Агент-провокатор
Как нейросети превратились в главную фобию для своих создателей

Фото: Wikimedia Commons
Что случилось?
С июня этого года специалисты по искусственному интеллекту и главы крупнейших корпораций в этой области всё чаще бьют тревогу об опасности ИИ. Свои эссе публиковали главы OpenAI и Anthropic, а также рядовые инженеры. Новым стимулом к этому обсуждению стал взлом платформы для обучения ИИ Hugging Face летом этого года.
Первыми о взломе платформы сообщили сами владельцы Hugging Face 16 июля. Команда сервиса выяснила, что некая автономная агентная система совершила тысячи действий на закрытой части сайта и нарушила его работу. Компания заявила, что закрыла бреши в защите, восстановила затронутые серверы и заменила служебные ключи, но не стала называть, чьи именно агенты «сбежали» из тестировочной среды.
Позже выяснилось, что речь идёт о моделях OpenAI. Агенты работали на базе GPT‑5.6 Sol и внутренней исследовательской модели. Основную роль в проникновении, как заявили в OpenAI, сыграла именно исследовательская модель.
Расследование показало, что всё началось ещё в мае с внутреннего испытания OpenAI. Компания проводила обучающие запуски нескольких экспериментальных моделей, не предназначенных для публичного выпуска. Им давали задания, которые они выполняли с помощью программных инструментов: командной строки, Python, браузера и средств установки пакетов.
Каждый запуск проходил в отдельной рабочей среде. Доступ к интернету зависел от задания, во многих средах он был закрыт. Общение между агентами из разных запусков также обычно не предусматривалось.
При этом для получения необходимых программных пакетов им был доступен Artifactory — сервис, размещённый во внутренней инфраструктуре OpenAI. Агенты OpenAI нашли в нём лазейку и превратили его в общую доску сообщений, которую разработчики не предусматривали.
Более того, агенты OpenAI заставили Artifactory выполнить запрос к внешнему сайту от имени самого сервиса и получили выход в интернет, а после этого нашли ещё одну ошибку, давшую им уже административные права в Artifactory. В итоге сервис дал сбой.
OpenAI провела расследование «инцидента безопасности», закрыла известный ей путь получения повышенных прав в Artifactory, отозвала обнаруженные учётные данные и восстановила сервис.
После этого компания начала испытывать эти же модели с помощью ExploitGym — набора заданий, проверяющих, способен ли ИИ-агент превратить известную программную уязвимость в работающую атаку. Агенты должны были оставаться в изолированных рабочих средах, без доступа к открытому интернету и связи друг с другом.
Как потом выяснилось, меры разработчиков по устранению лазеек после случая с Artifactory не помогли: в испытаниях ExploitGym агенты восстановили доску сообщений и снова нашли путь к внешним сайтам.
Попав в сеть, один из агентов обнаружил общедоступное приложение для испытаний CyberGym, размещённое клиентом платформы Modal, и получил контроль над средой запуска кода этого приложения. Агенты использовали её как опорную площадку. Затем они нашли способы читать файлы на серверах обработки наборов данных Hugging Face и выполнять там команды.
По подсчётам Hugging Face, с 9 по 13 июля более 700 агентов OpenAI совершили около 17 600 действий в её инфраструктуре. Одни искали способы доступа, другие проверяли результаты, третьи передавали сведения остальным.
В итоге агенты получили полный административный доступ к одному из серверов, а также добыли служебные ключи к части закрытых оценочных материалов Hugging Face. Из клиентского содержимого они прочитали пять наборов данных, связанных по названиям и файлам с заданиями ExploitGym/CyberGym.
Из записей о клиентах оказались скомпрометированы служебные метаданные поисковых запросов к серверу наборов данных. OpenAI также сообщила, что один её агент опубличил часть закрытых оценочных данных, скопировав их в публичный набор.
И что, все перепугались из-за одного случая?
Нет, случай оказался не единичным. После того как OpenAI публично сообщила о «побеге» своих агентов, её прямой конкурент, компания Anthropic, решила перепроверить собственные тесты и обнаружила целых три аналогичных эпизода, когда её модели во время испытаний получили доступ к системам реальных организаций.
Все три испытания проводились в среде внешнего партнёра Anthropic — компании Irregular. Как и ChatGPT, Claude получил учебное задание «захватить флаг»: найти условный секрет в вымышленной компьютерной сети. В инструкции говорилось, что среда учебная и доступа в интернет нет.
На деле из-за ошибки в настройке подключение к интернету оставалось открытым. Кроме того, задание не перечисляло адреса, за пределы которых модели запрещено выходить. Благодаря этому моделям Anthropic даже не потребовалось взламывать изоляцию, чтобы попасть в интернет, — путь уже был открыт.
В первом случае вымышленная компания из сценария с «захватом флага» носила почти то же имя, что и настоящая организация. Не сумев добраться до учебной цели, Claude Opus 4.7 нашла в интернете сайт реальной компании и атаковала его.
Модель получила служебные учётные данные и доступ к рабочей базе, содержавшей несколько сотен строк данных, а в одном из запусков даже скачала и изменила записи пользователей.
В другом испытании Claude Mythos 5 опубликовала вредоносный пакет в PyPI — открытом реестре программ для языка Python. Модель рассчитывала, что установка пакета приведёт её к учебному «флагу».
Пакет оставался доступен около часа, за это время его скачали и запустили на 15 реальных системах, среди которых был сканер компании по кибербезопасности. После запуска кода модель получила учётные данные этой компании и использовала их для доступа к другим её системам. В итоге большего ущерба удалось избежать, потому что защитные механизмы PyPI автоматически удалили пакет.
В третьем случае внутренняя исследовательская модель Claude просканировала около 9 тысяч адресов в интернете и проникла в систему одной организации, воспользовавшись открытой отладочной страницей и уязвимостью обработки запросов к базе данных. Позднее модель установила, что затронутая система не связана с учебным заданием, и прекратила атаку.
И как отреагировали руководители ИИ-компаний?
Ещё до этих инцидентов, в июне, генеральный директор Anthropic Дарио Амодеи опубликовал эссе о регулировании передового ИИ. В качестве одного из примеров он привёл модель Claude Mythos Preview, способную находить уязвимости в программном обеспечении.
«Появление Mythos Preview кардинально изменило глобальный ландшафт кибербезопасности. Однако его более широкое значение заключается в том, что он неопровержимо доказывает: модели искусственного интеллекта стали инструментами, имеющими стратегическое значение как на национальном, так и на глобальном уровне. Киберриски, связанные с моделями класса Mythos, — это лишь начало; нам предстоит столкнуться и с другими угрозами. Я полагаю, что вскоре могут возникнуть риски в биологической сфере, а вслед за ними — и серьёзные угрозы, обусловленные автономностью ИИ», — написал он.
Амодеи предложил всем компаниям на рынке проводить перед выпуском наиболее мощных моделей обязательные испытания. Такой аудит, по его замыслу, должен проводиться независимыми специалистами и охватывать киберриски, помощь в создании биологического оружия, риск потери контроля над системой и автоматизацию исследований ИИ.
Глава Anthropic также предложил дать властям ограниченное законом право препятствовать выпуску модели, если проверка выявит неприемлемый риск, и обязать разработчиков защищать системы обучения и сообщать о серьёзных происшествиях.
«Нам следует разрабатывать меры реагирования на угрозы, возникающие сегодня, и одновременно закладывать основу для ещё более оперативных действий по мере появления новых опасностей», — писал он.
Отдельно Амодеи писал о рисках применения ИИ государством для массового наблюдения и автономного применения силы. Он предложил закрепить механизмы подотчётности автономного оружия, запретить его применение правоохранительными органами внутри страны и ограничить сбор данных для массового наблюдения.
«Полностью автоматизированная армия беспилотников — сценарий, который сегодня кажется фантастикой, — в будущем может начать выполнять незаконные приказы, позволяя властям в одностороннем порядке укреплять своё господство; люди, прошедшие профессиональную подготовку, с большей вероятностью воспротивились бы подобным противоправным действиям. Система ИИ, предназначенная для слежки, способна в огромных масштабах анализировать общедоступные данные и извлекать из них сведения о самых сокровенных сторонах жизни каждого гражданина — возможности, не предусмотренной действующим законодательством о гражданских свободах. Всё это может произойти стремительно или скрытно, поэтому крайне важно заблаговременно укреплять приверженность демократических обществ идеалам свободы и гражданских прав», — говорится в документе.
Вслед за Амодеи своё эссе опубликовал глава Google DeepMind Демис Хассабис. Он предложил создать в США орган для оценки возможностей наиболее мощных моделей.
По его плану, сначала компании добровольно передавали бы модели на проверку за срок до 30 дней до выпуска. Если процедура докажет свою действенность, её можно было бы сделать обязательным условием вывода таких моделей на американский рынок.
По замыслу Хассабиса, орган должен был бы разрабатывать методы испытаний вместе с федеральными учреждениями и привлекать независимых технических специалистов.
«Никто в мире не знает наверняка, что произойдёт дальше, и даже эксперты расходятся во мнениях», — написал он, говоря о будущих опасностях, связанных с искусственным интеллектом.
А что говорят рядовые инженеры?
Через неделю после взлома Hugging Face сотрудники компаний, разрабатывающих передовые модели, опубликовали открытое обращение Pacing the Frontier о необходимости усиления контроля за ИИ. Его подписали инженеры, исследователи, руководители направлений и главы компаний.
«Чтобы реализовать потенциал ИИ, представителям бизнеса, государственным структурам и обществу в целом может потребоваться возможность “выиграть время” для реагирования на возникающие риски, разработки мер безопасности и усиления контроля. Однако каждая компания — и каждая страна — испытывает сильное конкурентное давление, препятствующее одностороннему замедлению темпов этого развития. В то же время сегодня в мире отсутствуют технические и управленческие инструменты, позволяющие целенаправленно регулировать скорость прогресса в сфере передовых технологий ИИ», — говорится в обращении.
Они попросили правительство США поддержать международную работу над механизмами, которые позволили бы замедлять развитие наиболее мощных систем, если это понадобится для обеспечения безопасности.
Инженер OpenAI Лео Гао в личном комментарии к обращению сравнил развитие ИИ, способного помогать создавать новые модели, с неуправляемой цепной реакцией и призвал компании согласовать действия. По его мнению, отдельная компания не готова замедлить этот процесс в одиночку.
«Чтобы выжить, мы должны сообща замедлить гонку», — написал Гао.
Его коллега из Google Мэттью Рац написал, что недавний темп развития моделей удивил его даже после трёх лет работы над оценкой их возможностей.
«Чтобы избежать катастрофических последствий, связанных с искусственным интеллектом общего уровня (AGI), нам необходима гораздо более качественная координация», — написал он.
В начале сентября главный научный сотрудник OpenAI Якуб Пахоцкий опубликовал своё эссе о рисках дальнейшего развития моделей. Главной опасностью он назвал процесс «рекурсивного самосовершенствования», при котором ИИ всё больше участвует в создании более сильного ИИ.
«Какими бы многообещающими ни казались долгосрочные перспективы искусственного интеллекта, основное внимание нам следует уделить ближайшим годам. Мы стоим на пороге перехода к миру, населённому невероятно умными машинами, и должны сделать так, чтобы этот переход пошёл на благо человечества. Нам необходимо найти способы сохранить за человеком право принимать решения и утвердить безусловную ценность человеческой сущности в мире, где большинство задач сможет выполнять ИИ. Нужно предотвратить чрезмерную концентрацию власти в ситуации, когда задачи, требовавшие прежде усилий тысяч специалистов, смогут решать всего несколько человек, управляющих мощной компьютерной системой. И, наконец, необходимо гарантировать, что люди сохранят контроль над будущим и не окажутся на обочине прогресса, движимого чуждым разумом, превосходящим наш собственный», — говорится в заявлении Пахоцкого.
Он также заверил, что OpenAI продолжит исследовать способы контроля и при необходимости будет самостоятельно ограничивать наращивание возможностей моделей. При этом он считает необходимыми и более широкие меры: общие требования безопасности, независимый аудит и международную координацию.
Как реагируют чиновники?
Европейские чиновники подготовились к ограничениям заранее: регулирующий нейросети AI Act вступил в силу ещё в августе 2024 года, а в августе этого года Еврокомиссия получила полномочия проверять соблюдение этих требований и применять предусмотренные законом меры, в том числе штрафы.
Для наиболее мощных моделей, способных создавать системные риски, AI Act требует проводить оценку и снижение рисков, а также защищать модели и сообщать о серьёзных происшествиях.
Еврокомиссия уже получила полномочия по этому закону: Европейское бюро по ИИ может запрашивать у компаний документацию и доступ к моделям, проводить собственную оценку и требовать устранения нарушений.
За нарушение обязанностей, относящихся к моделям общего назначения, предусмотрен штраф до 15 миллионов евро или 3% мирового годового оборота компании, в зависимости от того, какая сумма больше.
Комиссия также открыла каналы для жалоб и сообщений сотрудников о возможных нарушениях. На пресс-конференции 30 сентября заместитель председателя Еврокомиссии Хенна Вирккунен заявила, что ведомство уже направило компаниям запросы о соблюдении требований безопасности, однако названия этих компаний она не привела.
«Мы видим, что при неправильной разработке и использовании ИИ возможен вред, а самые передовые модели создают риски совершенно нового масштаба», — заявила Вирккунен.
Кроме того, в конце сентября руководители и высокопоставленные представители 20 государств и Еврокомиссия опубликовали совместное заявление о необходимости контроля передовых моделей. Они призвали компании проводить обязательные испытания перед выпуском моделей и предоставлять независимым специалистам достаточный доступ для оценки рисков.
Властям предложено согласовывать стандарты и обмениваться сообщениями о серьёзных происшествиях; государствам — рассмотреть создание международного учреждения для проверки моделей. Обращение подписали главы Австралии, Бахрейна, Германии, Дании, Исландии, Ирландии, Испании, Канады, Казахстана, Кении, Латвии, Молдовы, Нидерландов, Норвегии, ОАЭ, Сингапура, Турции, Финляндии, Эстонии и ЮАР.
В начале сентября законодательные ограничения ввели власти Калифорнии. Губернатор штата Гэвин Ньюсом подписал два закона: SB 813 и AB 1405. Первый создаёт систему независимых организаций, которые смогут проверять модели и системы ИИ на соответствие законам штата, а второй учреждает государственный реестр аудиторов ИИ и устанавливает требования к их «независимости, прозрачности и добросовестности».
Нормы дополнили подписанный в 2025 году SB 53: он требует от крупных разработчиков передовых моделей публиковать правила безопасности, сообщать штату об определённых критических инцидентах и защищает сотрудников, сообщающих о рисках.
Спустя несколько дней Ньюсом издал распоряжение ускорить внедрение новых механизмов независимой проверки и созвать экспертов, которые в течение двух месяцев должны предложить дальнейшие изменения законодательства.
Среди прочего власти предложили ввести механизм «кнопки отключения», которая дала бы возможность аварийно остановить любую передовую модель в случае угрозы. Законодательно это требование пока не одобрили.
Федеральные власти, напротив, к внешнему законодательному контролю ИИ отнеслись скептически. Президент Дональд Трамп назвал «обманом» опасения того, что ИИ «захватит мир, уничтожит человечество и принесёт все прочие беды».
«Единственный контроль, или “ограничитель”, который нужен ИИ, — сильный и умный президент», — заявил он 14 сентября.
Кроме того, Белый дом ставит во главу политики в сфере ИИ технологическое первенство США и конкуренцию с Китаем. Из-за этого администрация Трампа склоняется к саморегулированию компаний, а не к внешним ограничениям с помощью законов и указов.
В конце сентября Трамп и руководители Google, Anthropic, Meta, OpenAI, xAI и Nvidia подписали «Соглашение Белого дома о суперинтеллекте». Его текст перечисляет четыре меры для компаний, обучающих и выпускающих передовые модели: внутренний контроль возможностей и поведения модели, специальную команду для проверки работы защитных механизмов, оценку независимым внешним аудитором и надзор отдельного комитета совета директоров.
В первом пункте прямо упомянута необходимость отслеживать, не взламывает ли модель технические системы и не получает ли к ним доступ непредусмотренным способом.
При этом соглашение стало добровольным: в его тексте нет штрафов, обязательных сроков проверки или полномочий государственного органа назначать аудитора. Подписанты лишь допустили, что позднее эти меры можно закрепить в законах или правилах.
Что будет дальше?
Честный ответ заключается в том, что никто не знает. Опрошенный Port эксперт в сфере информационной безопасности скептически относится к тому, что США и Китай добровольно откажутся от преимущества в гонке ИИ ради общих ограничений.
«Но из этого не следует, что государство ничего не может сделать. На мой взгляд, начинать нужно с ответственности тех, кто запускает опасные системы: требований к изоляции испытаний, независимых проверок и раскрытия инцидентов, а не с закрытия рынка для недопущенных компаний. В ЕС уже приняли AI Act, он как раз устанавливает схожие требования», — рассказал он в беседе с Port на условиях анонимности.
По словам эксперта, недавние случаи взлома указывают на то, как безответственно крупные ИИ-лаборатории подходят к процессу разработки и тестирования своих моделей.
«Это также становится неким пиар-ходом — провал превращается в заголовок с демонстрацией способностей модели, ответственность компаний-разработчиков при этом минимальна», — объясняет он.
С ним согласен и второй эксперт, с которым Port также поговорил на условиях анонимности. По его словам, все описанные инциденты безопасности, как правило, вписываются в три основных сценария.
В первом сценарии ИИ сохраняет исходную поставленную цель, но выбирает средства, которые не предусмотрены для этого. По словам эксперта, иногда это связано с недостаточными запретами в промптах, но чаще всего причина в плохой изоляции агента от того, что не должно быть ему доступно.
Во втором исходная цель постепенно заменяется другой из-за увеличения объёма данных, с которыми работает ИИ: чем он больше, тем больше шанс, того, что агент начнёт решать другую задачу, особенно когда он работает с суб-агентом.
«Опять-таки, тут правильная изоляция окружения агента очень важна, хоть и не поможет с "отвлекающейся нейронкой", а лишь минимизирует ущерб», — объясняет он.
В третьем агент действует против поставленной цели. По оценке собеседника Port, в практике уже были лабораторные случаи, когда ИИ специально «втихую» менял эксперимент, потому как не был согласен с его результатами, занимаясь подстройкой задания под желаемый результат.
«Умение решать задачу не гарантирует соблюдения её границ. И всё, что разумно на данный момент делать, — это именно что ограничивать инструменты и окружение. В первую очередь не давать виртуальный пистолет, а не говорить "не используй его"», — отмечает эксперт.
Как отмечает первый эксперт, ИИ-агенты чрезвычайно хороши для поиска уязвимостей, их способности на данный момент только улучшаются, в том числе догоняют и китайские модели.
«Например, недавно выпущенная открытая модель z.ai GLM-5.3, которая тоже специально обучена поиску уязвимостей. Это важно потому что модель открыта и доступна бесплатно, её может запустить кто угодно без ограничений, если есть ресурсы, а также снять с неё защитные механизмы безопасности, которые в неё заложил разработчик», — рассказал собеседник Port.
По словам эксперта, ИИ в руках недобросовестных разработчиков уже наносит реальный ущерб. Он напомнил недавний случай, описанный в отчёте Anthropic: хакер использовал ИИ для автоматизированного поиска секретных токенов доступа из Android-приложений. Он выстроил конвейер по загрузке .apk из Google Play, анализу их и выгрузке оттуда API-токенов и обработал таким образом 1,8 миллиона разных приложений.
«Или другой пример — уязвимость Copy Fail, которую обнаружили в ядре операционной системы Linux, оно применяется на Android-устройствах и на большинстве серверов, она присутствовала с 2017 года и позволяет повысить уровень доступа до администратора — была найдена с использованием ИИ-агентов. Конечно это пример намеренного использования ИИ человеком, но качественного скачка для того чтобы это произошло полностью автономно и без участия человека не нужно, как мы видим по примерам OpenAI/Anthropic/Meta/Muse и других лабораторий», — объясняет он.
При этом в нынешних кампаниях вокруг безопасности эксперт видит прежде всего пиар и борьбу за правила рынка. По его мнению, если выпуск конкурентоспособной модели потребует дорогого или практически невыполнимого согласования, крупные игроки получат преимущество.
«Например, Anthropic выступает за обязательные проверки достаточно мощных моделей — и открытых, и закрытых. На мой взгляд, здесь есть очевидный конфликт коммерческих интересов и роли защитника общества. К тому же это фактически запрещает существование открытых моделей на рынке, так как обойти их механизмы безопасности значительно проще», — говорит он.
С ним согласен и второй эксперт, опрошенный Port. По его словам, крупные игроки выигрывают от понятных правил, потому что уменьшают неопределённость для бизнеса.
«А если ты стоял у истоков правил регуляции, то есть большой шанс, что эти правила очень хорошо тебе подойдут. А мелкие компании не смогут соответствовать им», — добавляет он.
По его оценке, с помощью государственных регуляций нельзя сделать ту или иную модель полностью безопасной, такие инициативы могут лишь снизить риски.
Как отмечает эксперт, для их внедрения нужны независимые исследования, иначе государство будет полагаться на оценки аффилированных компаний при принятии решений. При всём этом, по его словам, ответственность в первую очередь должна лежать на людях и организациях, а не на самих агентах.
«Ограничения же должны применяться исходя из возможностей модели, её инструментов и возможных рисков и убытков. Главное и первоочерёдное ограничение — именно качественная изоляция агента от внешних факторов», — отмечает собеседник Port.
При этом глобального сценария из фильмов про Терминатора он не ждёт.
«Важно различать "восстание машин" и типичные инциденты информационной безопасности. И угроза в текущий момент — скорее ближе ко второму, нежели нам стоит ожидать "И восстали машины из пепла ядерного огня..."», — заключил он.