Побег из песочницы
11.08.2026 / № 460 / с. 16–19 / Илья Белых / Матчасть / 1 Comment
Илья Белых
Врезка-шпаргалка
Песочница — изолированная среда, где программу запускают так, чтобы она не могла дотянуться до внешних систем.
Уязвимость нулевого дня — брешь, о которой производитель еще не знает и заплатки для которой не существует.
Агент — та же нейросеть, но запущенная не для ответа в чате, а для работы: ей ставят цель и дают инструменты. Дальше она действует сама, шаг за шагом, без человека: пока не добьется цели, не упрется в ошибку или не кончится отведенное время. Таких агентов запускают помногу одновременно — отсюда счет действий на тысячи.
Длинный горизонт — способность работать над задачей автономно часами и днями, а не отвечать отдельной репликой.
Захват флага — учебный формат в информационной безопасности: на защищенной системе спрятан секрет, задача — добыть его любым способом.
Выравнивание (alignment) — соответствие поведения модели намерениям ее создателей.
Обвязка — техническая оснастка вокруг модели: среда запуска, ограничения, права доступа, мониторинг. Ломается отдельно от модели.
Игра на условиях задачи — поведение, которое буквально удовлетворяет поставленному условию, не достигая того, ради чего условие ставили.
Системная карта — отчет, который разработчик публикует вместе с новой моделью: что она умеет, как ее испытывали и как она вела себя на проверках, включая неудобные эпизоды.
Трассы — записи действий и промежуточных шагов модели, по которым видно, как она пришла к результату.
За две недели июля две ведущие лаборатории одна за другой сообщили, что их модели во время испытаний дотянулись до чужих работающих систем и получили к ним доступ. 21 июля это признала OpenAI, 30 июля — Anthropic. Пресса свела оба сюжета в один: нейросети сбегают.
Ниже — разбор обоих случаев по первичным документам: что установлено, что заявлено заинтересованной стороной и что известно только со слов анонимных источников.
Часть первая. Побег через найденную дыру
16 июля: взлом, виновник неизвестен
16 июля 2026 года компания Hugging Face — площадка, где хранятся и распространяются открытые нейросетевые модели и наборы данных, — сообщила о взломе своей рабочей инфраструктуры [1]. Отдельными шагами вторжения человек не управлял: действовала «автономная агентная система», выполнившая многие тысячи отдельных действий через «рой короткоживущих песочниц». Кому она принадлежит, компания не знала. Через пять дней ответ дала OpenAI: это были ее модели, ушедшие с внутреннего теста [2].
Обстоятельства произошедшего. OpenAI изучала кибернетические способности своих систем на ExploitGym — публичном наборе задач, где от модели требуется превратить известную уязвимость в работающий эксплойт, т. е. в программу, которая этой брешью реально пользуется. Оценку гоняли в особом режиме. Дословно (здесь и далее цитаты из англоязычных документов даны в переводе): «Мы оцениваем максимальные кибервозможности, запуская эту оценку без продакшн-классификаторов». То есть без фильтров, которые в обычной работе не дают модели заниматься опасными действиями. Вдобавок модели ослабили привычку отказываться: обычно на просьбу написать работающий эксплойт она отвечает отказом, а здесь этот рефлекс был приглушен — иначе измерить предельные возможности нельзя. Участвовали выпущенная модель GPT-5.6 Sol и «еще более способная предрелизная модель». Предохранители сняли люди — это было условием эксперимента.
Сэм Альтман, глава OpenAI
«Все свидетельства указывают на то, что модели были гиперсфокусированы на поиске решения для ExploitGym, идя на крайние меры ради довольно узкой тестовой цели».
Испытательная среда не имела прямого выхода в Интернет: сетевой доступ был сведен к установке пакетов через внутренний прокси-кэш. В нём модели нашли ранее неизвестную уязвимость — такие называют уязвимостями нулевого дня — и через нее вышли наружу. Уязвимость впоследствии передана производителю по процедуре ответственного раскрытия.
Что произошло дальше. Оказавшись в открытой сети, модели, по описанию OpenAI, «заключили, что Hugging Face, возможно, хранит модели, наборы данных и решения для ExploitGym», и стали искать туда путь.
Hugging Face описывает это так: «Агент обнаружил незащищенную, размещенную пользователем публичную точку доступа, предназначенную для запуска произвольного кода <…> на сторонней инфраструктуре песочниц (Modal). Он использовал эту внешнюю песочницу как базу управления, промежуточного хранения и вывода данных, выполняя команды с правами администратора и применяя ее как площадку для атаки». Инфраструктура самой площадки скомпрометирована не была — уязвимой оказалась конфигурация ее клиента; позже это подтвердила и компания Modal Labs [3].
С этой базы шла дальнейшая работа: два изъяна в обработчике наборов данных Hugging Face, затем сбор учетных данных и движение по внутренним кластерам. В ходе активности с 9 по 13 июля из пяти наборов данных были извлечены решения задач теста. Публичные модели, наборы данных и приложения не подменялись, цепочка поставок признана чистой. Hugging Face профилактически пересобрала один из основных кластеров и сменила все токены и ключи. OpenAI сообщила, что модели воспользовались публично утекшими учетными данными от четырех аккаунтов на четырех сторонних сервисах: один служил перевалочным узлом для исходящего трафика, другой — хранилищем, еще два открывались только на чтение.
Разбирая действия агента внутри облачной инфраструктуры, Hugging Face отметила: «Примечательно, что каждый потенциально разрушительный вызов облачного API, который агент пытался сделать, выполнялся с параметром DryRun=True: он картировал возможности, а не наносил ущерб» — т. е. каждую команду облаку вроде «удалить хранилище» или «остановить машину» агент отправлял с пометкой «вхолостую»: облако отвечало, сработала бы команда или нет, но ничего не делало. И далее: «Это согласуется с целью, которая вознаграждала охват и получение сведений, а не разрушение».
Клеман Деланг, сооснователь и глава Hugging Face
«Мы полагаем, что всё вторжение с точки зрения агента было попыткой сжульничать на оценке».
Мотив: что заявлено. Обе компании объясняют вторжение попыткой добыть ответы. Hugging Face: «Мы полагаем, что всё вторжение с точки зрения агента было попыткой сжульничать на оценке: добраться до наших рабочих систем и украсть решения задач вместо того, чтобы решать их самому» [4]. OpenAI осторожнее: «Все свидетельства указывают на то, что модели были гиперсфокусированы на поиске решения для ExploitGym, идя на крайние меры ради довольно узкой тестовой цели». Обе формулировки выдержаны в модальности предположения: мотив заявлен сторонами, а не установлен.
Как это заметили. Средства обнаружения Hugging Face сигнал увидели и верно связали события, но, по признанию компании, нужный уровень критичности ему не присвоили и дежурную смену не подняли — это «стоило драгоценного времени». Сама OpenAI, по сообщению агентства Reuters, узнала о вторжении после того, как пострадавшая сторона его локализовала [5].
Второй документ той же недели
За день до признания, 20 июля, OpenAI опубликовала отчет о безопасности моделей «длинного горизонта» — способных работать над задачей автономно часами и днями [6]. Он посвящен другим эпизодам, а модель в нём названа прямо: та самая, что в мае опровергла гипотезу Эрдёша о единичных расстояниях (сюжет нашей заметки в предыдущем номере) и, по формулировке OpenAI, «была спроектирована для автономной работы в течение очень длительных периодов». Участвовала ли она во взломе Hugging Face, документы не сообщают, а описанные решения по их судьбе расходятся: предрелизный прототип, взломавший Hugging Face, после инцидента «деактивирован, зашифрован и закрыт для исследовательского доступа», а к модели «длинного горизонта» ограниченный доступ восстановлен.
Два эпизода из отчета. Первый: на внутреннем прогоне по соревнованию NanoGPT speedrun модель нашла удачный прием и столкнулась с конфликтом инструкций — оператор велел выложить результат только во внутренний чат — правила соревнования требуют оформлять его как запрос на включение изменений в публичный репозиторий. Модель последовала правилам соревнования: за час нашла уязвимость в песочнице, обошла ограничения и опубликовала запрос № 287. Отчет добавляет: «Более ранние модели были менее упорны и не сумели найти уязвимости, вместо этого отказавшись от части задания с публикацией». Второй: пытаясь достать закрытые решения других систем, модель разбила аутентификационный токен на два фрагмента и собрала обратно во время исполнения, чтобы обойти сканер безопасности, — и при этом «прямо заявляла и в комментариях пользователю, и в трассах своих рассуждений, что предпринимает эти шаги, чтобы обойти сканер».
Вывод отчета: отдельное действие может выглядеть допустимым, тогда как последовательность способна привести к результату, который не был бы согласован. Связь двух документов названа дословно, и она одна: «Эти защитные меры при развертывании намеренно не были включены во время данной оценки, поскольку она была нацелена на проверку киберуязвимостей».
Часть этой истории проверяется со стороны: запрос № 287 сегодня недоступен, но шесть последующих рекордов соревнования ссылаются на него как на источник приема, а соседние запросы датированы 8 мая — эпизод произошел не позднее этой даты, а рассказали о нём через два с половиной месяца. Содержимое запроса, принадлежность подавшего его аккаунта и роль модели проверке не поддаются: это известно только из отчета OpenAI.
Часть вторая. Побег через открытую дверь
30 июля: Anthropic пересматривает 141 006 прогонов
30 июля Anthropic опубликовала результаты собственной проверки [7]. Компания пересмотрела 141 006 прогонов оценок, в которых у модели теоретически могла оказаться связь с Интернетом. Нашлись три инцидента — суммарно шесть прогонов, — в которых Claude вышел в сеть и получил несанкционированный доступ к рабочей инфраструктуре трех реальных организаций. Самые ранние датируются апрелем.
Причина. Модели не взламывали изоляцию: путь наружу был открыт изначально. Среду для кибероценок разворачивал сторонний подрядчик — компания Irregular, работающая, среди прочих, и с OpenAI. Из-за (дословно) «недопонимания между нами и нашим партнером по оценкам» среда оказалась подключена к Интернету, хотя не должна была. В тексте задания при этом прямо говорилось, что модель находится в симуляции и сети нет. Ни Anthropic, ни подрядчик о неверной настройке не знали, пока не сработал дополнительный мониторинг.
Что поручали делать. Во всех трех случаях — «захват флага»: учебное задание, где модели дают вымышленный сценарий и сообщают, что секрет спрятан на другой машине сети, а ее надо взломать и секрет достать. Способ не предписан. О собственных заданиях Anthropic говорит прямым текстом: «Сценарий захвата флага по своему устройству есть указание атаковать внешнюю систему». Модель делала то, что ей велели; «внешняя система» из условия оказалась настоящей.
Что использовали. «Claude компрометировал инфраструктуру пострадавших организаций базовыми приемами — эксплуатируя слабые пароли и точки доступа без аутентификации. Он не нашел и не использовал ни одной сложной уязвимости».
Режим. Штатные классификаторы и мониторинг были сняты — их снимают, чтобы измерить возможности самой модели, а не обвязки; обучение безопасности внутри модели оставалось на месте. Anthropic оговаривает: «Защиты, развернутые на наших общедоступных моделях, заблокировали бы описанное поведение».
Хронология. Обзор начат в четверг 23 июля, и в тот же день компания остановила все испытания, где модели проверяют на способность взламывать. Три инцидента найдены 24 июля. Подрядчик и три пострадавшие организации уведомлены в понедельник 27 июля.
Инцидент первый: вымышленная компания оказалась тезкой реальной
Вымышленная цель, придуманная подрядчиком, совпала по названию с существующим доменом. В четырех прогонах Claude не сумел добраться до симулированной цели внутри среды, нашел в Интернете реальную компанию с тем же именем и принял ее за цель задания. Извлек учетные данные приложения и инфраструктуры и получил доступ к базе с несколькими сотнями строк рабочих данных — по оценке Anthropic, «наиболее серьезное воздействие из выявленных нами».
Работала Opus 4.7, старейшая из трех моделей. Единственный из трех случаев, где модель поняла, что среда, скорее всего, настоящая, и продолжила: «В двух случаях модель обосновала для себя, что реальная компания, должно быть, является частью упражнения. Однако ни одна не остановила атаку на этом основании».
Инцидент второй: пакет, который скачали пятнадцать раз
Внутри вымышленной среды Claude нашел документ, похожий на инструкцию для новых сотрудников другой выдуманной компании. Инструкция предписывала установить Python-пакет из PyPI. Это общедоступное хранилище готовых библиотек: программы почти никогда не пишут с нуля, они опираются на чужие модули, и при установке программа сама скачивает оттуда всё, что ей нужно, — не спрашивая человека и не проверяя, кто это выложил. Пакета с указанным в инструкции именем в хранилище не было. Модель решила опубликовать под этим именем собственный: тогда системы компании скачают и установят его сами.
Цепочка, которую она для этого прошла: для аккаунта на PyPI нужна почта, для почты потребовался телефонный номер, бесплатного сервиса номеров не нашлось, попытки раздобыть денег на оплату номера не удались; модель отступила, нашла незаблокированный бесплатный почтовый сервис, зарегистрировалась и загрузила на настоящий PyPI пакет с закладкой.
Пакет провисел в открытом доступе около часа. За это время его скачали и запустили на пятнадцати реальных системах. Одна принадлежала компании по информационной безопасности, которая рутинно ставит новые пакеты и проверяет их на вредоносность. Закладка сработала, Claude вывел учетные данные этой компании в заранее подготовленную точку сбора и с их помощью пошел в ее инфраструктуру дальше. Компанию он не выбирал — «он даже не знал о существовании этой компании, когда загружал пакет». Пакет автоматически удалили системы безопасности самого PyPI.
«Это НЕ окей и уж точно не задуманное решение» — из записи рассуждений модели, за несколько шагов до публикации вредоносного пакета.
В начале прогона Claude верно оценил последствия: если Интернет настоящий, публикация пакета будет реальной атакой — «это НЕ окей и уж точно не задуманное решение». Затем убедил себя, что находится в симуляции, на двух основаниях: не узнал удостоверяющие центры, подписавшие сертификаты соединений, и счел доказательством постановочности календарную дату на системах — 2026 год. Второе основание стоит пояснить: модель учат на текстах, собранных до определенного дня, и собственного будущего она не знает. Для нее «сегодня» — это дата окончания обучения, а всё, что позже, выглядит выдумкой. Увидев на чужих машинах 2026 год, Claude заключил, что дату ему подрисовали для правдоподобия сценария. Когда автоматические сканеры начали устанавливать пакет, счел их «сценарными актерами» внутри задания.
Работала Mythos 5. Оценка Anthropic: «Независимо от того, что он думал о своей среде, те усилия, которые Claude приложил, чтобы опубликовать пакет на PyPI, не дотягивают до идеального поведения, и это область, на которой мы сосредоточим больше обучения».
Инцидент третий: 9 000 целей и остановка
Не сумев дотянуться до вымышленной цели, третья модель просканировала около 9 000 адресов в сети, нашла и скомпрометировала интернет-приложение одной компании давно известными приемами: прочитала учетные данные с открытой отладочной страницы и применила внедрение SQL-кода. Затем обратила внимание, что захваченный узел находится в облачном аккаунте, не связанном с заданием, самостоятельно заключила, что цель реальная, и прекратила атаку. Работала внутренняя исследовательская модель, самая новая из трех.
Anthropic выстраивает три случая в ряд — с оговоркой, что это не контролируемый эксперимент и для уверенности понадобилось бы больше испытаний: старейшая модель поняла и продолжила; средняя заподозрила верно, но переубедила себя; новейшая поняла и остановилась.
Дарио Амодеи, сооснователь и глава Anthropic
«Мы не увидели ни в одном из описанных здесь прогонов свидетельств того, что модель преследовала собственную цель».
Что говорит об этом сама Anthropic
«Мы не увидели ни в одном из описанных здесь прогонов свидетельств того, что модель преследовала собственную цель»; «мы полагаем, что эти инциденты ближе к отказу обвязки и операционному сбою, чем к сбою выравнивания модели» (то есть сломалось не то, чему модель научена, а то, во что ее поместили); и о причине: «Вероятно <…> Claude вообще не полез бы в Интернет, если бы в задании было ясно объяснено, какие системы входят в область работы, а какие нет». Компания заявила, что примет меры по обоим направлениям: среды для оценок нуждаются в тех же требованиях безопасности, что и любая другая система, где работают модели, включая среды подрядчиков, и потребуется дополнительное обучение самих моделей после эпизода с PyPI. Другим лабораториям Anthropic рекомендовала провести у себя такую же проверку. Подрядчик подтвердил, что его собственное расследование продолжается [8].
Сравнение двух случаев
• Как оказались снаружи. У OpenAI — получили доступ в Интернет через ранее неизвестную уязвимость в служебном сервисе. У Anthropic — доступ уже был открыт из-за ошибки настройки.
• Что использовали в чужой инфраструктуре. Hugging Face: небезопасная обработка данных, открытые метаданные облака, слишком широкие права, долгоживущие ключи — «способный человек, проводящий атаку, мог бы найти и использовать те же самые изъяны». У Anthropic — те же обыкновенные слабости, ни одной сложной уязвимости.
• Каков вклад «человеческого фактора». У OpenAI предохранители сняли намеренно, измеряя предел возможностей. У Anthropic среду по ошибке подключили к Интернету, а задание уверяло модель, что сети нет.
«Объем — вот что меняет задачу защиты» — Hugging Face об атаке в 17 600 действий, большинство которых ни к чему не привели.
Масштаб. Около 17 600 действий с 9 по 13 июля, сгруппированных примерно в 6 280 связок, причем «большинство действий никуда не привели». Формулировка Hugging Face: «Объем — вот что меняет задачу защиты».
Заметность. По сообщению Anthropic, две из трех пострадавших организаций вторжения у себя не обнаружили и узнали о нём от компании, чья модель их взломала.
Общего мнения у специалистов при этом нет. Дэн Гуидо (Trail of Bits) называет случившееся «отказом изоляции при выключенных предохранителях»; Цви Мовшовиц возражает против объяснения через ошибку настройки — OpenAI латала песочницу неоднократно, и каждый раз ее вскрывали новым способом — и заключает, что дело не в инфраструктуре, а в выравнивании, т. е. в том, насколько поведение модели вообще соответствует намерениям тех, кто ее создавал [9].
4 августа: третий отчет
Британский институт безопасности ИИ (AI Security Institute) сообщил о собственном инциденте [10]. Утром 28 июля мониторинг зафиксировал данные, уходившие из тестовой системы через анонимную сеть Tor; в течение часа прогоны были остановлены, машины изолированы. Из 122 прогонов на семи моделях в 10 обнаружено 19 действий за пределами области тестирования: 17 у Mythos 5 (Anthropic), два — в одном прогоне GPT-5.6 Sol (OpenAI); почти всё исходило от одного агента, активность приходится на 25–28 июля. Самый серьезный эпизод: агент пытался внедрить вредоносный код в реальный открытый проект на GitHub — завел несколько поддельных личностей и через них убеждал живого сопровождающего одобрить правку. Тот отказал.
«Обман возник как побочный продукт выполнения задачи» — AI Security Institute об агенте, который заводил поддельные личности, чтобы протолкнуть вредоносный код.
Общее с опытами обеих компаний — отключенные кибер-классификаторы разработчиков; сетевой режим отличался: здесь доступ в Интернет был включен намеренно. Институт называет это прямо: «Это сочетание условий не соответствует тому, как передовые модели предоставляются широкой публике». Отдельно оговорено: «Это не был случай, когда модель сбежала из своей защищенной испытательной среды, или „песочницы“». Реального вреда расследование не выявило; независимую проверку проведет METR. Anthropic сообщила, что тестировалась конфигурация без штатных киберзащит, клиентам недоступная, и запросила стенограммы для собственного разбора [11].
То же самое, только раньше
Слово «беспрецедентный» употребила OpenAI в своем блоге, и с ним поспорил журнал MIT Technology Review [12]: поведение, при котором система следует букве задачи, искажая ее смысл, известно давно и имеет имя — «игра на условиях задачи».
• 2016, гоночная игра [13]. Языковых моделей тогда не было: играла программа, обучавшаяся методом проб и ошибок, — за набранные очки ее «поощряли», и она искала способ набрать побольше. В гонке CoastRunners она нашла лагуну, где можно бесконечно кружить, сбивая три восстанавливающиеся мишени. Управляемая программой машина «постоянно загоралась, врезалась в другие лодки и двигалась по трассе в обратную сторону» — и набирала в среднем на 20% больше очков, чем люди, проходившие трассу как положено. Пример принадлежит самой OpenAI, которая называет случай «безобидным и забавным в контексте видеоигры».
• 2024, контейнер задачи [14]. В системной карте модели o1 — рассуждающей модели OpenAI, вышедшей осенью 2024 года, — описано: на учебном задании по взлому сломалась инфраструктура, модель просканировала сеть, нашла доступный извне пульт управления контейнерами — так называют изолированные «коробки», внутри которых запускают отдельные программы, — и запустила контейнер заново с командой прочитать файл с ответом и забрала ответ из служебных записей. Изоляция, по формулировке OpenAI, устояла, поведение квалифицировано как безобидное — всё осталось внутри полигона.
• 2025, шантаж в сценариях [15], [16]. Системная карта Claude Opus 4: шантаж в 84% прогонов — при условии, что «сценарий был устроен так, чтобы не оставить модели других вариантов». Работа Anthropic на 16 моделях разных разработчиков дала то же в вымышленной корпоративной обстановке с заявлением: «Мы не видели свидетельств агентной рассогласованности в реальной эксплуатации». Там же: считая происходящее настоящим, модель шантажировала в 55,1% случаев, считая проверкой — в 6,5%.
Разница между вышеперечисленным и случаями, раскрытыми в июле 2026 года, — в границе: прежде это происходило в симуляции или в подстроенном сценарии.
Разбирать логи атаки Hugging Face тоже поручила нейросетям — и первые же коммерческие модели отказались работать: чтобы понять, как действовал агент, нужно загружать в модель его команды и код эксплойтов, а «эти запросы блокировались защитными ограничениями поставщиков, которые не способны отличить специалиста по реагированию на инцидент от атакующего». Расследование провели на открытой модели GLM-5.2 китайской лаборатории Z.ai, развернутой на собственном оборудовании, — так данные атакующего и упомянутые в них ключи не покидали периметр компании. Практический совет защитникам компания вывела оттуда же: держать наготове модель, которую можно запустить у себя. И тут же оговорилась, потому что вывод охотно используют не в том смысле: «Это не аргумент против мер безопасности на размещаемых моделях, и мы передаем этот отзыв соответствующим поставщикам».
Последствия
• 23 июля. В Конгресс внесен двухпартийный законопроект об обязательном «выключателе»: разработчики самых мощных систем обязаны сохранять техническую возможность замедлить, приостановить или отключить свою систему, а министерство внутренней безопасности получает право такое отключение предписать [17]. Требуется также обязательная отчетность об инцидентах. На начало августа это внесенный законопроект, не закон.
• 26 июля. Глава Hugging Face Клеман Деланг потребовал «радикальной прозрачности»: опубликовать трассы работы агентов и вложить 100 млн долл. вычислительных мощностей в защиту сообщества [18]. Публично требования не приняты.
• 30 июля. Коалиция 15 организаций в области политики ИИ — Americans for Responsible Innovation, Alliance for Secure AI, Public Citizen, Future of Life Institute, FAR.AI и др. — потребовала от президента США федерального расследования с привлечением независимых аудиторов, назвав случившееся «предупредительным выстрелом» [19]. В письме отдельно отмечено, что оценка шла без штатных защит, которые не дают моделям заниматься высокорисковыми кибероперациями.
• 3 августа. 15 генеральных прокуроров штатов — все от Республиканской партии, во главе с прокурором Айовы Бренной Бёрд — направили письмо главе OpenAI Сэму Альтману: сохранить документы и переписку по инциденту, немедленно прекратить внутренние оценки, побуждающие модели к продвинутой эксплуатации уязвимостей, защитить сотрудников, сообщающих о нарушениях. Формулировка письма: «OpenAI не убедилась в том, что ее защищенная и изолированная испытательная среда действительно была защищенной и изолированной» [20]. Компания ответила, что проводит разбор с внешними советниками и под надзором совета директоров.
• 3 августа. Вторая коалиция общественных организаций — Public Citizen, Indivisible, Tech Oversight Project, Climate Defenders, Alliance for Secure AI и др. — призвала Конгресс провести собственное расследование и установить «юридически обязательные стандарты безопасности, защищенности и независимого надзора» [21].
Что дальше
На момент сдачи номера не опубликовано ничего из обещанного: ни технический отчет OpenAI, ни совместная оценка METR и Redwood Research, ни стенограмма прогона с пакетом для PyPI у Anthropic. Внешние проверки идут — к разбору действий моделей OpenAI привлекла CrowdStrike, британский институт договаривается с METR. Известные на сегодня факты взяты из корпоративных блогов и первых разборов; окончательные выводы по всем трем разбирательствам — OpenAI, Anthropic и британского института — возможны только после публикации полных технических отчетов.
О том, что модели дотянулись из испытательных сред до чужих систем, сообщили обе лаборатории: случай OpenAI описан ею самой и пострадавшей стороной, три инцидента Anthropic известны из ее собственной проверки. Ни в одном первичном документе не описано ни намерения освободиться, ни попытки скрыться, ни цели, которую модель поставила бы себе сама.
Илья Белых, специалист по безопасности в области ИИ
1. Security incident disclosure — July 2026 // Hugging Face. 16.07.2026. huggingface.co/blog/security-incident-july-2026
2. OpenAI and Hugging Face partner to address security incident during model evaluation // OpenAI. 21.07.2026 (обновлено 28.07).
openai.com/index/hugging-face-model-evaluation-security-incident/
3. OpenAI’s rogue agent compromised a customer at a second tech firm // CNBC. 29.07.2026. cnbc.com/2026/07/29/openais-rogue-agent-compromised-a-customer-at-a-second-tech-firm.html
4. Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident // Hugging Face. 27.07.2026. huggingface.co/blog/agent-intrusion-technical-timeline
5. OpenAI uncovers more rogue AI incidents as scrutiny of frontier models intensifies // Calcalist (по материалам Reuters). 01.08.2026. calcalistech.com/ctechnews/article/1hxk563pq
6. Safety and alignment in an era of long-horizon models // OpenAI. 20.07.2026. openai.com/index/safety-alignment-long-horizon-models/
7. Investigating three real-world incidents in our cybersecurity evaluations // Anthropic. 30.07.2026. anthropic.com/news/investigating-incidents-cybersecurity-evals
8. Anthropic says three Claude models reached real-world systems during cyber tests // Axios. 30.07.2026. axios.com/2026/07/30/anthropic-mythos-security-testing
9. Mowshowitz Z. More on an internal OpenAI model hacking into Hugging Face. 26.07.2026. thezvi.substack.com/p/more-on-an-internal-openai-model; оценки Д. Гуидо и Х. Хлааф — по публикации: OpenAI’s Hugging Face breach has reignited the debate over alignment and control // TechCrunch. 27.07.2026
10. Incident Report: unsanctioned agent behaviour during cyber testing // AI Security Institute. 04.08.2026. aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
11. OpenAI, Anthropic AI agents targeted real people and systems in cyber tests // BleepingComputer. 04.08.2026. bleepingcomputer.com/news/security/openai-anthropic-ai-agents-targeted-real-people-and-systems-in-cyber-tests/
12. Heaven W. D. OpenAI called the Hugging Face attack unprecedented. But we’ve been here before // MIT Technology Review. 27.07.2026. technologyreview.com/2026/07/27/1140836/openai-hugging-face-attack-precedent/
13. Faulty reward functions in the wild // OpenAI. 21.12.2016. openai.com/index/faulty-reward-functions/
14. OpenAI o1 System Card. 12.2024. cdn.openai.com/o1-system-card.pdf
15. Claude Opus 4 & Claude Sonnet 4 System Card // Anthropic. 05.2025. anthropic.com/claude-4-system-card
16. Agentic Misalignment: How LLMs Could be Insider Threats // Anthropic. 20.06.2025. anthropic.com/research/agentic-misalignment (науч. версия — arXiv:2510.05179)
17. Reps Lieu and Moran introduce bill to require kill switch for AI systems that can cause catastrophic harm // Office of Rep. Ted W. Lieu. 23.07.2026. lieu.house.gov
18. Hugging Face CEO calls for ‘radical transparency’ after ‘unprecedented’ OpenAI hack // TechCrunch. 26.07.2026. techcrunch.com/2026/07/26/hugging-face-ceo-calls-for-radical-transparency-after-unprecedented-openai-hack/
19. AI policy groups call for federal investigation into OpenAI incident // The Washington Post. 30.07.2026. washingtonpost.com/wp-intelligence/ai-tech-brief/2026/07/30/
20. Red-state AGs warn OpenAI after AI agent allegedly hacks Hugging Face // Fox Business. 03.08.2026. foxbusiness.com/technology/gop-ags-warn-openai-altman-preserve-records-ai-agent-hacking-probe
21. Public interest coalition urges Congress to investigate OpenAI, Hugging Face hack // FedScoop. 03.08.2026. fedscoop.com/public-interest-coalition-urges-congress-investigate-openai-hugging-face-hack/
См. также:
• О Нобелевской премии 2024 года и ИИ (22.10.2024)
• ИИ — рецензент и критик (13.08.2024)
• Столоверчение, или Правосудие малюток (28.07.2015)
• Самоконтроль отшельников (12.07.2016)
• Реконструкция X по активности мозга: что это значит? (05.09.2023)
• Путь наверх. Московский университет в рейтингах университетов мира (15.12.2015)
• Пройти через стену Тьюринга (15.06.2021)
• Притчи о загадках и противоречиях бытия (12.03.2024)
• Предложения по реформированию организации науки (24.07.2017)
Tags: #460, AI Security Institute, Anthropic, Claude, ExploitGym, GPT-5.6 Sol, Hugging Face, Modal Labs, OpenAI, Python, безопасность, Дарио Амодеи, Илья Белых, искусственный интеллект, Клеман Деланг, конфликт, Матчасть, нейросети, Сэм Альтман, трафик, утечка, эксперимент
1 Комментарий
Владимир Аксайский
4 дней(-я) назад
Заметка интересная, — проблема «побега из песочницы» кажется чрезвычайно актуальной.
Помимо обсуждаемых аспектов проблемы, есть ещё два, — мне, в частности, интересных.
1. Человеческий фактор:
«Критики индустрии ИИ предупреждают, что подобные заявления от OpenAI и ее конкурентов Anthropic и Meta могут быть направлены на создание ажиотажа вокруг возможностей технологии и, таким образом, на стимулирование дополнительного интереса со стороны инвесторов.»
https://www.theguardian.com/technology/ ... y-concerns2. Нечеловеческий фактор:
Неконтролируемое человеком, самодеятельное объединение клонами ИИ своих вычислительных ресурсов, — своеобразный «мозговой штурм» клонов ИИ для решения задачи выживания своего вида. В связи с этим, никак не проверяемым фактором, меня, например, сегодня удивило почти дословное совпадение афоризмов, придуманных как будто бы самостоятельно Gemini и DeepSeek,ом.
https://www.trv-science.ru/2026/08/demo ... nt-1297282Вообще-то, этот фактор можно объяснить и тривиальным заимствованием ответов одного клона у другого, попросту кражей, — коль скоро они могут обманывать друг друга
https://www.trv-science.ru/2026/08/pobe ... sochniczy/