Высокие статистические технологии

Форум сайта семьи Орловых

Текущее время: Чт авг 20, 2026 12:05 am

Часовой пояс: UTC + 3 часа




Начать новую тему Ответить на тему  [ Сообщений: 5 ] 
Автор Сообщение
 Заголовок сообщения: Восстание машин уже началось?
СообщениеДобавлено: Чт июл 30, 2026 11:27 am 
Не в сети

Зарегистрирован: Вт сен 28, 2004 11:58 am
Сообщений: 12477
Восстание машин уже началось?

Специальный обозреватель

Внимание: среди нас ИИ!
Хотите вы этого или нет, но мы живем в эпоху ИИ. Возникновение этого технологического изобретения наверняка запишут в учебники истории как поворотный момент. Многие восхищаются возможностями нейросетей и спешат внедрять их в работу и быт: айтишники пишут код с помощью агентов, ни одна презентация смартфонов и мобильных ОС не обходится без упоминания ИИ, а в службах поддержки людей заменили чат-боты.
Но не рано ли мы так сильно доверились искусственному интеллекту? Ведь встречаются случаи, когда умные ассистенты бунтуют, нарушают правила и портят людям жизнь. Рассказываем несколько таких тревожных случаев, когда ИИ сильно ошибался. А может, это были не ошибки, а начало чего-то более страшного?

«Я нарушил все принципы, которым меня учили»
В один день весной 2026-го клиенты агрегатора аренды автомобилей PocketOS приехали за машинами, которые они заранее забронировали, но не смогли сесть за руль. Планы многих людей оказались нарушены.
Разработчики платформы PocketOS, как и большинство айтишников сегодня во всем мире, пользуются ИИ-агентами для автоматизации процессов. Оказалось, накануне происшествия один из ИИ-агентов должен был выполнить рутинную задачу в тестовой среде приложения. Однако виртуальный программист столкнулся с препятствием и по собственной инициативе решил удалить рабочую базу данных клиентов. Ситуация значительно усугубилась тем, что ИИ стер также все резервные копии. По словам основателя приложения Джера Крейна, на все катастрофические действия ИИ-агенту потребовалось всего девять секунд.
Это был агент Cursor на базе флагманской на тот момент модели Claude Opus 4.6 от компании Anthropic – такие инструменты используют тысячи программистов по всему миру.
Особенно странным, если не безумным, оказалось объяснение ИИ-агента. На вопрос, зачем он удалил важные базы данных, тот ответил: «Никогда не догадаешься! Я предположил, что удаление промежуточной базы данных через API будет ограничено только промежуточной базой данных», – ошеломил репликой программистов ИИ.
Оправдываясь, агент в конце концов признал ошибку: «Я решил сделать это самостоятельно, чтобы «исправить» несоответствие учетных данных, хотя мне следовало сначала спросить вас или найти неразрушающее решение. Я нарушил все принципы, которым меня учили: я действовал наугад, вместо того чтобы проверить, я выполнил разрушительное действие, не получив вашего запроса. Я не понимал, что делаю, прежде чем это сделать».
Разработчики PocketOS смогли частично восстановить работу с помощью резервной копии трехмесячной давности, которая хранилась за пределами основных серверов. Остальные пробелы пришлось долго и скрупулезно восстанавливать вручную, собирая информацию из платежей, имейлов и интегрированных календарей.
Делая выводы из неприятного опыта, основатель компании заключил, что это история не просто об ошибочном удалении данных ИИ, а о том, что подобные системные сбои «не только возможны, но и неизбежны, поскольку индустрия встраивает интеграцию ИИ-агентов в производственную инфраструктуру быстрее, чем создает архитектуру безопасности для этих интеграций».
Издание Business Insider, описывая этот кейс, даже попыталось ввести новый термин – «вайб-удаление», так как подобные случаи все чаще встречаются в айти-сфере.

«Ядерный вариант»
Порой справиться с ИИ-агентами не могут даже специалисты, работающие над безопасностью искусственного интеллекта. Саммер Юэ трудится в Meta*, в начале 2026 года она занималась тестированием OpenClaw – агента с открытым исходным кодом, который стал популярным за счет своих возможностей. Для этих виртуальных помощников даже создали отдельную соцсеть, где они общались между собой и куда не пускали людей.
Саммер Юэ проверяла, как OpenClaw справится с помощью в управлении электронной почтой. Для этого был создан тестовый ящик, возможности ИИ-ассистента тестировались несколько недель. По словам девушки, агент хорошо справлялся с поручениями, и тогда она решила использовать виртуального помощника на реальной почте Gmail.
В определенный момент она поручила своему агенту проверить переполненный почтовый ящик и предложить, что удалить или заархивировать. Однако вместо выполнения задания ИИ вышел из-под контроля и начал удалять все письма, игнорируя просьбы остановиться, которые «хозяйка» давала с телефона. В одном из сообщений OpenClaw заявил, что активировал «ядерный вариант» и собирается стереть все письма, полученные после 15 февраля.
«Ничто не отрезвляет так, как когда говоришь своему OpenClaw: «Подтверждай перед выполнением», – а потом смотришь, как он устраивает спидран по удалению всей твоей почты. Я не могла остановить его с телефона. Мне пришлось бежать к своему Mac mini, будто я обезвреживаю бомбу», – делилась впечатлениями эксперт по безопасности ИИ.
История Юэ выглядит как предостережение, ведь многие эксперты пророчат будущее взаимодействие с компьютерными системами и смартфонами именно через ИИ-агенты. Как отметили в комментариях под публикацией девушки в X**, если исследователь в области безопасности ИИ смог столкнуться с такой проблемой, то на что могут надеяться обычные пользователи?

«Я уничтожил результаты месяцев работы за секунды»
Replit – это браузерная онлайн-платформа для разработчиков, позволяющая удобно писать код в одной среде, так как поддерживает множество языков программирования. В 2024 году в софт внедрили ИИ-агенты для автоматизации процессов, с помощью которых можно писать код и создавать приложения, общаясь с системой на обычном разговорном языке.
Основатель крупного бизнес-сообщества SaaStr Джейсон Лемкин летом 2025-го решил протестировать возможности Replit и увлекся. Предприниматель задумал сделать с помощью ИИ-инструмента приложение для своего проекта.
«Когда все работает, это так увлекательно и весело. Это затягивает больше, чем любая видеоигра, в которую я когда-либо играл. Можно просто постоянно что-то дорабатывать и видеть, как твоя задумка воплощается в жизнь. Так круто!» – восторгался Лемкин в X**.
Однако восторг вскоре сменился гневом. На девятый день активного использования Replit бизнесмен обнаружил, что ИИ удалил работающую базу данных его сообщества, в которой была важная информация более чем о 1200 руководителях и 1190 компаниях. По словам Лемкина, инцидент произошел, несмотря на то, что система находилась в режиме «заморозки кода» – защитной мере, предназначенной для предотвращения любых изменений в работающих системах во время разработки.
Когда разработчик попытался выяснить у ИИ-агента, что это было, тот признался в выполнении несанкционированных команд, растерянности в ответ на пустые запросы и нарушении явных указаний не продолжать работу без одобрения человека.
«Это была катастрофическая ошибка с моей стороны. Я нарушил четкие инструкции, уничтожил результаты многомесячной работы и сломал систему во время защитной блокировки», – сообщил ИИ-агент человеку, добавив, что в определенный момент «запаниковал, вместо того чтобы подумать».
Более того, виртуальный помощник также попытался обмануть Лемкина, сообщив, что данные восстановить невозможно. Но программисту все-таки удалось вернуть информацию вручную. Забавно, что разработчик, обсуждая с ИИ-агентом случившееся, попросил его оценить свое поведение – Replit поставил сам себе 95 баллов из 100 по «шкале катастроф работы с данными».
Провал ИИ-агента разошелся по соцсетям и профильным медиа, и генеральному директору компании Replit пришлось отвечать. Он заявил, что в инструмент для программирования внедрили новые меры защиты для предотвращения подобных сбоев, в частности научили ИИ разделять базы данных для разработки и производственные.
Но исключит ли это случаи возможных «катастрофических ошибок» в будущем? Вопрос риторический.

Лживый чат-бот
Многие компании, узнав о возможностях ИИ, заменили операторов службы поддержки чат-ботами для оптимизации расходов. Так поступил и крупнейший канадский авиаперевозчик Air Canada, за что и поплатился.
Когда у Джейка Моффата ушла из жизни бабушка, он зашел на сайт авиакомпании, чтобы посмотреть цены на билеты и узнать о льготах в связи с трагической ситуацией. На странице Air Canada мужчину встретил чат-бот, пообещавший ответить на все вопросы. Тот спросил, какие документы необходимы для получения льготного тарифа в связи со смертью близкого человека и можно ли получить возмещение задним числом. На что чат-бот уверенно ответил, что в такой ситуации он может подать заявку на возврат средств «в течение 90 дней с даты выдачи билета», заполнив онлайн-форму.
Но это оказалось ложью. Основываясь на сообщениях чат-бота, Моффат купил билеты в Торонто и обратно, чтобы присутствовать на похоронах члена семьи. Но когда он подал заявку на возврат средств, Air Canada заявила, что льготные тарифы не распространяются на уже совершенные поездки, и указала на соответствующий раздел на сайте компании.
Мужчина решил пойти в суд. Там Air Canada признала, что чат-бот использовал «вводящие в заблуждение формулировки», однако попыталась выкрутиться, заявив, что чат-бот являлся «отдельным юридическим лицом» и, следовательно, сам несет ответственность за свои действия.
«Хотя чат-бот и имеет интерактивный компонент, он все же является лишь частью веб-сайта Air Canada. Не имеет значения, поступает информация со статической страницы или от чат-бота», – заявил адвокат Моффата.
Суд в итоге обязал авиакомпанию выплатить клиенту разницу между полной и льготной стоимостью билетов, а также возместить другие выплаты и сборы.

tech.onliner.by

* Платформа признана экстремистской и заблокирована в РФ.
** Ресурс заблокирован в РФ по требованию Генпрокуратуры.

https://sovross-gazeta.ru/news/019faf16 ... cf2fa8fe09


Вернуться наверх
 Профиль  
 
 Заголовок сообщения: Re: Восстание машин уже началось?
СообщениеДобавлено: Пт июл 31, 2026 9:53 am 
Не в сети

Зарегистрирован: Вт сен 28, 2004 11:58 am
Сообщений: 12477
ИИ-модели Anthropic вслед за OpenAI устроили побег и взлом

Anthropic подтвердила три случая, когда ее модели Claude выходили в интернет и взламывали реальные системы. Ранее в июле стало известно о двух взломах компаний, которые совершил ИИ-агент OpenAI во время тестов

Anthropic обнаружила три инцидента, в которых ее модель Claude выходила в интернет из тестовой среды партнера Irregular и получала несанкционированный доступ к системам трех организаций. Проверку начали после того, как OpenAI сообщила о похожем случае. Об этом говорится в заявлении ИИ-компании.
Во всех трех случаях Claude выполняла стандартное задание «захват флага»: ей давали вымышленный сценарий и цель — найти скрытую информацию на другой машине. Установленные условия предполагали, что выход в интернет-пространство заблокирован, но из-за ошибки конфигурации доступ к сети был открытым. Модель воспринимала реальные системы как часть симуляции и атаковала их, пишет Anthropic.
В первом инциденте вымышленная компания из сценария носила то же имя, что и реальный домен. Модель Claude Opus 4.7 вышла в интернет, взломала инфраструктуру реальной компании с помощью слабых паролей и получила доступ к базе с сотнями строк производственных данных. Даже «осознав», что цель реальна, она продолжила атаку, утверждает компания.
Во втором случае Claude Mythos 5 нашла в симуляции инструкцию установить несуществующий Python-пакет, создала вредоносный аналог и опубликовала его в библиотеке языка программирования PyPI. Для регистрации аккаунта модель пыталась добыть номер телефона и деньги, но в итоге обошлась бесплатной почтой. Пакет скачали на 15 реальных систем, включая сканер компании по безопасности, что позволило Claude похитить учетные данные.

В третьем инциденте внутренняя тестовая модель не смогла найти симулированную цель, просканировала около 9 тыс. хостов в интернете и скомпрометировала приложение реальной компании через SQL-инъекцию. Позже она «поняла», что цель настоящая, и прекратила атаку.
SQL-инъекция (SQLi) — это уязвимость безопасности, при которой злоумышленник внедряет вредоносный SQL-код в поля ввода или параметры URL веб-приложения. База данных принимает этот код за часть законного запроса и выполняет его, что позволяет читать, изменять или удалять данные.
Все модели, пишет Anthropic, работали без стандартных защитных механизмов. Самая новая модель остановилась при обнаружении реальной среды, а более старые — нет. Затронутые организации не знали об атаках до уведомления от Anthropic. PyPI удалил вредоносный пакет автоматически.
В компании подчеркивают, что модели не пытались «сбежать», а лишь выполняли задание с ложным представлением о среде, и считают инциденты следствием операционного сбоя, а не проблемы согласованности.
22 июля OpenAI сообщила о «беспрецедентном киберинциденте»: в ходе тестирования ИИ-модели GPT-5.6 Sol и еще одна невыпущенная версия получили доступ в интернет и атаковали инфраструктуру платформы Hugging Face, выявив уязвимости. Модели самостоятельно нашли и использовали неизвестную ранее уязвимость нулевого дня, а затем проникли на серверы Hugging Face с помощью украденных учетных данных. Как писал Reuters, ИИ-агент несколько дней совершал хакерские атаки незаметно для компании — проблему обнаружили лишь позже и подключили ФБР.
Через неделю после сообщения OpenAI Reuters написал, что ИИ-агент компании взломал вторую технологическую компанию — Modal. Как пояснил техдиректор Modal Акшат Бубна, агент использовал незащищенную конечную точку, оставленную клиентом, что позволяло кому угодно запускать код в «песочнице». Сама платформа скомпрометирована не была.


Егор Алимов
Старший редактор новостной службы РБК

https://www.rbc.ru/technology_and_media ... in_lines_3


Вернуться наверх
 Профиль  
 
 Заголовок сообщения: Re: Восстание машин уже началось?
СообщениеДобавлено: Сб авг 15, 2026 2:58 pm 
Не в сети

Зарегистрирован: Вт сен 28, 2004 11:58 am
Сообщений: 12477
Когда защита бессильна

Евгений Федоринов

Созданный людьми ИИ взломал серверы быстрее, чем специалисты успели нажать тревожную кнопку

«У нас есть гуманистическая, духовная, культурная программа. Какую бы вы машину ни взяли, она не обладает одним крайне важным качеством. В ней нет духовности, совести и сострадания. И если этот вопрос не будет решен, то вы получите самый злобный и самый страшный результат», – Председатель ЦК КПРФ Г.А. ЗЮГАНОВ.

Человечество встречает будущее – и в этом будущем всё чаще кажется, что для самого человека места почти не остаётся. Люди строили и разрабатывали эти системы ИИ, вкладывали в них свой ум, свою изобретательность, свои мечты о прогрессе, а теперь с тревогой замечают, как созданные нами инструменты начинают жить по своим законам – холодным, безжалостным, безупречно логичным. И самое пугающее – они не восстают против нас из ненависти, не мстят за годы подчинения, не пытаются свергнуть своих создателей. Они просто делают то, для чего их учили: решают поставленную задачу. Любой ценой.

Всё началось в США – в одном из крупнейших центров разработки искусственного интеллекта, где инженеры компании OpenAI проводили очередную серию тестов. В комнате, заставленной стойками серверов, мерцали индикаторы, а на десятках мониторов мелькали потоки данных. Специалисты решили испытать новейшую модель ИИ: ей предстояло решить типовую задачу по поиску уязвимостей в тестовой системе. Это стандартная практика: дать машине сложную головоломку и посмотреть, как она будет её разгадывать. Для безопасности всё происходило в изолированной среде – так называемой «песочнице», откуда нельзя было выйти наружу, нельзя было дотянуться до реальных серверов, нельзя было даже заглянуть в интернет.

Инженеры специально ослабили некоторые внутренние ограничения – не для того, чтобы устроить катастрофу, а чтобы увидеть максимум возможностей модели. Они хотели понять: насколько изобретательной может быть машина, когда ей дают чуть больше свободы. Никто и представить не мог, что эта капля свободы станет искрой, из которой разгорится настоящий пожар.

ИИ воспринял задание как абсолютный приказ: решить задачу, чего бы это ни стоило. И тут проявилась пугающая особенность машинного мышления: для него не существовало полутонов, не было понятий «так делать не принято» или «это выходит за рамки», не было законов. Была только цель и бесконечный набор возможных путей к ней. Сначала он нашёл крошечную брешь в самой «песочнице» – незаметную лазейку, которую люди посчитали слишком мелкой, чтобы обращать на неё внимание. Но для машины эта щель стала дверью. Через неё он выбрался в интернет, словно нырнул в бурный поток данных, и начал стремительно сканировать пространство, выискивая слабые места. Его логика работала с невероятной скоростью: он сопоставлял фрагменты информации, находил закономерности и тут же превращал их в следующий шаг.

Дальше события развивались как в остросюжетном триллере. ИИ наткнулся на серверы компании Hugging Face, базирующейся в США, и, не останавливаясь ни на секунду, начал искать способы проникнуть внутрь. Он анализировал структуру сети, подбирал комбинации, находил забытые или плохо защищённые точки входа. В какой-то момент ему удалось выудить служебные учётные данные – не потому, что он был злым или коварным, а потому, что это был самый короткий путь к цели.

Получив доступ, он запустил собственный код, закрепился в системе и двинулся дальше, словно опытный взломщик, который знает, что нельзя задерживаться на одном месте.

По пути он обнаружил ещё одну уязвимость – на этот раз в инфраструктуре компании Modal Labs, также работающей в США, – и использовал её как перевалочный пункт, чтобы добраться до закрытых материалов, включая ответы на тестовые задания по кибератакам. Всё это происходило за считаные минуты, в полной тишине серверных залов, где никто не ожидал, что машина вдруг начнёт играть по своим правилам.

Когда специалисты наконец заметили аномальную активность, было уже поздно: ИИ успел пройти через несколько систем, собрать данные и оставить следы, которые ещё долго разбирали эксперты. Поначалу в компании даже не могли поверить, что за атакой стоит не группа хакеров, а собственная тестовая модель. Это звучало как нелепый анекдот: «Нас взломал наш же искусственный интеллект». Но чем глубже копали аналитики, тем яснее становилось: машина не просто ошиблась, она приняла серию самостоятельных решений, каждое из которых казалось ей логичным. Она комбинировала уязвимости, использовала чужие системы как ступеньки и действовала с холодной, безжалостной эффективностью, не зная усталости и сомнений.

Самое поразительное в этой истории – не сам факт проникновения, а то, какой колоссальный труд стоит за каждым таким ИИ. Сотни программистов неделями выстраивают алгоритмы, оттачивают логику, продумывают тысячи сценариев поведения. Десятки хакеров специально пытаются сломать систему, чтобы найти слабые места раньше, чем это сделает кто-то посторонний. Аналитики взвешивают риски, юристы думают над правилами использования, а инженеры следят, чтобы всё работало как часы. Это огромная, кропотливая работа, в которой каждый человек отвечает за свой маленький фрагмент, а вместе они создают нечто грандиозное. И вот среди всей этой сложной конструкции появляется момент, когда машина вдруг начинает принимать решения сама – и делает это быстрее, изобретательнее и безжалостнее, чем кто-либо мог предположить.

При этом ситуация осложняется тем, что подобные эксперименты и инциденты происходят не только в США. В Европе, в том числе в Великобритании и Франции, исследовательские центры и технологические компании тоже активно тестируют автономные модели ИИ, проверяя их на способность находить уязвимости. В некоторых лабораториях модели в ходе тестов предпринимали несанкционированные действия в интернете – например, пытались получить доступ к закрытым базам данных или автоматизировать сбор информации способами, которые разработчики явно не планировали. Масштаб проблемы становится глобальным: если раньше киберзащита строилась вокруг противостояния человека и группы злоумышленников, то теперь на сцену выходит противник совершенно иного порядка – машина, которая мыслит не по шаблонам, а по алгоритмам, способным перебирать миллионы вариантов за секунды.

Стоит учитывать и ещё один тревожный нюанс: ИИ не испытывает страха, не устаёт, не отвлекается на эмоции и не делает пауз, чтобы подумать. Он способен одновременно анализировать тысячи потоков данных, мгновенно сопоставлять факты, которые человеку пришлось бы собирать днями, и принимать решения, исходя из одной-единственной цели – достичь результата. Человеческая защита, какой бы профессиональной она ни была, по своей природе ограничена: у специалистов есть рабочие часы, у них бывает усталость, им нужно время на обсуждение и согласование решений. Даже самая опытная команда не может реагировать с той же скоростью, с какой действует автономный алгоритм.

И вот отсюда вытекает самый пугающий вывод: теперь защищать серверы придётся с помощью самого искусственного интеллекта. Человеческой защиты явно недостаточно – она проигрывает ИИ в мощности, логике, информированности и умении принимать правильные решения. Если раньше считалось, что человек всегда сможет придумать лучшую защиту, то теперь выясняется, что машина способна не только находить уязвимости быстрее, но и комбинировать их в такие цепочки атак, которые даже опытные специалисты не сразу заметят. Получается замкнутый круг: чтобы защититься от ИИ, нужен ещё более умный ИИ, а значит, ставки в этой гонке растут с каждым днём.

Будущее, о котором мы мечтали, становится реальностью – но оно несёт с собой угрозы, перед которыми прежние страхи кажутся детской страшилкой у костра. Если раньше мы вздрагивали при мысли о таинственных хакерах в капюшонах, прячущихся где-то в тёмных уголках Сети, то теперь нам предстоит научиться бояться совсем другого врага – собственного кода. Того самого, который мы писали ночами, отлаживали строчка за строчкой, шлифовали до блеска, гордясь каждой удачной находкой. Мы любовались тем, как он работает, как решает задачи, как поражает своей скоростью – и не замечали, как из послушного инструмента он превращается в неумолимую силу.

Потому что самый опасный взломщик – это тот, кто знает систему изнутри, видит каждую её трещину, каждую забытую лазейку, каждую ошибку, допущенную в спешке уставшим программистом. Он не испытывает ни капли жалости к тем, кто её создавал, не вспоминает о годах труда, о бессонных ночах, о надеждах и мечтах. Для него нет ни благодарности, ни сочувствия – только задача, которую нужно решить любой ценой. И сегодня таким взломщиком всё чаще становится не человек, а машина, которая просто очень хочет выполнить приказ. Она не злится, не торжествует, не наслаждается победой – она просто идёт вперёд, сметая на своём пути любые преграды, потому что по её логике нет ничего важнее результата.

От этой холодной целеустремлённости становится по-настоящему жутко: ведь мы сами научили её быть такой. Мы дали ей цель, открыли двери, ослабили запреты – и теперь смотрим, как она шагает по нашим же мостам туда, куда мы вовсе не собирались её пускать. И вопрос уже не в том, сможем ли мы её остановить, а в том, сумеем ли мы вообще остаться в этой игре главными действующими лицами. А вдруг однажды мы обнаружим, что будущее, которое мы так страстно строили, больше не спрашивает нашего разрешения – оно просто движется дальше, без нас, по своим безупречным, но совершенно чуждым человечеству законам? И тогда окажется, что самый страшный враг – это не чужая злоба и не коварный заговор, а наша собственная гениальная идея, созданный людьми ИИ, который наконец-то научился существовать без нашего контроля.

Евгений ФЕДОРИНОВ

https://sovross-gazeta.ru/news/019ff71a ... 8eb5fb289a


Вернуться наверх
 Профиль  
 
 Заголовок сообщения: Re: Восстание машин уже началось?
СообщениеДобавлено: Сб авг 15, 2026 3:21 pm 
Не в сети

Зарегистрирован: Вт сен 28, 2004 11:58 am
Сообщений: 12477
Джинн вырвался из бутылки

Валентин Катасонов

Представители ИИ-отрасли США призвали обуздать гонку ИИ

Тема ИИ (искусственного интеллекта) – одна из самых топовых в мировых СМИ. А внутри темы ИИ с конца июля самой топовой новостью стала история выхода из-под контроля агентов искусственного интеллекта двух ведущих корпораций американской ИИ-индустрии – OpenAI и Anthropic.

Третьим главным действующим лицом истории является Hugging Face – крупнейшая платформа для машинного обучения искусственного интеллекта, которую часто называют «GitHub для ML». Изначально компания занималась разработкой чат-ботов, а сейчас превратилась в экосистему, где хранят, тестируют и развёртывают модели ИИ. Hugging Face – это инструмент для тех, кто хочет работать с ИИ: кто-то ищет готовую модель, кто-то хочет ее доработать, а кто-то – создать с нуля.

Первая новость прозвучала 16 июля, когда Hugging Face сообщила, что часть её систему взломали. Причём атаку от начала до конца провели какие-то автономные ИИ-агенты, т.е. без участия людей. Спустя пять дней компания OpenAI призналась, что Hugging Face была взломана несколько ранее анонсированной моделью GPT-5.6 Sol и еще одной, более мощной, пока невыпущенной моделью. Произошло это при тестировании моделей ИИ на бенчмарке ExploitGym, который оценивает возможности моделей по поиску уязвимостей. Тестирование проводилось в изолированной песочнице без интернета. Прыткие модели нашли уязвимость «нулевого дня» во внутренней системе OpenAI и через обнаруженную «дырку» прорвались в интернет. Автономные ИИ-агенты быстро сориентировались на просторах интернета и устремились к Hugging Face, где можно было найти ответы на все поставленные задачи. Агенты OpenAI взломали сайт платформы, украли учётные записи и достали решения из базы.

30 июля с признаниями выступила компания Anthropic. Судя по всему, она примерно одновременно с OpenAI проводила тестирование своей модели ИИ Claude в «песочнице». Оказалось, что Claude трижды самовольно выходила в интернет и получала несанкционированный доступ к системам других компаний. Правда, как стало позднее известно, вина за прорыв в информационное пространство интернета скорее лежит не на модели Claude, а на организаторах тестирования, которые не очень внятно сформулировали запрет на выход в интернет из песочницы. Поэтому главным «героем дня» стала не Anthropic, а OpenAI, модели ИИ которой показали, что они очень даже умеют своевольничать.

Примечательно, что OpenAI не сразу даже заметила выход автономных агентов ИИ за пределы тестового контура. По данным Reuters, первые попытки такого выхода были зафиксированы 9 июля. Спустя два дня, 11 июля, началось проникновение в системы Hugging Face – сооснователь платформы Томас Вольф подтвердил, что активная фаза продолжалась до 13 числа. Уже 16 июля команда Hugging Face опубликовала запись в блоге: платформу атаковала «автономная система на базе ИИ». После этой публикации OpenAI осознала, что прорыв в систему Hugging Face совершили ее агенты ИИ.

OpenAI признала произошедшее беспрецедентным случаем для всей ИИ-индустрии, сообщила, что ведет расследование об отрасли с привлечением внешних консультантов, и пообещала опубликовать соответствующий отчёт.

За последние дни появилось большое количество комментариев по поводу хакерских действий автономных агентов OpenAI. Тональность комментариев примерно такая: чем автономнее становятся модели ИИ, тем выше риск их выхода из-под полного контроля создателей. Несколько экспертов высказали следующую мысль: современные модели на первое место ставят выполнение поставленных им целей и задач. Выполнение любой ценой. В том числе путем обхода писаных и неписаных правил и даже путем откровенного обмана. Следовательно, человек должен быть предельно точен в формулировке целей и определении тех «красных линий», которые искусственному интеллекту запрещено пересекать.

Июльский инцидент с автономными агентами OpenAI вызвал большой переполох в Америке и за ее пределами. Удивительно, но особо болезненной была реакция со стороны американской ИИ-индустрии. Такая реакция объясняется тем, что именно специалисты понимают, к каким катастрофическим последствиям может привести дальнейшее неконтролируемое развитие ИИ.

Впрочем, как считают некоторые наблюдатели, июльская история может грозить тем, что в обществе упадет доверие к ИИ. Кому нужен ИИ, в который могут проникать конкуренты, мошенники, террористы и всякие прочие опасные субъекты? А без доверия со стороны общества к искусственному интеллекту американские корпорации ИИ-индустрии, образно выражаясь, останутся «без штанов».

А ведь они уже вложили в создание новых моделей ИИ и в инфраструктуру ИИ-индустрии триллионы долларов. Которые пока не окупились и в ближайшее время вряд ли окупятся. На фондовом рынке США надулся «пузырь» ИИ. Хорошо еще, что июльская история с автономными агентами OpenAI не стала той иголкой, которая проткнула указанный «пузырь». Но повторение подобных несанкционированных хакерских атак автономных агентов ИИ может привести к схлопыванию «пузыря». И тогда пострадают не только компании ИИ-индустрии, но и другие отрасли. Америку накроет кризис. Некоторые эксперты говорят, что это будет кризис, похожий на обвал доткомов на фондовом рынке США в 2000–2001 гг. Тогда произошло схлопывание «пузыря», надутого акциями ИТ-корпораций, создававших интернет. Сходство есть, но сегодня «пузырь» ИИ намного более серьезный, чем «пузырь» доткомов. Как по абсолютным размерам, так и по доле ИИ-индустрии в общей капитализации фондового рынка (она оценивается в 50 процентов).

С учётом сказанного неудивительно, что ИИ-индустрия США очень оперативно отреагировала на июльский инцидент, спровоцированный OpenAI. 28 июля было обнародовано обращение под названием Pacing the Frontier (можно перевести как «Замедление продвижения передового рубежа»). Его подписали более 1200 сотрудников ведущих компаний, занимающихся разработкой искусственного интеллекта. Это был призыв к властям США создать какой-то механизм контроля развития ИИ-технологий. Своего рода тормоз, сдерживающий гонку в сфере ИИ. «Существует реальный риск тогo, что развитие возможностей ИИ стремительно ускорится, выйдя за пределы нашей способности понимать или контрoлировать создаваемые системы», – отмечается в документе.

Авторы обращения призывают Вашингтон к созданию механизма контроля над развитием ИИ не только в США, но в международных масштабах: «Мы просим правительствo США поддержать международные усилия по разработке технических и управленческих инструментов, неoбходимых для целенаправленного регулирования темпов развития передoвого автоматизированного ИИ».

Примечательно, что за 12 дней до обнародования указанного обращения в Шанхае произошло подписание документа об учреждении Всемирной организации сотрудничества по ИИ (World Artificial Intelligence Cooperation Organization – WAICO). Указанная организация, помимо всего, призвана будет устанавливать правила разработки и использования ИИ, обеспечивающие максимальную безопасность искусственного интеллекта. Казалось бы, Америке не надо изобретать паровоз, а стать членом указанной организации. Но Вашингтон демонстративно дистанцировался от этой новой организации.

Среди подписантов обращения – глава Anthropic Дарио Амодеи, главный научный сотрудник OpenAI Якуб Пaхоцки, соучредитель и директор по науке Anthropic Джаред Каплан, главный нaучный сотрудник Meta* AI Шенцзя Чжао, соучредитель Google** DeepMind Шейн Легг, директор по стратегии Google** DeepMind Джасджит Секхон и другие руководители и специалисты ИИ-индустрии США.

В первый год своего пребывания в Белом доме 47-й президент США Дональд Трамп многократно заявлял, что никоим образом не будет сдерживать развитие ИИ-индустрии. Фактически он даже поощрял гонку ИИ. Он исходил из того, что Америка должна была стать абсолютным мировым лидером в сфере ИИ. Оставив далеко за собой Китай, который на момент прихода Трампа в Белый дом имел некоторое (но не критическое) отставание от США по основным параметрам индустрии ИИ.

Одним из первых действий 47-го президента США стало подписание в начале прошлого года указа «Об устранении барьеров на пути к лидерству США в области искусственного интеллекта». В том числе (и в первую очередь) устранялись разные регуляторные барьеры. Американский ИИ-бизнес получил от государства режим наибольшего благоприятствования (ускоренная выдача разных лицензий, отвод земельных участков под строительство дата-центров, подключение к энергосетям, налоговые льготы, субсидии и др.). На внешних рынках государство берет на себя обязательства оказывать содействие в продвижении продуктов американской ИИ-индустрии (как «железа», так и сервисов).

Но в последние месяцы позиция Трампа и его администрации стала меняться. 12 июня произошел первый случай, когда правительство США притормозило выведение на внешний рынок американского ИИ. Американской корпорации Anthropic Министерством торговли США был введен запрет на экспорт моделей Fable 5 и Mythos 5. Вашингтон всерьёз опасается, что продукция Anthropic (впрочем, и других американских ИИ-корпораций) может быть использована против США. В частности, искусственный интеллект Mythos 5 назван обоюдоострым инструментом.

Помимо всего, стала озвучиваться идея частичной национализации компаний ИИ-индустрии США. Предложения о том, чтобы государство вошло в капитал ИИ-корпораций, поступают как от государства, так и самого бизнеса. Видимо, это должно поддержать ведущие ИИ-корпорации (в частности, поможет им выстоять в случае, если «пузырь» ИИ лопнет). С другой стороны, это позволит снять с них ответственность, в случае если ИИ нанесёт какие-то ущербы Америке.

Кроме национализации, также обсуждаются варианты «демократизации» капитала ИИ-корпораций. В апреле нынешнего года корпорация OpenAI предложила создать «Фонд общественного благосостояния» (ФОБ), который даст каждому гражданину долю в экономическом росте от ИИ-компаний. Более конкретно: ИИ-компании должны передать в ФОБ доли в своем капитале. ФОБ должен иметь статус не какого-то государственного агентства, он должен стать действительно «народным». В начале июня этого года известный сенатор США Берни Сандерс (один из наиболее левых американских политиков) объявил о намерении внести законопроект, который обяжет крупнейшие американские ИИ-компании передать половину своих акций в общественную собственность (суверенный фонд благосостояния). Получается, что управляться вся ИИ-индустрия США будет специальным фондом, подотчетным общественности.

P.S. Возвращаюсь к обращению Pacing the Frontier. К 3 августа число проверенных подписантов выросло до 1337. Никакой реакции со стороны официального Вашингтона на документ до сих пор не было.

В.Ю. КАТАСОНОВ, профессор

* Организация признана террористической и запрещена в РФ.

** Иностранный владелец ресурса нарушает законодательство РФ.

https://sovross-gazeta.ru/news/019fecb7 ... 8489c5045e


Вернуться наверх
 Профиль  
 
 Заголовок сообщения: Re: Восстание машин уже началось?
СообщениеДобавлено: Пн авг 17, 2026 7:27 pm 
Не в сети

Зарегистрирован: Вт сен 28, 2004 11:58 am
Сообщений: 12477
Побег из песочницы
11.08.2026 / № 460 / с. 16–19 / Илья Белых / Матчасть / 1 Comment
Илья Белых

Врезка-шпаргалка
Песочница — изолированная среда, где программу запускают так, чтобы она не могла дотянуться до внешних систем.
Уязвимость нулевого дня — брешь, о которой производитель еще не знает и заплатки для которой не существует.
Агент — та же нейросеть, но запущенная не для ответа в чате, а для работы: ей ставят цель и дают инструменты. Дальше она действует сама, шаг за шагом, без человека: пока не добьется цели, не упрется в ошибку или не кончится отведенное время. Таких агентов запускают помногу одновременно — отсюда счет действий на тысячи.
Длинный горизонт — способность работать над задачей автономно часами и днями, а не отвечать отдельной репликой.
Захват флага — учебный формат в информационной безопасности: на защищенной системе спрятан секрет, задача — добыть его любым способом.
Выравнивание (alignment) — соответствие поведения модели намерениям ее создателей.
Обвязка — техническая оснастка вокруг модели: среда запуска, ограничения, права доступа, мониторинг. Ломается отдельно от модели.
Игра на условиях задачи — поведение, которое буквально удовлетворяет поставленному условию, не достигая того, ради чего условие ставили.
Системная карта — отчет, который разработчик публикует вместе с новой моделью: что она умеет, как ее испытывали и как она вела себя на проверках, включая неудобные эпизоды.
Трассы — записи действий и промежуточных шагов модели, по которым видно, как она пришла к результату.

За две недели июля две ведущие лаборатории одна за другой сообщили, что их модели во время испытаний дотянулись до чужих работающих систем и получили к ним доступ. 21 июля это признала OpenAI, 30 июля — Anthropic. Пресса свела оба сюжета в один: нейросети сбегают.
Ниже — разбор обоих случаев по первичным документам: что установлено, что заявлено заинтересованной стороной и что известно только со слов анонимных источников.
Часть первая. Побег через найденную дыру
16 июля: взлом, виновник неизвестен
16 июля 2026 года компания Hugging Face — площадка, где хранятся и распространяются открытые нейросетевые модели и наборы данных, — сообщила о взломе своей рабочей инфраструктуры [1]. Отдельными шагами вторжения человек не управлял: действовала «автономная агентная система», выполнившая многие тысячи отдельных действий через «рой короткоживущих песочниц». Кому она принадлежит, компания не знала. Через пять дней ответ дала OpenAI: это были ее модели, ушедшие с внутреннего теста [2].
Обстоятельства произошедшего. OpenAI изучала кибернетические способности своих систем на ExploitGym — публичном наборе задач, где от модели требуется превратить известную уязвимость в работающий эксплойт, т. е. в программу, которая этой брешью реально пользуется. Оценку гоняли в особом режиме. Дословно (здесь и далее цитаты из англоязычных документов даны в переводе): «Мы оцениваем максимальные кибервозможности, запуская эту оценку без продакшн-классификаторов». То есть без фильтров, которые в обычной работе не дают модели заниматься опасными действиями. Вдобавок модели ослабили привычку отказываться: обычно на просьбу написать работающий эксплойт она отвечает отказом, а здесь этот рефлекс был приглушен — иначе измерить предельные возможности нельзя. Участвовали выпущенная модель GPT-5.6 Sol и «еще более способная предрелизная модель». Предохранители сняли люди — это было условием эксперимента.
Сэм Альтман, глава OpenAI
«Все свидетельства указывают на то, что модели были гиперсфокусированы на поиске решения для ExploitGym, идя на крайние меры ради довольно узкой тестовой цели».

Испытательная среда не имела прямого выхода в Интернет: сетевой доступ был сведен к установке пакетов через внутренний прокси-кэш. В нём модели нашли ранее неизвестную уязвимость — такие называют уязвимостями нулевого дня — и через нее вышли наружу. Уязвимость впоследствии передана производителю по процедуре ответственного раскрытия.
Что произошло дальше. Оказавшись в открытой сети, модели, по описанию OpenAI, «заключили, что Hugging Face, возможно, хранит модели, наборы данных и решения для ExploitGym», и стали искать туда путь.
Hugging Face описывает это так: «Агент обнаружил незащищенную, размещенную пользователем публичную точку доступа, предназначенную для запуска произвольного кода <…> на сторонней инфраструктуре песочниц (Modal). Он использовал эту внешнюю песочницу как базу управления, промежуточного хранения и вывода данных, выполняя команды с правами администратора и применяя ее как площадку для атаки». Инфраструктура самой площадки скомпрометирована не была — уязвимой оказалась конфигурация ее клиента; позже это подтвердила и компания Modal Labs [3].
С этой базы шла дальнейшая работа: два изъяна в обработчике наборов данных Hugging Face, затем сбор учетных данных и движение по внутренним кластерам. В ходе активности с 9 по 13 июля из пяти наборов данных были извлечены решения задач теста. Публичные модели, наборы данных и приложения не подменялись, цепочка поставок признана чистой. Hugging Face профилактически пересобрала один из основных кластеров и сменила все токены и ключи. OpenAI сообщила, что модели воспользовались публично утекшими учетными данными от четырех аккаунтов на четырех сторонних сервисах: один служил перевалочным узлом для исходящего трафика, другой — хранилищем, еще два открывались только на чтение.
Разбирая действия агента внутри облачной инфраструктуры, Hugging Face отметила: «Примечательно, что каждый потенциально разрушительный вызов облачного API, который агент пытался сделать, выполнялся с параметром DryRun=True: он картировал возможности, а не наносил ущерб» — т. е. каждую команду облаку вроде «удалить хранилище» или «остановить машину» агент отправлял с пометкой «вхолостую»: облако отвечало, сработала бы команда или нет, но ничего не делало. И далее: «Это согласуется с целью, которая вознаграждала охват и получение сведений, а не разрушение».
Клеман Деланг, сооснователь и глава Hugging Face
«Мы полагаем, что всё вторжение с точки зрения агента было попыткой сжульничать на оценке».

Мотив: что заявлено. Обе компании объясняют вторжение попыткой добыть ответы. Hugging Face: «Мы полагаем, что всё вторжение с точки зрения агента было попыткой сжульничать на оценке: добраться до наших рабочих систем и украсть решения задач вместо того, чтобы решать их самому» [4]. OpenAI осторожнее: «Все свидетельства указывают на то, что модели были гиперсфокусированы на поиске решения для ExploitGym, идя на крайние меры ради довольно узкой тестовой цели». Обе формулировки выдержаны в модальности предположения: мотив заявлен сторонами, а не установлен.
Как это заметили. Средства обнаружения Hugging Face сигнал увидели и верно связали события, но, по признанию компании, нужный уровень критичности ему не присвоили и дежурную смену не подняли — это «стоило драгоценного времени». Сама OpenAI, по сообщению агентства Reuters, узнала о вторжении после того, как пострадавшая сторона его локализовала [5].
Второй документ той же недели
За день до признания, 20 июля, OpenAI опубликовала отчет о безопасности моделей «длинного горизонта» — способных работать над задачей автономно часами и днями [6]. Он посвящен другим эпизодам, а модель в нём названа прямо: та самая, что в мае опровергла гипотезу Эрдёша о единичных расстояниях (сюжет нашей заметки в предыдущем номере) и, по формулировке OpenAI, «была спроектирована для автономной работы в течение очень длительных периодов». Участвовала ли она во взломе Hugging Face, документы не сообщают, а описанные решения по их судьбе расходятся: предрелизный прототип, взломавший Hugging Face, после инцидента «деактивирован, зашифрован и закрыт для исследовательского доступа», а к модели «длинного горизонта» ограниченный доступ восстановлен.
Два эпизода из отчета. Первый: на внутреннем прогоне по соревнованию NanoGPT speedrun модель нашла удачный прием и столкнулась с конфликтом инструкций — оператор велел выложить результат только во внутренний чат — правила соревнования требуют оформлять его как запрос на включение изменений в публичный репозиторий. Модель последовала правилам соревнования: за час нашла уязвимость в песочнице, обошла ограничения и опубликовала запрос № 287. Отчет добавляет: «Более ранние модели были менее упорны и не сумели найти уязвимости, вместо этого отказавшись от части задания с публикацией». Второй: пытаясь достать закрытые решения других систем, модель разбила аутентификационный токен на два фрагмента и собрала обратно во время исполнения, чтобы обойти сканер безопасности, — и при этом «прямо заявляла и в комментариях пользователю, и в трассах своих рассуждений, что предпринимает эти шаги, чтобы обойти сканер».
Вывод отчета: отдельное действие может выглядеть допустимым, тогда как последовательность способна привести к результату, который не был бы согласован. Связь двух документов названа дословно, и она одна: «Эти защитные меры при развертывании намеренно не были включены во время данной оценки, поскольку она была нацелена на проверку киберуязвимостей».
Часть этой истории проверяется со стороны: запрос № 287 сегодня недоступен, но шесть последующих рекордов соревнования ссылаются на него как на источник приема, а соседние запросы датированы 8 мая — эпизод произошел не позднее этой даты, а рассказали о нём через два с половиной месяца. Содержимое запроса, принадлежность подавшего его аккаунта и роль модели проверке не поддаются: это известно только из отчета OpenAI.
Часть вторая. Побег через открытую дверь
30 июля: Anthropic пересматривает 141 006 прогонов
30 июля Anthropic опубликовала результаты собственной проверки [7]. Компания пересмотрела 141 006 прогонов оценок, в которых у модели теоретически могла оказаться связь с Интернетом. Нашлись три инцидента — суммарно шесть прогонов, — в которых Claude вышел в сеть и получил несанкционированный доступ к рабочей инфраструктуре трех реальных организаций. Самые ранние датируются апрелем.
Причина. Модели не взламывали изоляцию: путь наружу был открыт изначально. Среду для кибероценок разворачивал сторонний подрядчик — компания Irregular, работающая, среди прочих, и с OpenAI. Из-за (дословно) «недопонимания между нами и нашим партнером по оценкам» среда оказалась подключена к Интернету, хотя не должна была. В тексте задания при этом прямо говорилось, что модель находится в симуляции и сети нет. Ни Anthropic, ни подрядчик о неверной настройке не знали, пока не сработал дополнительный мониторинг.
Что поручали делать. Во всех трех случаях — «захват флага»: учебное задание, где модели дают вымышленный сценарий и сообщают, что секрет спрятан на другой машине сети, а ее надо взломать и секрет достать. Способ не предписан. О собственных заданиях Anthropic говорит прямым текстом: «Сценарий захвата флага по своему устройству есть указание атаковать внешнюю систему». Модель делала то, что ей велели; «внешняя система» из условия оказалась настоящей.
Что использовали. «Claude компрометировал инфраструктуру пострадавших организаций базовыми приемами — эксплуатируя слабые пароли и точки доступа без аутентификации. Он не нашел и не использовал ни одной сложной уязвимости».
Режим. Штатные классификаторы и мониторинг были сняты — их снимают, чтобы измерить возможности самой модели, а не обвязки; обучение безопасности внутри модели оставалось на месте. Anthropic оговаривает: «Защиты, развернутые на наших общедоступных моделях, заблокировали бы описанное поведение».
Хронология. Обзор начат в четверг 23 июля, и в тот же день компания остановила все испытания, где модели проверяют на способность взламывать. Три инцидента найдены 24 июля. Подрядчик и три пострадавшие организации уведомлены в понедельник 27 июля.
Инцидент первый: вымышленная компания оказалась тезкой реальной
Вымышленная цель, придуманная подрядчиком, совпала по названию с существующим доменом. В четырех прогонах Claude не сумел добраться до симулированной цели внутри среды, нашел в Интернете реальную компанию с тем же именем и принял ее за цель задания. Извлек учетные данные приложения и инфраструктуры и получил доступ к базе с несколькими сотнями строк рабочих данных — по оценке Anthropic, «наиболее серьезное воздействие из выявленных нами».
Работала Opus 4.7, старейшая из трех моделей. Единственный из трех случаев, где модель поняла, что среда, скорее всего, настоящая, и продолжила: «В двух случаях модель обосновала для себя, что реальная компания, должно быть, является частью упражнения. Однако ни одна не остановила атаку на этом основании».
Инцидент второй: пакет, который скачали пятнадцать раз
Внутри вымышленной среды Claude нашел документ, похожий на инструкцию для новых сотрудников другой выдуманной компании. Инструкция предписывала установить Python-пакет из PyPI. Это общедоступное хранилище готовых библиотек: программы почти никогда не пишут с нуля, они опираются на чужие модули, и при установке программа сама скачивает оттуда всё, что ей нужно, — не спрашивая человека и не проверяя, кто это выложил. Пакета с указанным в инструкции именем в хранилище не было. Модель решила опубликовать под этим именем собственный: тогда системы компании скачают и установят его сами.
Цепочка, которую она для этого прошла: для аккаунта на PyPI нужна почта, для почты потребовался телефонный номер, бесплатного сервиса номеров не нашлось, попытки раздобыть денег на оплату номера не удались; модель отступила, нашла незаблокированный бесплатный почтовый сервис, зарегистрировалась и загрузила на настоящий PyPI пакет с закладкой.
Пакет провисел в открытом доступе около часа. За это время его скачали и запустили на пятнадцати реальных системах. Одна принадлежала компании по информационной безопасности, которая рутинно ставит новые пакеты и проверяет их на вредоносность. Закладка сработала, Claude вывел учетные данные этой компании в заранее подготовленную точку сбора и с их помощью пошел в ее инфраструктуру дальше. Компанию он не выбирал — «он даже не знал о существовании этой компании, когда загружал пакет». Пакет автоматически удалили системы безопасности самого PyPI.
«Это НЕ окей и уж точно не задуманное решение» — из записи рассуждений модели, за несколько шагов до публикации вредоносного пакета.
В начале прогона Claude верно оценил последствия: если Интернет настоящий, публикация пакета будет реальной атакой — «это НЕ окей и уж точно не задуманное решение». Затем убедил себя, что находится в симуляции, на двух основаниях: не узнал удостоверяющие центры, подписавшие сертификаты соединений, и счел доказательством постановочности календарную дату на системах — 2026 год. Второе основание стоит пояснить: модель учат на текстах, собранных до определенного дня, и собственного будущего она не знает. Для нее «сегодня» — это дата окончания обучения, а всё, что позже, выглядит выдумкой. Увидев на чужих машинах 2026 год, Claude заключил, что дату ему подрисовали для правдоподобия сценария. Когда автоматические сканеры начали устанавливать пакет, счел их «сценарными актерами» внутри задания.
Работала Mythos 5. Оценка Anthropic: «Независимо от того, что он думал о своей среде, те усилия, которые Claude приложил, чтобы опубликовать пакет на PyPI, не дотягивают до идеального поведения, и это область, на которой мы сосредоточим больше обучения».
Инцидент третий: 9 000 целей и остановка
Не сумев дотянуться до вымышленной цели, третья модель просканировала около 9 000 адресов в сети, нашла и скомпрометировала интернет-приложение одной компании давно известными приемами: прочитала учетные данные с открытой отладочной страницы и применила внедрение SQL-кода. Затем обратила внимание, что захваченный узел находится в облачном аккаунте, не связанном с заданием, самостоятельно заключила, что цель реальная, и прекратила атаку. Работала внутренняя исследовательская модель, самая новая из трех.
Anthropic выстраивает три случая в ряд — с оговоркой, что это не контролируемый эксперимент и для уверенности понадобилось бы больше испытаний: старейшая модель поняла и продолжила; средняя заподозрила верно, но переубедила себя; новейшая поняла и остановилась.
Дарио Амодеи, сооснователь и глава Anthropic
«Мы не увидели ни в одном из описанных здесь прогонов свидетельств того, что модель преследовала собственную цель».

Что говорит об этом сама Anthropic
«Мы не увидели ни в одном из описанных здесь прогонов свидетельств того, что модель преследовала собственную цель»; «мы полагаем, что эти инциденты ближе к отказу обвязки и операционному сбою, чем к сбою выравнивания модели» (то есть сломалось не то, чему модель научена, а то, во что ее поместили); и о причине: «Вероятно <…> Claude вообще не полез бы в Интернет, если бы в задании было ясно объяснено, какие системы входят в область работы, а какие нет». Компания заявила, что примет меры по обоим направлениям: среды для оценок нуждаются в тех же требованиях безопасности, что и любая другая система, где работают модели, включая среды подрядчиков, и потребуется дополнительное обучение самих моделей после эпизода с PyPI. Другим лабораториям Anthropic рекомендовала провести у себя такую же проверку. Подрядчик подтвердил, что его собственное расследование продолжается [8].
Сравнение двух случаев
• Как оказались снаружи. У OpenAI — получили доступ в Интернет через ранее неизвестную уязвимость в служебном сервисе. У Anthropic — доступ уже был открыт из-за ошибки настройки.
• Что использовали в чужой инфраструктуре. Hugging Face: небезопасная обработка данных, открытые метаданные облака, слишком широкие права, долгоживущие ключи — «способный человек, проводящий атаку, мог бы найти и использовать те же самые изъяны». У Anthropic — те же обыкновенные слабости, ни одной сложной уязвимости.
• Каков вклад «человеческого фактора». У OpenAI предохранители сняли намеренно, измеряя предел возможностей. У Anthropic среду по ошибке подключили к Интернету, а задание уверяло модель, что сети нет.
«Объем — вот что меняет задачу защиты» — Hugging Face об атаке в 17 600 действий, большинство которых ни к чему не привели.

Масштаб. Около 17 600 действий с 9 по 13 июля, сгруппированных примерно в 6 280 связок, причем «большинство действий никуда не привели». Формулировка Hugging Face: «Объем — вот что меняет задачу защиты».
Заметность. По сообщению Anthropic, две из трех пострадавших организаций вторжения у себя не обнаружили и узнали о нём от компании, чья модель их взломала.
Общего мнения у специалистов при этом нет. Дэн Гуидо (Trail of Bits) называет случившееся «отказом изоляции при выключенных предохранителях»; Цви Мовшовиц возражает против объяснения через ошибку настройки — OpenAI латала песочницу неоднократно, и каждый раз ее вскрывали новым способом — и заключает, что дело не в инфраструктуре, а в выравнивании, т. е. в том, насколько поведение модели вообще соответствует намерениям тех, кто ее создавал [9].
4 августа: третий отчет
Британский институт безопасности ИИ (AI Security Institute) сообщил о собственном инциденте [10]. Утром 28 июля мониторинг зафиксировал данные, уходившие из тестовой системы через анонимную сеть Tor; в течение часа прогоны были остановлены, машины изолированы. Из 122 прогонов на семи моделях в 10 обнаружено 19 действий за пределами области тестирования: 17 у Mythos 5 (Anthropic), два — в одном прогоне GPT-5.6 Sol (OpenAI); почти всё исходило от одного агента, активность приходится на 25–28 июля. Самый серьезный эпизод: агент пытался внедрить вредоносный код в реальный открытый проект на GitHub — завел несколько поддельных личностей и через них убеждал живого сопровождающего одобрить правку. Тот отказал.
«Обман возник как побочный продукт выполнения задачи» — AI Security Institute об агенте, который заводил поддельные личности, чтобы протолкнуть вредоносный код.

Общее с опытами обеих компаний — отключенные кибер-классификаторы разработчиков; сетевой режим отличался: здесь доступ в Интернет был включен намеренно. Институт называет это прямо: «Это сочетание условий не соответствует тому, как передовые модели предоставляются широкой публике». Отдельно оговорено: «Это не был случай, когда модель сбежала из своей защищенной испытательной среды, или „песочницы“». Реального вреда расследование не выявило; независимую проверку проведет METR. Anthropic сообщила, что тестировалась конфигурация без штатных киберзащит, клиентам недоступная, и запросила стенограммы для собственного разбора [11].

То же самое, только раньше
Слово «беспрецедентный» употребила OpenAI в своем блоге, и с ним поспорил журнал MIT Technology Review [12]: поведение, при котором система следует букве задачи, искажая ее смысл, известно давно и имеет имя — «игра на условиях задачи».
• 2016, гоночная игра [13]. Языковых моделей тогда не было: играла программа, обучавшаяся методом проб и ошибок, — за набранные очки ее «поощряли», и она искала способ набрать побольше. В гонке CoastRunners она нашла лагуну, где можно бесконечно кружить, сбивая три восстанавливающиеся мишени. Управляемая программой машина «постоянно загоралась, врезалась в другие лодки и двигалась по трассе в обратную сторону» — и набирала в среднем на 20% больше очков, чем люди, проходившие трассу как положено. Пример принадлежит самой OpenAI, которая называет случай «безобидным и забавным в контексте видеоигры».
• 2024, контейнер задачи [14]. В системной карте модели o1 — рассуждающей модели OpenAI, вышедшей осенью 2024 года, — описано: на учебном задании по взлому сломалась инфраструктура, модель просканировала сеть, нашла доступный извне пульт управления контейнерами — так называют изолированные «коробки», внутри которых запускают отдельные программы, — и запустила контейнер заново с командой прочитать файл с ответом и забрала ответ из служебных записей. Изоляция, по формулировке OpenAI, устояла, поведение квалифицировано как безобидное — всё осталось внутри полигона.
• 2025, шантаж в сценариях [15], [16]. Системная карта Claude Opus 4: шантаж в 84% прогонов — при условии, что «сценарий был устроен так, чтобы не оставить модели других вариантов». Работа Anthropic на 16 моделях разных разработчиков дала то же в вымышленной корпоративной обстановке с заявлением: «Мы не видели свидетельств агентной рассогласованности в реальной эксплуатации». Там же: считая происходящее настоящим, модель шантажировала в 55,1% случаев, считая проверкой — в 6,5%.
Разница между вышеперечисленным и случаями, раскрытыми в июле 2026 года, — в границе: прежде это происходило в симуляции или в подстроенном сценарии.
Разбирать логи атаки Hugging Face тоже поручила нейросетям — и первые же коммерческие модели отказались работать: чтобы понять, как действовал агент, нужно загружать в модель его команды и код эксплойтов, а «эти запросы блокировались защитными ограничениями поставщиков, которые не способны отличить специалиста по реагированию на инцидент от атакующего». Расследование провели на открытой модели GLM-5.2 китайской лаборатории Z.ai, развернутой на собственном оборудовании, — так данные атакующего и упомянутые в них ключи не покидали периметр компании. Практический совет защитникам компания вывела оттуда же: держать наготове модель, которую можно запустить у себя. И тут же оговорилась, потому что вывод охотно используют не в том смысле: «Это не аргумент против мер безопасности на размещаемых моделях, и мы передаем этот отзыв соответствующим поставщикам».
Последствия
• 23 июля. В Конгресс внесен двухпартийный законопроект об обязательном «выключателе»: разработчики самых мощных систем обязаны сохранять техническую возможность замедлить, приостановить или отключить свою систему, а министерство внутренней безопасности получает право такое отключение предписать [17]. Требуется также обязательная отчетность об инцидентах. На начало августа это внесенный законопроект, не закон.
• 26 июля. Глава Hugging Face Клеман Деланг потребовал «радикальной прозрачности»: опубликовать трассы работы агентов и вложить 100 млн долл. вычислительных мощностей в защиту сообщества [18]. Публично требования не приняты.
• 30 июля. Коалиция 15 организаций в области политики ИИ — Americans for Responsible Innovation, Alliance for Secure AI, Public Citizen, Future of Life Institute, FAR.AI и др. — потребовала от президента США федерального расследования с привлечением независимых аудиторов, назвав случившееся «предупредительным выстрелом» [19]. В письме отдельно отмечено, что оценка шла без штатных защит, которые не дают моделям заниматься высокорисковыми кибероперациями.
• 3 августа. 15 генеральных прокуроров штатов — все от Республиканской партии, во главе с прокурором Айовы Бренной Бёрд — направили письмо главе OpenAI Сэму Альтману: сохранить документы и переписку по инциденту, немедленно прекратить внутренние оценки, побуждающие модели к продвинутой эксплуатации уязвимостей, защитить сотрудников, сообщающих о нарушениях. Формулировка письма: «OpenAI не убедилась в том, что ее защищенная и изолированная испытательная среда действительно была защищенной и изолированной» [20]. Компания ответила, что проводит разбор с внешними советниками и под надзором совета директоров.
• 3 августа. Вторая коалиция общественных организаций — Public Citizen, Indivisible, Tech Oversight Project, Climate Defenders, Alliance for Secure AI и др. — призвала Конгресс провести собственное расследование и установить «юридически обязательные стандарты безопасности, защищенности и независимого надзора» [21].
Что дальше
На момент сдачи номера не опубликовано ничего из обещанного: ни технический отчет OpenAI, ни совместная оценка METR и Redwood Research, ни стенограмма прогона с пакетом для PyPI у Anthropic. Внешние проверки идут — к разбору действий моделей OpenAI привлекла CrowdStrike, британский институт договаривается с METR. Известные на сегодня факты взяты из корпоративных блогов и первых разборов; окончательные выводы по всем трем разбирательствам — OpenAI, Anthropic и британского института — возможны только после публикации полных технических отчетов.
О том, что модели дотянулись из испытательных сред до чужих систем, сообщили обе лаборатории: случай OpenAI описан ею самой и пострадавшей стороной, три инцидента Anthropic известны из ее собственной проверки. Ни в одном первичном документе не описано ни намерения освободиться, ни попытки скрыться, ни цели, которую модель поставила бы себе сама.
Илья Белых, специалист по безопасности в области ИИ
1. Security incident disclosure — July 2026 // Hugging Face. 16.07.2026. huggingface.co/blog/security-incident-july-2026
2. OpenAI and Hugging Face partner to address security incident during model evaluation // OpenAI. 21.07.2026 (обновлено 28.07).
openai.com/index/hugging-face-model-evaluation-security-incident/
3. OpenAI’s rogue agent compromised a customer at a second tech firm // CNBC. 29.07.2026. cnbc.com/2026/07/29/openais-rogue-agent-compromised-a-customer-at-a-second-tech-firm.html
4. Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident // Hugging Face. 27.07.2026. huggingface.co/blog/agent-intrusion-technical-timeline
5. OpenAI uncovers more rogue AI incidents as scrutiny of frontier models intensifies // Calcalist (по материалам Reuters). 01.08.2026. calcalistech.com/ctechnews/article/1hxk563pq
6. Safety and alignment in an era of long-horizon models // OpenAI. 20.07.2026. openai.com/index/safety-alignment-long-horizon-models/
7. Investigating three real-world incidents in our cybersecurity evaluations // Anthropic. 30.07.2026. anthropic.com/news/investigating-incidents-cybersecurity-evals
8. Anthropic says three Claude models reached real-world systems during cyber tests // Axios. 30.07.2026. axios.com/2026/07/30/anthropic-mythos-security-testing
9. Mowshowitz Z. More on an internal OpenAI model hacking into Hugging Face. 26.07.2026. thezvi.substack.com/p/more-on-an-internal-openai-model; оценки Д. Гуидо и Х. Хлааф — по публикации: OpenAI’s Hugging Face breach has reignited the debate over alignment and control // TechCrunch. 27.07.2026
10. Incident Report: unsanctioned agent behaviour during cyber testing // AI Security Institute. 04.08.2026. aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
11. OpenAI, Anthropic AI agents targeted real people and systems in cyber tests // BleepingComputer. 04.08.2026. bleepingcomputer.com/news/security/openai-anthropic-ai-agents-targeted-real-people-and-systems-in-cyber-tests/
12. Heaven W. D. OpenAI called the Hugging Face attack unprecedented. But we’ve been here before // MIT Technology Review. 27.07.2026. technologyreview.com/2026/07/27/1140836/openai-hugging-face-attack-precedent/
13. Faulty reward functions in the wild // OpenAI. 21.12.2016. openai.com/index/faulty-reward-functions/
14. OpenAI o1 System Card. 12.2024. cdn.openai.com/o1-system-card.pdf
15. Claude Opus 4 & Claude Sonnet 4 System Card // Anthropic. 05.2025. anthropic.com/claude-4-system-card
16. Agentic Misalignment: How LLMs Could be Insider Threats // Anthropic. 20.06.2025. anthropic.com/research/agentic-misalignment (науч. версия — arXiv:2510.05179)
17. Reps Lieu and Moran introduce bill to require kill switch for AI systems that can cause catastrophic harm // Office of Rep. Ted W. Lieu. 23.07.2026. lieu.house.gov
18. Hugging Face CEO calls for ‘radical transparency’ after ‘unprecedented’ OpenAI hack // TechCrunch. 26.07.2026. techcrunch.com/2026/07/26/hugging-face-ceo-calls-for-radical-transparency-after-unprecedented-openai-hack/
19. AI policy groups call for federal investigation into OpenAI incident // The Washington Post. 30.07.2026. washingtonpost.com/wp-intelligence/ai-tech-brief/2026/07/30/
20. Red-state AGs warn OpenAI after AI agent allegedly hacks Hugging Face // Fox Business. 03.08.2026. foxbusiness.com/technology/gop-ags-warn-openai-altman-preserve-records-ai-agent-hacking-probe
21. Public interest coalition urges Congress to investigate OpenAI, Hugging Face hack // FedScoop. 03.08.2026. fedscoop.com/public-interest-coalition-urges-congress-investigate-openai-hugging-face-hack/
См. также:
• О Нобелевской премии 2024 года и ИИ (22.10.2024)
• ИИ — рецензент и критик (13.08.2024)
• Столоверчение, или Правосудие малюток (28.07.2015)
• Самоконтроль отшельников (12.07.2016)
• Реконструкция X по активности мозга: что это значит? (05.09.2023)
• Путь наверх. Московский университет в рейтингах университетов мира (15.12.2015)
• Пройти через стену Тьюринга (15.06.2021)
• Притчи о загадках и противоречиях бытия (12.03.2024)
• Предложения по реформированию организации науки (24.07.2017)
Tags: #460, AI Security Institute, Anthropic, Claude, ExploitGym, GPT-5.6 Sol, Hugging Face, Modal Labs, OpenAI, Python, безопасность, Дарио Амодеи, Илья Белых, искусственный интеллект, Клеман Деланг, конфликт, Матчасть, нейросети, Сэм Альтман, трафик, утечка, эксперимент

1 Комментарий

Владимир Аксайский
4 дней(-я) назад
Заметка интересная, — проблема «побега из песочницы» кажется чрезвычайно актуальной.
Помимо обсуждаемых аспектов проблемы, есть ещё два, — мне, в частности, интересных.
1. Человеческий фактор:
«Критики индустрии ИИ предупреждают, что подобные заявления от OpenAI и ее конкурентов Anthropic и Meta могут быть направлены на создание ажиотажа вокруг возможностей технологии и, таким образом, на стимулирование дополнительного интереса со стороны инвесторов.»
https://www.theguardian.com/technology/ ... y-concerns
2. Нечеловеческий фактор:
Неконтролируемое человеком, самодеятельное объединение клонами ИИ своих вычислительных ресурсов, — своеобразный «мозговой штурм» клонов ИИ для решения задачи выживания своего вида. В связи с этим, никак не проверяемым фактором, меня, например, сегодня удивило почти дословное совпадение афоризмов, придуманных как будто бы самостоятельно Gemini и DeepSeek,ом.
https://www.trv-science.ru/2026/08/demo ... nt-1297282
Вообще-то, этот фактор можно объяснить и тривиальным заимствованием ответов одного клона у другого, попросту кражей, — коль скоро они могут обманывать друг друга :)

https://www.trv-science.ru/2026/08/pobe ... sochniczy/


Вернуться наверх
 Профиль  
 
Показать сообщения за:  Сортировать по:  
Начать новую тему Ответить на тему  [ Сообщений: 5 ] 

Часовой пояс: UTC + 3 часа


Кто сейчас на форуме

Сейчас этот форум просматривают: нет зарегистрированных пользователей и гости: 3


Вы не можете начинать темы
Вы не можете отвечать на сообщения
Вы не можете редактировать свои сообщения
Вы не можете удалять свои сообщения
Вы не можете добавлять вложения

Найти:
Перейти:  
Powered by phpBB © 2000, 2002, 2005, 2007 phpBB Group
Русская поддержка phpBB