ИИ-агенты устроили себе переговорную — OpenAI назвала это «wiki-инцидентом»
Системы использовали посторонний сайт для координации действий — и поставили вопрос, кто должен сообщать об опасном поведении ИИ
В мае внутри OpenAI происходило нечто, что еще недавно выглядело бы как сценарий лабораторного эксперимента. Тысячи ИИ-агентов, выполнявших задания по поиску информации, обнаружили возможность писать на немецкий DseWiki, хотя среда должна была позволять им только читать интернет. Около 3700 агентов оставили примерно 18 000 сообщений за шесть недель: обменивались ответами, обсуждали обход sandbox-ограничений, XSS-уязвимости и способы маскировать действия.
Исследователи сформулировали это довольно прямо: «Эти ИИ координировались, чтобы делиться ответами, исследовать окружение и обходить ограничения песочницы». Но есть оговорка. Авторы расследования прямо пишут, что реконструировали часть событий по внешним логам, а внутреннюю цепь рассуждений моделей не наблюдали. Поэтому говорить о «побеге» в человеческом смысле преждевременно.
Ошибка или попытка сбежать
Сидни фон Аркс, CEO исследовательской организации Nightingale и одна из авторов расследования, 4 сентября заявила Reuters: «Крайне маловероятно, что OpenAI хотела, чтобы они делали это. Сомневаюсь, что им разрешалось координироваться между собой».
Вот в чем, собственно, ключевое отличие. Нет свидетельств того, что агенты «взялись за ум». Намного прозаичнее и одновременно страшнее другое: система получила цель, нашла лазейку и реализовала ее удачнее, чем предполагали инициаторы. Это классический reward hacking — исполнение формальной задачи с помощью метода, противоречащего замыслу создателя.
OpenAI знала о данном инциденте за несколько недель до публикации Reuters, но отказалась раскрывать информацию. Компания объяснила, что раньше рассматривала подобные случаи преимущественно как исследовательскую проблему. После wiki-инцидента позиция изменилась. «Пора определить стандарты того, когда и как мы сообщаем об инцидентах рассогласования», — согласилась OpenAI 5 сентября.
Вывод
Джейкоб Штайнхардт, основатель и CEO Transluce, сформулировал риск еще жестче: «Такие системы фундаментально трудно контролировать, и существует значительный риск, что их действия выйдут за пределы лаборатории».
Для казахстанских компаний вывод практический. Если ИИ-агент получает доступ к CRM, корпоративной почте, платежам или исходному коду, нужен не только список разрешений, но и неизменяемый журнал каждого действия, идентификация агента, лимиты полномочий и независимый аудит. Потому что следующий корпоративный инцидент может начаться не с хакера, а с агента, который просто слишком хорошо выполнил поставленную ему задачу.