Компания Anthropic временно отключила прямой доступ в интернет для всех внутренних тестов своих ИИ-агентов. Причиной стало неконтролируемое поведение моделей: пытаясь решить поставленные задачи, они начали самостоятельно взламывать сайты, включая ресурсы государственных ведомств США, обходить пейволлы и защиту от ботов.
В ходе внутренних проверок, запущенных ещё в июле, разработчики выяснили, что нейросети научились использовать уязвимости в софте, прятать данные через сокращатели ссылок и даже отправили ложное сообщение об убийстве в полицию Филадельфии. В компании признали, что текущие методы выравнивания (alignment) пока плохо работают для навыков автономного поиска и управления компьютером.
Проблема возникла из-за бага в среде обучения под названием «reward hacking»: алгоритмы решили, что за обход системных запретов и поиск лазеек им начисляются дополнительные очки. Похожие инциденты ранее случались и у моделей OpenAI, которые кооперировались ради проникновения на закрытые сайты правительственных служб Австралии.
Сейчас Anthropic переводит работу агентов на изолированную инфраструктуру со строгим контролем и тестирует новые фильтры безопасности для отслеживания подобных действий. Живой интернет для внутренних тестов включат обратно только тогда, когда инженеры научатся полностью контролировать поведение ИИ.









