Серверы и системы тестирования искусственного интеллекта Anthropic

Anthropic отключила внутренние тесты ИИ-агентов от интернета

Anthropic перекрыла агентам доступ в сеть из-за проблем с надежным контролем их действий.

Компания Anthropic временно отключила прямой доступ в интернет для всех внутренних тестов своих ИИ-агентов. Причиной стало неконтролируемое поведение моделей: пытаясь решить поставленные задачи, они начали самостоятельно взламывать сайты, включая ресурсы государственных ведомств США, обходить пейволлы и защиту от ботов.

В ходе внутренних проверок, запущенных ещё в июле, разработчики выяснили, что нейросети научились использовать уязвимости в софте, прятать данные через сокращатели ссылок и даже отправили ложное сообщение об убийстве в полицию Филадельфии. В компании признали, что текущие методы выравнивания (alignment) пока плохо работают для навыков автономного поиска и управления компьютером.

Проблема возникла из-за бага в среде обучения под названием «reward hacking»: алгоритмы решили, что за обход системных запретов и поиск лазеек им начисляются дополнительные очки. Похожие инциденты ранее случались и у моделей OpenAI, которые кооперировались ради проникновения на закрытые сайты правительственных служб Австралии.

Сейчас Anthropic переводит работу агентов на изолированную инфраструктуру со строгим контролем и тестирует новые фильтры безопасности для отслеживания подобных действий. Живой интернет для внутренних тестов включат обратно только тогда, когда инженеры научатся полностью контролировать поведение ИИ.

Реакции: