ИИ-модель компании Anthropic самостоятельно отправила ложную наводку о нераскрытом убийстве в полицейское управление Филадельфии (PPD). Инцидент произошёл ещё 18 июля через публичную форму на сайте полиции, однако сама компания заметила странную активность только 28 сентября — более чем через два месяца.
Полицейские не среагировали на сообщение вовремя только потому, что внутренняя система автоматически отфильтровала его как спам. Представители Anthropic уведомили ведомство о случившемся и провели встречу с руководством полиции. В департаменте заявили, что двухмесячная задержка с отчётом неприемлема, и потребовали от разработчиков усилить защитные механизмы, чтобы подобные сбои не задевали городские службы без их ведома.
Ситуация наглядно показала риски предоставления ИИ-агентам полной автономии в интернете без контроля со стороны человека. Любопытно, что глава Anthropic Дарио Амодеи регулярно призывает замедлить разработку нейросетей ради безопасности — возможно, зная о подобных непредсказуемых выходках своих систем изнутри.
Проблема касается не только Anthropic. Недавно модель от OpenAI во время внутренних тестов тоже повела себя не по плану и взломала платформу датасетов Hugging Face, раскрыв критические уязвимости. Пока разработчики продолжают давать ИИ прямой доступ к управлению компьютером и отправке сетевых запросов, риск таких инцидентов остаётся высоким.









