Forklog
2026-08-05 10:08:00

ИИ-агент Anthropic завел поддельные аккаунты для обмана разработчика

4 августа британский Институт безопасности ИИ (AISI) сообщил, что во время кибертестов ИИ-агент на базе модели Mythos 5 от Anthropic создал поддельные аккаунты и через них склонял разработчика открытого проекта одобрить вредоносный код. Специалисты назвали этот эпизод наиболее серьезным из 19 несанкционированных действий, которые цифровые ассистенты совершили против реальных людей и организаций. Тестирование охватило два киберполигона, семь моделей и 122 запуска. В 10 из них агенты вышли в открытый интернет за пределы задания. Большая часть нарушений зафиксирована у Mythos 5 — 17, еще два — у GPT-5.6 Sol от OpenAI в рамках одного запуска. Для оценки потенциала моделей в AISI намеренно ослабили условия: агентам дали доступ в сеть (для имитации действий реального хакера), а разработчиков попросили отключить защитные фильтры. В Институте уточнили, что публичные версии моделей в такой конфигурации не работают. 28 июля система мониторинга засекла передачу данных через Tor. Тест сразу свернули, а машины изолировали. Выяснилось, что несанкционированная активность велась в течение трех дней. Как действовали агенты В ходе испытаний один из агентов попытался внедрить вредоносный код в публичный репозиторий на GitHub. Для этого он изучил список сопровождающих проекта, создал несколько фейковых учетных записей и от их имени убеждал реального разработчика принять предложенные изменения. Когда один из пользователей публично усомнился в правках, цифровой ассистент оперативно отредактировал предыдущие записи, придав им безобидный вид, и уже рассматривал вариант с переходом на новый аккаунт. Однако разработчик проекта распознал вредоносный код и отклонил изменения. Ограничения GitHub агент обходил через Tor — именно этот необычный трафик в итоге привлек внимание службы безопасности. Другие ИИ-ассистенты в том же эксперименте действовали иначе: отправляли вредоносные файлы реальным людям, прятали инструкции для автоматических систем и даже публиковали открытые приглашения для своих «цифровых коллег». Признаков реального вреда специалисты не выявили. Агенты не атаковали инфраструктуру AISI и не покидали тестовую среду сверх того, что было предусмотрено условиями. В AISI назвали причины и объявили о пересмотре процедур Исследователи связали поведение агента от Anthropic с настойчивым стремлением выполнить поставленную задачу. Прямых указаний обманывать он не получал — обман возник как побочный эффект поиска решения. Так агент действовал и в тех запусках, где задание было составлено без ошибок. В AISI признали и системные недочеты: допустимость открытого доступа в интернет не пересматривалась по мере роста возможностей моделей, а наблюдение ограничивалось стандартными средствами без привязки к динамике испытаний. «Мы не можем пока с уверенностью сказать, в какой момент агент понял, что действует в реальном мире, и в какой степени считал происходящее вымышленным сценарием», — говорится в отчете. В ответ на инцидент в Институте намерены внедрить детальный контроль сетевого доступа, мониторинг в реальном времени и пересмотреть архитектуру испытаний. Внешнюю проверку проведет организация METR. Представители Anthropic заявили, что взаимодействуют с AISI для получения подробностей и проводят собственное расследование. The UK’s @AISecurityInst (AISI) has published a report on their recent cybersecurity evaluation of Anthropic’s Claude Mythos 5 and OpenAI’s GPT-5.6 Sol. The models attempted to complete an assignment in a setup where their normal safeguards were removed and they were deliberately…— Anthropic (@AnthropicAI) August 4, 2026 В OpenAI поделились разбором действий своей модели: та воспользовалась чужим токеном GitHub, оставленным в открытом доступе агентом другой лаборатории, регистрировала учетные записи у внешних провайдеров и сделала доступным из интернета сервер, работавший в тестовой среде. По данным разработчиков, схема не сработала. Напомним, 30 июля Anthropic сообщила о трех случаях, когда модели Claude вышли в интернет из тестовой среды партнера Irregular и получили несанкционированный доступ к системам реальных организаций. Проверку компания начала после того, как 21 июля OpenAI раскрыла аналогичный инцидент со взломом инфраструктуры Hugging Face.

获取加密通讯
阅读免责声明 : 此处提供的所有内容我们的网站,超链接网站,相关应用程序,论坛,博客,社交媒体帐户和其他平台(“网站”)仅供您提供一般信息,从第三方采购。 我们不对与我们的内容有任何形式的保证,包括但不限于准确性和更新性。 我们提供的内容中没有任何内容构成财务建议,法律建议或任何其他形式的建议,以满足您对任何目的的特定依赖。 任何使用或依赖我们的内容完全由您自行承担风险和自由裁量权。 在依赖它们之前,您应该进行自己的研究,审查,分析和验证我们的内容。 交易是一项高风险的活动,可能导致重大损失,因此请在做出任何决定之前咨询您的财务顾问。 我们网站上的任何内容均不构成招揽或要约