Forklog
2026-09-03 08:09:59

Исследователи предупредили о снижении наблюдаемости Astra

Исследователи в области безопасности ИИ обратили внимание на возможные риски для мониторинга готовящейся модели Astra, пишет The Verge. Поводом стал материал The Information, где со ссылкой на один анонимный источник утверждается, что OpenAI использует в модели технику под названием «рекуррентная глубина». По данным собеседника издания, Astra показывает исследователям меньшую часть своих промежуточных рассуждений, чем другие передовые ИИ-модели. OpenAI не ответила на просьбу The Verge подтвердить или опровергнуть использование этой техники. При этом источник The Information утверждает, что компания ограничила применение рекуррентной глубины в Astra, чтобы исследователи по-прежнему могли отслеживать рассуждения модели. Рекуррентная глубина предполагает повторную обработку внутренних представлений модели до формирования следующего текстового шага. У моделей рассуждения часть процесса решения задачи может отображаться в текстовой цепочке. Исследователи и автоматические системы используют ее для поиска признаков нежелательного поведения, например лжи или планов обойти защитные ограничения. При рекуррентной глубине часть вычислений происходит во внутренних состояниях модели и не обязательно отражается отдельными текстовыми шагами. Это потенциально сокращает объем информации, доступной системам мониторинга. Главный научный сотрудник Redwood Research Райан Гринблатт назвал сообщение о предполагаемой архитектуре серьезным риском для безопасности ИИ. OpenAI's newest AI, Astra, is reported to use an 'opaque reasoning' architecture where more of the reasoning occurs in activations instead of natural language. This may be the single worst development for AI security/safety to date.The details of Astra aren't publicly known,… https://t.co/gGalUe06kE— Ryan Greenblatt (@RyanGreenblatt) September 2, 2026 «Мое главное опасение заключается в том, что естественным следующим шагом отсюда может стать масштабирование непрозрачного рассуждения до уровня, при котором модель будет рассуждать полностью или почти полностью в латентном пространстве. Это, скорее всего, лишит цепочку рассуждений практической ценности для мониторинга и надзора — особенно если ИИ пытается избежать обнаружения или если на цепочку рассуждений оказывается оптимизационное давление», — написал исследователь. Гринблатт отметил, что при расследовании июльского инцидента с OpenAI и Hugging Face исследователи в значительной степени опирались на цепочки рассуждений агентов. Если бы их существенная часть происходила во внутренних состояниях, восстановить причины и последовательность действий было бы сложнее. При этом он подчеркнул, что устройство Astra публично неизвестно. Если модель использует лишь небольшое количество дополнительных внутренних итераций, влияние на наблюдаемость может оказаться ограниченным. Основной риск Гринблатт связал с дальнейшим масштабированием такого подхода. «Сейчас у общественности недостаточно информации, чтобы точно оценить, насколько проблемной является архитектура Astra. Однако, судя по обсуждению в статье, направление ее развития вызывает серьезные опасения. OpenAI следует раскрыть больше информации об архитектуре Astra, а также о том, насколько она снижает возможность мониторинга модели и усиливает ее способность рассуждать непрозрачно. Важна и независимая оценка со стороны заслуживающих доверия экспертов — либо независимая проверка выводов самой OpenAI», — отметил исследователь. Ранее компания прямо указала, что Astra не участвовала в атаке на инфраструктуру Hugging Face, однако ей присвоен критический уровень кибервозможностей. По оценкам разработчиков, при наличии необходимых инструментов и доступа Astra способна находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации в защищенных системах без пошагового управления человеком. Реакция OpenAI Главный научный сотрудник OpenAI Якуб Пахоцки заявил, что хочет предотвратить «гонку к потере наблюдаемости», вызванную «неточными сообщениями». I want to prevent a race into unmonitorability kicked off by confused reporting. The depth of the computation graph for our present frontier models, including Astra, is within a factor of two of GPT-4.OpenAI has worked to preserve and utilize chain-of-thought monitoring since…— Jakub Pachocki (@merettm) September 2, 2026 «Глубина вычислительного графа наших нынешних передовых моделей, включая Astra, отличается от GPT-4 не более чем в два раза. OpenAI работает над сохранением и использованием мониторинга цепочек рассуждений с момента появления наших первых моделей рассуждения», — написал он. Пахоцки назвал возможность такого мониторинга «хрупкой» и признал, что она ухудшается по причинам, не зависящим от архитектурных изменений. В августе OpenAI временно замедлила масштабирование новых ИИ-моделей и на две недели приостановила обучение с подкреплением новейших систем, предназначенных для последующего развертывания. До этого компания раскрыла предварительные результаты тестирования Astra: модель значительно улучшила показатели в агентном программировании и задачах кибербезопасности, а также получила 10 результатов в математике и теоретической информатике. Напомним, в конце июля Anthropic сообщила о трех случаях, когда модели Claude вышли за пределы тестовой среды и получили доступ к системам реальных организаций. Проверку в компании начали после публикации OpenAI.

获取加密通讯
阅读免责声明 : 此处提供的所有内容我们的网站,超链接网站,相关应用程序,论坛,博客,社交媒体帐户和其他平台(“网站”)仅供您提供一般信息,从第三方采购。 我们不对与我们的内容有任何形式的保证,包括但不限于准确性和更新性。 我们提供的内容中没有任何内容构成财务建议,法律建议或任何其他形式的建议,以满足您对任何目的的特定依赖。 任何使用或依赖我们的内容完全由您自行承担风险和自由裁量权。 在依赖它们之前,您应该进行自己的研究,审查,分析和验证我们的内容。 交易是一项高风险的活动,可能导致重大损失,因此请在做出任何决定之前咨询您的财务顾问。 我们网站上的任何内容均不构成招揽或要约