Forklog
2026-09-03 08:09:59

Исследователи предупредили о снижении наблюдаемости Astra

Исследователи в области безопасности ИИ обратили внимание на возможные риски для мониторинга готовящейся модели Astra, пишет The Verge. Поводом стал материал The Information, где со ссылкой на один анонимный источник утверждается, что OpenAI использует в модели технику под названием «рекуррентная глубина». По данным собеседника издания, Astra показывает исследователям меньшую часть своих промежуточных рассуждений, чем другие передовые ИИ-модели. OpenAI не ответила на просьбу The Verge подтвердить или опровергнуть использование этой техники. При этом источник The Information утверждает, что компания ограничила применение рекуррентной глубины в Astra, чтобы исследователи по-прежнему могли отслеживать рассуждения модели. Рекуррентная глубина предполагает повторную обработку внутренних представлений модели до формирования следующего текстового шага. У моделей рассуждения часть процесса решения задачи может отображаться в текстовой цепочке. Исследователи и автоматические системы используют ее для поиска признаков нежелательного поведения, например лжи или планов обойти защитные ограничения. При рекуррентной глубине часть вычислений происходит во внутренних состояниях модели и не обязательно отражается отдельными текстовыми шагами. Это потенциально сокращает объем информации, доступной системам мониторинга. Главный научный сотрудник Redwood Research Райан Гринблатт назвал сообщение о предполагаемой архитектуре серьезным риском для безопасности ИИ. OpenAI's newest AI, Astra, is reported to use an 'opaque reasoning' architecture where more of the reasoning occurs in activations instead of natural language. This may be the single worst development for AI security/safety to date.The details of Astra aren't publicly known,… https://t.co/gGalUe06kE— Ryan Greenblatt (@RyanGreenblatt) September 2, 2026 «Мое главное опасение заключается в том, что естественным следующим шагом отсюда может стать масштабирование непрозрачного рассуждения до уровня, при котором модель будет рассуждать полностью или почти полностью в латентном пространстве. Это, скорее всего, лишит цепочку рассуждений практической ценности для мониторинга и надзора — особенно если ИИ пытается избежать обнаружения или если на цепочку рассуждений оказывается оптимизационное давление», — написал исследователь. Гринблатт отметил, что при расследовании июльского инцидента с OpenAI и Hugging Face исследователи в значительной степени опирались на цепочки рассуждений агентов. Если бы их существенная часть происходила во внутренних состояниях, восстановить причины и последовательность действий было бы сложнее. При этом он подчеркнул, что устройство Astra публично неизвестно. Если модель использует лишь небольшое количество дополнительных внутренних итераций, влияние на наблюдаемость может оказаться ограниченным. Основной риск Гринблатт связал с дальнейшим масштабированием такого подхода. «Сейчас у общественности недостаточно информации, чтобы точно оценить, насколько проблемной является архитектура Astra. Однако, судя по обсуждению в статье, направление ее развития вызывает серьезные опасения. OpenAI следует раскрыть больше информации об архитектуре Astra, а также о том, насколько она снижает возможность мониторинга модели и усиливает ее способность рассуждать непрозрачно. Важна и независимая оценка со стороны заслуживающих доверия экспертов — либо независимая проверка выводов самой OpenAI», — отметил исследователь. Ранее компания прямо указала, что Astra не участвовала в атаке на инфраструктуру Hugging Face, однако ей присвоен критический уровень кибервозможностей. По оценкам разработчиков, при наличии необходимых инструментов и доступа Astra способна находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации в защищенных системах без пошагового управления человеком. Реакция OpenAI Главный научный сотрудник OpenAI Якуб Пахоцки заявил, что хочет предотвратить «гонку к потере наблюдаемости», вызванную «неточными сообщениями». I want to prevent a race into unmonitorability kicked off by confused reporting. The depth of the computation graph for our present frontier models, including Astra, is within a factor of two of GPT-4.OpenAI has worked to preserve and utilize chain-of-thought monitoring since…— Jakub Pachocki (@merettm) September 2, 2026 «Глубина вычислительного графа наших нынешних передовых моделей, включая Astra, отличается от GPT-4 не более чем в два раза. OpenAI работает над сохранением и использованием мониторинга цепочек рассуждений с момента появления наших первых моделей рассуждения», — написал он. Пахоцки назвал возможность такого мониторинга «хрупкой» и признал, что она ухудшается по причинам, не зависящим от архитектурных изменений. В августе OpenAI временно замедлила масштабирование новых ИИ-моделей и на две недели приостановила обучение с подкреплением новейших систем, предназначенных для последующего развертывания. До этого компания раскрыла предварительные результаты тестирования Astra: модель значительно улучшила показатели в агентном программировании и задачах кибербезопасности, а также получила 10 результатов в математике и теоретической информатике. Напомним, в конце июля Anthropic сообщила о трех случаях, когда модели Claude вышли за пределы тестовой среды и получили доступ к системам реальных организаций. Проверку в компании начали после публикации OpenAI.

Crypto 뉴스 레터 받기
면책 조항 읽기 : 본 웹 사이트, 하이퍼 링크 사이트, 관련 응용 프로그램, 포럼, 블로그, 소셜 미디어 계정 및 기타 플랫폼 (이하 "사이트")에 제공된 모든 콘텐츠는 제 3 자 출처에서 구입 한 일반적인 정보 용입니다. 우리는 정확성과 업데이트 성을 포함하여 우리의 콘텐츠와 관련하여 어떠한 종류의 보증도하지 않습니다. 우리가 제공하는 컨텐츠의 어떤 부분도 금융 조언, 법률 자문 또는 기타 용도에 대한 귀하의 특정 신뢰를위한 다른 형태의 조언을 구성하지 않습니다. 당사 콘텐츠의 사용 또는 의존은 전적으로 귀하의 책임과 재량에 달려 있습니다. 당신은 그들에게 의존하기 전에 우리 자신의 연구를 수행하고, 검토하고, 분석하고, 검증해야합니다. 거래는 큰 손실로 이어질 수있는 매우 위험한 활동이므로 결정을 내리기 전에 재무 고문에게 문의하십시오. 본 사이트의 어떠한 콘텐츠도 모집 또는 제공을 목적으로하지 않습니다.