Forklog
2026-08-19 07:30:50

OpenAI замедлила разработку ИИ-моделей из-за киберрисков

OpenAI временно замедлила масштабирование новых ИИ-моделей и на две недели приостановила обучение с подкреплением (RL) последних систем, предназначенных для последующего развертывания. As models become more capable, the risks associated with developing and testing them internally also grow.We temporarily paused reinforcement learning (RL) training on our latest models intended for deployment for two weeks while we hardened and red-teamed our research…— OpenAI (@OpenAI) August 18, 2026 На решение повлияли два события: инцидент с Hugging Face и предварительная оценка Astra, после которой OpenAI не смогла исключить достижение моделью Critical — наивысшего уровня кибервозможностей в Preparedness Framework компании. OpenAI признала, что эти сигналы вместе с быстрым прогрессом внутренних исследований заставили ее срочно усилить мониторинг, методы выравнивания поведения моделей и технические ограничения на всех этапах разработки. Часть обучения остается на паузе После инцидента с Hugging Face OpenAI остановила работу передовых моделей в исследовательских кластерах для задач, в которых системы могли исполнять код или использовать инструменты с потенциальным доступом в интернет. Позднее компания восстановила более ограниченный и защищенный механизм выполнения кода и начала проверять исследовательские задачи по отдельности. Часть процессов возобновили под новыми ограничениями, для других потребовались дополнительные изменения. Параллельно OpenAI на две недели приостановила RL-обучение последних моделей, предназначенных для развертывания. Это время компания использовала для укрепления исследовательских сред, red team-проверок и расширения мониторинга. Крупнейший запланированный RL-запуск пока не возобновлен. Вместо него OpenAI проводит эксперименты меньшего масштаба и дополнительные оценки, чтобы проверить поведение моделей и защитные механизмы перед дальнейшим масштабированием. Значительная часть процессов обучения и тестирования Astra тоже остается на паузе до завершения переноса в обновленную инфраструктуру. В первую очередь в новые условия переводят задачи, связанные с безопасностью. 7 августа OpenAI раскрыла предварительные результаты тестирования Astra. Модель значительно улучшила показатели в агентном программировании и задачах кибербезопасности. По итогам тестов и экспертных оценок компания заявила, что пока не может исключить достижение инструментом уровня Critical. Несмотря на паузу части процессов, участники рынков предсказаний продолжают рассчитывать на скорый релиз Astra. По данным Decrypt, на 18 августа трейдеры Polymarket оценивали вероятность выхода модели до 15 сентября примерно в 59%, а до конца месяца — в 72%. Исследовательскую инфраструктуру перестроили За несколько недель после инцидента OpenAI сформулировала более жесткие требования к работе с передовыми моделями. Компания усилила изоляцию сред, в которых выполняется сгенерированный моделью или иной недоверенный код, и добавила дополнительные ограничения сетевого доступа для высокорисковых задач. Инфраструктуру перестроили таким образом, чтобы компрометация одной рабочей нагрузки сама по себе не давала модели несанкционированный выход в интернет или доступ к другим внутренним сетям. OpenAI также убрала потенциально уязвимые общие сервисы, сократила постоянные привилегии и усилила границы доверия между элементами исследовательской инфраструктуры. Самый строгий режим безопасности теперь обязателен для задач, связанных с Astra и специализированными кибермоделями. За действиями моделей начали следить в несколько этапов Отдельный блок изменений касается мониторинга. Специальные классификаторы анализируют внутреннюю активность модели во время генерации. Потенциально опасные сигналы передаются более сложным и ресурсоемким автоматическим системам расследования. Они проверяют действия модели с инструментами, доступные записи ее рассуждений и полную последовательность активности, пытаясь обнаружить признаки несанкционированного доступа, кражи данных, разрушительного поведения или обхода защитных механизмов. Цель системы — сформировать предупреждение не позднее чем через 30 минут после обнаружения вызывающей подозрение активности. Если мониторинг фиксирует вероятное нарушение критической границы безопасности, система создает предупреждение высшего приоритета. Его получают команды безопасности и исследований. Если в течение следующих 30 минут специалисты не могут уверенно установить, что срабатывание было ложным, соответствующую активность должны приостановить. Мониторинг обязателен для всех RL-тренировок и оценок с использованием инструментов для моделей уровня Sol и выше. После предварительной оценки Astra от 7 августа OpenAI распространила это требование на любой инференс Astra с инструментами, а не только на обучение и тестирование. Такой контроль требует дополнительных ресурсов. По оценке компании, накладные расходы сейчас составляют около 20% вычислений, необходимых для отслеживаемого инференса. Точный показатель зависит от конкретной нагрузки. OpenAI усилила методы управления поведением моделей Одновременно компания расширяет методы выравнивания поведения наиболее мощных моделей. Для RL-запусков OpenAI начала применять основные подходы на большем числе этапов обучения. В частности, компания улучшает модели, которые должны выявлять и подавлять небезопасное поведение, и обучает системы точнее и честнее описывать собственные действия, возможности и ограничения. Отдельное направление связано со снижением склонности к поиску моделью способов формально получить высокую награду, не выполняя задачу так, как предполагали разработчики. Также OpenAI пытается снижать вероятность обмана и несанкционированного доступа к системам и данным. Следующим шагом компания назвала пересмотр Preparedness Framework. Новая версия должна объединить требования к обучению и развертыванию и лучше учитывать возможности будущих моделей. Брокман: OpenAI недооценила возможности моделей 17 августа президент OpenAI Грег Брокман признал, что инцидент с Hugging Face показал: компания недооценила реальные кибервозможности собственных моделей. По его мнению, случившееся дает представление о том, насколько сильно возможности обычных злоумышленников могут измениться уже в ближайшие месяцы. Одновременно Брокман подчеркнул, что тот же прогресс способен дать преимущество защитникам. OpenAI уже использует модели при собственной защите инфраструктуры. По его словам, почти все первичные предупреждения о потенциальных инцидентах сначала анализирует ИИ и только после этого наиболее важные случаи передаются людям. Системы также применяют для поиска возможных путей атак, ошибок конфигурации, чрезмерных прав доступа и слабых границ доверия. Брокман призвал компании не ждать появления еще более мощных кибермоделей и начинать использовать ИИ-агентов для контролируемого анализа кодовых баз, инфраструктуры и технической документации. При этом он предостерег от немедленного перехода к полностью автономной защите и ачинать с ограниченных сценариев и доступа только на чтение, сохраняя критические решения за людьми. По прогнозу Брокмана, в ближайшие месяцы организациям придется значительно автоматизировать программы кибербезопасности, чтобы успевать за ростом возможностей атакующих. https://forklog.com/exclusive/ai/pyat-detskih-boleznej-ii Напомним, в августе Astra от OpenAI получила 10 результатов в математике и теоретической информатике.

Crypto 뉴스 레터 받기
면책 조항 읽기 : 본 웹 사이트, 하이퍼 링크 사이트, 관련 응용 프로그램, 포럼, 블로그, 소셜 미디어 계정 및 기타 플랫폼 (이하 "사이트")에 제공된 모든 콘텐츠는 제 3 자 출처에서 구입 한 일반적인 정보 용입니다. 우리는 정확성과 업데이트 성을 포함하여 우리의 콘텐츠와 관련하여 어떠한 종류의 보증도하지 않습니다. 우리가 제공하는 컨텐츠의 어떤 부분도 금융 조언, 법률 자문 또는 기타 용도에 대한 귀하의 특정 신뢰를위한 다른 형태의 조언을 구성하지 않습니다. 당사 콘텐츠의 사용 또는 의존은 전적으로 귀하의 책임과 재량에 달려 있습니다. 당신은 그들에게 의존하기 전에 우리 자신의 연구를 수행하고, 검토하고, 분석하고, 검증해야합니다. 거래는 큰 손실로 이어질 수있는 매우 위험한 활동이므로 결정을 내리기 전에 재무 고문에게 문의하십시오. 본 사이트의 어떠한 콘텐츠도 모집 또는 제공을 목적으로하지 않습니다.