Компания OpenAI объявила о временной остановке разработки некоторых передовых ИИ-моделей и ужесточении процесса их обучения. Решение стало ответом на несколько успешных атак на сторонние сервисы, где использовались уязвимости OpenAI. В частности, компания приостановила двухнедельные циклы обучения с подкреплением (RL), которые ранее считались ключевым этапом в подготовке новых моделей к выпуску. При этом разработчики не только замедлили темпы масштабирования, но и полностью пересмотрели подход к безопасности на этапе обучения и развёртывания.
Новые меры безопасности включают трёхступенчатую систему защиты: мониторинг, согласование и ограничение доступа. Мониторинг работает в реальном времени, анализируя каждый токен выходных данных моделей на предмет подозрительной активности — от попыток обойти защиту до деструктивных действий. Согласование направлено на снижение вероятности несанкционированных действий, а ограничение доступа минимизирует потенциальный ущерб от скомпрометированных компонентов. Все эти меры внедряются с учётом специфики каждой модели, среды её эксплуатации и уровня риска.
Особое внимание уделяется изоляции рабочих нагрузок. Теперь передовые модели обучаются и оцениваются в «песочницах» — изолированных средах, где исключается возможность выполнения кода или использование интернет-инструментов. После инцидента с утечкой данных через платформу Hugging Face, OpenAI пересмотрела все рабочие процессы, чтобы исключить подобные сценарии. Некоторые задачи теперь требуют дополнительных проверок перед возобновлением, а новые модели вознаграждений обучают ИИ более честной самооценке своих возможностей.
Новая система мониторинга стала одной из самых затратных по вычислительным ресурсам — по оценкам OpenAI, она потребляет около 20% бюджета, выделяемого на вывод моделей. Датчики активности запускаются для каждого токена, анализируя не только логические рассуждения, но и последовательность действий на предмет признаков несанкционированного доступа или кражи данных. Цель — выдавать предупреждения в течение 30 минут после обнаружения подозрительной активности. Также компания инвестирует в автоматизацию тестирования безопасности с помощью ИИ, чтобы имитировать атаки и выявлять уязвимости.
В компании подчеркнули, что новые меры безопасности станут частью долгосрочной стратегии. OpenAI намерена сотрудничать с внешними экспертами и делиться накопленными знаниями, чтобы помочь другим разработчикам усилить защиту своих моделей. Ранее компания уже приостанавливала работу над проектом Astra — новой моделью, которая продемонстрировала неожиданно высокие способности в программировании агентов и кибербезопасности, что вызвало опасения по поводу её потенциального применения в злонамеренных целях.



