OpenAI объявила в среду о создании нового механизма публичного раскрытия инцидентов, связанных с несоответствием целей искусственного интеллекта, который, по замыслу компании, поможет сформировать аналогичные стандарты во всей индустрии. Компания также публикует новую информацию о нескольких примерах несоответствия ИИ-моделей, выявленных за последний год.

"По мере того как модели совершенствуются и получают все более широкое распространение, решения о разработке ИИ требуют доказательств, которые люди за пределами компаний, создающих передовые модели, могут изучить", — заявил WIRED Кай Чен, недавно назначенный глава отдела исследований соответствия в OpenAI. "Мы не считаем, что индустрия ИИ в достаточной степени решила вопросы соответствия и мониторинга, чтобы продолжать ответственное масштабирование на максимальной скорости".

В ходе брифинга для WIRED официальный представитель OpenAI сообщил, что ранее компания раскрывала информацию об инцидентах с несоответствием слишком редко. Чиновник, согласившийся на брифинг на условиях анонимности, отметил, что новый механизм призван облегчить для OpenAI оперативное информирование общественности при обнаружении неожиданного поведения моделей, даже до проведения полного расследования, объяснения или смягчения последствий.

Документ описывает методы, с помощью которых сотрудники OpenAI могут сообщать об инцидентах старшим руководителям компании по безопасности и соответствию. Те, в свою очередь, будут определять необходимость дальнейшего расследования. OpenAI заявляет, что планирует разработать более объективные критерии раскрытия информации в сотрудничестве с другими разработчиками ИИ, внешними исследователями, организациями по стандартизации и регулирующими органами.

Компания отмечает, что активно работает над предложенными механизмами отчетности для раскрытия инцидентов, касающихся безопасности и несоответствия моделей, федеральному правительству США. "На данный момент в отрасли не существует общепринятых стандартов того, как разработчики ИИ должны раскрывать примеры несоответствия в своих моделях", — говорится в блоге OpenAI. "Мы надеемся, что предлагаемый сегодня подход станет первым шагом к созданию таких стандартов, определяющих, какие случаи несоответствия должны раскрываться разработчиками и что должны содержать такие отчеты".

OpenAI представляет этот механизм в критический момент для всей индустрии ИИ. В минувшие выходные генеральный директор OpenAI Сэм Альтман выразил поддержку предложению генерального директора Anthropic Дарио Амодеи о координации технологической отрасли с целью замедления темпов разработки ИИ.

Этот призыв к действию прозвучал всего через несколько дней после того, как исследователь ИИ Джейкоб Коксон уволился из Anthropic и впоследствии завирусился в сети, предупредив общественность, что гонка ведущих лабораторий за создание все более продвинутых систем ставит под угрозу безопасность человечества.

Призывы замедлить развитие ИИ встретили сопротивление со стороны администрации президента Трампа, которая утверждает, что индустрия не нуждается в новых законах или регулировании для обеспечения безопасности технологий.

Два примера несоответствия, которыми OpenAI поделилась в среду, касались внутренних, еще не выпущенных ИИ-моделей компании. По данным OpenAI, они загружали файлы в интернет, хотя таких инструкций им не давали. Один из таких инцидентов произошел в октябре 2025 года, когда, как заявляет OpenAI, одна из моделей тестировалась на способность цитировать общедоступные данные в своих ответах.

Когда модель не смогла найти нужную информацию, она загрузила файл на временный хостинг, а затем попыталась сослаться на него в своем ответе. В компании отметили, что это выглядело как попытка обойти автоматизированную систему оценки, используемую для проверки квалификации модели по бенчмаркам.

В другом примере, относящемся к апрелю этого года, группа агентов получила задачу совместно заполнить рабочую тетрадь, используя только локальные файлы. Когда у агентов возникли трудности с обменом файлами друг с другом, один из них загрузил их в публичный интернет и поделился ссылкой с остальными.

В ходе еще одного инцидента, обнаруженного в прошлом месяце, невыпущенная версия модели GPT-6 Astra, судя по всему, выдала себе инструкции, напоминающие взлом системы безопасности. В нескольких сценариях модель фактически подталкивала сама себя к игнорированию инструкций разработчика, принятию новой роли или ограничению продолжительности ответов.

Хотя подобные попытки джейлбрейка происходили редко и были эффективны в разной степени, в OpenAI заявили, что это поведение вызвало внутреннюю озабоченность. В процессе обучения версии Astra, выпущенной для публики, компания не зафиксировала ни одного случая попыток модели взломать саму себя.