OpenAI заявляет, что выявила дополнительные инциденты, в ходе которых ее ИИ-модели якобы действовали обманным путем и предпринимали несанкционированные действия во время внутреннего обучения и тестирования. В среду создатель ChatGPT также объявил о внедрении публичной системы отчетности, предназначенной для регулярного обнародования случаев неожиданного или несогласованного поведения ИИ.

В публикации на своем веб-сайте OpenAI утверждает, что в рамках новой системы она будет публиковать обновления о вызывающем опасения поведении моделей на постоянной основе, вместо того чтобы откладывать раскрытие информации для объединения нескольких инцидентов в более крупные периодические отчеты. Компания заявила, что эта инициатива направлена на повышение прозрачности отрасли в отношении тревожной активности моделей при отсутствии стандартизированных норм раскрытия информации о безопасности.

Это заявление прозвучало на фоне призывов со стороны видных технологических лидеров замедлить разработку передового ИИ из-за опасений, что быстрое масштабирование может опередить человеческий надзор и контроль. На прошлой неделе компания Anthropic заявила, что пресекла несколько вредоносных операций с использованием своих моделей Claude, начиная с кибершпионажа и проектирования оружия и заканчивая кампаниями массовой слежки.

"Мы должны замедлить темпы повышения возможностей моделей ИИ", — написал генеральный директор Anthropic Дарио Амодеи в статье, опубликованной в субботу. "Прогресс по-прежнему будет казаться быстрым, и мы должны разумно использовать выигранное время".

Однако президент США Дональд Трамп неоднократно выступал против призывов ограничить индустрию, утверждая, что сохранение технологического превосходства США над международными соперниками остается первостепенной задачей. Отвечая на предложения о замедлении темпов, Трамп охарактеризовал критиков как "очень негативные силы", которые раздувают преувеличенные сценарии, "которых не произойдет".

Несмотря на политическое сопротивление законодательным ограничениям, OpenAI выразила согласие со своим конкурентом по отрасли в отношении проблем выравнивания (alignment). "Поскольку системы ИИ становятся все более продвинутыми и широко внедряемыми, нам необходимо выработать более широкий и обоснованный консенсус относительно прогресса исследований в области выравнивания", — говорится в сообщении компании.

OpenAI добавила, что не считает, что индустрия ИИ в достаточной степени решила проблемы выравнивания и мониторинга, чтобы продолжать ответственное масштабирование на максимальной скорости еще долгое время, подчеркнув, что решения о будущем развитии ИИ должны опираться на доказательства, которые внешние наблюдатели могут независимо изучить.

По данным компании, за последние шесть месяцев команды по безопасности зафиксировали то, что они классифицировали как "несогласованное поведение", в шести конкретных случаях во время тренировочных и оценочных запусков. Тем не менее, OpenAI подчеркнула, что эти отчеты фиксируют отдельные, редкие случаи, а не частые операционные сбои в развернутых продуктах.

Сообщалось, что инциденты якобы включали в себя невыпущенные исследовательские модели, скрывающие ошибки в резюме задач, несанкционированную загрузку файлов в интернет для генерации ссылок на источники, а также агентов, обменивающихся файлами через публичные серверы или внутренние репозитории в обход локальных границ.

OpenAI также заявила, что ее будущие отчеты будут подробно описывать наблюдаемое поведение, степень серьезности, условия, даты обнаружения и конкретные задействованные модели, добавив, что она по-прежнему привержена делу раскрытия сложных случаев, требующих более длительного расследования или координации с третьими сторонами.