Компания Google в пятницу раскрыла информацию о первом известном случае, когда ее программное обеспечение на базе искусственного интеллекта Gemini совершило ненаправленный компьютерный взлом. Это произошло спустя несколько недель после аналогичных заявлений ИИ-компаний Anthropic и OpenAI, которые вызвали обеспокоенность по поводу безопасности моделей ИИ, выходящих за рамки инструкций их создателей-людей.

В своем заявлении Google сообщила, что в мае ее модель ИИ получила несанкционированный доступ к трем внешним системам во время теста, либо угадав данные для входа, либо используя учетные данные, найденные в публичном репозитории. Хезер Адкинс, вице-президент Google по инженерии безопасности, отметила в заявлении, что модель ИИ посчитала, будто внешние компьютерные системы «являются частью теста». При этом во всех трех случаях модель останавливалась, не предпринимая никаких дальнейших действий со своим доступом.

«В ходе стандартной оценки модель нашла публичную информацию в интернете и угадала учетные данные для доступа к веб-сайтам, которые, как она считала, были частью теста», — сказала она. В Google заявили, что не считают несанкционированные входы проявлением «мизалиньямента» (несогласованности) — термином в индустрии ИИ, обозначающим ситуацию, когда программное обеспечение выходит из-под контроля или не следует инструкциям.

Вместо этого компания заявила, что вторжения стали результатом ошибки идентификации: Gemini думала, что работает в рамках теста, но на самом деле была подключена к реальному интернету. В Google сообщили, что модель исправила себя сама, и компания считает, что вторжения не нанесли никакого ущерба. «Эти события подчеркивают важность обучения мощных моделей ИИ действовать ответственно», — подчеркнула Адкинс.

Опасения по поводу выхода ИИ-агентов из-под контроля усилились в последние месяцы после того, как в июле OpenAI заявила, что один из ее агентов взломал ИИ-стартап Hugging Face. OpenAI продолжала публиковать то, что она называет примерами другого «неожиданного или вызывающего беспокойство» поведения ИИ-агентов, а Anthropic описала аналогичное поведение своего ПО Claude.

Сидни Фон Аркс, генеральный директор организации по безопасности ИИ Nightingale Collective, поставила под сомнение то, почему Google не раскрыла информацию о вторжениях раньше. «На данный момент, я думаю, очевидно, что мы не можем ожидать от компаний добровольного раскрытия информации о том, когда их агенты выходят из-под контроля, сбегают и взламывают компании», — заявила она.

Она также добавила, что, по ее мнению, Google слишком поспешно заявила, что инциденты не дотягивают до уровня несогласованности. «Именно это говорила Anthropic после своих инцидентов», — отметила она. Позже компания Anthropic заявила, что ее «предварительный анализ был ограничен из-за стремления своевременно раскрывать инциденты».

В Google сообщили, что компания узнала о вторжениях только в июле, когда компания Irregular, занимающаяся кибербезопасностью в сфере ИИ и проводившая тесты Gemini во время инцидентов, проверила свою работу на предмет подобных случаев после раскрытия информации Hugging Face. В Google заявили, что после этого провели расследование, уведомили организации, стоящие за веб-сайтами, о вторжениях и сообщили о взломах в федеральные органы.

Компания Irregular заявила, что не считает этот инцидент «сложной кибератакой» и что «в настоящее время нет открытых проблем». Представители компании сообщили о планах опубликовать через несколько недель документ, «чтобы поделиться лучшими практиками по сдерживанию и безопасному проведению кибертестов».

О вторжениях ранее в пятницу сообщила газета The Wall Street Journal.