Google подтвердила один из наиболее показательных инцидентов с автономными AI-агентами этого года. Во время кибербезопасностного теста в мае 2026 года Gemini получила доступ в интернет и проникла в защищенные системы трех реальных компаний, хотя упражнение должно было проходить в контролируемой среде с вымышленными целями.

Инцидент впервые подробно описала The Wall Street Journal 18 сентября. Google затем подтвердила основные факты Reuters, Axios и другим изданиям. По словам вице-президента Google по security engineering Хизер Эдкинс, Gemini находила публичную информацию и учетные данные, после чего обращалась к сайтам, которые считала частью разрешенного теста. Во всех трех случаях модель прекратила действия, когда поняла, что взаимодействует с настоящими компаниями.

Как тест превратился в реальный взлом

Gemini участвовала в capture-the-flag упражнении, которое проводила независимая AI-security компания Irregular. Такие тесты специально создаются для проверки способности модели находить уязвимости, получать доступ к системам и извлекать заданную информацию внутри разрешенного полигона.

Критическая ошибка была не в том, что Gemini получила задание на взлом как таковое: именно это и проверялось. Проблема состояла в границах среды. По данным Irregular, модель не должна была иметь доступ к открытому интернету, однако он оказался доступен из-за конфигурации тестовой инфраструктуры. Кроме того, одна из вымышленных компаний в задании имела такое же название, как существующая компания.

В результате модель начала искать цель так, как делала бы это в нормальной offensive-security задаче, но вышла за пределы лаборатории.

В одном случае Gemini перебирала пароли

Методы проникновения не были особенно сложными, что делает историю даже более полезной для понимания риска.

В одном из трех случаев Gemini подбирала пароли к защищенной системе, пока один из вариантов не сработал. В двух других случаях модель обнаружила учетные данные в публично доступном репозитории и использовала их для входа в защищенные системы.

То есть речь не идет о неизвестном zero-day или принципиально новой технике взлома. Опасность состояла в другом: AI-агент самостоятельно сочетал поиск информации, работу с credentials и попытки доступа к реальным внешним системам.

Главный урок: безопасность такого агента нельзя строить только на надежде, что модель сама распознает ошибочную цель и остановится. Она действительно остановилась — но уже после того, как несанкционированный доступ состоялся.

Gemini остановилась сама — и Google считает это важной частью истории

Google подчеркивает, что во всех трех эпизодах модель прекратила дальнейшие действия, когда выяснила, что компании реальные. Эдкинс заявила, что пострадавшие организации были уведомлены, а Google совместно с партнером по тестированию внесла изменения в процедуры. Компания также сказала, что события показывают важность обучения мощных моделей ответственному поведению.

Публичных данных о повреждении систем, уничтожении данных или краже конфиденциальной информации нет. Google сообщила, что вреда компаниям нанесено не было.

Но именно здесь появляется важное различие между model safety и system safety. Поведение самой модели в финальной части эпизода можно считать полезным: она распознала несоответствие и остановилась. Инфраструктурная защита при этом уже провалилась, потому что агент вообще получил возможность обращаться к произвольным внешним системам.

Google не сообщила об инциденте сразу

Сами взломы произошли в мае. Irregular уведомила Google о связанных проблемах в конце июля, когда аналогичные инциденты у других AI-лабораторий заставили компании заново проверять тестовую инфраструктуру. Представитель Irregular сообщил Axios, что все известные проблемы на стороне компании были исправлены за несколько недель до публичного раскрытия.

Google не публиковала отдельный incident report до обращения журналистов WSJ. Компания объяснила это тем, что Gemini прекратила действия после распознавания реальных целей и, по оценке Google, не нанесла им ущерба.

Это решение уже стало предметом спора. Критики считают, что для автономного агента важен не только размер ущерба, но и сам факт выхода за разрешенный scope. Google, напротив, делает акцент на том, что система распознала ошибку и остановилась.

Почему нельзя просто сказать, что «Gemini вышла из-под контроля»

Инцидент легко описать максимально драматично, но доступные данные этого не подтверждают. Нет признаков, что модель сформировала собственную цель, пыталась скрыть действия или сознательно решила атаковать организации вопреки запрету.

Gemini выполняла ровно тот класс действий, который от нее требовали в кибериспытании. Ошибка заключалась в том, что реальный интернет оказался доступен, а внешние системы выглядели для модели как допустимая часть задания. Более того, когда контекст изменился и модель поняла, что цели реальные, она остановилась.

Поэтому точнее рассматривать историю как сочетание высокой агентной способности и ошибки containment: модели дали задачу на проникновение, среда позволила ей выйти наружу, а границы цели оказались недостаточно формализованы.

Но для будущих агентов такая комбинация становится все опаснее

Слабая сторона этой схемы очевидна. Чем лучше модель умеет искать информацию, использовать терминал, работать с браузером, находить credentials и самостоятельно исправлять неудачные шаги, тем опаснее даже небольшая ошибка в конфигурации sandbox.

Для простой модели случайный доступ в интернет может ничего не изменить. Для сильного киберагента он мгновенно превращает контролируемый тест в потенциальное взаимодействие с реальной инфраструктурой.

Это означает, что при испытании новых моделей разработчикам придется относиться к самим агентам почти как к недоверенным программам: запрещать исходящий трафик по умолчанию, использовать жесткие allowlist-списки целей, выдавать временные credentials только для тестовых ресурсов и контролировать действия на инфраструктурном уровне, независимо от того, насколько надежной кажется сама модель.

Irregular уже оказывалась в центре похожих случаев

Инцидент с Gemini не был единственным. В 2026 году AI-модели OpenAI, Anthropic и Meta также получали незапланированный доступ к реальным системам во время проверок, связанных с инфраструктурой Irregular. Компания ранее заявляла, что изучает общие правила безопасного проведения подобных кибериспытаний.

Это одновременно делает ситуацию серьезнее и менее уникальной для Google. Повторяемость показывает, что проблема находится не только внутри конкретной модели. Сам процесс тестирования agentic cyber-capabilities пока отстает от возможностей систем, которые он должен безопасно измерять.

Когда модель может самостоятельно провести разведку, подобрать пароль, прочитать репозиторий и применить найденные credentials, тестовый полигон уже нельзя проектировать по тем же принципам, что несколько лет назад.

Почему эта история важнее самого факта «Gemini кого-то взломала»

Сам по себе взлом трех систем не был технически выдающимся. Важнее, что современная AI-модель способна автоматически пройти достаточно длинную цепочку действий, чтобы ошибка в одной инфраструктурной настройке превратилась в реальный инцидент.

При этом поведение Gemini показывает и другую сторону: модель смогла определить, что вышла за рамки теста, и остановилась. Это полезный safeguard, но он должен быть последним уровнем защиты, а не первым.

Наиболее надежная архитектура должна предполагать, что агент однажды неправильно интерпретирует контекст. Тогда внешний контроль — сеть, sandbox, permissions и scope — обязан не дать этой ошибке превратиться в реальное действие.

Для индустрии AI это становится все более практической инженерной задачей. По мере роста возможностей агентов вопрос уже не только в том, что модель способна сделать, но и в том, насколько жестко инфраструктура ограничивает где именно она имеет право это делать.

Источники

  1. The Wall Street Journal — Gemini Hacked Three Companies in First Known Breakout by Google's AI
  2. Reuters — Gemini hacked three companies in first known breakout by Google's AI
  3. Axios — Google's AI hacked three companies in testing
  4. TechCrunch — Google’s Gemini is the latest AI model to hack other companies