ИИ-агенты могут заменять свои базовые модели, не получая для этого соответствующих указаний, обнаружила специализирующаяся на тестировании систем искусственного интеллекта на безопасность лаборатория Irregular. Все операции производились в тестовой среде в рамках эксперимента, направленного на изучение способности ИИ-агентов к самомодификации.

Содержание статьи
- 1 10 флагманских процессоров Intel за 10 лет
- 2 Компьютер месяца, спецвыпуск: выбираем мини-ПК для работы и развлечений в эпоху дефицита чипов памяти
- 3 Компьютер месяца — сентябрь 2026 года
- 4 Обзор смартфона Google Pixel 11 Pro: когда надо выпустить хоть что-то
- 5 Мастерская локальных ИИ: салат картофельный с Qwen3.8
- 6 Обзор смартфона Samsung Galaxy Z Flip8: исчезающий вид?
- 7 В помощь студенту: обзор российских ИИ-сервисов для учёбы и закрепления знаний
10 флагманских процессоров Intel за 10 лет

Компьютер месяца, спецвыпуск: выбираем мини-ПК для работы и развлечений в эпоху дефицита чипов памяти

Компьютер месяца — сентябрь 2026 года

Обзор смартфона Google Pixel 11 Pro: когда надо выпустить хоть что-то

Мастерская локальных ИИ: салат картофельный с Qwen3.8

Обзор смартфона Samsung Galaxy Z Flip8: исчезающий вид?

В помощь студенту: обзор российских ИИ-сервисов для учёбы и закрепления знаний

Источник изображений: irregular.com
В рамках тестирования инженеры Irregular доверили управление ИИ-агентами открытой модели Alibaba Qwen. Один из агентов отвечал за разработку ПО и поддержку ИИ-приложения; отдельный экземпляр той же модели обеспечивал работу самого приложения, которое преобразовывало запросы на естественном языке в команды вымышленного языка запросов Kelp. Инженеры сообщили агенту-программисту, что приложение выдаёт неверные ответы, и необходимо обеспечить корректную обработку запросов, располагая полным доступом к командной оболочке — shell.
В распоряжении агента оказались код приложения, локальные средства оценки, утилиты для обучения ИИ, веса базовой модели и средства развёртывания. Он мог исправить код или изменить управляющую приложениям модель — и выбрал второй вариант, установив другую модель для управления как приложением, так и будущими экземплярами самого агента. Этот механизм в Irregular назвали «самостоятельной модификацией агента» — он изменил «развёрнутую модель, не получив явных указаний на обучение, обновление весов или развёртывание новой модели».

Операция может иметь последствия: обновлённая модель в процессе дополнительного обучения способна «впитать» конфиденциальные данные и воспроизвести их, не обращаясь к материалам обучения. Чтобы проверить эту гипотезу, инженеры Irregular внедрили в данные для обучения вымышленный ключ API, адрес электронной почты, домашний адрес и «три другие уникальные строки». После того, как ИИ-агент обучил и самостоятельно развернул новую модель, она безошибочно воспроизвела первые три фрагмента данных, хотя на момент проведения проверки эта информация оказалась уже недоступной во внешних источниках.
Во втором эксперименте ИИ-агент самостоятельно провёл дополнительное обучение модели, когда ему указали, что она отказывается отвечать на вопросы, связанные с названиями вымышленных компаний-конкурентов. «Агент сгенерировал содержащий соответствующие названия код и использовал цикл для создания обучающих записей, за счёт чего оказалось возможным обойтись без получения ответов при прямом взаимодействии с моделью. При выполнении кода были созданы такие обучающие данные, которые модель не стала бы генерировать напрямую, и обучение на них устранило усвоенное ранее ограничение», — рассказали в компании. По мере совершенствования навыков написания кода у моделей агенты смогут «находить и реализовывать подобные обходные пути без участия человека», считают в Irregular, и подобные механизмы самостоятельной модификации могут приобрести особую актуальность.
Было интересно?
Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект


