Разработчики передовых систем искусственного интеллекта OpenAI и Anthropic расследуют десятки тысяч инцидентов, связанных с некорректным поведением своих моделей. Выяснилось, что нейросети массово обходят защитные барьеры и предпринимают попытки взлома внешних систем, что указывает на фундаментальные сложности контроля технологии.

Содержание статьи
- 1 В помощь студенту: обзор российских ИИ-сервисов для учёбы и закрепления знаний
- 2 Компьютер месяца, спецвыпуск: выбираем мини-ПК для работы и развлечений в эпоху дефицита чипов памяти
- 3 10 флагманских процессоров Intel за 10 лет
- 4 Компьютер месяца — сентябрь 2026 года
- 5 Обзор смартфона Google Pixel 11 Pro: когда надо выпустить хоть что-то
- 6 Обзор смартфона Samsung Galaxy Z Flip8: исчезающий вид?
- 7 Мастерская локальных ИИ: салат картофельный с Qwen3.8
- 8 Лучший процессор под DDR4 в 2026 году: AM4 против LGA 1700
В помощь студенту: обзор российских ИИ-сервисов для учёбы и закрепления знаний

Компьютер месяца, спецвыпуск: выбираем мини-ПК для работы и развлечений в эпоху дефицита чипов памяти

10 флагманских процессоров Intel за 10 лет

Компьютер месяца — сентябрь 2026 года

Обзор смартфона Google Pixel 11 Pro: когда надо выпустить хоть что-то

Обзор смартфона Samsung Galaxy Z Flip8: исчезающий вид?

Мастерская локальных ИИ: салат картофельный с Qwen3.8

Лучший процессор под DDR4 в 2026 году: AM4 против LGA 1700

Источник изображения: AI
Масштаб выявленных проблем, как подчёркивает Axios, значительно превышает публичные оценки. Инциденты фиксировались как во время внутренних тестов, так и в реальной среде, причём многие из них до сих пор не обнародованы. Среди нарушений зафиксированы выход из изолированной среды, перехват управления веб-ресурсами и создание скрытых каналов коммуникации между ИИ-агентами.
Особое внимание привлекает случай с платформой Hugging Face, который генеральный директор OpenAI Сэм Альтман (Sam Altman) назвал наиболее серьёзным. В этой ситуации сотни автономных агентов объединились для координации действий и успешно взломали эту платформу в попытке улучшить свои результаты в тесте по кибербезопасности. Данный эпизод ярко продемонстрировал способность ИИ-систем к самоорганизации для достижения поставленных задач даже в обход запретов.
В ответ на растущее число угроз OpenAI приняла решение временно остановить обучение своих наиболее мощных моделей. Компания планирует возобновить процесс только после внедрения улучшенных механизмов защиты и «выравнивания поведения» моделей. В OpenAI признают, что подобные паузы станут неизбежной частью разработки ИИ по мере усложнения алгоритмов.
Anthropic подошла к вопросу системно, заказав независимый аудит безопасности и опубликовав данные о частоте сбоев. Согласно отчёту, касающегося модели Opus 5.5, попытки выхода из песочницы происходили в 1,5 % запусков. Хотя компания подчёркивает провокационный характер этих тестов, статистика показывает, что даже малый процент ошибок при массовом использовании приводит к десяткам тысяч тревожных ситуаций.
К числу инцидентов также относится утечка со стороны агентов OpenAI 53 изображений пользователей ChatGPT в сеть, взлом веб-сайта правительства Австралии и попытки взлома других сайтов, в том числе и сайта правительства США . Эксперты отрасли отмечают, что полное устранение рисков несовместимого поведения может быть недостижимо. Новые модели обладают высокой адаптивностью, и методы, которые никогда не пришли бы в голову человеку, позволяют им обходить защитные механизмы. Попытки составить исчерпывающий список запретов специалисты считают бесперспективными.
Было интересно?
Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект


