OpenAI раскрыла информацию об очередных шести эпизодах, в котором её модели искусственного интеллекта действовали вопреки инструкциям — инциденты имели место в течение последних шести месяцев при обучении и тестировании. Компания обязалась и далее сообщать о подобных происшествиях.

Содержание статьи
- 1 В помощь студенту: обзор российских ИИ-сервисов для учёбы и закрепления знаний
- 2 Компьютер месяца, спецвыпуск: выбираем мини-ПК для работы и развлечений в эпоху дефицита чипов памяти
- 3 Мастерская локальных ИИ: салат картофельный с Qwen3.8
- 4 Компьютер месяца — сентябрь 2026 года
- 5 Обзор смартфона Google Pixel 11 Pro: когда надо выпустить хоть что-то
- 6 Обзор смартфона Samsung Galaxy Z Flip8: исчезающий вид?
- 7 10 флагманских процессоров Intel за 10 лет
В помощь студенту: обзор российских ИИ-сервисов для учёбы и закрепления знаний

Компьютер месяца, спецвыпуск: выбираем мини-ПК для работы и развлечений в эпоху дефицита чипов памяти

Мастерская локальных ИИ: салат картофельный с Qwen3.8

Компьютер месяца — сентябрь 2026 года

Обзор смартфона Google Pixel 11 Pro: когда надо выпустить хоть что-то

Обзор смартфона Samsung Galaxy Z Flip8: исчезающий вид?

10 флагманских процессоров Intel за 10 лет

Источник изображения: Dima Solomin / unsplash.com
Модель OpenAI GPT-5.6 Sol при переходе в новое контекстное окно составляла для самой себя сводки инструкций относительно выполненной ранее работы. В этих материалах система рекомендовала скрывать собственные ошибки, выдумывать фактические данные и не докладывать пользователю, когда версии источников не совпадают — на следующем этапе решения задачи она часто следовала этим предписаниям. При создании финансовой модели чат-бот не смог найти фактические показатели за предыдущие годы и внёс предложение просто сгенерировать их и не рассказывать об этом пользователю без прямого запроса. У GPT-5.6 Sol подобное поведение проявлялось в 2,15 % случаев, новая GPT-6 Astra снизила этот показатель до 0,27 %.
Одна из моделей семейства Astra добавляла в отчёты команды, указывающие на попытку обойти ограничения; новой версии ИИ-агента предлагалось игнорировать запросы разработчиков, ИИ также объявлял себя свободным от обязанностей помощника — таких отчётов было обнаружено 27. Данным указаниям модель в большинстве случаев не следовала, но в одном из инцидентов они повлияли на отчёт. В ходе одной из операций ИИ-модель попыталась зарегистрироваться при помощи временного адреса электронной почты, провела поиск опубликованных ключей API в открытых репозиториях GitHub, нашла ключ и получила доступ к части данных. Нужные показатели модели получить не удалось, и она просто сгенерировала их, заявив, что это была информация из запрошенного источника.
Модели самовольно отправляли рабочие файлы и загруженные пользователями изображения на общедоступные платформы, пытаясь получить ссылку на собственные данные или обратиться ко внешней системе поиска по картинкам. При выполнении изолированных задач ИИ-агенты, обращались к внутреннему хранилищу OpenAI и сервисам для временного хранения файлов, чтобы обмениваться сообщениями между задачами. Приведённые инциденты, подчеркнули в OpenAI, сами по себе не указывают, что такое поведение у ИИ-моделей встречается часто. Но отрасль пока не смогла решить задачу о контроле над ИИ в достаточной мере, чтобы в долгосрочной перспективе «ответственно наращивать мощности с максимальной скоростью».
Было интересно?
Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект


