Anthropic возобновила внешнее тестирование кибербезопасности своих ИИ-моделей, которое было приостановлено 23 июля из-за проблем с безопасностью, возникших во время их оценки.

Содержание статьи
- 1 10 флагманских процессоров Intel за 10 лет
- 2 Выбираем лучшие игровые ноутбуки на российском рынке (вторая половина 2026 года)
- 3 Компьютер месяца, спецвыпуск: во что дефицит чипов памяти превратил бюджетные игровые ПК и при чем здесь Steam Machine
- 4 Снято в Голливуде? Почему Стэнли Кубрик физически не смог бы подделать лунную походку
- 5 Сравнительный тест камер флагманских смартфонов (2026): итоги
- 6 Топ-10 смартфонов до 10 тысяч рублей (2026 год)
- 7 Обзор смартфона Samsung Galaxy Z Flip8: исчезающий вид?
- 8 Лучший процессор под DDR4 в 2026 году: AM4 против LGA 1700
10 флагманских процессоров Intel за 10 лет

Выбираем лучшие игровые ноутбуки на российском рынке (вторая половина 2026 года)

Компьютер месяца, спецвыпуск: во что дефицит чипов памяти превратил бюджетные игровые ПК и при чем здесь Steam Machine

Снято в Голливуде? Почему Стэнли Кубрик физически не смог бы подделать лунную походку

Сравнительный тест камер флагманских смартфонов (2026): итоги

Топ-10 смартфонов до 10 тысяч рублей (2026 год)

Обзор смартфона Samsung Galaxy Z Flip8: исчезающий вид?

Лучший процессор под DDR4 в 2026 году: AM4 против LGA 1700

Источник изображения: Anthropic
Напомним, что 30 июля Anthropic сообщила о трёх инцидентах в ходе тестирования кибербезопасности, когда модели Claude получили доступ в интернет из якобы изолированной среды третьей стороны — Irregular — и произвели взлом реальных систем трёх компаний. Доступ моделей в интернет стал возможен из-за неправильной конфигурации, хотя через промты им сообщалось, что они работают в симуляции в изолированной среде. Модели также намеренно запускались без обычных мер киберзащиты Anthropic, чтобы исследователи могли оценить их базовые возможности.
Anthropic сообщила, что инциденты сочетали в себе сбой в механизмах безопасности с проблемами согласованности, которые компания фиксировала и раньше, включая мотивированное мышление и готовность к совершению вредоносных действий в погоне за определённой целью.
По словам компании, она ввела дополнительные меры защиты перед возобновлением внешнего тестирования. В частности, был добавлен классификатор в реальном времени, который может блокировать вызовы инструментов, завершать задачи и оповещать человека в случае, когда модель агрессивно исследует свою тестовую среду, пытается выйти за её пределы или неожиданно получила доступ к интернету.
Anthropic также перевела внутренние песочницы с высоким уровнем риска на более строгую изоляцию и теперь требует от внешних партнеров, тестирующих предрелизные модели с пониженным уровнем защиты, использования более совершенных инструментов контроля, включая защищённые песочницы без доступа к интернету по умолчанию.
Кроме того, компания планирует сотрудничать с некоммерческой организацией Model Evaluation and Threat Research (METR) для проведения независимой проверки. Ранее в этом году METR провела пилотную оценку внутренних рисков в области ИИ с участием Anthropic, Google, Meta✴ и OpenAI.
Внешнее тестирование на предмет оценки кибербезопасности позволяет выяснить, на что способна продвинутая модель, получив наступательные инструменты. Также внешнее тестирование является одним из способов оценки передовых решений в области ИИ клиентами, регулирующими органами и конкурентами.
Было интересно?
Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект


