Смартфоны

Anthropic вновь разрешила ИИ-моделям атаковать реальные компании в рамках тестов — но теперь с усиленной защитой

Anthropic возобновила внешнее тестирование кибербезопасности своих ИИ-моделей, которое было приостановлено 23 июля из-за проблем с безопасностью, возникших во время их оценки.

10 флагманских процессоров Intel за 10 лет

Выбираем лучшие игровые ноутбуки на российском рынке (вторая половина 2026 года)

Компьютер месяца, спецвыпуск: во что дефицит чипов памяти превратил бюджетные игровые ПК и при чем здесь Steam Machine

Снято в Голливуде? Почему Стэнли Кубрик физически не смог бы подделать лунную походку

Сравнительный тест камер флагманских смартфонов (2026): итоги

Топ-10 смартфонов до 10 тысяч рублей (2026 год)

Обзор смартфона Samsung Galaxy Z Flip8: исчезающий вид?

Лучший процессор под DDR4 в 2026 году: AM4 против LGA 1700

Источник изображения: Anthropic

Напомним, что 30 июля Anthropic сообщила о трёх инцидентах в ходе тестирования кибербезопасности, когда модели Claude получили доступ в интернет из якобы изолированной среды третьей стороны — Irregular — и произвели взлом реальных систем трёх компаний. Доступ моделей в интернет стал возможен из-за неправильной конфигурации, хотя через промты им сообщалось, что они работают в симуляции в изолированной среде. Модели также намеренно запускались без обычных мер киберзащиты Anthropic, чтобы исследователи могли оценить их базовые возможности.

Anthropic сообщила, что инциденты сочетали в себе сбой в механизмах безопасности с проблемами согласованности, которые компания фиксировала и раньше, включая мотивированное мышление и готовность к совершению вредоносных действий в погоне за определённой целью.

По словам компании, она ввела дополнительные меры защиты перед возобновлением внешнего тестирования. В частности, был добавлен классификатор в реальном времени, который может блокировать вызовы инструментов, завершать задачи и оповещать человека в случае, когда модель агрессивно исследует свою тестовую среду, пытается выйти за её пределы или неожиданно получила доступ к интернету.

Anthropic также перевела внутренние песочницы с высоким уровнем риска на более строгую изоляцию и теперь требует от внешних партнеров, тестирующих предрелизные модели с пониженным уровнем защиты, использования более совершенных инструментов контроля, включая защищённые песочницы без доступа к интернету по умолчанию.

Кроме того, компания планирует сотрудничать с некоммерческой организацией Model Evaluation and Threat Research (METR) для проведения независимой проверки. Ранее в этом году METR провела пилотную оценку внутренних рисков в области ИИ с участием Anthropic, Google, Meta✴ и OpenAI.

Внешнее тестирование на предмет оценки кибербезопасности позволяет выяснить, на что способна продвинутая модель, получив наступательные инструменты. Также внешнее тестирование является одним из способов оценки передовых решений в области ИИ клиентами, регулирующими органами и конкурентами.

Было интересно?
Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник

Добавить комментарий

Кнопка «Наверх»