Графические процессоры хорошо подходят для обучения искусственного интеллекта, но для инференса, то есть развёртывания уже обученных моделей требуется большой объём быстрой памяти. AMD объединилась с Cerebras Systems для разработки вычислительной платформы, объединяющей системы Instinct с ускорителями на базе памяти SRAM, чтобы обеспечить инференс со сверхнизкой задержкой для работы ИИ-агентов.

Содержание статьи
- 1 Обзор Infinix GT 50 Pro: геймерский смартфон со встроенной СЖО
- 2 Выбираем лучший игровой ноутбук до 100 000 рублей: сравнительное тестирование 7 интересных моделей
- 3 Репортаж с IEM Cologne Major 2026: Жаб Жабыч, триумф NiKo и главные сенсации мейджора по CS2
- 4 Обзор Ryzen 9 9950X3D2: правильный 16-ядерник с 3D-кешем
- 5 Умные помощники: обзор ИИ-сервисов для обработки изображений. Часть 2, актуализированная
Обзор Infinix GT 50 Pro: геймерский смартфон со встроенной СЖО

Выбираем лучший игровой ноутбук до 100 000 рублей: сравнительное тестирование 7 интересных моделей

Репортаж с IEM Cologne Major 2026: Жаб Жабыч, триумф NiKo и главные сенсации мейджора по CS2

Обзор Ryzen 9 9950X3D2: правильный 16-ядерник с 3D-кешем

Умные помощники: обзор ИИ-сервисов для обработки изображений. Часть 2, актуализированная

Источник изображения: cerebras.ai
Совместный проект восполняет пробел в портфеле AMD, образовавшийся после того, как Nvidia в декабре поглотила за $20 млрд стартап Groq. Гендиректор и соучредитель Cerebras Эндрю Фельдман (Andrew Feldman) не в восторге от деятельности Nvidia, которую он сравнивал с торговцами оружием. В отличие от графических процессоров, чипы Cerebras Wefer Scale Engine (WSE) используют не HBM4, а встроенную в чипы память SRAM, которая на порядки быстрее. Благодаря этому оборудование Cerebras является одним из быстрейших в мире в задачах инференса — скорость генерации часто превышает 2000 токенов в секунду.
Комплексные системы обрабатывают сложные запросы на ускорителях AMD Instinct, а генерация токенов, требующая больших объёмов памяти, делегируется Cerebras WSE — в результате достигается высокая производительность без ущерба для пропускной способности или стоимости. Конкретные показатели пока не приводятся, кроме одного: количество генерируемых токенов в секунду на ватт потребляемой энергии возрастает пятикратно.
Подобная схема есть у конкурента. Вместе с системами Nvidia Vera Rubin работают LPU (Language Processing Units) Groq 3 — разница в том, что если для обслуживания модели с 1 трлн параметров Kimi K2.5 требуются две тысяч чипов Groq, то в системах AMD и Cerebras хватит и нескольких десятков. Объединённое решение будет доступно в Cerebras Cloud уже в этом году, и это не последняя сделка AMD со стартапом.


