SpaceXAI выпустила новую модель Grok Voice Transcribe 2.0 для преобразования речи в текст. По заявлению разработчиков, она допускает вдвое меньше ошибок, чем предыдущая версия, при той же стоимости. Модель ориентирована на сложные записи, включая телефонные разговоры с помехами, одновременную речь нескольких людей, а также региональные акценты и диалекты.

Содержание статьи
- 1 Мастерская локальных ИИ: салат картофельный с Qwen3.8
- 2 Обзор смартфона Google Pixel 11 Pro: когда надо выпустить хоть что-то
- 3 Компьютер месяца — сентябрь 2026 года
- 4 Обзор смартфона Samsung Galaxy Z Flip8: исчезающий вид?
- 5 10 флагманских процессоров Intel за 10 лет
- 6 В помощь студенту: обзор российских ИИ-сервисов для учёбы и закрепления знаний
- 7 Компьютер месяца, спецвыпуск: выбираем мини-ПК для работы и развлечений в эпоху дефицита чипов памяти
Мастерская локальных ИИ: салат картофельный с Qwen3.8

Обзор смартфона Google Pixel 11 Pro: когда надо выпустить хоть что-то

Компьютер месяца — сентябрь 2026 года

Обзор смартфона Samsung Galaxy Z Flip8: исчезающий вид?

10 флагманских процессоров Intel за 10 лет

В помощь студенту: обзор российских ИИ-сервисов для учёбы и закрепления знаний

Компьютер месяца, спецвыпуск: выбираем мини-ПК для работы и развлечений в эпоху дефицита чипов памяти

Источник изображения: Grok
Grok Voice Transcribe 2.0, как сообщает MarkTechPost, построена на базе аудиомодели, которая используется в Grok Voice. Технология уже ежедневно обрабатывает десятки тысяч звонков в службы поддержки, расшифровывает миллионы часов видеоматериалов и применяется в голосовом ассистенте автомобилей Tesla. Для обучения использовались многоязычные записи с шумами и помехами, после чего модель дополнительно дорабатывалась методами постобучения.
В публичном рейтинге Artificial Analysis модель Grok Voice Transcribe 2.0 заняла первое место среди 32 потоковых моделей по показателю AA-WER Streaming. Компания также протестировала её на четырёх внутренних наборах данных: телефонных разговорах; диалогах с Grok; произнесённых номерах телефонов, обычных и электронных адресах; коротких фразах для голосовых ассистентов на 19 языках. Во всех четырёх случаях версия 2.0 показала лучшие результаты, чем версия 1.0, однако внутренние данные предоставлены самой SpaceXAI и независимо не подтверждались.
Одним из главных улучшений разработчики называют многоязычное распознавание. Модель автоматически определяет язык, поддерживает десятки языков и способна продолжать расшифровку при смене языка непосредственно во время разговора. На наборе коротких фраз показатель WER, отражающий долю ошибок при распознавании слов, снизился с 20,6 до 6,8 %, то есть примерно на 67 %. Документация также указывает на поддержку автоматического форматирования чисел, денежных сумм и единиц измерения для 25 языков.
Модель доступна через Speech to Text API в пакетном и потоковом режимах. В потоковом режиме поддерживается аудиокодек Opus с потоком данных около 4 Кбайт/с. Для сравнения: несжатый звук в формате PCM с частотой дискретизации 24 кГц требует около 48 Кбайт/с. API поддерживает временные метки и оценки уверенности распознавания каждого слова, разделение речи разных собеседников без дополнительной платы, до восьми аудиоканалов и возможность задать до 100 ключевых терминов. Также предусмотрены автоматическое форматирование чисел и дат, удаление слов-паразитов и определение момента окончания реплики для голосовых ассистентов.
В пакетном режиме можно загружать файлы размером до 500 Мбайт в 12 аудиоформатах, а потоковое распознавание осуществляется через WebSocket. В API модель имеет идентификатор grok-voice-transcribe-2.0. Пакетная расшифровка стоит $0,10 за час аудио, потоковая — $0,20 за час.
Было интересно?
Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект


