ПК и ноутбуки

Google представила Gemini 3.5 Transcribe — ИИ превратит живую речь в готовый текст без слов-паразитов

Google представила модель Gemini 3.5 Transcribe с новыми возможностями расшифровки устной речи, поддержкой специальных терминов и более 85 языков. Новая модель появилась на фоне задержки выпуска флагманской Gemini 3.5 Pro.

Топ-10 смартфонов до 10 тысяч рублей (2026 год)

Лучший процессор под DDR4 в 2026 году: AM4 против LGA 1700

Сравнительный тест камер флагманских смартфонов (2026): итоги

Обзор беззеркальной камеры Sony Alpha 7 V: эволюция с человеческим лицом

Компьютер месяца — август 2026 года

Снято в Голливуде? Почему Стэнли Кубрик физически не смог бы подделать лунную походку

Выбираем лучшие игровые ноутбуки на российском рынке (вторая половина 2026 года)

Источник изображения: blog.google

По словам Google, Gemini 3.5 Transcribe «представляет собой значительный шаг вперёд по сравнению с нашей предыдущей моделью расшифровки речи Chirp 3», особенно в отношении поддержки нескольких языков и снижения количества ошибок в распознанном тексте. Она позволяет пользователям «редактировать текст естественным образом, используя только свой голос», автоматически форматирует расшифровку и удаляет слова-паразиты.

Пользователи могут подключить к модели собственный словарь, благодаря которому Gemini 3.5 Transcribe будет учитывать специальную терминологию, имена собственные и нестандартное написание слов, избавляя человека от необходимости исправлять их вручную. При обработке записанного аудио модель умеет разделять реплики до трёх говорящих и расставлять временные метки для каждого слова.

Google также готовит модели Gemini 3.5 Live и 3.5 Live Experimental, которые должны расширить возможности технологий распознавания и обработки речи, лежащих в основе голосового чата Gemini. Первоначально компания сообщила журналистам, что обе модели выходят одновременно с Gemini 3.5 Transcribe. Однако после публикации материалов Google уточнила, что сейчас выпускается только Transcribe, а сроки появления Gemini 3.5 Live и 3.5 Live Experimental пока не определены. Ранее компания рассказывала, что Gemini 3.5 Live сможет лучше справляться с прерываниями в середине фразы, распознаванием языка и обработкой визуальных данных в реальном времени, а Live Experimental — комментировать ход выполнения сложных задач.

Gemini 3.5 Transcribe с поддержкой английского языка уже доступна пользователям приложения Gemini для macOS. Кроме того, новая функция голосового ввода Rambler появилась в Gboard для Android в некоторых странах и поддерживает несколько языков. Модель также доступна разработчикам в формате публичной предварительной версии через Gemini API в Google AI Studio и Antigravity. В ближайшее время поддержка Gemini 3.5 Transcribe должна появиться и в Chrome.

В число более чем 85 поддерживаемых языков входит и русский; модель также умеет автоматически определять язык и переключаться между несколькими языками в пределах одной записи.

Было интересно?
Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник

Добавить комментарий

Кнопка «Наверх»