Xiaomi представила открытую модель искусственного интеллекта CocktailASR-1. Она предназначена для решения одной из наиболее сложных задач в области расшифровки аудио — выделения голоса конкретного человека в ситуации, когда несколько людей говорят одновременно.

Содержание статьи
- 1 Сравнительный тест камер флагманских смартфонов (2026): итоги
- 2 Лучший процессор под DDR4 в 2026 году: AM4 против LGA 1700
- 3 Компьютер месяца, спецвыпуск: во что дефицит чипов памяти превратил бюджетные игровые ПК и при чем здесь Steam Machine
- 4 Выбираем лучшие игровые ноутбуки на российском рынке (вторая половина 2026 года)
- 5 Снято в Голливуде? Почему Стэнли Кубрик физически не смог бы подделать лунную походку
- 6 Топ-10 смартфонов до 10 тысяч рублей (2026 год)
- 7 10 флагманских процессоров Intel за 10 лет
- 8 Обзор смартфона Samsung Galaxy Z Flip8: исчезающий вид?
Сравнительный тест камер флагманских смартфонов (2026): итоги

Лучший процессор под DDR4 в 2026 году: AM4 против LGA 1700

Компьютер месяца, спецвыпуск: во что дефицит чипов памяти превратил бюджетные игровые ПК и при чем здесь Steam Machine

Выбираем лучшие игровые ноутбуки на российском рынке (вторая половина 2026 года)

Снято в Голливуде? Почему Стэнли Кубрик физически не смог бы подделать лунную походку

Топ-10 смартфонов до 10 тысяч рублей (2026 год)

10 флагманских процессоров Intel за 10 лет

Обзор смартфона Samsung Galaxy Z Flip8: исчезающий вид?

Источник изображения: Xiaomi
В Xiaomi проблему условно обозначили как «эффект коктейльной вечеринки». Большинство специализированных ИИ-моделей справляются с распознаванием речи, когда говорит один человек, но если друг на друга накладываются несколько голосов, ситуация значительно усложняется. Текст искажается, предложения сливаются, а реплики приписываются не тем собеседникам. В обратном направлении компания решила эту задачу с моделью OmniVoice — CocktailASR-1 же не генерирует, а выделяет и расшифровывает речь. Для работы с моделью необходимо представить короткий образец с голосом нужного человека. Она использует его как эталон, а затем, проанализировав запись с несколькими участниками, распознает и расшифрует речь только этого человека.
В ряде тестов по распознаванию речи в условиях многоголосных образцов она, отметили в Xiaomi, продемонстрировала ведущие результаты и превзошла существующие аналоги, предназначенные для решения той же задачи. Сложными условиями её возможности не исчерпываются — она умеет расшифровывать речь и в том случае, когда на записи голос только одного человека. Она также умеет избегать необоснованных предположений: если в предложенной записи указанный в качестве образца голос отсутствует, она выдаст пустой текст и не будет пытаться расшифровать слова другого человека.
Наконец, у Xiaomi CocktailASR-1 есть режим цепочки рассуждений — он позволяет пользователям изучать логику, на основе которой выполнялась расшифровка, а не просто видеть итоговый текст. Новая модель доступна на GitHub и Hugging Face.
Было интересно?
Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект


