Google представляет обновленную модель голосовых агентов Gemini 2.5 Flash Native Audio

Google анонсировала обновление своей модели голосовых агентов — Gemini 2.5 Flash Native Audio. Эта модель, по данным компании, успешно обходит OpenAI gpt-realtime в тестах на сложные функциональные вызовы. Gemini 2.5 Flash Native Audio уже внедрена в продукты компании и доступна для разработчиков. В рамках теста ComplexFuncBench Audio, оценивающего многошаговые вызовы функций, модель продемонстрировала результат 71,5%, что на 5% выше, чем у конкурента. Также было отмечено улучшение точности следования инструкциям разработчиков до 90% и лучшее удержание контекста в диалогах. Модель активно используется в голосовом режиме приложения Gemini и в Google Search, заменив традиционную каскадную архитектуру. Среди первых пользователей — United Wholesale Mortgage, чей голосовой ассистент Mia помог оформить более 14 000 кредитов. В дополнение к этому Google запустила бета-версию синхронного перевода в Google Translate, поддерживающую более 70 языков. Пока функция доступна только на Android в США, Мексике и Индии, а для iOS она появится в 2026 году.

Понравилась статья? Поделиться с друзьями: