Google анонсировала обновление своей модели голосовых агентов — Gemini 2.5 Flash Native Audio. Эта модель, по данным компании, успешно обходит OpenAI gpt-realtime в тестах на сложные функциональные вызовы. Gemini 2.5 Flash Native Audio уже внедрена в продукты компании и доступна для разработчиков. В рамках теста ComplexFuncBench Audio, оценивающего многошаговые вызовы функций, модель продемонстрировала результат 71,5%, что на 5% выше, чем у конкурента. Также было отмечено улучшение точности следования инструкциям разработчиков до 90% и лучшее удержание контекста в диалогах. Модель активно используется в голосовом режиме приложения Gemini и в Google Search, заменив традиционную каскадную архитектуру. Среди первых пользователей — United Wholesale Mortgage, чей голосовой ассистент Mia помог оформить более 14 000 кредитов. В дополнение к этому Google запустила бета-версию синхронного перевода в Google Translate, поддерживающую более 70 языков. Пока функция доступна только на Android в США, Мексике и Индии, а для iOS она появится в 2026 году.
0
Понравилась статья? Поделиться с друзьями:
Вам также может быть интересно
Анонимная наркологическая помощь: как сохранить репутацию и получить лечение Когда речь заходит о
Мир коллекционирования переживает значительные трансформации. Если раньше собирательство марок или монет воспринималось исключительно как
Компания Ugreen анонсировала новую модель портативного аккумулятора MagFlow 2-в-1, сертифицированного по стандарту MagSafe. Этот
При выборе игрового процессора необходимо находить баланс между ценой и производительностью, чтобы максимально использовать
Наш сервис предоставляет возможность переписывать новости, сохраняя при этом все важные факты. Мы изменяем
Самоподписанные сертификаты часто используются для тестирования и разработки, так как они позволяют пользователю создавать