Стартап из США Hume AI представил свою новую модель генерации речи под названием Octave 2, которая уже завоевала репутацию самой быстрой на рынке. Задержка в производстве речи составляет менее 200 миллисекунд, что позволяет создавать синтезированную речь практически в реальном времени. Это значительно расширяет возможности использования технологии в чат-ботах, голосовых помощниках и других интерактивных системах, где важна естественная пауза между репликами.
Octave 2 поддерживает 11 языков, включая русский, английский, французский, испанский и китайский. Модель может имитировать голоса, изменять их по полу и возрасту, а также управлять эмоциями — от спокойного до ярко выраженного тона. Кроме того, она способна редактировать фонемы для точного произношения сложных слов и названий.
По сравнению с предыдущей версией, новая модель стала на 40% быстрее, а стоимость генерации снизилась почти наполовину. Также улучшилось качество звучания, включая четкость дикции и передачу интонаций. Octave 2 доступна для тестирования на сайте Hume AI и через API для разработчиков. В блоге компании представлены примеры аудио и видео, демонстрирующие ее возможности. С запуском Octave 2 Hume AI намерена преодолеть главный барьер в технологии TTS — задержку, обеспечивая более естественный диалог между человеком и машиной.