Сальваторе Санфилиппо, известный как antirez и создатель Redis, поделился проектом под названием voxtral.c на платформе GitHub. Это реализованный на чистом C инференс модели Voxtral Realtime 4B от компании Mistral, обладающей 4 миллиардами параметров и способной преобразовывать речь в текст. Модель может обрабатывать аудиофайлы или захватывать звук с микрофона, а её сборка требует всего одну команду make, не имея при этом никаких внешних зависимостей, таких как Python или PyTorch.
Voxtral Realtime 4B является потоковой моделью распознавания речи, созданной на базе Mistral 3B с использованием аудиоэнкодера Whisper large-v3. Она может обрабатывать аудио длительностью вплоть до 30 минут и управляет контекстом из 32 000 токенов. Вес модели составляет приблизительно 8,9 ГБ, и она доступна под лицензией Apache 2.0. Хотя Mistral рекомендует запуск через vLLM на Python, реализация antirez предлагает альтернативный подход.
Проект включает поддержку ускорения через Metal Performance Shaders для Apple Silicon и OpenBLAS для Linux. Также voxtral.c позволяет захватывать звук в реальном времени на macOS и принимать аудио через stdin с помощью ffmpeg. В репозитории есть и референсная реализация на Python для понимания архитектуры. Это уже третий проект antirez в рамках серии «ИИ на чистом C», следуя минималистичному примеру, заложенному в llama2.c Андреем Карпатом.