С появлением MedASR, нового инструмента для преобразования речи в текст в медицинской сфере, процесс расшифровки стал более точным. Эта модель, обладающая 105 миллионами параметров, была обучена на 5000 часах обезличенной медицинской речи, включающей врачебные диктовки и клинические диалоги. MedASR использует архитектуру Conformer и специализируется на распознавании узкоспециализированных терминов из областей, таких как радиология и внутренние болезни.
Модель принимает моноаудио с частотой 16 кГц и выдает текст, без попыток интерпретировать смысл. Разработчики видят в MedASR основу для голосовых приложений в здравоохранении, позволяющую улучшить качество расшифровки и заполнения клинических заметок. Пользователи могут дообучить модель под свои нужды, включая акценты и шумные условия. Для извлечения информации из расшифровок предлагается использовать генеративные модели, такие как MedGemma, для создания кратких заметок и резюме.