CPU3DИИ-инструменты для 3D, видео и звука

Audio8-ASR-Infinite: потоковое распознавание речи с постоянным потреблением памяти

На HuggingFace 21 сентября 2026 года опубликована модель Edge0/Audio8-ASR-Infinite с задачей text-generation. Автор описывает её как нативное потоковое распознавание речи, рассчитанное на минимальную задержку: модель принимает решения 12,5 раза в секунду, а скользящий KV-кэш удерживает потребление памяти и латентность на постоянном уровне даже при непрерывной работе 24/7. Поддерживаются китайский и английский языки, есть семантический VAD, который отличает паузы на обдумывание и заикание от реального конца реплики.

Что это значит

Модель содержит 4,1 млрд параметров, веса занимают 7,6 ГБ в единственном файле model.safetensors. Лицензия — Apache 2.0, то есть модель можно использовать и модифицировать, в том числе в коммерческих проектах, с сохранением указания авторства. Запускается через библиотеку transformers, но для потокового режима с бесконечной длиной автор рекомендует адаптированную сборку vLLM. Квантованных сборок на площадке пока нет, поэтому для локального запуска потребуется видеокарта, способная вместить полные 7,6 ГБ весов плюс рабочий контекст. Для тех, кто ищет инструменты распознавания речи с работой на собственном железе, модель интересна прежде всего постоянным потреблением памяти: скользящий KV-кэш не даёт расходу расти со временем, что редко встречается в потоковых ASR-моделях. Следить за появлением квантованных версий и новыми моделями в этой области можно в ленте CPU3D.
Audio8-ASR-Infinite: потоковое распознавание речи Аудиопоток микрофон или файл китайский и английский Семантический VAD отличает паузы от конца реплики Audio8-ASR-Infinite 4,1 млрд параметров веса 7,6 ГБ Apache 2.0 Решения 12,5 раза/сек минимальная задержка Скользящий KV-кэш постоянное потребление памяти Текст 24/7 непрерывная работа без роста памяти vLLM Запуск transformers адаптированная vLLM GPU Железо видеокарта 7,6 ГБ+
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также