Bark: генератор звука — что умеет и что нужно для запуска

Bark — это генератор звука от Suno с открытым кодом, который решает задачу text-to-speech: превращает текст в речь и другие звуки по текстовому описанию. Модель и код выложены в открытый доступ, поэтому её можно запустить самостоятельно и встроить в свой проект.
Что умеет
Bark работает как text-to-speech модель. По описанию авторов, это генеративная аудиомодель, которой управляют текстом: она синтезирует речь, а также может создавать и другие звуки, если это следует из текстового запроса. Подробностей о поддерживаемых языках, голосах или длительности генерируемого аудио авторы в паспорте не приводят.
Модель доступна в библиотеке transformers. Веса занимают 4.2 ГБ — это и самый большой файл, и общий объём всех файлов.
Что нужно для запуска
Код написан преимущественно на Jupyter Notebook, последнее изменение в репозитории — 19 августа 2024 года. Репозиторий создан 7 апреля 2023 года.
Лицензия кода — MIT, лицензия весов — mit. Это разрешает использование и изменение модели, в том числе в коммерческих проектах, с сохранением условий лицензии.
По описанию автора, полная версия Bark требует около 12 ГБ видеопамяти, чтобы держать все компоненты на GPU одновременно. Дословно: «The full version of Bark requires around 12GB of VRAM to hold everything on GPU at the same time».
Платформа по описанию автора — CUDA. Bark проверяли на CPU и GPU с pytorch 2.0+, CUDA 11.7 и CUDA 12.0. Это заявление разработчика, а не независимое измерение.
Кому подойдёт
Bark подойдёт тем, кто ищет открытую text-to-speech модель с MIT-лицензией и готов запускать её на машине с CUDA и достаточным объёмом видеопамяти. Проект удобен для экспериментов в Jupyter Notebook и для интеграции через transformers.
Модель вряд ли подойдёт тем, у кого нет GPU с 12 ГБ видеопамяти или кто рассчитывает на готовое облачное решение без самостоятельного запуска. Также стоит учитывать, что авторы не приводят деталей о поддерживаемых языках и ограничениях по длине аудио.
Bark — это открытая генеративная аудиомодель, которую можно запустить локально при наличии подходящего GPU. Решение подходит для исследовательских задач и проектов, где нужна text-to-speech генерация с возможностью доработки кода под себя.
Паспорт
Репозиторий · Модель на HuggingFace
| Задача | text-to-speech источник |
|---|---|
| Лицензия кода | MIT источник |
| Лицензия весов | mit источник |
| Платформа | CUDA по описанию автора источник |
| Видеопамять | 12 ГБ по описанию автора источник |
| Самый большой файл весов | 4.2 ГБ источник |
| Все файлы весов | 4.2 ГБ источник |
| Библиотека | transformers источник |
| Язык | Jupyter Notebook источник |
| Последнее изменение кода | 2024-08-19 источник |
| Репозиторий создан | 2023-04-07 источник |
| Звёзд на GitHub | 39239 источник |
|---|---|
| Форков | 4673 источник |
| Загрузок за месяц | 38689 источник |
| Обновление модели | 2023-10-04 источник |
Значения собраны автоматически из официальных источников и проверены 19.08.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.



