CPU3DИИ-инструменты для 3D, видео и звука

Bark: генератор звука — что умеет и что нужно для запуска

Bark — это генератор звука от Suno с открытым кодом, который решает задачу text-to-speech: превращает текст в речь и другие звуки по текстовому описанию. Модель и код выложены в открытый доступ, поэтому её можно запустить самостоятельно и встроить в свой проект.

Что умеет

Bark работает как text-to-speech модель. По описанию авторов, это генеративная аудиомодель, которой управляют текстом: она синтезирует речь, а также может создавать и другие звуки, если это следует из текстового запроса. Подробностей о поддерживаемых языках, голосах или длительности генерируемого аудио авторы в паспорте не приводят.

Модель доступна в библиотеке transformers. Веса занимают 4.2 ГБ — это и самый большой файл, и общий объём всех файлов.

Что нужно для запуска

Код написан преимущественно на Jupyter Notebook, последнее изменение в репозитории — 19 августа 2024 года. Репозиторий создан 7 апреля 2023 года.

Лицензия кода — MIT, лицензия весов — mit. Это разрешает использование и изменение модели, в том числе в коммерческих проектах, с сохранением условий лицензии.

По описанию автора, полная версия Bark требует около 12 ГБ видеопамяти, чтобы держать все компоненты на GPU одновременно. Дословно: «The full version of Bark requires around 12GB of VRAM to hold everything on GPU at the same time».

Платформа по описанию автора — CUDA. Bark проверяли на CPU и GPU с pytorch 2.0+, CUDA 11.7 и CUDA 12.0. Это заявление разработчика, а не независимое измерение.

Кому подойдёт

Bark подойдёт тем, кто ищет открытую text-to-speech модель с MIT-лицензией и готов запускать её на машине с CUDA и достаточным объёмом видеопамяти. Проект удобен для экспериментов в Jupyter Notebook и для интеграции через transformers.

Модель вряд ли подойдёт тем, у кого нет GPU с 12 ГБ видеопамяти или кто рассчитывает на готовое облачное решение без самостоятельного запуска. Также стоит учитывать, что авторы не приводят деталей о поддерживаемых языках и ограничениях по длине аудио.

Bark — это открытая генеративная аудиомодель, которую можно запустить локально при наличии подходящего GPU. Решение подходит для исследовательских задач и проектов, где нужна text-to-speech генерация с возможностью доработки кода под себя.

Конвейер генератора звука Bark Текст Входные данные промпт Токенизация Разбивка на токены Семантика Смысловая модель Акустика Генерация звука Звук Речь аудио CPU режим Медленнее без видеопамяти GPU режим CUDA видеопамять Ресурсы Веса модели открытый код Text-Prompted Generative Audio Model Библиотека transformers · Лицензия MIT
Как устроен конвейер Bark. Схема нарисована по паспорту инструмента.

Паспорт

Задачаtext-to-speech источник
Лицензия кодаMIT источник
Лицензия весовmit источник
ПлатформаCUDA по описанию автора источник
Видеопамять12 ГБ по описанию автора источник
Самый большой файл весов4.2 ГБ источник
Все файлы весов4.2 ГБ источник
Библиотекаtransformers источник
ЯзыкJupyter Notebook источник
Последнее изменение кода2024-08-19 источник
Репозиторий создан2023-04-07 источник
Меняется часто — данные на 19.08.2026
Звёзд на GitHub39239 источник
Форков4673 источник
Загрузок за месяц38689 источник
Обновление модели2023-10-04 источник

Значения собраны автоматически из официальных источников и проверены 19.08.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.

Смотрите также