Генераторы звука и речи на нейросетях: открытые модели
Здесь собраны модели, которые делают звук: музыку по описанию, звуковые эффекты, речь по тексту и клонирование голоса. У каждой — паспорт: лицензия, требования к памяти, платформа, форматы. Всё, что можно проверить машинно, взято из официальных источников и подписано датой проверки.
В разделе только открытые модели — те, что ставятся на свою машину. Про запуск на разном железе русскоязычные обзоры обычно молчат, а для звука это главный вопрос: многие модели заводятся и без большой видеокарты.
Материалы
15 материалов
YuE: генератор звука — что умеет и что нужно для запускаYuE — это открытый генератор звука от команды M-A-P, который авторы описывают как модель для создания полноценных песен. По заявлению разработчиков, п…
XTTS: генератор звука — что умеет и что нужно для запускаXTTS — это генератор речи с открытым кодом от Coqui. Он решает задачу text-to-speech: превращает текст в звучащую речь. Проект развивается в репозитор…
Stable Audio Open: генератор звука — что умеет и что нужно для запускаStable Audio Open — это генератор звука от Stability AI с открытым кодом. Он решает задачу text-to-audio: превращает текстовое описание в звуковой фай…
OpenVoice: генератор звука — что умеет и что нужно для запускаOpenVoice — это генератор речи с открытым кодом от команды MyShell. Он решает задачу text-to-speech и, по описанию авторов, относится к классу аудиофу…
MusicGen: генератор звука — что умеет и что нужно для запускаMusicGen — это генератор звука от Meta, который превращает текстовое описание в аудио. Он входит в библиотеку Audiocraft и решает задачу text-to-audio…
MOSS-SoundEffect без CUDA (Mac и AMD): генератор звука — что умеет и что нужно для запускаMOSS-SoundEffect без CUDA — это настольное приложение для генерации звуковых эффектов по текстовому описанию. Сборка ориентирована на компьютеры Mac с…
MOSS-SoundEffect: генератор звука — что умеет и что нужно для запускаMOSS-SoundEffect — это открытый генератор звука, который превращает текстовое описание в аудио. Задача модели — text-to-audio: пользователь описывает…
MMAudio: генератор звука — что умеет и что нужно для запускаMMAudio — открытый генератор звука, который синтезирует аудиодорожку по видео или текстовому описанию. Разработчики позиционируют его как инструмент д…
Fish Speech: генератор звука — что умеет и что нужно для запускаFish Speech — это открытый генератор речи от Fish Audio, который решает задачу text-to-speech: превращает текст в озвучку. Проект публикует и код, и г…
F5-TTS: генератор звука — что умеет и что нужно для запускаF5-TTS — это открытый генератор речи, который превращает текст в звук. Проект создан разработчиком SWivid и распространяется в виде кода и готовых вес…
DiffRhythm: генератор звука — что умеет и что нужно для запускаDiffRhythm — это генератор звука, который по описанию авторов предназначен для создания полноценных песен целиком, от текста до готового аудио, с помо…
CosyVoice: генератор звука — что умеет и что нужно для запускаCosyVoice — это генератор речи с открытым кодом от Alibaba. Он решает задачу text-to-speech: превращает текст в звучащую речь. Авторы описывают его ка…
ChatTTS: генератор звука — что умеет и что нужно для запускаChatTTS — это генератор звука с открытым кодом от команды 2noise. Он решает задачу text-to-audio: превращает текст в речь, ориентированную на повседне…
Bark: генератор звука — что умеет и что нужно для запускаBark — это генератор звука от Suno с открытым кодом, который решает задачу text-to-speech: превращает текст в речь и другие звуки по текстовому описан…
ACE-Step: генератор звука — что умеет и что нужно для запускаACE-Step — это открытый генератор звука, который превращает текстовое описание в аудио. Разработчики позиционируют его как шаг к базовой модели для ге…