Edge0 выпустила 35B MoE-модель, работающую в 3 ГБ памяти
На HuggingFace опубликована Edge0-35B-A3B-preview — текстовая модель класса 35B с разреженной MoE-архитектурой. Авторы заявляют, что она декодирует со скоростью 15 ток/с при активном потреблении памяти менее 3 ГБ.
Что это значит
Модель насчитывает 34.7 млрд параметров, веса в репозитории занимают 18.3 ГБ в формате safetensors, лицензия — apache-2.0. Запуск выполняется через фреймворк edge0 с потоковой загрузкой экспертов: полный 4-битный чекпоинт остаётся на диске, а в память подгружаются только активные веса. Квантованных сборок на площадке пока нет — чекпоинт уже поставляется в int4 вместе с LoRA и адаптерами prerouter.
Для запуска нужен сам фреймворк edge0, который стримит веса экспертов с накопителя по мере обращения. Пиковая память ограничена активным набором весов, а не общим числом параметров, поэтому модель помещается в память телефона без шардирования. Насколько такой подход чувствителен к скорости диска, разработчик не уточняет.
Модель находится в статусе раннего превью, и судить о её практической применимости пока рано. Но сам подход — держать веса на диске и подгружать только нужных экспертов — интересен для тех, кто запускает LLM на машинах с ограниченной памятью. Следить за развитием можно в ленте новостей CPU3D.Как устроен метод. Схема нарисована по этой заметке.