Ollama v0.40.0 переводит модели на MLX на Apple Silicon по умолчанию
Вышел выпуск Ollama v0.40.0. Главное изменение: на устройствах Apple Silicon модели, архитектуры которых поддерживает среда выполнения MLX, теперь автоматически запускаются через MLX. Пример от разработчиков — ollama pull qwen3.8 и ollama run qwen3.8. В течение предварительного релиза авторы обещают тестировать и включать дополнительные модели.
Что это значит
Для тех, кто запускает модели на Mac с чипами M-серии, это изменение в поведении по умолчанию: отдельная настройка для перехода на MLX не требуется. Если архитектура модели поддерживается MLX, Ollama сам выберет этот рантайм при загрузке. Разработчик не уточняет, какие именно архитектуры уже включены, а какие появятся позже, — в описании выпуска указано только, что список будет расширяться в ходе предварительного тестирования.
Обновление стоит отслеживать тем, кто работает с моделями на Apple Silicon и хочет понять, как меняется производительность и потребление памяти на их конкретных задачах. Поскольку выпуск помечен как pre-release, поведение может меняться от сборки к сборке.
Следить за новостями об инструментах для локального запуска нейросетей можно в ленте CPU3D.Как устроен метод. Схема нарисована по этой заметке.