Запуск моделей MiniMax на своём железе
MiniMax выкладывает веса почти всей линейки — не только видео и музыки, но и текстовых моделей. В официальном профиле на Hugging Face лежит восемь моделей. Закрыта одна: речевая Speech 2.8. Другой вопрос, что скачать и запустить — не одно и то же: размеры отличаются в сотни раз.
MiniMax H3 — 33 млрд
Омнимодальная генерация видео. Именно вокруг неё собрался технический хвост запросов: сборки для ComfyUI, квантизации, отдельные VAE и адаптеры LoRA.
MiniMax Music3 — 2 млрд
Генерация музыки. После закрытия платного музыкального API для новых пользователей открытая модель осталась основным способом работать с ней у себя.
Что именно выложено
Состав официального профиля MiniMax на Hugging Face. Размер в параметрах — главный ориентир: он определяет, влезет ли модель в вашу видеопамять.
| Модель | Размер | Задача | Где запускается |
|---|---|---|---|
| MiniMax-Music3 | 2 млрд | текст в звук | домашняя видеокарта |
| MiniMax-H3 | 33 млрд | изображение и текст в видео | мощная домашняя видеокарта, с квантизацией |
| MiniMax-M2, M2.1, M2.5, M2.7 | 229 млрд каждая | текст | серверное железо |
| MiniMax-M3 | 427 млрд | изображение и текст в текст | серверное железо |
| MiniMax-M3-MXFP8 | 440 млрд, сжатая | то же, в пониженной точности | серверное железо |
| VTP-Base, VTP-Large | 0,3 и 0,7 млрд | извлечение признаков изображения | что угодно |
Речевой Speech 2.8 в профиле нет. Озвучка — единственная часть линейки, которую нельзя унести к себе: она работает только через платформу, по подписке или поштучно.
Зачем вообще запускать локально
Через API секунда видео в 2K стоит $0,13. При работе с длинными планами и множеством дублей счёт набегает быстро, и на этапе подбора кадра платить за каждую неудачную попытку невыгодно.
Локальный запуск снимает поштучную оплату целиком, но переносит стоимость на железо и время: модель нужно скачать, разместить в памяти видеокарты и обслуживать окружение самому.
Что делает квантизация
Веса в исходном виде рассчитаны на профессиональные карты с большим объёмом видеопамяти. Квантизация — пересчёт весов в более грубое представление — уменьшает требования к памяти ценой части качества.
В запросах вокруг H3 постоянно встречаются форматы GGUF и int8: это и есть попытки уложить модель в карту потребительского класса. Чем грубее квантизация, тем меньше памяти нужно и тем заметнее просадка детализации.
Важная оговорка про GGUF. Сама MiniMax сборок в этом формате не публикует: в её профиле лежат исходные веса и один сжатый вариант M3 в MXFP8. Всё, что ходит как «H3 в GGUF», включая варианты INT4 и NVFP4, — работа сообщества, выложенная сторонними авторами. Пользоваться этим можно, но поддержки и гарантий у таких сборок нет, и вести себя они могут иначе, чем оригинал.
Из чего складывается локальная сборка
Набор компонентов у видеомодели больше, чем у текстовой: помимо самих весов нужны части, отвечающие за кодирование и декодирование кадра.
Веса модели
Основной файл. Именно он существует в нескольких вариантах точности — от полной до сильно сжатой.
VAE
Отдельный компонент, переводящий внутреннее представление в изображение и обратно. Раздаётся отдельным файлом и тоже бывает в разной точности.
Адаптеры LoRA
Небольшие надстройки поверх весов, меняющие стиль или поведение модели без её переобучения. Подключаются поверх базовой сборки.
ComfyUI как основная среда
Локальный H3 запускают в ComfyUI — узловом редакторе, где генерация собирается схемой из блоков. Там же подключаются VAE и адаптеры.
Это не единственный путь, но самый популярный: под ComfyUI выкладывают готовые схемы, и повторить чужую сборку проще, чем собирать своё окружение с нуля.
Открытые веса не отменяют платного доступа. Дома реально живут H3 и Music3. Текстовые модели формально тоже открыты, но 229 и 427 миллиардов параметров — это не домашняя задача, и на практике к ним ходят через API. Озвучка закрыта совсем.
Локальная сборка и платный доступ не заменяют друг друга: на своём железе идут открытые веса H3 и Music 3.0, через оплату — текстовая линейка и всё остальное.