- Блог
- MiniMax H3 ComfyUI: Полное руководство по настройке рабочих процессов T2V, I2V и R2V
MiniMax H3 ComfyUI: Полное руководство по настройке рабочих процессов T2V, I2V и R2V

Обзор ИИ
Можно ли запускать MiniMax H3 локально в ComfyUI?
Да. У MiniMax H3 открыты веса модели и имеется встроенная поддержка в ComfyUI 0.30.0 или новее. Загрузите шаблон H3, скачайте требуемую диффузионную модель, текстовый энкодер и два VAE, затем запустите её на своём собственном оборудовании.
Какие рабочие процессы поддерживает MiniMax H3 в ComfyUI?
ComfyUI поставляется со шаблонами H3 для генерации видео из текста (Text-to-Video), из изображения (Image-to-Video) с необязательными первым/последним кадрами и из опорного материала (Reference-to-Video). Все три варианта способны генерировать нативный стереозвук — речь, звуковые эффекты и музыку — совместно с видео.
Сколько видеопамяти (VRAM) требуется для запуска MiniMax H3 в ComfyUI?
Единого жёсткого минимума не существует. Практически достижимой целью является видеокарта с 24 ГБ VRAM для усечённой int8-версии рабочего процесса; сообществом проведены тесты с пониженным разрешением 480p на картах с 12 ГБ VRAM при наличии 32 ГБ системной ОЗУ, выгрузки данных в ОЗУ и быстрого хранилища.
Готовы попробовать сами?
Бесплатные кредиты при регистрации. Тарифы от $20 в месяц.
Существует ли более простая альтернатива локальному запуску MiniMax H3 в ComfyUI?
Да. Seedance предоставляет генерацию аудио- и видеоконтента прямо в браузере без необходимости загружать локальные модели, настраивать узлы или планировать объём видеопамяти GPU. Это проще, когда требуется готовый клип, а не пользовательский локальный граф.
Что такое MiniMax H3 и почему стоит запускать её в ComfyUI?
MiniMax H3 — это открытая мультимодальная генеративная модель, способная одновременно обрабатывать текст, изображения, видео и аудио в едином контексте. Она может генерировать видео с разрешением до 2K, частотой кадров 24 fps и продолжительностью около 15 секунд, при этом голос, звуковые эффекты и музыка создаются как единый нативный стереозвук.
ComfyUI превращает эти возможности в наглядный граф узлов. Вы можете выбрать точность модели, seed, разрешение, длительность, планировщик (scheduler), опорные материалы, первый или последний кадр, а также путь вывода — после чего сохранить граф как повторяемый производственный рабочий процесс. Встроенные шаблоны охватывают T2V, I2V и R2V, а базовые узлы H3 можно перекомбинировать для создания более специализированных графов.
Запускайте H3 локально, когда важнее контроль над параметрами, повторное использование узлов, конфиденциальность входных данных или автоматизация пакетной обработки, чем время настройки. Подходит создателям, уже знакомым с ComfyUI, и командам, стремящимся избежать ограничений API по количеству вызовов. Компромисс заключается в значительных требованиях к дисковому пространству, необходимости тщательного планирования объёма видеопамяти GPU, длительных загрузках и большем количестве проблем, требующих диагностики, по сравнению с браузерным решением.
Требования к системе и загрузка моделей
Обновите ComfyUI до версии 0.30.0 или новее, затем откройте Workflow → Browse Workflow Templates → Video и выберите шаблон MiniMax H3. ComfyUI может запросить отсутствующие файлы, однако их ручное размещение упрощает диагностику проблем.
| Требуемый файл | Разместить в | Назначение |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors |
ComfyUI/models/diffusion_models/ |
Генерация T2V, I2V, первого/последнего кадра |
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors |
ComfyUI/models/text_encoders/ |
Мультимодальное понимание промптов и опорных материалов |
minimax_h3_video_vae_fp16.safetensors |
ComfyUI/models/vae/ |
Кодирование и декодирование видео в латентное пространство |
minimax_h3_audio_vae_fp32.safetensors |
ComfyUI/models/vae/ |
Нативное кодирование и декодирование аудио |
Для R2V вместо файла FL2VA используйте minimax_h3_ref2va_pruned_int8_convrot.safetensors в каталоге diffusion_models/. Сохраняйте полные имена файлов; после их добавления обновите список моделей или перезапустите ComfyUI.
Считайте 24 ГБ VRAM комфортной ориентировочной целью для усечённой int8-конфигурации, а не официально заявленным минимальным значением. Для карт с меньшим объёмом видеопамяти потребуется использовать меньшие кадры, более короткие клипы, агрессивную выгрузку данных и достаточный объём системной ОЗУ плюс место на NVMe-накопителе для подкачки моделей. Если граф не загружается или большую часть времени тратит на подкачку, сначала уменьшите разрешение или перенесите рабочий процесс на облачное оборудование.
Настройка рабочего процесса MiniMax H3 Text-to-Video (T2V)
- Откройте библиотеку шаблонов и загрузите MiniMax H3 T2V.
- Убедитесь, что выбраны диффузионная модель, текстовый энкодер Qwen3-VL, видео-VAE и аудио-VAE.
- В Resolution Selector выберите соотношение сторон и количество мегапикселей; оставьте значение
multipleравным32. - Введите один структурированный промпт, задайте длительность и seed, затем отправьте граф в очередь.
- Просмотрите изображение, диалог, звуковые эффекты, музыку и финальный кадр перед повышением разрешения.
Рабочий холст H3 «из коробки» использует короткую сторону 768 px и ограничивает длинную сторону примерно 1344 px. При соотношении сторон 16:9 и ~1,0 мегапикселя получается разрешение примерно 1344×768. Начинайте с меньших размеров для тестирования промптов, затем масштабируйте только проверенную конфигурацию. Длительность привязывается к сетке блоков кадров H3 при 24 fps, поэтому ComfyUI может немного скорректировать указанное значение.
Сначала опишите сцену, затем — синхронизированное действие, движение камеры и аудио — всё в одном блоке промпта. Чёткое описание T2V работает надёжнее, чем перечень несвязанных кинематографических эпитетов. Для более быстрого старта на облачной платформе рабочий процесс Seedance Text to Video исключает необходимость настройки локального графа и загрузки моделей.
Официальный вывод шаблона ComfyUI для MiniMax H3 T2V. Это реальный пример рабочего процесса, повторно размещённый на Seedance R2 для надёжного воспроизведения.
Настройка рабочего процесса MiniMax H3 Image-to-Video (I2V)
Шаблон I2V использует узел MiniMaxH3ImageToVideo. Подключите изображение к входу first_frame, при необходимости подключите другое изображение к входу last_frame и опишите движение между ними. Оба входа являются необязательными на уровне узла, поэтому одни и те же веса FL2VA поддерживают рабочие процессы, управляемые текстом, первым кадром, последним кадром или обоими кадрами одновременно.
I2V лучше всего подходит для демонстрации продуктов, обеспечения непрерывности персонажей, контролируемых переходов и анимации, ориентированной на стиль. Согласуйте выходное разрешение с холстом H3 (короткая сторона 768 px), убедитесь, что размеры кратны 32, и избегайте подачи слишком маленького или сильно сжатого исходного изображения. Сначала опишите то, что должно остаться неизменным, а затем — движение камеры.

Реальное входное изображение, поставляемое вместе со шаблоном MiniMax H3 I2V для ComfyUI.
Официальный результат I2V на основе этого исходного изображения. Сравните форму изделия, материалы, расположение колёсика, траекторию камеры и звук — не только визуальное впечатление от первого кадра.
Если вы хотите реализовать ту же идею «изображение → движение», но без необходимости хранить веса локально, попробуйте Seedance Image to Video.
Настройка рабочего процесса MiniMax H3 Reference-to-Video (R2V)
R2V использует узел MiniMaxH3ReferenceToVideo и отдельные веса диффузионной модели ref2va. Он принимает смешанные входные данные: изображения, видео и аудио, поэтому целевой кадр может заимствовать идентичность персонажа, визуальный стиль, движение объекта, перемещение камеры или голос из разных источников.
Подключайте ссылки в строго определённом порядке и называйте их точно так же в подсказке: <Picture 1>, <Video 1> и <Audio 1>. Назначьте каждой ссылке одну конкретную задачу. Например: сохранить персонажа из <Picture 1>, использовать движение камеры «долли» из <Video 1> и сопоставить голос из <Audio 1>. Текущий рабочий процесс ComfyUI поддерживает до девяти изображений, трёх видео и трёх автономных аудиоклипов.
Используйте параметр ref_image_size=match для более быстрых тестов или max, чтобы сохранить короткую сторону ссылки до 2048 пикселей, когда важнее точность идентичности, чем скорость. Слишком большое количество перекрывающихся ссылок может ослабить выполнение инструкций, поэтому сначала проверьте работоспособность графа с двумя ссылками, прежде чем добавлять больше.
Официальный вывод шаблона R2V с использованием распространяемых ссылок на персонажа и стиль.
Для облачного рабочего процесса с ссылками откройте Seedance Reference to Video. В руководстве по MiniMax H3 для работы со ссылками-видео подробно описаны принципы составления подсказок и распределения ролей между ссылками.
Советы по написанию подсказок для улучшения результата MiniMax H3
Для подсказок H3 используйте три чётко обозначенных поля: integrated_multimodal_description, overall_soundscape и non_diegetic_music. Внутри описания сцены укажите временные метки кадров, видимые действия, направление камеры и точный диалог. Присвойте повторяющимся говорящим стабильные идентификаторы, например (S1), а произносимые слова размещайте исключительно внутри тега <d>[English] ...</d>.
T2VA — слабо: Кинематографичная городская сцена с крутым звуком.
T2VA — лучше: 0–3 с: широкий план мокрого пешеходного перехода, медленное движение камеры «долли» вперёд; 3–7 с: курьер поворачивается к камере. Шаги и дорожный шум в стереорежиме; низкие ударные начинаются с 4 с.
I2VA/FL2VA — слабо: Анимируйте это изображение драматично.
I2VA/FL2VA — лучше: Сохраните геометрию изделия, колёсико, кнопки, прозрачный корпус и сине-оранжевую подсветку. Один медленный оборот на 30 градусов; никакого нового текста или деталей. Завершите анимацию, совместив последний кадр с предоставленным финальным кадром.
R2V — слабо: Используйте все ссылки и создайте экшен-видео.
R2V — лучше: Сохраните идентичность и костюм из <Picture 1>; скопируйте только движение камеры из <Video 1>; сопоставьте тембр голоса из <Audio 1>. Не переносите субъект или фон из видео.
T2VA требует полного описания мира. I2VA должен защищать исходное изображение перед добавлением движения. FL2VA и L2VA должны описывать переход в предоставленный граничный кадр. R2V должен чётко объяснить взаимосвязь каждой ссылки с целевым результатом. В руководстве по составлению подсказок MiniMax H3 эти режимно-специфичные шаблоны рассматриваются подробнее.
MiniMax H3 в ComfyUI против браузерных ИИ-инструментов для генерации видео
| Критерий | Локальный H3 в ComfyUI | Seedance | Comfy Cloud |
|---|---|---|---|
| Установка | Установка/обновление ComfyUI и размещение крупных весов | Открытие в браузере | Загрузка размещённого в облаке шаблона ComfyUI |
| Локальная видеопамять (VRAM) | Обязательна; параметры зависят от точности и выходного разрешения | Не требуется | Не требуется локально |
| Контроль над рабочим процессом | Полный контроль на уровне узлов и автоматизация | Упрощённый интерфейс генерации | Граф ComfyUI без необходимости локального оборудования |
| Встроенная поддержка аудио | Стерео-аудио H3 в рамках одной генерации | Совместный рабочий процесс аудио и видео | Тот же рабочий процесс H3 на облачных вычислительных ресурсах |
| Оптимально для | Глубокой кастомизации, локальных входных данных и многократно используемых графов | Быстрой генерации идей и производства без предварительной настройки | Пользователей ComfyUI, не имеющих локальной видеокарты |
Выбирайте локальный ComfyUI, если сам граф является частью вашей производственной системы. Выбирайте облачный ComfyUI, если вам нужны его узлы, но вы не хотите нести нагрузку по обслуживанию оборудования. Выбирайте Seedance, если вы хотите быстро перейти от подсказки или ссылки к готовому клипу, минимизировав решения по инфраструктуре. Попробуйте Seedance прямо в браузере →
Заключение
MiniMax H3 — один из самых мощных открытых вариантов моделей для ComfyUI, способный генерировать видео и встроенный аудиопоток одновременно. Начните работу в три шага: обновитесь до ComfyUI 0.30.0+, поместите модель диффузии, текстовый энкодер и два VAE в соответствующие папки, затем загрузите подходящий шаблон T2V, I2V или R2V. На начальных этапах проводите тесты с небольшими объёмами данных, каждому ссылочному элементу назначайте чёткую задачу и повышайте разрешение только после того, как подсказка будет работать корректно; если локальные загрузки, требования к видеопамяти и обслуживание узлов перевешивают преимущества глубокого контроля, браузерный рабочий процесс Seedance станет более быстрым путём к производству.
Готовы попробовать сами?
Примените шаги из этого руководства в Seedance и превратите промпты или изображения в готовые видео за считанные минуты.
Бесплатные кредиты при регистрации. Тарифы от $20 в месяц.
Похожие статьи
Еще материалы на этом же языке, которые стоит прочитать дальше.

MiniMax H3 Turbo LoRA: руководство по настройке генерации видео в 5 раз быстрее
Установите MiniMax H3 Turbo LoRA в ComfyUI, выберите версию v4 или v1, подключите узел сэмплера и настройте генерацию за 4–8 шагов для более быстрого видео со стереозвуком.
Читать статью
Исправление «абракадабры» в MiniMax H3: причины возникновения и способы решения
Устранение «абракадабры» в аудио MiniMax H3 с помощью более чистых тегов диалога, укороченных промптов, стабильных идентификаторов говорящих, одноязычных сценариев и практических резервных рабочих процессов.
Читать статью
Seedance 2.5 Unlimited: тарифные планы, кредиты и способы генерации большего количества видео
Узнайте, что на самом деле означает «безлимитный» режим Seedance 2.5, сравните тарифные планы и кредиты, оцените ежемесячный объём генерируемых видео и улучшите промпты для высокопроизводительного производства.
Читать статью