MiniMax H3 ComfyUI: T2V, I2V 및 R2V 워크플로우를 위한 완전한 설정 가이드

E
Emma Chen·7분 읽기·Aug 17, 2026
X에 공유
MiniMax H3 ComfyUI: T2V, I2V 및 R2V 워크플로우를 위한 완전한 설정 가이드

AI 개요

ComfyUI에서 MiniMax H3를 로컬로 실행할 수 있나요?

예. MiniMax H3는 오픈 웨이트(open weights)를 제공하며, ComfyUI 0.30.0 이상 버전에서 네이티브로 지원됩니다. H3 템플릿을 불러오고, 필요한 확산 모델(diffusion model), 텍스트 인코더(text encoder), 두 개의 VAE를 다운로드한 후, 자체 하드웨어에서 실행할 수 있습니다.

ComfyUI에서 MiniMax H3는 어떤 워크플로우를 지원하나요?

ComfyUI는 텍스트-투-비디오(T2V), 선택적 첫 번째/마지막 프레임을 포함한 이미지-투-비디오(I2V), 레퍼런스-투-비디오(R2V)용 H3 템플릿을 기본 제공합니다. 이 세 가지 모두 비디오와 함께 네이티브 스테레오 대사, 음향 효과, 음악을 생성할 수 있습니다.

ComfyUI에서 MiniMax H3를 실행하려면 얼마나 많은 VRAM이 필요하나요?

단일 하드 미니멈 값은 존재하지 않습니다. 24GB GPU는 가지치기된 int8 워크플로우에 대한 실용적인 목표 사양입니다. 커뮤니티에서 수행된 축소된 480p 테스트는 12GB GPU와 32GB 시스템 RAM, 오프로딩(offloading), 고속 스토리지를 사용해 성공적으로 실행되었습니다.

직접 해볼 준비가 되셨나요?

가입 시 무료 크레딧 제공. 요금제는 월 $20부터.

Seedance 무료로 사용해보기

ComfyUI에서 MiniMax H3를 로컬로 실행하는 것보다 더 쉬운 대안이 있나요?

예. Seedance는 로컬 모델 다운로드, 노드 설정, GPU 메모리 계획 없이 브라우저 기반 오디오-비디오 생성을 제공합니다. 완성된 클립을 원할 때, 맞춤형 로컬 그래프보다는 간편함이 우선시되는 경우에 더 적합합니다.

MiniMax H3란 무엇이며, 왜 ComfyUI에서 실행해야 하나요?

MiniMax H3는 텍스트, 이미지, 비디오, 오디오를 단일 컨텍스트에서 이해하는 오픈 웨이트의 옴니-모달(omni-modal) 생성 모델입니다. 최대 2K 해상도, 24fps, 약 15초 길이의 비디오를 생성할 수 있으며, 음성, 음향 효과, 음악을 네이티브 스테레오 오디오로 통합 생성합니다.

ComfyUI는 이러한 기능을 시각화 가능한 노드 그래프로 전환합니다. 모델 정밀도, 시드(seed), 해상도, 지속 시간, 스케줄러(scheduler), 레퍼런스, 첫 번째 또는 마지막 프레임, 출력 경로 등을 직접 선택할 수 있으며, 그래프를 반복 가능한 제작 워크플로우로 저장할 수 있습니다. 네이티브 템플릿은 T2V, I2V, R2V를 모두 지원하며, 핵심 H3 노드는 보다 전문화된 그래프를 위해 재조합할 수 있습니다.

매개변수 제어, 재사용 가능한 노드, 비공개 입력, 또는 배치 자동화가 설정 시간보다 중요할 때 로컬에서 H3를 실행하세요. 이미 ComfyUI를 숙지한 창작자나 API 호출당 할당량 제한을 피하고 싶은 팀에 적합합니다. 단점은 상당한 저장 공간, GPU 메모리 계획, 긴 다운로드 시간, 브라우저 기반 워크플로우보다 더 많은 문제 해결 작업이 필요하다는 점입니다.

시스템 요구 사항 및 모델 다운로드

ComfyUI를 0.30.0 이상 버전으로 업데이트한 후, Workflow → Browse Workflow Templates → Video를 열고 MiniMax H3 템플릿을 선택하세요. ComfyUI는 누락된 파일을 자동으로 요청할 수 있지만, 수동으로 위치 지정하면 문제 진단이 더 용이합니다.

필수 파일 저장 위치 용도
minimax_h3_fl2va_pruned_int8_convrot.safetensors ComfyUI/models/diffusion_models/ T2V, I2V, 첫 번째/마지막 프레임 생성
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors ComfyUI/models/text_encoders/ 멀티모달 프롬프트 및 레퍼런스 이해
minimax_h3_video_vae_fp16.safetensors ComfyUI/models/vae/ 비디오 잠재 공간(latent space) 인코딩 및 디코딩
minimax_h3_audio_vae_fp32.safetensors ComfyUI/models/vae/ 네이티브 오디오 인코딩 및 디코딩

R2V는 diffusion_models/minimax_h3_ref2va_pruned_int8_convrot.safetensors를 FL2VA 확산 파일 대신 사용합니다. 전체 파일명을 그대로 유지하세요. 파일을 추가한 후에는 모델을 새로 고치거나 ComfyUI를 재시작하세요.

가지치기된 int8 경로에 대해 24GB VRAM을 편안한 계획 기준으로 삼으세요. 공식 최소 사양이 아닙니다. 낮은 메모리 GPU는 더 작은 프레임, 더 짧은 클립, 공격적인 오프로딩, 충분한 시스템 RAM 및 NVMe 공간을 통한 모델 스왑이 필요합니다. 그래프가 로드되지 않거나 대부분의 시간을 스왑에 소비한다면, 먼저 해상도를 낮추거나 워크플로우를 클라우드 하드웨어로 이전하세요.

MiniMax H3 텍스트-투-비디오(T2V) 워크플로우 설정

  1. 템플릿 라이브러리를 열고 MiniMax H3 T2V를 불러옵니다.
  2. 확산 모델, Qwen3-VL 텍스트 인코더, 비디오 VAE, 오디오 VAE가 올바르게 선택되었는지 확인합니다.
  3. Resolution Selector에서 화면 비율과 메가픽셀 값을 선택하세요. multiple 값은 32로 유지합니다.
  4. 하나의 구조화된 프롬프트를 입력하고, 지속 시간과 시드를 설정한 후 그래프를 큐에 등록합니다.
  5. 해상도를 높이기 전에, 영상, 대사, 음향 효과, 음악, 최종 프레임을 검토합니다.

H3의 네이티브 작업 캔버스는 짧은 변을 768px로 사용하며, 한쪽 변을 약 1344px로 제한합니다. 16:9 비율에서 약 1.0 메가픽셀은 약 1344×768에 해당합니다. 프롬프트 테스트를 위해 더 작은 크기로 시작한 후, 승인된 설정만 확장하세요. 지속 시간은 24fps 기준 H3의 프레임 블록 격자에 맞춰 조정되므로, ComfyUI가 요청된 값을 약간 조정할 수 있습니다.

먼저 장면을 서술하고, 그 다음 타이밍된 동작, 카메라 이동, 오디오를 동일한 프롬프트 블록 내에 기술하세요. 관련 없는 영화적 형용사 목록보다는 깔끔한 T2V 프롬프트가 더 신뢰할 수 있습니다. 더 빠른 호스팅 기반 시작점을 원하시면, Seedance 텍스트-투-비디오 워크플로우를 사용하면 로컬 그래프 및 다운로드 단계를 생략할 수 있습니다.

MiniMax H3 T2V · 공식 ComfyUI 템플릿 출력

MiniMax H3 T2V용 공식 ComfyUI 템플릿 출력입니다. 실제 워크플로우 샘플이며, 신뢰성 있는 재생을 위해 Seedance R2에 재호스팅되었습니다.

MiniMax H3 이미지-투-비디오(I2V) 워크플로우 설정

I2V 템플릿은 MiniMaxH3ImageToVideo를 사용합니다. 이미지를 first_frame에 연결하고, 선택적으로 다른 이미지를 last_frame에 연결한 후, 두 프레임 사이의 움직임을 설명하세요. 두 입력 모두 노드 수준에서 선택 사항이므로, 동일한 FL2VA 가중치로 텍스트 중심, 첫 번째 프레임 중심, 마지막 프레임 중심, 또는 첫 번째 및 마지막 프레임 모두를 사용하는 워크플로우를 모두 지원합니다.

I2V는 제품 전시, 캐릭터 연속성, 제어된 전환, 스타일 중심 애니메이션에 가장 적합합니다. 출력을 H3의 768px 짧은 변 캔버스에 맞추고, 차원을 32의 배수가 되도록 유지하며, 너무 작거나 과도하게 압축된 소스 이미지를 피하세요. 카메라 움직임을 설명하기 전에 반드시 유지되어야 할 요소를 먼저 기술하세요.

MiniMax H3 I2V 템플릿에서 공식적으로 사용하는 투명 게이밍 마우스 입력

ComfyUI의 MiniMax H3 I2V 템플릿과 함께 배포된 실제 입력 이미지.

MiniMax H3 I2V · 공식 ComfyUI 템플릿 출력

해당 소스 이미지로부터 생성된 공식 I2V 결과물. 제품 형태, 재질, 휠 배치, 카메라 경로, 음향을 — 단순히 첫 프레임의 인상뿐 아니라 — 비교하세요.

로컬 가중치를 유지하지 않고도 동일한 입력-대-모션 아이디어를 시도하려면 Seedance 이미지-대-비디오를 이용하세요.

MiniMax H3 레퍼런스-대-비디오(R2V) 워크플로 설정

R2V는 MiniMaxH3ReferenceToVideo 노드와 별도의 ref2va 확산 가중치(diffusion weights)를 사용합니다. 이 워크플로는 이미지, 비디오, 오디오를 혼합하여 입력받을 수 있으므로, 목표 씬은 다양한 출처에서 캐릭터 정체성, 시각 스타일, 피사체 동작, 카메라 이동, 또는 음성을 차용할 수 있습니다.

레퍼런스를 의도적으로 순서대로 연결하고, 프롬프트 내에서 정확히 다음과 같이 이름을 지정하세요: <Picture 1>, <Video 1>, <Audio 1> — 각 레퍼런스에 하나의 역할만 할당하세요. 예를 들어, <Picture 1>에서 캐릭터 정체성을 보존하고, <Video 1>에서 달리(dolly) 이동을 적용하며, <Audio 1>에서 음성 톤을 일치시킬 수 있습니다. 현재 ComfyUI 워크플로는 최대 9개의 이미지, 3개의 비디오, 3개의 독립 오디오 클립을 지원합니다.

테스트 속도를 우선시할 경우 ref_image_size=match를 사용하거나, 정체성 보존이 속도보다 중요할 때는 max를 사용해 참조 이미지의 짧은 변을 최대 2048px까지 보존하세요. 너무 많은 레퍼런스가 중복되면 명령 수행 정확도가 약화될 수 있으므로, 추가 레퍼런스를 넣기 전에 반드시 두 개 레퍼런스 기반 그래프를 먼저 검증하세요.

MiniMax H3 R2V · 공식 ComfyUI 템플릿 출력

배포된 캐릭터 및 스타일 레퍼런스를 활용한 공식 R2V 템플릿 출력.

호스팅된 레퍼런스 워크플로를 사용하려면 Seedance 레퍼런스-대-비디오를 열어보세요. 자세한 프롬프트 작성법 및 레퍼런스 할당 절차는 MiniMax H3 레퍼런스-비디오 가이드에서 확인할 수 있습니다.

MiniMax H3 출력 품질 향상을 위한 프롬프트 작성 팁

H3 프롬프트에는 세 가지 명시적 필드를 사용하세요: integrated_multimodal_description, overall_soundscape, non_diegetic_music. 장면 설명 내에서는 타이밍된 샷, 시각적으로 보이는 동작, 카메라 방향, 정확한 대사를 기재해야 합니다. 반복 등장하는 화자는 (S1)과 같은 고정 ID를 부여하고, 대사만 <d>[English] ...</d> 안에 넣으세요.

T2VA — 약함: 멋진 사운드가 있는 영화 같은 도시 장면.

T2VA — 개선됨: 0–3초: 비 오는 횡단보도 전체샷, 천천히 앞으로 달리(dolly forward); 3–7초: 택배원이 카메라 쪽으로 돌아섬. 스테레오 발자국 소리와 교통 소음; 4초부터 낮은 퍼커션 시작.

I2VA/FL2VA — 약함: 이 이미지를 극적으로 애니메이션하세요.

I2VA/FL2VA — 개선됨: 제품의 기하학적 형태, 휠, 버튼, 투명 케이스, 파랑-주황 조명을 보존하세요. 한 번의 느린 30도 궤도 회전; 새로운 텍스트나 부품은 추가하지 마세요. 마지막 프레임과 정렬된 상태로 종료하세요.

R2V — 약함: 모든 레퍼런스를 사용해 액션 비디오를 만드세요.

R2V — 개선됨: <Picture 1>에서 캐릭터 정체성과 복장을 유지하세요; <Video 1>에서 카메라 이동만 복사하세요; <Audio 1>에서 음성 톤을 일치시키세요. 비디오의 피사체나 배경은 전달하지 마세요.

T2VA는 완전한 세계 묘사가 필요합니다. I2VA는 모션을 추가하기 전에 원본을 보호해야 합니다. FL2VA와 L2VA는 제공된 경계 프레임으로의 전환을 명시적으로 설명해야 합니다. R2V는 모든 레퍼런스와 목표 간 관계를 설명해야 합니다. MiniMax H3 프롬프트 가이드에서는 이러한 모드별 패턴을 더 상세히 다룹니다.

MiniMax H3: ComfyUI 대 브라우저 기반 AI 비디오 도구 비교

항목 로컬 ComfyUI 내 H3 Seedance Comfy Cloud
설치 ComfyUI 설치/업데이트 및 대용량 가중치 배치 브라우저에서 바로 실행 호스팅된 ComfyUI 템플릿 로드
로컬 VRAM 필요; 정밀도 및 출력 해상도에 따라 설정 달라짐 불필요 로컬에서는 불필요
워크플로 제어 노드 수준의 완전한 제어 및 자동화 가능 간소화된 생성 인터페이스 로컬 하드웨어 없이 ComfyUI 그래프 실행
네이티브 오디오 동일 생성 과정에서 H3 스테레오 오디오 지원 오디오-비디오 통합 워크플로 클라우드 컴퓨팅 환경에서 동일 H3 워크플로
가장 적합한 용도 심층 맞춤화, 로컬 입력, 재사용 가능한 그래프 설치 없이 빠른 아이디어 구현 및 프로덕션 로컬 GPU 리소스가 부족한 ComfyUI 사용자

그래프 자체가 프로덕션 시스템의 일부인 경우 로컬 ComfyUI를 선택하세요. 하드웨어 부담 없이 ComfyUI 노드만 활용하고 싶다면 클라우드 호스팅 ComfyUI를 선택하세요. 인프라 결정을 최소화하고 프롬프트나 레퍼런스로부터 바로 실용적인 클립을 얻고 싶다면 Seedance를 선택하세요. 브라우저에서 Seedance 바로 시도하기 →

결론

MiniMax H3는 비디오와 네이티브 오디오를 동시에 생성할 수 있는 ComfyUI의 가장 강력한 오픈 웨이트(Open Weights) 옵션 중 하나입니다. 다음 세 단계로 시작하세요:

  1. ComfyUI를 0.30.0+ 이상으로 업데이트하세요.
  2. 확산 모델, 텍스트 인코더, 두 개의 VAE를 각각 올바른 폴더에 배치하세요.
  3. 해당 T2V, I2V 또는 R2V 템플릿을 로드하세요.

초기 테스트는 작게 시작하고, 모든 레퍼런스에 명확한 역할을 부여하세요. 프롬프트가 잘 작동한 후에야 해상도를 높이세요. 만약 로컬 다운로드, VRAM, 노드 관리가 심층 제어의 이점을 상쇄한다면, 브라우저 기반 Seedance 워크플로가 프로덕션으로 가는 더 빠른 길입니다.

직접 해볼 준비가 되셨나요?

이 가이드의 단계를 Seedance에서 바로 적용해 프롬프트나 이미지를 몇 분 안에 완성도 높은 영상으로 바꿔보세요.

가입 시 무료 크레딧 제공. 요금제는 월 $20부터.