- 블로그
- MiniMax H3 로컬 설정 가이드: ComfyUI, 모델, VRAM 및 첫 렌더링
AI Overview
MiniMax H3를 로컬에서 실행할 수 있나요?
예. MiniMax는 H3 가중치와 ComfyUI 호환 패키지를 공개했지만, 실용적인 설치를 위해서는 적절한 확산 모델(diffusion model), 텍스트 인코더(text encoder), 비디오 VAE, 오디오 VAE, 워크플로우(workflow), 그리고 오프로딩(offloading)을 위한 충분한 시스템 메모리가 필요합니다.
MiniMax H3 실행에 얼마나 많은 VRAM이 필요한가요?
정확한 요구 사양은 없습니다. 정밀도(precision), 양자화(quantization), 해상도(resolution), 지속 시간(duration), 오프로딩 방식 등에 따라 메모리 사용량이 달라지기 때문입니다. 24GB GPU는 가지치기된(pruned) INT8 워크플로우를 실행하기 위한 실용적인 목표치이며, 그보다 작은 GPU는 더 강력한 양자화와 인내심을 요구합니다.
어떤 MiniMax H3 모델을 다운로드해야 하나요?
텍스트, 첫 프레임, 마지막 프레임 또는 이미지 중심 생성에는 FL2VA를 선택하세요. 여러 참조 이미지, 비디오 또는 오디오를 입력으로 사용하는 워크플로우에는 Ref2VA를 선택하세요. 전체 저장소(repository)를 맹목적으로 다운로드하지 마세요.
로컬 H3가 Seedance Agent보다 우수한가요?
로컬 H3는 그래프 및 파일에 대한 최대 제어 권한을 제공합니다. 반면, 드라이버 관리, 가중치 유지, VRAM 우회 조치, 촬영 기록, 승인 절차, 부분 재실행 등을 직접 처리하지 않고 H3 출력만 원한다면 Seedance Agent이 더 나은 선택입니다.
시스템 준비 여부 결정하기
GPU 메모리, 시스템 RAM, 저장 공간을 함께 점검하세요
MiniMax H3 로컬 설정 가이드는 설치 명령어보다 먼저 시스템 용량(capacity) 평가로 시작해야 합니다. 공식 MiniMax 저장소는 여러 파이프라인과 구성 요소를 포함해 약 498GB에 달합니다. 일반적으로는 단 하나의 확산 체크포인트(diffusion checkpoint), 이에 매칭되는 텍스트 인코더, 비디오 VAE, 오디오 VAE, 하나의 워크플로우만 필요합니다. 캐시, 임시 파일, 출력 비디오 크기를 고려하지 않더라도, 축소된 스택조차 수십 기비바이트(GiB)를 차지할 수 있습니다.
간단한 ComfyUI 시작을 위해, 가지치기된 INT8 확산 모델과 공격적으로 축소된 텍스트 인코더(오프로딩 적용)를 실행하려면 24GB VRAM이 실용적인 목표치입니다. 12~16GB VRAM은 커뮤니티에서 제공하는 GGUF 또는 기타 양자화된 경로로 가능하지만, 설정이 더 민감해지고 생성 속도도 느려집니다. 8GB VRAM 주장은 보통 CPU/RAM에 대한 집중적 오프로딩과 특정 런타임에 의존하므로, “시작은 가능”하다고 간주하고 “편안함”과는 구분해야 합니다. 넉넉한 시스템 RAM과 고속 SSD 공간을 확보하세요. VRAM만이 유일한 한계가 아닙니다.
호스팅된 MiniMax H3 생성기는 가장 빠른 제어 테스트입니다. 동일한 짧은 아이디어를 먼저 여기서 실행해 보세요. 로컬 결과가 실패할 경우, 프롬프트 또는 모델 제한과 설치 문제를 분리해 진단할 수 있습니다.

이 가이드를 위해 제작된 완성된 출력 개념. 얼굴, 의복, 초승달 기하학, 도구 접촉, 불꽃, 작업장 배치는 로컬 환경에서의 첫 품질 검사에 엄격한 기준을 제시합니다.
Apple Silicon은 별도의 경로로 취급하세요
공식 통합 인덱스는 현재 Apple Silicon용 실험적 Metal 네이티브 H3 경로를 가리키고 있지만, 이는 표준 CUDA 및 ComfyUI 설정과 동일한 운영 경로가 아닙니다. NVIDIA wheel 명령어를 맥(Mac)에 복사해서 실행하려 하지 마세요. 선택한 프로젝트가 지원하는 칩, 메모리, 워크플로우 유형, 현재 제한 사항을 반드시 확인한 후 소규모 테스트를 수행하세요. 맥에서 신뢰할 수 있는 프로덕션을 원한다면, 초기 단계의 로컬 포트 디버깅보다 호스팅 경로가 더 빠를 수 있습니다.
올바른 스택 및 워크플로우 선택하기
라이브러리 수준 제어가 필요하지 않다면 ComfyUI부터 시작하세요
현재 템플릿이 모델 로더, 텍스트 인코더, VAE, 샘플러, 오디오 디코딩, 최종 비디오 조립을 모두 내장하고 있어, ComfyUI은 가장 접근하기 쉬운 로컬 경로입니다. H3 템플릿을 가져오기 전에 ComfyUI를 업데이트하세요. 이전 안정 버전은 필요한 노드 유형을 인식하지 못할 수 있습니다. 핵심 템플릿과 선택적 사용자 정의 노드 없이 시작하세요. 깨끗한 기준 렌더링 하나가 성공한 후에야 가속화, 캐싱, 보간, 업스케일링을 추가하세요.
직접 Diffusers 또는 사용자 정의 Python 경로는 서비스 개발 및 연구에 유용하지만, 더 많은 종속성과 파이프라인 결정을 노출시킵니다. 모델 호스팅 페이지에 표시된 간단한 코드 조각은 완전한 오디오-비디오 워크플로우를 반영하지 않을 수 있습니다. 로컬에서 단 하나의 클립만 생성하려는 목표라면, 파일명에서 모든 구성 요소를 재구성하기보다는 관리되는 워크플로우에서 시작하세요.
작업 유형에 맞춰 FL2VA 또는 Ref2VA를 선택하세요
FL2VA는 텍스트-투-비디오, 이미지-투-비디오, 첫/마지막 프레임 제어에 사용되는 모델 계열입니다. Ref2VA는 참조 이미지, 비디오, 오디오를 입력으로 사용하는 다른 체크포인트 계열입니다. FL2VA 가중치로 Ref2VA 워크플로우를 로드하는 것은 무해한 대체가 아닙니다. 그래프는 다른 조건부 입력 경로(conditioning route)를 기대합니다. Ref2V 대 FL2VA 가이드에서 이 결정을 자세히 설명합니다.
첫 번째 테스트에는 FL2VA 텍스트-투-비디오 또는 단일 이미지 I2V를 선택하세요. 구성 요소가 가장 적습니다. 기준선 테스트를 통해 런타임, VAE, 출력 체인이 정상 작동함을 확인한 후에만 Ref2VA로 전환하세요.
필수 파일 다운로드 및 배치하기
다운로드 전에 매니페스트(manifest) 작성하기
정확한 워크플로우 파일명과 이 파일이 참조하는 모든 모델 파일명을 기록하세요. 실용적인 매니페스트는 네 줄로 구성됩니다: 확산 모델, 텍스트 인코더, 비디오 VAE, 오디오 VAE. 정밀도, 파일 크기, 소스 저장소, 대상 디렉터리, 게시된 경우 체크섬(checksum)도 기록하세요. 이를 통해 두 가지 비용이 큰 실수—모든 가능한 변형을 다운로드하거나 서로 호환되지 않는 그래프용으로 설계되지 않은 파일을 혼합 사용하는 것—를 방지할 수 있습니다.
현재 ComfyUI 패키지의 디렉터리 구조는 다음과 같습니다:```text ComfyUI/models/diffusion_models/<H3 diffusion checkpoint> ComfyUI/models/text_encoders/<matching Qwen3-VL text encoder> ComfyUI/models/vae/<MiniMax H3 video VAE> ComfyUI/models/vae/<MiniMax H3 audio VAE>
오픈 웨이트 로컬 파이프라인은 768p 영상을 생성합니다. 호스팅되는 2K 재생성은 별도의 서비스입니다. 일반적인 로컬 그래프가 해당 출력 모드를 자동으로 지원한다고 기대하며 ‘2K’라고 표시된 파일을 다운로드하지 마십시오.
### 실행 전에 파일명을 반드시 확인하세요
각 다운로드 후에는 바이트 크기와 체크섬을 비교하고, 워크플로우 선택기에서 지정한 파일명이 디스크 상의 실제 파일명과 정확히 일치하는지 확인하십시오. 부분적으로 다운로드된 모델 파일도 폴더 내에 나타날 수 있으며, 이후 텐서 오류나 역직렬화 오류 등 혼란스러운 오류로 실패할 수 있습니다. FL2VA 및 Ref2VA 확산 가중치는 명확하고 구분 가능한 이름으로 유지하십시오. 여러 양자화 버전을 테스트하는 경우, 한 구성 요소만 변경하고 각 작동하는 그래프는 새 버전 번호를 부여해 저장하십시오.

*완성된 근접 프레임은 카메라 거리 변화 시에도 신원, 손의 접촉, 도구의 기하학적 형태, 조각물의 표현이 로컬 설정에서 보존되는지를 판단하는 데 도움이 됩니다.*
## 워크플로우를 가져오고 기준 렌더링을 수행하세요
### 먼저 로드한 후, 빨간 노드를 해결하세요
업데이트된 ComfyUI 설치 환경에서 공식 템플릿을 엽니다. 노드가 빨간색이거나 인식되지 않으면, 해당 노드가 현재 ComfyUI 코어에 속하는지, 아니면 문서화된 사용자 정의 패키지에 속하는지 즉시 확인하십시오. 노드 관리자가 제안하는 모든 노드를 무분별하게 설치하지 마십시오. 필요한 패키지가 변경된 후에는 반드시 재시작하고, 템플릿을 다시 열어 네 개의 매니페스트 파일을 각각 올바른 로더에 정확히 선택하십시오.
짧은 지속 시간, 보수적인 가로형 해상도, 템플릿의 표준 샘플러 설정, 그리고 하나의 간단한 프롬프트를 설정하십시오. LoRA, 참조 팩, 업스케일러, 프레임 보간, 긴 멀티샷 프롬프트는 모두 피하십시오. 첫 번째 성공 기준은 기계적입니다: 프롬프트가 큐에 등록되고, 모델이 한 번만 로드되며, 샘플링이 진행되고, 영상 및 음성이 정상적으로 디코딩되며, 최종 MP4 파일이 재생 가능해야 합니다. 두 번째 실행 시 예기치 않게 다시 다운로드되거나 재컴파일되지 않아야 합니다.
### 일반적인 오류를 드러내는 하나의 프롬프트를 사용하세요
밝게 조명된 장소에서 물리적 동작을 수행하는 주제와 그에 동반되는 청각적 이벤트를 포함하는 프롬프트를 시도해 보십시오: “남색 셔츠와 베이지 앞치마를 입은 대장장이가 초승달 형태 조각을 한 차례 타격한다. 불꽃이 왼쪽으로 튀고, 그녀는 조각을 담금질 탱크 쪽으로 내린다. 밝은 작업장 낮빛, 안정된 얼굴과 손, 선명한 망치 충격과 증기.” 이 프롬프트는 정체성, 객체 기하학, 접촉, 움직임, 조명, 소리를 전체 스토리로 확장하지 않고도 효과적으로 검증할 수 있습니다.
```official-video
src=https://r2.seedance.tv/blog/minimax-h3-first-and-last-frame/official-flf-output-v1.mp4
poster=https://r2.seedance.tv/blog/minimax-h3-first-and-last-frame/official-flf-poster-v1.png
label=MiniMax H3 first-and-last-frame output sample
로컬 그래프가 실제 움직임, 일관된 전환, 그리고 단일 프레임이 아닌 완전히 재생 가능한 최종 파일을 생성하는지를 확인하기 위한 H3 완성 출력 예시.
가장 흔한 로컬 오류를 해결하세요
실패 단계를 기준으로 진단하세요
텍스트 인코딩 중 메모리 부족 오류가 발생하면, 텍스트 인코더 또는 해당 오프로드 전략을 점검하십시오. 샘플링 중 오류가 발생하면, 확산 모델, 잠재 공간 크기, 지속 시간, 어텐션 구현 방식, 또는 오프로드 동작을 확인하십시오. 디코딩 중 오류가 발생하면, 영상/음성 VAE 및 GPU 여유 용량을 점검하십시오. 모든 충돌을 단순히 “VRAM 부족”으로 간주하지 말고, 마지막으로 성공적으로 완료된 노드를 기록하십시오. 우선 지속 시간과 해상도를 줄이고, 다른 GPU 기반 애플리케이션을 종료한 후, 알려진 호환성 있는 양자화 버전을 테스트하십시오.
VAE가 로드되지 않으면, 영상 및 음성 파일이 models/vae 폴더에 존재하고, 완전한 상태이며, 올바른 로더에 의해 선택되었는지 확인하십시오. 최종 영상에 음성이 없는 경우, 음성 VAE가 결합 잠재 공간의 음성 부분을 정상적으로 디코딩했는지, 그리고 최종 영상 노드가 두 스트림을 모두 믹싱했는지 확인하십시오. H3 VAE 및 TensorRT 속도 향상 가이드는 디코딩 병목 현상과 샘플링 속도를 구분하는 데 도움이 됩니다.

증기, 물과의 접촉, 집게, 얼굴, 초승달 형태는 단순한 망치 타격 테스트 통과 후 더 어려운 움직임 및 디코딩 검증 포인트를 제공합니다.
최적화를 하나씩 추가하세요
기준 워크플로우가 정상 작동하면, 터보 LoRA, 세이지 어텐션(SageAttention), 블록 캐싱, 추가 양자화, 또는 사용자 정의 VAE 경로를 적용하기 전에 워크플로우를 복제하십시오. 하나의 변수만 변경하고, 동일한 시드와 프롬프트로 다시 실행하십시오. 최대 VRAM 사용량, 실제 실행 시간, 출력 파일 크기, 시각적 아티팩트, 음질을 기록하십시오. 4단계 가속화는 고속 움직임이나 음성에 영향을 줄 수 있으므로, 클립이 검토 기준을 통과할 때만 속도 향상이 유효합니다.
하나의 작동하는 그래프를 프로덕션 워크플로우로 전환하세요
그래프, 실행 환경, 출력을 함께 버전 관리하세요
작동하는 워크플로우 JSON 파일을 다음 정보를 포함한 매니페스트와 함께 저장하십시오: ComfyUI 커밋, 사용자 정의 노드 커밋, Python, PyTorch, CUDA, GPU, 모델 해시, 시드, 해상도, 지속 시간, 샘플러 설정. /prompt 엔드포인트를 통해 제출할 계획이라면 API 형식 워크플로우를 별도로 내보내십시오. 에디터용 JSON과 API용 JSON은 상호 교환 불가능합니다. 미리보기, 최종 MP4, 로그 파일은 모두 동일한 작업 식별자 하에 보관하십시오.
긴 스토리를 제작할 경우 짧은 블록 단위로 나누고, 승인된 종료 지점을 다음 단계로 이어가십시오. 멀티 키프레임 워크플로우는 중간 시각적 앵커를 다루며, 재개 가능한 멀티샷 워크플로우는 작업 끝부분 근처에서 오류가 발생하더라도 전체 작업을 처음부터 다시 시작하지 않도록 체크포인트를 활용하는 방법을 설명합니다.
정체성, 참조 영향, 카메라 동작, 원생 오디오 및 기본 FL2VA 경로가 안정화된 후의 최종 멀티플렉스 파일을 검토하기 위한 독립적이고 완성된 H3 참조 출력.
로컬 H3 또는 Seedance Agent 선택
실질적인 가치를 창출할 때만 로컬 제어 유지
모델 파일을 로컬 머신에 반드시 보관해야 하거나, 사용자 정의 노드나 실험적 양자화가 필요하거나, GPU 환경을 직접 관리할 수 있으며 반복 시간이 허용 가능한 경우, 로컬 H3가 적합합니다. 이를 통해 워크플로우 JSON, 시드, 중간 상태, 자동화 엔드포인트에 직접 접근할 수 있습니다. 이러한 제어 권한은 연구 및 특수 파이프라인에 유용하지만, 지속적인 유지보수 책임도 수반합니다.
Seedance Agent는 드라이버 호환성, 스토리지, 오프로딩, 노드 버전, 렌더 복구 등을 별도의 프로젝트로 전환하지 않고도 H3를 활용하려는 팀에 적합합니다. 간단한 요청을 검토 가능한 샷 계획으로 변환하고, 각 샷에 참조 역할과 승인 기준을 연결하며, 완성된 출력물을 제시하고, 승인 후에는 약한 섹션만 재실행할 수 있습니다.

마지막 프레임은 충격에서 완성된 객체에 이르기까지 전체 로컬 시퀀스를 거친 후에도 정체성, 의복, 작업장 배치, 초승달 기하학적 형태가 그대로 유지되는지를 검증합니다.
결론
신뢰할 수 있는 MiniMax H3 로컬 설정은 ‘H3’라고 표시된 모든 것을 다운로드하는 것에서 시작하는 것이 아니라, 올바른 작업 유형군(task family)을 먼저 선택하는 것으로 시작합니다. 하드웨어 및 스토리지 요구사항을 확인하고, ComfyUI을 업데이트한 후, 하나의 디퓨전 체크포인트와 일치하는 텍스트 인코더 및 두 개의 VAE를 모두 준비하여 예상된 폴더에 파일을 배치하고, 가속화나 복잡한 참조를 추가하기 전에 간단한 기준 렌더링을 성공적으로 수행해야 합니다. 작동이 확인된 모든 조합은 버전 관리하여, 새로운 노드나 양자화로 인해 검증된 안정 설정이 덮어씌워지는 일을 방지해야 합니다. 로컬 제어보다 계획 수립, 검토, 연속성, 복구 가능한 제작이 더 중요하다면, 프로젝트를 Seedance Agent으로 시작하세요 — 그리고 전체 스택을 직접 관리하지 않고도 MiniMax H3를 활용할 수 있습니다.
직접 해볼 준비가 되셨나요?
이 가이드의 단계를 Seedance에서 바로 적용해 프롬프트나 이미지를 몇 분 안에 완성도 높은 영상으로 바꿔보세요.
가입 시 무료 크레딧 제공. 요금제는 월 $20부터.

Vidu 참조 영상 프롬프트 참고 자료: 공식, 예시 및 일관성 개선 방법
반복 가능한 Vidu 참조 영상 프롬프트 공식을 배우고, 실용적인 예시를 복사하며, 1–7개의 참조 이미지를 지정하고, 캐릭터, 제품, 장면의 일관성 저하 문제를 해결하세요.
글 읽기
Qwen AI 비디오 제너레이터 무료 이용 안내: 접근, 테스트 및 내보내기 가이드
Qwen 비디오 도구에 어떻게 접근하는지, 무료 사용 한도를 어떻게 확인하는지, 텍스트 및 이미지-비디오 변환을 어떻게 테스트하는지, 내보내기 기능을 어떻게 확인하는지, 그리고 검증된 아이디어를 Seedance Agent로 이전하는 방법을 알아보세요.
글 읽기
SnapGen AI 비디오 제너레이터 무료 체험: 구독 전에 꼭 테스트해 보세요
SnapGen의 무료 이용 가능 여부를 확인하는 방법, 텍스트 및 이미지-비디오 변환 기능을 테스트하는 방법, 내보내기 결과와 비용을 검토하는 방법, 그리고 검증된 개념을 Seedance Agent로 이전하는 방법을 알아보세요.
글 읽기