- 블로그
- MiniMax H3 LoRA 훈련: 맞춤형 비디오 스타일을 위한 파인튜닝 완전 가이드
AI 개요
MiniMax H3 LoRA 훈련이란 무엇인가요?
MiniMax H3 LoRA 훈련은 33B 규모의 H3 기반 모델을 고정시킨 채, 특정 캐릭터, 시각적 스타일, 제품 또는 동작을 학습하는 소규모 어댑터를 훈련시키는 과정입니다. 내보낸 어댑터는 전체 체크포인트보다 훨씬 작으며, 추론 시 기반 모델과 결합해 사용할 수 있습니다.
로컬에서 MiniMax H3 LoRA를 훈련하려면 얼마나 많은 VRAM이 필요한가요?
공식적으로 발표된 보편적인 최소 요구 사양은 없습니다. 16GB는 해상도를 낮춘 공격적인 목표치로 간주하고, 24GB는 더 실용적인 출발점으로 삼으세요. 12GB는 강력한 양자화(quantization), 오프로딩(offloading), 짧은 클립, 그리고 충분한 시스템 RAM을 사용해야만 가능할 수 있습니다.
MiniMax H3 LoRA 데이터셋을 위해 몇 개의 비디오가 필요한가요?
클라우드 기반 트레이너는 최소 10개의 클립을 허용하지만, 깔끔하고 다양한 50–200개 클립이 더 실용적인 목표치입니다. 모든 클립은 24fps로 정규화하고, 유효한 17n+5 프레임 길이—즉 현재 트레이너에서 지원하는 22, 39, 56, 73, 90, 107, 또는 124 프레임—를 사용하세요.
직접 해볼 준비가 되셨나요?
가입 시 무료 크레딧 제공. 요금제는 월 $20부터.
로컬 GPU 없이 MiniMax H3 LoRA를 훈련시킬 수 있나요?
네. 호스팅된 fal 트레이너는 ZIP 형식의 데이터셋을 받아 .safetensors 어댑터를 반환합니다. 현재 공개된 세 개의 트레이너 엔드포인트는 네 가지 훈련 대상을 지원합니다: T2V, I2V/first-frame, I2V LoRA를 활용한 first-last-frame 추론, 그리고 Ref2VA.
MiniMax H3용 LoRA를 훈련해야 하는 이유
MiniMax H3는 주제, 스타일, 카메라 움직임, 음향 등 다양한 요소에 걸쳐 일반화되도록 설계된 33B 규모의 공동 비디오-오디오 DiT 모델입니다. 이러한 광범위한 일반화 능력은 유용하지만, 일반 모델은 수십 개의 샷에 걸쳐 하나의 허구 캐릭터, 정확한 제품 마감 처리, 혹은 고유한 동작 언어를 자동으로 유지하지는 못합니다. LoRA는 기반 가중치를 고정시킨 채, 소규모의 학습 가능한 저순위(low-rank) 업데이트 집합만 추가합니다.
반복적인 프롬프트 및 참조 이미지에도 불구하고 결과가 계속 흐트러질 때 LoRA를 훈련하세요. 캐릭터 데이터셋은 위치에 관계없이 안정적인 얼굴, 복장, 실루엣을 학습시킬 수 있습니다. 제품 데이터셋은 기하학적 형태, 재질, 로고 배치, 선호 광고 조명 등을 강화할 수 있습니다. 동작 전용 LoRA는 반복되는 궤도, 댄스 어휘, 전환 패턴 등으로 H3의 출력을 편향시킬 수 있습니다. LoRA는 부실한 캡션 또는 모순된 클립을 수정하는 도구가 아닙니다. 오히려 데이터셋의 패턴(그 중 오류도 포함)을 증폭시킵니다.
이와 같은 실제 베이스라인 렌더링을 사용하여 어댑터가 개선해야 할 기준을 명확히 하세요. 새로운 정체성이나 스타일이 아닌 단지 로컬 샘플링 속도 향상만을 목표로 한다면, 대신 MiniMax H3 Turbo LoRA 가이드를 참고하세요.
네 가지 H3 LoRA 트레이너 설명
H3는 네 가지 유용한 LoRA 훈련 대상을 제공하지만, 현재 호스팅된 API는 세 개의 트레이너 엔드포인트만 공개하고 있습니다. first-last-frame 작업은 I2V 어댑터 계열을 재사용합니다: 먼저 첫 번째 프레임을 조건으로 훈련한 후, LoRA 활성화된 I2V 추론 엔드포인트에 종료 프레임을 제공합니다.
| 대상 | 공개된 훈련 경로 | 가장 적합한 용도 |
|---|---|---|
| T2V | T2V 트레이너 | 캡션과 함께 제공된 클립에서 학습한 스타일, 주제, 카메라, 또는 동작 |
| I2V | I2V 트레이너 | 제공된 첫 번째 프레임을 애니메이션하면서 그 정체성을 보존 |
| FLF2V | I2V 트레이너 → 이후 종료 프레임을 사용한 I2V LoRA 추론 | 고정된 시작 및 종료 지점을 갖는 제어된 전환 및 제품 회전 |
| Ref2VA | Ref2VA 트레이너 | 캐릭터, 스타일, 동작, 비디오 또는 오디오 참조를 조건으로 한 훈련 |
프롬프트만으로 개념을 호출해야 할 경우 T2V를 선택하세요. 출발 프레임이 정체성의 앵커가 되어야 할 경우 I2V/FLF2V를 선택하세요. 제작 요청서(brief)가 혼합된 참조 이미지, 비디오 또는 오디오에 의존할 경우 Ref2VA를 선택하세요. 동일한 시작 모드를 훈련 없이 비교해 보려면, 데이터셋을 제출하기 전에 Text to Video 워크스페이스를 테스트하세요.
데이터셋 준비: 클립, 캡션, 그리고 17n+5 프레임 격자
비디오와 캡션을 하나의 폴더에 넣고 파일 이름 기반(stem)을 일치시킵니다: 예를 들어 shot_001.mp4와 shot_001.txt. .mp4, .mov, .avi, 또는 .mkv 확장자를 사용하세요. 클립 당 하나의 개념만 포함하고, 편집 및 워터마크를 제거하며, 거의 동일한 클립(near-duplicates)은 피하세요. 캡션은 지속적인 개념과 동시에 보이는 동작, 카메라 움직임, 오디오를 명시해야 하며, 막연한 키워드 나열은 피해야 합니다. MiniMax H3 프롬프트 가이드에서는 유용한 캡션 구조를 제공합니다.
모든 클립을 24fps로 정규화하세요. H3는 frames = 17n + 5 규칙을 따르며, 수학적으로는 5 프레임도 유효하지만, 현재 호스팅된 트레이너는 22–124 프레임만 허용하므로, 22, 39, 56, 73, 90, 107, 또는 124 프레임을 사용하세요. 클립을 자른 후, 지속 시간(duration) 라벨이 아닌 실제 프레임 수를 확인하세요.
파이프라인 테스트 목적이라면 최소 10개 클립부터 시작하세요. 유용한 캐릭터 또는 스타일 어댑터를 만들기 위해서는, 다양하고 잘 캡션된 50–200개 클립이 더 나은 작업 범위입니다. 검증용으로 10–15%를 분리하세요. 타깃 정체성은 유지하면서, 화면 구성, 배경, 카메라 각도, 동작을 다양화하세요.

공식 워크플로에서 사용된 실제 H3 I2V 소스 이미지입니다. 제품 LoRA 훈련 데이터는 이 정도의 정밀도로 디테일을 보존하면서도 촬영 디자인은 다양화되어야 합니다.
ai-toolkit 및 ComfyUI를 활용한 로컬 훈련
ai-toolkit 커밋 8502a84는 MiniMax H3 T2V 및 첫 프레임 기반 I2V 학습 기능을 추가했습니다. 해당 커밋 또는 그 이후 버전을 사용하세요. 이 버전은 가지치기된 int8 ConvRot H3 변환기와 NVFP4/AWQ 양자화된 Qwen3-VL 텍스트 인코더를 로드하며, FlowMatch로 학습하고 ComfyUI와 호환되는 LoRA 키를 내보냅니다. H3 샘플러는 guidance-distilled 방식이므로, 기존의 CFG(Conventional Classifier-Free Guidance) 조정 대신 샘플링 guidance 값을 1로 고정하세요.
다음은 하드웨어에 독립적인 완전한 레시피가 아니라, ai-toolkit 작업 내에서 집중적으로 사용할 수 있는 시작 블록입니다:
network:
type: lora
linear: 16
linear_alpha: 16
train:
steps: 2000
noise_scheduler: flowmatch
optimizer: adamw8bit
lr: 2e-4
model:
name_or_path: MiniMaxAI/MiniMax-H3
arch: minimax_h3
quantize: true
model_kwargs:
partition: fl2va
sample:
guidance_scale: 1
H3 구현체는 내부적으로 비디오 FlowMatch 시프트를 12, 오디오 시프트를 3으로 사용합니다. 일반적인 이미지 모델 프리셋으로 이 값을 덮어쓰지 마세요. I2V의 경우, 데이터셋의 첫 프레임 조건부 입력(first-frame conditioning)을 활성화하고, 장시간 실행 전에 프레임 소스를 반드시 확인하세요. 잠재 벡터(latents) 및 텍스트 임베딩을 캐시하고, 250–500 스텝마다 체크포인트를 저장하며, 각 저장 시점에서 동일한 고정 프롬프트로 검증하세요. 학습 후 검사 및 추론 인터페이스는 ComfyUI이며, 완전한 H3 ComfyUI 설정 가이드에는 기본 파일과 그래프가 포함되어 있습니다.
로컬 GPU 없이 fal에서 클라우드 학습하기
- 짝지어진 비디오와
.txt캡션을 ZIP으로 패키징하세요. 필요 시, 트레이너별 첫 프레임 또는 참조용 사이드카(sidecar) 파일도 함께 추가하세요. - 위 표에 따라 T2V, I2V 또는 Ref2VA 트레이너를 선택하세요.
- 스텝 수, rank, 학습률, 프레임 수, 해상도, 조건부 입력 확률을 설정하세요.
- 짧은 테스트를 실행하고 검증 출력을 검토한 후, 개념이 여전히 개선되고 있을 때만 학습 시간을 연장하세요.
- 반환된
.safetensors어댑터와 구성 파일(config file)을 다운로드하세요.
현재 스키마는 기본적으로 2,000 스텝, rank 32, 학습률 2e-4, 24fps, 73 프레임을 사용합니다. 지원 가능한 rank 범위는 8–128입니다. 요금은 학습 스텝당 산정되므로, 런칭 전 실제 비용은 블로그에 복사된 숫자가 아닌 UI의 실시간 예측값을 기준으로 산정하세요. 이 서비스는 로컬 VRAM을 요구하지 않지만, 데이터셋 품질과 체크포인트 테스트는 여전히 사용자의 책임입니다.
주요 하이퍼파라미터 — Rank, 학습률, 스텝 수
| 목표 | Rank / alpha | 학습률 | 스텝 수 | 시작 권고 사항 |
|---|---|---|---|---|
| 파이프라인 테스트 | 16 / 16 | 2e-4 |
500–1,000 | 캡션 유효성, 모델 로딩, 내보내기 정상 작동 확인 |
| 캐릭터 또는 제품 | 16 / 16 | 2e-4 |
1,000–2,500 | 검증 단계에서 정체성이 최고조에 도달할 때 중단 |
| 스타일 또는 사실성 | 16 / 16 | 1e-4 |
최대 5,000 | 낮은 학습률 적용 후 저장된 체크포인트 비교 |
| 복잡한 혼합 개념 | 32 / 32 | 1e-4–2e-4 |
2,000–4,000 | rank 16으로는 과소적합(underfitting)이 발생할 때만 사용 |
Rank는 모델 용량(capacity)을 의미할 뿐, 품질 조절 슬라이더가 아닙니다. 높은 rank는 파일 크기를 증가시키며, 배경이나 얼굴을 더 빠르게 암기(memorize)할 수 있습니다. 학습률은 업데이트 크기를 제어합니다. 텍스처가 거칠어지거나 어댑터가 프롬프트를 압도할 경우 학습률을 낮추세요. 스텝 수는 반복 횟수보다는 검증 결과에 따라 결정해야 합니다. 모든 프롬프트가 동일한 구성을 재현한다면, 이전 체크포인트로 되돌리거나 데이터 다양성을 높이세요.
학습된 LoRA를 Seedance 및 ComfyUI에서 사용하기
ComfyUI에서 H3를 사용할 경우, 어댑터를 ComfyUI/models/loras/에 복사하고 모델 목록을 새로 고친 후, H3 확산 모델 로드 후에 어댑터를 로드하세요. 강도(strength)는 0.7–1.0에서 시작하세요. 어댑터는 올바른 FL2VA 또는 Ref2VA 베이스와 매칭되어야 합니다. 보관된 프롬프트들에 대해 트리거 문구(trigger phrase)를 테스트한 후, 동일한 시드(seed), 프레임 수, 샘플러 설정으로 베이스 모델과 비교하세요.
Seedance의 표준 브라우저 워크플로는 임의의 .safetensors 로더를 노출하지 않습니다. 실용적인 연결 방법은 H3에서 강력한 LoRA 프레임 또는 짧은 참조 영상을 렌더링한 후, 이를 Seedance Image to Video에서 브라우저 기반 모션 생성, 수정 및 프로덕션에 활용하는 것입니다. 이를 통해 맞춤형 학습은 개방된 H3 스택에서 수행하면서, 더 빠른 호스팅 기반 마무리는 Seedance를 통해 처리할 수 있습니다.
결론
반복 가능한 캐릭터, 제품, 스타일 또는 모션이 단 하나의 우수한 클립보다 중요할 때 MiniMax H3 LoRA 학습이 가치 있습니다. 먼저 조건부 입력 모드를 선택하고, 17n+5 그리드 기반의 깔끔한 24fps 데이터셋을 구축하세요. rank 16과 보수적인 검증으로 시작하여, 가장 높은 스텝 수가 아닌 최적의 체크포인트에서 학습을 중단하세요. 로컬 제어가 필요하면 ai-toolkit을, GPU가 없을 경우 fal을 사용하세요. 그런 다음 어댑터를 H3/ComfyUI에 로드하고, 승인된 자산을 브라우저 기반 프로덕션 경로로 간편하게 Seedance에 전달하세요.
직접 해볼 준비가 되셨나요?
이 가이드의 단계를 Seedance에서 바로 적용해 프롬프트나 이미지를 몇 분 안에 완성도 높은 영상으로 바꿔보세요.
가입 시 무료 크레딧 제공. 요금제는 월 $20부터.

2026년 기준, 품질·속도·오디오 측면에서 최적의 MiniMax H3 설정
ComfyUI 또는 클라우드 환경에서 해상도, 스텝 수, 샘플러, 스케줄러, 가이던스, 오디오 및 모든 H3 생성 모드에 대해 최적의 MiniMax H3 설정을 사용하세요.
글 읽기
MiniMax H3: 30단계 대 50단계 — 품질과 속도에서 실제로 달라지는 점
이미지 디테일, 생성 시간, 오디오 품질, Turbo LoRA 속도 등 각 요소별로 MiniMax H3를 20단계, 30단계, 50단계로 비교하고, 각 워크플로우에 가장 적합한 설정을 제시합니다.
글 읽기
MiniMax H3 첫 프레임 및 마지막 프레임: AI 비디오의 양 끝을 제어하는 방법
MiniMax H3의 첫 프레임 및 마지막 프레임 기반 비디오 생성 방식을 배우고, 두 개의 종단 이미지를 준비하며, 동작 중심 프롬프트를 작성하고, ComfyUI를 사용하는 방법과 일반적인 FLF2V 문제 해결법을 익힙니다.
글 읽기