MiniMax H3 2단계 워크플로우: 고해상도 ComfyUI 가이드

E
Emma Chen·7분 읽기·Sep 2, 2026
X에 공유
MiniMax H3 2단계 워크플로우: 고해상도 ComfyUI 가이드

AI 개요

미니맥스 H3 두 단계 워크플로우란 무엇인가요?

이 워크플로우는 먼저 작은 캔버스에서 동작, 구도, 사운드를 생성한 후, H3 잠재 공간(latent)을 확대하고 낮은 노이즈의 두 번째 패스를 실행하여 고해상도 디테일을 재구성합니다.

고해상도로 직접 생성하는 것보다 빠른가요?

반복 작업 시 일반적으로 그렇습니다. 첫 번째 패스는 비용이 저렴하기 때문입니다. 그러나 정제 단계의 패스 역시 목표 해상도에 근접하므로, 최대 VRAM 사용량과 총 소요 시간은 스케일, 지속 시간, 오프로딩 여부에 따라 달라집니다.

두 번째 단계에서 미니맥스 H3 원생 오디오를 보존하나요?

보존할 수 있습니다. 호환 가능한 H3 잠재 공간 업스케일러는 오디오 잠재 공간(latent)을 그대로 전달하며, 이를 고정하거나 약간 다듬을 수 있도록 합니다. 과도한 오디오 디노이즈는 사운드트랙을 대체하거나 왜곡시킬 수 있습니다.

누구에게 이 워크플로우가 적합한가요?

더 선명한 H3 출력, 더 빠른 드래프트, 또는 낮은 VRAM 사용 경로를 필요로 하며, 두 단계 사이에서 정체성(identity), 동작, 오디오를 직접 확인할 수 있는 ComfyUI 사용자에게 적합합니다.

미니맥스 H3 두 단계 워크플로우가 실제로 수행하는 작업

미니맥스 H3 두 단계 워크플로우는 창의적 결정과 디테일 재구성을 분리합니다. 1단계에서는 보다 작고 실용적인 캔버스에서 동작, 카메라 이동, 타이밍, 그리고 원생 오디오를 해결합니다. 2단계에서는 승인된 잠재 공간(latent)을 확대하고 낮은 노이즈의 샘플링 경로를 따라 텍스처를 재구성하지만, 새로운 연출을 ‘발명’하지는 않습니다.

1단계: 동작, 구도, 오디오 고정

짧고 측정 가능한 샷으로 시작하여 프롬프트, 시드(seed), 지속 시간, 프레임 속도, 참조 자료를 고정합니다. 작은 캔버스는 카메라 움직임이나 손동작 실패를 더 저렴하게 탐지할 수 있게 해줍니다. 정제 전 전체 클립을 검토하고 부적절한 동작은 거부하세요.

동일한 유리세공 기술자가 정체성, 의복, 작업실 조명, 물체 연속성을 유지한 채 완성된 세 프레임

유용한 첫 번째 패스는 샷이 광각 액션에서 근접 디테일로 이동함에도 불구하고 동일한 인물, 앞치마, 작업실, 도구, 유리 형태를 인식 가능하게 유지합니다.

2단계: 업스케일 및 디테일 재구성

첫 번째 샘플러의 디노이즈된 출력을 H3 호환 잠재 공간 업스케일러에 입력합니다. 새 차원에 맞게 조건화(conditional input)를 업데이트하고, 디테일 복원에 충분한 양의 노이즈만 추가한 후, 낮은 시그마 범위에서 두 번째 샘플러를 실행합니다. 구조를 보존하면서 마이크로텍스처(microtexture)를 해상화하기 위해 정제 후 디코딩합니다.

두 단계 샘플링 vs 직접 렌더링 vs 픽셀 업스케일링 비교

방법 최적 사용 사례 주요 장점 주요 위험
직접 목표 해상도 렌더링 성능이 충분한 하드웨어에서 최종 샷 제작 하나의 샘플링 경로 실패 시 비용이 높음
H3 잠재 공간 두 단계 워크플로우 승인된 동작에 더 많은 디테일이 필요한 경우 디코딩 전 디테일 재구성 과도한 리노이즈(re-noise)로 인해 정체성 또는 오디오 변경 가능성
디코딩 후 픽셀 업스케일링 안정적인 샷이며 단지 더 큰 배포 파일이 필요한 경우 예측 가능한 동작 보존 누락된 의미론적 디테일을 복구할 수 없음

로컬 그래프 없이 빠른 시각 실험을 수행하려면, Seedance 이미지-투-비디오 워크플로우에서 동일한 샷 구조를 테스트한 후, 단순히 해상도 라벨이 아니라 동작과 활용 가능한 디테일을 비교하세요.

워크플로우를 가져오기 전 준비 사항

모델, 인코더, VAE 파일

이미 올바르게 렌더링되는 미니맥스 H3 워크플로우를 기준으로 시작하세요. 체크포인트 또는 양자화된 모델, 텍스트 인코더, VAE, 모델 경로를 확인하세요. 이 그래프를 별도로 저장하여 롤백 경로로 활용하세요.

필수 사용자 정의 노드

일반적인 이미지 노드가 아닌, H3의 압축된 영상-및-오디오 잠재 공간(latent)을 위한 특화된 업스케일러를 사용해야 합니다. 첫 번째 샘플러는 디노이즈된 출력을 노출해야 하고, 업스케일러는 오디오를 전달해야 하며, 2단계는 재구성된 조건화(conditional input)를 수용해야 합니다. 테스트 전 모든 누락된 노드를 해결하세요.

하드웨어 계획

두 단계는 실패한 드래프트의 비용을 줄여주지만, 최대 메모리 사용량을 반드시 낮추지는 않습니다. 정제 단계의 패스는 여전히 확대된 잠재 공간(latent)을 처리합니다. VRAM, 시스템 RAM, 정밀도(precision), 오프로딩, 지속 시간, 목표 캔버스 크기 모두 중요합니다. 첫 번째 테스트는 짧게 수행하고, 모델, 잠재 공간(latent), 디코딩된 프레임을 저장할 충분한 디스크 공간을 확보하세요.

하나의 프로젝트에서 호스팅된 생성과 로컬 생성을 혼합하는 경우, 멀티모델 AI 비디오 워크플로우를 참고하여 비용, 제어력, 제작 리스크에 따라 샷을 라우팅하는 방법을 확인할 수 있습니다.

두 단계 ComfyUI 그래프 구축 방법

검증된 미니맥스 H3 기준선으로 시작

수정되지 않은 텍스트-투-비디오, 이미지-투-비디오 또는 레퍼런스-투-비디오 그래프를 먼저 실행하세요. 하나의 주제, 동작, 카메라 지시사항, 사운드 조건을 사용하세요. 시드, 차원, 프레임 수, 샘플러, 정밀도, 렌더링 시간을 기록하세요. 이 기준선이 실패한다면, 리파이너(refiner)는 단지 원인을 가릴 뿐입니다.

1단계를 잠재 공간 업스케일러에 연결

디코딩된 이미지가 아닌, 첫 번째 샘플러의 디노이즈된 출력을 H3 잠재 공간 업스케일러에 연결하세요. 그래프에서 지원하는 차원을 사용하고, 동작 보존을 쉽게 평가할 수 있도록 보수적인 스케일 증가량으로 시작하세요.

같은 달리는 개가 부드러운 첫 번째 패스 드래프트와 털, 목줄 바느질, 물방울이 선명히 표현된 두 번째 패스 프레임으로 나란히 표시됨

오른쪽 프레임은 개의 포즈, 실루엣, 표정, 일출 조명을 변경하지 않으면서 털 가닥, 물의 구조, 표면 텍스처를 추가해야 합니다.

새 캔버스에 맞춰 조건화 재구성

이미지 또는 레퍼런스 조건화를 두 번째 단계 차원으로 스케일링하세요. 크기 불일치는 얼굴을 왜곡하거나 프레이밍을 이동시키거나 주제를 재해석할 수 있습니다. 레퍼런스 강도는 보수적으로 유지하고, 정체성이 여전히 흔들릴 경우에만 점진적으로 증가시키세요.

낮은 시그마 정제 패스 실행

확대된 잠재 공간(latent)을 외부 노이즈가 비활성화된 두 번째 샘플러에 연결하고, 낮은 노이즈 시그마 범위를 사용하세요. 보편적인 숫자를 복사하기보다는, 실제 분할 지점을 테스트하세요. 호환 가능한 VAE로 디코딩하고, 비디오와 오디오를 함께 저장하세요. 미니맥스 H3 AI 에이전트 기술 가이드에서는 레퍼런스와 타이밍을 구성하는 또 다른 방식을 소개합니다.

고해상도, 속도, 원생 오디오를 위한 최적 설정

기본 캔버스 및 스케일 팩터 선택

기본 캔버스는 얼굴, 손, 그리고 작은 물체를 정의해야 하되, 거부된 초안의 비용은 낮게 유지해야 합니다. 검증된 H3 해상도 근처에서 시작한 후, 하나의 중간 규모 단계를 테스트해 보세요. 먼 거리의 얼굴은 더 큰 기본 캔버스가 필요할 수 있으므로, 한 개의 쉬운 샷만으로 이 설정을 판단하지 마십시오.

단계와 시그마(σ)를 의도적으로 분리하세요

높은 노이즈 샘플링은 레이아웃과 동작을 결정하고, 낮은 노이즈 샘플링은 텍스처를 해상도화합니다. 2단계에서 사지나 카메라 방향이 변경된다면, 정제 단계를 더 늦게 시작하거나 디노이즈 값을 줄이세요. 2단계가 거의 아무것도 추가하지 않는다면, 낮은 노이즈 경로를 약간 더 많이 노출시키세요. 테스트당 하나의 매개변수만 변경하세요.

오디오를 ‘잠금’, ‘정제’, 또는 ‘재혼합’하세요

오디오는 의도적인 별도 브랜치로 취급하세요. 1단계에서 이미 사용 가능한 대사, 앰비언스, 또는 음악이 있다면 audio_denoise를 0으로 설정하세요. 약간의 값은 텍스처를 다듬는 데 도움이 될 수 있지만, 강한 값은 말이 안 되는 소리, 타이밍 변화, 또는 다른 공간 음색(room tone)을 유발할 수 있습니다.

첼리스트의 완성된 시네마틱 프레임 — 얼굴 디테일, 손가락 접촉, 활의 기하학적 배치, 나무 질감, 그리고 동기화된 연주 오디오를 검토하기 위해 사용

음악적 클로즈업은 엄격한 테스트입니다: 정제된 프레임은 활이 현 위에 유지되어야 하고, 손가락은 지판 위에 있어야 하며, 얼굴 정체성은 안정적이어야 하며, 들리는 음은 움직임과 정확히 동기화되어야 합니다.

전체 샘플을 재생하고, 스틱 충격, 심벌 움직임, 손의 연속성, 그리고 소리가 가시적 리듬에 정확히 고정되어 있는지를 관찰하세요.

여러 시각적 또는 오디오 참조가 각각 독립된 역할을 수행해야 하는 샷의 경우, 먼저 참조-대-비디오 작업공간을 사용하여 이를 정리하세요.

VRAM이 낮은 환경에서 중요한 설정

모델 오프로딩, 지원되는 효율적 어텐션, 보수적인 프레임 수, 그리고 하나의 배치(batch)를 사용하세요. 검사할 버전만 디코딩하세요. 2단계에서도 여전히 메모리 부족(OOM) 문제가 발생한다면, 대상 크기 또는 지속 시간을 줄인 후에 최적화 도구를 추가하세요.

MiniMax H3 워크플로우 JSON 파일을 가져오고 유효성을 검사하는 방법

가져오기 및 종속성 해결

워크플로우 JSON 파일을 ComfyUI로 드래그한 후, 누락된 노드 목록을 읽고 각 저장소(repository) 및 모델 경로를 확인하세요. 재시작 후 입력값이 초기화되지 않았는지 반드시 확인하세요. 원본 JSON 파일은 그대로 보관하고, 수정된 그래프는 별도로 버전 관리하세요.

통제된 기준선 테스트 실행

고정된 시드(seed)를 사용해 5~8초 분량의 샷을 테스트하세요. 프롬프트를 변경하지 않고, 1단계 결과, 2단계 결과, 직접 해상도 결과를 모두 저장하세요. 깨끗한 기준선을 얻으려면, 텍스트-대-비디오 생성기를 사용해 프롬프트 문제와 그래프 문제를 구분할 수 있습니다.

시청자가 실제로 볼 수 있고 들을 수 있는 것들을 비교하세요

렌더링 시간, 피크 VRAM, 정체성(identity), 기하학적 형태, 카메라 경로, 플리커(flicker), 배경 안정성, 오디오 명료도, 동기화 여부를 기록하세요. 정지 이미지는 선명도를 과장하면서 시간적 일관성의 부재를 숨길 수 있으므로, 어려운 프레임을 검사하기 전에 모든 버전을 일반 속도로 재생해 보세요.

2단계는 시청자에게 실제로 보이는 가치를 추가할 때만 유지하세요. 세부 디테일이 선명해지지만 인물, 동작, 또는 사운드트랙이 바뀐다면, 디노이즈 범위를 낮추거나 디코딩 후 업스케일링(post-decode upscaling)을 사용하세요.

OOM, 오디오 왜곡, 정체성 왜곡, 색상 노이즈 문제 해결

2단계에서 메모리 부족(OOM) 발생

대상 차원(dimension)을 먼저 줄이고, 그 다음 지속 시간을 단축하거나 오프로딩을 증가시키세요. 두 모델이 모두 GPU에 무의도로 상주하지 않도록 확인하세요. 2단계가 피크 VRAM을 결정할 수 있습니다.

얼굴 또는 캐릭터가 변경됨

컨디셔닝 차원, 참조 스케일링, 디노이즈 값을 점검하세요. 정체성 드리프트(identity drift)는 일반적으로 리파이너(refiner)가 너무 많은 자유도를 가지거나 컨디셔닝이 불일치함을 의미합니다. 얼굴 복원을 추가하기 전에 더 가까운 기본 캔버스를 테스트해 보세요.

대사 또는 앰비언스가 왜곡됨

오디오 디노이즈를 0으로 설정하고 1단계의 오디오 품질을 확인하세요. 1단계 오디오가 불안정하다면, 1단계에 더 많은 스케줄 시간을 할당하거나 프롬프트를 단순화하세요. 2단계는 1단계에서 전혀 확립되지 않은 연주를 신뢰성 있게 복구할 수 없습니다.

디테일이 과도하게 처리되거나 색상 노이즈가 나타남

2단계 시작 시점을 더 늦게 이동시키고, 디노이즈 값을 낮추며, VAE 및 래턴트 업스케일러(latent-upscaler) 버전을 확인하세요. 통제된 테스트에서도 색상 노이즈가 계속 나타난다면, 래턴트 경로를 강제하지 말고 디코딩된 픽셀 업스케일링(decoded pixel upscale)을 사용하세요.

JSON에 누락되거나 호환되지 않는 노드가 있음

노드 버전을 일치시키고, 각 변경 후 테스트하세요. 중첩된 비디오-및-오디오 래턴트 오류는 일반적으로 제네릭 노드가 H3 전용 경로에 잘못 진입했음을 의미합니다. 기준선으로 되돌린 후, 한 섹션씩 다시 연결하세요.

결론

MiniMax H3 2단계 워크플로우를 승인 파이프라인(approval pipeline)으로 사용하세요: 동작, 구성, 오디오를 저렴하게 해결한 후, 보존할 가치가 있는 샷만 정제하세요. 2단계는 공연 성능을 재작성하지 않고 세부 디테일만 추가할 때만 수락하세요. 검증된 양호한 그래프로 시작하고, 오디오는 보존하며, 렌더링 결과를 비교하고, 한 번에 하나의 변수만 변경하세요. 간략한 요구사항을 검증하려면, Seedance AI 비디오 생성기에서 시작해 동일한 프롬프트나 프레임을 테스트 클립으로 변환하세요.

직접 해볼 준비가 되셨나요?

이 가이드의 단계를 Seedance에서 바로 적용해 프롬프트나 이미지를 몇 분 안에 완성도 높은 영상으로 바꿔보세요.

가입 시 무료 크레딧 제공. 요금제는 월 $20부터.