- 블로그
- MiniMax H3 Ref2V 대비 FL2VA: 어떤 워크플로우를 사용해야 할까요?
MiniMax H3 Ref2V 대 FL2VA는 단순한 품질 비교가 아닙니다. 이들은 서로 다른 유형의 제어를 위해 설계된 두 가지 작업 계열입니다. Ref2V의 공식 명칭은 Ref2VA이며, 주체, 스타일, 동작 또는 음성을 재사용 가능한 참조 자료로 이미지, 영상, 오디오를 활용합니다. 반면 FL2VA은 한 장 또는 두 장의 키프레임을 사용해 하나의 샷이 시작되는 위치, 끝나는 위치, 또는 양쪽 모두를 정의합니다.
따라서 실용적인 질문은 “어느 체크포인트가 더 나은가?”가 아니라 “이 샷에서 무엇이 고정되어야 하는가?”입니다. 정체성 또는 제품이 새로운 카메라 앵글과 환경에서도 유지되어야 한다면 Ref2VA을 선택하세요. 반대로 시작 또는 종료 시점의 구도가 정확히 일치해야 한다면 FL2VA을 선택하세요.
AI 개요
MiniMax H3 Ref2V와 FL2VA의 주요 차이점은 무엇인가요?
Ref2VA은 주체, 스타일, 영상 또는 오디오 참조 자료를 새로 구성된 샷으로 재사용합니다. FL2VA은 첫 번째 프레임에서 마지막 프레임으로, 또는 양 끝단 사이에서 애니메이션을 생성합니다.
캐릭터 일관성을 위해 Ref2VA 또는 FL2VA 중 어느 것을 사용해야 하나요?
캐릭터가 새로운 장소나 카메라 앵글에서도 등장해야 할 경우 Ref2VA을 사용하세요. 반대로 애니메이션할 정확한 구도를 이미 보유하고 있다면 FL2VA을 사용하세요.
두 MiniMax H3 모드 모두 오디오를 생성할 수 있나요?
네. 두 작업 계열 모두 네이티브 스테레오 오디오가 포함된 영상을 생성합니다. 오디오 클립 또는 음성의 음색이 참조 패키지의 일부인 경우 Ref2VA이 더 강력한 선택입니다.
첫 번째 테스트에는 어느 모드가 더 쉬운가요?
FL2VA이 일반적으로 더 간단합니다. 단 하나의 이미지와 하나의 프롬프트만으로 시작할 수 있기 때문입니다. 반면 단일 프레임에 충분한 정체성, 동작 또는 오디오 정보가 부족할 때 Ref2VA의 가치가 드러납니다.
Ref2VA 대 FL2VA: 간단한 의사결정 규칙
이 두 모드를 비교하는 사용자는 보통 수백 기비바이트의 웨이트를 로드하거나 두 개의 ComfyUI 그래프를 구축하기 전에 적용 가능한 결정 기준을 원합니다. 다음 규칙을 사용하세요: FL2VA은 종단점을 보존하고, Ref2VA은 참조 역할을 보존합니다.
| 제작 요구 사항 | 더 적합한 출발점 | 이유 |
|---|---|---|
| 하나의 완성된 정지 이미지를 애니메이션화 | FL2VA | 소스 이미지가 정확히 첫 번째 또는 마지막 구도입니다 |
| 디자인된 오프닝과 엔딩 연결 | FL2VA | 두 개의 키프레임이 양 끝단을 정의합니다 |
| 동일한 배우를 다른 장소에 배치 | Ref2VA | 정체성은 새 샷의 구도와 분리될 수 있습니다 |
| 여러 광고 설정에서 동일한 제품 재사용 | Ref2VA | 다양한 각도의 뷰가 기하학적 형태 및 재질을 설명할 수 있습니다 |
| 음성, 분위기음, 동작 단서 재사용 | Ref2VA | 오디오 및 영상은 참조 자료로 할당될 수 있습니다 |
| 시각적 입력 없이 텍스트만으로 생성 | FL2VA 계열 | 동일한 체크포인트 계열이 텍스트-투-비디오도 지원합니다 |
H3 출력은 네이티브 32 kHz 스테레오 오디오가 포함된 24 fps이며, 기본 워크플로는 별도의 고해상도 재생성 단계 이전에 일반적으로 768p 해상도로 출력합니다. 이러한 공유된 출력 사양은 조건부 입력 방식의 차이를 제거하지 않습니다. 체크포인트 선택은 여전히 모델이 어떤 유형의 증거를 수신할지를 결정합니다.
멀티모달 참조 할당에 대한 보다 포괄적인 소개는 MiniMax H3 참조 영상 가이드를 참조하세요.
Ref2VA이 더 적합한 경우
고정된 구도가 아닌 주체를 원할 때
Ref2VA은 ‘배역 캐스팅’으로 이해하는 것이 가장 좋습니다. 인식 가능하게 유지되어야 할 인물 또는 사물을 나타내는 증거를 제공한 후, 새로운 샷을 묘사하세요. 오픈 모델은 최대 9개의 이미지, 최대 3개의 참조 영상, 최대 3개의 오디오 클립을 수용하며, 모든 참조 유형을 합쳐 최대 12개의 파일까지 허용합니다. 영상 및 오디오 참조의 지속 시간은 제한되어 있으므로, 각 자산은 명확한 목적을 가져야 합니다.
단순히 9개의 슬롯이 존재한다고 해서 거의 동일한 초상화 9장을 모두 입력하지 마세요. 유용한 캐릭터 패키지는 깔끔한 얼굴 각도, 3/4 신체 각도, 하나의 의상 디테일을 포함할 수 있습니다. 제품 패키지는 정면, 측면, 근접 기하학적 뷰를 포함할 수 있습니다. 동작 참조는 정지 이미지로는 전달할 수 없는 타이밍 또는 카메라 움직임을 보여줘야 합니다.

렌즈, 조명, 환경이 크게 달라진 상황에서도 얼굴 윤곽, 은발, 코발트 자켓, 귀걸이를 점검하세요—이것이 바로 Ref2VA 테스트가 평가해야 할 증거의 유형입니다.
모든 참조 자료에 하나의 역할만 할당하세요
강력한 Ref2VA 프롬프트는 각 입력 자료를 명명하고 그 역할을 명시합니다. “이미지 1은 배우를 정의함”, “영상 1은 돌리 카메라 움직임을 제공함”, “오디오 1은 음성의 음색을 제공함”처럼 명확히 서술하는 것이, 모든 것을 모든 자료로부터 복사하라고 모델에 요청하는 것보다 낫습니다. 두 개의 참조 자료가 충돌할 경우, 얼굴, 의상, 움직임, 환경, 사운드 중 어느 자료가 우선하는지 명시하세요.
공식 Ref2VA 템플릿 결과: 하나의 선명한 프레임만 평가하는 대신, 새로 생성된 동작 속에서 정체성과 스타일이 살아남았는지 평가하세요.
복사하여 바로 사용 가능한 구조는 MiniMax H3 프롬프팅 가이드에서 주체 정의를 목표 샷 및 사운드스케이프와 분리하는 방법을 설명합니다.
FL2VA이 더 적합한 경우
하나의 프레임이 이미 해답을 담고 있을 때
FL2VA을 선택하세요. 이 경우 소스는 단순한 영감이 아니라 바로 촬영된 화면 그 자체입니다. 한 장의 이미지로도 첫 프레임으로 삼아 이후 애니메이션을 진행할 수 있고, 혹은 마지막 프레임으로 삼아 동작이 그 지점에 도달하도록 만들 수 있습니다. 두 장의 이미지가 있으면 모델은 명시적인 시각적 시작점과 끝점을 갖게 됩니다. 따라서 FL2VA은 통제된 공개 장면, 매치 컷(match cut), 루프, 타이틀 카드 등장, 제품 변형, 그리고 설계된 포즈에 정확히 도달해야 하는 액션에 유용합니다.
흔한 실수는 소스 프레임이 지지할 수 없는 카메라 앵글을 요구하는 것입니다. 근접 초상화는 재킷 뒷면, 전체 방의 구조, 배우의 걷는 자세 등을 담고 있지 않습니다. FL2VA은 누락된 정보를 창출할 수 있지만, 모든 창출은 연속성 위험을 수반합니다. 작업이 제공된 구도 내에서의 움직임이 아니라 진정으로 새로운 샷을 요구한다면, Ref2VA으로 전환하세요.

유용한 FL2VA 평가 항목: 중간 동작의 신뢰성 여부와 동시에 최종 포즈, 기차의 기하학적 형태, 방향, 복장이 계획된 종료 지점으로 정확히 수렴하는지 확인하세요.
호환 가능한 종료 지점 설계하기
첫 번째와 마지막 프레임은 피사체 정체성, 복장, 장면 기하학, 화면 비율, 그리고 타당한 움직임에 대해 일치해야 합니다. 설명 없이 급격한 변화가 발생하면 모델이 여러 문제를 동시에 해결해야 하게 됩니다. 예를 들어 첫 번째 이미지가 역 내에서 서 있는 배우를 보여주고, 마지막 이미지가 다른 렌즈, 다른 복장, 계절, 위치를 보여준다면, 전환 과정은 제한된 시간 동안 움직임을 수행하기보다는 오히려 형태 변형(morphing)에 집중하게 될 수 있습니다.
공식 FL2VA 결과: 종료 지점 정확도, 프레임 간 경로, 그리고 원생 오디오가 시각적 액션을 따라가는지 여부를 확인하세요.
MiniMax H3 first-and-last-frame 가이드에서는 종료 지점 설계에 대해 더 자세히 다룹니다.
올바른 ComfyUI 워크플로 구축하기
필요한 작업 계열만 로드하세요
MiniMax H3는 별도의 FL2VA 및 Ref2VA 체크포인트 계열을 제공합니다. 이들은 동일한 그래프에 연결된 두 개의 메뉴 라벨이 아닙니다. FL2VA은 텍스트와 선택적 첫 번째·마지막 이미지 조건을 입력으로 받습니다. 반면 Ref2VA은 순서가 정해진 이미지·비디오·오디오 참조 자료와, 해당 참조 자료들이 목표물과 어떻게 관계되는지를 정의하는 프롬프트를 입력으로 받습니다.
가장 작은 그래프부터 검증하세요. FL2VA의 경우, 깔끔한 첫 프레임 하나, 짧은 동작 지시문, 고정된 시드(seed), 짧은 지속 시간을 사용하세요. 단일 프레임 결과가 자연스럽게 움직이는 것을 확인한 후에야 마지막 프레임을 추가하세요. Ref2VA의 경우, 하나의 정체성 이미지와 하나의 목표 샷 설명으로 시작하세요. 실패 사례가 어떤 증거가 부족한지를 알려줄 때만 두 번째 시점, 동작 비디오, 또는 음성 클립을 추가하세요.
MiniMax H3 ComfyUI 설정 가이드에서는 전체 로컬 설치 절차를 안내합니다. 모델 계열은 명확히 이름 붙인 디렉터리에 저장하여, 캐시된 로더가 Ref2VA 테스트를 FL2VA 테스트처럼 인식하지 않도록 주의하세요.
참조 자료 목록이 아니라 목표물을 프롬프트하세요
참조 자료를 정의한 후에는 완성된 비디오를 시간 순서대로 묘사하세요. 카메라, 액션, 환경, 대사, 분위기, 음악을 명시하세요. 참조 이미지에 이미 보이는 내용을 프롬프트 전부를 할애해 반복하지 마세요. Ref2VA은 새 샷의 명세를 필요로 하고, FL2VA은 이미 보이는 것들 사이의 타당한 동작 경로를 필요로 합니다.
동일한 요청 사항으로 두 가지 모드 모두 테스트하기
핵심 실패 요소를 평가하세요
동일한 창의적 요청 사항을 두 가지 모드 모두로 실행하려면, 그 요청 사항이 두 모드 모두에 대해 공정하게 표현될 수 있어야 합니다. 지속 시간, 화면 비율, 프롬프트 의도, 시드 정책, 검토 기준을 동일하게 고정하세요. 그런 다음 정체성, 객체 기하학, 종료 지점 정확도, 동작 품질, 카메라 제어, 오디오 관련성, 사용 가능한 프레임 속도를 평가하세요.
동일한 피사체가 새 구도에서도 유지되어야 한다면 Ref2VA이 우위를 점해야 합니다. 반면 첫 번째 또는 마지막 구도가 입력과 정확히 일치해야 한다면 FL2VA이 우위를 점해야 합니다. 선명한 프레임이 잘못된 배우를 보완하지 못하고, 일관된 배우가 요구된 종료 카드를 놓치는 것을 보완하지도 못합니다.

제품의 경우, 전반적인 색상뿐 아니라 다양한 환경에서 그릴 기하학, 다이얼 배치, 손잡이 형태, 페인트 마모 정도, 버튼 수를 점검하세요.
렌더링 시도 횟수가 아니라 승인된 출력 수를 계산하세요
가장 저렴한 워크플로는 재시도 횟수가 적은데도 승인된 샷을 생성하는 워크플로입니다. 각 버전이 실패한 이유를 기록하세요. FL2VA이 큰 카메라 이동 중에 반복적으로 정체성을 바꾼다면, 요청 사항은 Ref2VA을 필요로 할 가능성이 높습니다. 반대로 Ref2VA이 정확한 오프닝 또는 클로징 구도를 반복적으로 놓친다면, 더 많은 형용사를 추가하기보다는 FL2VA을 통해 해당 종료 지점을 직접 제공하세요.
더 긴 시퀀스의 경우, 한 번의 생성으로 전체 장면을 해결하려 하기보다는 승인된 결과를 MiniMax H3 멀티 키프레임 워크플로로 이어가세요.
두 개의 로컬 파이프라인을 원하지 않을 때 Seedance Agent를 사용하세요
로컬 오픈 모델 방식은 심층적인 제어를 제공하지만, 매 샷마다 체크포인트 선택, 참조 자료 정리, 프롬프트 재구성, 버전 추적, 수동 재시도가 필요해 운영 비용이 증가합니다. 바로 이 지점에서 Seedance Agent가 자연스럽게 적용됩니다.에이전트에게 창의적인 목표와 참조 팩을 제공한 후, 최종 생성에 비용을 지출하기 전에 제안된 촬영 계획을 검토하세요. 이 방식은 참조 역할을 브리프에 계속 연결해 두고, 적절한 생성 경로를 선택하며, 대안들을 체계적으로 정리하고, 실패한 촬영만 다시 실행하여 전체 로컬 그래프를 다시 구축하도록 강제하지 않습니다. 유용한 이점은 모델을 숨기는 것이 아니라, 의사결정, 근거, 출력, 승인 기록을 모두 함께 유지하는 데 있습니다.
노드 수준의 재현 가능한 제어가 필요하고, 두 가지 작업 계열을 모두 유지할 수 있는 하드웨어 환경을 갖추고 있다면, 로컬 Ref2VA 또는 FL2VA을 사용하세요. 체크포인트 파이프라인을 별도의 프로덕션으로 관리하지 않고도 참조 자료에서 승인된 촬영으로 원활히 이행하려면 호스팅된 에이전트를 사용하세요. Seedance Agent로 워크플로를 시작하여 실제 출력을 비교한 후, 더 큰 시퀀스로 확장하기 전에 결정할 수 있습니다.
결론
MiniMax H3 Ref2V 대 FL2VA의 선택은 불변 조건(invariant)을 정의하면 간단해집니다. 배우, 제품, 스타일, 동작 힌트 또는 음성이 새로 구성된 촬영에서도 반드시 유지되어야 할 경우 Ref2VA을 선택하세요. 한 장의 공급 프레임이 애니메이션할 정확한 구성을 나타내거나, 두 장의 프레임이 시작과 종료를 정확히 정의할 경우 FL2VA을 선택하세요. 가능한 가장 작은 그래프를 구성하고, 각 참조 자료에 하나의 역할을 할당한 후, 승인된 출력 비율을 기준으로 테스트하고, 실패가 당신이 잘못된 요소를 보호하고 있음을 보여줄 때 모드를 전환하세요. 두 개의 로컬 파이프라인을 유지하지 않고도 동일한 참조 계획 수립, 모델 선택, 검토, 부분 재실행 로직을 원한다면, Seedance Agent 워크플로를 시도해 보세요.
직접 해볼 준비가 되셨나요?
이 가이드의 단계를 Seedance에서 바로 적용해 프롬프트나 이미지를 몇 분 안에 완성도 높은 영상으로 바꿔보세요.
가입 시 무료 크레딧 제공. 요금제는 월 $20부터.

ComfyUI에서 여러 비디오 일괄 처리: 신뢰할 수 있는 폴더 워크플로
ComfyUI에서 신뢰할 수 있는 파일 반복 처리, 개별 출력, 오디오 보존, 프레임 속도 확인, 복구 가능한 작업을 통해 여러 비디오를 일괄 처리하세요.
글 읽기
Seedance 2.5 AI 필름 비용: 렌더링 전에 단편 영화 예산 산정하기
요금제, 촬영 장면 수, 재시도율, 해상도, 오디오, 마무리 작업 등을 기준으로 Seedance 2.5 AI 필름 비용을 신용 포인트를 사용하기 전에 추정하세요.
글 읽기
MiniMax H3 멀티 키프레임 워크플로우: 타이밍, 연속성 및 전환 제어
ComfyUI에서 MiniMax H3 멀티 키프레임 워크플로우를 구축하고, 정확한 프레임에 이미지 또는 오디오 가이드를 배치하며, 연속성을 유지하고 Seedance Agent로 제작을 관리하세요.
글 읽기