- 블로그
- FLUX 3 Video 리뷰: 멀티모달 성능, 20초 클립, 그리고 솔직한 한계
AI 개요
FLUX 3 Video란 무엇이며 누가 개발했나요?
FLUX 3 Video는 Black Forest Labs가 개발한 비디오, 오디오, 이미지, 액션을 아우르는 통합 멀티모달 모델입니다. 2026년 7월에 발표된 이 비디오 버전은 텍스트-투-비디오 및 이미지-투-비디오 방식으로 최대 20초 길이의 클립을 생성하며, 네이티브 오디오를 함께 제공합니다.
FLUX 3 Video 품질은 다른 모델과 비교해 어느 정도인가요?
FLUX 3는 특히 애니메이션 타이포그래피, 광범위한 시각 스타일, 대화, 자연스러운 단순 장면 표현에서 뛰어납니다. 반면, 호스팅된 2K 출력, 복잡한 물리 시뮬레이션, 장시간 객체 일관성 등에서는 MiniMax H3가 여전히 더 안정적인 선택입니다.
FLUX 3 Video는 얼마인가요?
파트너 API 가격은 초당 약 $0.17, 즉 10초당 약 $1.70입니다. Black Forest Labs는 간단한 공개 초당 요금제를 공식적으로 공시하지 않으므로, 대량 생성 전 반드시 현재 적용 중인 공급업체 요금을 확인하세요.
직접 해볼 준비가 되셨나요?
가입 시 무료 크레딧 제공. 요금제는 월 $20부터.
FLUX 3 Video를 로컬에서 ComfyUI로 실행할 수 있나요?
아직 공식 소비자용 다운로드 가능한 웨이트로는 불가능합니다. 호스팅된 API 워크플로우는 ComfyUI 또는 Comfy Cloud에서 나타날 수 있지만, 로컬 자체 호스팅은 계획 중인 FLUX 3 Dev 오픈 웨이트 출시에 달려 있으며, 현재로서는 확정된 출시 일정이 없습니다.
FLUX 3 Video가 실제로 무엇인지 — 하나의 모델, 모든 용도
FLUX 3는 별도의 음성 및 사운드 도구를 나중에 첨부한 비디오 전용 체크포인트가 아닙니다. 이는 이미지, 비디오, 오디오, 액션을 하나의 아키텍처로 통합하여 훈련된 멀티모달 기반 모델입니다. Self-Flow 접근법은 이러한 다양한 모달리티를 정렬시켜, 생성된 영향이 사운드를 유도하고, 말하는 문장이 입 움직임을 형성하며, 이미지 참조가 이후 비디오 프레임을 안내하도록 합니다.
이 설계가 바로 제품의 핵심 강점입니다. 창작자는 텍스트, 시작 이미지, 키프레임, 기존 영상, 대화, 분위기 사운드 등을 각각 별개의 작업으로 취급하지 않고도 자유롭게 전환할 수 있습니다. 그러나 이와 동등하게 중요한 단점도 존재합니다: 광범위한 기반 모델이라 해서 모든 동작, 해상도, 일관성 테스트에서 전문 비디오 모델을 자동으로 능가한다는 보장은 없습니다.
위 공식 생성 프레임은 FLUX 3의 시각적 범위를 보여주는 더 강력한 예시입니다: 광택 있는 빨간 코트를 입은 한 인물이 형광 녹색 세탁소 내부에 서 있습니다. 중심에 위치한 피사체, 반복되는 원형 세탁기, 강렬한 보색 대비는 즉각적인 그래픽적 매력을 창출하면서도 장면 전체를 명확히 읽을 수 있도록 유지합니다.
FLUX 3 Video가 할 수 있는 것 — 기능 및 사양
현재 생성 릴리스는 기본 텍스트-투-비디오보다 훨씬 넓은 제어 세트를 제공합니다:
- 최대 20초: 한 번의 생성으로 완전한 대화 흐름이나 짧은 광고 장면을 담을 수 있으며, 5초 또는 10초 후에 중단되지 않습니다.
- 네이티브 오디오: 대화, 효과음, 분위기 사운드가 프레임과 함께 생성되며, 별도의 음성 녹음 과정을 거치지 않습니다.
- 텍스트, 이미지, 키프레임 입력: 프롬프트에서 시작하거나, 시작 이미지를 애니메이션화하거나, 종료 이미지를 정의하거나, 여러 키프레임을 연결할 수 있습니다.
- 비디오 연속 생성: 최대 4초 분량의 기존 비디오와 오디오를 제공한 후, 그 이어지는 동작, 카메라 움직임, 대화, 사운드를 모두 자연스럽게 이어받습니다.
- 다중 샷: 하나의 생성 내에서 장면이나 카메라 앵글을 전환하면서도 시퀀스 전체를 관련성 있게 유지합니다.
- 타이포그래피: 제목, 간판, 화면 그래픽, 애니메이션 글꼴 등을 장면의 일부로 직접 렌더링합니다.
- 스타일 범위: 캐주얼한 캠코더 영상부터 애니메이션, 광고, 향수, 세련된 영화까지 다양하게 표현 가능합니다.
- 해상도: HD 해상도로 생성되며, 풀 HD 출력은 업스케일링을 통해 제공됩니다. 1080p는 네이티브 2K 렌더링과 혼동해서는 안 됩니다.

공식 FLUX 3 출력: 세 개의 제공된 키프레임을 10초 분량의 시퀀스로 연결한 사례. 타임라인을 통해 제어 방식을 단일 최종 프레임보다 훨씬 쉽게 이해할 수 있습니다.
이 타이포그래피 예시는 실제 생성된 클립이며, 디자인된 모의 시연이 아닙니다. 생산용 모델을 선택하기 전에 유사한 개념을 테스트하려면 Seedance 텍스트-투-비디오 워크플로우를 사용해 동일한 요청사항, 지속 시간, 화면 비율로 시작하세요.
실세계 품질 — FLUX 3가 앞서는 부분과 부족한 부분
FLUX 3가 가장 두드러지게 우수한 분야는 동영상 내 그래픽 콘텐츠입니다. 터미널 텍스트, 타이틀 카드, 간판, 디자인된 글꼴 등이 대부분의 비디오 모델이 생성하는 난해한 문자보다 훨씬 의도적이며 정확합니다. 또한 캐주얼, 레트로, 애니메이션, 상업용 스타일 사이를 유연하게 전환할 수 있습니다. 대화 장면은 공유된 오디오-비디오 모델 덕분에 이점을 얻습니다: 발화, 표정, 공간 사운드가 함께 계획됩니다.
직접 해볼 준비가 되셨나요?
이 가이드의 단계를 Seedance에서 바로 적용해 프롬프트나 이미지를 몇 분 안에 완성도 높은 영상으로 바꿔보세요.
가입 시 무료 크레딧 제공. 요금제는 월 $20부터.

LTX 2.5 리뷰: 속도, 멀티샷(Multi-Shot), 그리고 MiniMax H3와의 비교
속도, 네이티브 멀티샷 비디오, ComfyUI 설정, 오픈 웨이트(Open Weights), 이미지 품질, 그리고 MiniMax H3와의 직접 비교를 다룬 솔직한 LTX 2.5 리뷰.
글 읽기
Wan Animate 2 튜토리얼: Move 모드, Mix 모드 및 ComfyUI 워크플로 가이드
Wan Animate 2의 Move 모드와 Mix 모드를 학습하고, 참조 및 드라이버 입력을 준비한 후 ComfyUI 워크플로를 구축하며, 얼굴, 마스크, 배경 드리프트 문제를 해결합니다.
글 읽기
MiniMax H3 LoRA 훈련: 맞춤형 비디오 스타일을 위한 파인튜닝 완전 가이드
MiniMax H3 비디오 데이터셋을 준비하고, T2V, I2V, first-last-frame 또는 Ref2VA 훈련 방식을 선택한 후, rank와 학습률을 조정하여 생성된 LoRA를 클라우드 또는 로컬 워크플로에서 사용합니다.
글 읽기