FLUX 3는 Black Forest Labs가 발표한 차세대 FLUX 계열 모델이다. 기존 텍스트-투-이미지 모델의 연장선에 머물지 않고, 이미지, 비디오, 액션을 하나의 멀티모달 플로우 모델 방향으로 묶으려는 시도다.
핵심 방향
FLUX 3의 메시지는 “더 예쁜 이미지 모델”보다 “현실 세계를 다루는 시각 지능 백본”에 가깝다. 정지 이미지 생성뿐 아니라 시간적으로 이어지는 비디오, 시각 입력을 바탕으로 한 액션 예측·제어 가능성을 함께 강조한다.
| 영역 | 의미 |
|---|---|
| 이미지 | 기존 FLUX 계열의 강점인 고품질 이미지 생성과 편집을 확장한다 |
| 비디오 | 장면 일관성, 움직임, 시간 축 제어가 중요해진다 |
| 액션 | 로봇, 에이전트, 인터랙티브 환경에서 시각 입력을 행동으로 연결하는 방향이다 |
누가 봐야 하나
FLUX 3는 이미지 생성 API만 찾는 사용자보다 다음 팀에 더 중요하다.
- 제품 이미지, 광고 소재, 영상 클립을 한 파이프라인에서 만들려는 크리에이티브 툴 팀
- 시각 기반 에이전트나 로봇 작업을 연구하는 팀
- 이미지 모델과 비디오 모델을 따로 운영하면서 품질·일관성·비용 문제가 생긴 팀
관련 문서
- gpt-image-2 — 이미지 생성 모델 비교와 API 관점
- nunchaku-lite — Diffusers에서 큰 확산 모델을 4비트로 실행하는 경로
- comfy-mcp — 에이전트에서 ComfyUI 이미지·영상 워크플로 실행
- ai-video-tips-veo3-alternatives — 비디오 생성 모델 선택 기준
참고 자료
- FLUX 3 — Black Forest Labs (2026-07-27)