AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

FLUX 3 – 이미지·비디오·액션을 묶는 Black Forest Labs 멀티모달 모델

FLUX 3는 Black Forest Labs가 발표한 차세대 FLUX 계열 모델이다. 기존 텍스트-투-이미지 모델의 연장선에 머물지 않고, 이미지, 비디오, 액션을 하나의 멀티모달 플로우 모델 방향으로 묶으려는 시도다.

핵심 방향

FLUX 3의 메시지는 “더 예쁜 이미지 모델”보다 “현실 세계를 다루는 시각 지능 백본”에 가깝다. 정지 이미지 생성뿐 아니라 시간적으로 이어지는 비디오, 시각 입력을 바탕으로 한 액션 예측·제어 가능성을 함께 강조한다.

영역의미
이미지기존 FLUX 계열의 강점인 고품질 이미지 생성과 편집을 확장한다
비디오장면 일관성, 움직임, 시간 축 제어가 중요해진다
액션로봇, 에이전트, 인터랙티브 환경에서 시각 입력을 행동으로 연결하는 방향이다

누가 봐야 하나

FLUX 3는 이미지 생성 API만 찾는 사용자보다 다음 팀에 더 중요하다.

  • 제품 이미지, 광고 소재, 영상 클립을 한 파이프라인에서 만들려는 크리에이티브 툴 팀
  • 시각 기반 에이전트나 로봇 작업을 연구하는 팀
  • 이미지 모델과 비디오 모델을 따로 운영하면서 품질·일관성·비용 문제가 생긴 팀

Replicate에서 실행하기

Replicate의 FLUX 3 가이드는 이 모델을 BFL의 첫 비디오 모델로 소개하며, 이미지·오디오·비디오를 통합 아키텍처에서 학습해 한 번의 생성에서 영상과 오디오를 함께 만든다는 점을 강조한다. 텍스트-투-비디오뿐 아니라 시작 이미지, 종료 이미지, keyframe image, 기존 start_video를 넣어 영상 이어 만들기까지 지원한다.

import Replicate from "replicate";

const replicate = new Replicate();
const output = await replicate.run("black-forest-labs/flux-3", {
  input: {
    prompt: "A diver descends through a crystal-clear cenote, ancient ruins beneath the surface.",
    duration: "8",
    resolution: "720p",
    aspect_ratio: "16:9",
    generate_audio: true,
  },
});

프롬프트에는 화면만 쓰지 말고 소리도 함께 지정하는 것이 좋다. 자동차 추격 장면이라면 엔진음, 타이어 소리, 빗물 튀김처럼 물리적 사건과 연결되는 오디오를 적으면 영상의 움직임과 분위기까지 함께 영향을 받는다.

프롬프트 패턴

  • 여러 장면이 필요하면 [0-4s]: ... [4-9s]: ...처럼 시간 구간을 직접 적는다.
  • 이미지-투-비디오에서 시작 이미지와 종료 이미지를 함께 쓸 때는 duration을 정수로 맞춘다.
  • “멋진 장면”보다 카메라 위치, 추적 방식, 컷 전환을 구체적으로 적는다.
  • 기존 영상을 이어 붙일 때는 마지막 프레임의 운동량과 다음 행동을 자연스럽게 연결한다.

관련 문서

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)