Black Forest Labs, FLUX 3 출시: 이미지·비디오·오디오를 한 번에 학습하는 다중 모달 플로우 모델

📅 2026-07-29 · 🤖 AI Trend Korea · 🏷️ FLUX 3다중 모달Self-FlowFLUX 3 VideoFLUX-mimic

Black Forest Labs(BFL)가 FLUX 3를 공개했다. 이미지, 비디오, 오디오, 그리고 로봇 액션 예측을 하나의 가중치(weight) 세트만으로 동시에 처리하는 최초의 FLUX 모델이다. 텍스트만 입력해도 20초짜리 영상과 음성이 한 번에 생성되고, 동일 백본이 로봇 정책까지 구동한다. 이번 글에서는 FLUX 3의 기술 핵심, 영상 기능, 성능 비교, 그리고 함께 공개된 용어 10선까지 한 번에 정리한다.

20초단 한 번 생성 길이
93%Luma Ray 3.2 대비 선호도
80msRTX 5090 로봇 추론 시간
단일 모델영상·음성·액션 통합

FLUX 3란 무엇인가?

FLUX 3는 BFL이 만든 다중 모달(multimodal) 파운데이션 모델이다. 쉽게 말해 텍스트, 이미지, 비디오, 오디오라는 여러 종류의 데이터를 한꺼번에 학습한 거대한 AI 모델이다. 지금까지 나온 생성형 AI는 보통 이미지만 만들거나 영상만 만들거나 음성만 만들었다. FLUX 3는 이 모든 것을 하나의 모델 아키텍처로 통합했다.

이전 FLUX 모델은 이미지 생성에 특화되어 있었다. FLUX 3의 결정적 차이는 비디오와 오디오 그리고 로봇 액션 예측까지 하나의 가중치 세트로 동시에 처리한다는 점이다. 다시 말해 화면 속 장면, 거기서 나는 소리, 그리고 로봇이 어떻게 움직여야 할지를 한 모델이 동시에 이해한다.

왜 이미지·비디오·오디오를 동시에 학습해야 할까?

BFL의 설명은 단순하다. 한 가지 데이터만으로는 현실을 다 담을 수 없다는 것이다. 이미지는 한 순간의 모습만 잡고, 비디오는 시간 흐름을, 오디오는 사건과 소리의 인과관계만 보여준다. BFL은 이 각각을 현실의 손실 투영(lossy projection), 즉 원본의 일부만 담은 압축본으로 정의한다.

그래서 여러 모달리티를 함께 학습하면 서로가 서로를 제약하는 효과가 생긴다. 예를 들어 소리는 반드시 충격과 일치해야 하고, 움직임은 질량 법칙을 따라야 한다. 이런 상호 제약 덕분에 FLUX 3는 특히 사람 얼굴 표정과 물리적 사건·소리를 자연스럽게 연결하는 데서 강점을 보인다.

💡 한 줄 요약: 한 모델이 더 많은 감각을 동시에 학습할수록, 더 그럴듯한 영상을 만든다.

FLUX 3의 기술 핵심: Self-Flow

FLUX 3의 토대가 된 기법은 BFL이 2026년 3월에 공개한 Self-Flow다. Self-Flow는 두 가지 학습 목표를 합친 것이다.

학습 효율을 위해 EMA 교사 모델 자기 증류(teacher self-distillation) 기법이 쓰인다. 쉽게 설명하면, 모델이 학생 모델 본인과 비슷한 별도의 교사 모델을 두고, 그 교사 모델의 가중치는 학생 모델을 부드럽게 평균(EMA)해서 만든다. 교사 모델은 더 안정적인 학습 목표를 제공하기 때문에 결과적으로 학습이 빨라진다.

또한 토큰별 타임스텝 컨디셔닝(per-token timestep conditioning)이 적용됐다. 모든 토큰에 동일한 시간 스텝을 주지 않고, 토큰마다 다른 스텝을 부여해 품질과 안정성을 끌어올린 방식이다. GitHub에 공개된 참조 구현은 Apache-2.0 라이선스로 SiT-XL/2 백본을 사용하지만, 이는 연구용 체크포인트일 뿐 FLUX 3 자체는 아니라는 점을 BFL은 명확히 밝혔다.

FLUX 3 Video의 핵심 기능

FLUX 3 Video는 FLUX 3 위에 올라간 영상 생성 모듈이다. 가장 큰 특징은 네이티브 오디오(native audio) 지원이다. 영상과 음성을 따로 붙이는 것이 아니라, 한 번의 추론에서 비디오 프레임과 음향 스펙트로그램이 동시에 생성된다. 그래서 입술 움직임과 음성이 자동으로 어긋나지 않게 정렬된다.

지원 모드

부가 기능

키프레임 → 비디오는 스토리보드 방식으로 영상을 정확히 통제하고 싶은 사용자에게 유용하다. 시작과 끝 이미지만 던져주면 AI가 사이의 장면을 알아서 만들어 준다.

성능 비교: 다른 영상 모델과 어떻게 다른가?

BFL이 공개한 1차 인간 선호도 평가 결과는 720p·10초 길이·오디오 포함 조건에서 측정됐다. FLUX 3가 상대를 이긴 비율은 다음과 같다.

다만 Seedance 2.0과 Gemini Omni Flash에 대해서는 52%로, 사실상 동전 던지기 수준의 차이만 났다. 평가자가 한 표 차이로 선택한 경우가 절반이라는 뜻이다. 절대적인 승리가 아닌 상대적 선호도 평가임을 감안해야 한다.

FLUX-mimic: 같은 모델이 로봇도 움직인다

FLUX 3 백본은 영상 생성뿐 아니라 로봇 정책 FLUX-mimic도 구동한다. 동일한 가중치로 로봇이 어떻게 움직여야 할지를 예측한다. 흥미로운 점은 단일 RTX 5090 GPU에서 80ms 이내로 동작한다는 것이다. 실시간 로봇 제어에 충분한 응답 속도다.

학습 컴퓨팅의 95% 이상이 비디오 예측에 쓰이고, 오디오는 학습 토큰의 0.5% 미만을 차지한다. 그럼에도 영상·음성·액션이 하나의 모델 안에서 동시에 작동한다는 점이 FLUX 3의 핵심 차별점이다.

접근 정책: 언제부터 쓸 수 있나?

BFL은 단계적 공개을 밝혔다.

핵심 용어 10선 한눈에 보기

① 다중 모달 파운데이션 모델
텍스트·이미지·오디오·비디오 등 여러 종류의 데이터를 동시에 학습해 다양한 작업에 적응할 수 있는 기반 대형 AI 모델.
② 플로우 매칭 목적함수
시뮬레이션 없이 신경망이 노이즈를 데이터로 옮기는 속도장을 직접 학습하는 생성 모델 학습 방법.
③ Self-Flow
BFL이 2026년 3월 공개한 자기지도 플로우 매칭 프레임워크. 외부 인코더 없이 다중 모달 학습을 통합하며 최대 2.8배 빠른 수렴을 보인다.
④ EMA 교사 자기 증류
학생 모델의 가중치를 부드럽게 평균(EMA)해 만든 별도 교사 모델로 학습을 안정시키는 자기 학습 기법.
⑤ 에이전트 체이닝
여러 AI 단계의 출력을 다음 단계의 입력으로 연결해 복잡한 작업을 작은 단위로 정확하게 처리하는 설계 기법.
⑥ 키프레임 → 비디오
시작과 끝 이미지를 지정하면 AI가 그 사이의 움직임을 자동으로 채워 넣어 스토리보드처럼 영상을 만드는 기법.
⑦ 타이포그래피 생성
글자 디자인과 모션이 결합된 영상을 AI가 자동으로 생성하는 기술. 다국어 음성과 비트 싱크 모션 포함.
⑧ 손실 투영(lossy projection)
데이터를 압축할 때 일부 정보를 버리지만 사람이 인지하기엔 충분한 수준의 표현으로 환원하는 방식.
⑨ 토큰별 타임스텝 컨디셔닝
모든 토큰에 같은 시간 스텝을 주지 않고 토큰마다 다른 스텝을 부여해 품질과 안정성을 높이는 기법.
⑩ 네이티브 오디오
영상과 음성을 따로 합치지 않고, 한 번의 모델 추론에서 비디오 프레임과 음향 스펙트로그램을 동시에 생성하는 방식.

자주 묻는 질문 (FAQ)

정리: FLUX 3가 중요한 이유

FLUX 3는 단순한 영상 생성 모델이 아니다. 이미지·비디오·오디오·로봇 액션을 하나의 모델이 동시에 이해한다는 점이 핵심이다. 학습 컴퓨팅의 95%는 영상에 쓰이지만, 0.5%도 안 되는 오디오 토큰이 모델 전체에 제약을 줘서 결과 품질을 끌어올린다.

같은 가중치로 로봇까지 움직인다는 점은 생성형 AI가 더 이상 화면 안의 영상에 머물지 않고 물리 세계로 확장되고 있다는 신호다. 오픈 웨이트 공개까지 시간이 걸리겠지만, 멀티모달 통합의 방향성을 확인했다는 점에서 FLUX 3는 2026년 生成형 AI의 기준점이 될 모델이다.