Black Forest LabsBlack Forest Labs

Flux 3
Ein Modell für Bild, Video & Audio

Flux 3 ist das neue multimodale Basismodell von Black Forest Labs. Es erzeugt Bilder, Videos und Audio aus einer einzigen Architektur heraus, mit Ergebnissen, die in jedem Stil noch lebensechter wirken.

Die FLUX-3-Videogenerierung ist bei faktry verfügbar: Text-zu-Video, Bild-zu-Video, First/Last-Frame-zu-Video und Video-Erweiterung, jeweils mit nativem Ton.

Flux 3 in Aktion

Sieh, was Flux 3 erzeugen kann, generiert bei faktry.

Was ist FLUX 3?

FLUX 3 ist ein multimodales KI-Basismodell von Black Forest Labs, das am 23. Juli 2026 veröffentlicht wurde. Es erzeugt Bild, Video und synchronen nativen Ton aus einer einzigen einheitlichen Architektur auf Basis von Self-Flow, der Methode von Black Forest Labs zur Abstimmung von multimodaler Generierung und Verständnis in einem Modell. FLUX 3 Video erzeugt Clips von bis zu 20 Sekunden Länge in einem einzigen Durchlauf, mit mehrsprachigen Dialogen und synchronem Ton-Bild-Verhältnis.

FLUX 3 auf einen Blick

Entwickler
Black Forest Labs
Veröffentlicht
23. Juli 2026
Architektur
Multimodales Self-Flow-Basismodell
Modalitäten
Bild, Video und nativer Ton aus einem Modell
Max. Videolänge
20 Sekunden pro Generierung
Audio
Nativ, synchron, mehrsprachige Dialoge
Varianten
FLUX 3 Video, FLUX 3 Image, FLUX 3 Dev, FLUX 3 Action, FLUX-mimic
Offene Gewichte
Angekündigt, aber noch nicht veröffentlicht. FLUX 3 Dev ist als Open-Weight-Variante bestätigt, bislang ohne Releasedatum, Lizenz oder Hugging-Face-Repository
Lizenz
Für FLUX 3 noch nicht veröffentlicht. Die älteren FLUX.1-[dev]-Gewichte stehen unter der BFL Non-Commercial License
Bei faktry
Jetzt live: Text-zu-Video, Bild-zu-Video, First/Last-Frame-zu-Video und Video-Erweiterung

Zuletzt aktualisiert: · Modelldetails veröffentlicht von Black Forest Labs

FLUX 3 im Vergleich zu Flux 2

Was sich zwischen dem reinen Bildmodell Flux 2 und dem multimodalen FLUX 3 von Black Forest Labs ändert.

FähigkeitFlux 2FLUX 3
ModalitätenNur BildBild, Video und nativer Ton
VideogenerierungNicht unterstütztBis zu 20 Sekunden pro Generierung
AudioNicht unterstütztNativ, synchron, mehrsprachige Dialoge
ArchitekturBildgenerierungsmodellMultimodales Self-Flow-Basismodell
VariantenPro, Max, FlexVideo, Image, Dev, Action, FLUX-mimic
Bei faktryJetzt verfügbarJetzt verfügbar (Video)

Flux 2 heute bei faktry nutzen →

FLUX 3 Video, live bei faktry

Vier Wege, mit FLUX 3 Video zu erzeugen und zu bearbeiten, jeweils mit nativem Ton und Abrechnung pro Sekunde Ausgabe.

Text zu Video

Erzeugt ein Video mit synchronisiertem, nativem Ton direkt aus einem Text-Prompt.

10 Credits / Sekunde
Bis zu 20 s · 720p oder 1080p · automatisches oder festes Seitenverhältnis

Bild zu Video

Animiert ein einzelnes Startbild anhand deines Prompts zu einem vollständigen Videoclip.

10 Credits / Sekunde
Bis zu 20 s · 720p oder 1080p · nativer Ton

First/Last-Frame zu Video

Legt Start- und Endbild fest, FLUX 3 erzeugt die Bewegung dazwischen.

10 Credits / Sekunde
Bis zu 20 s · 720p oder 1080p · nativer Ton

Video verlängern

Setzt ein bestehendes Video an dessen letzten Frames fort und behält Bewegung und Stil bei.

20 Credits / Sekunde
Bis zu 20 s neues Material · 720p oder 1080p · nativer Ton

Dauer, Auflösung, Seitenverhältnis, nativer Ton und Sicherheitsstufe sind pro Generierung individuell einstellbar.

Was Flux 3 anders macht

Dank der Self-Flow-Architektur versteht ein einziges Modell, wie die Welt aussieht, sich bewegt und klingt.

Wirklich multimodal

Ein einziges Modell erzeugt Bild, Video und Audio, statt mehrerer separater Systeme, die aneinander gekoppelt sind.

Self-Flow-Architektur

Flow Matching bringt Generierung und Verständnis über verschiedene Datentypen hinweg in Einklang, das Modell lernt, wie Objekte zusammenhängen, sich bewegen und klingen.

Video mit nativem Ton

Erzeugt Videos mit synchronisiertem, direkt integriertem Ton bis zu 20 Sekunden Länge, inklusive Text-zu-Video, Bild-zu-Video und Video-zu-Video.

Präzisere Bildgenerierung

Versteht komplexe Prompts und stellt Text besser dar als frühere FLUX-Modelle, über verschiedene Stile, Seitenverhältnisse und Auflösungen hinweg.

Von Haus aus mehrsprachig

Sehr genaue mehrsprachige Textdarstellung in Bildern und mehrsprachige Dialoge in generierten Videos.

Lebensechte Bewegung & Ton

Überzeugende Mimik und stimmige Bild-Ton-Synchronisation, mit Steuerung über Keyframes.

Funktionen im Detail

Ein genauerer Blick darauf, was Flux 3 bei Video und Bild leistet.

Videogenerierung

Text-zu-Video, Bild-zu-Video und Video-zu-Video
Nativer Ton, Videos bis zu 20 Sekunden
Keyframe-zu-Video für präzise Bewegungssteuerung
Mehrsprachige Dialoge mit passender Lippensynchronisation
Vielfältige visuelle Stile, von fotorealistisch bis stilisiert
Überzeugende Mimik und stimmige Bild-Ton-Synchronisation

Bildgenerierung

Erzeugung und Bearbeitung in einem Modell
Besseres Verständnis komplexer, mehrteiliger Prompts
Sehr genaue mehrsprachige Textdarstellung in Bildern
Zahlreiche Stile, Seitenverhältnisse und Auflösungen
Konsistentere Ergebnisse als bei früheren FLUX-Modellen

Erste Benchmarks

In vorläufigen Text-zu-Video-Tests von Black Forest Labs wurde FLUX 3 Video im direkten Vergleich gegenüber anderen führenden Videomodellen bevorzugt.

77%
vs. Runway Gen-4.5
93%
vs. Luma Ray 3.2
bis zu 69%
vs. Grok Imagine Video
60%
vs. Kling v3 Pro

Vorläufige Ergebnisse, veröffentlicht von Black Forest Labs zur Ankündigung. Nicht unabhängig von faktry überprüft.

Wofür sich Flux 3 eignen wird

Ein Modell deckt Workflows ab, für die bisher mehrere einzelne Tools nötig waren.

Content-Erstellung

Von einem einzelnen Prompt direkt zu markenkonformen Bildern und Videos in einem durchgängigen Stil.

Marketing-Videos

Kurze Videos mit nativem Ton und mehrsprachigen Dialogen für Kampagnen und Social Media.

Produktvisualisierung

Produktideen ohne separate Rendering-Pipeline direkt in fotorealistische Bilder und Bewegtbild verwandeln.

Internationale Inhalte

Korrekter mehrsprachiger Text in Bildern und mehrsprachige Dialoge in Videos für ein globales Publikum.

Kann ich Flux 3 kostenlos testen?

Ja. Jedes neue Konto erhält 100 Credits, ohne Kreditkarte, und die FLUX 3-Videogenerierung ist von Anfang an freigeschaltet.

Kostenlose Credits zum Ausprobieren

100 Credits enthalten - keine Kreditkarte nötig
Voller FLUX 3-Videozugriff: Text, Bild und First/Last-Frame zu Video
Nativer Ton, bis zu 20 Sekunden pro Generierung
Kommerzielle Nutzungsrechte
Jetzt starten

Häufig gestellte Fragen

Was ist Flux 3?

Flux 3 ist das neue multimodale Basismodell von Black Forest Labs. Es erzeugt Bild, Video mit nativem Ton und Text aus einem einzigen, auf Self-Flow basierenden Modell.

Kann ich Flux 3 kostenlos testen?

Ja. Melden Sie sich auf faktry.ai an und Sie erhalten sofort 100 Gratis-Credits, ohne Kreditkarte. Damit können Sie Ihre ersten FLUX 3-Videos direkt erstellen. Danach gibt es kein Abo: FLUX 3 wird pro Sekunde Ausgabe abgerechnet, Sie zahlen also nur, was Sie tatsächlich generieren.

Wann wurde Flux 3 veröffentlicht?

Black Forest Labs hat FLUX 3 am 23. Juli 2026 veröffentlicht, zuerst mit Videogenerierung. faktry hat FLUX 3 Video kurz danach live geschaltet. Bildfunktionen und die weitere Modellreihe (FLUX 3 Image, FLUX 3 Dev, FLUX 3 Action und FLUX-mimic) folgen in den kommenden Monaten.

Sind die Flux 3-Gewichte auf Hugging Face verfügbar?

Noch nicht. Black Forest Labs hat FLUX 3 Dev als Open-Weight-Variante bestätigt, aber Stand August 2026 gibt es weder ein Releasedatum noch eine Lizenz, eine genannte Parameterzahl oder ein FLUX 3-Repository auf Hugging Face. Die Organisationsseite von Black Forest Labs auf Hugging Face ist die Stelle, an der die Gewichte erscheinen werden. Bis dahin ist FLUX 3 über gehostete APIs erreichbar, unter anderem über faktry.

Kann ich Flux 3 schon bei faktry nutzen?

Ja. Die FLUX-3-Videogenerierung ist jetzt bei faktry live: Text-zu-Video, Bild-zu-Video, First/Last-Frame-zu-Video und Video-Erweiterung, jeweils mit nativem Ton und Abrechnung pro Sekunde Ausgabe. Flux 2, Sora 2, Veo 3.1, Kling 3.0 und Seedance sind ebenfalls verfügbar.

Was unterscheidet Flux 3 von Flux 2?

Flux 2 erzeugt nur Bilder. Flux 3 ist multimodal: Es generiert Bilder und Videos mit nativem Ton aus einem Modell, mit besserem Prompt-Verständnis und präziserer mehrsprachiger Textdarstellung.

Was kann Flux 3 tatsächlich erzeugen?

Videos bis zu 20 Sekunden mit nativem Ton und mehrsprachigen Dialogen sowie Bilder in vielen Stilen, Seitenverhältnissen und Auflösungen, alles aus demselben zugrunde liegenden Modell.

Welche anderen Modelle kann ich schon bei faktry nutzen?

Flux 2, Sora 2, Veo 3.1, Kling 3.0, Seedance und weitere sind neben FLUX 3 bereits bei faktry verfügbar. Die komplette Übersicht findest du auf unserer KI-Modelle-Seite.