Welches KI-Modell sollten Sie wählen?

Es gibt mehr Bild- und Videomodelle, als irgendjemand testen kann. Dieser Leitfaden behandelt die aktuelle Version jeder Modellfamilie auf faktry, wofür sie sich am besten eignet und welches Modell zu Ihrer Aufgabe passt.

Vom faktry-Team Aktualisiert im September 2026

Ein mit FLUX 3 auf faktry erzeugter Clip. Alle Bilder und Videos in diesem Leitfaden wurden auf der Plattform erstellt.

Die kurze Antwort

Wenn Sie nur einen Startpunkt suchen: Nehmen Sie Nano Banana 2 für Bilder und Veo 3.1 für Video. Beide sind schnell, beide kommen mit den meisten Prompts gut zurecht, und keines verlangt, dass Sie erst einen Parameter verstehen, bevor Sie ein brauchbares Ergebnis bekommen.

Der Rest dieses Leitfadens ist für die Momente, in denen der Standard nicht reicht. Vielleicht muss das Bild lesbaren Text enthalten, das Video dreißig Sekunden lang sein, oder Sie wollen in einem Clip eine einzelne Sache ändern, ohne die ganze Szene neu zu erzeugen. Jeder Abschnitt unten nennt das Modell, das für genau dieses Problem gebaut ist.

Schnelle Empfehlungen

Suchen Sie Ihre Situation in der Liste und lesen Sie dann den Abschnitt zum jeweiligen Modell.

Bilder: fünf Modelle, fünf Stärken

Bildmodelle unterscheiden sich vor allem in drei Punkten: wie schnell sie antworten, wie genau sie einem detaillierten Prompt folgen und wie viel Steuerung sie erlauben. Das sind die fünf, die wir empfehlen, in der Reihenfolge, in der die meisten sie ausprobieren sollten.

Nano Banana 2

GoogleAm besten für: Tempo und Vielseitigkeit

Beispiel, erstellt mit Nano Banana 2
Erstellt mit Nano Banana 2 auf faktry.

Nano Banana 2 ist Googles Bildmodell auf Basis von Gemini 3.1 Flash und unser Standard. Es ist schnell, kommt mit einer großen Bandbreite an Motiven zurecht und kann per Websuche reale Zusammenhänge in ein Bild einbeziehen. Das hilft bei aktuellen Produkten, Orten und Ereignissen.

Es rendert bis zu 4K und unterstützt 11 Seitenverhältnisse, sodass dasselbe Modell einen quadratischen Social-Post ebenso abdeckt wie ein breites Banner. Eine Lite-Version tauscht etwas Qualität gegen schnellere Generierung und geringere Credit-Kosten und eignet sich für große Stückzahlen und frühe Experimente.

Zur vollständigen Seite zu Nano Banana 2

Beispiel, erstellt mit Nano Banana 2
Weitere Beispiele, erstellt mit Nano Banana 2.
Beispiel, erstellt mit Nano Banana 2

GPT Image 2.5

OpenAIAm besten für: Text, Layout und präzise Bearbeitung

Beispiel, erstellt mit GPT Image 2.5
Typografie-lastige Layouts wie diese Einladung sind die größte Stärke von GPT Image 2.5.

GPT Image 2.5 ist OpenAIs neuestes Bildmodell, erschienen am 8. September 2026, und ersetzt in diesem Leitfaden GPT Image 2. Es gibt zwei Varianten. Flare ist der schnelle Standard mit bis zu 50 % geringerer Latenz als der Vorgänger. Sunburst ist langsamer und präziser, gedacht für finale Kampagnenmotive und Bearbeitungen, bei denen sich sonst nichts im Bild verändern darf.

Es ist das Modell der Wahl, wenn ein Bild Worte enthalten muss: Einladungen, Folien, Poster, Verpackungen. Es nimmt bis zu 16 Referenzbilder pro Bearbeitung, rendert transparente Hintergründe und bietet fünf Qualitätsstufen, sodass Entwürfe schon ab 1 Credit möglich sind und finale Bilder die höheren Stufen nutzen.

Zur vollständigen Seite zu GPT Image 2.5

Beispiel, erstellt mit GPT Image 2.5
Weitere Beispiele, erstellt mit GPT Image 2.5.
Beispiel, erstellt mit GPT Image 2.5

Seedream 5.0

ByteDanceAm besten für: Bearbeitung und mehrsprachiger Text

Beispiel, erstellt mit Seedream 5.0Beispiel, erstellt mit Seedream 5.0
Erstellt mit Seedream 5.0 auf faktry.

Seedream 5.0 ist ByteDances multimodales Bildmodell für professionelle Layouts wie dichte Infografiken, Produktblätter und Poster mit viel Text. Der native mehrsprachige Textrender ist der Hauptgrund, warum es gewählt wird, besonders für nicht englische Texte.

Es bearbeitet mit bis zu 10 Referenzbildern. Die Pro-Stufe liefert höchste Detailtreue und Textqualität für die finale Auslieferung, Lite ist schneller, günstiger und erreicht bis zu 4K.

Zur vollständigen Seite zu Seedream 5.0

Flux 2

Black Forest LabsAm besten für: Feinsteuerung und Konsistenz

Flux 2 von Black Forest Labs gibt es in drei Varianten. Pro liefert professionelle Details und Konsistenz, Max zielt auf höchste Qualität und Auflösung, und Flex legt die Regler offen: Guidance Scale, Inferenzschritte (1 bis 50) und Prompt-Erweiterung.

Guidance bestimmt, wie wörtlich das Modell Ihrem Prompt folgt, und Schritte tauschen Zeit gegen Feinschliff. Wenn Sie ein Bild lieber abstimmen als neu würfeln, ist das die richtige Familie. Black Forest Labs hat FLUX 3 als Nachfolger angekündigt; auf faktry ist dieses Modell derzeit für Video verfügbar, daher bleibt Flux 2 die Wahl für Flux-Bilder.

Zur vollständigen Seite zu Flux 2

Beispiel, erstellt mit Flux 2
Flux 2 Pro
Beispiel, erstellt mit Flux 2
Flux 2 Flex

Krea 2

KreaAm besten für: Ästhetik und kreative Bandbreite

Krea 2 ist darauf trainiert, wie ein Bild wirkt, nicht nur was es zeigt. Überlässt man ihm die Entscheidung, wählt es Farbgebung, Tiefenschärfe und Bildausschnitt passend zum Motiv. Eine Kreativitätseinstellung von Raw bis High legt fest, wie viel dieser Interpretation Sie möchten.

Sie können ein einzelnes Bild oder ein Moodboard eingeben, und Krea 2 überträgt den visuellen Stil auf neue Motive. Besonders stark ist es bei Filmkorn, Bewegungsunschärfe, Chrom, Lens Flares und ähnlichen fotografischen Effekten. Large ist die Wahl für Fotorealismus, Produktaufnahmen und Architektur. Medium ist schneller und passt besser zu Illustration, Anime und Concept Art.

Zur vollständigen Seite zu Krea 2

Video: worauf Sie vor der Wahl achten sollten

Video bringt Länge, Ton und Konsistenz auf die Liste. Wichtig sind vier Fragen: Wie lang kann ein einzelner Clip sein, kommt er mit Ton, können Sie Referenzen mitgeben, und lässt sich das Ergebnis bearbeiten. Die Modelle sind grob von der besten ersten Anlaufstelle zu den spezialisierteren Optionen sortiert.

Veo 3.1

GoogleAm besten für: Realismus und synchroner Ton

Veo 3.1 ist Googles Flaggschiff für Video und das Modell, das wir zuerst empfehlen. Es erzeugt synchronen Ton zum Bild, akzeptiert Text, ein Startbild oder Referenzbilder und gibt 720p, 1080p oder 4K in Clips von 4, 6 oder 8 Sekunden aus.

Der Standard-Modus ist für fertige Clips, der Fast-Modus für schnelle Durchläufe. Reference-to-Video hält eine Figur oder ein Produkt über mehrere Einstellungen konsistent, und die Prompt-Verbesserung behebt typische Formulierungsprobleme vor der Generierung. Die kurze Clip-Länge ist die wichtigste Grenze; für Längeres schauen Sie weiter unten in der Liste.

Zur vollständigen Seite zu Veo 3.1

HappyHorse-1.0

AlibabaAm besten für: Spitzenqualität laut Rangliste

Zum Zeitpunkt der Veröffentlichung belegt HappyHorse-1.0 Platz eins in der Artificial Analysis Video Arena für Text-to-Video und Image-to-Video ohne Ton, wobei die Platzierung auf Blindabstimmungen von Menschen beruht. Mit Ton liegt es in beiden auf Platz zwei.

Es erzeugt Video und Ton gemeinsam in einem Durchgang, verarbeitet Clips von 3 bis 15 Sekunden in 720p oder 1080p, akzeptiert bis zu 9 Referenzbilder und unterstützt anweisungsbasierte Bearbeitung. Wählen Sie es, wenn vor allem zählt, wie gut das Ergebnis auf jemanden wirkt, der nicht weiß, welches Modell es erzeugt hat.

Zur vollständigen Seite zu HappyHorse-1.0

Sora 2

OpenAIAm besten für: Filmisches Erzählen

Sora 2 ist OpenAIs filmisches Videomodell. Die Ausgabe ist auf 720p festgelegt, Clips dauern 1 bis 10 Sekunden, und es arbeitet mit Text oder einem Startbild. Bekannt ist es für stimmige Szenen mit glaubwürdiger Bewegung, Beleuchtung und Kameraführung.

Standard eignet sich gut für Entwürfe, Pro ist die Premium-Stufe für fertige Arbeiten. Es hat die engste technische Bandbreite in diesem Leitfaden, wählen Sie es also wegen der Bildwirkung und nicht wegen Länge, Auflösung oder Referenzen.

Zur vollständigen Seite zu Sora 2

Kling 3.0

KlingAm besten für: Mehrere Einstellungen am Stück

Kling 3.0 kann bis zu 10 Einstellungen in einer einzigen Anfrage planen, sodass eine kurze Sequenz mit Schnitten als eine Generierung entsteht, mit denselben Figuren durchgehend. Clips dauern 3 bis 15 Sekunden, mit Ton und Stimmzuordnung, und 4K-Ausgabe ist möglich.

Standard- und Pro-Modus tauschen Tempo gegen Qualität, und Lip Sync macht es für sprechende Clips nutzbar. Wenn Sie eine kleine Szene als Storyboard aufbauen, statt eine durchgehende Einstellung zu drehen, ist das das direkteste Werkzeug.

Zur vollständigen Seite zu Kling 3.0

Wan 3.0

AlibabaAm besten für: Lange Clips mit vielen Referenzen

Erstellt mit Wan 3.0 auf faktry.

Wan 3.0 erzeugt bis zu 30 Sekunden in einem durchgehenden Durchgang, standardmäßig mit synchronem Ton, in 480p, 720p oder 1080p. Diese Länge ist das Hauptargument. Bei den meisten Modellen müssen Sie mehrere Clips aneinandersetzen, um dorthin zu kommen.

Außerdem akzeptiert es die breiteste Auswahl an Referenzen, die wir anbieten: bis zu 10 Bilder, 5 Videos und 5 Audioclips, dazu Dokumente und Webseiten. Referenz, Bearbeitung, Replikation und Bewegungssteuerung übernimmt dasselbe Modell.

Zur vollständigen Seite zu Wan 3.0

Seedance 2.5

ByteDanceAm besten für: Inszenierte Szenen bis 30 Sekunden

Erstellt mit Seedance 2.5 auf faktry.

Seedance 2.5 erzeugt native 30-Sekunden-Clips mit gemeinsamem Ton, in 480p oder 720p. Sie können bis zu 50 multimodale Referenzen übergeben, um eine Figur, ein Set oder eine Farbpalette über die ganze Einstellung festzuhalten.

Mit der Steuerung von Start- und Endbild legen Sie das erste und das letzte Bild fest, und das Modell erfindet die Bewegung dazwischen. ByteDance nennt rund 20 % höhere Prompt-Genauigkeit als bei Seedance 2.0. Es endet bei 720p, wählen Sie also Wan 3.0, wenn Sie 1080p brauchen.

Zur vollständigen Seite zu Seedance 2.5

FLUX 3

Black Forest LabsAm besten für: Video mit Dialog

Erstellt mit FLUX 3 auf faktry.

FLUX 3, erschienen am 23. Juli 2026, ist das multimodale Modell von Black Forest Labs: eine Architektur für Bild, Video und Ton. Auf faktry ist die Videoseite verfügbar, mit Clips bis zu 20 Sekunden in 720p oder 1080p und nativem, mehrsprachigem Dialog.

Es gibt vier Modi: Text zu Video, Bild zu Video, erstes und letztes Bild sowie Video-Verlängerung, die einen vorhandenen Clip fortsetzt. Abgerechnet wird pro Sekunde Ausgabe, ab 10 Credits. Eine starke Wahl, wenn in einem Clip Menschen sprechen sollen.

Zur vollständigen Seite zu FLUX 3

MiniMax H3

MiniMaxAm besten für: 2K-Ausgabe und Steuerung über viele Referenzen

Erstellt mit MiniMax H3 auf faktry.

MiniMax H3, auch Hailuo 03 genannt, ist ein Open-Weight-Modell, das Video an einer Stelle erzeugt, referenziert und bearbeitet. Es gibt bis zu 2K bei 24 fps mit nativem Stereoton aus, in Clips von 5 bis 15 Sekunden.

Eine einzige Anfrage kann eine Figur aus einem Foto, die Kamerasprache eines Referenzclips und eine Stimme aus einer Audioaufnahme mitbringen, mit bis zu 9 Bildern, 3 Videos und 3 Audioclips. Es kann außerdem Motive ersetzen, entfernen oder hinzufügen und eine Szene neu ausleuchten. Abgerechnet wird pro Sekunde, ab 10 Credits.

Zur vollständigen Seite zu MiniMax H3

Gemini Omni Flash

GoogleAm besten für: Bearbeitung und Iteration

Gemini Omni Flash wendet Geminis multimodales Denken auf Video an, und v1.1 (27. August 2026) ist die richtige Wahl, wenn Sie bereits Filmmaterial haben. Beschreiben Sie die Änderung in normaler Sprache, und es bearbeitet den vorhandenen Clip, bis zu 60 Sekunden hochgeladenes Video.

Es erzeugt auch aus Text, aus einem Bild mit optionalem Endbild oder aus bis zu 10 Bildern und 3 kurzen Referenzclips. Die Auflösung reicht von einem günstigen 360p-Entwurf bis 4K und wird pro Sekunde berechnet, sodass Sie niedrig iterieren und hoch abschließen können. Neue Generierungen dauern 3 bis 10 Sekunden.

Zur vollständigen Seite zu Gemini Omni Flash

LTX 2.5

LightricksAm besten für: Offene Gewichte und natives 4K

Erstellt mit LTX 2.5 auf faktry.

LTX 2.5 ist das Open-Weights-Videomodell von Lightricks. Es bringt native Multi-Shot-Generierung mit, die Figur, Umgebung und Licht über Schnitte hinweg stabil hält, und gibt alles von 720p bis nativem 4K HDR mit synchronem Ton aus.

Es beherrscht Text-to-Video, Image-to-Video und Audio-to-Video, mit Clips bis zu 20 Sekunden. Da die Gewichte offen sind, lohnt sich ein Blick darauf, wenn Sie mit eigenen Daten feintunen oder später selbst hosten möchten. Auf faktry können Sie es ohne Einrichtung ausprobieren.

Zur vollständigen Seite zu LTX 2.5

Die Videomodelle im Überblick

ModellClip-LängeAuflösung
Veo 3.14, 6 oder 8 s720p bis 4K
HappyHorse-1.03 bis 15 s720p, 1080p
Sora 21 bis 10 s720p
Kling 3.03 bis 15 sBis zu 4K
Wan 3.0Bis zu 30 s480p bis 1080p
Seedance 2.5Bis zu 30 s480p, 720p
FLUX 3Bis zu 20 s720p, 1080p
MiniMax H35 bis 15 sBis zu 2K
Gemini Omni Flash3 bis 10 s360p bis 4K
LTX 2.5Bis zu 20 s720p bis natives 4K

Gleiche Szene, drei Modelle

Eine Szene, drei Modelle: FLUX 3, Sora 2 und MiniMax H3, in dieser Reihenfolge.

Technische Daten sagen nur begrenzt etwas aus. Der Clip neben diesem Text zeigt eine Szene, eine Kundin beim Pfirsichkauf auf einem Markt, nacheinander erzeugt von FLUX 3, Sora 2 und MiniMax, jeweils im Bild beschriftet.

Achten Sie auf die Hände, den Korb und die Menschen im Hintergrund. Solche Details, dazu Licht und Kamerabewegung, sind die Stellen, an denen sich Modelle unterscheiden, und sie lassen sich schwer aus einer Beschreibung beurteilen.

Am schnellsten entscheiden Sie, indem Sie Ihren eigenen Prompt durch zwei oder drei Modelle laufen lassen und vergleichen. Die kostenlosen Credits decken das ab, und derselbe Prompt funktioniert bei allen.

Fünf Fragen, die die meisten Entscheidungen klären

Wenn zwei Modelle beide passend aussehen, entscheiden diese Punkte, grob nach Wichtigkeit sortiert.

  1. Wie gut muss das Ergebnis sein? Fotorealismus, künstlerische Interpretation und lesbarer Text sind verschiedene Fähigkeiten. Produktfotografie verlangt etwas anderes als Concept Art.
  2. Wie viele Versuche brauchen Sie? Schnellere Modelle erlauben mehr Iterationen. Entwerfen Sie mit einem schnellen Modell oder einer Lite-Stufe und investieren Sie Credits erst für das finale Rendering in das Premium-Modell.
  3. In welcher Form wird es ausgeliefert? Druck braucht mehr Auflösung als ein Bildschirm, und jede Plattform hat ihr eigenes Seitenverhältnis. Prüfen Sie Auflösung und Clip-Länge, bevor Sie sich festlegen.
  4. Wollen Sie steuern oder nur anfragen? Den meisten reichen die Standardwerte. Wenn Sie Guidance, Schritte oder Kreativität abstimmen möchten, wählen Sie ein Modell, das sie anbietet.
  5. Wie hoch ist das Budget? Die Credit-Kosten variieren je nach Modell, Stufe und Auflösung. Video wird bei mehreren Modellen pro Sekunde abgerechnet, kurze Testclips halten Experimente daher günstig.

Auswahl nach Aufgabe

Dieselben Modelle, gruppiert danach, was das Ergebnis leisten muss.

Produktfotografie
Flux 2 Pro für Details und Konsistenz. GPT Image 2.5, wenn Sie einen transparenten Hintergrund oder Text auf der Verpackung brauchen. Seedream 5.0 für dichte Produktblätter.
Social Media
Nano Banana 2 für Standbilder, oder die Lite-Stufe für große Mengen. Veo 3.1 oder Kling 3.0 für Clips.
Marketing-Video
Veo 3.1 für Qualität mit Ton, Sora 2 für einen filmischen Look, und Seedance 2.5 oder Wan 3.0, wenn der Spot länger als zehn Sekunden läuft.
Poster, Folien und Einladungen
GPT Image 2.5 oder Seedream 5.0, beide stark bei Text und Layout.
Kreative Erkundung
Krea 2 für Stil, Flux 2 Flex für Kontrolle und Nano Banana 2, wenn Sie viele schnelle Varianten wollen.
Vorhandenes Filmmaterial bearbeiten
Gemini Omni Flash für Bearbeitung in normaler Sprache. HappyHorse-1.0 und MiniMax H3 für referenzbasierte Bearbeitung.
Sprechende Menschen im Bild
FLUX 3 für mehrsprachigen Dialog, Kling 3.0 für Lip Sync und Veo 3.1 für synchronen Ton.

Was dieser Leitfaden weglässt

Wenn es in derselben Familie eine neuere Version gibt, behandeln wir nur die neuere. GPT Image 2.5 steht für GPT Image 2, Seedance 2.5 für Seedance 2.0, Wan 3.0 für Wan 2.5 und Kling 3.0 für Kling 2.5 Turbo.

Die einzige Ausnahme ist Flux 2. FLUX 3 ist neuer, aber nur die Videoseite ist auf faktry verfügbar, daher bleibt Flux 2 die richtige Antwort für Flux-Bilder. Wir aktualisieren diesen Leitfaden, sobald sich das ändert.