~9 Min

Modellkarte 2026: Welches Modell für welche Aufgabe

FLUX.2, Qwen, Wan, HunyuanImage - wer wofür taugt und wie man im Modell-Zoo nicht untergeht

Überblick über aktuelle Open-Source-Modelle für Bilder und Video im Jahr 2026: FLUX.2, Qwen-Image, Wan, HunyuanImage, Z-Image, SD 3.5. Was sie unterscheidet, welche Modelle für Fotos, Text, Video und schwache Hardware taugen, und wo die Grenze zwischen Open-Source und geschlossenen APIs wie Ideogram verläuft.

ECC-Skills in dieser Lektion: fal-ai-media

Warum sich 2026 alles geändert hat

Noch vor ein paar Jahren war die Wahl einfach: Stable Diffusion und eine Handvoll ihrer Nachfolger. Text auf dem Bild kam als unlesbares Kauderwelsch heraus, Video war ein Kunststück für Eingeweihte, und für wirklich saubere Ergebnisse musste man zu bezahlten Diensten.

Heute sieht das anders aus. Open-Source - also Modelle, deren Gewichte öffentlich zugänglich gemacht wurden - hat die geschlossenen Dienste eingeholt und mancherorts überholt. Es gibt jetzt einzelne Meister für jede Aufgabe. Und genau hier geht der Einsteiger unter: Es gibt inzwischen so viele Modelle, dass einem die Augen übergehen.

Sodi als Navigator an einem leuchtenden Wegweiser zu Foto, Text und Video
Erst die Aufgabe, dann das Modell: Sodi wählt den Weg für Foto, Text oder Video.

Open-Source gegen geschlossene APIs - eine wichtige Grenze

Bevor wir die Modelle besprechen, ziehen wir eine Linie, über die fast alle stolpern.

  • Open-Source (open-weights). Die Gewichte sind veröffentlicht. Datei heruntergeladen - und du generierst auf deiner eigenen Grafikkarte kostenlos, ohne Internet, ohne fremde Server. Das ist der ganze Sinn von ComfyUI. Dazu gehören FLUX.2, Qwen-Image, Wan 2.1/2.2 und andere.
  • Geschlossene APIs. Das Modell läuft nur auf dem Server des Unternehmens, du zahlst für jedes Bild oder jede Sekunde Video. Oft sind das sehr leistungsstarke Sachen - zum Beispiel Ideogram (Legende für Text auf dem Bild) oder Wan 2.5 (Video mit Ton). Aber herunterladen und lokal betreiben kann man sie nicht.

Stars für Bilder

FLUX.2 - der neue Qualitätsmaßstab

FLUX.2 von Black Forest Labs steht für saubere, „hochwertige“ Ergebnisse und genaues Treffen des Prompts. Die große Version (FLUX.2 dev, ~32 Mrd. Parameter) hält die charakteristische Konsistenz: Du kannst ihr mehrere Referenzen geben, und sie bewahrt Stil und Charakter von Bild zu Bild - ein Traum für Marken. Es gibt auch das leichte FLUX.2 klein mit 4-9 Mrd. - schnell und für schwache Hardware. Du nimmst es, wenn du Qualität und einen einheitlichen Serienstil brauchst.

Qwen-Image - Meister für Text

Qwen-Image löst einen alten Schmerz: Text auf dem Bild. Poster, Cover, Schilder, Interface-Mockups, Memes mit Beschriftung - hier ist es unter den offenen Modellen konkurrenzlos. Bonus - eine separate Version Qwen-Image-Edit, die ein fertiges Bild bearbeitet und sogar den Text darauf überschreibt. Dafür gibt es eine eigene Lektion.

HunyuanImage - schwere Artillerie

HunyuanImage 3.0 - ein Monster mit 80 Mrd. Parametern. Es verdaut Prompts mit tausend Wörtern und baut komplexeste Szenen mit Kontextverständnis. Die Kehrseite - ein enormer Hunger nach Videospeicher. Das ist eine Option für alle, die eine leistungsstarke Grafikkarte haben und Aufgaben mit vielen Details bewältigen müssen.

Z-Image und SD 3.5 - für Geschwindigkeit und schwache Hardware

Wenn die Grafikkarte bescheiden ist, ist das 2026 kein Todesurteil. Z-Image (6 Mrd. Parameter, Apache 2.0) liefert ein ansehnliches Bild in weniger als einer Sekunde und läuft mit 16 GB Videospeicher - und zeichnet auch Text. Und das bewährte Stable Diffusion 3.5 bleibt ein universelles Arbeitstier mit verbessertem Text. Wenn Geschwindigkeit wichtig ist oder die Hardware schwach ist - schau hierher.

Star für Video: Wan

Bilder sind eine Hälfte von 2026. Die andere - Video, und hier regiert Wan von Alibaba. Die offenen Wan 2.1 und 2.2 können sowohl Text-zu-Video als auch - was besonders interessant ist - dein Foto zum Leben erwecken (image-to-video). Sie laufen direkt in ComfyUI. Eine eigene Lektion des Kapitels behandelt sie ausführlich.

Was du nimmst, wenn...
  • Foto/Kunst in Top-Qualität benötigt - FLUX.2 (oder HunyuanImage, wenn die Hardware leistungsstark ist).
  • Text auf dem Bild benötigt - Qwen-Image. Fertiges Bild bearbeiten - Qwen-Image-Edit.
  • Schwache Grafikkarte oder Geschwindigkeit benötigt - Z-Image, FLUX.2 klein, SD 3.5.
  • Video benötigt - Wan 2.1 / 2.2.
Was du NICHT tun solltest
  • Alle Modelle herunterladen „um sie zu haben“ - du füllst die Festplatte, arbeitest aber mit zwei oder drei.
  • HunyuanImage 80B auf schwache Karte setzen - es stürzt wegen Speichermangels ab.
  • Ideogram in ComfyUI suchen - es ist nicht dort, das ist ein geschlossenes API.
  • Modell „nach Hype“ nehmen statt „für die Aufgabe“ - genau da fängt die Qual an.

Wie man in einer Minute wählt

Modellwahl nach Aufgabe
  1. Formuliere die Aufgabe in einem Wort: Foto / Text / Video / Kunst.
  2. Schätze deine Hardware ein: wie viele Gigabyte Videospeicher hat die Karte.
  3. Text auf dem Bild - Qwen-Image. Video - Wan. Der Rest - FLUX.2.
  4. Hardware schwach? Nimm eine leichte Version: Z-Image, FLUX.2 klein, SD 3.5 oder eine quantisierte (GGUF) Version des gewünschten Modells.
  5. Lade EIN Modell für die Aufgabe herunter. Wenn du es beherrschst - dann probiere das zweite.

Häufige Fehler bei der Modellwahl

  • Dem neuesten hinterherjagen. Das „Topmodell“ mit 80 Mrd. Parametern startet auf einer schwachen Karte einfach nicht. Zur eigenen Hardware - das passende Modell.
  • Open-Source und API verwechseln. Ideogram, Midjourney, Wan 2.5 laufen nicht lokal. In ComfyUI - nur offene Gewichte.
  • Das falsche Modell mit dem Prompt kurieren wollen. Von einem Text-Modell ein Foto verlangen - dasselbe wie in den vorherigen Lektionen: erst der richtige „Koch“, dann das Rezept.
  • Einen Zoo herunterladen. Dutzende von Checkpoints „auf Vorrat“ fressen nur die Festplatte. Zwei bis drei funktionierende für die eigenen Aufgaben - das reicht.

TL;DR - если коротко

  • Das Modell entscheidet fast alles. 2026 hat Open-Source die bezahlten Dienste eingeholt und stellenweise überholt - aber es gibt inzwischen so viele Modelle, dass man aufpassen muss, nicht nach allen auf einmal zu greifen.
  • FLUX.2 - der Maßstab für Qualität und charakteristische Konsistenz. Qwen-Image - Meister für Text auf dem Bild. Wan - König der Open-Source-Videos.
  • Schwache Hardware? Nimm leichte Modelle: Z-Image, FLUX.2 klein oder quantisierte Versionen. Schwere Modelle (HunyuanImage 80B) - für leistungsstarke Grafikkarten.
  • Open-Source = Gewichte können heruntergeladen und lokal betrieben werden. Ideogram und Wan 2.5 - geschlossene APIs: leistungsstark, aber nicht dein Eigentum und kostenpflichtig pro Bild.
  • Die wichtigste Regel hat sich nicht geändert: erst die Aufgabe, dann das Modell. Nicht umgekehrt.

Wiki durchsuchen

Esc zum Schließen drücken

Geben Sie einen Suchbegriff ein, um alle Lektionen und Kurse zu durchsuchen.