Modellkarte 2026: Welches Modell für welche Aufgabe
FLUX.2, Qwen, Wan, HunyuanImage - wer wofür taugt und wie man im Modell-Zoo nicht untergeht
Überblick über aktuelle Open-Source-Modelle für Bilder und Video im Jahr 2026: FLUX.2, Qwen-Image, Wan, HunyuanImage, Z-Image, SD 3.5. Was sie unterscheidet, welche Modelle für Fotos, Text, Video und schwache Hardware taugen, und wo die Grenze zwischen Open-Source und geschlossenen APIs wie Ideogram verläuft.
Warum sich 2026 alles geändert hat
Noch vor ein paar Jahren war die Wahl einfach: Stable Diffusion und eine Handvoll ihrer Nachfolger. Text auf dem Bild kam als unlesbares Kauderwelsch heraus, Video war ein Kunststück für Eingeweihte, und für wirklich saubere Ergebnisse musste man zu bezahlten Diensten.
Heute sieht das anders aus. Open-Source - also Modelle, deren Gewichte Gewichte (weights) - das ist die trainierte Datei des neuronalen Netzes, sein „Gehirn“. Wenn die Gewichte veröffentlicht wurden (open-weights), kann man das Modell herunterladen und kostenlos auf dem eigenen Computer betreiben. Wenn nicht - ist der Zugriff nur über einen fremden kostenpflichtigen Server (API) möglich. öffentlich zugänglich gemacht wurden - hat die geschlossenen Dienste eingeholt und mancherorts überholt. Es gibt jetzt einzelne Meister für jede Aufgabe. Und genau hier geht der Einsteiger unter: Es gibt inzwischen so viele Modelle, dass einem die Augen übergehen.
Open-Source gegen geschlossene APIs - eine wichtige Grenze
Bevor wir die Modelle besprechen, ziehen wir eine Linie, über die fast alle stolpern.
- Open-Source (open-weights). Die Gewichte sind veröffentlicht. Datei heruntergeladen - und du generierst auf deiner eigenen Grafikkarte kostenlos, ohne Internet, ohne fremde Server. Das ist der ganze Sinn von ComfyUI. Dazu gehören FLUX.2, Qwen-Image, Wan 2.1/2.2 und andere.
- Geschlossene APIs. Das Modell läuft nur auf dem Server des Unternehmens, du zahlst für jedes Bild oder jede Sekunde Video. Oft sind das sehr leistungsstarke Sachen - zum Beispiel Ideogram (Legende für Text auf dem Bild) oder Wan 2.5 (Video mit Ton). Aber herunterladen und lokal betreiben kann man sie nicht.
Stars für Bilder
FLUX.2 - der neue Qualitätsmaßstab
FLUX.2 FLUX.2 - eine Modellfamilie vom Studio Black Forest Labs, erschienen Ende 2025. Nachfolger des beliebten FLUX.1. Gilt als eines der besten offenen Modelle in Qualität und Genauigkeit der Prompt-Umsetzung. von Black Forest Labs steht für saubere, „hochwertige“ Ergebnisse und genaues Treffen des Prompts. Die große Version (FLUX.2 dev, ~32 Mrd. Parameter) hält die charakteristische Konsistenz: Du kannst ihr mehrere Referenzen geben, und sie bewahrt Stil und Charakter von Bild zu Bild - ein Traum für Marken. Es gibt auch das leichte FLUX.2 klein mit 4-9 Mrd. - schnell und für schwache Hardware. Du nimmst es, wenn du Qualität und einen einheitlichen Serienstil brauchst.
Qwen-Image - Meister für Text
Qwen-Image Qwen-Image - ein Modell von Alibaba (Team Qwen), 20 Mrd. Parameter, Lizenz Apache 2.0 (frei nutzbar, auch kommerziell). Bekannt wurde es dadurch, dass es lesbaren Text auf dem Bild sauber zeichnet - was offene Modelle früher kaum konnten. löst einen alten Schmerz: Text auf dem Bild. Poster, Cover, Schilder, Interface-Mockups, Memes mit Beschriftung - hier ist es unter den offenen Modellen konkurrenzlos. Bonus - eine separate Version Qwen-Image-Edit, die ein fertiges Bild bearbeitet und sogar den Text darauf überschreibt. Dafür gibt es eine eigene Lektion.
HunyuanImage - schwere Artillerie
HunyuanImage 3.0 HunyuanImage 3.0 - ein Modell von Tencent mit der Architektur „Mixture of Experts“ (MoE), 80 Mrd. Parameter insgesamt. Versteht riesige Prompts (bis zu tausend Wörter) und komplexe Szenen, braucht aber ernsthafte Hardware. - ein Monster mit 80 Mrd. Parametern. Es verdaut Prompts mit tausend Wörtern und baut komplexeste Szenen mit Kontextverständnis. Die Kehrseite - ein enormer Hunger nach Videospeicher. Das ist eine Option für alle, die eine leistungsstarke Grafikkarte haben und Aufgaben mit vielen Details bewältigen müssen.
Z-Image und SD 3.5 - für Geschwindigkeit und schwache Hardware
Wenn die Grafikkarte bescheiden ist, ist das 2026 kein Todesurteil. Z-Image (6 Mrd. Parameter, Apache 2.0) liefert ein ansehnliches Bild in weniger als einer Sekunde und läuft mit 16 GB Videospeicher - und zeichnet auch Text. Und das bewährte Stable Diffusion 3.5 bleibt ein universelles Arbeitstier mit verbessertem Text. Wenn Geschwindigkeit wichtig ist oder die Hardware schwach ist - schau hierher.
Star für Video: Wan
Bilder sind eine Hälfte von 2026. Die andere - Video, und hier regiert Wan Wan - eine Familie offener Videomodelle von Alibaba. Wan 2.1 und 2.2 - mit offenen Gewichten, laufen in ComfyUI, können Video aus Text erzeugen und Fotos zum Leben erwecken. Wan 2.5 - bereits ein geschlossenes API. von Alibaba. Die offenen Wan 2.1 und 2.2 können sowohl Text-zu-Video als auch - was besonders interessant ist - dein Foto zum Leben erwecken (image-to-video). Sie laufen direkt in ComfyUI. Eine eigene Lektion des Kapitels behandelt sie ausführlich.
- Foto/Kunst in Top-Qualität benötigt - FLUX.2 (oder HunyuanImage, wenn die Hardware leistungsstark ist).
- Text auf dem Bild benötigt - Qwen-Image. Fertiges Bild bearbeiten - Qwen-Image-Edit.
- Schwache Grafikkarte oder Geschwindigkeit benötigt - Z-Image, FLUX.2 klein, SD 3.5.
- Video benötigt - Wan 2.1 / 2.2.
- Alle Modelle herunterladen „um sie zu haben“ - du füllst die Festplatte, arbeitest aber mit zwei oder drei.
- HunyuanImage 80B auf schwache Karte setzen - es stürzt wegen Speichermangels ab.
- Ideogram in ComfyUI suchen - es ist nicht dort, das ist ein geschlossenes API.
- Modell „nach Hype“ nehmen statt „für die Aufgabe“ - genau da fängt die Qual an.
Wie man in einer Minute wählt
- Formuliere die Aufgabe in einem Wort: Foto / Text / Video / Kunst.
- Schätze deine Hardware ein: wie viele Gigabyte Videospeicher hat die Karte.
- Text auf dem Bild - Qwen-Image. Video - Wan. Der Rest - FLUX.2.
- Hardware schwach? Nimm eine leichte Version: Z-Image, FLUX.2 klein, SD 3.5 oder eine quantisierte (GGUF) Version des gewünschten Modells.
- Lade EIN Modell für die Aufgabe herunter. Wenn du es beherrschst - dann probiere das zweite.
Häufige Fehler bei der Modellwahl
- Dem neuesten hinterherjagen. Das „Topmodell“ mit 80 Mrd. Parametern startet auf einer schwachen Karte einfach nicht. Zur eigenen Hardware - das passende Modell.
- Open-Source und API verwechseln. Ideogram, Midjourney, Wan 2.5 laufen nicht lokal. In ComfyUI - nur offene Gewichte.
- Das falsche Modell mit dem Prompt kurieren wollen. Von einem Text-Modell ein Foto verlangen - dasselbe wie in den vorherigen Lektionen: erst der richtige „Koch“, dann das Rezept.
- Einen Zoo herunterladen. Dutzende von Checkpoints „auf Vorrat“ fressen nur die Festplatte. Zwei bis drei funktionierende für die eigenen Aufgaben - das reicht.
TL;DR - если коротко
- Das Modell entscheidet fast alles. 2026 hat Open-Source die bezahlten Dienste eingeholt und stellenweise überholt - aber es gibt inzwischen so viele Modelle, dass man aufpassen muss, nicht nach allen auf einmal zu greifen.
- FLUX.2 - der Maßstab für Qualität und charakteristische Konsistenz. Qwen-Image - Meister für Text auf dem Bild. Wan - König der Open-Source-Videos.
- Schwache Hardware? Nimm leichte Modelle: Z-Image, FLUX.2 klein oder quantisierte Versionen. Schwere Modelle (HunyuanImage 80B) - für leistungsstarke Grafikkarten.
- Open-Source = Gewichte können heruntergeladen und lokal betrieben werden. Ideogram und Wan 2.5 - geschlossene APIs: leistungsstark, aber nicht dein Eigentum und kostenpflichtig pro Bild.
- Die wichtigste Regel hat sich nicht geändert: erst die Aufgabe, dann das Modell. Nicht umgekehrt.