~9 мин

Карта моделей 2026: кого брать под задачу

FLUX.2, Qwen, Wan, HunyuanImage - кто на что годится и как не утонуть в зоопарке моделей

Обзор актуальных опенсорс-моделей для картинок и видео на 2026 год: FLUX.2, Qwen-Image, Wan, HunyuanImage, Z-Image, SD 3.5. Чем отличаются, что брать под фото, текст, видео и слабое железо, и где проходит граница между опенсорсом и закрытыми API вроде Ideogram.

Почему в 2026-м всё поменялось

Ещё пару лет назад выбор был простой: Stable Diffusion и горстка её потомков. Текст на картинке выходил кракозябрами, видео было фокусом для избранных, а за по-настоящему чистый результат приходилось идти в платные сервисы.

Сейчас картина другая. Опенсорс - то есть модели, чьи веса выложили в открытый доступ, - догнал, а кое-где и обогнал закрытые сервисы. Появились отдельные чемпионы под каждую задачу. И ровно тут новичок тонет: моделей стало так много, что глаза разбегаются.

Sodi-навигатор у светящейся развилки с указателями фото, текст и видео
Сначала задача, потом модель: Sodi выбирает дорогу под фото, текст или видео.

Опенсорс против закрытых API - важная граница

Прежде чем разбирать модели, проведём черту, на которой спотыкаются почти все.

  • Опенсорс (open-weights). Веса опубликованы. Скачал файл - и генерируешь у себя на видеокарте бесплатно, без интернета, без чужих серверов. Это весь смысл ComfyUI. Сюда входят FLUX.2, Qwen-Image, Wan 2.1/2.2 и другие.
  • Закрытые API. Модель работает только на сервере компании, ты платишь за каждую картинку или секунду видео. Часто это очень мощные штуки - например, Ideogram (легенда по тексту на картинке) или Wan 2.5 (видео со звуком). Но скачать и запустить локально их нельзя.

Звёзды для картинок

FLUX.2 - новый эталон качества

FLUX.2 от Black Forest Labs - это про чистый, «дорогой» результат и точное попадание в запрос. Старшая версия (FLUX.2 dev, ~32 млрд параметров) держит фирменную консистентность: можешь подать ей несколько референсов, и она сохранит стиль и персонажа от кадра к кадру - мечта для бренда. Есть и лёгкая FLUX.2 klein на 4-9 млрд - быстрая, для слабого железа. Берёшь, когда нужно качество и единый стиль серии.

Qwen-Image - чемпион по тексту

Qwen-Image решает старую боль: текст на картинке. Постеры, обложки, вывески, макеты интерфейса, мемы с подписью - тут она вне конкуренции среди открытых. Бонус - отдельная версия Qwen-Image-Edit, которая редактирует уже готовую картинку и даже переписывает текст на ней. Этому посвящён отдельный урок.

HunyuanImage - тяжёлая артиллерия

HunyuanImage 3.0 - монстр на 80 млрд параметров. Переваривает промпты в тысячу слов и собирает сложнейшие сцены с пониманием контекста. Расплата - аппетит к видеопамяти. Это вариант для тех, у кого мощная видеокарта и задача со множеством деталей.

Z-Image и SD 3.5 - для скорости и слабого железа

Если видеокарта скромная, в 2026-м это не приговор. Z-Image (6 млрд параметров, Apache 2.0) выдаёт достойную картинку меньше чем за секунду и заводится на 16 ГБ видеопамяти, да ещё и текст рисует. А проверенная Stable Diffusion 3.5 остаётся универсальной рабочей лошадкой с улучшенным текстом. Когда важна скорость или железо слабое - смотри сюда.

Звезда для видео: Wan

Картинка - это половина 2026 года. Вторая - видео, и тут правит Wan от Alibaba. Открытые Wan 2.1 и 2.2 умеют и текст-в-видео, и - что вкуснее - оживить твоё фото (image-to-video). Работают прямо в ComfyUI. Отдельный урок главы разбирает их подробно.

Что взять, если...
  • Нужно фото/арт топ-качества - FLUX.2 (или HunyuanImage, если железо мощное).
  • Нужен текст на картинке - Qwen-Image. Редактировать готовое - Qwen-Image-Edit.
  • Слабая видеокарта или нужна скорость - Z-Image, FLUX.2 klein, SD 3.5.
  • Нужно видео - Wan 2.1 / 2.2.
Чего НЕ делать
  • Качать все модели «чтобы были» - забьёшь диск, работать будешь двумя-тремя.
  • Ставить HunyuanImage 80B на слабую карту - вылетит по памяти.
  • Искать Ideogram в ComfyUI - его там нет, это закрытый API.
  • Брать модель «по хайпу» вместо «под задачу» - вот где начинается мучение.

Как выбрать за минуту

Выбор модели по задаче
  1. Сформулируй задачу одним словом: фото / текст / видео / арт.
  2. Прикинь своё железо: сколько гигабайт видеопамяти у карты.
  3. Текст на картинке - Qwen-Image. Видео - Wan. Остальное - FLUX.2.
  4. Железо слабое? Бери лёгкую версию: Z-Image, FLUX.2 klein, SD 3.5 или квантованную (GGUF) сборку нужной модели.
  5. Скачивай ОДНУ модель под задачу. Освоил - тогда пробуй вторую.

Частые ошибки с выбором модели

  • Гнаться за самой новой. «Топовая» 80-миллиардная модель на слабой карте просто не запустится. Под железо - модель по силам.
  • Путать опенсорс и API. Ideogram, Midjourney, Wan 2.5 локально не крутятся. В ComfyUI - только открытые веса.
  • Лечить промптом не ту модель. Просить фото у модели для текста - то же, что в прошлых уроках: сначала правильный «повар», потом рецепт.
  • Скачать зоопарк. Десятки чекпоинтов «на всякий» только съедят диск. Два-три рабочих под твои задачи - предел.

TL;DR - если коротко

  • Модель решает почти всё. В 2026-м опенсорс догнал и местами обогнал платные сервисы - но моделей стало много, и важно не хвататься за все сразу.
  • FLUX.2 - эталон качества и фирменной консистентности. Qwen-Image - чемпион по тексту на картинке. Wan - король опенсорс-видео.
  • Слабое железо? Бери лёгкие модели: Z-Image, FLUX.2 klein или квантованные версии. Тяжёлые (HunyuanImage 80B) - для мощных видеокарт.
  • Опенсорс = веса можно скачать и крутить локально. Ideogram и Wan 2.5 - закрытые API: мощно, но не твоё и платно за каждый кадр.
  • Главное правило не изменилось: сначала задача, потом модель. Не наоборот.

Поиск по вики

Нажмите Esc для закрытия

Введите запрос для мгновенного поиска по всем страницам курсов и уроков.