~9 мин

Первый workflow ComfyUI: текст в картинку за 6 нод

Шесть коробочек, пара проводов - и картинка из ничего

Первый workflow ComfyUI text-to-image по нодам: Load Checkpoint, CLIP Text Encode, Empty Latent Image, KSampler, VAE Decode, Save Image. Что делает каждая и как соединить провода.

Что такое workflow в ComfyUI простыми словами

Открыл ComfyUI - и на тебя смотрит схема из коробочек на проводах. Будто кто-то разобрал пульт от телевизора и не собрал обратно. Спокойно. Это не реактор и не код.

Это конвейер. Обычный заводской конвейер. На входе - твои слова, на выходе - готовый PNG. А между ними стоят шесть станков, и каждый делает ровно одно дело, потом толкает деталь дальше по ленте. Эти станки и есть ноды , а лента между ними - провода. Запомни эту картинку, дальше будет легче.

Заводской конвейер из шести станков, по ленте едет картинка от слов к готовому фото
Воркфлоу - это конвейер. Слова заезжают слева, картинка выезжает справа.

Зачем разбираться в нодах, а не просто жать Generate

Можно тыкать «Generate» вслепую. Иногда повезёт. Но захочешь поменять размер, убрать лишнее или понять, почему вышла каша, - и без знания нод ты как без рук.

  • Поймёшь, где крутить ручки, чтобы картинка стала лучше, а не страшнее.
  • Перестанешь копировать чужие воркфлоу наугад - будешь видеть, что внутри.
  • Красный провод и ошибка перестанут вызывать панику. Ты просто починишь.
  • Любой следующий урок - LoRA, апскейл, inpaint - это та же лента плюс пара новых станков. База одна на всё.

Девять из десяти жалоб «у меня ComfyUI не работает» - это несоединённый провод или нода, которая ждёт данные не того типа. Разберёшься с базой - и эти проблемы станут видны сразу.

Шесть нод text-to-image по порядку

Прокатимся по конвейеру слева направо. Этот порядок и есть вся логика воркфлоу - запомни его, остальное приложится.

1. Load Checkpoint - нанимаем художника

Первый станок грузит чекпоинт - саму модель, которая умеет рисовать. Это твой художник. Кого наймёшь - таким и будет стиль: один пишет как фотограф, другой как аниматор.

У ноды три выхода. MODEL - мозг художника. CLIP - его уши, чтобы понимать слова. VAE - его переводчик в пиксели. Дальше эта троица разъедется по разным станкам.

2 и 3. CLIP Text Encode - что рисовать и что НЕ рисовать

Тут два одинаковых станка. Они берут твой текст и переводят его на язык модели - человеческие слова напрямую она не понимает.

  • Позитивный промпт - что хочешь видеть: «рыжий кот в очках, мягкий свет, фото».
  • Негативный промпт - чего видеть НЕ хочешь: «размыто, лишние пальцы, текст, водяной знак».

4. Empty Latent Image - чистый холст и размер

Этот станок выдаёт пустой холст в виде латента . Это ещё не картинка, а заготовка из чистого шума, в которой модель будет «проявлять» изображение.

Здесь же задаёшь размер - ширину и высоту - и сколько картинок выдать за раз (batch size). Размер не мелочь: каждая модель обучена под свой родной размер. Поставишь слишком большой - получишь дубли и артефакты. Проверено многими новичками, не повторяй.

5. KSampler - сердце генерации

Главный станок. Сюда сходится почти всё: художник (MODEL), оба списка слов (positive и negative) и чистый холст (latent). И вот тут случается то, ради чего всё затевалось: модель раз за разом убирает шум с холста, шаг за шагом, пока из тумана не проступит картинка по твоему описанию.

KSampler - место, где ты крутишь главные ручки. Вот самые важные:

Что точно стоит понимать
  • steps (шаги) - сколько раз убирать шум. Больше - чище, но дольше. 20-30 обычно за глаза.
  • cfg - насколько строго слушать промпт. Задерёшь - картинка «пережаривается». Держи 6-8.
  • seed - зерно случайности. Тот же seed = тот же результат, копейка в копейку.
Куда руки тянутся, но лучше не лезть сразу
  • sampler_name - алгоритм. Дефолтный обычно ок, поиграешь позже.
  • scheduler - как именно убирается шум. Тоже оставь по умолчанию на старте.
  • denoise - для text-to-image держи на 1.0. Трогать будем в уроке про image-to-image.

6. VAE Decode и Save Image - из латента в готовый файл

KSampler выдал картинку, но всё ещё в виде латента - на «языке машины». VAE Decode переводит её в обычные пиксели, которые видит глаз. А Save Image кладёт готовый файл на диск, по умолчанию в папку output. Конвейер доехал до конца.

Схема из шести нод с подписанными проводами: model, clip, vae, latent, conditioning, image
Те же шесть нод и провода между ними. Цвет провода = тип данных.

Провода в ComfyUI: почему они разного цвета

Провод - не украшение. Он говорит станку: «держи деталь вон с того станка». И есть железное правило: цвет провода = тип данных. Стыковать можно только одинаковые цвета. Перепутать физически не выйдет.

  • розовый/фиолетовый - MODEL (мозг художника, идёт в KSampler);
  • жёлтый - CLIP (от чекпоинта к двум станкам с текстом);
  • оранжевый - CONDITIONING (переведённые слова, от текста в KSampler);
  • красный - VAE (переводчик в пиксели, в VAE Decode);
  • розово-красный - LATENT (холст и результат, циркулирует в середине);
  • синий - IMAGE (готовые пиксели, в Save Image).

Как запустить первую генерацию с нуля

Самое приятное: дефолтный воркфлоу уже собран за тебя. Шесть нод руками ставить не надо - грузишь шаблон и меняешь слова.

Твой первый запуск за 6 шагов
  1. Открой ComfyUI. В верхнем меню найди шаблоны воркфлоу и выбери базовый text-to-image (Image Generation). Шесть нод появятся сами.
  2. В ноде Load Checkpoint выбери любую установленную модель из списка. Список пуст - значит модель не скачана: положи файл в папку models, подпапка checkpoints, и обнови.
  3. В верхнюю ноду текста (positive) впиши, что хочешь: рыжий кот в очках сидит у окна, мягкий утренний свет, детальное фото.
  4. В нижнюю ноду текста (negative) впиши, чего НЕ хочешь: размыто, низкое качество, лишние конечности, текст, водяной знак.
  5. В Empty Latent Image оставь размер по умолчанию. Не гонись за огромным холстом на первом запуске.
  6. Жми Queue (запустить). Подожди - и в ноде Save Image появится твоя картинка. Файл уже лежит в папке output.

Частые ошибки новичка в ComfyUI

  • Перепутать позитив и негатив. Впишешь «красиво» в негатив - модель будет старательно избегать красоты. Сверяйся: верхний вход KSampler обычно positive, нижний negative.
  • Тянуть провод не того цвета. Не липнет - значит не туда. Ищи вход того же типа, а не дёргай сильнее.
  • Сразу ставить гигантский размер. Большой холст в Empty Latent Image даёт дубли и кашу. Начни с родного размера модели.
  • Крутить все ручки KSampler разом. Меняй по одной, иначе не поймёшь, что сработало. Стартуй со steps и cfg.
  • Пустой список в Load Checkpoint. Это не сломанный интерфейс - просто нет ни одной модели. Скачай чекпоинт и положи в нужную папку.
  • Искать картинку «где-то в программе». Файл всегда на диске - в папке output рядом с ComfyUI. Не там, где ты его ищешь.

TL;DR - если коротко

  • Дефолтный workflow - это конвейер из шести нод, сшитых проводами. Данные текут слева направо, и всё.
  • Load Checkpoint - художник (модель). Два CLIP Text Encode - что рисовать (плюс) и чего НЕ рисовать (минус).
  • Empty Latent Image - холст и размер. KSampler - сердце: лепит картинку из шума по твоим словам.
  • VAE Decode переводит результат в обычные пиксели. Save Image кладёт файл на диск.
  • Цвет провода = тип данных. Стыкуются только одинаковые цвета - перепутать не выйдет.
  • Руками ничего не паяешь: грузишь готовый шаблон и меняешь слова. Минута - и поехали.

Поиск по вики

Нажмите Esc для закрытия

Введите запрос для мгновенного поиска по всем страницам курсов и уроков.