Первый workflow ComfyUI: текст в картинку за 6 нод
Шесть коробочек, пара проводов - и картинка из ничего
Первый workflow ComfyUI text-to-image по нодам: Load Checkpoint, CLIP Text Encode, Empty Latent Image, KSampler, VAE Decode, Save Image. Что делает каждая и как соединить провода.
Что такое workflow в ComfyUI простыми словами
Открыл ComfyUI - и на тебя смотрит схема из коробочек на проводах. Будто кто-то разобрал пульт от телевизора и не собрал обратно. Спокойно. Это не реактор и не код.
Это конвейер. Обычный заводской конвейер. На входе - твои слова, на выходе - готовый PNG. А между ними стоят шесть станков, и каждый делает ровно одно дело, потом толкает деталь дальше по ленте. Эти станки и есть ноды Нода (node) - коробочка-станок в ComfyUI. Берёт что-то на вход, делает одну операцию и отдаёт результат на выход. Из нод собирается весь воркфлоу. , а лента между ними - провода. Запомни эту картинку, дальше будет легче.
Зачем разбираться в нодах, а не просто жать Generate
Можно тыкать «Generate» вслепую. Иногда повезёт. Но захочешь поменять размер, убрать лишнее или понять, почему вышла каша, - и без знания нод ты как без рук.
- Поймёшь, где крутить ручки, чтобы картинка стала лучше, а не страшнее.
- Перестанешь копировать чужие воркфлоу наугад - будешь видеть, что внутри.
- Красный провод и ошибка перестанут вызывать панику. Ты просто починишь.
- Любой следующий урок - LoRA, апскейл, inpaint - это та же лента плюс пара новых станков. База одна на всё.
Девять из десяти жалоб «у меня ComfyUI не работает» - это несоединённый провод или нода, которая ждёт данные не того типа. Разберёшься с базой - и эти проблемы станут видны сразу.
Шесть нод text-to-image по порядку
Прокатимся по конвейеру слева направо. Этот порядок и есть вся логика воркфлоу - запомни его, остальное приложится.
1. Load Checkpoint - нанимаем художника
Первый станок грузит чекпоинт Чекпоинт (checkpoint) - это и есть обученная модель, большой файл, который умеет рисовать. Лежит в папке models, подпапка checkpoints. Разные чекпоинты рисуют в разном стиле: реализм, аниме, живопись. - саму модель, которая умеет рисовать. Это твой художник. Кого наймёшь - таким и будет стиль: один пишет как фотограф, другой как аниматор.
У ноды три выхода. MODEL - мозг художника. CLIP - его уши, чтобы понимать слова. VAE - его переводчик в пиксели. Дальше эта троица разъедется по разным станкам.
2 и 3. CLIP Text Encode - что рисовать и что НЕ рисовать
Тут два одинаковых станка. Они берут твой текст и переводят его на язык модели - человеческие слова напрямую она не понимает.
- Позитивный промпт - что хочешь видеть: «рыжий кот в очках, мягкий свет, фото».
- Негативный промпт - чего видеть НЕ хочешь: «размыто, лишние пальцы, текст, водяной знак».
4. Empty Latent Image - чистый холст и размер
Этот станок выдаёт пустой холст в виде латента Латент (latent) - сжатое внутреннее представление картинки, в котором работает модель. Это ещё не пиксели, а компактный «черновик» в памяти машины. В пиксели его переводит VAE в самом конце. . Это ещё не картинка, а заготовка из чистого шума, в которой модель будет «проявлять» изображение.
Здесь же задаёшь размер - ширину и высоту - и сколько картинок выдать за раз (batch size). Размер не мелочь: каждая модель обучена под свой родной размер. Поставишь слишком большой - получишь дубли и артефакты. Проверено многими новичками, не повторяй.
5. KSampler - сердце генерации
Главный станок. Сюда сходится почти всё: художник (MODEL), оба списка слов (positive и negative) и чистый холст (latent). И вот тут случается то, ради чего всё затевалось: модель раз за разом убирает шум с холста, шаг за шагом, пока из тумана не проступит картинка по твоему описанию.
KSampler KSampler (семплер) - нода, которая пошагово превращает шум в изображение, ориентируясь на твои промпты. Сердце генерации. - место, где ты крутишь главные ручки. Вот самые важные:
- steps (шаги) - сколько раз убирать шум. Больше - чище, но дольше. 20-30 обычно за глаза.
- cfg - насколько строго слушать промпт. Задерёшь - картинка «пережаривается». Держи 6-8.
- seed - зерно случайности. Тот же seed = тот же результат, копейка в копейку.
- sampler_name - алгоритм. Дефолтный обычно ок, поиграешь позже.
- scheduler - как именно убирается шум. Тоже оставь по умолчанию на старте.
- denoise - для text-to-image держи на 1.0. Трогать будем в уроке про image-to-image.
6. VAE Decode и Save Image - из латента в готовый файл
KSampler выдал картинку, но всё ещё в виде латента - на «языке машины». VAE Decode переводит её в обычные пиксели, которые видит глаз. А Save Image кладёт готовый файл на диск, по умолчанию в папку output. Конвейер доехал до конца.
Провода в ComfyUI: почему они разного цвета
Провод - не украшение. Он говорит станку: «держи деталь вон с того станка». И есть железное правило: цвет провода = тип данных. Стыковать можно только одинаковые цвета. Перепутать физически не выйдет.
- розовый/фиолетовый - MODEL (мозг художника, идёт в KSampler);
- жёлтый - CLIP (от чекпоинта к двум станкам с текстом);
- оранжевый - CONDITIONING (переведённые слова, от текста в KSampler);
- красный - VAE (переводчик в пиксели, в VAE Decode);
- розово-красный - LATENT (холст и результат, циркулирует в середине);
- синий - IMAGE (готовые пиксели, в Save Image).
Как запустить первую генерацию с нуля
Самое приятное: дефолтный воркфлоу уже собран за тебя. Шесть нод руками ставить не надо - грузишь шаблон и меняешь слова.
- Открой ComfyUI. В верхнем меню найди шаблоны воркфлоу и выбери базовый text-to-image (Image Generation). Шесть нод появятся сами.
- В ноде Load Checkpoint выбери любую установленную модель из списка. Список пуст - значит модель не скачана: положи файл в папку models, подпапка checkpoints, и обнови.
- В верхнюю ноду текста (positive) впиши, что хочешь: рыжий кот в очках сидит у окна, мягкий утренний свет, детальное фото.
- В нижнюю ноду текста (negative) впиши, чего НЕ хочешь: размыто, низкое качество, лишние конечности, текст, водяной знак.
- В Empty Latent Image оставь размер по умолчанию. Не гонись за огромным холстом на первом запуске.
- Жми Queue (запустить). Подожди - и в ноде Save Image появится твоя картинка. Файл уже лежит в папке output.
Частые ошибки новичка в ComfyUI
- Перепутать позитив и негатив. Впишешь «красиво» в негатив - модель будет старательно избегать красоты. Сверяйся: верхний вход KSampler обычно positive, нижний negative.
- Тянуть провод не того цвета. Не липнет - значит не туда. Ищи вход того же типа, а не дёргай сильнее.
- Сразу ставить гигантский размер. Большой холст в Empty Latent Image даёт дубли и кашу. Начни с родного размера модели.
- Крутить все ручки KSampler разом. Меняй по одной, иначе не поймёшь, что сработало. Стартуй со steps и cfg.
- Пустой список в Load Checkpoint. Это не сломанный интерфейс - просто нет ни одной модели. Скачай чекпоинт и положи в нужную папку.
- Искать картинку «где-то в программе». Файл всегда на диске - в папке output рядом с ComfyUI. Не там, где ты его ищешь.
TL;DR - если коротко
- Дефолтный workflow - это конвейер из шести нод, сшитых проводами. Данные текут слева направо, и всё.
- Load Checkpoint - художник (модель). Два CLIP Text Encode - что рисовать (плюс) и чего НЕ рисовать (минус).
- Empty Latent Image - холст и размер. KSampler - сердце: лепит картинку из шума по твоим словам.
- VAE Decode переводит результат в обычные пиксели. Save Image кладёт файл на диск.
- Цвет провода = тип данных. Стыкуются только одинаковые цвета - перепутать не выйдет.
- Руками ничего не паяешь: грузишь готовый шаблон и меняешь слова. Минута - и поехали.