~8 хв

Мультимодальні моделі: скрін у код, голос, картинки, відео

Модель, яка не лише читає текст, а ще й дивиться, слухає і сама малює

Мультимодальність простими словами: модель розуміє текст, картинки, звук і відео та вміє їх створювати. Скрін у код, голос замість клавіатури, генерація картинок - для вайбкодера.

Що таке мультимодальність простими словами

Уяви стажера, який вміє лише читати й писати. Текст - будь ласка, хоч роман. А ти йому скриншот: «ось, дивись, кнопка зʼїхала». А він не бачить. Зовсім. Для нього твій скриншот - просто незрозумілий файл, як для тебе інструкція давньогрецькою.

Тепер інший стажер. Читає, дивиться на картинки, слухає голос, може глянути відео. І сам начерк намалює, якщо попросиш. Ось це й є мультимодальна модель.

Слово страшне, сенс простий. Модальність - це канал сприйняття. Текст - один канал, картинка - інший, звук - третій, відео - четвертий (по суті картинки плюс звук у часі). «Мульти» означає «багато». Мультимодальна модель тягне кілька каналів одразу, а не лише літери.

Голова моделі з чотирма вхідними каналами: текст, картинка, звук, відео
Одна модель - багато каналів. Текст, картинка, звук, відео входять і виходять.

Навіщо мультимодальність вайбкодеру

Ти вайбкодер. Твоя суперсила - пояснювати задачу так, як зручно тобі, а не підлаштовуватися під машину. Мультимодальність знімає головний податок: тобі не потрібно перекладати картинку в слова.

Як було раніше? «Там кнопка синя, заокруглена, трохи лівіше центру, під нею дрібний сірий текст…» - і все одно модель зрозуміє по-своєму. А як тепер? Кинув скриншот - і все.

  • Скрін у код. Показуєш макет або фото начерку від руки - отримуєш HTML і CSS чи готовий компонент. Дизайн словами не описуєш.
  • Голос замість клавіатури. Надиктував задачу на ходу - модель розпізнала мовлення й відповіла. Руки вільні.
  • Картинки на замовлення. Потрібна заглушка, іконка, банер для лендінга - модель малює прямо під запит.
  • Відео та скріни з багом. Записав екран, де все ламається, - модель дивиться й каже, у чому річ. Швидше за будь-який опис.

Скриншот помилки економить десять хвилин листування. Ти не переказуєш стек-трейс по памʼяті - ти його показуєш, і модель читає прямо з картинки.

Вхід і вихід: як працює мультимодальна модель

Запамʼятай одну річ - і половина плутанини зникне. У мультимодальності дві сторони, і змішувати їх не можна:

  • Розуміння (вхід). Що модель уміє прийняти й осмислити: текст, картинку, аудіо, відео.
  • Генерація (вихід). Що модель уміє створити: текст, картинку, голос, інколи відео.

Це різні навички. Модель може чудово бачити картинки й при цьому зовсім не вміти їх малювати. Буває й навпаки: генератор картинок, який слабко ловить текстові нюанси. Тож фраза «модель мультимодальна» сама по собі нічого не каже. Питай конкретно: за якими каналами вхід, за якими вихід?

Звідки в моделі «очі» та «вуха»

Зовсім на пальцях. Усередині модель живе у світі чисел. Щоб вона «побачила» картинку, зображення спершу перетворюють на набір чисел, які лежать у тому самому просторі, що й слова. Грубо кажучи, картинка і фраза описуються однією внутрішньою мовою. Тому модель і повʼязує слово «кіт» із фоткою кота - для неї це близькі точки в одному просторі смислів.

Зі звуком і відео те саме: їх ріжуть на шматочки й переводять у числа. Відео тут найважчий канал - це багато кадрів плюс звукова доріжка. Звідси й розплата: обробляється довше й дорожче за текст.

Картинка, звук і текст сходяться в один спільний простір смислів
Картинка, звук і слова перекладаються однією внутрішньою мовою - мовою чисел.

Як зверстати екран за скриншотом: приклад

Покажу типовий кейс вайбкодера від початку до кінця. Задача проста: є скрін чужого екрана, хочеш схожий у себе.

Скрін у код за 5 кроків
  1. Зроби скриншот екрана, який хочеш повторити, або сфоткай начерк від руки.
  2. Відкрий мультимодальну модель, яка вміє приймати зображення на вхід - це її здатність бачити.
  3. Прикріпи картинку й опиши задачу словами: зверстай це на HTML і CSS, адаптивно, кольори візьми з картинки.
  4. Отримай код, встав у проєкт, запусти. Щось зʼїхало - знову прикріпи скриншот результату й скажи, що поправити.
  5. Потрібна картинка-заглушка замість порожнього блоку - попроси модель згенерувати зображення під опис і поклади його в проєкт.

Помітив? На кроці 2 ти перевірив вхід (розуміє картинку), а на кроці 5 тобі знадобився вихід (малює картинку). Це можуть бути навіть різні моделі - і це нормально.

Щоб скрін у код заходив з першого разу, не пиши «зверстай як на картинці». Дай моделі рамки. Ось шаблон - скопіюй і підстав під себе:

Промпт: скрін макета в код

Ось скриншот екрана. Зверстай схожий блок.

Що важливо:

  • стек: чистий HTML і CSS, без фреймворків;
  • адаптивно: на телефоні все в одну колонку;
  • кольори, відступи й шрифти бери максимально близько до картинки;
  • семантичні теги, зрозумілі імена класів.

Спочатку коротко перелічи, які елементи ти бачиш на скріні, і лише потім видай код одним файлом.

Маленька хитрість захована в останньому рядку. Прохання спочатку описати, що модель бачить, ловить непорозуміння до того, як вона напише код. Чогось у списку немає або щось зайве? Правиш одразу, а не налагоджуєш потім готову верстку.

Ліворуч розмитий абзац тексту, праворуч один скриншот, обидві стрілки ведуть до однакового коду
Абзац опису і один скрін дають один і той самий код. Скрін швидше.
Де мультимодальність реально виручає
  • Скрін макета або помилки замість довгого текстового опису.
  • Голосове введення задачі, коли друкувати незручно або ти на ходу.
  • Швидкі картинки-заглушки, іконки та чернетки для інтерфейсу.
  • Розбір короткого відео з відтворенням бага.
Де поки що краще не перестаратися
  • Довге відео цілком - дорого й повільно, краще вирізати потрібний шматок.
  • Складна точна графіка для прода - генерація дає чернетку, а не фінал.
  • Скріни з паролями й токенами - чутливе не завантажуй.
  • Сліпа віра, що раз модель бачить, то й зрозуміє все - результат усе одно перевіряй.

Часті помилки з мультимодальними моделями

  • Вважати будь-яку модель всеїдною. Не кожна модель бачить картинки й тим паче малює їх. Спершу перевір її входи та виходи, потім будуй процес.
  • Плутати розуміння й генерацію. «Розбирає скриншоти» не означає «генерує зображення». Це дві різні навички, і часто вони живуть у різних моделях.
  • Вантажити гігантське відео цілком. Відео - найважчий канал. Виріж шматок секунд на десять із самим багом, а не надсилай пів години запису.
  • Описувати словами те, що простіше показати. Є скрін - прикріпи скрін. Переказуючи картинку текстом, ти втрачаєш головну перевагу.
  • Завантажувати чутливі дані. На скриншоті легко проґавити закритий токен, пароль чи дані клієнта. Замазуй перед надсиланням.
  • Чекати піксель-у-піксель. Генерація картинок і верстка за скріном дають близький результат, а не точну копію. Це чернетка, яку ти доводиш руками.

TL;DR - если коротко

  • Модальність - це канал сприйняття: текст, картинка, звук, відео. Звичайна модель знає лише текст, мультимодальна - одразу кілька каналів.
  • У мультимодальності дві сторони: модель розуміє картинку, звук і відео на вході та може їх створювати на виході. Уміє не кожна - звіряй під задачу.
  • Для вайбкодера це важіль: кинув скрін макета - отримав код. Надиктував голосом, згенерив картинку-заглушку прямо в проєкт.
  • Скрін помилки або відео з багом часто пояснюють швидше за абзац тексту. Показав - і описувати словами не треба.
  • Відео - найважчий канал: ріж короткий шматок із самим багом, а не лий пів години запису.
  • Правило одне: дивись на входи та виходи конкретної моделі. Розуміє картинку - не означає малює, і навпаки.

Пошук по вікі

Натисніть Esc для закриття

Введіть запит для миттєвого пошуку по всіх сторінках курсів та уроків.