~8 мин

Мультимодальные модели: скрин в код, голос, картинки, видео

Модель, которая не только читает текст, но и смотрит, слушает и сама рисует

Мультимодальность простыми словами: модель понимает текст, картинки, звук и видео и умеет их создавать. Скрин в код, голос вместо клавиатуры, генерация картинок - для вайбкодера.

Что такое мультимодальность простыми словами

Представь стажёра, который умеет только читать и писать. Текст - пожалуйста, хоть роман. А ты ему скриншот: «вот, смотри, кнопка съехала». А он не видит. Совсем. Для него твой скриншот - просто непонятный файл, как для тебя инструкция на древнегреческом.

Теперь другой стажёр. Читает, смотрит на картинки, слушает голос, может глянуть видео. И сам набросок нарисует, если попросишь. Вот это и есть мультимодальная модель.

Слово страшное, смысл простой. Модальность - это канал восприятия. Текст - один канал, картинка - другой, звук - третий, видео - четвёртый (по сути картинки плюс звук во времени). «Мульти» значит «много». Мультимодальная модель тянет несколько каналов сразу, а не только буквы.

Голова модели с четырьмя входными каналами: текст, картинка, звук, видео
Одна модель - много каналов. Текст, картинка, звук, видео входят и выходят.

Зачем мультимодальность вайбкодеру

Ты вайбкодер. Твоя суперсила - объяснять задачу так, как удобно тебе, а не подстраиваться под машину. Мультимодальность снимает главный налог: тебе не нужно переводить картинку в слова.

Как было раньше? «Там кнопка синяя, скруглённая, чуть левее центра, под ней мелкий серый текст…» - и всё равно модель поймёт по-своему. А как теперь? Кинул скриншот - и всё.

  • Скрин в код. Показываешь макет или фото наброска от руки - получаешь HTML и CSS или готовый компонент. Дизайн словами не описываешь.
  • Голос вместо клавиатуры. Надиктовал задачу на ходу - модель распознала речь и ответила. Руки свободны.
  • Картинки на заказ. Нужна заглушка, иконка, баннер для лендинга - модель рисует прямо под запрос.
  • Видео и скрины с багом. Записал экран, где всё ломается, - модель смотрит и говорит, в чём дело. Быстрее любого описания.

Скриншот ошибки экономит десять минут переписки. Ты не пересказываешь стек-трейс по памяти - ты его показываешь, и модель читает прямо с картинки.

Вход и выход: как работает мультимодальная модель

Запомни одну вещь - и половина путаницы исчезнет. У мультимодальности две стороны, и смешивать их нельзя:

  • Понимание (вход). Что модель умеет принять и осмыслить: текст, картинку, аудио, видео.
  • Генерация (выход). Что модель умеет создать: текст, картинку, голос, иногда видео.

Это разные навыки. Модель может прекрасно видеть картинки и при этом совсем не уметь их рисовать. Бывает и наоборот: генератор картинок, который слабо ловит текстовые нюансы. Так что фраза «модель мультимодальная» сама по себе ничего не говорит. Спрашивай конкретно: по каким каналам вход, по каким выход?

Откуда у модели «глаза» и «уши»

Совсем на пальцах. Внутри модель живёт в мире чисел. Чтобы она «увидела» картинку, изображение сначала превращают в набор чисел, которые лежат в том же пространстве, что и слова. Грубо говоря, картинка и фраза описываются на одном внутреннем языке. Поэтому модель и связывает слово «кот» с фоткой кота - для неё это близкие точки в одном пространстве смыслов.

Со звуком и видео то же самое: их режут на кусочки и переводят в числа. Видео тут самый тяжёлый канал - это много кадров плюс звуковая дорожка. Отсюда и расплата: видео обрабатывается дольше и обходится дороже текста.

Картинка, звук и текст сходятся в одно общее пространство смыслов
Картинка, звук и слова переводятся в один внутренний язык - язык чисел.

Как сверстать экран по скриншоту: пример

Покажу типичный кейс вайбкодера от начала до конца. Задача простая: есть скрин чужого экрана, хочешь похожий у себя.

Скрин в код за 5 шагов
  1. Сделай скриншот экрана, который хочешь повторить, или сфоткай набросок от руки.
  2. Открой мультимодальную модель, которая умеет принимать изображения на вход - это её способность видеть.
  3. Прикрепи картинку и опиши задачу словами: свёрстай это на HTML и CSS, адаптивно, цвета возьми с картинки.
  4. Получи код, вставь в проект, запусти. Что-то съехало - снова прикрепи скриншот результата и скажи, что поправить.
  5. Нужна картинка-заглушка вместо пустого блока - попроси модель сгенерировать изображение под описание и положи его в проект.

Заметил? На шаге 2 ты проверил вход (понимает картинку), а на шаге 5 тебе понадобился выход (рисует картинку). Это могут быть даже разные модели - и это нормально.

Чтобы «скрин в код» срабатывал с первого раза, не пиши «свёрстай как на картинке». Дай модели рамки. Вот шаблон - скопируй и подставь под себя:

Промпт: скрин макета в код

Вот скриншот экрана. Свёрстай похожий блок.

Что важно:

  • стек: чистый HTML и CSS, без фреймворков;
  • адаптивно: на телефоне всё в одну колонку;
  • цвета, отступы и шрифты бери максимально близко к картинке;
  • семантические теги, понятные имена классов.

Сначала коротко перечисли, какие элементы ты видишь на скрине, и только потом выдай код одним файлом.

Маленькая хитрость спрятана в последней строке. Просьба сначала описать, что модель видит, ловит недопонимание до того, как она напишет код. Чего-то в списке нет или что-то лишнее? Правишь сразу, а не отлаживаешь потом готовую вёрстку.

Слева размытый абзац текста, справа один скриншот, обе стрелки ведут к одинаковому коду
Абзац описания и один скрин дают один и тот же код. Скрин быстрее.
Где мультимодальность реально выручает
  • Скрин макета или ошибки вместо длинного текстового описания.
  • Голосовой ввод задачи, когда печатать неудобно или ты на ходу.
  • Быстрые картинки-заглушки, иконки и черновики для интерфейса.
  • Разбор короткого видео с воспроизведением бага.
Где пока лучше не переусердствовать
  • Длинное видео целиком - дорого и медленно, лучше вырезать нужный кусок.
  • Сложная точная графика для прода - генерация даёт черновик, а не финал.
  • Скрины с паролями и токенами - чувствительное не загружай.
  • Слепая вера, что раз модель видит, то и поймёт всё - результат всё равно проверяй.

Частые ошибки с мультимодальными моделями

  • Считать любую модель всеядной. Не каждая модель видит картинки и тем более рисует их. Сначала проверь её входы и выходы, потом строй процесс.
  • Путать понимание и генерацию. «Разбирает скриншоты» не значит «генерирует изображения». Это два разных навыка, и часто они живут в разных моделях.
  • Грузить гигантское видео целиком. Видео - самый тяжёлый канал. Вырежи кусок секунд на десять с самим багом, а не присылай получасовую запись.
  • Описывать словами то, что проще показать. Есть скрин - прикрепи скрин. Пересказывая картинку текстом, ты теряешь главное преимущество.
  • Загружать чувствительные данные. На скриншоте легко проворонить закрытый токен, пароль или данные клиента. Замазывай перед отправкой.
  • Ждать совпадения пиксель в пиксель. Генерация картинок и вёрстка по скрину дают близкий результат, а не точную копию. Это черновик, который ты доводишь руками.

TL;DR - если коротко

  • Модальность - это канал восприятия: текст, картинка, звук, видео. Обычная модель знает только текст, мультимодальная - сразу несколько каналов.
  • У мультимодальности две стороны: модель понимает картинку, звук и видео на входе и может их создавать на выходе. Умеет не каждая - сверяй под задачу.
  • Для вайбкодера это рычаг: кинул скрин макета - получил код. Надиктовал голосом, сгенерил картинку-заглушку прямо в проект.
  • Скрин ошибки или видео с багом часто объясняют быстрее абзаца текста. Показал - и описывать словами не надо.
  • Видео - самый тяжёлый канал: режь короткий кусок с самим багом, а не лей получасовую запись.
  • Правило одно: смотри на входы и выходы конкретной модели. Понимает картинку - не значит рисует, и наоборот.

Поиск по вики

Нажмите Esc для закрытия

Введите запрос для мгновенного поиска по всем страницам курсов и уроков.