Як обрати модель ШІ під задачу: гід по reasoning, ціні та контексту
Не клич екскаватор, щоб вкрутити лампочку
Як обрати модель ШІ під задачу: reasoning-моделі для коду й логіки, дешеві для класифікації, великий контекст для документів, локальні для приватних даних. Бери мінімально достатню.
Що означає «обрати модель під задачу»
Уяви, що в гаражі в тебе цілий автопарк: самокат, звичайний легковик, гоночний болід і броньований фургон інкасатора. Їздять усі. Але поїдеш на боліді по хліб у сусідній двір - спалиш бак, оглушиш сусідів і зіллєш купу грошей ні на що. А холодильник на самокаті? Просто не довезеш.
З мовними моделями LLM (велика мовна модель) - програма, навчена на величезному обсязі тексту, що відповідає на запити словами. ChatGPT, Claude, Gemini та локальні моделі - це все LLM. рівно та сама історія. Їх багато, вони різної потужності та ціни. І фокус не в тому, щоб знайти «найкращу». Фокус - під конкретну задачу взяти придатну. Часто це не топ, а навпаки - найскромніша, яка справляється.
Навіщо взагалі обирати модель під задачу
Можна лити всі задачі в одну найдорожчу модель. І воно навіть запрацює. Тільки переплачуватимеш у рази, чекатимеш довше, а інколи ще й отримуватимеш результат гірший. Важка модель уміє «перемудрувати» на дурницях і закопатися там, де вистачило б одного рядка.
- Економія. Між найдешевшою і топовою - різниця в ціні в рази за ті самі обсяги. На потоці задач це перетворюється на серйозні гроші.
- Швидкість. Легка модель відповідає помітно швидше. Для дрібниць, автоматизації та живого чату це вирішує все.
- Приватність. Частину даних у хмару просто не можна відправляти. Питання тут не про ціну - чи можна взагалі.
- Якість. На складній логіці дешева модель сиплеться. А от розуміти, коли підняти потужність, - це вже навичка.
Девʼять із десяти скарг «ШІ тупить» і «ШІ дорогий» - це не про ШІ. Це про те, що взяли не ту модель під задачу. Самокат не винен, що не везе холодильник.
Три вагові категорії моделей: легкі, середні, важкі
Почни з головного - з ваги. За розумом і ціною моделі грубо лягають на три полиці. Імена та версії тасуються постійно, тож запамʼятовуй полиці, а не назви.
Дешеві та швидкі моделі - для дрібниць і потоку
Найлегші. Коштують копійки, відповідають майже миттєво. У складній логіці не блищать - так їм це й не потрібно.
Бери їх на: класифікацію Класифікація - задача розкласти вхід по заздалегідь заданих шухлядах: спам чи не спам, позитив чи негатив, категорія товару. Для неї не потрібна важка модель. (спам чи не спам, тон відгуку), витяг даних із тексту, просте переформулювання, переклад коротких фраз, сортування й маршрутизацію запитів. Усе, де думати глибоко не треба, а треба швидко й багато.
Середні моделі - робоча конячка на кожен день
Золота середина за ціною та розумом. Це дефолт для більшості задач: написати листа, зібрати чернетку статті, пояснити тему, накидати нескладний скрипт, відповісти користувачу в чаті.
Не знаєш, з чого стартувати? Стартуй звідси. У девʼяти випадках із десяти середньої вистачає. А на дешеву чи топову переходь лише тоді, коли впрешся в стелю - знизу (задача надто проста, щоб платити) або зверху (задача їй не по зубах).
Важкі reasoning-моделі - для складного коду й логіки
Топові моделі з режимом міркування Reasoning (міркування) - режим, у якому модель перед відповіддю «думає» покроково: розкладає задачу, перевіряє варіанти. Сильніша на складній логіці, коді та математиці, але дорожча й повільніша. . Дорогі й не найметкіші, зате на складній логіці їм немає рівних.
Діставай їх під заплутаний код і налагодження, багатокрокову логіку, серйозну математику, архітектурні рішення, довгі ланцюжки висновків - там, де одна помилка ламає все. Економити тут собі дорожче: дешева модель видасть правдоподібну маячню, і на перевірку піде більше, ніж ти заощадив.
Контекстне вікно та приватність: дві окремі осі вибору
Вага - не все, що ти обираєш. Поверх неї є ще дві незалежні штуки. Вони не про «розумніша чи дурніша», а про «чи влізе документ» і «чи можна взагалі випускати дані назовні».
Велике контекстне вікно - для довгих документів
Розмір контекстного вікна Контекстне вікно - скільки тексту модель утримує «в голові» за один запит: і твій ввід, і її відповідь. Вимірюється в токенах. Що більше вікно, то довший документ влізає цілком. - окрема вісь, і вона часто йде в комплекті з топовими моделями. Треба згодувати цілий договір, усю кодову базу чи книжку? Потрібна модель, яка втримає це цілком, а не шматочками.
Великі моделі сьогодні тримають дуже великі вікна: рахунок іде на сотні тисяч токенів Токен - шматочок тексту, яким оперує модель. Грубо: один токен це приблизно три-чотири символи, або близько трьох чвертей слова. Довжину документа й ціну рахують у токенах. , а в частини моделей - і більше. Точні цифри застарівають на очах, але принцип залізний: довгий документ - модель з великим вікном. Інакше вона «забуде» початок до того моменту, як добереться до кінця.
Локальні моделі - для приватних даних
Особливий випадок. Локальна модель Локальна модель - модель, що запускається на твоєму компʼютері чи сервері, без відправлення даних у чужу хмару. Зазвичай слабша за топові хмарні, зате дані не покидають твоє залізо. крутиться на твоєму залізі й нікуди не відправляє дані. Слабша за хмарні топи - зазвичай так. Зате тут критерій вибору зовсім інший.
Бери локально, коли дані не можна випускати назовні: медичні картки, юридичні документи клієнтів, чужі комерційні секрети, персональні дані під захистом закону. Питання не «дешевше чи дорожче», а «чи можна це взагалі відправляти в хмару». Часто - не можна.
Головний принцип: бери мінімально достатню модель
Ось правило, на якому тримається все. Не бери модель потужнішу, ніж потрібно задачі. Починай знизу й піднімайся - лише якщо результат реально поганий.
- Стартуєш із дешевої чи середньої - отримуєш результат за копійки й майже миттєво.
- Піднімаєш потужність точково, лише там, де реально вперся в стелю.
- Платиш за розум рівно там, де розум потрібен, - і ніде більше.
- Ллєш усе в топову - і переплачуєш у рази за класифікацію та дрібниці.
- Чекаєш повільну відповідь там, де з головою вистачило б швидкої.
- Інколи отримуєш гірше: важка модель «перемудровує» на простому.
Класифікація, спам, тон відгуку, витяг полів - дешева швидка.
Лист, стаття, пояснення, нескладний скрипт, чат-відповідь - середня робоча.
Складний код, налагодження, багатокрокова логіка, математика - важка reasoning.
Договір цілком, уся кодова база, книжка - модель з великим вікном.
Мед, юр, чужі секрети, персональні дані - локальна на своєму залізі.
Не знаєш, з чого почати - бери середню й рухайся від неї.
Приклад: один проєкт, чотири різні моделі
Припустимо, ти робиш застосунок для відгуків про кафе. В одному проєкті спокійно уживаються різні моделі - кожна на своєму місці. І це норма, а не зоопарк.
- Розкидати вхідні відгуки на «хороший» і «поганий» - це класифікація, бери найдешевшу й найшвидшу.
- Згенерувати ввічливу відповідь на відгук - середня робоча модель, їй таке по плечу.
- Написати модуль аналітики з хитрою логікою підрахунку - тут уже важка reasoning-модель.
- Розібрати договір оренди на двісті сторінок цілком - модель з великим контекстним вікном.
- Якщо у вхідних спливають персональні дані клієнтів, які не можна слати в хмару, - локальна модель.
Часті помилки під час вибору моделі
- Лити все в найдорожчу модель. Класифікація на топовій reasoning-моделі - це поїздка по хліб на боліді. Їде, але переплата в рази.
- Економити на складній логіці. Заплутаний код на найдешевшій моделі дасть правдоподібну маячню. На її перевірку піде більше, ніж ти заощадив.
- Різати довгий документ на шматки без потреби. Є модель з великим вікном - дай документ цілком. Інакше вона забуде початок до кінця.
- Вантажити гігантський контекст «про всяк випадок». Дорожче й гірше: середину довгого тексту моделі читають слабше. Вантаж лише те, що реально треба бачити цілком.
- Слати приватні дані в хмару. Мед, юр, чужі секрети - це не про економію, а про «чи можна взагалі». Часто не можна - тоді тільки локально.
- Завчати конкретні імена моделей. Версії змінюються постійно. Тримай у голові категорії - і будь-яка новинка сама стане на свою полицю.
TL;DR - если коротко
- Моделі діляться за вагою: дешеві-швидкі, середні-робочі, важкі-думаючі. Ціна між крайніми - у рази.
- Складний код і логіка - топова reasoning-модель. Дрібниці й класифікація - найдешевша. Тут не скупись, там не лий гроші.
- Довгі документи (договір, кодова база, книжка) - модель з великим контекстним вікном. Не пʼять запитів поспіль - один.
- Приватні дані (мед, юр, чужі секрети) - локальна модель на своєму залізі. Нічого не витече.
- Головний принцип: бери мінімально достатню. Починай знизу, піднімай потужність лише коли реально вперся.
- Імена та версії моделей тасуються щомісяця. Тримай у голові категорії, а не назви.