Regex чи нейромережа: як розібрати текст і не злити бюджет
Де кличеш робота-педанта задарма, а де платиш розумному експертові
Regex чи нейромережа для розбору тексту? Вчимося обирати: дешеві правила для рівних рядків, нейромережа для хаосу і гібрид, який ріже витрати на 95%.
Що це за вибір і чому він про гроші
Уяви: тобі принесли коробку листів. Завдання - витягти з кожного імʼя та адресу. Відкриваєш, а листи ж двох сортів.
Перший сорт - бланки суворої форми. Згори завжди «Імʼя:», нижче завжди «Адреса:». І так у кожному. Без сюрпризів. Тут навіть думати ліньки - садиш робота-педанта: «після слова Імʼя двокрапка - бери звідти». Він швидкий, безплатний і не втомлюється ніколи.
Другий сорт - рукописні листівки від бабусь. В однієї імʼя в куточку. В іншої аж у самому кінці. А третя замість адреси намалювала схему: «за магазином ліворуч, біля дуба спитаєш». Робот-педант тут тихо плаче в куточку. Тут потрібна жива розумна людина - прочитає, зрозуміє суть, розбереться навіть із дубом.
У вайбкодингу все так само. Робот-педант - це regex Regex (регулярний вираз) - коротке правило-шаблон, за яким компʼютер шукає в тексті шматки потрібної форми: «знайди все, що схоже на дату» або «візьми текст після слова Ціна». Працює, лише якщо форма повторюється. (прості правила). Розумна людина - це нейромережа (той самий Claude чи GPT). А головна навичка уроку - чути, кого з цих двох кликати на конкретне завдання.
Чому цей вибір робиш саме ти
Ти вайбкодер - regex руками ти не пишеш, за тебе це зробить агент. Але рішення, кого кликати, лишається за тобою. Прямо у формулюванні завдання. І від нього залежить одразу три речі:
- гроші - кожен виклик нейромережі коштує токенів; прогнати через неї 10 000 рядків, які розібрав би шаблон, - це спалити бюджет на рівному місці;
- швидкість - правила спрацьовують миттєво, а нейромережа собі думає по кілька секунд над кожним шматком;
- надійність - на рівному тексті правило видає одну й ту саму відповідь завжди, а нейромережа вряди-годи вигадає щось новеньке.
Улюблена помилка новачка: «о, текст, треба розібрати - кличу ШІ». А там список із тисячі однакових рядків, де вистачило б трьох слів у промпті. Зрозумієш цей урок - перестанеш переплачувати.
Regex чи нейромережа: дерево рішень з одного питання
Перш ніж щось парсити, спитай себе одне: текст рівний чи хаотичний? Далі все просто.
Текст рівний і повторюється (90%+ за одним шаблоном)
Починай з простих правил. Тут дві розвилки:
- правила витягують 95% і більше - супер, нейромережа взагалі не потрібна;
- правила беруть менше ніж 95% - підключи нейромережу, але лише на ті крихти, що не розібралися.
Текст вільний і щоразу новий
Тут правила безсилі, хоч як старайся. Клич нейромережу одразу - це саме її робота, для цього її й вигадали.
Regex проти нейромережі: хто на що годиться
- Майже задарма і миттєво - хоч мільйон рядків за один присіст.
- Результат завжди однаковий - сьогодні, завтра, за рік.
- Ідеальний для рівних шаблонів: форми, таблиці, тести, чеки.
- Не залежить від інтернету і не палить жодного токена.
- Розуміє зміст і хаос - те, що роботові не до снаги.
- Розбере текст, форма якого витанцьовує від шматка до шматка.
- Коштує грошей і думає повільніше - кожен шматок - це окремий виклик.
- Іноді вигадує і на той самий текст відповідає по-різному.
Гібрид regex і нейромережі: головний прийом профі
Ось як роблять досвідчені. Текст їде конвеєром:
- Прості правила проганяють весь потік і витягують структуру - так ловиться 95-98%.
- Оцінка впевненості позначає підозрілі шматки: тут варіантів замало, там відповідь зникла, тут рядок обрізано на півслові.
- Нейромережа вмикається лише на позначених крихтах - і дає їм раду.
Дорогого експерта кличуть не на всю коробку листів. А на ті три листівки, де педант розвів руками.
Розбір тисячі питань тесту: як це виглядає на практиці
Припустімо, у тебе експорт зі старого підручника - тисяча питань тесту, і всі однаковісінькі: номер, текст питання, варіанти A-D, рядок «Answer:» з буквою. Треба витягти це в акуратну таблицю.
Як зробить новачок: «Claude, ось файл на тисячу питань, розбери все по поличках». Агент чесно прожує десятки тисяч рядків через нейромережу - повільно, дорого, а десь на 600-му питанні ще й прибреше. Просто від утоми.
Як попросить тямущий вайбкодер:
У мене файл із тисячею питань тесту. Формат у всіх однаковий: номер, текст питання, варіанти A, B, C, D, потім рядок Answer і буква.
Зроби так:
- Спершу напиши просте правило (regex), яке витягне з цього рівного тексту номер, питання, варіанти й відповідь. Прожени ним весь файл.
- Порахуй, які шматки розібралися погано: варіантів менше трьох, немає відповіді або питання підозріло коротке. Покажи мені їхній список.
- І лише ці спірні шматки розбери розумно за змістом. Решту не чіпай.
- У кінці скажи: скільки відсотків витягнуло правило і скільки шматків довелося розбирати за змістом.
Часті помилки при розборі тексту
- Гнати все через нейромережу «про всяк випадок». Текст рівний? Це як найняти професора рахувати палички в зошиті. Дорого, повільно і трохи принизливо для професора.
- Пхати правила в живий хаос. Якщо форма витанцьовує від шматка до шматка, робот-педант захлинеться - ось тут навпаки потрібна нейромережа.
- Пропускати перевірку впевненості. Сліпо вірити «правило начебто спрацювало» не можна. Попроси агента позначити підозрілі шматки, а не мовчки здати все підряд.
- Кликати дорогу модель туди, де вистачить дешевої. На перевірку спірних крихт беруть найдешевшу нейромережу (класу Haiku) - для такої дрібної роботи її цілком вистачить.
- Не тестувати на кривих даних. Порожні рядки, пропущена відповідь, дивні символи - саме на них усе й ламається. Прожени «погані» приклади заздалегідь, до бойового запуску.
TL;DR - если коротко
- Текст буває рівний (рядки однаковісінькі) і хаотичний (як бог на душу поклав). Рівний - правилам, хаос - нейромережі.
- Regex - робот-педант: задарма, миттєво, але строго за шаблоном і ні кроку вбік.
- Нейромережа - дорогий експерт: зрозуміє будь-який бардак, але бере гроші й думає неквапом.
- Найсильніший - гібрид: правила беруть 95-98%, нейромережа доробляє спірні крихти.
- На бойовому проєкті такий гібрид зрізав близько 95% витрат проти «все через нейромережу».
- Одне питання перед стартом: рівний текст чи хаос? З нього все й починається.