3 Годувальник доками 4 Гід-напрямний ~9 хв

Regex чи нейромережа: як розібрати текст і не злити бюджет

Де кличеш робота-педанта задарма, а де платиш розумному експертові

Regex чи нейромережа для розбору тексту? Вчимося обирати: дешеві правила для рівних рядків, нейромережа для хаосу і гібрид, який ріже витрати на 95%.

Скіли ECC у цьому уроці: regex-vs-llm-structured-text

Що це за вибір і чому він про гроші

Уяви: тобі принесли коробку листів. Завдання - витягти з кожного імʼя та адресу. Відкриваєш, а листи ж двох сортів.

Перший сорт - бланки суворої форми. Згори завжди «Імʼя:», нижче завжди «Адреса:». І так у кожному. Без сюрпризів. Тут навіть думати ліньки - садиш робота-педанта: «після слова Імʼя двокрапка - бери звідти». Він швидкий, безплатний і не втомлюється ніколи.

Другий сорт - рукописні листівки від бабусь. В однієї імʼя в куточку. В іншої аж у самому кінці. А третя замість адреси намалювала схему: «за магазином ліворуч, біля дуба спитаєш». Робот-педант тут тихо плаче в куточку. Тут потрібна жива розумна людина - прочитає, зрозуміє суть, розбереться навіть із дубом.

У вайбкодингу все так само. Робот-педант - це regex (прості правила). Розумна людина - це нейромережа (той самий Claude чи GPT). А головна навичка уроку - чути, кого з цих двох кликати на конкретне завдання.

Ліворуч робот-педант розбирає стос однакових бланків, праворуч стомлений експерт читає гору рукописних листівок
Рівні бланки - роботові. Рукописний хаос - експертові.

Чому цей вибір робиш саме ти

Ти вайбкодер - regex руками ти не пишеш, за тебе це зробить агент. Але рішення, кого кликати, лишається за тобою. Прямо у формулюванні завдання. І від нього залежить одразу три речі:

  • гроші - кожен виклик нейромережі коштує токенів; прогнати через неї 10 000 рядків, які розібрав би шаблон, - це спалити бюджет на рівному місці;
  • швидкість - правила спрацьовують миттєво, а нейромережа собі думає по кілька секунд над кожним шматком;
  • надійність - на рівному тексті правило видає одну й ту саму відповідь завжди, а нейромережа вряди-годи вигадає щось новеньке.

Улюблена помилка новачка: «о, текст, треба розібрати - кличу ШІ». А там список із тисячі однакових рядків, де вистачило б трьох слів у промпті. Зрозумієш цей урок - перестанеш переплачувати.

Regex чи нейромережа: дерево рішень з одного питання

Перш ніж щось парсити, спитай себе одне: текст рівний чи хаотичний? Далі все просто.

Текст рівний і повторюється (90%+ за одним шаблоном)

Починай з простих правил. Тут дві розвилки:

  • правила витягують 95% і більше - супер, нейромережа взагалі не потрібна;
  • правила беруть менше ніж 95% - підключи нейромережу, але лише на ті крихти, що не розібралися.

Текст вільний і щоразу новий

Тут правила безсилі, хоч як старайся. Клич нейромережу одразу - це саме її робота, для цього її й вигадали.

Regex проти нейромережі: хто на що годиться

Прості правила (regex) - робот-педант
  • Майже задарма і миттєво - хоч мільйон рядків за один присіст.
  • Результат завжди однаковий - сьогодні, завтра, за рік.
  • Ідеальний для рівних шаблонів: форми, таблиці, тести, чеки.
  • Не залежить від інтернету і не палить жодного токена.
Нейромережа - розумний експерт
  • Розуміє зміст і хаос - те, що роботові не до снаги.
  • Розбере текст, форма якого витанцьовує від шматка до шматка.
  • Коштує грошей і думає повільніше - кожен шматок - це окремий виклик.
  • Іноді вигадує і на той самий текст відповідає по-різному.

Гібрид regex і нейромережі: головний прийом профі

Ось як роблять досвідчені. Текст їде конвеєром:

  1. Прості правила проганяють весь потік і витягують структуру - так ловиться 95-98%.
  2. Оцінка впевненості позначає підозрілі шматки: тут варіантів замало, там відповідь зникла, тут рядок обрізано на півслові.
  3. Нейромережа вмикається лише на позначених крихтах - і дає їм раду.

Дорогого експерта кличуть не на всю коробку листів. А на ті три листівки, де педант розвів руками.

Конвеєр: потік тексту йде через правила, спірні крихти відводяться вбік до нейромережі
Правила беруть потік, нейромережа - лише спірні крихти.

Розбір тисячі питань тесту: як це виглядає на практиці

Припустімо, у тебе експорт зі старого підручника - тисяча питань тесту, і всі однаковісінькі: номер, текст питання, варіанти A-D, рядок «Answer:» з буквою. Треба витягти це в акуратну таблицю.

Як зробить новачок: «Claude, ось файл на тисячу питань, розбери все по поличках». Агент чесно прожує десятки тисяч рядків через нейромережу - повільно, дорого, а десь на 600-му питанні ще й прибреше. Просто від утоми.

Як попросить тямущий вайбкодер:

Промпт - скопіюй і спробуй

У мене файл із тисячею питань тесту. Формат у всіх однаковий: номер, текст питання, варіанти A, B, C, D, потім рядок Answer і буква.

Зроби так:

  1. Спершу напиши просте правило (regex), яке витягне з цього рівного тексту номер, питання, варіанти й відповідь. Прожени ним весь файл.
  2. Порахуй, які шматки розібралися погано: варіантів менше трьох, немає відповіді або питання підозріло коротке. Покажи мені їхній список.
  3. І лише ці спірні шматки розбери розумно за змістом. Решту не чіпай.
  4. У кінці скажи: скільки відсотків витягнуло правило і скільки шматків довелося розбирати за змістом.

Часті помилки при розборі тексту

  • Гнати все через нейромережу «про всяк випадок». Текст рівний? Це як найняти професора рахувати палички в зошиті. Дорого, повільно і трохи принизливо для професора.
  • Пхати правила в живий хаос. Якщо форма витанцьовує від шматка до шматка, робот-педант захлинеться - ось тут навпаки потрібна нейромережа.
  • Пропускати перевірку впевненості. Сліпо вірити «правило начебто спрацювало» не можна. Попроси агента позначити підозрілі шматки, а не мовчки здати все підряд.
  • Кликати дорогу модель туди, де вистачить дешевої. На перевірку спірних крихт беруть найдешевшу нейромережу (класу Haiku) - для такої дрібної роботи її цілком вистачить.
  • Не тестувати на кривих даних. Порожні рядки, пропущена відповідь, дивні символи - саме на них усе й ламається. Прожени «погані» приклади заздалегідь, до бойового запуску.
Мем: вайбкодер кличе величезну нейромережу, щоб розібрати список із трьох однакових рядків
Коли завдання вирішили б три слова в промпті.

TL;DR - если коротко

  • Текст буває рівний (рядки однаковісінькі) і хаотичний (як бог на душу поклав). Рівний - правилам, хаос - нейромережі.
  • Regex - робот-педант: задарма, миттєво, але строго за шаблоном і ні кроку вбік.
  • Нейромережа - дорогий експерт: зрозуміє будь-який бардак, але бере гроші й думає неквапом.
  • Найсильніший - гібрид: правила беруть 95-98%, нейромережа доробляє спірні крихти.
  • На бойовому проєкті такий гібрид зрізав близько 95% витрат проти «все через нейромережу».
  • Одне питання перед стартом: рівний текст чи хаос? З нього все й починається.

Пошук по вікі

Натисніть Esc для закриття

Введіть запит для миттєвого пошуку по всіх сторінках курсів та уроків.