3 Кормилец доками 4 Направляющий ~9 мин

Regex или нейросеть: как разобрать текст и не слить бюджет

Где справится бесплатный робот-педант, а где платишь умному эксперту

Regex или нейросеть для разбора текста? Учимся выбирать: дешёвые правила для ровных строк, нейросеть для хаоса и гибрид, который режет расходы на 95%.

Скиллы ECC в этом уроке: regex-vs-llm-structured-text

Что это за выбор и почему он про деньги

Представь: тебе принесли коробку писем. Задача - вытащить из каждого имя и адрес. Открываешь, а письма-то двух сортов.

Первый сорт - бланки строгой формы. Сверху всегда «Имя:», ниже всегда «Адрес:». И так в каждом. Без сюрпризов. Тут и думать нечего - сажаешь робота-педанта: «нашёл строку Имя с двоеточием - бери, что после него». Он быстрый, бесплатный и не устаёт никогда.

Второй сорт - рукописные открытки от бабушек. У одной имя в углу. У другой в самом конце. А третья вместо адреса нарисовала схему: «за магазином налево, у дуба спросишь». Робот-педант тут тихо плачет в углу. Здесь нужен живой умный человек - прочитает, поймёт смысл, разберётся даже с дубом.

В вайбкодинге всё ровно так же. Робот-педант - это regex (простые правила). Умный человек - это нейросеть (тот же Claude или GPT). А главный навык урока - чуять, кого из этих двоих звать на конкретную задачу.

Слева робот-педант разбирает стопку одинаковых бланков, справа усталый эксперт читает гору рукописных открыток
Ровные бланки - роботу. Рукописный хаос - эксперту.

Почему этот выбор делаешь именно ты

Ты вайбкодер - regex руками ты не пишешь, за тебя это сделает агент. Но решение, кого звать, остаётся за тобой. Прямо в формулировке задачи. И от него зависит сразу три вещи:

  • деньги - каждый вызов нейросети стоит токенов; прогнать через неё 10 000 строк, которые разобрал бы шаблон, - это сжечь бюджет на ровном месте;
  • скорость - правила срабатывают мгновенно, нейросеть же думает свои секунды на каждом куске;
  • надёжность - на ровном тексте правило выдаёт один и тот же ответ всегда, а нейросеть нет-нет да и сочинит что-то новенькое.

Любимая ошибка новичка: «о, текст, надо разобрать - зову ИИ». А там список из тысячи одинаковых строк, где хватило бы трёх слов в промпте. Поймёшь этот урок - перестанешь переплачивать.

Regex или нейросеть: дерево решений из одного вопроса

Прежде чем что-то парсить, спроси себя одно: текст ровный или хаотичный? Дальше всё просто.

Текст ровный и повторяется (90%+ по одному шаблону)

Начинай с простых правил. Тут две развилки:

  • правила вытягивают 95% и больше - супер, нейросеть вообще не нужна;
  • правила берут меньше 95% - подключи нейросеть, но только на те крохи, что не разобрались.

Текст вольный и каждый раз новый

Тут правила бессильны, как ни старайся. Зови нейросеть сразу - это ровно её работа, для этого её и придумали.

Regex против нейросети: кто на что годится

Простые правила (regex) - робот-педант
  • Почти бесплатно и мгновенно - хоть миллион строк за один присест.
  • Результат всегда одинаковый - сегодня, завтра, через год.
  • Идеален для ровных шаблонов: формы, таблицы, тесты, чеки.
  • Не зависит от интернета и не жжёт ни одного токена.
Нейросеть - умный эксперт
  • Понимает смысл и хаос - то, что роботу не по зубам.
  • Разберёт текст, форма которого пляшет от куска к куску.
  • Стоит денег и думает медленнее: каждый кусок - отдельный вызов.
  • Иногда сочиняет и на один и тот же текст отвечает по-разному.

Гибрид regex и нейросети: главный приём профи

Вот как делают опытные. Текст едет по конвейеру:

  1. Простые правила прогоняют весь поток и вытаскивают структуру - так ловится 95-98%.
  2. Оценка уверенности помечает подозрительные куски: тут вариантов слишком мало, там ответ пропал, здесь строка обрезана на полуслове.
  3. Нейросеть включается только на помеченных крохах - и чинит их.

Дорогого эксперта зовут не на всю коробку писем. А на те три открытки, где педант развёл руками.

Конвейер: поток текста идёт через правила, спорные крохи отводятся вбок к нейросети
Правила берут поток, нейросеть - только спорные крохи.

Разбор тысячи вопросов теста: как это выглядит на практике

Допустим, у тебя экспорт из старого учебника - тысяча вопросов теста, и все на одно лицо: номер, текст вопроса, варианты A-D, строка «Answer:» с буквой. Надо вытащить это в аккуратную таблицу.

Как сделает новичок: «Claude, вот файл на тысячу вопросов, разбери всё по полочкам». Агент честно прожуёт десятки тысяч строк через нейросеть - медленно, дорого, а где-то на 600-м вопросе ещё и приврёт. Просто от усталости.

Как попросит понимающий вайбкодер:

Промпт - скопируй и попробуй

У меня файл с тысячей вопросов теста. Формат у всех одинаковый: номер, текст вопроса, варианты A, B, C, D, потом строка Answer и буква.

Сделай так:

  1. Сначала напиши простое правило (regex), которое вытащит из этого ровного текста номер, вопрос, варианты и ответ. Прогони им весь файл.
  2. Посчитай, какие куски разобрались плохо: вариантов меньше трёх, нет ответа или вопрос подозрительно короткий. Покажи мне их список.
  3. И только эти спорные куски разбери умно по смыслу. Остальное не трогай.
  4. В конце скажи: сколько процентов вытянуло правило и сколько кусков пришлось дочинить.

Частые ошибки при разборе текста

  • Гнать всё через нейросеть «на всякий случай». Текст ровный? Это как нанять профессора считать палочки в тетради. Дорого, медленно и немного унизительно для профессора.
  • Пихать правила в живой хаос. Если форма пляшет от куска к куску, робот-педант захлебнётся - вот тут наоборот нужна нейросеть.
  • Пропускать проверку уверенности. Слепо верить «правило вроде сработало» нельзя. Попроси агента пометить подозрительные куски, а не молча сдать всё подряд.
  • Звать дорогую модель туда, где хватит дешёвой. На проверку спорных крох берут самую дешёвую нейросеть (класса Haiku) - для такой мелкой работы её за глаза хватит.
  • Не тестировать на кривых данных. Пустые строки, пропущенный ответ, странные символы - именно на них всё и ломается. Прогони «плохие» примеры заранее, до боевого запуска.
Мем: вайбкодер зовёт огромную нейросеть, чтобы разобрать список из трёх одинаковых строчек
Когда задачу решили бы три слова в промпте.

TL;DR - если коротко

  • Текст бывает ровный (строки на одно лицо) и хаотичный (как бог на душу положил). Ровный - правилам, хаос - нейросети.
  • Regex - робот-педант: бесплатно, мгновенно, но строго по шаблону и ни шагу влево.
  • Нейросеть - дорогой эксперт: поймёт любой бардак, но берёт деньги и думает не спеша.
  • Сильнее всего - гибрид: правила берут 95-98%, нейросеть дочиняет спорные крохи.
  • На боевом проекте такой гибрид срезал около 95% расходов против «всё через нейросеть».
  • Один вопрос перед стартом: ровный текст или хаос? С него начинается всё.

Поиск по вики

Нажмите Esc для закрытия

Введите запрос для мгновенного поиска по всем страницам курсов и уроков.