Regex или нейросеть: как разобрать текст и не слить бюджет
Где справится бесплатный робот-педант, а где платишь умному эксперту
Regex или нейросеть для разбора текста? Учимся выбирать: дешёвые правила для ровных строк, нейросеть для хаоса и гибрид, который режет расходы на 95%.
Что это за выбор и почему он про деньги
Представь: тебе принесли коробку писем. Задача - вытащить из каждого имя и адрес. Открываешь, а письма-то двух сортов.
Первый сорт - бланки строгой формы. Сверху всегда «Имя:», ниже всегда «Адрес:». И так в каждом. Без сюрпризов. Тут и думать нечего - сажаешь робота-педанта: «нашёл строку Имя с двоеточием - бери, что после него». Он быстрый, бесплатный и не устаёт никогда.
Второй сорт - рукописные открытки от бабушек. У одной имя в углу. У другой в самом конце. А третья вместо адреса нарисовала схему: «за магазином налево, у дуба спросишь». Робот-педант тут тихо плачет в углу. Здесь нужен живой умный человек - прочитает, поймёт смысл, разберётся даже с дубом.
В вайбкодинге всё ровно так же. Робот-педант - это regex Regex (регулярное выражение) - короткое правило-шаблон, по которому компьютер ищет в тексте куски нужной формы: «найди всё, что выглядит как дата» или «возьми текст после слова Цена». Работает, только если форма повторяется. (простые правила). Умный человек - это нейросеть (тот же Claude или GPT). А главный навык урока - чуять, кого из этих двоих звать на конкретную задачу.
Почему этот выбор делаешь именно ты
Ты вайбкодер - regex руками ты не пишешь, за тебя это сделает агент. Но решение, кого звать, остаётся за тобой. Прямо в формулировке задачи. И от него зависит сразу три вещи:
- деньги - каждый вызов нейросети стоит токенов; прогнать через неё 10 000 строк, которые разобрал бы шаблон, - это сжечь бюджет на ровном месте;
- скорость - правила срабатывают мгновенно, нейросеть же думает свои секунды на каждом куске;
- надёжность - на ровном тексте правило выдаёт один и тот же ответ всегда, а нейросеть нет-нет да и сочинит что-то новенькое.
Любимая ошибка новичка: «о, текст, надо разобрать - зову ИИ». А там список из тысячи одинаковых строк, где хватило бы трёх слов в промпте. Поймёшь этот урок - перестанешь переплачивать.
Regex или нейросеть: дерево решений из одного вопроса
Прежде чем что-то парсить, спроси себя одно: текст ровный или хаотичный? Дальше всё просто.
Текст ровный и повторяется (90%+ по одному шаблону)
Начинай с простых правил. Тут две развилки:
- правила вытягивают 95% и больше - супер, нейросеть вообще не нужна;
- правила берут меньше 95% - подключи нейросеть, но только на те крохи, что не разобрались.
Текст вольный и каждый раз новый
Тут правила бессильны, как ни старайся. Зови нейросеть сразу - это ровно её работа, для этого её и придумали.
Regex против нейросети: кто на что годится
- Почти бесплатно и мгновенно - хоть миллион строк за один присест.
- Результат всегда одинаковый - сегодня, завтра, через год.
- Идеален для ровных шаблонов: формы, таблицы, тесты, чеки.
- Не зависит от интернета и не жжёт ни одного токена.
- Понимает смысл и хаос - то, что роботу не по зубам.
- Разберёт текст, форма которого пляшет от куска к куску.
- Стоит денег и думает медленнее: каждый кусок - отдельный вызов.
- Иногда сочиняет и на один и тот же текст отвечает по-разному.
Гибрид regex и нейросети: главный приём профи
Вот как делают опытные. Текст едет по конвейеру:
- Простые правила прогоняют весь поток и вытаскивают структуру - так ловится 95-98%.
- Оценка уверенности помечает подозрительные куски: тут вариантов слишком мало, там ответ пропал, здесь строка обрезана на полуслове.
- Нейросеть включается только на помеченных крохах - и чинит их.
Дорогого эксперта зовут не на всю коробку писем. А на те три открытки, где педант развёл руками.
Разбор тысячи вопросов теста: как это выглядит на практике
Допустим, у тебя экспорт из старого учебника - тысяча вопросов теста, и все на одно лицо: номер, текст вопроса, варианты A-D, строка «Answer:» с буквой. Надо вытащить это в аккуратную таблицу.
Как сделает новичок: «Claude, вот файл на тысячу вопросов, разбери всё по полочкам». Агент честно прожуёт десятки тысяч строк через нейросеть - медленно, дорого, а где-то на 600-м вопросе ещё и приврёт. Просто от усталости.
Как попросит понимающий вайбкодер:
У меня файл с тысячей вопросов теста. Формат у всех одинаковый: номер, текст вопроса, варианты A, B, C, D, потом строка Answer и буква.
Сделай так:
- Сначала напиши простое правило (regex), которое вытащит из этого ровного текста номер, вопрос, варианты и ответ. Прогони им весь файл.
- Посчитай, какие куски разобрались плохо: вариантов меньше трёх, нет ответа или вопрос подозрительно короткий. Покажи мне их список.
- И только эти спорные куски разбери умно по смыслу. Остальное не трогай.
- В конце скажи: сколько процентов вытянуло правило и сколько кусков пришлось дочинить.
Частые ошибки при разборе текста
- Гнать всё через нейросеть «на всякий случай». Текст ровный? Это как нанять профессора считать палочки в тетради. Дорого, медленно и немного унизительно для профессора.
- Пихать правила в живой хаос. Если форма пляшет от куска к куску, робот-педант захлебнётся - вот тут наоборот нужна нейросеть.
- Пропускать проверку уверенности. Слепо верить «правило вроде сработало» нельзя. Попроси агента пометить подозрительные куски, а не молча сдать всё подряд.
- Звать дорогую модель туда, где хватит дешёвой. На проверку спорных крох берут самую дешёвую нейросеть (класса Haiku) - для такой мелкой работы её за глаза хватит.
- Не тестировать на кривых данных. Пустые строки, пропущенный ответ, странные символы - именно на них всё и ломается. Прогони «плохие» примеры заранее, до боевого запуска.
TL;DR - если коротко
- Текст бывает ровный (строки на одно лицо) и хаотичный (как бог на душу положил). Ровный - правилам, хаос - нейросети.
- Regex - робот-педант: бесплатно, мгновенно, но строго по шаблону и ни шагу влево.
- Нейросеть - дорогой эксперт: поймёт любой бардак, но берёт деньги и думает не спеша.
- Сильнее всего - гибрид: правила берут 95-98%, нейросеть дочиняет спорные крохи.
- На боевом проекте такой гибрид срезал около 95% расходов против «всё через нейросеть».
- Один вопрос перед стартом: ровный текст или хаос? С него начинается всё.