dd

Ещё про парсер

Написано

в

Прошло 8 дней с того момента, как я начал делать парсер по работе. Вроде бы всё не сложно, но количество вариаций параметров в названиях продуктов просто заставляет застрелиться.
За прошедшую неделю я пересмотрел около 200к названий разных товаров и выделял из них куски, которые можно стянуть.
Додумался использовать генераторы, чтобы не жрать память как не в себя.
Оптимизировал регулярки, чтобы всё работало приемлемо быстро. Сейчас файл с 97к вхождений парсится и складывается в базу за 2 минуты 22 секунды. В принципе, неплохо, но можно гораздо лучше, если даже хотя бы не использовать экстракторы данных, не относящиеся конкретно к этому типу товаров. Например, при парсинге очков нам не нужен экстрактор веса, объёма и формы выпуска и наоборот — при парсинге таблеток нам ни к чему искать в названии диоптрии.
Вообще, мне кажется я бы в жизни столько не узнал о регулярных выражениях, если бы не этот проект. Кажется, сейчас я просто бог регулярок и это хорошо — знания крайне полезные, потому что обычно регулярки вводят людей в ступор.
Дальше работа будет заключаться только в добавлении новых правил для пред- и пост-обработки названий товаров для упрощения поиска.

Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *