Архитектура стабильного сборщика тиражей

Как мы пришли к стабильному сбору

После многочисленных итераций и экспериментов мы остановились на простой и надёжной архитектуре:

Почему не PaddleOCR и не Tesseract

Мы пробовали три OCR-движка, но в итоге оставили только ddddocr. Он быстрее и точнее на капчах nloto. Остальные были удалены, чтобы не усложнять код.

Как работает сейчас

  1. Проверка доступности сайта (check_site_available).
  2. Загрузка главной страницы и автоматический обход капчи (10 попыток с обновлением).
  3. Запрос к API для получения списка лотерей и истории тиражей.
  4. Сохранение в БД с игнорированием дубликатов.
  5. Фоновый режим через nohup и cron-сторож для автоматического перезапуска.

Что дальше

← На главную