feat: Agregar soporte OCR con Tesseract para PDFs escaneados
- Integrar Tesseract OCR para leer PDFs escaneados automáticamente - Detectar automáticamente si el PDF tiene texto o requiere OCR - Agregar servicio ocr_service.py con funciones de OCR - Actualizar Dockerfile con tesseract-ocr, tesseract-ocr-spa y poppler-utils - Agregar variables de configuración OCR (OCR_ENABLED, OCR_LANGUAGE, OCR_DPI, OCR_TIMEOUT) - Crear endpoint de debug para ver texto extraído (/api/v1/debug/extract-text) - Agregar scripts de instalación y prueba (install_ocr.ps1, test_ocr.py, debug_pdf.ps1) - Documentación completa (OCR_SETUP.md, DOCKER_OCR.md, COMO_PROBAR.md) - Actualizar docker-compose.yml con variables de entorno OCR - Modificar pdf_text.py para usar OCR cuando sea necesario - Actualizar requirements.txt con pytesseract, Pillow, pdf2image
This commit is contained in:
@@ -32,6 +32,10 @@ services:
|
||||
- REDIS_URL=redis://redis:6379/0
|
||||
- CELERY_BROKER_URL=redis://redis:6379/0
|
||||
- CELERY_RESULT_BACKEND=redis://redis:6379/0
|
||||
- OCR_ENABLED=${OCR_ENABLED:-true}
|
||||
- OCR_LANGUAGE=${OCR_LANGUAGE:-spa}
|
||||
- OCR_DPI=${OCR_DPI:-300}
|
||||
- OCR_TIMEOUT=${OCR_TIMEOUT:-300}
|
||||
volumes:
|
||||
- ./app:/app/app
|
||||
depends_on:
|
||||
@@ -61,6 +65,10 @@ services:
|
||||
- REDIS_URL=redis://redis:6379/0
|
||||
- CELERY_BROKER_URL=redis://redis:6379/0
|
||||
- CELERY_RESULT_BACKEND=redis://redis:6379/0
|
||||
- OCR_ENABLED=${OCR_ENABLED:-true}
|
||||
- OCR_LANGUAGE=${OCR_LANGUAGE:-spa}
|
||||
- OCR_DPI=${OCR_DPI:-300}
|
||||
- OCR_TIMEOUT=${OCR_TIMEOUT:-300}
|
||||
volumes:
|
||||
- ./app:/app/app
|
||||
depends_on:
|
||||
|
||||
Reference in New Issue
Block a user