Version 0.1.23
🚀 Nouvelles fonctionnalités
- 📄 Détection et traitement OCR des pages scannées : amélioration majeure de la qualité d'extraction du contenu des PDF avec détection automatique des pages scannées (smartphones, scanners) et application d'un traitement OCR optimisé avec quality gates robustes.
- Nouveau module de détection intelligente des pages scannées basé sur des heuristiques (ratio de texte, couverture d'image, tracés vectoriels)
- Module OCR dédié avec quality gates pour valider la qualité du texte extrait
- Ajout du champ
isScanneddans le modèle de données pour tracker le type d'extraction utilisé par page - Optimisation du flux de conversion avec priorisation OCR pour les pages scannées détectées
- Support multilingue : français + anglais
- Nettoyage des artefacts OCR
- 🖼️ Texte alternatif des images ASPX : amélioration de l'extraction du texte alternatif des images dans les fichiers ASPX. Feature sous viariable d'env: (
ASPX_ENABLE_ALT_FIRST=false (si true, lors de la conversion des fichiers aspx, on privilégie l'utilisation du alt_text des images avant leur url), par défaut à false
💡 Améliorations
- 🔧 Gestion d'erreurs améliorée : messages d'erreur structurés et exploitables avec meilleure traçabilité des erreurs Python/TypeScript.
- 🧹 Nettoyage des ressources : blocs
finallypour garantir la suppression des fichiers temporaires et gestion robuste des fichiers orphelins.