Hugging Face analyse les limites des modèles OCR malgré les nouvelles architectures
- 01DharmaOCR, spécialisé en portugais brésilien, surpasse des modèles OCR plus récents malgré des architectures moins avancées.
- 02Son entraînement combine un fine-tuning supervisé sur des données portugaises et une optimisation par préférences directes (DPO) pour améliorer la stabilité.
- 03Les erreurs d'extraction, inhérentes aux modèles OCR probabilistes, restent un défi malgré l'adoption de nouvelles architectures.

Une étude de Hugging Face montre que DharmaOCR, spécialisé pour le portugais brésilien, dépasse des modèles plus récents comme Mistral OCR4 et Unlimited-OCR sur des tâches d'extraction de texte, malgré des architectures moins avancées.
L’article publié par Hugging Face détaille les raisons de cette performance, liée à une approche ciblée plutôt qu’à l’adoption de nouvelles architectures. Le modèle DharmaOCR a été conçu pour répondre à un besoin précis : l’extraction de texte en portugais brésilien à partir de documents complexes. Son pipeline d’entraînement repose sur deux étapes distinctes. La première consiste en un fine-tuning supervisé sur un large corpus de fichiers en portugais, couvrant divers formats et niveaux de complexité. L’objectif est d’aligner les poids du modèle sur les spécificités linguistiques et structurelles de la langue, en concentrant sa capacité de représentation sur le portugais plutôt que sur un espace multilingue générique.
La seconde étape applique une méthode d’optimisation par préférences directes (DPO). Contrairement à un entraînement classique sur des transcriptions correctes, cette approche utilise des données de préférences comparatives entre sorties concurrentes. Le modèle apprend ainsi à sélectionner systématiquement la meilleure extraction possible lors de l’inférence. L’enjeu n’est pas seulement la précision, mais aussi la stabilité : réduire les modes de défaillance des modèles génératifs, comme les sorties répétitives ou incohérentes, qui augmentent les coûts et les risques en production. Les résultats montrent que cette combinaison permet d’atteindre le score de qualité d’extraction le plus élevé tout en réduisant le taux de dégénérescence sur des benchmarks dédiés au portugais.
L’article souligne que les avancées récentes en OCR, notamment avec l’adoption massive de modèles multimodaux génératifs, n’ont pas résolu les problèmes initiaux identifiés par DharmaOCR : la qualité d’extraction sur des documents complexes et la stabilité en conditions réelles. Les variantes fine-tunées de modèles OCR se multiplient, mais leur nature probabiliste reste une source inhérente d’erreurs. Les différences entre modèles résident donc moins dans leur architecture que dans leur capacité à limiter ces erreurs et à garantir une sortie fiable, même dans des scénarios exigeants.
Articles liés

La cyberattaque autonome d'OpenAI contre Hugging Face révèle des failles classiques
Analyse des failles exploitées lors de l'attaque contre Hugging Face, utile pour les équipes sécurité.

OpenAI exploite une faille zero-day dans JFrog Artifactory lors d’un test interne
Décryptage technique d'une intrusion d'agent IA exploitant une faille critique chez Hugging Face, avec détails sur le vecteur d'attaque et le délai de correction.
Hugging Face intègre Nunchaku 4-bit dans Diffusers pour l'inférence de diffusion
Découvrez comment optimiser l'inférence de diffusion avec Nunchaku 4-bit via la bibliothèque Diffusers.