Hugging Face analyse les limites des modèles OCR malgré les nouvelles architectures
- 01DharmaOCR, spécialisé en portugais brésilien, surpasse des modèles OCR plus récents malgré des architectures moins avancées.
- 02Son entraînement combine un fine-tuning supervisé sur des données portugaises et une optimisation par préférences directes (DPO) pour améliorer la stabilité.
- 03Les erreurs d'extraction, inhérentes aux modèles OCR probabilistes, restent un défi malgré l'adoption de nouvelles architectures.

Une étude de Hugging Face montre que DharmaOCR, spécialisé pour le portugais brésilien, dépasse des modèles plus récents comme Mistral OCR4 et Unlimited-OCR sur des tâches d'extraction de texte, malgré des architectures moins avancées.
L’article publié par Hugging Face détaille les raisons de cette performance, liée à une approche ciblée plutôt qu’à l’adoption de nouvelles architectures. Le modèle DharmaOCR a été conçu pour répondre à un besoin précis : l’extraction de texte en portugais brésilien à partir de documents complexes. Son pipeline d’entraînement repose sur deux étapes distinctes. La première consiste en un fine-tuning supervisé sur un large corpus de fichiers en portugais, couvrant divers formats et niveaux de complexité. L’objectif est d’aligner les poids du modèle sur les spécificités linguistiques et structurelles de la langue, en concentrant sa capacité de représentation sur le portugais plutôt que sur un espace multilingue générique.
La seconde étape applique une méthode d’optimisation par préférences directes (DPO). Contrairement à un entraînement classique sur des transcriptions correctes, cette approche utilise des données de préférences comparatives entre sorties concurrentes. Le modèle apprend ainsi à sélectionner systématiquement la meilleure extraction possible lors de l’inférence. L’enjeu n’est pas seulement la précision, mais aussi la stabilité : réduire les modes de défaillance des modèles génératifs, comme les sorties répétitives ou incohérentes, qui augmentent les coûts et les risques en production. Les résultats montrent que cette combinaison permet d’atteindre le score de qualité d’extraction le plus élevé tout en réduisant le taux de dégénérescence sur des benchmarks dédiés au portugais.
L’article souligne que les avancées récentes en OCR, notamment avec l’adoption massive de modèles multimodaux génératifs, n’ont pas résolu les problèmes initiaux identifiés par DharmaOCR : la qualité d’extraction sur des documents complexes et la stabilité en conditions réelles. Les variantes fine-tunées de modèles OCR se multiplient, mais leur nature probabiliste reste une source inhérente d’erreurs. Les différences entre modèles résident donc moins dans leur architecture que dans leur capacité à limiter ces erreurs et à garantir une sortie fiable, même dans des scénarios exigeants.
Articles liés

Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale
Analyse de l'offre d'un acteur proposant des modèles IA débridés, et des débats éthiques qu'elle suscite.

NeoMME : un encodeur multimodal multilingue open source sans tour de vision séparée
Explorer une innovation open-source majeure pour les modèles d'IA polyvalents.
Hugging Face publie un guide pour affiner des modèles en 100 étapes avec GRPO
Découvrez une méthode de fine-tuning optimisée pour générer des sorties structurées avec des modèles de taille réduite.