watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·

Hugging Face analyse les limites des modèles OCR malgré les nouvelles architectures

jeudi 16 juillet 202611:492 min de lecture1 source citée
L'essentiel — 3 points
  • 01DharmaOCR, spécialisé en portugais brésilien, surpasse des modèles OCR plus récents malgré des architectures moins avancées.
  • 02Son entraînement combine un fine-tuning supervisé sur des données portugaises et une optimisation par préférences directes (DPO) pour améliorer la stabilité.
  • 03Les erreurs d'extraction, inhérentes aux modèles OCR probabilistes, restent un défi malgré l'adoption de nouvelles architectures.
Hugging Face analyse les limites des modèles OCR malgré les nouvelles architectures

Une étude de Hugging Face montre que DharmaOCR, spécialisé pour le portugais brésilien, dépasse des modèles plus récents comme Mistral OCR4 et Unlimited-OCR sur des tâches d'extraction de texte, malgré des architectures moins avancées.

L’article publié par Hugging Face détaille les raisons de cette performance, liée à une approche ciblée plutôt qu’à l’adoption de nouvelles architectures. Le modèle DharmaOCR a été conçu pour répondre à un besoin précis : l’extraction de texte en portugais brésilien à partir de documents complexes. Son pipeline d’entraînement repose sur deux étapes distinctes. La première consiste en un fine-tuning supervisé sur un large corpus de fichiers en portugais, couvrant divers formats et niveaux de complexité. L’objectif est d’aligner les poids du modèle sur les spécificités linguistiques et structurelles de la langue, en concentrant sa capacité de représentation sur le portugais plutôt que sur un espace multilingue générique.

La seconde étape applique une méthode d’optimisation par préférences directes (DPO). Contrairement à un entraînement classique sur des transcriptions correctes, cette approche utilise des données de préférences comparatives entre sorties concurrentes. Le modèle apprend ainsi à sélectionner systématiquement la meilleure extraction possible lors de l’inférence. L’enjeu n’est pas seulement la précision, mais aussi la stabilité : réduire les modes de défaillance des modèles génératifs, comme les sorties répétitives ou incohérentes, qui augmentent les coûts et les risques en production. Les résultats montrent que cette combinaison permet d’atteindre le score de qualité d’extraction le plus élevé tout en réduisant le taux de dégénérescence sur des benchmarks dédiés au portugais.

L’article souligne que les avancées récentes en OCR, notamment avec l’adoption massive de modèles multimodaux génératifs, n’ont pas résolu les problèmes initiaux identifiés par DharmaOCR : la qualité d’extraction sur des documents complexes et la stabilité en conditions réelles. Les variantes fine-tunées de modèles OCR se multiplient, mais leur nature probabiliste reste une source inhérente d’erreurs. Les différences entre modèles résident donc moins dans leur architecture que dans leur capacité à limiter ces erreurs et à garantir une sortie fiable, même dans des scénarios exigeants.

Réagir :
Partager —XLinkedIn
Sources citées