watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·

Hugging Face analyse les limites des modèles OCR malgré les nouvelles architectures

jeudi 16 juillet 202611:492 min de lecture1 source citée
L'essentiel — 3 points
  • 01DharmaOCR, spécialisé en portugais brésilien, surpasse des modèles OCR plus récents malgré des architectures moins avancées.
  • 02Son entraînement combine un fine-tuning supervisé sur des données portugaises et une optimisation par préférences directes (DPO) pour améliorer la stabilité.
  • 03Les erreurs d'extraction, inhérentes aux modèles OCR probabilistes, restent un défi malgré l'adoption de nouvelles architectures.
Hugging Face analyse les limites des modèles OCR malgré les nouvelles architectures

Une étude de Hugging Face montre que DharmaOCR, spécialisé pour le portugais brésilien, dépasse des modèles plus récents comme Mistral OCR4 et Unlimited-OCR sur des tâches d'extraction de texte, malgré des architectures moins avancées.

L’article publié par Hugging Face détaille les raisons de cette performance, liée à une approche ciblée plutôt qu’à l’adoption de nouvelles architectures. Le modèle DharmaOCR a été conçu pour répondre à un besoin précis : l’extraction de texte en portugais brésilien à partir de documents complexes. Son pipeline d’entraînement repose sur deux étapes distinctes. La première consiste en un fine-tuning supervisé sur un large corpus de fichiers en portugais, couvrant divers formats et niveaux de complexité. L’objectif est d’aligner les poids du modèle sur les spécificités linguistiques et structurelles de la langue, en concentrant sa capacité de représentation sur le portugais plutôt que sur un espace multilingue générique.

La seconde étape applique une méthode d’optimisation par préférences directes (DPO). Contrairement à un entraînement classique sur des transcriptions correctes, cette approche utilise des données de préférences comparatives entre sorties concurrentes. Le modèle apprend ainsi à sélectionner systématiquement la meilleure extraction possible lors de l’inférence. L’enjeu n’est pas seulement la précision, mais aussi la stabilité : réduire les modes de défaillance des modèles génératifs, comme les sorties répétitives ou incohérentes, qui augmentent les coûts et les risques en production. Les résultats montrent que cette combinaison permet d’atteindre le score de qualité d’extraction le plus élevé tout en réduisant le taux de dégénérescence sur des benchmarks dédiés au portugais.

L’article souligne que les avancées récentes en OCR, notamment avec l’adoption massive de modèles multimodaux génératifs, n’ont pas résolu les problèmes initiaux identifiés par DharmaOCR : la qualité d’extraction sur des documents complexes et la stabilité en conditions réelles. Les variantes fine-tunées de modèles OCR se multiplient, mais leur nature probabiliste reste une source inhérente d’erreurs. Les différences entre modèles résident donc moins dans leur architecture que dans leur capacité à limiter ces erreurs et à garantir une sortie fiable, même dans des scénarios exigeants.

Réagir :
Partager —XLinkedIn
Sources citées