watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·

Hugging Face publie trois nouveaux modèles OCR open source sous licence Apache 2.0

jeudi 16 juillet 202611:492 min de lecture1 source citée
L'essentiel — 3 points
  • 01Hugging Face publie trois nouveaux modèles OCR open source sous licence Apache 2.0, dont DharmaOCR.
  • 02DharmaOCR est optimisé pour le portugais brésilien et utilise un fine-tuning suivi d’une optimisation par préférences directes (DPO).
  • 03Les modèles visent à réduire les erreurs de transcription dans des documents complexes tout en améliorant la stabilité des sorties.
Hugging Face publie trois nouveaux modèles OCR open source sous licence Apache 2.0

Hugging Face annonce la publication de trois nouveaux modèles OCR open source sous licence Apache 2.0, dont DharmaOCR, optimisés pour le portugais brésilien.

Ces modèles s’appuient sur une architecture ciblée, conçue pour améliorer la reconnaissance de caractères dans des documents complexes tout en réduisant les erreurs de transcription. Leur entraînement repose sur deux étapes distinctes : un fine-tuning supervisé sur des corpus en portugais brésilien, suivi d’une optimisation par préférences directes (DPO) pour stabiliser les sorties et limiter les répétitions ou incohérences.

Le premier modèle, DharmaOCR, se distingue par une spécialisation linguistique et documentaire, ayant démontré des performances supérieures à Mistral OCR4 et Unlimited-OCR sur des benchmarks dédiés au portugais brésilien. Les deux autres modèles, non nommés dans l’annonce, partagent cette approche pour d’autres cas d’usage spécifiques, bien que les détails techniques restent limités.

Les auteurs soulignent que l’évolution récente des modèles OCR, notamment l’adoption massive de variantes multimodales, n’a pas résolu les problèmes de fiabilité en production. Les erreurs de transcription restent inhérentes aux systèmes probabilistes, mais leur fréquence et leur impact peuvent être atténués par des méthodes comme le DPO, qui améliore la cohérence des résultats sans nécessiter de retraining complet.

Ces modèles sont publiés sous licence Apache 2.0, permettant une réutilisation libre, y compris à des fins commerciales, tout en garantissant l’accès au code source et aux poids des modèles.

Réagir :
Partager —XLinkedIn
Sources citées