watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·

AllenAI compare les prédictions de tokens entre modèles hybrides et transformers

jeudi 25 juin 202616:112 min de lecture1 source citée
L'essentiel — 3 points
  • 01AllenAI a comparé Olmo 3 (transformer) et Olmo Hybrid sur la prédiction de tokens individuels, révélant que les deux architectures excellent dans des domaines différents.
  • 02Le modèle hybride surpasse le transformer sur les tokens sémantiques (noms, verbes, adjectifs) et ceux nécessitant du suivi contextuel, mais perd cet avantage sur la reproduction verbatim de contenu existant.
  • 03Ces différences reflètent les propriétés fondamentales : l'attention du transformer excelle à retrouver des tokens spécifiques lointains, tandis que la récurrence du modèle hybride maintient un coût computationnel constant mais peine sur la simple récupération.
AllenAI compare les prédictions de tokens entre modèles hybrides et transformers

AllenAI a publié une étude détaillant comment les modèles hybrides — une architecture émergente qui combine attention et récurrence — prédisent différemment les tokens par rapport aux transformers standards. L'analyse révèle que les avantages du modèle hybride ne sont pas uniformes : ils dépendent fortement du type de token à prédire.

Pour cette comparaison, AllenAI a mis en place une expérience contrôlée entre deux modèles de 7 milliards de paramètres : Olmo 3 (transformer) et Olmo Hybrid. Les deux modèles ont été entraînés avec des données, un tokenizer et une recette d'entraînement identiques, isolant ainsi l'impact de l'architecture seule. Cette approche permet d'observer précisément où chaque architecture excelle ou peine.

Les résultats montrent que le modèle hybride surpasse le transformer sur les tokens porteurs de sens — noms, verbes, adjectifs — et sur ceux qui nécessitent de suivre le contexte, comme l'identification du référent d'un pronom. En revanche, son avantage s'efface presque complètement sur les tokens qui reproduisent du contenu déjà présent dans l'entrée, c'est-à-dire ceux qui peuvent être retrouvés par simple consultation du texte antérieur. C'est précisément là que le transformer excelle.

Cette différence de performance reflète les propriétés architecturales fondamentales des deux approches. Un transformer utilise l'attention dans chaque couche, permettant au modèle de comparer directement chaque token avec tous les tokens précédents et de pondérer leur pertinence. Cette capacité rend l'attention particulièrement efficace pour rappeler un token spécifique exact, même lointain. Le revers : le coût computationnel augmente rapidement avec la longueur de l'entrée, et l'attention peine à représenter les informations qui évoluent séquentiellement.

Les modèles hybrides conservent quelques couches d'attention mais remplacent les autres par des couches récurrentes. Une couche récurrente traite les tokens de gauche à droite en maintenant une mémoire de taille fixe, intégrant chaque nouveau token progressivement. Cette approche maintient un coût constant par token, indépendamment de la longueur de l'entrée. Cependant, elle semble moins adaptée aux tâches de simple récupération de contenu verbatim.

AllenAI note que les modèles hybrides peuvent égaler ou surpasser les transformers sur les benchmarks standards, mais ces métriques globales masquent les différences granulaires révélées par cette analyse au niveau des tokens. Comprendre ces profils de force distincts aide à clarifier où chaque architecture apporte un réel avantage, au-delà des chiffres agrégés.

Réagir :
Partager —XLinkedIn
Sources citées