AllenAI compare les prédictions de tokens entre modèles hybrides et transformers
- 01AllenAI a comparé Olmo 3 (transformer) et Olmo Hybrid sur la prédiction de tokens individuels, révélant que les deux architectures excellent dans des domaines différents.
- 02Le modèle hybride surpasse le transformer sur les tokens sémantiques (noms, verbes, adjectifs) et ceux nécessitant du suivi contextuel, mais perd cet avantage sur la reproduction verbatim de contenu existant.
- 03Ces différences reflètent les propriétés fondamentales : l'attention du transformer excelle à retrouver des tokens spécifiques lointains, tandis que la récurrence du modèle hybride maintient un coût computationnel constant mais peine sur la simple récupération.

AllenAI a publié une étude détaillant comment les modèles hybrides — une architecture émergente qui combine attention et récurrence — prédisent différemment les tokens par rapport aux transformers standards. L'analyse révèle que les avantages du modèle hybride ne sont pas uniformes : ils dépendent fortement du type de token à prédire.
Pour cette comparaison, AllenAI a mis en place une expérience contrôlée entre deux modèles de 7 milliards de paramètres : Olmo 3 (transformer) et Olmo Hybrid. Les deux modèles ont été entraînés avec des données, un tokenizer et une recette d'entraînement identiques, isolant ainsi l'impact de l'architecture seule. Cette approche permet d'observer précisément où chaque architecture excelle ou peine.
Les résultats montrent que le modèle hybride surpasse le transformer sur les tokens porteurs de sens — noms, verbes, adjectifs — et sur ceux qui nécessitent de suivre le contexte, comme l'identification du référent d'un pronom. En revanche, son avantage s'efface presque complètement sur les tokens qui reproduisent du contenu déjà présent dans l'entrée, c'est-à-dire ceux qui peuvent être retrouvés par simple consultation du texte antérieur. C'est précisément là que le transformer excelle.
Cette différence de performance reflète les propriétés architecturales fondamentales des deux approches. Un transformer utilise l'attention dans chaque couche, permettant au modèle de comparer directement chaque token avec tous les tokens précédents et de pondérer leur pertinence. Cette capacité rend l'attention particulièrement efficace pour rappeler un token spécifique exact, même lointain. Le revers : le coût computationnel augmente rapidement avec la longueur de l'entrée, et l'attention peine à représenter les informations qui évoluent séquentiellement.
Les modèles hybrides conservent quelques couches d'attention mais remplacent les autres par des couches récurrentes. Une couche récurrente traite les tokens de gauche à droite en maintenant une mémoire de taille fixe, intégrant chaque nouveau token progressivement. Cette approche maintient un coût constant par token, indépendamment de la longueur de l'entrée. Cependant, elle semble moins adaptée aux tâches de simple récupération de contenu verbatim.
AllenAI note que les modèles hybrides peuvent égaler ou surpasser les transformers sur les benchmarks standards, mais ces métriques globales masquent les différences granulaires révélées par cette analyse au niveau des tokens. Comprendre ces profils de force distincts aide à clarifier où chaque architecture apporte un réel avantage, au-delà des chiffres agrégés.
