watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·

AllenAI compare les prédictions de tokens entre modèles hybrides et transformers

jeudi 25 juin 202616:112 min de lecture1 source citée
L'essentiel — 3 points
  • 01AllenAI a comparé Olmo 3 (transformer) et Olmo Hybrid sur la prédiction de tokens individuels, révélant que les deux architectures excellent dans des domaines différents.
  • 02Le modèle hybride surpasse le transformer sur les tokens sémantiques (noms, verbes, adjectifs) et ceux nécessitant du suivi contextuel, mais perd cet avantage sur la reproduction verbatim de contenu existant.
  • 03Ces différences reflètent les propriétés fondamentales : l'attention du transformer excelle à retrouver des tokens spécifiques lointains, tandis que la récurrence du modèle hybride maintient un coût computationnel constant mais peine sur la simple récupération.
AllenAI compare les prédictions de tokens entre modèles hybrides et transformers

AllenAI a publié une étude détaillant comment les modèles hybrides — une architecture émergente qui combine attention et récurrence — prédisent différemment les tokens par rapport aux transformers standards. L'analyse révèle que les avantages du modèle hybride ne sont pas uniformes : ils dépendent fortement du type de token à prédire.

Pour cette comparaison, AllenAI a mis en place une expérience contrôlée entre deux modèles de 7 milliards de paramètres : Olmo 3 (transformer) et Olmo Hybrid. Les deux modèles ont été entraînés avec des données, un tokenizer et une recette d'entraînement identiques, isolant ainsi l'impact de l'architecture seule. Cette approche permet d'observer précisément où chaque architecture excelle ou peine.

Les résultats montrent que le modèle hybride surpasse le transformer sur les tokens porteurs de sens — noms, verbes, adjectifs — et sur ceux qui nécessitent de suivre le contexte, comme l'identification du référent d'un pronom. En revanche, son avantage s'efface presque complètement sur les tokens qui reproduisent du contenu déjà présent dans l'entrée, c'est-à-dire ceux qui peuvent être retrouvés par simple consultation du texte antérieur. C'est précisément là que le transformer excelle.

Cette différence de performance reflète les propriétés architecturales fondamentales des deux approches. Un transformer utilise l'attention dans chaque couche, permettant au modèle de comparer directement chaque token avec tous les tokens précédents et de pondérer leur pertinence. Cette capacité rend l'attention particulièrement efficace pour rappeler un token spécifique exact, même lointain. Le revers : le coût computationnel augmente rapidement avec la longueur de l'entrée, et l'attention peine à représenter les informations qui évoluent séquentiellement.

Les modèles hybrides conservent quelques couches d'attention mais remplacent les autres par des couches récurrentes. Une couche récurrente traite les tokens de gauche à droite en maintenant une mémoire de taille fixe, intégrant chaque nouveau token progressivement. Cette approche maintient un coût constant par token, indépendamment de la longueur de l'entrée. Cependant, elle semble moins adaptée aux tâches de simple récupération de contenu verbatim.

AllenAI note que les modèles hybrides peuvent égaler ou surpasser les transformers sur les benchmarks standards, mais ces métriques globales masquent les différences granulaires révélées par cette analyse au niveau des tokens. Comprendre ces profils de force distincts aide à clarifier où chaque architecture apporte un réel avantage, au-delà des chiffres agrégés.

Réagir :
Partager —XLinkedIn
Sources citées