TutorMoments évalue la capacité des IA à choisir quand intervenir en tutorat
- 01TutorMoments évalue si les IA savent quand aider ou laisser un élève résoudre seul un problème de mathématiques.
- 02Les modèles testés ont tendance à trop aider, réduisant l'autonomie de l'apprenant.
- 03La précision des LLM varie fortement selon leur capacité à équilibrer soutien et autonomie.

TutorMoments est un cadre d'évaluation conçu pour mesurer si les grands modèles de langage (LLM) savent déterminer quand intervenir ou rester en retrait lors d'une session de tutorat en mathématiques.
Le projet s'appuie sur des transcriptions anonymisées de séances réelles de tutorat individuel aux États-Unis. Des enseignants expérimentés ont identifié les moments clés où un tuteur devait choisir entre simplifier un problème pour faciliter le démarrage ou encourager l'élève à poursuivre le raisonnement par lui-même. TutorMoments utilise ces transcriptions jusqu'au point de décision, puis simule une session de tutorat où un LLM joue le rôle du tuteur tandis qu'un autre LLM incarne l'élève. L'objectif est d'observer comment le modèle gère cette tension pédagogique fondamentale.
Les résultats préliminaires indiquent que les modèles tendent à sur-intervenir en apportant un soutien excessif, au détriment de l'autonomie de l'élève. La formulation explicite de la consigne de tutorat — en insistant sur l'équilibre entre aide et autonomie — améliore partiellement les performances, mais ne comble pas l'écart avec les tuteurs humains, qui adaptent systématiquement leur intervention au contexte. Les variations entre modèles restent importantes : certains réussissent mieux que d'autres à identifier les moments où une poussée vers une réflexion approfondie est nécessaire.
Pour favoriser la reproductibilité, AllenAI publie un ensemble de données de transcriptions dé-identifiées, le code permettant d'exécuter le pipeline de replay, ainsi que les replays des modèles évalués sur les moments clés. L'initiative s'inscrit dans une démarche de recherche ouverte, visant à outiller les éducateurs, chercheurs et développeurs travaillant sur les tuteurs automatisés.
Articles liés

AllenAI présente DiScoFormer, un transformer unifié pour estimer densité et score
AllenAI propose un nouveau modèle transformer capable de gérer à la fois la densité et le score sur différentes distributions.

AllenAI compare les prédictions de tokens entre modèles hybrides et transformers
Explorer les différences de performance entre les prédictions de tokens dans les modèles hybrides.