- 01Kimi K3 de Moonshot n'a pas obtenu ses performances par une distillation directe de Fable d'Anthropic, selon des experts.
- 02Le délai entre la sortie de Fable et celle de Kimi K3 rend improbable une distillation massive suivie d'un entraînement complet.
- 03Les performances de Kimi K3 pourraient s'expliquer par d'autres techniques d'entraînement, comme le reinforcement learning.

Le modèle Kimi K3 de Moonshot, présenté comme le plus grand modèle de langage open-weight disponible, ne doit pas ses performances avancées à une exploitation directe de Fable, le LLM d'Anthropic, selon des experts interrogés par TechCrunch.
Plusieurs responsables américains, dont l'ancien conseiller scientifique de la Maison Blanche Michael Kratsios, ont suggéré que Moonshot aurait copié les capacités de Fable en utilisant des puces non autorisées à l'export vers la Chine. Kratsios évoque une « distillation industrielle à grande échelle » visant à s'approprier des technologies propriétaires américaines. Ces déclarations s'inscrivent dans un contexte de tensions croissantes autour des modèles open-weight chinois, avec des discussions en cours pour en restreindre l'accès aux États-Unis. Moonshot n'a pas répondu aux questions sur sa méthode d'entraînement, et aucune preuve concrète n'a été publiée pour étayer ces allégations.
Les experts interrogés remettent en cause l'hypothèse d'une distillation comme explication principale des performances de Kimi K3. Braden Hancock, chercheur à l'Institut Laude et cofondateur de Snorkel AI, estime que le délai entre la sortie publique de Fable (1er juillet 2026) et celle de Kimi K3 est trop court pour permettre une distillation massive suivie d'un entraînement complet. Il souligne que deux semaines ne suffiraient pas pour générer suffisamment de données, entraîner un modèle et le publier. Nathan Lambert, chercheur à l'Allen Institute for AI, abonde dans ce sens : selon lui, la distillation perd en importance à mesure que les modèles chinois se rapprochent des standards internationaux, et les performances de Kimi K3 ne peuvent s'expliquer par un simple fine-tuning supervisé.
La distillation implique de solliciter systématiquement un modèle cible pour en extraire des données, parfois en analysant ses raisonnements étape par étape. Ces données sont ensuite utilisées pour entraîner un nouveau modèle via un fine-tuning supervisé. Pourtant, les experts soulignent que cette méthode ne permet pas d'atteindre des capacités aussi avancées sans un processus d'entraînement complémentaire, notamment en reinforcement learning (RL). Les performances de Kimi K3 pourraient donc résulter d'une combinaison de techniques, dont certaines non mentionnées dans les critiques américaines.
Articles liés

Anthropic lance Opus 5, un modèle plus accessible et moins restreint que Fable 5
Découvrez les nouveautés d'Opus 5 d'Anthropic, un modèle d'IA conçu pour être plus accessible et flexible que Fable.

Elon Musk affirme ne pas « couper l'accès » à Anthropic malgré leur rivalité
Elon Musk rassure Anthropic sur l'accès à ses infrastructures via Mythos/Fable.

Les États-Unis lèvent les restrictions sur les modèles Fable et Mythos d'Anthropic
Les développeurs d'IA peuvent désormais déployer les modèles avancés d'Anthropic sans contraintes aux États-Unis.