- 01Kog propose un moteur logiciel (KIE) pour accélérer l'inférence des modèles IA sur des GPU standards comme les AMD MI300X ou Nvidia H200.
- 02La startup a démontré une vitesse de 3 000 tokens par seconde avec un modèle de 2 milliards de paramètres, mais cible désormais les grands modèles de langage.
- 03Kog a enregistré plus de 200 leads commerciaux et vise les entreprises freinées par les délais d'attente des modèles d'IA.

La startup française Kog annonce une méthode logicielle pour améliorer l’efficacité de l’inférence des modèles d’intelligence artificielle sur des GPU standards, sans matériel dédié.
Kog propose une approche logicielle, le Kog Inference Engine (KIE), conçue pour exploiter davantage les capacités des GPU existants comme les AMD MI300X ou les Nvidia H200. Contrairement à des solutions matérielles comme celles de Cerebras, Kog mise sur l’optimisation logicielle pour accélérer le traitement des requêtes, notamment dans les workflows agentiques. Lors d’une démonstration en mai 2026, la startup a atteint 3 000 tokens par seconde par requête avec un petit modèle de 2 milliards de paramètres, le Laneformer 2B, open source depuis.
L’entreprise cible en priorité les entreprises confrontées à des délais d’attente prolongés pour des tâches professionnelles impliquant des modèles d’IA. Selon son PDG Gaël Delalleau, Kog a enregistré plus de 200 leads commerciaux tangibles depuis son annonce, avec une demande initiale forte dans le domaine du développement logiciel. Les utilisateurs de Claude Code savent que certaines requêtes peuvent prendre plusieurs heures, un frein identifié par Anthropic, qui propose un mode « Fast » payant pour réduire ces délais. Kog vise précisément les clients rebutés par ces attentes, tout en collaborant avec des partenaires pour des cas d’usage comme la génération de jeux ou d’applications via des prompts.
Cependant, Kog reconnaît que le marché n’est pas encore prêt pour une adoption massive de ses solutions. Les retours indiquent que les clients potentiels ne sont pas encore préparés à affiner des petits modèles, une étape pourtant courante dans l’optimisation des workflows IA. La startup a donc recentré ses efforts sur l’accélération des modèles plus grands pour répondre à la demande actuelle. Malgré cette orientation, Kog maintient son objectif affiché d’atteindre une inférence 30 fois plus rapide pour les grands modèles de langage (LLM), bien que sa démonstration repose sur un modèle de petite taille.
Delalleau conteste l’idée selon laquelle les GPU ne seraient pas adaptés au décodage des modèles IA. Il souligne que les GPU récents, comme ceux utilisés dans la démonstration, disposent d’une bande passante mémoire accrue, un potentiel encore sous-exploité. Kog n’est pas la seule entreprise à explorer cette voie : ZML, une autre startup française, a également développé un logiciel agnostique du matériel pour contourner certaines limitations des GPU Nvidia.
Articles liés

Un prêt de 400 M$ garanti par des puces d'inférence IA pour un cloud dédié
Premier prêt garanti par des puces d'inférence IA, marquant un tournant dans le financement de l'infrastructure IA.

Nvidia étend son avantage IA avec des systèmes d'orchestration pour centres de données
Analyse des innovations techniques pour optimiser l'efficacité des centres de données.

Amazon renforce sa dépendance à Nvidia malgré ses puces maison
Décryptage des implications pour les infrastructures cloud et la dépendance aux GPU Nvidia.