watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
29 aoûtSony Music et Warner Chappell attaquent Anthropic pour violation de droits d'auteur·29 aoûtVijay Pande quitte a16z pour fonder VZVC, une structure ciblée en IA médicale·29 aoûtNvidia étend son avantage IA avec des systèmes d'orchestration pour centres de données·29 aoûtLes musiciens traquent l'utilisation non déclarée d'œuvres pour l'IA générative musicale·28 aoûtNeocloud Lambda lève 1 milliard de dollars de dette pour financer des puces Nvidia·28 aoûtAnthropic démontre l’auto-amélioration contrôlée d’une IA par un système automatisé·28 aoûtLes acquisitions ciblent les acteurs de l’IA open source pour contrôler les modèles·28 aoûtUn juge fédéral annule le blacklistage d'Anthropic par l'administration Trump·28 aoûtL’EPA américaine supprime l’obligation de consultation publique pour les permis de pollution des data centers·28 aoûtMicroduck, un robot humanoïde open source de 25 cm à 399 $·29 aoûtSony Music et Warner Chappell attaquent Anthropic pour violation de droits d'auteur·29 aoûtVijay Pande quitte a16z pour fonder VZVC, une structure ciblée en IA médicale·29 aoûtNvidia étend son avantage IA avec des systèmes d'orchestration pour centres de données·29 aoûtLes musiciens traquent l'utilisation non déclarée d'œuvres pour l'IA générative musicale·28 aoûtNeocloud Lambda lève 1 milliard de dollars de dette pour financer des puces Nvidia·28 aoûtAnthropic démontre l’auto-amélioration contrôlée d’une IA par un système automatisé·28 aoûtLes acquisitions ciblent les acteurs de l’IA open source pour contrôler les modèles·28 aoûtUn juge fédéral annule le blacklistage d'Anthropic par l'administration Trump·28 aoûtL’EPA américaine supprime l’obligation de consultation publique pour les permis de pollution des data centers·28 aoûtMicroduck, un robot humanoïde open source de 25 cm à 399 $·29 aoûtSony Music et Warner Chappell attaquent Anthropic pour violation de droits d'auteur·29 aoûtVijay Pande quitte a16z pour fonder VZVC, une structure ciblée en IA médicale·29 aoûtNvidia étend son avantage IA avec des systèmes d'orchestration pour centres de données·29 aoûtLes musiciens traquent l'utilisation non déclarée d'œuvres pour l'IA générative musicale·28 aoûtNeocloud Lambda lève 1 milliard de dollars de dette pour financer des puces Nvidia·28 aoûtAnthropic démontre l’auto-amélioration contrôlée d’une IA par un système automatisé·28 aoûtLes acquisitions ciblent les acteurs de l’IA open source pour contrôler les modèles·28 aoûtUn juge fédéral annule le blacklistage d'Anthropic par l'administration Trump·28 aoûtL’EPA américaine supprime l’obligation de consultation publique pour les permis de pollution des data centers·28 aoûtMicroduck, un robot humanoïde open source de 25 cm à 399 $·29 aoûtSony Music et Warner Chappell attaquent Anthropic pour violation de droits d'auteur·29 aoûtVijay Pande quitte a16z pour fonder VZVC, une structure ciblée en IA médicale·29 aoûtNvidia étend son avantage IA avec des systèmes d'orchestration pour centres de données·29 aoûtLes musiciens traquent l'utilisation non déclarée d'œuvres pour l'IA générative musicale·28 aoûtNeocloud Lambda lève 1 milliard de dollars de dette pour financer des puces Nvidia·28 aoûtAnthropic démontre l’auto-amélioration contrôlée d’une IA par un système automatisé·28 aoûtLes acquisitions ciblent les acteurs de l’IA open source pour contrôler les modèles·28 aoûtUn juge fédéral annule le blacklistage d'Anthropic par l'administration Trump·28 aoûtL’EPA américaine supprime l’obligation de consultation publique pour les permis de pollution des data centers·28 aoûtMicroduck, un robot humanoïde open source de 25 cm à 399 $·

Kog optimise l'inférence des modèles IA sur GPU avec un moteur logiciel

vendredi 14 août 202614:502 min de lecture1 source citée
L'essentiel — 3 points
  • 01Kog propose un moteur logiciel (KIE) pour accélérer l'inférence des modèles IA sur des GPU standards comme les AMD MI300X ou Nvidia H200.
  • 02La startup a démontré une vitesse de 3 000 tokens par seconde avec un modèle de 2 milliards de paramètres, mais cible désormais les grands modèles de langage.
  • 03Kog a enregistré plus de 200 leads commerciaux et vise les entreprises freinées par les délais d'attente des modèles d'IA.
Kog optimise l'inférence des modèles IA sur GPU avec un moteur logiciel

La startup française Kog annonce une méthode logicielle pour améliorer l’efficacité de l’inférence des modèles d’intelligence artificielle sur des GPU standards, sans matériel dédié.

Kog propose une approche logicielle, le Kog Inference Engine (KIE), conçue pour exploiter davantage les capacités des GPU existants comme les AMD MI300X ou les Nvidia H200. Contrairement à des solutions matérielles comme celles de Cerebras, Kog mise sur l’optimisation logicielle pour accélérer le traitement des requêtes, notamment dans les workflows agentiques. Lors d’une démonstration en mai 2026, la startup a atteint 3 000 tokens par seconde par requête avec un petit modèle de 2 milliards de paramètres, le Laneformer 2B, open source depuis.

L’entreprise cible en priorité les entreprises confrontées à des délais d’attente prolongés pour des tâches professionnelles impliquant des modèles d’IA. Selon son PDG Gaël Delalleau, Kog a enregistré plus de 200 leads commerciaux tangibles depuis son annonce, avec une demande initiale forte dans le domaine du développement logiciel. Les utilisateurs de Claude Code savent que certaines requêtes peuvent prendre plusieurs heures, un frein identifié par Anthropic, qui propose un mode « Fast » payant pour réduire ces délais. Kog vise précisément les clients rebutés par ces attentes, tout en collaborant avec des partenaires pour des cas d’usage comme la génération de jeux ou d’applications via des prompts.

Cependant, Kog reconnaît que le marché n’est pas encore prêt pour une adoption massive de ses solutions. Les retours indiquent que les clients potentiels ne sont pas encore préparés à affiner des petits modèles, une étape pourtant courante dans l’optimisation des workflows IA. La startup a donc recentré ses efforts sur l’accélération des modèles plus grands pour répondre à la demande actuelle. Malgré cette orientation, Kog maintient son objectif affiché d’atteindre une inférence 30 fois plus rapide pour les grands modèles de langage (LLM), bien que sa démonstration repose sur un modèle de petite taille.

Delalleau conteste l’idée selon laquelle les GPU ne seraient pas adaptés au décodage des modèles IA. Il souligne que les GPU récents, comme ceux utilisés dans la démonstration, disposent d’une bande passante mémoire accrue, un potentiel encore sous-exploité. Kog n’est pas la seule entreprise à explorer cette voie : ZML, une autre startup française, a également développé un logiciel agnostique du matériel pour contourner certaines limitations des GPU Nvidia.

Réagir :
Partager —XLinkedIn
Sources citées