watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·

Writer lance Palmyra X6 et optimise son infrastructure pour réduire les coûts d'inférence

jeudi 13 août 202621:132 min de lecture1 source citée
L'essentiel — 3 points
  • 01Writer lance Palmyra X6, un modèle dérivé de GLM-5.2 de Z.ai, pour réduire les coûts d'inférence.
  • 02Le nouveau modèle et les optimisations du harness agentique pourraient diminuer jusqu'à 50 % les coûts pour les tâches basiques.
  • 03Une étude interne de Writer montre que des ajustements du harness réduisent les coûts de 40 % en moyenne, quel que soit le modèle utilisé.
Writer lance Palmyra X6 et optimise son infrastructure pour réduire les coûts d'inférence

Writer, éditeur d'outils et d'agents IA pour les équipes marketing, annonce le déploiement de Palmyra X6, un nouveau modèle dérivé de l'open source GLM-5.2 de Z.ai. Conçu pour des tâches complexes et multi-étapes, ce modèle vise à réduire les coûts d'inférence tout en maintenant des performances adaptées aux besoins des entreprises. Writer estime que cette solution, combinée à des améliorations de son infrastructure, pourrait diminuer jusqu'à 50 % les coûts pour les tâches basiques de ses clients.

L'entreprise a également publié une version mise à jour de son harness agentique, un framework permettant d'orchestrer les interactions entre les modèles et les outils métiers. Selon Writer, ces optimisations ciblent particulièrement l'efficacité des tâches nécessitant plusieurs étapes, en réduisant le nombre de tokens générés. Une étude interne récente, publiée par des chercheurs de Writer, souligne que des ajustements mineurs dans le harness peuvent réduire les coûts de 40 % en moyenne, indépendamment du modèle utilisé. Les auteurs de l'étude soulignent que l'efficacité du harness se multiplie sur l'ensemble des modèles déployés par une organisation, passés et futurs.

Pour les clients de Writer, Palmyra X6 s'intègre à l'écosystème existant aux côtés d'autres modèles proposés par l'entreprise ou d'outils importés via des plateformes comme Azure ou Amazon Bedrock. May Habib, PDG de Writer, met en avant une méfiance croissante des entreprises envers les laboratoires d'IA majeurs, accusés de ne pas proposer de solutions adaptées aux enjeux de coûts. Elle évoque un « explosion des coûts sans précédent » et une perte de confiance des DSI envers ces acteurs, incapables selon elle de répondre aux besoins concrets des organisations.

Réagir :
Partager —XLinkedIn
Sources citées