watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
À chaud

OpenAI ajoute des outils vocaux à son API et Thinking Machines propose un modèle temps réel

mercredi 20 mai 202607:452 min de lecture1 source citée
L'essentiel — 3 points
  • 01OpenAI intègre GPT Realtime 2 dans son API avec traduction vocale en temps réel et transcription Whisper.
  • 02Thinking Machines lance un modèle full-duplex à faible latence pour des interactions conversationnelles plus naturelles.
  • 03Ces outils soulignent le compromis entre rapidité et raisonnement dans les systèmes vocaux, avec des garde-fous contre les risques de fraude.
OpenAI ajoute des outils vocaux à son API et Thinking Machines propose un modèle temps réel

OpenAI enrichit son interface de programmation avec des fonctionnalités vocales avancées, tandis que Thinking Machines dévoile un modèle conçu pour des interactions conversationnelles en temps réel.

OpenAI annonce l’intégration de GPT Realtime 2, basé sur GPT-5, dans son API avec trois nouvelles fonctionnalités vocales : la traduction en temps réel, la transcription via Whisper, et des garde-fous renforcés contre les risques de fraude. Ces outils visent à réduire la latence tout en maintenant une capacité de raisonnement, tout en élargissant le contexte disponible pour les interactions. L’entreprise souligne explicitement le compromis entre rapidité de réponse et profondeur d’analyse, un enjeu central pour les applications en temps réel comme les assistants vocaux ou les systèmes de support client.

Thinking Machines présente un modèle conversationnel à faible latence et en full-duplex, reposant sur une architecture à deux modèles et une pile d’inférence personnalisée. Ce système, conçu pour des interactions humaines plus naturelles, affiche des résultats prometteurs sur des benchmarks d’interactivité, bien que son accès reste limité et non validé par des tiers pour l’instant. L’approche technique mise en avant par Thinking Machines repose sur une optimisation poussée des échanges bidirectionnels, une caractéristique rare dans les modèles actuels, souvent limités à des flux unidirectionnels ou semi-duplex.

Ces annonces s’inscrivent dans un contexte où les acteurs du secteur cherchent à améliorer l’expérience utilisateur des interfaces vocales, tout en gérant les risques associés aux usages frauduleux ou malveillants. OpenAI évoque notamment des mesures de protection contre l’usurpation d’identité ou la manipulation de dialogues, tandis que Thinking Machines met l’accent sur la réactivité comme facteur clé pour des interactions perçues comme plus humaines.

Réagir :
Partager —XLinkedIn
Sources citées