Le mode vocal de ChatGPT a été réécrit : vous oublierez que vous parlez à une intelligence artificielle
OpenAI a présenté les modèles GPT-Live-1 et GPT-Live-1 mini, visant à rendre l'expérience vocale de ChatGPT plus naturelle.
OpenAI a annoncé de nouveaux modèles vocaux pour le mode vocal de ChatGPT. Baptisés GPT-Live-1 et GPT-Live-1 mini, ces modèles visent à permettre aux utilisateurs de converser avec l'intelligence artificielle de manière plus naturelle et fluide.
Selon les informations communiquées par l'entreprise, les nouveaux modèles gèrent mieux les pauses et les transitions lors de la conversation. L'objectif est que les échanges vocaux avec ChatGPT se rapprochent davantage d'une véritable discussion bidirectionnelle plutôt que d'une simple expérience classique de commande et de réponse.
POSSIBILITÉ DE PARLER ET D'ÉCOUTER SIMULTANÉMENT
L'une des caractéristiques marquantes des nouveaux modèles vocaux est la prise en charge de la communication bidirectionnelle complète, appelée « full-duplex ». Grâce à cette structure, l'assistant peut continuer à parler tout en écoutant la voix de l'utilisateur simultanément. Cela vise à offrir une expérience plus fluide, particulièrement lors de longues conversations.
Il a été précisé que le mode vocal actuel de ChatGPT sera remplacé par défaut par le modèle GPT-Live-1 mini. Les utilisateurs des abonnements payants pourront quant à eux accéder à GPT-Live-1, présenté comme un modèle plus vaste et plus avancé.
L'infrastructure vocale précédente d'OpenAI reposait sur plusieurs étapes, notamment un système de conversion parole-texte pour transcrire la voix de l'utilisateur, un modèle linguistique pour générer la réponse, et un système de synthèse vocale pour énoncer cette réponse. Il est indiqué que les nouveaux modèles transforment cette structure en une expérience plus directement basée sur la voix.
L'entreprise souligne que le nouveau mode vocal a été développé pour des conversations prolongées. Selon les informations rapportées, un cadre d'OpenAI a déclaré avoir pu tenir des conversations ininterrompues de 30 à 40 minutes grâce à cette fonctionnalité lors de ses promenades. La nouvelle structure devrait également réduire les problèmes tels que l'interruption inutile de l'utilisateur par l'assistant.
Pour les requêtes plus complexes nécessitant des capacités de recherche, de raisonnement ou d'agent, le mode vocal peut faire appel en arrière-plan au modèle textuel actuel de l'entreprise, GPT-5.5. L'objectif est que le flux de la conversation vocale se poursuive sans interruption durant ce processus.
Cependant, il n'est pas encore clair si le nouveau système offrira le même niveau de performance dans toutes les langues. Lors d'une démonstration de traduction en direct en hindi, il a été noté que l'assistant parlait avec un accent américain prononcé et que la langue semblait artificielle. Bien qu'OpenAI indique que le nouveau mode est optimisé pour « la plupart des langues les plus parlées », l'entreprise n'a pas partagé de liste détaillée des langues.
Source de l'actualité: 12punto
Les plus lus
Vive réaction de l'Iran à l'attaque ukrainienne en mer Caspienne
Nos citoyens syriaques et arméniens disent « Que Dieu bénisse Erdoğan »
Il fait un signe de la main à son interlocuteur au téléphone, puis tue le glacier
Le « brouillon » de Lausanne de la présidence... Le nouveau parti d'Özgür Özel...
Une femme sort à moitié nue dans la rue puis se jette du 3e étage
Si vous n'aviez pas d'argent, vous ne pouviez pas vous faire soigner ; désormais, vous ne pouvez même plus devenir médecin
Des figurants engagés pour 950 lires lors d'une cérémonie d'adhésion du CHP
Allégation de « démission de 10 députés » au sein du YENİ Parti
Şengül Yılmaz est le nom qui a attiré l'attention lors de la cérémonie de remise des épinglettes
Qu'ont-ils exigé d'İsmet Pacha à Lausanne ?