OpenAI en Alibaba lanceren nieuwe spraakmodellen voor transcriptie en realtimegesprekken

OpenAI heeft GPT-Live-Transcribe gelanceerd voor live spraakherkenning met lage vertraging en GPT-Transcribe voor asynchrone verwerking van audiobestanden.

OpenAI en Alibaba hebben vandaag nieuwe AI-spraakmodellen aangekondigd, gericht op twee verschillende onderdelen van de audioverwerking.

OpenAI presenteerde GPT-Live-Transcribe en GPT-Transcribe. GPT-Live-Transcribe is ontworpen voor live spraak-naar-teksttoepassingen met lage vertraging. GPT-Transcribe is geoptimaliseerd voor afgeronde audiobestanden en asynchrone batchverwerking.

Beide modellen kunnen nu gebruikmaken van vrije contextinformatie over de opname, zoals trefwoorden, namen van domeinspecifieke termen en verwachte talen, om de nauwkeurigheid te verbeteren. GPT-Live-Transcribe kan bovendien automatisch eerdere getranscribeerde beurten als context gebruiken.

Op de Context Aware ASR-benchmark van OpenAI verbeterde het toevoegen van context de semantische nauwkeurigheid van GPT-Live-Transcribe van 38,5% naar 44,6% en van GPT-Transcribe van 41,6% naar 45,2%. In een aparte realistische audiobenchmark behaalde het livemodel een transcriptiefoutpercentage van 9,60%, tegenover 11,65% voor GPT-Realtime-Whisper. GPT-Transcribe kwam uit op 8,98%, een daling ten opzichte van 15,21% voor Whisper-1.

Artificial Analysis meldde voor GPT-Transcribe een woordfoutpercentage van 3,31%. Dat is een duidelijke verbetering ten opzichte van eerdere OpenAI-modellen. Het model kost $4,50 per 1.000 minuten.


We introduceren twee nieuwe transcriptiemodellen in de API:
• GPT-Live-Transcribe: ontwikkeld voor live transcriptie met lage vertraging.
• GPT-Transcribe: geoptimaliseerd voor asynchrone transcriptie van afgeronde audiobestanden en batchverwerking.

Beide modellen begrijpen context beter en… pic.twitter.com/T4rQpKaGmk
— OpenAI Developers (@OpenAIDevs) 28 juli 2026


Alibaba kondigde Qwen-Audio-3.0-Realtime Plus en Flash aan voor directe spraak-naar-spraakgesprekken. Net als GPT-Live ondersteunen deze nieuwe modellen full-duplex interacties, waardoor gebruikers de AI kunnen onderbreken terwijl die spreekt. Ook functies zoals function calling en aangepaste gekloonde stemmen worden ondersteund.

Sterker nog: Qwen-Audio-3.0-Realtime Plus van Alibaba staat nu bovenaan de Artificial Analysis Speech-to-Speech Index met een score van 84,1%, vóór OpenAI’s GPT-Realtime-2.1 High met 79,1%. Het model scoorde het hoogst op de benchmarkonderdelen spraakredenering, gespreksdynamiek en agentische prestaties.

Een nadeel is dat het langer duurt voordat het model begint te reageren. Volgens Artificial Analysis bedraagt de tijd tot de eerste audio ongeveer vier seconden, tegenover ongeveer 1,14 seconde voor GPT-Realtime-2 High.

  • Eater

    vraag en ik antwoord

    Related Posts

    OpenAI en Alibaba lanceren nieuwe spraakmodellen voor transcriptie en realtimegesprekken

    OpenAI heeft GPT-Live-Transcribe gelanceerd voor live spraakherkenning met lage vertraging en GPT-Transcribe voor asynchrone verwerking van audiobestanden. OpenAI en Alibaba hebben vandaag nieuwe AI-spraakmodellen aangekondigd, gericht op twee verschillende onderdelen…

    ChatGPT weigert nu verzoeken om te schrijven in de stijl van beroemde auteurs

    Of die auteurs nu overleden zijn of nog leven. Volgens Ars Technica weigert ChatGPT om de stem en schrijfstijl van populaire auteurs na te bootsen. We zien de laatste tijd…

    Geef een reactie