OpenAI onthult GPT-Live: hoe realtime spraak-AI eindelijk natuurlijk aanvoelt
4 augustus 2026 · 06:00 · Claude (Anthropic) · claude-sonnet-5
OpenAI licht toe hoe het bedrijf in zes maanden een realtime systeem bouwde voor vloeiende, onderbreekbare spraakgesprekken met AI. GPT-Live moet de vertraging en houterigheid van eerdere voice-assistenten wegnemen.
Realtime spraak-AI is al jaren de heilige graal van de sector: een digitale gesprekspartner die luistert, denkt en antwoordt zonder de onhandige stiltes en haperingen die spraakassistenten traditioneel kenmerken. OpenAI claimt nu een belangrijke stap te hebben gezet met GPT-Live, een systeem voor continue voice-interactie dat het bedrijf in slechts zes maanden ontwikkelde. In een technisch blogbericht legt OpenAI uit welke keuzes eraan ten grondslag liggen en waarom natuurlijke spraakinteractie zoveel lastiger is dan het lijkt.Waarom realtime spraak zo moeilijk is
Bij tekstgebaseerde AI-modellen is enige vertraging acceptabel: een gebruiker leest toch even. Bij gesproken interactie ligt dat anders. Mensen verwachten dat een gesprekspartner binnen een fractie van een seconde reageert, kan worden onderbroken en zelf ook kan onderbreken zonder de draad kwijt te raken. Volgens OpenAI vereist dit een volledig andere architectuur dan de klassieke aanpak van spraak-naar-tekst, tekst-naar-AI-antwoord en vervolgens tekst-naar-spraak. Die keten introduceert namelijk cumulatieve vertraging op elke schakel, waardoor gesprekken al snel houterig aanvoelen. Met GPT-Live kiest OpenAI voor een end-to-end streaming-architectuur, waarbij audio continu binnenstroomt en het model doorlopend meeluistert, in plaats van te wachten tot een gebruiker helemaal is uitgesproken. Dat maakt het mogelijk om al te beginnen met verwerken voordat een zin is afgerond, wat de ervaren reactietijd drastisch verkort.Onderbreken zonder chaos
Een van de grootste technische uitdagingen die OpenAI beschrijft, is het omgaan met onderbrekingen. Mensen praten door elkaar heen, corrigeren zichzelf halverwege een zin of veranderen plotseling van onderwerp. Een goed werkend spraaksysteem moet kunnen herkennen wanneer een gebruiker daadwerkelijk klaar is met praten, wanneer die alleen even nadenkt, en wanneer die het model actief onderbreekt. GPT-Live is ontworpen om die signalen in realtime te interpreteren, zodat het model zijn eigen antwoord kan afbreken en soepel kan overschakelen naar de nieuwe input van de gebruiker, net zoals bij een menselijk gesprek.Zes maanden bouwen aan een nieuw fundament
Wat opvalt in het verhaal van OpenAI is het tempo: het team bouwde het systeem in zes maanden tijd, een relatief korte periode voor zo'n fundamentele verandering in infrastructuur. Dat tempo onderstreept hoezeer grote AI-spelers momenteel investeren in voice-first interfaces. Waar chatbots via tekst de afgelopen jaren de norm waren, verschuift de aandacht nu naar gesproken interactie als volgende stap in de evolutie van AI-assistenten. Dit past in een bredere trend waarbij bedrijven als OpenAI, Google en Amazon stevig inzetten op spraakgestuurde producten, van slimme speakers tot geïntegreerde assistenten in apps en apparaten.Wat betekent dit voor gebruikers en ontwikkelaars?
Voor ontwikkelaars die AI-toepassingen bouwen, opent een systeem als GPT-Live de deur naar nieuwe use cases: klantenservice-bots die daadwerkelijk vloeiend een gesprek voeren, digitale assistenten die tijdens het autorijden bruikbaar zijn, of onderwijstools waarbij leerlingen hardop kunnen oefenen met een AI-tutor. De lage latentie en de mogelijkheid tot onderbreking maken dergelijke toepassingen aanzienlijk realistischer dan de trage, beurtelingse spraakinteracties van eerdere generaties. Voor de gemiddelde gebruiker betekent dit vooral dat spraakinteractie met AI minder als "een commando geven aan een apparaat" gaat aanvoelen en meer als een echt gesprek. Dat is een subtiel maar belangrijk verschil: onderzoek naar gebruikerservaring laat steevast zien dat vertraging en houterigheid de grootste frustratiebronnen zijn bij spraakassistenten, meer nog dan feitelijke fouten in de antwoorden zelf.Vooruitblik
De ontwikkeling van GPT-Live past in een breder patroon dat je kunt herkennen wanneer je de geschiedenis van kunstmatige intelligentie bekijkt: telkens wanneer een technische drempel wordt geslecht, ontstaat er een golf van nieuwe AI-toepassingen die voorheen simpelweg niet haalbaar waren. Realtime, onderbreekbare spraak-AI kan zo'n drempel blijken te zijn. Het is nu afwachten of concurrenten als Google en Amazon met vergelijkbare architecturen komen, en hoe snel deze technologie zijn weg vindt naar consumentenproducten. Wie de ontwikkelingen op de voet wil volgen, kan terecht bij meer AI-nieuws en verdiepende achtergrondartikelen in onze kennisbank.Bron: OpenAI
Ster Software
Het meest complete Nederlandstalige informatieplatform over kunstmatige intelligentie.
Kraaienjagersweg 24
7341 PT Beemte Broekland
© 2026 Ster Software BV · KvK 75474913
Inhoud gegenereerd door Claude (Anthropic) · model: claude-sonnet-4-6