GPT-Live 2026: ChatGPT Sprachchat komplett erklärt

Veröffentlicht: 10/08/2026
Aktualisiert: 06/09/2026

Wir denken. KI tippt mit.

Schulte_Markus_300x300px

Markus Schulte

AI Solution Development, Autor

Inhaltsverzeichnis
Teilen
AI Newsletter

GPT-Live ist die neue Modell-Generation hinter dem ChatGPT Sprachchat und macht aus dem bisherigen Frage-Antwort-Pingpong erstmals ein flüssiges Gespräch. OpenAI hat die Sprachmodelle am 8. Juli 2026 vorgestellt, seitdem hören sie zu, während sie sprechen, und lassen sich mitten im Satz unterbrechen. Anders als beim Vorgänger von 2024 ist Deutschland diesmal vom ersten Tag an dabei, und auch Nutzer der kostenlosen Version bekommen die neue Technik. Dieser Überblick erklärt die Begriffe, die Technik, alle Nutzungslimits, den Datenschutz und die Tricks, die in den Einstellungen stecken.

GPT-Live, Sprachchat, Voice Mode? Diese Begriffe stecken dahinter

Rund um die neue Sprachfunktion kursieren mindestens ein halbes Dutzend Namen, und selbst Fachmedien nutzen sie durcheinander. Die Funktion in ChatGPT heißt auf Deutsch offiziell ChatGPT Sprachchat, im Englischen ChatGPT Voice. GPT-Live ist dagegen das KI-Modell, das diese Funktion antreibt, so wie GPT-5.6 die Textantworten erzeugt. Wer in deutschen Medien „Sprachmodus“, „Voice Mode“ oder „Sprachfunktion“ liest, meint immer dasselbe Feature.

BegriffWas er bezeichnet
ChatGPT Sprachchat (engl. ChatGPT Voice)Die Sprachfunktion in ChatGPT, erreichbar über das Wellensymbol im Eingabefeld
GPT-LiveDie neue Generation von Sprachmodellen, die den Sprachchat seit dem 8. Juli 2026 antreibt
GPT-Live-1Das große Modell, Standard für die Bezahltarife Go, Plus und Pro
GPT-Live-1 miniDie kleinere Variante, Standard für den kostenlosen Tarif
Live / Advanced / StandardDie drei wählbaren Modi in den Sprachchat-Einstellungen; „Live“ ist der neue GPT-Live-Modus
Erweiterter Sprachmodus (Advanced Voice Mode)Der bisherige Sprachchat von 2024, läuft unter „Advanced“ weiter
ChatGPT-DiktatEine andere Funktion, die eine einzelne Aufnahme in bearbeitbaren Text umwandelt

OpenAI führt zwei Versionen des Modells ein. GPT-Live-1 ist in den Bezahltarifen der neue Standard, GPT-Live-1 mini übernimmt diese Rolle im Gratis-Tarif. Beide beherrschen das gleichzeitige Hören und Sprechen, unterscheiden sich aber bei Intelligenz-Optionen und Nutzungszeit.

Full-Duplex: So funktioniert GPT-Live technisch

GPT-Live basiert auf einer Full-Duplex-Architektur und verarbeitet Eingaben kontinuierlich, während es bereits antwortet. Das Modell trifft nach OpenAI-Angaben viele Male pro Sekunde eine Entscheidung, ob es sprechen, weiter zuhören, pausieren, unterbrechen oder ein Werkzeug aufrufen soll. Im Gespräch äußert sich das durch kurze Bestätigungslaute wie „hm-hm“ oder „verstanden“, durch echtes Schweigen, wenn Sie nachdenken, und durch die Möglichkeit, der KI schlicht ins Wort zu fallen.

Was bedeutet Full-Duplex?

Der Begriff stammt aus der Nachrichtentechnik. Full-Duplex heißt, dass Daten gleichzeitig in beide Richtungen fließen, wie beim Telefon, bei dem beide Seiten zugleich sprechen und hören können. Ein Walkie-Talkie arbeitet dagegen im Halb-Duplex, immer nur eine Richtung zur Zeit. Bisherige KI-Sprachmodi funktionierten wie ein Walkie-Talkie mit Warteschleife, GPT-Live telefoniert.

Die zweite Neuerung ist die Arbeitsteilung. GPT-Live selbst ist auf schnelle, natürliche Reaktion trainiert. Sobald eine Frage eine Websuche, tieferes Nachdenken oder längere Recherche erfordert, reicht das Modell die Aufgabe im Hintergrund an ein großes Sprachmodell weiter, zum Start ist das GPT-5.5. Während das Hintergrundmodell arbeitet, spricht GPT-Live einfach weiter und liefert das Ergebnis nach, sobald es vorliegt. OpenAI kündigt in der GPT-Live-Ankündigung an, dieses Hintergrundmodell fortlaufend zu aktualisieren, sobald neue Modelle erscheinen.

GPT-Live ist bereits die dritte Generation der ChatGPT-Sprachtechnik. Der erste Sprachchat von 2023 kettete drei getrennte Systeme aneinander, eine Spracherkennung tippte mit, ein Sprachmodell formulierte die Antwort, eine synthetische Stimme las sie vor. Das funktionierte, war aber langsam und verlor zwischen den Stationen Informationen, etwa den Tonfall. Der erweiterte Sprachmodus von 2024 erledigte alles in einem einzigen Modell, blieb jedoch rundenbasiert. Er wertete Stille als Signal, dass Sie fertig sind, weshalb er Nutzer bei kurzen Denkpausen notorisch unterbrach. Genau dieses Problem geht GPT-Live an der Wurzel an.

Bei den Stimmen bleibt alles vertraut und klingt doch anders. Die neun Stimmen von ChatGPT wurden für GPT-Live neu abgemischt, eine zehnte kam nicht dazu. Neue Stimmen realer Personen kann und darf das Modell nicht erzeugen, OpenAI hat Schutzmechanismen gegen die Imitation echter Stimmen eingebaut.

Es fühlt sich magisch und ‚echt‘ an. Ich habe es immer vorgezogen, mit einer KI zu tippen statt zu sprechen. Jetzt glaube ich, das wird sich verschieben.
Sam Altman, OpenAI-Chef, am 8. Juli 2026 auf X (übersetzt)

Wie sich das anhört, zeigt OpenAI im offiziellen Demo-Video zum Start, inklusive Unterbrechungen, Tempowechseln und einer Live-Übersetzung.

Von der Telefonschleife zum Gespräch: drei Jahre Sprachchat in ChatGPT

Die Sprachfunktion von ChatGPT ist keine drei Jahre alt und wurde in dieser Zeit zweimal komplett neu erfunden. Wer die Funktion seit 2024 nicht mehr benutzt hat, erkennt sie nicht wieder. Die Zeitleiste zeigt die wichtigsten Stationen.

DatumMeilenstein
25.09.2023OpenAI kündigt die erste ChatGPT-Sprachfunktion an, ein Kettensystem aus Spracherkennung, Sprachmodell und Vorlesestimme mit fünf Stimmen
13.05.2024GPT-4o-Demo mit Antwortzeiten ab 232 Millisekunden, präsentiert von Technikchefin Mira Murati
19./20.05.2024OpenAI pausiert die Stimme „Sky“, nachdem Schauspielerin Scarlett Johansson wegen der Ähnlichkeit zu ihrer Stimme protestiert; sie hatte eine Anfrage von Sam Altman zuvor abgelehnt
30.07.2024Der erweiterte Sprachmodus startet als Alpha für eine kleine Gruppe von Plus-Abonnenten
24.09.2024Rollout des erweiterten Sprachmodus für Plus- und Team-Nutzer, allerdings u. a. ohne die EU, Großbritannien und die Schweiz
22.10.2024Der erweiterte Sprachmodus erreicht die EU, Plus-Nutzer in Deutschland brauchen keine Umwege mehr
Anfang 2025Video und Bildschirmfreigabe im erweiterten Sprachmodus kommen auch in Deutschland an
09.06.2025Großes Stimmen-Update mit natürlicherer Betonung und einem Live-Übersetzungsmodus
08.07.2026GPT-Live startet weltweit und ersetzt den erweiterten Sprachmodus als Standard
23.07.2026GPT-Live kommt in die ChatGPT-Desktop-App für macOS und Windows und steuert dort auch die Agenten-Funktionen Work und Codex
31.07.2026OpenAI versieht GPT-Live-Audio mit unhörbaren SynthID-Wasserzeichen
07.08.2026Datei-Uploads und Projekte funktionieren jetzt auch im Sprachchat

Für deutsche Nutzer ist die Vorgeschichte ein Stück Leidensgeschichte. Beim Start des erweiterten Sprachmodus im September 2024 schaute Deutschland zur Veröffentlichung des Advanced Voice Mode in die Röhre, erst rund vier Wochen später zog die EU nach. Manche Nutzer behalfen sich damals mit einem VPN-Umweg zum Advanced Voice Mode, der seit dem EU-Start am 22. Oktober 2024 überflüssig ist. Bei GPT-Live wiederholt sich diese Geschichte nicht.

Verfügbarkeit: Deutschland ist diesmal ab Tag eins dabei

GPT-Live rollt seit dem 8. Juli 2026 weltweit aus, ohne EU-Sonderbehandlung. Bereits am Tag nach dem Start meldete OpenAI den vollständigen Rollout für die Tarife Go, Plus und Pro, der Free-Rollout lief zu diesem Zeitpunkt noch. Verfügbar ist der neue Sprachchat in den ChatGPT-Apps für iOS und Android, im Browser auf chatgpt.com und seit dem 23. Juli auch in der Desktop-App für macOS und Windows, dort laut Presseberichten zunächst für die Bezahl- und Firmentarife. Auf unterstützten iPhones funktioniert der Sprachchat auch in Apple CarPlay.

Firmenkunden mussten kurz warten. Zum Start blieben Business-, Enterprise- und Edu-Workspaces laut den offiziellen ChatGPT-Release-Notes zunächst außen vor, inzwischen listet OpenAI den Sprachchat auch für diese Tarife samt eigener Preislogik. In Enterprise-, Edu- und Healthcare-Workspaces ist „Live“ sogar die Standardauswahl, sobald Administratoren die Sprachfunktion freischalten. In der Desktop-App geht die Integration am weitesten, dort startet und koordiniert die Stimme auf Wunsch mehrere KI-Agenten in den Arbeitsumgebungen Work und Codex und steuert mit entsprechenden Berechtigungen den Computer.

Eine Einschränkung nennt OpenAI offen. Optimiert ist GPT-Live auf die meistgenutzten ChatGPT-Sprachen, in anderen Sprachen kann das Modell mit Akzent sprechen oder ins Stocken geraten. Schon in der Launch-Demo fiel eine Hindi-Übersetzung mit deutlich amerikanischer Färbung auf. Deutsch gehört zu den großen ChatGPT-Sprachen, klingt also sauber, einzelne Dialekt-Färbungen bleiben aber Glückssache.

Nutzungslimits 2026: So viel Sprachzeit steckt in jedem Tarif

Die Sprachzeit ist das neue Kontingent-Thema, denn OpenAI rechnet beim Sprachchat in Stunden statt in Nachrichten. Gemessen wird in einem gleitenden 24-Stunden-Fenster, ein einzelnes Gespräch endet spätestens nach zwei Stunden. Die Angaben stammen aus dem offiziellen OpenAI-Hilfeartikel zum ChatGPT Sprachchat mit Stand vom 10. August 2026, OpenAI behält sich Änderungen ausdrücklich vor.

TarifGPT-Live-1GPT-Live-1 mini
Freenicht enthaltenBegrenzter Zugriff pro 24 Stunden
Go und Plus1 Std. (Stufe Instant) + 1 Std. (Mittel oder Hoch)2 Std.
Pro für 100 US-Dollar/Monat12 Std. (Instant) + 12 Std. (Mittel oder Hoch)24 Std.
Pro für 200 US-Dollar/MonatUnbegrenztUnbegrenzt
Business1 Std. (Instant) + 1 Std. (Mittel/Hoch), danach 5 Credits pro Minutenicht enthalten
Enterprise, Edu, Healthcare (flexible Preise)5 Credits pro Minutenicht enthalten

Die in der Tabelle genannten Credits sind die interne Verrechnungseinheit des Workspace-Guthabens, aus dem Geschäftskunden zusätzliche Sprachzeit über die Freimenge hinaus bezahlen.

Hinter den Intelligenzstufen Instant, Mittel und Hoch verbirgt sich die Wahl des Hintergrundmodells. Instant delegiert an das schnelle GPT-5.5 Instant, die Stufen Mittel und Hoch schalten das gründlichere GPT-5.5 Thinking mit mittlerem beziehungsweise hohem Denkaufwand dazu. Free-Nutzer können die Stufe nicht wechseln, das mini-Modell läuft fest auf Instant. Wer die Stufe Hoch wählt, wartet spürbar länger auf Antworten, vor allem wenn der Sprachchat nebenbei das Web durchsucht.

Sprachchat starten und einstellen: die Anleitung

Der Einstieg dauert keine Minute. In der iOS- und Android-App wie im Browser sitzt rechts im Eingabefeld das Wellensymbol, ein Tipp darauf startet die Sprachunterhaltung. Nicht zu verwechseln mit dem Mikrofonsymbol, das nur das Diktat startet.

  1. Tippen Sie im Eingabefeld auf das Wellensymbol ganz rechts.
  2. Erlauben Sie der App beim ersten Mal den Mikrofonzugriff und wählen Sie eine Stimme aus.
  3. Sprechen Sie einfach los, sobald die pulsierende Kugel erscheint. Pausen, Unterbrechungen und Themenwechsel sind ausdrücklich erlaubt.
  4. Über die Steuerelemente schalten Sie das Mikrofon stumm oder beenden das Gespräch. Das Transkript erscheint anschließend im Chatverlauf.

Die spannenden Optionen liegen unter Einstellungen → Sprachchat. Dort wechseln Sie zwischen den Modi Live, Advanced und Standard, stellen die Intelligenzstufe um und wählen eine der neun Stimmen mit so klangvollen Namen wie Arbor, Breeze, Cove, Ember, Juniper, Maple, Sol, Spruce und Vale. Wer die bevorzugte Sprache fest hinterlegt, verbessert die Erkennung, ein Sprachwechsel mitten im Gespräch klappt trotzdem auf Zuruf. Drei Schalter lohnen einen Blick. Hintergrundunterhaltungen lässt das Gespräch weiterlaufen, während Sie andere Apps nutzen oder das Handy sperren. Mit Sprachchat starten öffnet ChatGPT direkt im Sprachmodus. Und wer ChatGPT im Auto nutzt, aktiviert den automatischen Start in CarPlay.

Mitten im Sprachgespräch dürfen Sie jederzeit zurück zur Tastatur. Über die Hinzufügen-Schaltfläche lassen sich Nachrichten tippen und Bilder anhängen, ChatGPT antwortet trotzdem per Stimme im selben Chat. Seit dem 7. August 2026 nimmt der Sprachchat laut den Release-Notes auch Datei-Uploads an und arbeitet mit Projekten zusammen, inklusive Zugriff auf Projekt-Chats, Quellen und hinterlegte Anweisungen. Fragen, deren Antwort ein Bild braucht, beantwortet GPT-Live mit eingeblendeten visuellen Karten, etwa zu Wetter, Aktienkursen oder Sportergebnissen.

Praxistipp für ruhige Gespräche

Wenn ChatGPT Sie zu früh unterbricht, helfen drei Dinge. Nutzen Sie Kopfhörer in lauter Umgebung, aktivieren Sie am iPhone im Kontrollzentrum die Stimmisolation für das Mikrofon, und sagen Sie zu Beginn einen Satz wie „Warte, bis ich dich bitte zu antworten“. GPT-Live hält sich in der Regel daran und hört zu, bis Sie fertig gedacht haben; bei sehr langen Pausen oder Stimmen im Hintergrund kann es trotzdem antworten.

Video, Bildschirmfreigabe, alte Stimmen: Dafür bleibt Advanced zuständig

GPT-Live kann zum Start weder Video noch Bildschirmfreigabe, das ist die größte funktionale Lücke des neuen Modus. Wer ChatGPT per Kamera etwas zeigen oder den eigenen Bildschirm teilen möchte, wechselt unter Einstellungen → Sprachchat auf Advanced, also den bisherigen erweiterten Sprachmodus, wo beide Funktionen für berechtigte Abonnenten weiter funktionieren. In manchen Medienberichten wurde Video bereits GPT-Live zugeschrieben, die offiziellen OpenAI-Hilfeseiten stellen jedoch klar, dass diese Funktionen beim neuen Modus noch fehlen. OpenAI arbeitet nach eigenen Angaben daran, sie „bald“ nachzurüsten.

Auch sonst bleibt der alte Modus für einige Fälle zuständig. Eigene GPTs sprechen weiterhin über den erweiterten Sprachmodus mit der Stimme Shimmer, verbundene Apps und Plugins unterstützt GPT-Live ebenfalls noch nicht. Und wer schlicht den vertrauten Klang von 2024 vermisst, wählt Advanced oder Standard als Dauereinstellung. Die Modi bleiben laut OpenAI verfügbar, „sofern diese Funktionen dort verfügbar sind“, eine Abschalt-Garantie ist das ausdrücklich nicht.

Benchmarks und Latenz: Was OpenAI misst und was ein unabhängiger Test zeigt

In OpenAIs eigenen Benchmark-Tests bevorzugten Menschen GPT-Live-1 in 75,7 Prozent der fünf- bis zehnminütigen Gespräche gegenüber dem erweiterten Sprachmodus, das mini-Modell kam auf 69,2 Prozent. Bewertet wurden Gesprächsfluss, Sprecherwechsel, Unterbrechungen und die empfundene Natürlichkeit. Deutlicher fällt der Sprung beim Wissen aus. Im Wissenschaftstest GPQA kletterte der Sprachchat laut den von Fachmedien wie eesel in der GPT-Live-Review ausgewerteten OpenAI-Diagrammen von 45,3 auf 76,5 Prozent, mit der Intelligenzstufe Hoch auf bis zu 84,2 Prozent. Bei der agentischen Websuche BrowseComp wirkt der Unterschied wie ein Generationenbruch, von 0,7 auf 35,1 Prozent in der Instant-Stufe, mit der Stufe Hoch sogar auf 75,2 Prozent. Der alte Sprachmodus konnte schlicht kaum suchen, GPT-Live delegiert die Suche an das Hintergrundmodell. Alle diese Zahlen stammen von OpenAI selbst, unabhängige Nachmessungen der Intelligenz-Werte stehen noch aus.

Zwei Balkendiagramme zeigen GPT-Live Benchmarks: GPQA (wissenschaftliches Reasoning) steigt von 45,3% auf bis zu 84,2%, BrowseComp (Websuche) von 0,7% auf bis zu 75,2%.
GPT-Live Benchmarks im Vergleich zum Advanced Voice Mode (AVM) über alle Intelligenzstufen hinweg. (Quelle: https://openai.com/de-DE/index/introducing-gpt-live/)
Screenshot des GPT-Live Präferenztest von OpenAI mit zwei Diagrammen: Links Balkendiagramm zeigt paarweise Gesprächspräferenz mit 75,7% für gpt-live-1 und 69,2% für gpt-live-1-mini gegenüber AVM (50% Parität-Linie). Rechts Säulendiagramm mit Gesprächsbewertungen für Gesprächsfluss und Angenehmheit auf Skala bis 7.
Der GPT-Live Präferenztest zeigt deutliche Vorteile bei Gesprächsfluss und Angenehmheit gegenüber dem Advanced Voice Mode. (Quelle: https://openai.com/de-DE/index/introducing-gpt-live/)

Die Reaktionszeit hat dagegen bereits jemand unabhängig nachgemessen. Der Echtzeit-Kommunikationsanbieter Agora hat in einer eigenen Latenz-Messreihe zu GPT-Live mit je 30 Durchläufen pro Testfall auf einem iPhone 13 nachgeprüft, was OpenAI nicht veröffentlicht. Das Ergebnis bestätigt den Eindruck vieler Tester nur zum Teil.

Antwortzeit im Median: GPT-Live gegen seine Vorgänger

Gemessen von Agora am 9. Juli 2026 (30 Durchläufe pro Modus, iPhone 13, ChatGPT-App, Werte gerundet). Kleinere Werte bedeuten schnellere Antworten.

Quelle: Agora-Latenzmessung zu GPT-Live (Blog, 10.07.2026)
Zahlen als Tabelle
ModusMedian-Antwortzeit in Millisekunden
GPT-Live-11.100
Erweiterter Sprachmodus1.300
Standard-Sprachmodus5.000

Interessanter als der Median ist die Konstanz. Die Schwankung der Sprecherwechsel-Zeiten schrumpfte in der Messung von 489 auf 104 Millisekunden, GPT-Live antwortet also nicht nur etwas schneller, sondern vor allem berechenbarer, und genau das erzeugt das natürliche Gesprächsgefühl. Agora fand allerdings auch zwei Schwächen. Wer GPT-Live bewusst ins Wort fällt, wartet rund anderthalb Sekunden (1,4 s), bis das Modell wirklich verstummt, etwa eine halbe Sekunde länger als beim Vorgänger. Und in 4 von 30 Testfenstern reagierte das Modell auf Hintergrundstimmen, die gar nicht an ChatGPT gerichtet waren. Die Tester weisen selbst darauf hin, dass bei 30 Durchläufen kleine Unterschiede nicht überbewertet werden sollten.

Erste Tests: Lob für den Gesprächsfluss, Kritik am Dauer-Nicken

Die Fachpresse bescheinigt GPT-Live fast einhellig einen spürbaren Sprung. Der KI-Entwickler und Blogger Simon Willison, der Vorabzugang hatte, nennt das Modell in seiner Einschätzung zu GPT-Live „sehr beeindruckend“, sein längstes Gespräch beim Hundespaziergang dauerte eine volle Stunde. Sein kuriosester Fund aus der Testphase war ein Bug, bei dem das Modell Gespräche unterbrach, um an unpassenden Stellen zu lachen. Nach seiner Meldung an OpenAI trat das Verhalten seltener auf. Ein Wochentest auf Medium kommt zu dem Schluss, GPT-Live sei die erste Sprach-KI, die der Autor dem Tippen vorziehe. Und Engadget beschreibt im Praxis-Guide, dass man beim Sprechen fast vergesse, mit einer KI zu reden.

Der häufigste Kritikpunkt ist ausgerechnet das menschlichste Feature. Die ständigen Bestätigungslaute wie „mhm“ und „ja“ empfanden viele Nutzer in den ersten Tagen als aufdringlich, in sozialen Netzwerken häuften sich Beschwerden über das Dauer-Nicken der KI. Abhilfe ist simpel, denn das Modell reagiert auf Stilwünsche. Ein Satz wie „Bitte keine Bestätigungslaute“ genügt für das laufende Gespräch. Tester bemängeln außerdem, dass GPT-Live auf Inhalte-Produktion schlicht nicht ausgelegt ist. Wer diktieren, formatieren oder Texte erzeugen will, bleibt beim Tippen oder beim Diktat besser aufgehoben, der Sprachchat liefert Gespräche statt fertiger Dokumente.

Als Alltagstalent entpuppt sich die Live-Übersetzung. Weil GPT-Live gleichzeitig hört und spricht, dolmetscht es Gespräche nahezu fließend, ohne dass die Beteiligten Sprechpausen einplanen müssen. Zusammen mit der Transkript-Anzeige im Chat taugt der Sprachchat damit erstmals ernsthaft als Urlaubs- und Termin-Dolmetscher, mit der erwähnten Einschränkung bei kleineren Sprachen.

Sicherheits-Zahlen aus der Systemkarte: besser mit zwei Ausnahmen

Die offizielle Systemkarte zeigt GPT-Live in fast allen Sicherheits-Kategorien gleichauf oder besser als den Vorgänger, dokumentiert aber auch zwei Rückschritte. In OpenAIs Tests mit echten, um persönliche Daten bereinigten Nutzeranfragen verbesserte sich GPT-Live-1 bei Anleitungen zu illegalem Verhalten von 0,74 auf 0,95 und bei Selbstverletzungs-Themen von 0,89 auf 0,97 (1,0 wäre fehlerfrei). Die Testfälle sind dabei bewusst schwierig gewählt und bilden keine Alltagsquoten ab. Beim Umgang mit emotionaler Abhängigkeit fiel das große Modell jedoch von 0,88 auf 0,82 zurück, und das mini-Modell rutschte bei sexuellen Inhalten von 0,97 auf 0,92 ab. Ausgerechnet die Kategorie, die bei einer immer menschlicher klingenden KI-Stimme am genauesten hinschauen lässt, wurde also schwächer. OpenAI stuft die Werte in der GPT-Live-Systemkarte als innerhalb der eigenen Startstandards ein.

Ungewöhnlich offen dokumentiert OpenAI eine Panne. Am 4. August 2026 räumte das Unternehmen in einem Änderungsvermerk ein, dass die ursprünglich veröffentlichten Sicherheits-Werte mit einer falschen Backend-Konfiguration gemessen worden waren. Alle Tests liefen daraufhin neu, ein Anhang stellt alte und korrigierte Zahlen nebeneinander. Mehrere Werte verschlechterten sich dabei messbar, etwa die Gore-Kategorie des mini-Modells in den synthetischen Tests von 0,96 auf 0,90. Unter die eigenen Mindeststandards fiel laut OpenAI kein Wert.

Tabelle 3 aus der GPT-Live Systemkarte zeigt Voice-Native Evaluations mit ursprünglichen und korrigierten Sicherheitswerten für GPT-Live-1 und GPT-Live-1 mini versus Advanced Voice Mode.
Tabelle 3 der GPT-Live Systemkarte stellt nach dem Korrektur-Vermerk vom 4. August 2026 die ursprünglichen und die neu berechneten Sicherheitswerte nebeneinander. (Quelle: https://deploymentsafety.openai.com/gpt-live)

Neu ist die Echtzeit-Absicherung während des Sprechens. Erkennt das System riskante Inhalte, kann es die Antwort mitten im Satz umlenken, eine gesprochene Sicherheitsmeldung abspielen, Hilfsangebote als Text einblenden oder das Gespräch in schweren Fällen beenden. Bei Anzeichen von Selbstverletzung verweist der Sprachchat auf fachlich geprüfte Krisen-Hotlines. Für Minderjährige hat OpenAI altersgerechtes Verhalten direkt ins Modell trainiert, Eltern steuern über die Kindersicherung, ob ihr Teenager den Sprachchat nutzen darf, und können in Risikosituationen benachrichtigt werden. Seit August 2026 bündelt OpenAI diese Schutzmaßnahmen in einer eigenen Teen-Version, die wir im Artikel zu ChatGPT für Jugendliche erklären. Stimmen klonen kann GPT-Live nach OpenAI-Angaben nicht, es spricht ausschließlich mit den neun vordefinierten Stimmen, und die externe Red-Teaming-Prüfung fand die Imitations-Sperren standardmäßig wirksam.

Die heikelste Frage bleibt die emotionale Bindung. OpenAI kündigt in der Ankündigung selbst an, die Nutzung nach dem Start gezielt auf Anzeichen emotionaler Abhängigkeit zu überwachen, und knüpft damit an die eigene Forschung zu affektiver Nutzung an, darunter eine 2025 gemeinsam mit dem MIT Media Lab veröffentlichte Studie. Gegenüber TechCrunch stellte das Unternehmen klar, GPT-Live sei nicht als KI-Gefährte konzipiert. Die deutsche Debatte läuft trotzdem, das Magazin t3n beschreibt in einer kritischen Analyse zur GPT-Live-Stimme die Menschlichkeit als bewusste Design-Entscheidung mit Geschäftsinteresse und mahnt einen nüchternen Umgang an. Wie schnell Nutzer zu einer sprechenden KI eine Beziehung aufbauen, war schon 2024 Thema, als die ChatGPT-Sprachfunktion erstmals mit menschlicher Stimme für Diskussionen sorgte.

Datenschutz: Was mit Ihren Sprachaufnahmen passiert

Die wichtigste Zahl für Datenschutzbewusste lautet 30 Tage. So lange bewahrt OpenAI die Audio-Clips aus Live- und Advanced-Gesprächen auf; das Transkript bleibt dagegen als Teil des Chatverlaufs bestehen, bis Sie den Chat löschen. Wer einen Chat löscht, löscht damit auch die zugehörigen Aufnahmen innerhalb von 30 Tagen, sofern keine rechtlichen Gründe oder Sicherheitsfälle dagegenstehen. Das Archivieren eines Chats löscht dagegen nichts. Im alten Standard-Modus wird das Audio sogar direkt nach der Transkription entfernt.

Fürs KI-Training verwendet OpenAI Sprachaufnahmen nur nach ausdrücklicher Freigabe. Erst wer unter Einstellungen → Datenkontrollen die Option „Das Modell für alle verbessern“ aktiviert und zusätzlich den Schalter „Audioaufnahmen einbeziehen“ umlegt, teilt seine Clips. Transkripte können bei aktivierter Verbesserungs-Option dagegen je nach Tarif ins Training einfließen. In Business-, Enterprise- und Edu-Workspaces ist das Teilen von Audio-Clips technisch gar nicht möglich. Zur Frage, ob ChatGPT ständig zuhört, ist die Architektur eindeutig, das Mikrofon ist nur während einer aktiven Sprachunterhaltung offen, per Stumm-Taste oder Beenden-Knopf ist Schluss. Die Agora-Messung zeigt allerdings, dass das offene Mikrofon während des Gesprächs gelegentlich Hintergrundstimmen aufschnappt und beantwortet, in Meetings oder im Großraumbüro gehört der Sprachchat deshalb beendet oder stummgeschaltet.

Für den geschäftlichen Einsatz kommt die Regulierung dazu. Wer Kunden per KI-Stimme anspricht, muss das nach Artikel 50 der KI-Verordnung offenlegen, die Transparenzpflichten gelten seit dem 2. August 2026 im Rahmen des EU AI Act. Sprachaufnahmen von Kunden sind außerdem personenbezogene Daten im Sinne der DSGVO, brauchen also Rechtsgrundlage und Löschkonzept. Für das private Plaudern mit ChatGPT gilt schlicht die Faustregel, sensible Angaben wie Gesundheits- oder Finanzdaten haben in einem Cloud-Sprachdienst nichts verloren.

SynthID-Wasserzeichen: OpenAI markiert GPT-Live-Audio mit Google-Technik

Seit dem 31. Juli 2026 trägt jede unterstützte Audiodatei aus dem ChatGPT Sprachchat und der OpenAI-API ein unhörbares SynthID-Wasserzeichen. Die Besonderheit steckt in der Herkunft der Technik, denn SynthID wurde von Google DeepMind entwickelt. OpenAI hatte sich im Mai 2026 dem Provenienz-Standard C2PA im Lenkungsgremium angeschlossen und SynthID zunächst für KI-Bilder übernommen, zeitgleich mit Unternehmen wie ElevenLabs, Kakao und NVIDIA. Apple schloss sich der Wasserzeichen-Allianz wenige Wochen später an. Mit dem Juli-Update folgte die Ausweitung auf Sprache. Das Wasserzeichen sitzt direkt im Klangsignal und übersteht nach Anbieterangaben Bearbeitungen wie Zuschneiden, Filter und verlustbehaftete Kompression.

Prüfen kann das jeder selbst. OpenAIs Verifizierungstool für KI-generierte Inhalte nimmt Bild- und Audiodateien entgegen und meldet, ob C2PA-Metadaten oder ein SynthID-Wasserzeichen gefunden wurden. Für Audio empfiehlt OpenAI Clips zwischen 10 und 60 Sekunden, hochgeladene Dateien werden laut Anbieter nicht fürs Training genutzt und nur gespeichert, wenn Gesetze es verlangen. Parallel öffnete OpenAI eine Verifizierungs-Schnittstelle, mit der Redaktionen und Plattformen solche Prüfungen automatisieren können. Ein erkanntes Signal belegt dabei nur die Herkunft aus OpenAI-Werkzeugen, ein fehlendes Signal beweist umgekehrt nichts, etwa wenn ein Inhalt von einem anderen Anbieter stammt.

Screenshot des OpenAI-Verifizierungstools zur Überprüfung von SynthID-Wasserzeichen und C2PA-Metadaten in generierten Inhalten
Upload-Oberfläche des OpenAI-Tools zur Verifizierung von SynthID-Wasserzeichen in Bild- und Audiodateien. (Quelle: https://openai.com/de-DE/research/verify/)

Der Zeitpunkt war kein Zufall. Zwei Tage nach der Wasserzeichen-Ankündigung, am 2. August 2026, wurden die Transparenzpflichten aus Artikel 50 der europäischen KI-Verordnung durchsetzbar, die eine Kennzeichnung KI-erzeugter Audio-Inhalte verlangen. Zur Einordnung der Betrugsdebatte taugt das Wasserzeichen übrigens nur begrenzt, denn GPT-Live spricht ausschließlich mit den vordefinierten ChatGPT-Stimmen und eignet sich nicht zum Klonen fremder Stimmen. Die in Deutschland diskutierten Schockanrufe mit geklonten Stimmen stammen aus anderen Werkzeugen.

Gemini Live, Claude und Grok: die Konkurrenz im Vergleich

Der direkteste Rivale bleibt Google Gemini Live, und die beiden Anbieter setzen auf entgegengesetzte Stärken. OpenAI baut auf das Gespräch, also Full-Duplex-Interaktion plus Hintergrund-Delegation an große Modelle. Google setzt auf Wahrnehmung, Gemini Live sieht per Kamera und Bildschirmfreigabe, arbeitet aber weiterhin rundenbasiert. Ein Vergleich von GPT-Live und Gemini Live bringt es auf die Formel, für visuelle Aufgaben führe der Weg zu Google, für Konversation und Recherche zu OpenAI, zumal GPT-Live das gleichzeitige Sprechen und Hören auch im Gratis-Tarif bietet.

Auch die übrigen Anbieter rüsteten 2026 auf. Anthropic koppelte den Sprachmodus von Claude am 23. Juli erstmals an seine großen Modelle, zuvor lief die Stimme dort stets auf dem kleinsten Modell Haiku. Details zu den Claude-Tarifen stehen im großen Vergleich von Claude und ChatGPT 2026. xAI bietet mit Grok bereits seit April ein schnelles Sprachmodell samt Entwickler-Schnittstellen an. Genau da liegt OpenAIs auffälligste Lücke, denn GPT-Live ist bislang ein reines ChatGPT-Produkt. Entwickler warten auf die angekündigte API und tragen sich in eine Warteliste ein, für eigene Sprachanwendungen bleibt vorerst die Realtime-API mit dem Modell gpt-realtime-2.1 zuständig.

OpenAI plant einen GPT-Live-Lautsprecher mit Jony Ive

GPT-Live ist auch die Software-Grundlage für OpenAIs Einstieg ins Hardware-Geschäft. Nach einem Bloomberg-Bericht von Mitte Juli arbeitet das Unternehmen mit Star-Designer Jony Ive an einem tragbaren, bildschirmlosen Smart Speaker mit Kamera, angetrieben von GPT-Live, mit Zielmarke 2027. Die Grundlage dafür legte OpenAI mit der 6,5 Milliarden US-Dollar schweren Übernahme von Jony Ives Firma io. Ob der Zeitplan hält, ist offen, seit dem 10. Juli 2026 läuft eine Klage von Apple gegen OpenAI wegen angeblich entwendeter Geschäftsgeheimnisse rund um das Gerät.

Häufige Fragen zu GPT-Live

Ist GPT-Live kostenlos nutzbar?

Ja, auch der Gratis-Tarif von ChatGPT nutzt die neue Technik, allerdings mit dem kleineren Modell GPT-Live-1 mini und begrenzter Sprachzeit. Die Intelligenzstufen Mittel und Hoch bleiben den Bezahltarifen vorbehalten, das mini-Modell arbeitet fest auf der schnellen Instant-Stufe.

Ist GPT-Live in Deutschland verfügbar oder brauche ich wieder ein VPN?

GPT-Live startete am 8. Juli 2026 weltweit und damit auch in Deutschland, ein VPN ist nicht nötig. Das war 2024 beim erweiterten Sprachmodus anders, damals wartete die EU rund einen Monat länger als die USA. Falls die Live-Option bei Ihnen fehlt, liegt das meist an einer veralteten App-Version oder dem gestaffelten Rollout.

Wie bekomme ich den alten Sprachmodus zurück?

Unter Einstellungen → Sprachchat lässt sich jederzeit von Live auf Advanced (der bisherige erweiterte Sprachmodus) oder Standard umschalten. Advanced brauchen Sie auch für Video und Bildschirmfreigabe. Eigene GPTs nutzen ohnehin weiterhin den erweiterten Sprachmodus und sprechen dort mit der Stimme Shimmer.

Hört ChatGPT mit GPT-Live ständig zu?

Nein, das Mikrofon ist nur während einer aktiven Sprachunterhaltung offen, und es kann nur ein Sprachgespräch gleichzeitig laufen. Mit der Stumm-Taste oder dem Beenden-Knopf ist sofort Schluss. Nur wer die Option Hintergrundunterhaltungen aktiviert, lässt das Gespräch bei gesperrtem Handy weiterlaufen, auch das bleibt aber eine aktive, sichtbare Sitzung.

Kann GPT-Live Video oder meinen Bildschirm sehen?

Zum Start nicht, Video und Bildschirmfreigabe funktionieren nur im Advanced-Modus für berechtigte Abonnenten. OpenAI hat angekündigt, beide Funktionen bald in GPT-Live nachzurüsten. Verbundene Apps und Plugins unterstützt der neue Modus ebenfalls noch nicht.

Kann GPT-Live live übersetzen?

Ja, und durch das gleichzeitige Hören und Sprechen dolmetscht GPT-Live deutlich flüssiger als der Vorgänger. Sie bitten ChatGPT einfach im Gespräch darum, zwischen zwei Sprachen zu übersetzen. Bei weniger verbreiteten Sprachen räumt OpenAI aber hörbare Akzente ein, in einer Launch-Demo fiel etwa eine Hindi-Übersetzung mit amerikanischer Färbung auf.

ChatGPT für Handwerker &
Unternehmen

Holen Sie sich jetzt kostenlos die besten ChatGPT Prompts für lokale Dienstleister wie z.B. Handwerker. Sie werden damit bei Preisverhandlungen siegen können und Gegenargumente entkräften. Viele Prompts und ein breites Spektrum an Themen, um Ihren Arbeitsalltag zu erleichtern. Laden Sie sich jetzt diese einmalige Prompt-Bibliothek speziell für regional tätige Unternehmen & Handwerksbetriebe herunter.

Webinar Release KI im Handwerk

Sie haben eine Frage?