Glossareintrag
Wir denken. KI tippt mit.
Ein Voice Agent (deutsch Sprachagent, im Betriebsalltag meist KI-Telefonassistent genannt) ist ein KI-Agent, der ein Gespräch in gesprochener Sprache führt. Er versteht den Anrufer, antwortet in Echtzeit mit einer synthetischen Stimme und erledigt dabei Aufgaben, etwa einen Termin eintragen, einen Rückruf notieren oder einen Notfall an den Bereitschaftsdienst durchstellen. Im Kern arbeitet ein Sprachmodell (LLM), das über Spracherkennung und Sprachausgabe an eine Telefonleitung, eine App oder eine Website angeschlossen ist.
Vom Sprachassistenten wie Alexa oder Siri unterscheidet ihn die Rolle. Ein Sprachassistent bedient seinen Besitzer auf Zuruf, ein Voice Agent vertritt ein Unternehmen gegenüber fremden Anrufern und muss ein Anliegen selbstständig aufnehmen und zu Ende bringen. Vom klassischen Sprachmenü („Drücken Sie die 1 für Störungen“) trennt ihn, dass er frei formulierte Sätze versteht, statt Tastendrücke oder feste Schlüsselwörter abzufragen. Der Telefonie-Anbieter Twilio beschreibt ein Sprachsystem ohne Sprachmodell deshalb als „just a phone menu with better audio“.
Gegenüber dem Chatbot ändert sich nicht die Intelligenz, sondern der Kanal. Beide können auf demselben Sprachmodell laufen, der Voice Agent muss aber innerhalb von Bruchteilen von Sekunden antworten, Unterbrechungen aushalten und mit Dialekt, Hintergrundlärm und halben Sätzen zurechtkommen. Im Englischen heißt dieselbe Technik auch AI Voice Agent, Voice AI Agent oder Voicebot, wobei „Voicebot“ häufig für die älteren, regelbasierten Systeme steht.
Voice Agents werden nach zwei Bauweisen gebaut, die OpenAI in seinem Leitfaden für Voice Agents gegenüberstellt. Die Kaskade (englisch „chained“ oder „cascaded“) schaltet drei Modelle hintereinander. Eine Spracherkennung (Speech-to-Text, STT) wandelt das Gesagte in Text, ein Sprachmodell formuliert die Antwort, eine Sprachausgabe (Text-to-Speech, TTS) liest sie mit einer synthetischen Stimme vor. Beim Speech-to-Speech-Modell verarbeitet dagegen ein einziges, multimodales Modell den Ton direkt und antwortet wieder mit Ton, ohne den Umweg über geschriebenen Text. Beispiele sind OpenAIs gpt-realtime-Modelle in der Realtime API und Googles Gemini Live API, die Tonfall und Stimmung des Sprechers in die Antwort einbezieht und über 70 Sprachen abdeckt.
Die Kaskade liefert an jeder Stufe Text und damit ein Protokoll, das sich prüfen und archivieren lässt; das Sprachmodell lässt sich frei austauschen, und ein vorhandener Text-Chatbot lässt sich mit Spracherkennung und Sprachausgabe zum Voice Agent erweitern. Speech-to-Speech klingt natürlicher, hört Emotionen und Betonung heraus und spart die Übergabezeit zwischen den Stufen. Der Spracherkennungs-Anbieter Deepgram weist in seinem Vergleich beider Architekturen darauf hin, dass Fehler im Speech-to-Speech-Modell ohne Textspur schwer zu finden sind, und rät, die Antwortzeit im eigenen Aufbau zu messen, statt einer Bauweise pauschal den Vorzug zu geben. Microsofts Voice Live API und die Plattform von ElevenLabs erlauben beides, ein natives Audio-Modell oder ein Text-Modell mit vorgeschalteter Erkennung.
Menschen antworten im Gespräch am häufigsten nach einer Pause von 0 bis 200 Millisekunden, wie eine Studie über zehn Sprachen in PNAS 2009 gemessen hat, und an diesem Maßstab wird jeder Voice Agent gemessen. Twilio nennt als Ziel für Voice AI unter 500 Millisekunden. Der Anbieter Parloa schätzt die tatsächliche Antwortzeit heutiger Systeme in seiner Analyse zur Sprachlatenz auf einen Median von 1,4 bis 1,7 Sekunden, bei Kaskaden typischerweise 0,8 bis 2 Sekunden, weil sich die Laufzeiten von Erkennung, Modell, Sprachausgabe und Telefonnetz addieren. Deshalb streamen moderne Systeme jede Stufe, das Modell beginnt zu antworten, bevor der Satz des Anrufers vollständig erkannt ist, und die Sprachausgabe spricht die ersten Wörter, während das Modell noch schreibt.
Dazu kommt das Sprecherwechsel-Problem (Turn Detection). Das System muss erkennen, ob der Anrufer fertig ist oder nur nachdenkt, und ob er unterbrechen will (Barge-in). Die einfache Methode misst Stille und wartet eine feste Zeit; sie schneidet Anrufer ab, die Luft holen, und lässt Pausen entstehen, wenn jemand schnell weiterspricht. OpenAI bietet in der Realtime API deshalb eine semantische Sprechpausen-Erkennung, die aus dem Inhalt schätzt, ob der Satz zu Ende ist. ElevenLabs lässt sich mit einem eigenen Modell für den Sprecherwechsel, das Füllwörter wie „ähm“ und den Gesprächsfluss auswertet, zwischen ungeduldig und geduldig einstellen und empfiehlt, Unterbrechungen bei Pflichtansagen abzuschalten. Rauschunterdrückung und Echo-Kompensation, die Microsoft in seiner Voice Live API mitliefert, sorgen dafür, dass Baustellenlärm oder die eigene Stimme aus dem Lautsprecher nicht als neuer Sprecher gewertet werden.
Zum Agenten wird das System erst durch Function Calling. Während des Gesprächs ruft das Modell Werkzeuge auf, prüft freie Termine im Kalender, legt einen Kunden im CRM an oder löst einen Rückruf aus, und überbrückt die Wartezeit mit einem Satz wie „einen Moment, ich schaue nach“. Firmenwissen wie Öffnungszeiten, Preislisten oder Anfahrtsgebiete bekommt der Agent über RAG aus einer Wissensdatenbank, statt es im Prompt mitzuschleppen. Ans Telefonnetz kommt der Agent über SIP-Trunking, das OpenAI direkt in der Realtime API anbietet, oder über Telefonie-Plattformen wie Twilio, die den Anruf an das Modell durchreichen; im Browser oder in Apps läuft der Ton über WebRTC.
Modellanbieter wie OpenAI, Google und Microsoft bilden die unterste von drei Marktschichten und stellen die Sprach- und Audio-Modelle bereit. Plattformen wie ElevenAgents von ElevenLabs, Vapi, Retell, Deepgram und Twilio bündeln Erkennung, Modell, Stimmen, Sprecherwechsel und Telefonanbindung zu einem Baukasten, in dem Entwickler einen Agenten konfigurieren statt programmieren; wie sich solche Agenten inzwischen per MCP aus Claude heraus verwalten lassen, beschreibt unser Artikel zum ElevenLabs MCP in Claude. Die dritte Schicht bilden fertige Telefonassistenten für einzelne Branchen, die auf diesen Plattformen aufsetzen und dem Betrieb nur noch Rufnummer, Ansage und Kalenderanbindung abverlangen.
Die Entwicklung läuft auf Modelle hinaus, die gleichzeitig hören und sprechen (Full Duplex). OpenAI veröffentlichte laut seinem API-Changelog im Juli 2026 GPT-Realtime-2.1 mit besserer Erkennung von Zahlen- und Buchstabenfolgen, etwa bei Kundennummern. Im selben Monat brachte OpenAI mit GPT-Live einen Vollduplex-Sprachmodus in ChatGPT, den unser Artikel zu GPT-Live erklärt. Amazon baut Alexa mit Anthropic-Modellen zum agentischen Assistenten um (Hintergrund zur Alexa-Kooperation), Apple stellte auf der WWDC im Juni 2026 eine neue Siri auf Gemini-Basis vor.
Die Risiken sind dieselben wie bei jedem Sprachmodell, nur unter Zeitdruck und ohne Lesezeit für den Kunden. Halluzinationen am Telefon, etwa eine erfundene Preiszusage, fallen erst auf, wenn der Kunde sich darauf beruft, und eine Prompt Injection kann auch gesprochen ankommen. Die Gegenseite nutzt dieselbe Technik für Betrug. Die US-Telekommunikationsaufsicht FCC stufte KI-generierte Stimmen in Werbeanrufen im Februar 2024 als künstliche Stimmen nach dem Robocall-Gesetz ein und machte sie ohne Einwilligung illegal; die Behörde nannte als Anlass Anrufe, die mit geklonten Stimmen Familienangehörige erpressen, Prominente nachahmen und Wähler täuschen. In der EU gilt seit dem 2. August 2026 die Transparenzpflicht aus Artikel 50 der KI-Verordnung. Anbieter müssen KI-Systeme, die direkt mit Menschen sprechen, so bauen, dass der Anrufer spätestens bei der ersten Interaktion erfährt, dass er mit einer KI spricht, außer es ist aus Sicht eines aufmerksamen Nutzers ohnehin offensichtlich (mehr dazu im Eintrag zum EU AI Act).
Für lokale Unternehmen und Handwerksbetriebe ist der Voice Agent die KI-Anwendung, die am dichtesten am Tagesgeschäft sitzt, weil das Telefon dort klingelt, wo gerade niemand abheben kann. Ein typischer Ablauf beim SHK-Betrieb sieht so aus. Freitag 19:40 Uhr ruft eine Mieterin an, im Keller steht Wasser. Der Agent meldet sich mit Firmenname und dem Hinweis, dass ein KI-Assistent spricht, fragt nach Adresse, Rückrufnummer und Art des Schadens, erkennt am Stichwort Rohrbruch den Notfall und stellt zum Bereitschaftsmonteur durch. Ein zweiter Anrufer möchte nur einen Wartungstermin für die Gastherme, der Agent prüft den Kalender, trägt Dienstag 9 Uhr ein und schickt dem Büro eine Zusammenfassung per E-Mail. Beide Gespräche laufen gleichzeitig, ohne Warteschleife und ohne Mailbox.
Heidbrink Heizungsbau in Münster (17 Mitarbeiter, bis zu 50 Anrufe am Tag) lässt seit Dezember 2025 die Assistentin „Sandra“ des Anbieters HeyKiki ans Telefon; laut Bericht im Handwerksblatt sank die Zahl der Wochenend-Anrufe, die den Bereitschaftsdienst erreichen, von bis zu 20 auf zwei bis drei echte Notfälle. Der Berliner SHK-Betrieb Krone GT nimmt mit einem Placetel-Agenten über 400 Anrufe am Tag an, überwiegend Schadensmeldungen von Mietern, und leitet nur die komplexen Fälle an Mitarbeiter weiter. Die Bitkom-Studie zur Digitalisierung des Handwerks (Befragung Sommer 2025, 504 Betriebe) zählt erst 4 Prozent KI-Nutzer, weitere 9 Prozent planen den Einsatz, und 96 Prozent nennen Sicherheit und Datenschutz als Hürde.
Im deutschsprachigen Markt werben eigenständige Telefonassistenten wie HalloPetra (mit Branchen-Profilen und Fachbegriffen für SHK, Elektro und weitere Gewerke), fonio.ai und Agentino ausdrücklich um Handwerksbetriebe, mit Notfallerkennung, Terminvergabe und Gesprächszusammenfassung per E-Mail, abgerechnet nach Monatspaketen mit Inklusivminuten (aktuelle Tarife auf den verlinkten Preisseiten); HalloPetra und Agentino nennen Frankfurt als Serverstandort. Parallel bauen die Hersteller von Handwerkersoftware den Agenten direkt ein. plancraft hat im April 2026 PORTA gestartet, HERO Software liefert HERO Voice, ToolTime und Labelwin haben den Telefondienst ebenfalls integriert (Bericht zu PORTA, HERO Voice). Der Vorteil der Integration liegt in den Daten, der Agent erkennt den Bestandskunden an der Rufnummer und legt das Gespräch direkt am Auftrag ab. Wer einen Entwickler hat, setzt auf ElevenAgents, Vapi, Retell oder direkt auf die OpenAI Realtime API, die nach Gesprächsminuten beziehungsweise Audio-Token abrechnen (Preisliste von OpenAI), und verlangt sich damit eigene Telefonie, eigenes Prompting und eigene Tests ab.
Vor dem Einschalten stehen vier Pflichten. Erstens die KI-Ansage zu Gesprächsbeginn, die Artikel 50 der KI-Verordnung seit dem 2. August 2026 von den Anbietern solcher Systeme verlangt und die der Betrieb in seiner Begrüßung nicht abschalten darf; Verstöße kosten nach Artikel 99 bis zu 15 Millionen Euro oder 3 Prozent des Jahresumsatzes, bei kleinen Unternehmen der niedrigere Wert. Zweitens die Aufzeichnung. Transkript und Tonmitschnitt fallen unter § 201 StGB, der das unbefugte Aufnehmen des nichtöffentlich gesprochenen Wortes mit bis zu drei Jahren Freiheitsstrafe bedroht; die Ansage muss die Aufzeichnung deshalb nennen und dem Anrufer die Möglichkeit lassen aufzulegen. Drittens die DSGVO. Stimme, Name und Adresse sind personenbezogene Daten, der Anbieter braucht einen Auftragsverarbeitungsvertrag, die Datenschutzerklärung einen Hinweis auf die KI-Nutzung, und die Orientierungshilfe der Datenschutzkonferenz verlangt bei hohem Risiko eine Datenschutz-Folgenabschätzung. Viertens der ausgehende Anruf. Lässt der Betrieb den Agenten selbst anrufen, etwa für Terminerinnerungen, gilt § 7 UWG, der Werbung „unter Verwendung einer automatischen Anrufmaschine“ ohne ausdrückliche Einwilligung verbietet; die Bundesnetzagentur ahndet unerlaubte Telefonwerbung mit bis zu 300.000 Euro. Eine Terminerinnerung an einen Kunden, der den Termin selbst vereinbart hat, ist keine Werbung, ein Anruf zur Wartungsaktion schon.
Der Anbieter Vokaro gibt für Hochdeutsch 95 bis 98 Prozent korrekt erkannte Wörter an, bei starkem Dialekt nur 60 bis 80 Prozent (Anbieterangaben zur deutschen Spracherkennung), und Straßennamen, Kundennummern und Lärm im Hintergrund bleiben die häufigsten Fehlerquellen; gute Agenten buchstabieren nach und leiten im Zweifel weiter. In der Verbraucherumfrage von Nordlight Research (Januar 2024, über 1.000 Befragte) wollen 75 Prozent weiterhin einen Menschen als Option, 51 Prozent verlangen eine nahtlose Weitergabe, 58 Prozent schätzen die Erreichbarkeit rund um die Uhr (Trendmonitor von Nordlight Research). Eine GfK-Umfrage für Greven Medien aus dem September 2025 ergab, dass 18- bis 40-Jährige KI im Kundenservice lokaler Betriebe als selbstverständlicher empfinden als über 50-Jährige, und dass die Hälfte der Befragten fehlende persönliche Betreuung fürchtet (Auswertung im Handwerksblatt). Ein Voice Agent, der den Monteur auf Wunsch sofort durchstellt, erfüllt beide Erwartungen; einer, der den Anrufer in einer Schleife festhält, verspielt den Vorteil gegenüber der Mailbox.