Konversationstypen
Es gibt zwei Konversationstypen, die bestimmen, wie der Voice Agent Sprache verarbeitet und auf Anrufer reagiert:- Standard Conversation - ein dreistufiger Prozess (STT → LLM → TTS)
- Realtime Conversation - ein direkter Audio-zu-Audio-Ansatz
Standard: Beim Erstellen eines neuen Voice Agents wird automatisch die Standard Conversation als Konversationstyp verwendet. Der Modus kann jederzeit unter Erweitert in den Einstellungen des Agents geändert werden.
Standard Conversation (STT → LLM → TTS)
Bei der Standard Conversation durchläuft jede Nachricht des Anrufers drei separate Verarbeitungsschritte: 🎤 STT → 🧠 LLM → 🔊 TTS- STT (Speech-to-Text) - Die gesprochene Sprache des Anrufers wird in Text umgewandelt. Die eingesetzte Spracherkennung liefert eine äußerst präzise Transkription - auch bei Fachbegriffen, Eigennamen und Dialekten.
- LLM (Large Language Model) - Der erkannte Text wird an ein KI-Sprachmodell gesendet, das eine passende Antwort generiert. Die verfügbaren Modelle unterstützen ein deutlich größeres Kontextfenster als Realtime-Modelle. Dadurch kann der Agent längere Gesprächsverläufe, umfangreiche Wissensdatenbanken und komplexe Anweisungen gleichzeitig berücksichtigen.
- TTS (Text-to-Speech) - Die generierte Textantwort wird in gesprochene Sprache umgewandelt und dem Anrufer vorgelesen.
Sprachmodell auswählen
Öffnen Sie im Voice Wizard Erweitert und dann Konversation und Audio. Im Feld Modell wählen Sie das Sprachmodell für eine Standard Conversation aus:
Die Auswahl gilt für die Antworten des Agents. Feste Millisekundenwerte lassen sich nicht angeben: Prompt-Länge, Tool-Aufrufe, Netzwerk sowie Sprach- und Sprachausgabe beeinflussen die wahrgenommene Reaktionszeit. Sprach- und Sprachausgabe-Einstellungen konfigurieren Sie weiterhin separat.
GPT-5.6 Terra und GPT-5.6 Luna stehen nur für Standard Conversation zur Verfügung. Realtime Conversation verwendet ihre eigenen nativen Realtime-Modelle.
Abgrenzung zu Bring Your Own LLM
Das Feld Modell wählt die von der Plattform verwalteten Standardmodelle aus. Es ist getrennt von Bring Your Own LLM; dessen Verbindung und Verhalten ändern sich durch diese Auswahl nicht.Realtime Conversation
Die Realtime Conversation verwendet ein Ende-zu-Ende-Sprachmodell, das Audio direkt verarbeitet - ohne den Umweg über separate STT- und TTS-Schritte: 🎤 Audio rein → 🧠 Realtime-Sprachmodell → 🔊 Audio raus Das Sprachmodell empfängt die Audiodaten des Anrufers direkt und erzeugt die gesprochene Antwort in einem einzigen Schritt. Es gibt keine separate Textzwischenstufe. Die Antwort erfolgt nahezu sofort, was ein besonders natürliches und flüssiges Gesprächserlebnis schafft. Dieser Modus eignet sich besonders für einfache, geradlinige Anwendungsfälle - z. B. FAQ-Hotlines, allgemeine Auskünfte oder kurze Informationsgespräche, bei denen eine schnelle Antwortzeit wichtiger ist als komplexe Gesprächslogik. Spracherkennungsoptimierung (Spezialbegriffe, Hintergrundkontext) steht in diesem Modus nicht zur Verfügung.Spracherkennungsoptimierung
Die Spracherkennungsoptimierung hilft dem Voice Agent, die gesprochene Sprache des Anrufers besser zu verstehen. Sie steht nur im Standard-Conversation-Modus zur Verfügung und besteht aus zwei Bereichen:- Spezialbegriffe - Einzelne Wörter oder kurze Ausdrücke, die der Spracherkennung gezielt bekannt gemacht werden.
- Hintergrundkontext - Beschreibender Text, der der Spracherkennung das Thema und den Kontext des Gesprächs vermittelt.
Spezialbegriffe
Spezialbegriffe (auch: Schlüsselbegriffe) sind einzelne Wörter oder kurze Ausdrücke, die in Gesprächen häufig vorkommen, aber für die Spracherkennung ungewöhnlich, selten oder unbekannt sein können. Durch das Hinterlegen dieser Begriffe wird die Erkennungsgenauigkeit für genau diese Wörter deutlich verbessert.Wann sollten Sie Spezialbegriffe verwenden?
- Fachbegriffe: Branchenspezifische Wörter, die im allgemeinen Sprachgebrauch selten vorkommen
- Produkt- und Markennamen: Eigennamen, die nicht im Standardwortschatz enthalten sind
- Straßen- und Ortsnamen: Lokale Bezeichnungen, die die Spracherkennung möglicherweise nicht kennt
- Personennamen: Namen von Mitarbeitern oder Ansprechpartnern, die häufig genannt werden
- Abkürzungen und Kürzel: Firmeninterne Bezeichnungen oder branchenübliche Kürzel
- Erfundene oder zusammengesetzte Wörter: Begriffe, die speziell für Ihr Unternehmen oder Ihre Produkte geschaffen wurden
Eingabeformat
Geben Sie die Begriffe als kommagetrennte Liste ein:Beispiele
Beispiele
- Versicherungsbranche:
Schadensmeldung, Deckungssumme, Haftpflicht, Kaskoversicherung, Selbstbeteiligung, Policennummer - Medizinbereich:
Ibuprofen, Metformin, Pantoprazol, Blutdruckmessgerät, HbA1c-Wert - IT-Dienstleister:
Kubernetes, Terraform, GitLab, On-Premise, Firewall-Regel, VPN-Tunnel - Immobilien:
Grundbuchauszug, Nebenkostenabrechnung, Mietkaution, Energieausweis, Wohnflächenberechnung - Firmennamen und Produkte:
TarifPlus, SmartConnect, FlexiCare, MediCheck, ProfiPlan
Best Practices
- Fügen Sie nur Begriffe hinzu, die von der Spracherkennung tatsächlich falsch erkannt werden oder bei denen Sie eine Fehlererkennung erwarten.
- Verwenden Sie die korrekte Schreibweise - die Spracherkennung nutzt diese als Referenz für die Textausgabe.
- Vermeiden Sie ganze Sätze - Spezialbegriffe sollten einzelne Wörter oder kurze Ausdrücke (max. 2–3 Wörter) sein.
- Testen Sie nach dem Hinzufügen, ob die Erkennung sich verbessert hat.
Hintergrundkontext
Der Hintergrundkontext gibt der Spracherkennung zusätzliche Informationen darüber, worum es in den Gesprächen geht. Im Gegensatz zu Spezialbegriffen, die einzelne Wörter betreffen, liefert der Hintergrundkontext eine thematische Orientierung - ähnlich wie wenn Sie einem Zuhörer vorab erklären, worüber gleich gesprochen wird.Wann sollten Sie Hintergrundkontext verwenden?
- Wenn Gespräche ein bestimmtes Fachgebiet betreffen (z. B. Versicherung, Medizin, Technik)
- Wenn typische Gesprächsverläufe vorhersehbar sind
- Wenn es häufig wiederkehrende Themen gibt, die der Spracherkennung helfen können, zweideutige Wörter korrekt zu interpretieren
Was sollte der Hintergrundkontext enthalten?
- Beschreibung des Einsatzbereichs: Was ist die Aufgabe des Voice Agents?
- Typische Gesprächsthemen: Worüber sprechen Anrufer in der Regel?
- Branchenspezifische Informationen: Welche Fachgebiete oder Produkte sind relevant?
Beispiele
Beispiel 1: Kundenservice einer Versicherung
Beispiel 1: Kundenservice einer Versicherung
Beispiel 2: Arztpraxis / Terminvereinbarung
Beispiel 2: Arztpraxis / Terminvereinbarung
Beispiel 3: IT-Support
Beispiel 3: IT-Support
Best Practices
- Schreiben Sie den Kontext in natürlicher Sprache - als würden Sie jemandem den typischen Gesprächsinhalt erklären.
- Halten Sie den Text prägnant und relevant - nur Informationen, die der Spracherkennung tatsächlich helfen.
- Erwähnen Sie typische Formate (z. B. Ticketnummern, Vorgangsnummern), die Anrufer häufig nennen.
- Aktualisieren Sie den Kontext, wenn sich der Einsatzbereich Ihres Voice Agents ändert.
Hintergrund-Audio
Mit Hintergrund-Audio können Sie dem Voice Agent ein dezentes Umgebungsgeräusch hinterlegen, das während des gesamten Gesprächs im Hintergrund abgespielt wird. Dies vermittelt dem Anrufer den Eindruck, mit einer echten Person in einer realen Umgebung zu sprechen.Verfügbare Sounds
Die Lautstärke des Hintergrund-Audios kann über einen Regler stufenlos angepasst werden.
Tool-Ausführungssound
Der Tool-Ausführungssound wird abgespielt, während der Voice Agent einen Werkzeugaufruf (Tool) ausführt - z. B. eine API-Abfrage, das Senden einer SMS oder eine Terminbuchung. Während dieser Zeit wartet der Agent auf die Antwort des externen Systems, und der Anrufer hört ohne diesen Sound nur Stille. Der Sound signalisiert dem Anrufer, dass der Agent aktiv arbeitet, und überbrückt die Wartezeit.Verfügbare Sounds
- Off - Kein Sound während der Tool-Ausführung (Standard)
- Keyboard Typing - Tastaturgeräusch, vermittelt den Eindruck, dass der Agent Daten eingibt oder nachschlägt
- Keyboard Typing 2 - Alternative Variante des Tastaturgeräuschs
Beispiel
Szenario: Anrufer fragt nach seinem Vertragsstatus
Szenario: Anrufer fragt nach seinem Vertragsstatus
Anrufer: „Können Sie mir sagen, ob mein Vertrag noch aktiv ist?“Agent: „Einen Moment bitte, ich prüfe Ihre Daten…“Während der Agent die API abfragt, hört der Anrufer ein Tastaturgeräusch im Hintergrund.Agent: „Ihr Vertrag mit der Nummer V-2024-00815 ist aktiv und läuft bis zum 31.12.2025.“Hinweis: Der Tool-Ausführungssound wird nur während aktiver Werkzeugaufrufe abgespielt und stoppt automatisch, sobald das Ergebnis vorliegt. Er ersetzt nicht das Hintergrund-Audio, sondern ergänzt es.