Skip to main content

Konversationstypen

Es gibt zwei Konversationstypen, die bestimmen, wie der Voice Agent Sprache verarbeitet und auf Anrufer reagiert:
  • Standard Conversation - ein dreistufiger Prozess (STT → LLM → TTS)
  • Realtime Conversation - ein direkter Audio-zu-Audio-Ansatz
Standard: Beim Erstellen eines neuen Voice Agents wird automatisch die Standard Conversation als Konversationstyp verwendet. Der Modus kann jederzeit unter Erweitert in den Einstellungen des Agents geändert werden.

Standard Conversation (STT → LLM → TTS)

Bei der Standard Conversation durchläuft jede Nachricht des Anrufers drei separate Verarbeitungsschritte: 🎤 STT → 🧠 LLM → 🔊 TTS
  1. STT (Speech-to-Text) - Die gesprochene Sprache des Anrufers wird in Text umgewandelt. Die eingesetzte Spracherkennung liefert eine äußerst präzise Transkription - auch bei Fachbegriffen, Eigennamen und Dialekten.
  2. LLM (Large Language Model) - Der erkannte Text wird an ein KI-Sprachmodell gesendet, das eine passende Antwort generiert. Die verfügbaren Modelle unterstützen ein deutlich größeres Kontextfenster als Realtime-Modelle. Dadurch kann der Agent längere Gesprächsverläufe, umfangreiche Wissensdatenbanken und komplexe Anweisungen gleichzeitig berücksichtigen.
  3. TTS (Text-to-Speech) - Die generierte Textantwort wird in gesprochene Sprache umgewandelt und dem Anrufer vorgelesen.
Im Standard-Modus können Sie die Spracherkennung und die Sprachausgabe gezielt anpassen: Für die STT-Komponente stehen Spezialbegriffe und Hintergrundkontext zur Verfügung, um die Erkennungsgenauigkeit zu verbessern. Für die TTS-Komponente können Sie die Stimme auswählen und deren Eigenschaften wie Sprechgeschwindigkeit, Stabilität und Ähnlichkeit konfigurieren. Dieser Modus eignet sich besonders für komplexe Anwendungsfälle mit umfangreicher Geschäftslogik, Werkzeugaufrufen (Tools), Wissensdatenbanken und mehrstufigen Gesprächsabläufen.

Sprachmodell auswählen

Öffnen Sie im Voice Wizard Erweitert und dann Konversation und Audio. Im Feld Modell wählen Sie das Sprachmodell für eine Standard Conversation aus: Die Auswahl gilt für die Antworten des Agents. Feste Millisekundenwerte lassen sich nicht angeben: Prompt-Länge, Tool-Aufrufe, Netzwerk sowie Sprach- und Sprachausgabe beeinflussen die wahrgenommene Reaktionszeit. Sprach- und Sprachausgabe-Einstellungen konfigurieren Sie weiterhin separat.
GPT-5.6 Terra und GPT-5.6 Luna stehen nur für Standard Conversation zur Verfügung. Realtime Conversation verwendet ihre eigenen nativen Realtime-Modelle.

Abgrenzung zu Bring Your Own LLM

Das Feld Modell wählt die von der Plattform verwalteten Standardmodelle aus. Es ist getrennt von Bring Your Own LLM; dessen Verbindung und Verhalten ändern sich durch diese Auswahl nicht.

Realtime Conversation

Die Realtime Conversation verwendet ein Ende-zu-Ende-Sprachmodell, das Audio direkt verarbeitet - ohne den Umweg über separate STT- und TTS-Schritte: 🎤 Audio rein → 🧠 Realtime-Sprachmodell → 🔊 Audio raus Das Sprachmodell empfängt die Audiodaten des Anrufers direkt und erzeugt die gesprochene Antwort in einem einzigen Schritt. Es gibt keine separate Textzwischenstufe. Die Antwort erfolgt nahezu sofort, was ein besonders natürliches und flüssiges Gesprächserlebnis schafft. Dieser Modus eignet sich besonders für einfache, geradlinige Anwendungsfälle - z. B. FAQ-Hotlines, allgemeine Auskünfte oder kurze Informationsgespräche, bei denen eine schnelle Antwortzeit wichtiger ist als komplexe Gesprächslogik. Spracherkennungsoptimierung (Spezialbegriffe, Hintergrundkontext) steht in diesem Modus nicht zur Verfügung.

Spracherkennungsoptimierung

Die Spracherkennungsoptimierung hilft dem Voice Agent, die gesprochene Sprache des Anrufers besser zu verstehen. Sie steht nur im Standard-Conversation-Modus zur Verfügung und besteht aus zwei Bereichen:
  • Spezialbegriffe - Einzelne Wörter oder kurze Ausdrücke, die der Spracherkennung gezielt bekannt gemacht werden.
  • Hintergrundkontext - Beschreibender Text, der der Spracherkennung das Thema und den Kontext des Gesprächs vermittelt.
Zeichenlimit: Spezialbegriffe und Hintergrundkontext teilen sich ein gemeinsames Budget von 9.000 Zeichen. Überschreiten beide Felder zusammen dieses Limit, wird eine Fehlermeldung angezeigt.

Spezialbegriffe

Spezialbegriffe (auch: Schlüsselbegriffe) sind einzelne Wörter oder kurze Ausdrücke, die in Gesprächen häufig vorkommen, aber für die Spracherkennung ungewöhnlich, selten oder unbekannt sein können. Durch das Hinterlegen dieser Begriffe wird die Erkennungsgenauigkeit für genau diese Wörter deutlich verbessert.

Wann sollten Sie Spezialbegriffe verwenden?

  • Fachbegriffe: Branchenspezifische Wörter, die im allgemeinen Sprachgebrauch selten vorkommen
  • Produkt- und Markennamen: Eigennamen, die nicht im Standardwortschatz enthalten sind
  • Straßen- und Ortsnamen: Lokale Bezeichnungen, die die Spracherkennung möglicherweise nicht kennt
  • Personennamen: Namen von Mitarbeitern oder Ansprechpartnern, die häufig genannt werden
  • Abkürzungen und Kürzel: Firmeninterne Bezeichnungen oder branchenübliche Kürzel
  • Erfundene oder zusammengesetzte Wörter: Begriffe, die speziell für Ihr Unternehmen oder Ihre Produkte geschaffen wurden

Eingabeformat

Geben Sie die Begriffe als kommagetrennte Liste ein:
  • Versicherungsbranche: Schadensmeldung, Deckungssumme, Haftpflicht, Kaskoversicherung, Selbstbeteiligung, Policennummer
  • Medizinbereich: Ibuprofen, Metformin, Pantoprazol, Blutdruckmessgerät, HbA1c-Wert
  • IT-Dienstleister: Kubernetes, Terraform, GitLab, On-Premise, Firewall-Regel, VPN-Tunnel
  • Immobilien: Grundbuchauszug, Nebenkostenabrechnung, Mietkaution, Energieausweis, Wohnflächenberechnung
  • Firmennamen und Produkte: TarifPlus, SmartConnect, FlexiCare, MediCheck, ProfiPlan

Best Practices

  • Fügen Sie nur Begriffe hinzu, die von der Spracherkennung tatsächlich falsch erkannt werden oder bei denen Sie eine Fehlererkennung erwarten.
  • Verwenden Sie die korrekte Schreibweise - die Spracherkennung nutzt diese als Referenz für die Textausgabe.
  • Vermeiden Sie ganze Sätze - Spezialbegriffe sollten einzelne Wörter oder kurze Ausdrücke (max. 2–3 Wörter) sein.
  • Testen Sie nach dem Hinzufügen, ob die Erkennung sich verbessert hat.

Hintergrundkontext

Der Hintergrundkontext gibt der Spracherkennung zusätzliche Informationen darüber, worum es in den Gesprächen geht. Im Gegensatz zu Spezialbegriffen, die einzelne Wörter betreffen, liefert der Hintergrundkontext eine thematische Orientierung - ähnlich wie wenn Sie einem Zuhörer vorab erklären, worüber gleich gesprochen wird.

Wann sollten Sie Hintergrundkontext verwenden?

  • Wenn Gespräche ein bestimmtes Fachgebiet betreffen (z. B. Versicherung, Medizin, Technik)
  • Wenn typische Gesprächsverläufe vorhersehbar sind
  • Wenn es häufig wiederkehrende Themen gibt, die der Spracherkennung helfen können, zweideutige Wörter korrekt zu interpretieren

Was sollte der Hintergrundkontext enthalten?

  • Beschreibung des Einsatzbereichs: Was ist die Aufgabe des Voice Agents?
  • Typische Gesprächsthemen: Worüber sprechen Anrufer in der Regel?
  • Branchenspezifische Informationen: Welche Fachgebiete oder Produkte sind relevant?

Beispiele

Best Practices

  • Schreiben Sie den Kontext in natürlicher Sprache - als würden Sie jemandem den typischen Gesprächsinhalt erklären.
  • Halten Sie den Text prägnant und relevant - nur Informationen, die der Spracherkennung tatsächlich helfen.
  • Erwähnen Sie typische Formate (z. B. Ticketnummern, Vorgangsnummern), die Anrufer häufig nennen.
  • Aktualisieren Sie den Kontext, wenn sich der Einsatzbereich Ihres Voice Agents ändert.
Wichtig: Der Hintergrundkontext dient ausschließlich der Spracherkennung (STT). Er beeinflusst nicht das Verhalten oder die Antworten des KI-Sprachmodells (LLM). Um das Verhalten des Agents zu steuern, verwenden Sie die KI Anweisungen / Prompts.

Hintergrund-Audio

Mit Hintergrund-Audio können Sie dem Voice Agent ein dezentes Umgebungsgeräusch hinterlegen, das während des gesamten Gesprächs im Hintergrund abgespielt wird. Dies vermittelt dem Anrufer den Eindruck, mit einer echten Person in einer realen Umgebung zu sprechen.

Verfügbare Sounds

Die Lautstärke des Hintergrund-Audios kann über einen Regler stufenlos angepasst werden.

Tool-Ausführungssound

Der Tool-Ausführungssound wird abgespielt, während der Voice Agent einen Werkzeugaufruf (Tool) ausführt - z. B. eine API-Abfrage, das Senden einer SMS oder eine Terminbuchung. Während dieser Zeit wartet der Agent auf die Antwort des externen Systems, und der Anrufer hört ohne diesen Sound nur Stille. Der Sound signalisiert dem Anrufer, dass der Agent aktiv arbeitet, und überbrückt die Wartezeit.

Verfügbare Sounds

  • Off - Kein Sound während der Tool-Ausführung (Standard)
  • Keyboard Typing - Tastaturgeräusch, vermittelt den Eindruck, dass der Agent Daten eingibt oder nachschlägt
  • Keyboard Typing 2 - Alternative Variante des Tastaturgeräuschs

Beispiel

Anrufer: „Können Sie mir sagen, ob mein Vertrag noch aktiv ist?“Agent: „Einen Moment bitte, ich prüfe Ihre Daten…“Während der Agent die API abfragt, hört der Anrufer ein Tastaturgeräusch im Hintergrund.Agent: „Ihr Vertrag mit der Nummer V-2024-00815 ist aktiv und läuft bis zum 31.12.2025.“
Hinweis: Der Tool-Ausführungssound wird nur während aktiver Werkzeugaufrufe abgespielt und stoppt automatisch, sobald das Ergebnis vorliegt. Er ersetzt nicht das Hintergrund-Audio, sondern ergänzt es.