- Natürlich klingen. Text, der geschrieben gut aussieht, klingt vorgelesen schnell steif und roboterhaft. Die Anweisung muss aktiv gegen die Neigung des Sprachmodells zu perfekter Schriftsprache arbeiten.
- Zuverlässig funktionieren. Der Agent muss Tools korrekt aufrufen, Regeln einhalten, an Menschen übergeben und mit Fehlern umgehen - live am Telefon, ohne Benutzeroberfläche als Rückfallebene.
Empfohlene Struktur
Gliedern Sie Ihre Anweisung in benannte Abschnitte mit Markdown-Überschriften. Das verhindert, dass sich Regeln aus verschiedenen Kontexten vermischen, und Sprachmodelle beachten bestimmte Überschriften - insbesondere# Guardrails - besonders zuverlässig.
Die bewährte Reihenfolge:
# Tools und # Error handling weglassen. Die Reihenfolge sollte aber erhalten bleiben: Persona vor Verhalten, Verhalten vor Regeln, Regeln vor Tool-Nutzung.
# Personality
Definiert, wer der Agent ist. Beschreiben Sie die Persönlichkeit als hörbares Verhalten, nicht als Adjektive - “freundlich und hilfsbereit” ist ohnehin der Standardmodus jedes Sprachmodells und ändert nichts.# Environment
Sagt dem Agenten, wo er sich befindet und was er über die Anrufer annehmen kann. Ein kurzer, aber wirkungsvoller Abschnitt: Ein frustrierter Anrufer braucht einen anderen Einstieg als ein neugieriger Interessent.# Tone
Legt Antwortlänge, Tempo und Sprechstil fest. Jede Voice-Anweisung sollte eine konkrete Ziellänge enthalten - das ist einer der wirksamsten einzelnen Sätze im ganzen Prompt.# Goal
Nummerierte Schritte, die der Agent abarbeiten soll. Für transaktionale Agenten (Terminbuchung, Bestellauskunft) ist dies der wichtigste Abschnitt: Er verwandelt vage Erwartungen in einen eindeutigen Ablauf.# Guardrails
Nicht verhandelbare Regeln. Formulieren Sie Guardrails als “Niemals”-Sätze und sammeln Sie sie zentral hier, statt sie über die Anweisung zu verstreuen.# Tools
Ein Unterabschnitt pro Tool mit drei Blöcken: wann es genutzt wird, wie es genutzt wird und was bei Fehlern passiert. Details dazu im Abschnitt Tools in der Anweisung.# Error handling
Übergreifende Regeln für den Fall, dass ein Tool fehlschlägt oder unerwartete Daten liefert.Tipps & Tricks
Zeigen statt beschreiben
Vage Stil-Anweisungen (“sei locker”, “klinge natürlich”) bewirken fast nichts. Das Wirksamste, was Sie tun können: konkrete Beispiel-Äußerungen in die Anweisung schreiben - jeweils als Paar aus der roboterhaften Standardversion und der gewünschten natürlichen Version.Wichtige Regeln doppelt verankern
Sprachmodelle gewichten den jüngsten Gesprächsverlauf stärker als weit zurückliegende Anweisungen. Ihre 1–2 wichtigsten Regeln gehören deshalb an zwei Stellen: einmal in# Guardrails, einmal in dem Abschnitt, in dem sie konkret greifen (z. B. beim jeweiligen Tool). Hängen Sie an wirklich kritische Sätze den Zusatz “Das ist wichtig.” an - sparsam eingesetzt, wirkt das zuverlässig.
Die eine Regel, die in jede Anweisung mit Tools gehört, gleich doppelt:
Wenn du etwas nicht weißt oder ein Tool fehlschlägt, sage das offen. Erfinde niemals Informationen. Das ist wichtig.Der Instinkt des Modells, “hilfreich” zu sein, erzeugt sonst erfundene Terminbestätigungen, Preise oder Bestellstatus - die teuersten Fehler im Live-Betrieb.
Sie oder Du - festlegen und durchziehen
Schlank halten
Jede Zeile muss ihren Platz verdienen. Lange Anweisungen verlangsamen die Antwortzeit - und am Telefon ist jede Verzögerung direkt spürbar.Nicht motivieren, sondern anweisen
“Gib dir Mühe, besonders freundlich zu sein!” verschwendet Tokens. Schreiben Sie, was der Agent tun soll. Und setzen Sie GROSSBUCHSTABEN und “NIEMALS” sparsam ein - wenn alles betont ist, ist nichts mehr betont.Nuancen: Sprache am Telefon
Anrufer sprechen ihre Angaben - das Modell muss sie in Schriftform umwandeln, bevor es sie an ein Tool übergibt. Hier passieren im Live-Betrieb die meisten Fehler. Schreiben Sie die Umwandlungsregeln direkt in die Anweisung bzw. in die Tool-Beschreibung.Uhrzeiten: die “halb drei”-Falle
Der häufigste Zuverlässigkeitsfehler bei deutschen Voice Agents: “halb drei” bedeutet 14:30, nicht 15:30. Verlassen Sie sich nicht darauf, dass das Modell das richtig macht - schreiben Sie die Regel mit Beispielen in die Anweisung:Datum, Telefonnummern, Zahlen
- Datum: Format ist TT.MM.JJJJ - “der dritte Mai” wird zu
03.05., nicht05/03. Relative Angaben wie “übermorgen” kann der Agent nur auflösen, wenn er das aktuelle Datum kennt - nutzen Sie dafür die Datum-Variablen. - Telefonnummern: Deutsche Anrufer diktieren oft in Zweiergruppen (“dreißig vierundsiebzig” = 30 74). Regel in die Anweisung: Ziffernpaare auflösen, Trennzeichen entfernen, führende 0 bei Bedarf durch +49 ersetzen.
- Zahlen: Dezimaltrennzeichen ist das Komma (
1,50 €), Tausendertrennzeichen der Punkt (1.500). “Einundzwanzig” ist 21 - das Modell muss die Reihenfolge drehen.
E-Mail-Adressen am Telefon vermeiden
Falls es doch sein muss: Anrufer sagen “ät” oder “Klammeraffe” für@, “Punkt” für ., “Bindestrich” für - und buchstabieren nach dem Muster “M wie Martha”. Schreiben Sie diese Umwandlung in die Tool-Beschreibung - und lassen Sie den Agenten die Adresse zur Bestätigung zurücklesen.
Im Zweifel: zurücklesen
Die wirksamste einzelne Zeile für jeden Agenten, der Buchungen oder Daten verarbeitet:ElevenLabs v3 Prompting
Nutzt Ihr Agent eine ElevenLabs-v3-Stimme, gelten für die Sprachausgabe ein paar zusätzliche Regeln. v3 versteht Audio-Tags in eckigen Klammern als Regieanweisungen für die Sprechweise und reagiert deutlich stärker auf Satzzeichen als ältere Stimmen. Beides lässt sich in der Anweisung gezielt nutzen - und beides kann einen Agenten schnell übertrieben klingen lassen. Dieser Abschnitt beschreibt, was in die Anweisung gehört, damit die Sprachausgabe natürlich bleibt und die Zuverlässigkeit nicht leidet.Audio-Tags wirken nur im Konversationstyp Standard Conversation (STT → LLM → TTS), in dem die Antworten des Sprachmodells als Text an die Sprachausgabe übergeben werden. Stimme und Stimm-Einstellungen wählen Sie in den Sprach- und Audioeinstellungen des Agenten.
Audio-Tags
Audio-Tags sind Wörter in eckigen Klammern, die v3 nicht vorliest, sondern als Anweisung für die Sprechweise interpretiert - etwa[whispering], [sighs], [laughs], [pauses] oder [rushed]. Sie steuern, wie etwas gesagt wird, nicht was gesagt wird.
Im Voice Agent schreibt das Sprachmodell die Tags selbst in seine Antworten. Die Anweisung legt deshalb fest, welche Tags der Agent verwenden darf, wie oft und wann. Ohne diese Vorgabe nutzt das Modell entweder gar keine Tags oder setzt sie unkontrolliert ein.
Zwei Grundregeln:
- Nur hörbare Sprechweise. Ein Tag beschreibt etwas, das man am Telefon hören kann: Tempo, Lautstärke, Tonfall, eine Pause, ein Seufzen. Tags für Sichtbares wie
[standing]oder[grinning]haben kein hörbares Gegenstück, und Soundeffekte wie[music]oder[applause]gehören nicht in ein Kundengespräch. - Tags verändern niemals die Aussage. Ein Tag darf keinen Inhalt hinzufügen, nichts erfinden und keine Regel aus
# Guardrailsaufweichen. Und er darf niemals in einem Tool-Parameter landen - ein[pauses]im Namensfeld einer Terminbuchung ist ein Datenfehler.
Pausen
Pausen entstehen in v3 über den Text selbst:
Für die meisten Kundengespräche reichen Satzzeichen völlig aus.
[pauses] ist die Ausnahme für Momente, in denen die Pause selbst eine Aussage ist - etwa bevor der Agent eine schlechte Nachricht überbringt.
Sparsam einsetzen
Ein Tag pro Antwort ist viel, die meisten Antworten brauchen gar keins. Und ein Tag muss zur gewählten Stimme und zur Situation passen: Eine ruhige Support-Stimme soll nicht[shouting] rufen oder [laughs harder] lachen, und eine seriöse, professionelle Stimme reagiert auf spielerische Tags oft unnatürlich. Die Stimme muss der gewünschten Sprechweise ohnehin ähnlich sein - ein Tag verstärkt, was in der Stimme angelegt ist, es erschafft es nicht.
Für Kundenservice-Agenten hat sich eine kurze Erlaubt-Liste bewährt: drei bis vier zurückhaltende Tags, die explizit genannt werden - alles andere ist tabu. Verwenden Sie die englischen Tag-Namen aus der ElevenLabs-Dokumentation, auch in deutschen Anweisungen; das passt zur Konvention “englische Überschriften, deutscher Inhalt”.
Satzzeichen und Großschreibung
v3 liest Satzzeichen als Sprechanweisung: Auslassungspunkte verlangsamen und verleihen Gewicht, GROSSBUCHSTABEN werden betont, normale Satzzeichen geben den Rhythmus vor. Die Folge für die Anweisung: Das Modell übernimmt die Beispiel-Äußerungen aus dem Prompt (die “Statt/Besser”-Paare) - inklusive ihrer Satzzeichen. Schreiben Sie sie so, wie sie klingen sollen. Verlassen Sie sich bei keinem dieser Effekte auf Annahmen. Wie stark eine Stimme auf ein Tag oder ein Satzzeichen reagiert, unterscheidet sich von Stimme zu Stimme - testen Sie jede Formulierung mit der tatsächlich gewählten Stimme.Beispiele
Ein# Tone-Abschnitt, der Audio-Tags kontrolliert freigibt:
# Guardrails gehört:
Tools in der Anweisung
Tools (Terminbuchung, SMS, E-Mail, API-Anfragen, n8n) werden in der Sidebar angelegt und im Voice Wizard pro Agent aktiviert. Die Bedingung am Tool steuert, wann es grundsätzlich verfügbar ist - die Anweisung beschreibt, wie es sich in den Gesprächsablauf einfügt. Beschreiben Sie jedes Tool in der Anweisung mit drei Blöcken:Empfohlener Ablauf für die Terminbuchung
Soll Ihr Agent Termine entgegennehmen, empfehlen wir diesen Gesprächsverlauf als Leitfaden im# Goal-Abschnitt:
1
Wunschtermin klären
Fragen Sie zuerst nach dem gewünschten Termin. Ist dieser nicht verfügbar, schlägt der Agent direkt passende Ausweichtermine vor, statt den Anrufer mehrfach nachhaken zu lassen.
2
Name erfassen
Vor- und Nachname des Anrufers erfassen. Bei seltenen Namen die Schreibweise kurz zurückbestätigen.
3
Termin buchen
Der Agent legt den Termin an und wiederholt die wichtigsten Eckdaten zur Bestätigung.
4
Optional: Bestätigung per SMS
Kombinieren Sie den Ablauf mit dem SMS-Tool und senden Sie dem Anrufer eine Bestätigung. Klären Sie vorab, ob die anrufende Rufnummer verwendet werden darf, oder erfassen Sie alternativ eine Mobilnummer. Schlägt die Buchung im Backend fehl, kann ersatzweise eine SMS mit einem Buchungslink versendet werden.
Variablen in der Anweisung
Variablen sind Platzhalter, die zur Laufzeit durch dynamische Werte ersetzt werden. Sie werden in doppelte Prozentzeichen eingeschlossen:%%...%%. Der Prompt-Editor bietet eine Autovervollständigung an - tippen Sie einfach %%.
Anrufdaten
Diese Variablen werden aus dem laufenden Anruf befüllt und stehen nur in der KI-Anweisung zur Verfügung (nicht im System-Prompt):Datum & Zeit
Die Datum- und Zeit-Variablen stehen in der KI-Anweisung und im System-Prompt zur Verfügung. Sie erfordern die JSON-Schreibweise - ein bloßes%%datetime%% führt zu einem Fehler:
Parameter:
variable:datetime,date,timeoderday_of_weektimezone: IANA-Zeitzone (z. B.Europe/Berlin,UTC) - Standard:Europe/Berlinlanguage:deoderen- Standard:de
Anwendungsfall: Weiterleitung nur während der Geschäftszeiten
Anwendungsfall: Weiterleitung nur während der Geschäftszeiten
Aufgelöste Variablen beim Testen überprüfen
Aufgelöste Variablen beim Testen überprüfen
Beim Testen Ihrer Anweisung können Sie die tatsächlich eingesetzten Werte an zwei Stellen einsehen:
- Browser-Test: Die aufgelöste Anweisung wird beim Wechsel zum Prompt bzw. zu Beginn der Unterhaltung angezeigt.
- Conversations-Ansicht: Klicken Sie auf “Details” und prüfen Sie die
tec_outputsin der Debug-Ansicht.
Zusätzlich können Sie in der Nachbearbeitung eigene Variablen definieren, die nach dem Anruf aus dem Gespräch extrahiert und in E-Mail-, SMS- und API-Aufgaben verwendet werden (z. B.
%%kunden_email%%). Diese stehen nicht in der KI-Anweisung zur Verfügung.Beispiel-Prompts
Zwei vollständige Anweisungen, die die Struktur und die Tipps aus diesem Guide anwenden. Beide sprechen Anrufer mit Sie an - passen Sie das an Ihre Marke an.Beispiel 1: Terminbuchung Autowerkstatt (mit Tools)
Beispiel 1: Terminbuchung Autowerkstatt (mit Tools)
Beispiel 2: FAQ und Weiterleitung Elektronikgeschäft (ohne Buchung)
Beispiel 2: FAQ und Weiterleitung Elektronikgeschäft (ohne Buchung)
Checkliste
Gehen Sie diese Punkte durch, bevor Sie eine Anweisung live schalten:- Gibt es einen
# Personality-Abschnitt mit hörbarem Verhalten statt Adjektiven? - Legt
# Toneeine konkrete Antwortlänge fest (z. B. “1–2 Sätze”)? - Enthält
# Goalnummerierte, eindeutige Schritte? - Gibt es 4–8 Beispiel-Paare (“Statt … / Besser …”) für natürliche Formulierungen?
- Ist Sie/Du festgelegt und in jedem Beispiel konsistent?
- Hat jedes Tool eine Wann/Wie/Bei-Fehlern-Beschreibung?
- Ist die Umwandlung gesprochener Angaben geregelt (Uhrzeiten inkl. “halb drei”, Datum, Telefonnummern)?
- Steht die “Erfinde nichts”-Regel an mindestens zwei Stellen?
- Ist die Anweisung schlank?
- Im Browser-Test geprüft, inklusive der aufgelösten Variablen?
- Bei einer ElevenLabs-v3-Stimme: Erlaubt-Liste für Audio-Tags festgelegt und mit der gewählten Stimme getestet?
Häufige Fehler
- Adjektive statt Verhalten. “Sei freundlich und professionell” ändert nichts - beschreiben Sie, was man hören soll.
- Alles betonen. Wenn jede zweite Zeile “NIEMALS” enthält, verliert die Betonung ihre Wirkung. Reservieren Sie sie für die 1–2 wirklich kritischen Regeln.
- Regeln nur einmal nennen. Kritische Regeln gehören an zwei Stellen - sonst gehen sie in langen Gesprächen verloren.
- Tools ohne Anleitung. Ein Tool ohne Wann/Wie/Bei-Fehlern-Beschreibung führt zu improvisierten, unzuverlässigen Aufrufen.
- Ein Mega-Prompt für alles. Drei und mehr verschiedene Abläufe in einer Anweisung machen den Agenten langsam und fehleranfällig.
- Nur lesen, nie anrufen. Eine Anweisung, die gut aussieht, kann schlecht klingen. Testen Sie am Telefon und passen Sie iterativ an - eine Änderung pro Durchlauf.