Abstimmung & Feintuning
Sprechtempo, Kreativität, Zeitlimits, Aussprache, Aufzeichnung und Hintergrundgeräusche.
Der Bereich Abstimmung enthält die Stellschrauben, an denen du drehst, wenn der Agent inhaltlich schon richtig arbeitet, sich aber noch nicht richtig anfühlt. Vier Seiten, jede mit einem klaren Zweck.
Parameter
Geschwindigkeit
Das Sprechtempo der Stimme. Der Bereich reicht von langsam bis schnell, 1.00 ist das Normaltempo der jeweiligen Stimme.
Werte leicht über 1.00 wirken bei den meisten deutschen Stimmen wacher und weniger behäbig. Ab etwa 1.25 klingt es gehetzt, und Zahlen, Namen und Adressen werden für den Anrufer schwer mitzuschreiben.
Temperatur
Wie festgelegt oder wie frei das Sprachmodell antwortet.
| Bereich | Verhalten | Wofür |
|---|---|---|
| niedrig | Antworten bleiben eng am Prompt und wiederholen sich in ähnlichen Situationen | Terminbuchung, Datenaufnahme, alles mit festem Ablauf |
| mittel | Guter Kompromiss aus Verlässlichkeit und natürlicher Formulierung | Der übliche Startpunkt |
| hoch | Freiere, abwechslungsreichere Formulierungen, aber weniger vorhersehbar | Beratung, offene Gespräche |
Erst der Prompt, dann die Temperatur
Wenn der Agent inhaltlich falsch antwortet, ist fast nie die Temperatur schuld. Halte dich zuerst an den Prompt und stelle die Temperatur erst ein, wenn die Inhalte stimmen.
Max. Anrufdauer
Nach dieser Zeit beendet die Plattform das Gespräch automatisch. Das ist eine Kostenbremse gegen Anrufe, die sich totlaufen, etwa wenn niemand mehr am anderen Ende ist.
Max. Wartezeit
Wie lange der Agent Stille erträgt, bevor er nachfragt oder auflegt. Zu kurz eingestellt fällt er Anrufern ins Wort, die nur kurz überlegen. Zu lang eingestellt entstehen unangenehme Pausen.
Spracherkennung
Hier bringst du dem Agenten deine Wörter bei. Zwei getrennte Werkzeuge, die oft verwechselt werden:

| Werkzeug | Richtung | Wirkung |
|---|---|---|
| Aussprache-Wörterbuch | Ausgabe | Wie der Agent ein Wort ausspricht |
| STT-Schlüsselbegriffe | Eingabe | Wie zuverlässig der Agent ein Wort versteht |
Aussprache-Wörterbuch
Jeder Eintrag ordnet einem geschriebenen Begriff eine eigene Aussprache zu, wahlweise als klingt-wie-Schreibweise oder als IPA-Phoneme zwischen doppelten spitzen Klammern:
Chaiselongue → Schäslong
Voltaris → <<v|ɔ|ɹ|ˈ|t|ɛ|s|ə>>Pro Eintrag legst du fest, für welche Sprache er gilt, oder wählst Alle Sprachen.
Typische Kandidaten sind Markennamen, Produktbezeichnungen, Fremdwörter und Eigennamen, also genau die Wörter, bei denen eine falsche Aussprache sofort unprofessionell klingt.
STT-Schlüsselbegriffe
Schlüsselbegriffe geben der Spracherkennung einen Vorsprung bei Wörtern, die sie zuverlässig treffen muss. Jeder Begriff wird genau so transkribiert, wie du ihn schreibst.
Die Plattform zeigt dir laufend die Auslastung an, sowohl die Zahl der Begriffe als auch den daraus entstehenden Token-Verbrauch. Beide Grenzen gelten gleichzeitig, lange Begriffe verbrauchen also mehr Budget als kurze.
Nur, was wirklich schwierig ist
Häufige Vornamen und Bestätigungen sind bereits in einer eingebauten Basis abgedeckt. Nutze das Budget für das, was deine Branche ausmacht, also Produktnamen, Fachbegriffe und Ortsnamen.
Aufzeichnung
Steuert, ob Gespräche mitgeschnitten werden.

| Einstellung | Bedeutung |
|---|---|
| Audio aufzeichnen | Alle Anrufe dieses Agenten werden aufgezeichnet und gespeichert |
| Automatische Löschung | Aufzeichnungen werden nach einer festgelegten Frist automatisch gelöscht |
| Aufzeichnungshinweis | Text, mit dem der Agent die Einwilligung einholt |
Einwilligung einholen
Sobald ein Aufzeichnungshinweis gespeichert ist, spricht der Agent ihn und beginnt die Aufzeichnung erst nach der Zustimmung des Anrufers. Ohne gespeicherten Hinweis holt er keine Einwilligung ein.
Wo der Hinweis im Gespräch fällt, steuerst du über den Platzhalter {{recordingDisclaimer}} in der Startnachricht. Ohne Platzhalter hängt die Plattform den Hinweis automatisch an die Begrüßung an.
Die Formulierung liegt bei dir
Die Plattform spricht den Hinweis und startet die Aufzeichnung erst nach der Zustimmung. Ob dein Text eine wirksame Einwilligung einholt, hängt vom Anwendungsfall ab und bleibt in deiner Verantwortung. In Deutschland ist die Aufzeichnung eines Telefonats ohne Einwilligung aller Beteiligten unzulässig.
Hintergrundgeräusche
Zwei unabhängige Spuren, die Gespräche weniger steril wirken lassen.

| Spur | Wann sie läuft |
|---|---|
| Umgebungsgeräusche | Durchgehend im Hintergrund, etwa eine Büroatmosphäre |
| Denkgeräusche | Nur während der Agent eine Antwort verarbeitet, etwa Tastaturtippen |
Beide haben eine eigene Lautstärke. Denkgeräusche überbrücken hörbar die Verarbeitungszeit und nehmen der Pause das Künstliche.
Leise dosieren
Hintergrundgeräusche sollen unbewusst wirken. Sobald ein Anrufer sie bewusst wahrnimmt, sind sie zu laut. Prüfe die Einstellung immer über einen echten Telefonanruf, nicht über den Browser-Test, denn die Telefonleitung klingt anders.