#
Konfiguration im aiStudio
Die Phonebot-Konfiguration erreichen Sie im aiStudio unter Konfiguration > Telefonbot-Konfiguration. Die Einstellungen sind auf zwei Tabs aufgeteilt: Sprachausgabe und Spracheingabe.
#
Sprachausgabe
Der Tab Sprachausgabe steuert, wie der Bot mit Anrufenden spricht.
#
Text-to-Speech
TTS-Provider: Wählen Sie die Text-to-Speech-Engine aus, die für die Generierung der Sprachantworten verwendet wird. Aktuell stehen Azure AI Speech und ElevenLabs zur Verfügung.
Stimme: Geben Sie den Namen oder die ID der gewünschten Stimme des ausgewählten TTS-Providers ein. Beispiel: de-DE-SeraphinaMultilingualNeural.
Sprechgeschwindigkeit: Passen Sie die Geschwindigkeit der Sprachausgabe über den Schieberegler an. Der Wert 1 entspricht der Standardgeschwindigkeit. Der Regler bewegt sich zwischen 0.5 (langsamer) und 2 (schneller).
#
Ausspracheregeln
Definieren Sie Ausspracheregeln, die auf jede generierte Sprachantwort angewendet werden. Dies ist nützlich für Produktnamen, Abkürzungen oder Begriffe, die eine andere Sprache als die umgebende Textsprache erfordern.
Die Tabelle zeigt alle vorhandenen Regeln mit Begriff und zugewiesener Sprache. Über die Icons am Ende jeder Zeile können Sie einen Eintrag bearbeiten oder löschen.
Klicken Sie auf + Ausspracherregel hinzufügen, um einen neuen Begriff mit der zugehörigen Aussprachesprache zu hinterlegen.
#
Spracheingabe
Der Tab Spracheingabe steuert, wie der Bot die gesprochene Eingabe der Anrufenden versteht.
#
Speech-to-Text
Benutzerdefinierte Terminologie: Hinterlegen Sie hier domänenspezifische Begriffe, die die Speech-to-Text-Engine (STT) zuverlässig erkennen soll – z. B. Produktnamen, Fachbegriffe oder Eigennamen.
Geben Sie einen oder mehrere durch Komma getrennte Begriffe in das Eingabefeld ein und klicken Sie auf Hinzufügen. Es können bis zu 100 Einträge mit jeweils bis zu 200 Zeichen hinterlegt werden. Der aktuelle Zähler (z. B. 0 / 100) zeigt an, wie viele Einträge bereits vorhanden sind.
#
Basisantworten im Themenkatalog
Im Themenkatalog stehen zwei phonebot-spezifische Basisantworten zur Verfügung, die Sie anpassen können:
- Noch da? – Diese Antwort wird ausgespielt, wenn der Bot keine Reaktion der anrufenden Person erkennt und nachfragt, ob die Verbindung noch besteht. Standardtext: "Sind Sie noch da?"
- Verabschiedung – Diese Antwort wird ausgespielt, wenn seitens der anrufenden Person keine Reaktion erfolgt und der Bot die Verbindung trennt. Standardtext: "Ich beende nun das Gespräch. Einen schönen Tag noch!"
Passen Sie die Texte beider Basisantworten an den Ton Ihres Bots an.
#
Agenten & Prompt-Konfiguration
Da der Phonebot vollständig im aiStudio konfiguriert wird, gelten folgende Empfehlungen:
- Anzahl der Agenten minimieren: Beschränken Sie sich möglichst auf einen einzigen Agenten, um die Latenz gering zu halten. Wenn keine Wissensdatenbank (RAG) zwingend erforderlich ist, verwenden Sie einen Custom Agent – dieser überspringt den Retrieval-Schritt und reduziert die Latenz weiter.
- Leichtgewichtige Modelle verwenden: Wählen Sie ausschließlich schlanke Sprachmodelle, um niedrige Latenz und angemessene Kosten sicherzustellen. Empfohlene Modelle sind z. B. GPT 4.1 mini, DeepSeek V3 Flash oder Gemini 2.5 Flash.
- Kurze Antworten: Der Bot wird im Systemprompt angewiesen, kurze und prägnante Antworten zu geben. Lange Sprachantworten erhöhen die wahrgenommene Wartezeit und verschlechtern die Gesprächsqualität am Telefon.
- Gesprächsende steuern: Nach der Verabschiedung durch den Bot wird das Gespräch automatisch beendet. Da die Dauer der Sprachausgabe geschätzt wird, kann es nach der Verabschiedung noch einige Sekunden dauern, bis die Verbindung getrennt wird. Dies verhindert, dass der Bot vorzeitig unterbrochen wird.
Das automatische Auflegen lässt sich gezielt über das Markup
[END_CALL]im Prompt steuern. Platzieren Sie dieses Markup an der Stelle im Prompt, an der der Bot das Gespräch beenden soll.