Referenzarchitekturen
Architektur für einen Voice-Agent
Speech-to-Text, ein Agent mit Tools und Text-to-Speech in einer Schleife mit geringer Latenz.

Ein Voice-Agent ist eine Pipeline, die in deutlich unter einer Sekunde fertig sein muss. Audio von der Telefonleitung wird an ein Speech-to-Text-Modell gestreamt. Der Agent erhält das Transkript, ruft das LLM und bei Bedarf Tools wie ein Buchungssystem auf. Die Antwort läuft als Stream durch ein Text-to-Speech-Modell zurück zum Anrufer. Der Gesprächskontext liegt im Kurzzeitgedächtnis. Das Diagramm markiert die beiden Streaming-Kanten, an denen die Latenz am meisten zählt.


