--- title: "Fibu mit F oder V? Warum Voicebots anders denken müssen" description: "Voicebots in Echtzeit: Optimierung von Spracherkennung und Dialogführung für effiziente B2B-Kundengespräche bei DATEV." canonical_url: "https://www.shiftcx.de/mediathek/asset/fibu-mit-f-oder-v-warum-voicebots-anders-denken-muessen.html" published: "2025-04-23" updated: "2026-02-17" language: "de" content_type: "VideoObject" publisher: "" --- # Fibu mit F oder V? Warum Voicebots anders denken müssen **Aufgezeichnet am:** 01.10.2025 **Dauer:** 45 Min. ## Sprecher - [Markus A. Wolf](/experten/markus-a-wolf.html) — Cognigy AI Implementation Lead, Agentic AI & User Exerience, DATEV Voicebots in Echtzeit: Optimierung von Spracherkennung und Dialogführung für effiziente B2B-Kundengespräche bei DATEV. Markus A. Wolf von DATEV beleuchtet die Optimierung von Voicebots für Echtzeit-Kundendialoge in B2B-Umgebungen. Der Praxisbericht bietet einen tiefen Einblick in die spezifischen Herausforderungen und Lösungsansätze bei der Implementierung von Voicebots, die hohe Datenqualität und natürliche Dialoge ermöglichen. Im Fokus stehen die Anforderungen an Spracherkennung und Nutzererwartungen sowie die kontinuierliche Optimierung von Sprachassistenzsystemen. Die Besonderheit liegt in der Kombination technischer und psychologischer Faktoren, die den Umgang mit Kundenanfragen prägen. Wolf hebt hervor, dass Voicebots in Echtzeit reagieren müssen, da Verzögerungen die Nutzererfahrung beeinträchtigen. DATEV nutzt LLMs, um verschiedene Aussprachen und Formate zu interpretieren, und setzt auf Agentensysteme für die Sprachausgabe. Die Optimierung der Sprachmodelle erfolgt durch Anpassung an spezifische Use Cases, um Reaktionszeiten und Output-Qualität zu maximieren. Ein iterativer Entwicklungsprozess mit internen Tests und Live-Betrieb ermöglicht die kontinuierliche Anpassung an sich verändernde Nutzererwartungen. Wolf betont die Bedeutung von Monitoring-Tools zur Verbesserung der Dialogführung und zur Identifikation von Optimierungspotenzialen. ## Kernaussagen - Voicebots müssen in Echtzeit reagieren, da Verzögerungen von mehr als 1,5 Sekunden die Nutzererfahrung erheblich beeinträchtigen. - Hohe Datenqualität bei Spracherkennung reduziert die Notwendigkeit von Rückfragen und verbessert die Effizienz der Dialoge. - Voicebots sollten natürliche Dialoge ermöglichen, indem sie Rückfragen kontextbezogen stellen und auf unklare Antworten flexibel reagieren. - Die Optimierung von Sprachmodellen erfordert die Anpassung an spezifische Use Cases, um Reaktionszeiten und Output-Qualität zu maximieren. - Sprachassistenzsysteme sollten kontinuierlich überwacht und optimiert werden, da sich Sprache und Nutzererwartungen ständig verändern. ## Zitat > Voicebots müssen lernen, menschliche Kommunikation zu verstehen und zu reflektieren, um wirklich effektiv zu sein. – Markus A. Wolf Die Herausforderung bei Voicebots liegt in der Echtzeitkommunikation. Eine Verzögerung von mehr als 1,5 Sekunden kann bereits Zweifel an der Verbindung aufkommen lassen. – Markus A. Wolf Sprachassistenzsysteme sollten nicht nur Antworten liefern, sondern auch den Dialog mit Rückfragen aktiv gestalten, um den Kontext besser zu erfassen. – Markus A. Wolf