Your AI Voice Sounds WRONG! Here's Why
Mit der richtigen Textvorverarbeitung (Cleaning/Normalisierung) lässt sich die Sprachausgabe jeder Text-to-Speech-Engine von robotisch zu natürlich klingend verbessern. Mein YouTube-Tutorial zeigt Schritt für Schritt, wie man Zahlen, Abkürzungen und Sonderzeichen behandelt, um die TTS-Qualität deutlich zu steigern. Das funktioniert für JEDE TTS — nicht nur für ausgefallene KI-basierte Modelle, sondern auch für eSpeak/mbrola.
Warum Text-Cleaning wichtig ist: Bestimmte Elemente können unnatürliche Sprachmuster verursachen:
- Abkürzungen wie „Dr.” oder „Mr.” werden als Satzenden interpretiert
- Zahlen werden Ziffer für Ziffer statt natürlich vorgelesen
- Sonderzeichen und Symbole können unerwartete Pausen verursachen
- Zeit- und Datumsformate werden mitunter falsch interpretiert
Den passenden Python-Cleaning-Script gibt es in meinem Thorsten-Voice-GitHub-Repository. Zusätzlich zeigt ein Jupyter-Notebook auf Google Colab, wie eine komplette Voice-Processing-Pipeline mit NVIDIA NeMo (Text-Cleaning) und Piper (TTS) aussehen kann.
Fragen oder Bugs? Gerne als Kommentar unter dem Video oder als Issue auf GitHub.