← Zurück zu allen Neuigkeiten
9. Januar 2025

Your AI Voice Sounds WRONG! Here's Why

Mit der richtigen Textvorverarbeitung (Cleaning/Normalisierung) lässt sich die Sprachausgabe jeder Text-to-Speech-Engine von robotisch zu natürlich klingend verbessern. Mein YouTube-Tutorial zeigt Schritt für Schritt, wie man Zahlen, Abkürzungen und Sonderzeichen behandelt, um die TTS-Qualität deutlich zu steigern. Das funktioniert für JEDE TTS — nicht nur für ausgefallene KI-basierte Modelle, sondern auch für eSpeak/mbrola.

Warum Text-Cleaning wichtig ist: Bestimmte Elemente können unnatürliche Sprachmuster verursachen:

  • Abkürzungen wie „Dr.” oder „Mr.” werden als Satzenden interpretiert
  • Zahlen werden Ziffer für Ziffer statt natürlich vorgelesen
  • Sonderzeichen und Symbole können unerwartete Pausen verursachen
  • Zeit- und Datumsformate werden mitunter falsch interpretiert

Den passenden Python-Cleaning-Script gibt es in meinem Thorsten-Voice-GitHub-Repository. Zusätzlich zeigt ein Jupyter-Notebook auf Google Colab, wie eine komplette Voice-Processing-Pipeline mit NVIDIA NeMo (Text-Cleaning) und Piper (TTS) aussehen kann.

Fragen oder Bugs? Gerne als Kommentar unter dem Video oder als Issue auf GitHub.

YouTube-Tutorial ansehen