Hallo,
ich benutze TTS schon länger, bisher mit Piper. Ich wollte aber auch auf dem Desktop bessere Qualität haben. Inzwischen gibt es ja jede Menge Sprachmodelle. Ich hab also angefangen mich in das Thema etwas einzulesen und bin auf Crane gestoßen. Eine auf Rust basierenden Inference Engine. Schnell und einfach zu bauen und laufen zu lassen.
Ich hab also Crane genommen und ein neues Projekt gestartet: crane-wyoming. Das verbindet Crane mit dem Wyoming Protokoll mit Home Assistant.
Ich hab auch ein Speech Dispatcher Modul, damit man in Firefox das Read Aloud Feature unter Linux nutzen kann.
Ich hab jetzt die HA App fertig zum testen und suche Tester.
Ich hab derzeit leider nur TTS Modelle im Angebot die eigentlich eine GPU voraussetzen. Auf einer CPU sind die Berechnungen einfach wahnsinnig langsam. Es gibt aber einen TTS Cache, wenn die Sprache gleich bleibt kommt es aus dem Cache und ist schneller. Als nächstes schaue ich mir Kokoro an. Der Plan ist das in Crane zu unterstützen.