Whisper oder Speech to phrase, was nehmen?

Hi.

Ich werde mir selbst nachträglich zu Weihnachten einen M5 Stack Atom Echo schenken, um mal ein wenig mit Voice Assist in HA zu spielen. Um einen voll funktionsfähigen Sprachassistenten zu bekommen, braucht man ja je ein speech to text und ein text to speech Mechanismus. Piper als text to speech ist klar, da gibt es nur den einen. Aber bei speech to text hat man die Auswahl zwischen Whisper und Speech-To-Phrase. Whisper kann mehr, braucht aber (deutlich länger zum Reagieren. S-T-P kann halt nur vorgegebene Sätze verstehen. Allerdings frage ich mich grade, ob das nicht ausreicht, um Aktionen in HA auszuführen. Mein HAOS System (direkt installiert, keine VM oder so was) ist ein Intel N100 mit 16 GB Ram, sollte also auch für Whisper genug Leistung bieten. Ich frage mich aber dennoch, ob Whisper überhaupt nötig ist und ob S-T-P nicht auch auf dem N100 eine fühlbar schnellere Reaktion bringt… Oft genug regt mich Alexa schon auf, wenn sie nicht sofort reagiert. Deswegen bin ich da ein wenig skeptisch, was Whisper betrifft.

Das Ganze soll auf jeden Fall rein lokal ablaufen, da ich irgendwann mal mein Smart Home völlig cloudfrei nutzen will. Klar, für Wetter, Kalender, Müllabfuhr usw. wird auch in Zukunft eine (zu 99% read only) Internet- Verbindung benötigt, aber Befehle erst über das Internet und u.U. mehrere kommerzielle Cloud Lösungen laufen zu lassen, das kommt auf Dauer nicht mehr in Frage. Dann könnte ich ja gleich bei Alexa bzw. Google Home bleiben.

Also, was soll ich nehmen?

Die Kombination mit Piper und Whisper läuft bei mir mit dem Home Assistant Voice sehr gut.
Geräte steuern wie Licht ein und ausschalten egal ob die Nennung der Licht Entität ( Alias) oder den Raum erfolgt keine Sekunde nach absetzen des Sprachbefehls. Das gleiche bei Aktivierung von Szenen oder das Starten von Skripten.

Gruß Osorkon

Welches Sprachmodell hast du denn auf welcher Hardware laufen? Ich hatte das mal auf einem Pi5 mit einem der kleinsten Modelle versucht, aber das Ergebnis war eher ernüchternd, auch was die Erkennung anbelangte. Mit Speech to Phrase funktioniert es bei mir so lala, ist aber auch nicht wirklich der Kracher, zumal damit lediglich eine Sprachsteuerung möglich ist (also: “mach das Licht an” oder “fahr die Jalousien runter” und ähnliches), aber keine komplexeren Aufgabenstellungen.

Bildschirmfoto 2025-12-22 um 10.50.58

Homelab Server (Proxmox) i9-13900H, 20 Cores, 96GB RAM
Home Assistant VM: 6 cores, 4GB RAM
Also ein wenig potenter als ein Pi5.

Gruß Osorkon

OK, damit klappt’s wahrscheinlich deutlich geschmeidiger ;-). Hast du whisper als Addon laufen und die Auswahl des Modells auf “auto”?

So schaut es aus.

Gruß Osorkon

Hi.

Erst mal Danke.

Ich wollte zum Ausprobieren mal mit einem M5Stack Atom Echo anfangen. Den hab ich noch nicht, kommt aber irgendwann nach Weihnachten. So verbrennt man nicht so viel Geld, wenn das gar nicht klappt.

Mehr habe ich eigentlich auch nicht vor. Was anderes (abgesehen von Wettermeldungen und ähnlichem) mache ich auch mit Alexa nicht.

Damit kann mein N100 sicher nicht mithalten. Aber einen Pi5 steckt er trotzdem locker in die Tasche.

Damit ist mein N100 wohl halbwegs gleichwertig. Er hat zwar nur 4 Kerne aber dafür 16 GB RAM (HAOS direkt installiert)

Wenn das bei dir in der VM gut läuft, habe ich die Hoffnung, das es auch bei mir klappt. Also werde ich erst mal mit Whisper anfangen und nur, wenn es zu lange Verzögerungen gibt, auch mal S-T-P ausprobieren.

Nachtrag:

Kann man eigentlich auch sowas wie einen PiCore Player für die Sprachausgabe von HA nutzen?

Hi und Frohe Weihnachten.

Der Atom Echo ist tatsächlich vorhin angekommen. Das Aufspielen der Firmware hat geklappt. Er wird in HA gefunden und als Sprachassistent eingebunden. So weit so gut.

Aber der “Rest” ist einfach katastrophal. Die lokale Spracherkennung in Home Assistant ist noch sehr, sehr, sehr viel schlechter, als ich es je befürchtet hatte. Völlig unbrauchbar. Zum Einen dauert es grade nach einer Fehlerkennung mehrere Minuten, bevor das Ding überhaupt wieder reagiert und man den nächsten Versuch starten kann. Und zum Anderen bekommt man außer “Entschuldigung, das habe ich nicht verstanden” praktisch nur noch “Der Bereich xxx existiert nicht” als Antwort. So ist das Ganze nicht mal als Spielerei zu gebrauchen. Bei 100 Versuchen hat man vielleicht eine erfolgreiche Ausführung, wenn es hoch kommt. Das braucht dann aber ewig, da man eben nach jedem Fehlversuch viel zu lange warten muss, bis das Ding überhaupt wieder reagiert. Mit Wörtern wie Kaffee, Licht, Leuchte usw. kommt die Spracherkennung gar nicht zurecht, versteht sie überhaupt nicht. Ich habe es mit “faster whisper” und “Piper” versucht. ich muss aber noch mal ausprobieren, ob es mit “Speech to phrase” besser klappt. Aber viel Hoffnung habe ich da nach den Erfahrungen von heute wirklich nicht. Müsste man die Spracherkennung vielleicht zuerst mal trainieren? Falls ja, wie geht das? Musste ich damals bei Alexa und auch bei Google Home ebenfalls machen. In HA hab ich dazu bisher aber nichts gefunden.