ich saniere gerade eine Immobilie und habe mir die letzten Wochen viel Gedanken um das Smarthome Konzept gemacht. Ich möchte gerne mein Konzept kurz vorstellen und zur Diskussion stellen für konkrete Verbesserungsvorschläge und andere Sichtweisen. Also Feedback und Ideen sind ausdrücklich erwünscht und willkommen.
Die drei Aufgaben
Smarthome steuern — Home Assistant für Smarthome Shelly-Aktoren, WLED, Wärmepumpe, eAuto usw…
Dokumente verwalten — Paperless-ngx
Sprachsteuerung — Home Assistant Voice für Smarthomesteuerung und Anbindung Hermes Agent als KI-Assistent
Kernarchitektur
┌─────────── 1× Mini-PC: Unraid (Intel N150, 16 GB) ───────────┐
│ Home Assistant OS ── als eigene VM (2 vCPU, 4 GB, br0) │
│ Hermes Agent ──────── als Container (Gehirn + Gateway) │
│ Paperless-ngx ─────── Container + Postgres/Redis (NVMe) │
│ PaperlessMCP ──────── Container (MCP-Brücke) │
└──────────────┬───────────────────────────────────────────────┘
│
UniFi UNAS ◄───────┘ (Dokumente auf NFS; DB & Index lokal/NVMe)
Leitprinzipien:
Hermes greift nie direkt auf Dateien/Konfig zu, sondern über strukturierte MCP-Schnittstellen (eine zu Paperless, eine zu Home Assistant)
Schnelle Daten bleiben lokal (Datenbank, Index, VM-Disk auf NVMe des MIni-PCs)
Paperless-Dokumente liegen auf dem NAS
Home Assistant als eigene VM
Sicherheit: keine Portfreigabe (Remote nur über Tailscale)
Bausteine im Detail
Baustein
Rolle
Zugang
Unraid als Betriebssystem (N150)
Host, Docker, VMs, Backups
WebGUI
Home Assistant OS
Smarthome-Zentrale, lokale Voice-Pipeline
Web-UI
Hermes Agent
KI-Assistent, MCP, Messenger-Gateway
Desktop-App / Telegram
Paperless-ngx
Dokumentenablage, OCR
Web-UI
PaperlessMCP
übersetzt Hermes-Anfragen in Paperless-API
MCP /mcp
HA-MCP (offiziell)
Hermes ↔ Home Assistant
MCP /api/mcp
UniFi UNAS
Dokumentenspeicher
NFS/SMB
Tailscale
sicherer Fernzugriff ohne Portfreigabe
—
Hermes Zugriffskanäle
Mac Desktop-App → Remote-Backend auf dem Server
Telegram → Messenger-Gateway
Home Assistant Voice (je Raum) → Sprachsteuerung im Haus
Sprachsteuerung
in jedem Zimmer: HA Voice (Preview Edition) → Wake-Word on-device → HA-VM
→ STT/TTS lokal oder HA Cloud
→ Smarthome Steuerung lokal
→ Hermes als "Gehirn"
Rollentrennung: HA = schnelle Smarthome-Steuerung (offline, sofort), Hermes für allgemeine Fragen + autonome Aufgaben.
Offener Punkt: Die direkte Anbindung von Hermes an die Voice-Satelliten — also „Hey Hermes" → allgemeine Frage → Hermes antwortet direkt über Sprachgerät — technische Umsetzung ist noch unklar.
Der Weg dorthin (HA-Assist als Conversation-Agent an Hermes) scheitert lt. KI an einem im Hermes-Kern noch fehlenden WebSocket-Protokoll (assist_query/assist_response; in v0.20.0 verifiziert nicht vorhanden). Die Smarthome-Sprachsteuerung selbst soll davon unabhängig bereits nativ über Home Assistant funktionieren.
Kurz: Ein lokaler Unraid-Server, der Smarthome, Dokumenten-KI und Sprachsteuerung über klar getrennte, sichere Schnittstellen bündelt — die direkte Hermes↔Voice-Satelliten-Anbindung ist der einzige noch offene Baustein.
Was haltet ihr von dem Konzept, was könnte man besser lösen, wie kann ich den lokalen Hermes Agent an die HA Voice Satelliten anbinden?
Lass doch die Einrichtung vom Hermes Agenten durchführen. Dann erfährst du gleich die technischen Voraussetzungen bzw. noch zu klärenden Punkte, quasi aus erster Hand.
Ich nutze Hermes nicht und ich weiss nicht ob dir mein Setup hilft…
Ich nutze viel die Sprachsteuerung mit den HA PEs über die lokale Pipeline und “okay nabu”. STT und TTS aber über die Home Assistant Cloud. Zusätzlich habe ich Google Gemini mit Suchwerkzeug in HA eingebunden.
Wenn ich etwas von der KI mit Internetanbindung wissen möchte, sage ich “frag Google…” und eine Automatisierung leitet meine Anfrage an die KI weiter. Ich muss also nach dem Aktivierungswort quasi noch ein Aktivierungswort (frag Google) sagen.
Das funktioniert problemlos mit der Custom-Integration “Extended OpenAI Conversation”. Du musst nur den API-Server in Hermes aktivieren und den Endpoint in der Integration konfigurieren. Dann kannst du Hermes als Sprachassistent in Home Assistant hinzufügen und mit den Voice-Satelliten darauf zugreifen.
Danke für den Tipp. Ich habe inzwischen auch diese hier gefunden, die Hermes in HA als Konversationsagent integriert:
Siehst du trotzdem Vorteile bei deiner verlinkten Integration?
Hab es durch Hermes mal prüfen lassen:
Warum diese Integration die schlechtere Wahl ist:
Kein Session-Continuity. hermes-ha-integration sendet X-Hermes-Session-Id über mehrere Gesprächsrunden — Hermes behält damit den Kontext eines Voice-Dialogs. extended_openai_conversation tut das nicht; für „Schalte das Licht, und danach das Radio" am Satelliten heißt das: Hermes kann bei Folgefragen den Kontext verlieren.
Doppelter System-Prompt. Die Integration injiziert exponierte Entitäten und ihr eigenes Skills-System in den Prompt. Hermes baut seinen Kontext (Tools, Skills, Memory) aber schon selbst auf Serverseite. Ergebnis: redundantes Prompt-Material, mehr Tokens, mehr Latenz — bei Sprachausgabe spürbar.
Dead Weight + Sicherheitsfläche. Die Integration schafft eigene HA-seitige Ausführungswerkzeuge (Bash, Datei-Lesen/-Schreiben, SQLite, Web-Scraping, Scripte). Wenn das Backend ein vollwertiger Agent mit eigenen Tools ist, ist das tote Funktionalität — und eine Angriffsfläche, die man nicht braucht. Man müsste aktiv dafür sorgen, dass sie ungenutzt bleibt (Functions-YAML leer lassen).
Keine Hermes-spezifische Pflege. Die Integration weiß nichts von Hermes’ API-Besonderheiten (Health-Probe, Modelle, Profil-Routing). Wenn sich Hermes’ API ändert, passt sie das nicht nach — hermes-ha-integration schon, deren Autor gezielt für diesen Anwendungsfall baut.
Interessant. Die Integration kannte ich noch nicht. Ich denke sie ist besser als mein Vorschlag, da sie speziell an Hermes angepasst ist. Hab’s gleich mal installiert
Das funktioniert sogar sehr gut. Ich habe das mal zum Anlass genommen, mich intensiver mit Voice Assist Hardware zu befassen.
In meiner Bastelkiste lag noch ein „Holo-Display“ und ein Mikrofon (ICS-43434) rum. Ich habe Hermes gefragt, ob das für einen Voice Assist geeignet ist und er hat es bejaht. Es handelt sich ein ESP32-S3 mit 8MB PSRAM. Dann hat er losgelegt und mittels ESPHome die Software gebaut.
Jetzt läuft schon mal die Spracheingabe und die Hermes Integration versteht mich und antwortet. Die Sprachausgabe fehlt noch. Aber ein MAX98357A und Lautsprecher sollten morgen geliefert werden. Aktuell werden die Ausgaben nur auf dem Display angezeigt. Ich bin wirklich erstaunt, wie gut das alles funktioniert. Vor allem die Wakeword Erkennung ist viel besser, als ich erwartet habe.
Mein 1,3 Zoll Display ist dafür viel zu klein. Deshalb ist es auch in der Schublade gelandet.
Aber Hermes sagt, dass es prinzipiell geht
Es braucht genau zwei Bausteine, beide „Standard":
Der Kanal (HA-Seite):
Ein Helper input_text.hermes_bild_url. Hermes ruft den Service während des Antwort-Turns serverseitig auf – die Integration führt Tool-Aufrufe ja im Hermes-Prozess aus, HA wartet nur auf den Text.
Das Anzeigen (ESP-Seite) in ESPHome:
• text_sensor (platform: homeassistant) auf den Helper
• bei Änderung → online_image.set_url (die URL ist templatable, Re-Download wird automatisch getriggert) + component.update: display
• online_image unterstützt JPEG (nur baseline, kein progressive), PNG, BMP