mein Homeassistant läuft als VM auf einer Synology NAS und mach vor allem bei Updates und Neustarts seit längerem bereits Probleme. Daher würde ich diese gerne neu aufsetzen.
Kurz zum Hintergrund:
HA Core oder OS Updates triggern nach Installation einen neugestartet an, nach diesem ist jedoch immer noch die alte Version aktiv und fast kein Addon/Integration wird normal geladen. Daraufhin muss ich 1-3 manuelle Neustarts durchführen bis das System wieder benutzbar ist. Dann muss der Updateprozess neu angetriggert werden, mit Glück klappt es dann.
Auch nach einem manuellen Neustart ist es sehr häufig der Fall, dass das System nach über 1h immer noch nicht erreichbar ist. Verbinde ich mich mit der VM, sehe ich die emergency konsole und muss häufig mit Befehlen wie banner, login etc. nach helfen.
Ich installiere die monatlichen Releases eigentlich immer erst ab .3, weshalb ich da eine Fehlerquelle ausschließen würde.
Nach einem solchen Fall die Protokolle durchzuwühlen ist extrem mühsam. Ich habe mit Stundenlangem Recherchieren und “arbeiten mit der KI”, etliche Warnungen und Errors aus dem Protokoll beheben können. Beim speziellen Updateproblem stoße ich teilweise auf mögliche Containerprobleme.
Nun zur eigentlichen Frage: In der Hoffnung, dass ein Neuaufsetzen und Wiedereinspielen eines Backups nicht dieselben Probleme wieder mit einspielt, möchte ich eine neue VM aufsetzen, aber nicht bei 0 anfangen. Meine aktuelle VM hat 75GB, ich hatte hier aufgrund von Platzmangel etwas vergrößert. Würde es Probleme bereiten, wenn ich ein bei einer Neuinstallation mit den 32GB im Standard ein Backup wieder einspiele, oder müsste ich vor einem Restore die Größe ebenfalls wieder auf 75GB ändern?
Du tust ja nur die Konfiguration wiederherstellen und ggf. irgendwelche And-On mit ihren Daten(mühl) sowie irgendwelche Dateien, welche Du im config Ordner abgelegt hast. Auch die db Größe könnte eine Rolle spielen.
Der Festplatten Speicher könntest Du aber auch bei Deiner laufenden VM vergrößern, falls notwendig.
Und nein, es spielt keine Rolle welchen Plattenspeicher Du der VM zuweisen tust, solange das Backup da drauf passt.
Was für ein DS Modell nutzt Du genau und wie viel RAM sind darin verbaut?
Wie viel RAM hast Du der HA VM zugewiesen?
Was für HDD/SSD nutzt Du und kommt da ein RAID ins Spiel?
Das Dein jetziges HA irgendwie “verbogen” ist ist natürlich möglich, aber die üblichen Synology SoHo-NAS, sprich die Einstiegs-Plus-Klasse, sind nun auch mal keine Raketen und daher kann ein HA Update da auch schon mal durchaus 5, 10 oder ggf. auch noch mehr Minuten dauern. Halt je nachdem welches +Modell da mit welcher Ausstattgung und Einrichtung wie im Einsatz ist.
Anm.: Wenn Dein HA tatsächlich (total) “verbogen” sein sollte und Du es nicht schaffen solltest die Probleme zu beheben, dann macht das nutzen eines HA Backups davon nicht wirklich Sinn, weil Du dann eben auch die bestehenden Problem “mitschleppst”. Sprich diese Hoffnung
2x Seagate IronWolf 8 TB im RAID 1 (müsste ja 1 sein: Platte 1 = Platte 2). In der Synology steht “Synology Hybrid RAID (SHR)”
Wäre es nur die Dauer, dann wäre das für mich ja kein Problem. Aber wie erwähnt geht kein einziges Update einfach so durch.
Hm ja den Gedanke habe ich ja ebenfalls. Aber alles neu aufzusetzen und bei 0 anfangen ist für mich keine Option. Dann sitze ich ja etliche Tage dran jedes Gerät wieder neu einzubinden, jede Automation zu kopieren etc.
Die KI hatte mir beim Versuch von Fehlerdiagnosen zum Schluss folgendes ausgeschmissen:
Wichtig: Warum wir jetzt sicher sind
Die Kombination aus:
abgebrochenem Core-Update
Supervisor startet nie
System bleibt im setup-State
Emergency Console nach Timeout
ist ein klassisches Supervisor-Bootstrapping-Problem.
Netzwerk und DNS kann ich ausschließen. Storage eigentlich auch. Da auch andere KIs zwischendurch mal ein beschädigtes Image oder “defekt” im Supervisor-Container erwähnt haben, bin ich dementsprechend mit der Neuinstallation am überlegen.
OK mit einer DS720+ in ähnlicher Ausstattung hatte ich hier eine HA VM per VMM auch mal übergangsweise laufen und da sollte das Thema Ressourcen nicht das Problem sein. Dann scheint bei Deiner HA VM tatsächlich irgendetwas anderes “verbogen” zu sein.
Aus der Ferne ist natürlich schwierig zu sagen und zu beurteilen was oder wo Deine Probleme jetzt genau liegen. Ich an Deiner Stelle würde zum testen vermutlich erst einmal eine neue HA VM erstellen und bei der dann nur ein “Minimal-Backup” von HA einspielen. D.h. nur das
ohne irgendwelche Addons. Diese Version würde ich dann mal starten und schauen was mir dort ggf. bereits an Problemen und Fehlern so angezeigt wird. Vor dem starten aber das Thema IP klären, sprich nicht das die neue HA VM dann plötzlich die IP von Deiner bisherigen HA VM nutzt. Mit dieser “Test-HA-VM” würde ich dann erst einmal div. Tests machen und halt schauen ob Du darüber ggf. feststellen kannst was die Probleme verursacht. Dazu würde ich dann z.B. auch mal Zug um Zug die bisher genutzen Integrationen deaktivieren, um darüber ggf. auch festzustellen ob ggf. eine von Dir genutze Integration die Probleme verursacht.
Wie gesagt dient diese “Test-HA-VM” nur der Fehlersuche und ja die Fehlersuche kann auch dann noch sehr mühsam sein.
PS: Vergiss die Dinge die Dir irgendeine KI sagt oder vorschlägt. Die kann da selber nur im Nebel herumstochern und dabei kommt eben auch manchmal ziemlicher Quatsch heraus. Nutz lieber die klassische Methode und such per Google nach den Warnungen und Fehlern die bei Dir in den HA div. HA Protokollen auftauchen und versuch die Zusammenhänge zu verstehen. Ja ich weiß das Du das
auch schon gemacht hast, aber wenn Du Deine bisherige HA Installation per Backup weiternutzen willst musst Du da leider durch.
danke für die ausführliche Antwort. Ich habe in den letzten Tagen viel “experimentiert”.
Ich hab testweise mal eine komplett frische und neue VM aufgezogen, die fährt einwandfrei hoch und lies sich von 12.3 einwandfrei auf 12.4 und 12.5 updaten. Keine Probleme mit Neustarts o.ä.
Dann habe ich zusätzlich eine neue VM hochgezogen die ich mit einem Backup einspeisen will, das funktioniert leider nicht so gut. In der Auswahl für Wiederherstellung habe nur nur “Einstellungen und Verlauf” ausgewählt. Dann folgt der Bildschirm “Wiederherstellung im Gange”. Ich kann sehen, dass die VM für ca 1h eine erhöte Auslastung hat, danach passiert nichts mehr. Man soll die Webseite nicht schließen oder neuladen. Ich habe es insgesamt 3x getestet. Beim ersten Versuch habe ich nach 2h einfach mal die Seite neu geladen, konnte nicht erreicht werden und weiter ist nichts passiert. Daher habe ich die VM gelöscht und neu erstellt. Beim zweiten Versuch habe ich 8h gewartet mit demselben Ergebnis. Beim aktuellen Test läuft der Vorgang schon seit über 12h und nichts passiert.
Sieht für mich so aus, als wenn es ein Problem bei der Wiederherstellung gibt. Rufe ich die HA-TEST-VM IP in einem neuen Tab im Browser auf, erhalte ich connection refused.
Im Wiederherstellungstab sieht man seit 12h das:
Da stimme ich zwar grundsätzlich zu, aber viele Kleinigkeiten konnte ich mittels KI schon erfolgreich lösen. Daher ist das für mich immer ein guter Indikator, zumindest zum testen.
Also ich hege langsam den Gedanken, dass ich einfach Stück für Stück die neue blanke HA-Instanz parallel aufziehe und dann zwar viel Aufwand haben werde, aber dann zumindest alles frisch ist. Ich habe bislang noch nichts großartig eingerichtet, weil ich nicht weiß ob es zu Problemen kommt wenn ich z.B. die Shelly-Integration in 2 HAs gleichzeitig am laufen habe.
Da es mit dem Backup anscheinend auch nicht funktioniert ist mein aktueller Gedanke, wie gesagt, Schritt für Schritt alles in die neue Instanz zu ziehen und an dem Punkt, an dem alles soweit benutzbar ist, bekommt die neue Instanz die IP der alten.
Okay, da nach über 24h immer noch nichts passiert ist habe ich etwas anderes versucht. Anstatt direkt beim Einrichtungsassisstenten das Backup wiedereinzuspielen, habe eine frische Installation durchgeführt und dann unter Einstellungen - System - Backup, das Backup hochgeladen und nur “Einstellungen und Verlauf” wiederhergestellt. Auch hier sind mittlerweile ca. 16h rum, die Weboberfläche läd allerdings nicht.
Auf der VM aufgeschaltet wird “info” den state “running” zurück, pingen kann ich die Maschine ebenfalls. Laut Router ist sie auch aktiv verbunden.
Der observer sagt bei Supervisor Connected, Support Supported und Health Healthy.
Also scheint entweder irgendwas mit dem Backup nicht zu stimmen, oder ich mache etwas falsch.
Eine Vermutung: In der configuration.yaml ist der Pfad zum SSL-Zertifikat hinterlegt. Kann es eventuell sein, dass das fehlende Zertifikat Probleme macht? Allerdings bekomme ich ja keinen Zertifikatsfehler, sondern Connection_refused.
Ich befürchte Dir wird hier wohl niemand sagen können was jetzt bei Deiner bisherigen HA Installation “verbogen” ist und warum sich ein Backup davon bei einer anderen HA Installation dann nicht einspielen lässt. Wichtig wäre ja erst einmal alle Protokolle bei der bestehenden HA Installation zu überprüfen und zu schauen ob sich darin
ggf. immer noch Warnungen oder Fehlermeldungen befinden die ggf. relevant sein könnten. Wovon ich jetzt mal ausgehe. Diese gilt es dann möglichst auch zu beseitigen. Dafür könntest Du auch mal alle möglichen Integration und Addons temporär deaktivieren, um erst einmal möglichst viele mögliche Ursachen auszuschließen. Bei so einer Vorgehensweise gilt es dann auch zwischendurch die HA VM immer mal wieder neu zu starten, damit irgendwelche temporär deaktivierten Integrationen und Addons auch wirklich nicht mehr aktiv sind. Dann halt immer wieder einen Blick in alle HA Protokolle werfen wie es dann mit evtl. Warnungen und Fehlermeldungen aussieht.
Anm.: Ich weiß natürlich nicht welchen Umfang Deine HA VM auf der DS720+ hat, aber bei einem Restore von HA kannst Du es Dir sparen da mehrere Stunden darauf zu warten ob das Restore abgeschlossen wird oder nicht. Insbesondere dann wenn da nur ein Minimal-Restore durchgeführt wird. D.h. wenn das da innerhalb einer Stunde noch nicht abgeschlossen ist kannst Du Dir m.M.n. weiteres warten durchaus (er)sparen.
Wie gesagt wüsste ich nicht was man Dir da aus der Ferne nach raten oder vorschlagen könnte oder sollte. Deine jetzige HA VM ist scheinbar irgendwie “verbogen”, was man ja u.a. bereits daran
erkennen kann. Somit wird dann wohl auch ein Backup davon entsprechend “verbogen” sein. Was genau dafür die Ursache ist kann ich so aus der Ferne leider nicht sagen.
Edit: Wenn Du dann mal - wie oben geschrieben - alle möglichen Integrationen, Addons und sonstige Dinge die Du ggf. auch noch irgendwie per *.yaml laden lässt temporär deaktiviert hast und die aktuelle HA VM dann nur in einer “Minimal-Variante” läuft, dann kannst Du von der dann laufenden HA VM ja auch mal ein Backup erstellen und versuchen dann dieses Backup bei Deiner neuen HA VM einzuspielen. Ja ich weiß das Du vorher bei den Versuchen mit einem Minimal-Restore ja auch nur das Notwendigste sichern lassen hast und das Restore dann trotzdem nicht funktioniert hat, aber trotzdem wäre so eine Vorgehensweise ja auch mal einen Versuch wert.
Die aktuelle HA-VM heruntergefahren, der noch bestehenden Backup-VM die IP der aktuellen VM zugewiesen, neugestartet → obsserver sagt alles passt, VM sagt state running, über IP allerdings nicht aufrufbar.
Frische HA VM gebootet, alte HA VM runtergefahren, der frischen VM die IP der alten zugewiesen, neustart → Frische HA VM ist über die “gewohnte” IP verfügbar. Dann Backup eingespielt und stundenlang gewartet. “Info” sagt “state running”, Aufruf über IP allerdings nichts möglich.
Ich werde deinen Vorschlag noch umsetzen zum testen und wenn es dann nicht geht, muss ich eben alles neu machen. Ich würde zwar schon gerne wissen woran es liegen könnte, allerdings will ich nicht mehr Zeit und Nerven in ein mögliches Backup investieren als ich bräuchte, um alles neu aufzusetzen.
Ist zwar schade um die ganzen Verlaufswerte meiner Verbräuche, aber vielleicht kriegt man die ja irgendwie exportiert und importiert.
Was auch sicherlich Sinn macht. Aber nur mal so als Anmerkung: Du hast hier in Deinem Beitrag nicht eine einzige Warn- oder Fehlermeldung genannt die bei Dir aufgetaucht ist und/oder immer noch auftaucht. Du hast hier lediglich geschrieben
das Du mit irgendeiner KI vermutlich irgendwelche Fehler beheben konntest. Wenn das Dir geholfen hat ist das selbstverständlich gut und es ist ja auch nichts gegen einen unterstützenden Einsatz einer KI zu sagen, aber es kann hier eben auch niemand mehr nachvollziehen welche Fehler es bei Dir gab, wie Du diese ggf. beseitigt hast und was das am Ende ggf. für Auswirkungen hatte. Wie ich ja schon angedeutet habe ist irgendeine KI natürlich nicht perfekt und macht eben auch häufig genug irgendwelche Fehler. Somit wäre eine eher blindes umsetzen von irgendwelchen Lösungsvorschlägen ggf. auch mal kontraproduktiv.
Aber genug dazu. Ich kann Dir, ohne nicht selber vor der Kiste zu sitzen, halt nicht sagen wo genau bei Dir jetzt das Problem liegt, wodurch es ggf. verursacht wird und wie Du es ggf. lösen kannst. Das was ich hier beschrieben habe ist halt nur ein möglicher Weg wie man ein Problem ggf. erst einmal “umschiffen” kann, aber eben nicht wie man es am Ende dann ggf. auch gelöst bekommt.
Da hast du natürlich recht, mir ging es in diesem Thread auch eigentlich weniger darum aktuell bestehende Probleme der HA-Instanz zu lösen, sondern eher um den Restore. Ich hatte eigentlich schon damit abgeschlossen: Backup & Restore und ab zur neuen Instanz. Daher habe ich nur den Ursprung wie z.B. das mit den Updates als Auslöser genannt.
Jeder Schritt hilft, daher danke für die Antworten!
Ah guter Hinweis, danke. Ich füge mal ein paar Bilder mit Erläuterungen ein.
Ich hatte bereits einen Restore angetriggert und quasi einfach gewartet.
Folgende Ausgabe liefert journalctl (Ich habe versucht u.a. mittels pastebin die Ausgabe direkt liefern zu können. curl ist zwar installiert, liefert aber nicht wie in meiner normalen Linuxumgebung die URL zurück. Daher habe ich ganz simpel Screenshots erstellt.)
//Edit: Ich editiere hier einmal um eventuell etwas deutlicher zu formulieren:
Aktuell habe ich 3 HA-Instanzen:
VM 1 meine ganz normale HA Instanz die produktiv genutzt wird und von welcher die Backups stammen. Diese VM wollte ich ablösen
VM 2 (aus dem Screenshot oben) hier habe ich ein Backup bereits eingespielt gehabt. Jedoch nach Einspielen des Backups kein Zugriff über die Weboberfläche. Das ist quasi eine von vielen VMs, bei denen ich nach Restore nicht auf die Weboberfläche kam. Zwischenzeitlich habe ich meine Produktivumgebung immer weiter “gekürzt” und zb. die configuration.yaml minmaler zu halten, falls diese für ein Problem sorgen sollte.
VM 3 (aus den Screenshots unten) damit eventuell nachvollziehbar wird, was beim Restoreprozess falsch laufen könne, habe ich diese VM hochgezogen und den Restoreprozess dann quasi mit Screenshots festgehalten.
Um den direkten Restore-Prozess zu verfolgen, habe ich eine weitere Maschine gestartet bis zum erfolgreichen Boot. Danach einmal mit “System neustarten” neugestartet und es entstand folgende Ausgabe:
Dann kamen plötzlich Fehler. Da man in der Synology-Konsole nicht hoch oder runter scrollen kann (zumindest hab ich noch nie rausgefunden wie), habe ich die Zeilen per Angabe aus dem Log geholt. Daher leider keine Farbgebung:
Neue HA-VM und einiges installiert, HACS, div. Addons, Integrationen etc. und dann ein Backup erstellt.
Noch eine neue HA-VM und das Backup der vorherigen eingespielt. Hat einwandfrei funktioniert inkl. Addons, Integrationen etc. Das Backup hatte nur 20MB und nicht wie das meiner Haupt-Instanz 1GB.
Also scheint meiner Ansicht nach das Backup meine Haupt-HA-Instanz korrupt zu sein. Fragt sich nur ob es daran liegt, dass die Haupt Instanz korrupt ist oder entsprechend ein Teil des Backups. Ich denke es ist einfacher eine neue Instanz ohne Backup aufzuziehen, anstatt die Einstellung zu suchen, die eventuell mein Backup unbrauchbar macht. Hierbei müsste ich ja nach jeder Änderung einmal ein Backup erstellen, neue VM aufziehen, Backup einspielen und testen.
Für den ein oder anderen, den es interessiert ein Update meinerseits:
Ich kann schlussendlich nicht nachvollziehen woran es genau gelegen hat, allerdings habe ich mein HA noch weiter “entschlackt”. Alle Integrationen und alle Addons die ich nicht aktiv benötige, habe ich komplett entfernt, nicht nur deaktiviert. Zusätzlich alles aus der configuration.yaml was nicht benötigt wird (also auskommentiert war) ebenfalls entfernt.
Ein Backup lässt sich nun ohne Probleme und inkl. Addons starten. Aufgrund der SSL-Zertifikate (vermute ich), kann ich bei Wiederherstellung zwar nicht auf den Status der Wiederherstellungsseite achten, da ich die Instanz dann irgendwann mit https aufrufen muss.
Aber schlussendlich habe ich es jetzt mehrfach getestet und jedes mal konnte ich mit den aktuell durchgeführten Backups erfolgreich einen Restore durchführen. Scheinbar war also bei den ursprünglichen Backups bevor der großen “Entschlackung” irgendetwas dabei, wass beim Restore wohl gestört hat.
//Edit:
nochmal als Ergänzung. Seitdem ich die meisten Addons/Integrationen entfernt habe, scheine ich auch kein Problem bei Updates/Neustarts mehr zu haben. Das macht den Gedanken einer neuen Instanz natürlich (glücklicherweise) überflüssig. Aktuell funktioniert die Instanz also wieder einwandfrei.