Plötzlicher HA Neustart

Moin,

Warum?

Ja, genau, das hat sich bei Debian geändert, musste man halt in Proxmox nachziehen, sollte jetzt aber passen.

Naja, wenn es nur das Microcode gedönse war, dann sollte es da hoffentlich nicht zu Problemen kommen.

Aber du beantwortest die Frage, nicht :wink:
Sind noch andere LXC, VM von diesen Stop, Start geschichten betroffen, außer 104 und 106?

VG
Bernd

HI,

ich würde das ausgliedern, weil da die Daten eh hingehören und weil ich perspektivisch auf proxmox die für HA notwendigen Container ausgliedern will, wie NodeRed, ESPhome, MQTT und ZigBee, ich will proxmox ansonsten möglichst schonen damit keine Fehler in anderen Anwendungen zu abstürzen führen

ICh habe noch paperless (103) drauf aber gestoppt (werde ich auch ausgliedern) da war auch ein permanenter Neustart wie bei Influx, ansonsten noch Adguard (101), das läuft aber wohl stabil ansonsten noch Grafan (107) stabil und als VM neben Homeassistant noch Windows. Das habe ich aber auch bereits vor längerer ZEit auf die NAS ausgegliedert, weil ich das nur für meine KNX ETS brauche.
Ansonsten habe ich mit dem Helper Script installiert
EspHome (102)
go2rct (105)
mqtt (108)
Zigbee2mqtt (109)
VDCodeserver (110)
Wireguard (111)

Die sind aber noch nicht aktiv, weil ich noch ander Ausgleiderung arbeite.

Gruß
Elmar

Moin,

ok, dann bin ich erst einmal mit meinem Latein am Ende.
Ich würde mir mal einen USB-Stick mit einem Speziellen Life-Linux, zum Stresstest der Hardware erstellen und den Rechner mal so richtig stressen und schauen was dabei herauskommt.

https://www.stresslinux.org/sl/

VG
Bernd

Hi Bernd,

jetzt muss ich erst mal danke für deine wirklich tolle Hilfe sagen, das ist schon echt aussergwöhnlich wie intensiv du dich da rein gearbeitet hast, danke dafür.

Den Stresstest mache ich mal am Wochenende, ich vermute, dass man da etwas Zeit für braucht.

Heute gings aber weiter, ich bekam die Benachrichtigung “Available space is less than 1 GB!” Also ca 92% voll. Ich habe daraufhin mal geschaut was da so an Daten drauf ist und mir ist aufgefallen, dass eine “corrupte Datenbankdatei” allein 2,1 GB einnimmt, ich vermute mal, dass man die nicht einfach löschen darf, kannst Du mir helfen wie ich die kleiner bekomme? auto_purge hatte ich seinerzeit auf false gestellt, als es problem mit icloud3 nach der 2024.7.0 gab, aber nachdem das gelöst war aber ich purge wieder aktiviert.

Gruß
Elmar

Moin,

Ja, man sollte sich dafür Zeit nehmen und auch immer ein Auge drauf haben, denn die CPU wird da schon ganz schön gestresst und man will ja keine Kernschmelze verursachen :wink:

Das HAOS VM Root Feilsystem ist wie groß 32 GB? Machst du Backups, lokal, oder extern?
Denn da rödelt dir irgendwas ja schön die Platte der VM zu, siehst du im HA Protokoll irgendwas Auffälliges?

Du kannst die SQLITE Datenbankfiles, also die, die als corrupt gezeichnet wurden, herunterladen, z. B. auf dein Büro-PC, danach kannst Du sie löschen, du kannst vorher schauen, ob noch jemand die Datei geöffnet hat, das sollte aber nicht der Fall sein.

➜  ~ lsof homeassistant/home-assistant_v2.db.corrupt.*

Wie gesagt, nicht gleich löschen, sondern herunterladen, dann löschen. Du kannst dir den DB Browser 4 SQLite herunterladen auf dein PC und dann kannst die heruntergeladenen Files damit betrachten
https://sqlitebrowser.org/
Vielleicht möchtest Du ja noch Daten retten.

Hast Du in deinem HA das Add-on Glances installiert?

Achtng ich habe das nicht immer laufen, daher sind alle schalter auf off, damit Du wirklich einen guten Überblick bekommst muss der gesicherte Modus aber wirklich aus sein und das Tool muss einige zeit laufen, dann siehst du so etwas

VG
Bernd

Hi,

dann werd ich mal die CPU stressen - am besten wenns draussen regnet :slight_smile:

Ja das System ist 32 GB groß habs aber mal ein wenig erhöht bis, jetzt habe ich
ICh habe gesehen, dass Matter nen Fehler rausgab, das habe ich aber jetzt mal deinstalliert, bekomme das Gerät auch über MQTT hin.
Zigbee scheitn das was zu haben (siehe Anhang)

Ansonsten nix kritisches im Log

Backup mache ich extern auf die NAS über SAMBA

Die files habe ich grad heruntergeladen und gelöscht und habe dann auch gleich das update auf OS 13.1 gemacht, lief alles gut durch soweit. Hat auch wieder etwas Platz gegeben Speicher liegt jetzt bei 51 %

Glances packe ich mal drauf.

Aber nochmal vielen Dank für die Hilfe, echt klasse

Gruß
Elmar

Moin,

Bitteschön, kein Ding, macht ja Spaß :slight_smile:

Dann aber mal das, ABER, bite bite, keine Briefmarken von Logs, oder irgendwas, was Text ist, zum einen, aus Bildern kann man nichts Kopieren, Zitieren, um einen Fehler mal im Netz zu suchen, müsste ich den abtippen, nein, das möchte ich nicht :wink:
Zudem, je nachdem auf welchem Gerät ich mir das anschaue, tuen mir die Augen weh :wink:

Das, was ich da erkennen konnte, war, dass du mit einigen Devices Probleme hast.
Such mal in der Z2M UI nach den Geräten, das ist z. B. eine IEEE-Adresse aus deinem Bildchen,
grafik

Das passende Gerät dazu findest du dann so, z. B.

VG
Bernd

Moin,

danke fürs feed-back, mache ich zukünftig im verarbeitbaren Format.

Es handelt sich bei dem Gerät um die Schalt- und messbare Steckdose für die Kaffeemaschine, in ZigBEE selbst sieht aber alles gut aus.

Ich habe auch mal Glances probiert (danke für den Tipp) hier das Ergebnis:

CONTAINERS 23 sorted by CPU consumption
Engine	Pod	Name	Status	Uptime	CPU%	MEM	/MAX	IOR/s	IOW/s	RX/s	TX/s	Command
docker	-	addon_core_openwakeword	running	17 hours	31,4	140M	8.52G	0b	0b	1.06Mb	121Kb	/init
docker	-	homeassistant	running	17 hours	22,3	3.94G	8.52G	0b	9Kb	NaNb	NaNb	/init
docker	-	addon_a0d7b954_glances	running	12 hours	11,9	83.2M	8.52G	0b	0b	NaNb	NaNb	/run.sh
docker	-	addon_core_assist_microphone	running	17 hours	0,5	29.9M	8.52G	0b	0b	14Kb	310Kb	/init
docker	-	hassio_audio	running	17 hours	0,2	23.7M	8.52G	0b	0b	5Kb	0b	/init
docker	-	addon_6a2c1c7a_sma-em	running	17 hours	0,1	28.4M	8.52G	0b	0b	NaNb	NaNb	/init ./run.py
docker	-	addon_a0d7b954_nut	running	17 hours	0,1	36.1M	8.52G	0b	0b	6Kb	3Kb	/init
docker	-	addon_a0d7b954_aircast	running	17 hours	0,1	7.25M	8.52G	0b	0b	NaNb	NaNb	/init
docker	-	hassio_dns	running	17 hours	0,1	33.2M	8.52G	0b	0b	7Kb	3Kb	/init
docker	-	addon_core_mosquitto	running	17 hours	0	78.0M	8.52G	0b	0b	8Kb	3Kb	/init
docker	-	addon_a0d7b954_airsonos	running	17 hours	0	31.0M	8.52G	0b	0b	NaNb	NaNb	/init
docker	-	addon_core_configurator	running	17 hours	0	40.8M	8.52G	0b	0b	1.23Mb	4Kb	/init
docker	-	addon_982ee2c4_volvo2mqtt	running	17 hours	0	59.7M	8.52G	0b	0b	5Kb	96b	/init /volvoAAOS2mqtt/run.sh
docker	-	addon_45df7312_zigbee2mqtt	running	17 hours	0	168M	8.52G	0b	0b	7Kb	2Kb	/sbin/tini -- /docker-entrypoint.sh
docker	-	addon_core_whisper	running	17 hours	0	1.30G	8.52G	0b	0b	5Kb	0b	/init
docker	-	addon_5c53de3b_esphome	running	17 hours	0	849M	8.52G	0b	0b	NaNb	NaNb	/init
docker	-	hassio_supervisor	running	17 hours	0	196M	8.52G	0b	0b	0b	0b	/init
docker	-	addon_core_piper	running	17 hours	0	99.4M	8.52G	0b	0b	5Kb	0b	/init
docker	-	addon_core_samba	running	17 hours	0	56.4M	8.52G	0b	230Kb	NaNb	NaNb	/init
docker	-	addon_15d21743_samba_backup	running	17 hours	0	35.6M	8.52G	0b	0b	5Kb	0b	/init /run.sh
docker	-	hassio_cli	running	17 hours	0	15.4M	8.52G	0b	0b	5Kb	0b	/init
docker	-	hassio_observer	running	17 hours	0	11.2M	8.52G	0b	0b	6Kb	264b	/usr/bin/observer
docker	-	hassio_multicast	running	17 hours	0	4.64M	8.52G	0b	0b	NaNb	NaNb	/init

openwakeword scheint einiges zu ziehen.

Gruß
Elmar

Moin,

Um welches Gerät handelt es sich?
Könnte es an einem fehlenden Firmwareupdate liegen?

Da habe ich auch Anmerkungen zu

Engine	Pod	Name	                       Status	Uptime      CPU%  MEM
docker	-	addon_core_openwakeword	       running	17 hours	31,4  140M
docker	-	homeassistant	               running	17 hours	22,3  3.94G
docker	-	addon_a0d7b954_glances	       running	12 hours	11,9  83.2M
docker	-	addon_core_assist_microphone   running	17 hours	0,5   29.9M
docker	-	hassio_audio                   running	17 hours	0,2   23.7M	
docker	-	addon_6a2c1c7a_sma-em          running	17 hours	0,1	  28.4M
docker	-	addon_a0d7b954_nut             running	17 hours	0,1	  36.1M
docker	-	addon_a0d7b954_aircast         running	17 hours	0,1	  7.25M
docker	-	hassio_dns                     running	17 hours	0,1	  33.2M
docker	-	addon_core_mosquitto           running	17 hours	0	  78.0M
docker	-	addon_a0d7b954_airsonos        running	17 hours	0	  31.0M
docker	-	addon_core_configurator        running	17 hours	0	  40.8M
docker	-	addon_982ee2c4_volvo2mqtt      running	17 hours	0	  59.7M
docker	-	addon_45df7312_zigbee2mqtt     running	17 hours	0	  168M	
docker	-	addon_core_whisper             running	17 hours	0	  1.30G	
docker	-	addon_5c53de3b_esphome         running	17 hours	0	  849M	
docker	-	hassio_supervisor              running	17 hours	0	  196M	
docker	-	addon_core_piper               running	17 hours	0	  99.4M	
docker	-	addon_core_samba               running	17 hours	0	  56.4M
docker	-	addon_15d21743_samba_backup    running	17 hours	0	  35.6M
docker	-	hassio_cli                     running	17 hours	0	  15.4M	
docker	-	hassio_observer                running	17 hours	0	  11.2M
docker	-	hassio_multicast               running	17 hours	0	  4.64M	

Alleine schon, dass Glances ~11 % CPU verbraucht, ist seltsam!
Das bei Dir homeassistant ~4 GB an Memory verbraucht ist seltsam!

Ich dachte, Du betreibst Zigbee2MQTT als LXC, wieso läuft der noch in HA?

Bei mir sieht das so aus

Engine	Pod	Name	                            Status	Uptime      CPU%     MEM
docker  -   homeassistant                       running an hour     2,6      622M 
docker  -   addon_a0d7b954_zwavejs2mqtt         running 21 hours    1        198M 
docker  -   addon_a0d7b954_glances              running 30 mins     0,5      80.6M
docker  -   addon_bf7963f0_ism7mqtt             running 21 hours    0,3      111M 
docker  -   hassio_supervisor                   running 21 hours    0,1      229M 
docker  -   hassio_audio                        running 21 hours    0        27.9M
docker  -   addon_45df7312_zigbee2mqtt_proxy    running 21 hours    0        11.5M
docker  -   addon_core_piper                    running 21 hours    0        209M 
docker  -   addon_a0d7b954_vscode               running 21 hours    0        149M 
docker  -   hassio_dns                          running 21 hours    0        30.3M
docker  -   addon_core_nginx_proxy              running 21 hours    0        21.8M
docker  -   addon_a0d7b954_ssh                  running 21 hours    0        19.2M
docker  -   hassio_cli                          running 21 hours    0        16.4M
docker  -   hassio_observer                     running 21 hours    0        10.1M
docker  -   hassio_multicast                    running 21 hours    0        5.74M

Also, ich würde mal gezielt alles abschalten, was nicht gebraucht wird und dann eins nach dem anderen wieder starten und beobachten.

VG
Bernd

HI,

das ist das Gerät, upgedated sind die alle und laufen auch reibungslos.

Ich bin grad dabei alles alles auf Container umzuziehen.
Für InfluxDB, Grafana und nOde Red habe ich bereist neue angelegt, das läuft.
ESPHome habe ich angelegt, Kann es auch mittlerweile updates, aber kurioserweise kann ich die GEräte nur aus dem Homeassistant heraus updaten im LXC COntainer läuft das auf einen Fehler.
mqtt, zigbee und matter muss ich noch outsourcen ich habe die Container zwar schon angelegt, will das aber nach und nach in Ruhe machen.
Wenn ich das alles angelegt habe, werde ich mal versuchen HA auch neu zu installieren, möglicherweise wirds dann ja besser

GRuß
Elmar

Moin,

Bei ESPHome, kann ich Dir nicht viel helfen, da nicht im Einsatz.

Dann musst Du mal den Fehler hier zeigen, vielleicht erkenne ich ja was.

Das ist auch gut so, denn wie sagt man so schön

Kutscher fahr langsam, ich hab es eilig.

Wie, was, ich hoffe nicht beides über denselben, gleichen Stick!

Ok, dann verstehe ich die Meldung nicht, vielleicht fehlten da auch noch der Zusammenhang und das Log von oben ist aus dem Zusammenhang gerissen.

VG
Bernd

Hi,

so jetzt sind ein paar Tage vergangen und seitem die letzten besprochenen Maßnahmen durchgeführt wurden läuft HA stabiler. Man soll den Tag zwar nicht vor dem Abend loben, aber ich glaube schon, dass insbesondere die Proxmox updates einiges gebracht haben.
Zu den anderen Themen: Matter werde ich wohl abgeschaltet lassen habe da eh nur ein GErät und das funktioniert auch gut mit MQTT. Die Zigbee MEldung bleibt, aber alle Geräte funktionieren und sind uo to date.
Ich habe zudem festgestellt, dass wenn ich die “Assist Geräte” ausschalte, die CPU Leistung von openwake word deutlich geringer wird, das werde ich noch beobachten.
Ansonsten läuft der Umzug von einigen Addons auf Docker sehr zäh, leider fehlen mir da die Anleitungen aber ich arbeite mich da weiter durch.

Nochmal besten Dank
Elmar

Moin,

schön, dass es langsam in die richtige Richtung geht und sich dein System stabilisiert.

Da kann ich gerade nicht folgen, was sind Assist Geräte, liegt vielleicht daran, dass ich so etwas nicht betreibe.

Wenn Du da hilfe brauchst, dann mach vielleicht für jedes Add-on einen eigenen Thread auf, natürlich nur, wenn es nicht schon einen gibt, also vorher suchen, dann Posten.
Ich habe zu den meisten Themen immer etwas gefunden, und die Installation der Dienste ist ja, mit den Helferskripten, einfach, danach einfach in die HA Dokumentation schauen, oder wie gesagt, hier nachfragen.

VG
Bernd

Moin,

ich habe mich wohl zu früh gefreut, heute kams mal wieder zum Absturz allerdings als ich nicht zu Hause war, musste also aus der Ferne versuchen es neu zu starten. In HA habe ich keine Auffälligkeiten in den Logs gefunden, auch Zigbee oder MQTT haben funktioniert und keine Auffälligkeiten gezeigt.

Aus dem Proxmox pve System Log Kann ich zum Zeitpunkt des Absturz folgendes feststellen:

Aug 29 10:52:27 pve pvedaemon[1230513]: worker exit
Aug 29 10:52:27 pve pvedaemon[1080]: worker 1230513 finished
Aug 29 10:52:27 pve pvedaemon[1080]: starting 1 worker(s)
Aug 29 10:52:27 pve pvedaemon[1080]: worker 1369029 started
Aug 29 11:17:01 pve CRON[1380117]: pam_unix(cron:session): session opened for user root(uid=0) by (uid=0)
Aug 29 11:17:01 pve CRON[1380118]: (root) CMD (cd / && run-parts --report /etc/cron.hourly)
Aug 29 11:17:01 pve CRON[1380117]: pam_unix(cron:session): session closed for user root
Aug 29 12:01:13 pve postfix/qmgr[1004]: A253440CDD: from=<root@pve.fritz.box>, size=40034, nrcpt=1 (queue active)
Aug 29 12:01:13 pve postfix/smtp[1399731]: connect to mx02.mail.icloud.com[17.57.155.25]:25: Connection refused
Aug 29 12:01:13 pve postfix/smtp[1399731]: connect to mx01.mail.icloud.com[17.42.251.62]:25: Connection refused
Aug 29 12:01:13 pve postfix/smtp[1399731]: connect to mx02.mail.icloud.com[17.57.152.5]:25: Connection refused
Aug 29 12:01:13 pve postfix/smtp[1399731]: connect to mx02.mail.icloud.com[17.56.9.31]:25: Connection refused
Aug 29 12:01:13 pve postfix/smtp[1399731]: connect to mx01.mail.icloud.com[17.57.154.33]:25: Connection refused
Aug 29 12:01:13 pve postfix/smtp[1399731]: A253440CDD: to=<mail@mail>, relay=none, delay=378638, delays=378637/0.01/0.21/0, dsn=4.4.1, status=deferred (connect to mx01.mail.icloud.com[17.57.154.33]:25: Connection refused)
Aug 29 12:17:01 pve CRON[1406759]: pam_unix(cron:session): session opened for user root(uid=0) by (uid=0)
Aug 29 12:17:01 pve CRON[1406760]: (root) CMD (cd / && run-parts --report /etc/cron.hourly)
Aug 29 12:17:01 pve CRON[1406759]: pam_unix(cron:session): session closed for user root
-- Reboot --
Aug 29 12:39:51 pve kernel: Linux version 6.8.12-1-pve (build@proxmox) (gcc (Debian 12.2.0-14) 12.2.0, GNU ld (GNU Binutils for Debian) 2.40) #1 SMP PREEMPT_DYNAMIC PMX 6.8.12-1 (2024-08-05T16:17Z) ()
Aug 29 12:39:51 pve kernel: Command line: BOOT_IMAGE=/boot/vmlinuz-6.8.12-1-pve root=/dev/mapper/pve-root ro quiet
Aug 29 12:39:51 pve kernel: KERNEL supported cpus:
Aug 29 12:39:51 pve kernel:   Intel GenuineIntel
Aug 29 12:39:51 pve kernel:   AMD AuthenticAMD
Aug 29 12:39:51 pve kernel:   Hygon HygonGenuine
Aug 29 12:39:51 pve kernel:   Centaur CentaurHauls
Aug 29 12:39:51 pve kernel:   zhaoxin   Shanghai  
Aug 29 12:39:51 pve kernel: x86/split lock detection: #AC: crashin

Das war Mittags und dann Nachmittags noch einmal:

Aug 29 13:17:01 pve CRON[19033]: pam_unix(cron:session): session opened for user root(uid=0) by (uid=0)
Aug 29 13:17:01 pve CRON[19034]: (root) CMD (cd / && run-parts --report /etc/cron.hourly)
Aug 29 13:17:01 pve CRON[19033]: pam_unix(cron:session): session closed for user root
Aug 29 13:42:35 pve pvedaemon[1094]: <root@pam> successful auth for user 'root@pam'
Aug 29 13:54:34 pve kernel: perf: interrupt took too long (2511 > 2500), lowering kernel.perf_event_max_sample_rate to 79000
Aug 29 14:17:01 pve CRON[44499]: pam_unix(cron:session): session opened for user root(uid=0) by (uid=0)
Aug 29 14:17:01 pve CRON[44500]: (root) CMD (cd / && run-parts --report /etc/cron.hourly)
Aug 29 14:17:01 pve CRON[44499]: pam_unix(cron:session): session closed for user root
Aug 29 14:19:55 pve postfix/qmgr[1018]: A253440CDD: from=<root@pve.fritz.box>, size=40034, nrcpt=1 (queue active)
Aug 29 14:19:55 pve postfix/smtp[45605]: connect to mx02.mail.icloud.com[17.57.152.5]:25: Connection refused
Aug 29 14:19:55 pve postfix/smtp[45605]: connect to mx01.mail.icloud.com[17.42.251.62]:25: Connection refused
Aug 29 14:19:55 pve postfix/smtp[45605]: connect to mx02.mail.icloud.com[17.57.155.25]:25: Connection refused
Aug 29 14:19:55 pve postfix/smtp[45605]: connect to mx02.mail.icloud.com[17.57.154.33]:25: Connection refused
Aug 29 14:19:55 pve postfix/smtp[45605]: connect to mx02.mail.icloud.com[17.57.156.30]:25: Connection refused
Aug 29 14:19:55 pve postfix/smtp[45605]: A253440CDD: to=<mail@mail>, relay=none, delay=386960, delays=386960/0.01/0.18/0, dsn=4.4.1, status=deferred (connect to mx02.mail.icloud.com[17.57.156.30]:25: Connection refused)
Aug 29 14:21:13 pve pvestatd[1036]: auth key pair too old, rotating..
Aug 29 14:27:37 pve kernel: perf: interrupt took too long (3145 > 3138), lowering kernel.perf_event_max_sample_rate to 63000
Aug 29 15:17:01 pve CRON[69497]: pam_unix(cron:session): session opened for user root(uid=0) by (uid=0)
Aug 29 15:17:01 pve CRON[69498]: (root) CMD (cd / && run-parts --report /etc/cron.hourly)
Aug 29 15:17:01 pve CRON[69497]: pam_unix(cron:session): session closed for user root
Aug 29 15:29:55 pve postfix/qmgr[1018]: A253440CDD: from=<root@pve.fritz.box>, size=40034, nrcpt=1 (queue active)
Aug 29 15:29:55 pve postfix/smtp[74958]: connect to mx01.mail.icloud.com[17.57.156.30]:25: Connection refused
Aug 29 15:29:55 pve postfix/smtp[74958]: connect to mx02.mail.icloud.com[17.57.154.33]:25: Connection refused
Aug 29 15:29:55 pve postfix/smtp[74958]: connect to mx02.mail.icloud.com[17.57.156.30]:25: Connection refused
Aug 29 15:29:55 pve postfix/smtp[74958]: connect to mx01.mail.icloud.com[17.57.154.33]:25: Connection refused
Aug 29 15:29:55 pve postfix/smtp[74958]: connect to mx02.mail.icloud.com[17.42.251.62]:25: Connection refused
Aug 29 15:29:55 pve postfix/smtp[74958]: A253440CDD: to=<mail@mail>, relay=none, delay=391160, delays=391160/0.01/0.22/0, dsn=4.4.1, status=deferred (connect to mx02.mail.icloud.com[17.42.251.62]:25: Connection refused)
Aug 29 15:47:13 pve kernel: perf: interrupt took too long (3938 > 3931), lowering kernel.perf_event_max_sample_rate to 50000
-- Reboot --
Aug 29 16:06:31 pve kernel: Linux version 6.8.12-1-pve (build@proxmox) (gcc (Debian 12.2.0-14) 12.2.0, GNU ld (GNU Binutils for Debian) 2.40) #1 SMP PREEMPT_DYNAMIC PMX 6.8.12-1 (2024-08-05T16:17Z) ()
Aug 29 16:06:31 pve kernel: Command line: BOOT_IMAGE=/boot/vmlinuz-6.8.12-1-pve root=/dev/mapper/pve-root ro quiet
Aug 29 16:06:31 pve kernel: KERNEL supported cpus:
Aug 29 16:06:31 pve kernel:   Intel GenuineIntel
Aug 29 16:06:31 pve kernel:   AMD AuthenticAMD
Aug 29 16:06:31 pve kernel:   Hygon HygonGenuine
Aug 29 16:06:31 pve kernel:   Centaur CentaurHauls
Aug 29 16:06:31 pve kernel:   zhaoxin   Shanghai  
Aug 29 16:06:31 pve kernel: x86/split lock detection: #AC: crashing the kernel on kernel split_locks and warning on user-space split_locks
Aug 29 16:06:31 pve kernel: BIOS-provided physical RAM map:

Systemstart musste ich leider über Stromausschalten aus der Ferne machen, weil ich dringend etwas bedienen musste. Beim zweiten mal habe ich dann aber unmittelbar danach aus HA heraus noch einmal einen Neustart gemacht. Seitdem läuft es wieder. Was mit den Logs war kann ich daraus nicht sehen , sehen nur jeweils gleich aus. Wo im Log mail@mail steht stand vorher meine Mailadresse, die habe ich vorsichtshaber rausgelöscht.
Aus der GRafik der Prozessorleistung von HA geht hervor, wann die Abstürze erfolgt sind, der erste muss so gegen 11.30 Uhr gewesen sein und der zweit gegen 14.00 Uhr:

Und proxmox hat die CPU Leistung für HA registriert:

Zu Deinen Fragen:
Assist Geräte sind meine Sprachassistensgeräte 2 x M4 Atom Echo und 1 x ESP32 S3 Box

Danke für den Hinweis mit den Docker Add-ons, so werd ich es machen

Gruß
Elmar

Mpon,

Hast Du denn in Proxmox, Mail eingerichtet?
Denn Proxmox erreicht den Mail Provider nicht

Aug 29 12:01:13 pve postfix/smtp[1399731]: connect to mx02.mail.icloud.com[17.57.155.25]:25: Connection refused
Aug 29 12:01:13 pve postfix/smtp[1399731]: connect to mx01.mail.icloud.com[17.42.251.62]:25: Connection refused
Aug 29 12:01:13 pve postfix/smtp[1399731]: connect to mx02.mail.icloud.com[17.57.152.5]:25: Connection refused
Aug 29 12:01:13 pve postfix/smtp[1399731]: connect to mx02.mail.icloud.com[17.56.9.31]:25: Connection refused
Aug 29 12:01:13 pve postfix/smtp[1399731]: connect to mx01.mail.icloud.com[17.57.154.33]:25: Connection refused
Aug 29 12:01:13 pve postfix/smtp[1399731]: A253440CDD: to=<mail@mail>, relay=none, delay=378638, delays=378637/0.01/0.21/0, dsn=4.4.1, status=deferred (connect to mx01.mail.icloud.com[17.57.154.33]:25: Connection refused)

Und das ist ja auch nicht der Grund des Absturz.
Laufen zu den Uhrzeiten irgendwelche Sachen in HA?

So langsam gehen mir auch die Ideen aus :frowning:
Bei einem so gelagertem Problem ist es wirklich schwer remote den richtigen Ansatz zu finden.

VG
Bernd

Hi,

ich wüsste ehrlich gesagt nicht wo, aber ich glaube auf der anderen Seite nicht, dass das zum Absturz führt. Werde aber mal schauen wo es steckt.

Da “openwakeword” bei der CPU immer heraus sticht habe ich mir das mal genauer angeschaut. Ich habe festgestellt, dass die CPU Nutzung immer dann hoch geht wenn ein bestimmter M5 Atom eingeschaltet wird. Möglicherweise ist da ein Fehler drin. Allerdings waren gestern bei dem Absturz alle 3 Geräte aus, von daher kann das eigentlich auch nicht das Problem sein.

Ich muss es halt weiter beobachten.

Eins habe ich noch gefunden:

PROCESSES DISABLED (press 'z' to display)
Warning or critical alerts (last 1 entries)
2024-08-30 10:23:40 (00:00:10) - CRITICAL on CPU_IOWAIT (62,7)

Gruß
Elmar

Moin,

Wo hast Du noch was gefunden?

Da musst Du dann auch mal zeigen, was Du wie eingerichtet hast, ich nutze das nicht, kann also nicht wirklich was dazu beitragen.

Das muss ja nicht heißen, dass openwakeword nicht trotzdem was Verbotenes tut.

Wie sieht denn glances so im Allgemeinen aus?
Ich hab nicht nochmals alles gelesen, aber um welche Hardware handelt es sich?

VG
Bernd

Hi,
gefunden habe ich die Meldung in glances.

Openwakeword habe ich ganz normal als add-on eingerichtet

Habe jetzt Glances beobachtet. Meistens stechen bei der CPU Auslastung

  1. Homeassistant
  2. openwakeword

hervor.

Üblicherweise bleibt es im Rahmen von um die 30% CPU Auslastung, schalte ich die besagten Assist Geräte aus pendelt es sich bei ca. 15% ein.

Aufgefallen ist mir, dass wenn ich zu Hause bin und dadurch direkt auf das System zugreife, selten Probleme auftreten. Wenn ich über Nabu Casa zugreife kommt es eher zu Schwierigkeiten. Wie der oben beschriebene Fall und auch gestern kam es dazu, dass die CPU Auslastung laut glances auf 100% kam, das System allerdings nicht abstürzte. Daraufhin habe ich mal das Core-Protokoll herunter geladen:

home-assistant_2024-09-03T12-44-47.428Z.txt (307,4 KB)

Heute läuft das System was die CPU Auslastung anbelangt normal, hatte aber einen Neustart zwischendurch
Ich habe mir daraufhin mal das Protokoll vom core angeschaut und herunter herunter geladen, weil da Fehlermeldungen zu sehen waren die sonst nicht da waren:

home-assistant_2024-09-04T13-36-28.399Z.txt (305,5 KB)

Ich habe einen Intel NUC:
# Intel Mini-PC, 16 GB DDR4 & 512 GB PCIe SSD Intel NUC 11 Essential, 11. Generation Intel Celeron N5105 Mini-Computer, Unterstützung für 4K UHD | WiFi 5 | Bluetooth 5.1 | integriertes Windows 11 Pro

Den habe ich auf 64GB RAM aufgerüstet, HA ist auf Proxmox VM installiert.

Gruß
Elmar

Moin,

Ich habe die Spezifikationen nur kurz überflogen, dabei ist mir aufgefallen das Du mit den 64 GB etwas über das Ziel des Max. Memory hinweg schießt.
Ich will das jetzt nicht beurteilen, das könnte aber auch der Grund sein, warum sich der Rechner so seltsam verhält.
Wenn Du es mal nur mit einem Riegel und somit 32 GB versuchst, wobei ich nicht weiß, ob der Rechner single Channel Memory verkraftet, was war denn ursprünglich verbaut?

VG
Bernd

Hi,

ich möchte da eigentlich eine local ai installieren, das würde etwas prozessorleistung benötigen aber ich probiers mal aus wenn ich weniger rein mache

GRuß
Elmar