← Thinking

Wie genau sind Schlaf- und Readiness-Scores von Wearables? Was Validierungsstudien zeigen

25 September 2026 · Tom Wuerden

Wie genau sind Schlaf- und Readiness-Scores von Wearables? Was Validierungsstudien zeigen

Eine Referenzseite dazu, welche Werte eines Wearables ein Sensor abliest und welche ein Modell erzeugt, wie groß der Fehler jeweils ist und welche zwei einen Platz in einer Woche verdienen.

Zuerst die Kurzfassung. Eine handelsübliche Uhr oder ein Ring erkennt gut, wann du geschlafen hast, und verfolgt deinen Puls ebenso gut. Bei der Herzratenvariabilität wird es ungenau. Schlafphasen, Readiness- und Erholungsscores, Stresskurven und VO2max werden alle aus diesen wenigen Messgrößen berechnet, und wie groß der Fehler dieser Rechnung ist, steht nirgends auf dem Bildschirm.

Was folgt, ist die lange Antwort, Studie für Studie, die Grenzen jeder einzelnen offen benannt und die vollständige Quellenliste am Ende, und eine kürzere, persönlichere Fassung desselben Arguments erscheint auf Substack. Ich schlafe seit Jahren mit einem Ring und trainiere mit einer Uhr, ein Teil des Folgenden sind also meine eigenen Daten, und ich sage jeweils dazu, wo.

Die Kernpunkte

  • Wann du schläfst, wird gut gemessen. In einem Labortest mit sechs Geräten trennte jedes einzelne Schlaf und Wachsein in 86 bis 89 Prozent der Nacht korrekt, ausgewertet in Abschnitten von dreißig Sekunden, weshalb die Forschenden alle sechs für valide erklärten, wenn es darum geht, wann und wie lange du schläfst.

  • Auch die Herzfrequenz über Nacht wird gut gemessen: Vier der sechs stimmten mit dem EKG überein, mit Intraklassen-Korrelationen von 0,85 oder besser.

  • Die Herzratenvariabilität wird ungenau gemessen. Beim typischen Gerät lagen die Übereinstimmungsgrenzen zum EKG bei 55 bis 77 Millisekunden.

  • Schlafphasen werden ohne das Hirnsignal erschlossen, das sie definiert, zum Teil aus eingebauten Annahmen darüber, wann in der Nacht welche Phase gewöhnlich auftritt.

  • Keiner der Hersteller von vierzehn untersuchten Gesamtscores hat offengelegt, wie der Score berechnet wird.

  • Belastungsbasierte Schätzungen der VO2max liegen im Gruppenmittel recht genau, können bei einer einzelnen Person aber um etwa 10 ml/kg/min danebenliegen.

  • Zwei Werte verdienen deine Aufmerksamkeit: wie stark deine Schlafmitte über eine Woche streut und dein Ruhepuls im Vergleich zu deinem eigenen Normalwert.

Das ist eine erklärende und strategische Perspektive, keine persönliche medizinische Beratung.

Die Ansichten sind die des Autors und keine Aussagen der Atlas Cove Lda.


Die kurze Antwort: gemessen oder berechnet

Jeder Wert auf einem Wearable beginnt bei einem von vier Rohdatenströmen, nämlich einem Beschleunigungssensor für Bewegung, einem optischen Sensor für den Puls, einem kleinen Thermometer, das auf der Haut aufliegt, und der Uhrzeit, und alles, was der Bildschirm darüber hinaus zeigt, ist die Ausgabe eines Modells, das nie besser sein kann als die Menschen, an denen es trainiert wurde. Alles andere ist Arithmetik.

Die nützliche Frage zu jeder Zahl in der App lautet also, aus welchem Datenstrom sie stammt und wie viele Rechenschritte zwischen Sensor und Anzeige liegen; Schlafenszeit, Aufwachzeit und Puls sind nach einem Schritt da. Eine Tiefschlafsumme, ein Readiness-Score oder eine Schätzung der aeroben Kapazität kommen erst nach mehreren heraus, und jeder Schritt fügt Fehler hinzu, die du nicht siehst. Eine Zahl nach einem Schritt verdient mehr Vertrauen als eine nach fünf, ganz gleich, wie selbstbewusst sie auf dem Display steht.

Das ist die ganze Behauptung, und sie ist bewusst eng gefasst. Damit ist nicht gesagt, dass die Geräte schlecht sind. Bei dem, was sie tatsächlich erfassen, sind sie besser als die Forschungsinstrumente, die vor ihnen da waren.


Worin die Sensoren gut sind

Der optische Sensor ist der interessante. Er schickt grünes Licht in die Haut und misst, wie viel davon zurückkommt, was sich mit jedem Pulsschlag ändert, während sich die kleinen Gefäße darunter füllen und leeren, und die Technik, Photoplethysmographie, beruht auf demselben Prinzip wie der Clip, den man dir auf einer Krankenhausstation an den Finger steckt. Eine Herzfrequenz daraus zu gewinnen, braucht fast kein Modell.

Der sauberste Test, den ich kenne, stammt von Miller und Kollegen, die dreiundfünfzig junge Erwachsene für eine einzige Nacht im Schlaflabor mit sechs handelsüblichen Geräten ausstatteten, parallel zu einer vollständigen Polysomnographie und einem EKG (Miller et al., 2022). Vier Geräte saßen am Handgelenk, eines war ein Ring und eines ein Klebepflaster auf der Stirn mit eigenen Elektroden, und als die Nacht in Abschnitten von dreißig Sekunden ausgewertet wurde, lag jedes von ihnen bei Schlaf oder Wachsein in 86 bis 89 Prozent der Zeit richtig, weshalb die Autoren alle sechs für valide erklärten, wenn es darum geht, wann und wie lange jemand schläft. Bei der Herzfrequenz über die Nacht stimmten vier der sechs mit Intraklassen-Korrelationen von 0,85 bis 0,99 mit dem EKG überein. Der Puls ist die leichte Übung.

Auch die übrige Literatur sieht es so. Eine Übersichtsarbeit von 2024 zum Stand der Forschung kam zu dem Schluss, dass aktuelle handelsübliche Geräte den Schlaf, gemessen am Labor, besser erfassen als die klassischen Forschungs-Aktigraphen, mit denen die Schlafforschung jahrzehntelang gearbeitet hat (de Zambotti et al., 2024).

Dieses gute Ergebnis hat eine Schwachstelle, und sie wird später noch wichtig. Jedes Gerät in Millers Studie erkannte mehr als neun von zehn Schlafabschnitten, aber der Anteil echter Wachzeit, den es auch als wach erkannte, lag bei den Geräten an Handgelenk und Finger zwischen 26 und 57 Prozent. Chinoy und Kollegen fanden dasselbe Muster mit einer anderen Auswahl von sieben handelsüblichen Trackern über drei Labornächte: eine Sensitivität für Schlaf von mindestens 0,93, eine Spezifität für Wachsein zwischen 0,18 und 0,54 (Chinoy et al., 2021). Wer still und wach daliegt, sieht für einen Beschleunigungssensor sehr nach Schlaf aus. Kurze Wachphasen mitten in der Nacht rutschen am häufigsten durch.


Herzratenvariabilität: gemessen, aber ungenau

Dein Herz schlägt nicht wie ein Metronom. Der Abstand zwischen zwei Schlägen wird länger und wieder kürzer, jeweils um ein paar Millisekunden, vor allem weil der Vagusnerv mit jedem Atemzug und je nach deiner allgemeinen Verfassung beim Herzen auf die Bremse tritt und sie wieder löst. Die Herzratenvariabilität fasst dieses Schwanken zusammen, und das gebräuchlichste Maß dafür ist rMSSD, die Wurzel aus dem mittleren Quadrat der Differenzen aufeinanderfolgender Schlagabstände. In Ruhe und im Schlaf gilt sie weithin als Fenster zur parasympathischen Aktivität, und die weiter unten besprochene Ring-Studie berechnete sie über Zeitfenster von einer und von fünf Minuten, eben um schnelle parasympathische Veränderungen zu erfassen (Altini and Kinnunen, 2021).

HRV ist heikler. Eine Pulsfrequenz verkraftet ein paar unsauber erfasste Schläge. Ein Maß, das aus den Differenzen einzelner Intervalle berechnet wird, verkraftet sie nicht, also muss ein optischer Sensor jedes Intervall verwerfen, bei dem er sich nicht sicher ist, und die Ring-Studie behielt ein Intervall nur, wenn auch die zwei davor und die zwei danach sauber aussahen. Millers sechs Geräte waren sich nicht einmal über das Zeitfenster einig: Manche gaben die HRV über die ganze Nacht an, eines über Blöcke von vier Stunden, eines aus einem dreiminütigen Test, den du selbst startest.

Das Ergebnis in derselben Labornacht war mäßig. Vier der sechs Geräte stimmten bei der HRV mit dem EKG überein, mit Intraklassen-Korrelationen von 0,63 bis 0,69, und ihre Übereinstimmungsgrenzen reichten rund 55 bis 77 Millisekunden nach beiden Seiten, ein Band, das breiter ist als die meisten Veränderungen von Tag zu Tag, in die Menschen morgens beim Öffnen der App eine Bedeutung hineinlesen. Ein Gerät erreichte 0,99. Allerdings mit Rohdaten, die sein Hersteller den Forschenden zur Verfügung stellte, und die zeigt dir die App an deinem Handgelenk nicht.

HRV vom Handgelenk oder vom Finger ist ein Indikator, und der Wert eines einzelnen Morgens sagt für sich genommen sehr wenig. So habe ich meine immer gelesen, als eine Linie unter mehreren, und die Validierungsdaten geben mir keinen Grund, sie aufzuwerten.


Wie eine Uhr Schlafphasen schätzt, ganz ohne Hirnsignal

Im Labor ist eine Schlafphase eine Definition, angewandt auf Hirnaktivität. Eine Fachkraft wertet elektrische Signale von der Kopfhaut, Augenbewegungen und Muskelspannung in Abschnitten von dreißig Sekunden aus, und Tiefschlaf ist der Name für ein Muster großer, langsamer EEG-Wellen, und weil ein Gerät am Handgelenk keine dieser Messgrößen hat, ist jede Phase, die es meldet, eine Vorhersage aus Bewegung, Puls, Temperatur und Uhrzeit.

Walch und Kollegen haben offen veröffentlicht, wie sich eine solche Vorhersage bauen lässt, mit einer gewöhnlichen Uhr aus dem Handel und einunddreißig Menschen mit gesundem Schlaf (Walch et al., 2019). Bewegung allein war der schwächste Prädiktor, um REM von Non-REM zu trennen. Die Herzfrequenz brachte viel. Dann kam eine dritte Eingangsgröße, die die Autoren Clock Proxy nannten: eine Kurve, die den zirkadianen Schlafantrieb über die Nacht annähert. Mit allen drei Eingangsgrößen trennte das Modell Wachsein, REM und Non-REM in etwa 72 Prozent der Zeit korrekt.

Altini und Kinnunen, beide mit dem Hersteller des Rings verbunden, den ich trage, gingen mit 440 Nächten von 106 Menschen weiter und legten jeden Schritt offen (Altini and Kinnunen, 2021). Der Beschleunigungssensor allein ordnete die vier Schlafphasen in 57 Prozent der Zeit richtig zu, die Temperatur dazu hob das auf 60, und die Herzratenvariabilität brachte es auf 76, und auf diesen Schritt entfällt der größte Teil des Zugewinns. Die letzten drei Punkte, bis auf 79, kamen aus dem, was sie sensorunabhängige Merkmale nennen: ein Kosinus als Stellvertreter für den zirkadianen Rhythmus, ein exponentieller Abfall als Stellvertreter für den Schlafdruck und eine Linie, die über die Nacht von null auf eins steigt, alle drei hinzugefügt, um dem Modell zu sagen, dass Tiefschlaf meist früh kommt und REM spät. Ich habe dieses Paper mit mehr Vergnügen gelesen, als ich erwartet hatte, weil es klar sagt, was die meisten Produktseiten weglassen.

Dieses Ergebnis verdient Anerkennung. Ein Wert von 79 Prozent liegt nah an der Übereinstimmung zweier geschulter menschlicher Auswerter bei derselben Aufzeichnung, die das Paper mit 82 bis 83 angibt, und für eine gewöhnliche Nacht ist das gute Ingenieursarbeit.

Millers Tabellen nach Schlafphase zeigen, wo die schwierige Stelle liegt. Von den Dreißig-Sekunden-Abschnitten, die das Labor als Tiefschlaf gewertet hatte, markierten die vier Geräte an Handgelenk und Finger, die Tiefschlaf gesondert ausweisen, zwischen 28 und 62 Prozent ebenfalls als Tiefschlaf, und beim REM kamen dieselben vier auf 49 bis 66 Prozent. Zählt man alle Phasen und das Wachsein zusammen, stimmten die Geräte an Handgelenk und Finger in 50 bis 61 Prozent der Zeit mit dem Labor überein. Das Stirnpflaster, als einziges Gerät mit direktem Zugang zu Hirnsignalen, erreichte insgesamt 65 Prozent und erkannte 68 Prozent des Tiefschlafs. Das Gerät mit dem Hirnsignal schnitt bei der Phase am besten ab, die durch das Hirnsignal definiert ist, und viel anderes war auch nicht zu erwarten.


Warum ausgerechnet die untypische Nacht die Schwachstelle ist

Sieh dir an, von wem diese Modelle gelernt haben. Walchs Gruppe schloss Menschen mit Insomnie aus, ebenso Schichtarbeitende und alle, die im Vormonat mehr als zwei Zeitzonen überquert hatten, und im Abschnitt zu den Limitationen schrieben die Autoren selbst, dass die Genauigkeit bei Insomnie sinken könnte, weil die Methode auf ein normal arbeitendes autonomes Nervensystem angewiesen ist. Altini und Kinnunen trainierten ebenfalls an Menschen mit gesundem Schlaf.

Chinoys Studie prüfte die andere Seite direkt. Eine der drei Labornächte jeder teilnehmenden Person wurde absichtlich gestört, zerstückelt, so wie eine schlechte Nacht zerfällt, und in diesen Nächten schnitten die Tracker schlechter ab. Die Autoren fordern, die Geräte in anderen Gruppen und Umgebungen zu testen, bevor jemand die Ergebnisse weiter strapaziert.

Diese Befunde nebeneinanderzulegen, ist mein eigener Schritt, getestet hat das keine der beiden Studien: Ein Modell, das sich zum Teil darauf stützt, wo Phasen in einer typischen Nacht gewöhnlich liegen, dürfte genau in der Nacht am wenigsten verlässlich sein, die nicht typisch ist. Das ist die Nacht mit Jetlag, die Nacht mit einem kranken Kind, die Nacht, in der du um drei wach liegst. Es ist auch die Nacht, nach der du am ehesten die App öffnest, um sie zu verstehen.

Die Algorithmen im Handel sind proprietär. Ich kann dir nicht sagen, dass irgendein bestimmtes Produkt wie die beiden veröffentlichten Rezepte arbeitet. Was ich sagen kann: Beide veröffentlichten Rezepte brauchten die Uhrzeit, um ihr bestes Ergebnis zu erreichen.


VO2max von der Uhr: eine Schätzung mit breiter Fehlerspanne

Während der Vorbereitung auf Cascais zeigte mir meine Uhr drei Werte, im April 54,7, im Juli 52,4 und im Oktober 51,6, ein Rückgang um 3,1 Punkte über sechs Monate, in denen alles andere dafür sprach, dass das Training gut lief. Ich nahm ihn für bare Münze. Im Juli hätte ich wegen dieses mittleren Werts beinahe Intervalleinheiten zurück in einen Plan genommen, der keinen Platz mehr dafür hatte. Der Brustgurt machte die Pulsdaten besser. Der Sauerstoffwert blieb trotzdem geraten, denn an mir hat nie etwas Sauerstoff gemessen.

Die Metaanalyse von Molina-Garcia und Kollegen fasste vierzehn Validierungsstudien zusammen und legte dar, wie die beiden Hauptarten von Schätzverfahren aufgebaut sind (Molina-Garcia et al., 2022). Das belastungsbasierte Verfahren erfasst ein paar persönliche Angaben, mindestens das Alter, zeichnet Herzfrequenz und Geschwindigkeit während eines Laufs oder einer Radfahrt auf, behält die Abschnitte, die verlässlich aussehen, und leitet die VO2max daraus ab, wie sich Herzfrequenz und Geschwindigkeit zueinander verhalten. Das ruhebasierte Verfahren arbeitet mit Ruhepuls, Herzratenvariabilität, Alter, selbst angegebener Aktivität und ein paar weiteren Angaben, die du eintippst, ganz ohne Belastung in der Rechnung.

Im Mittel lagen die ruhebasierten Schätzungen rund 2 ml/kg/min zu hoch, mit Übereinstimmungsgrenzen von rund minus 13 bis plus 17. Die belastungsbasierten Schätzungen hatten fast keine mittlere Abweichung, minus 0,09, aber Übereinstimmungsgrenzen von etwa 10 ml/kg/min nach beiden Seiten, weshalb die Autoren die belastungsbasierte Schätzung so zusammenfassen: brauchbar, um eine Population zu beschreiben, und schwach bei jeder einzelnen Person darin.

Zehn Punkte in jede Richtung sind mehr als das Dreifache des Rückgangs, der mir beinahe den Sommer umgekrempelt hätte. Ich lese eine VO2max von der Uhr heute als grobe Standortbestimmung, und in keine Veränderung, die kleiner ist als dieses Band, lese ich eine Richtung hinein.

Es gibt ein ernsthaftes Gegenargument. Die Übereinstimmung mit dem Labor über viele Menschen ist eine andere Frage als die, ob ein Gerät die Veränderungen einer einzelnen Person zuverlässig abbildet, und ein Gerät, das jeden Nutzer um vier Punkte überschätzt, könnte den Trend jedes Einzelnen trotzdem richtig verfolgen. Die Metaanalyse prüft das nicht, und ich habe keine Studie gefunden, die es tut, also behandle ich es als offen. Die längere Fassung dazu, warum VO2max über ein langes Rennen weniger entscheidet, als viele denken, steht in was VO2max entscheidet und was nicht.


Was in einem Readiness- oder Erholungsscore steckt

Doherty und Kollegen haben sich vierzehn Gesamtscores von zehn Herstellern angesehen, zu Readiness, Erholung, Belastung, Stress und Energie (Doherty et al., 2025). Von diesen vierzehn nutzten 86 Prozent die Herzratenvariabilität als Eingangsgröße und 79 Prozent den Ruhepuls. Keiner der Hersteller legte die Formel offen. Zeitfenster und Gewichtungen unterschieden sich, und nur wenige konnten auf eine begutachtete Validierung verweisen, und weil Altini, einer der fünf Autoren, zugleich Erstautor des Ring-Papers ist, kommt die Kritik aus den eigenen Reihen und nicht von jemandem, der dem Fach ohnehin übelwill.

Der typische Score mischt also die ungenau gemessene Eingangsgröße mit der gut gemessenen, in Anteilen, die außerhalb der Firma niemand sehen kann, und gibt zwei Ziffern zurück. Ich bin von der Ausbildung her Ingenieur, und das stört mich auf eine ganz bestimmte Weise: Eine Zahl aus einem verborgenen Rezept lässt sich nicht überprüfen, und darum lässt sich auch nicht zeigen, dass sie falsch ist. Das ist der ganze Einwand. Ich habe vor einer Weile aufgehört, auf meinen zu schauen, vor allem weil mir auffiel, dass ich nichts anders machte, wenn er ausschlug.

Was fairerweise für Scores spricht, ist nicht von der Hand zu weisen. Eine Farbe am Morgen ist einfach, und für jemanden, der dem Schlaf sonst gar keine Beachtung schenken würde, tut ein Schubs Richtung Bett zu einer vernünftigen Uhrzeit gut, auch wenn die Rechnung hinter dem Schubs wackelig ist.

Das Risiko zeigt sich anderswo. In Gavriloffs Studie trugen dreiundsechzig Menschen mit Insomnie ein Gerät und bekamen am nächsten Morgen erfundenes Feedback, per Zufall entweder eine gute oder eine schlechte Nacht (Gavriloff et al., 2018). Wer zu hören bekam, schlecht geschlafen zu haben, fühlte sich tagsüber nach eigenen Angaben weniger wach, schläfriger und erschöpfter, während beide Gruppen in einem objektiven Vigilanztest gleich abschnitten. Das sind Menschen mit Insomnie, über einen Tag, also ist es kein allgemeines Gesetz. Es ist trotzdem der klarste Beleg, den ich kenne, dass eine Schlafzahl verändern kann, wie sich ein Tag anfühlt, ohne zu verändern, was du an ihm leisten kannst.

Es heißt auch, dass ich etwas korrigieren muss. In dem ersten Beitrag dieser Reihe habe ich vorgeschlagen, dem wöchentlichen Erholungstrend zu folgen, den eine Uhr dir liefert. Heute würde ich mich dabei auf den Ruhepuls beschränken, der diesem Trend zugrunde liegt.


Was sich anzuschauen lohnt und ein Test über sechs Wochen

Meine eigene Liste ist kurz. Der Ring beantwortet mir vier Fragen: wie lange ich geschlafen habe, die Mitte der Nacht und wie sie über sieben Tage wandert, Puls und HRV als Indikatoren und ob ich zu lange gesessen habe. Die Uhr beantwortet, wie weit, wo und bei welcher Herzfrequenz. Alles andere auf beiden Bildschirmen lasse ich in Ruhe.

Fang mit der Schlafmitte an. Sie ist der Punkt genau zwischen Einschlafen und Aufwachen, und entscheidend ist, wie weit sie über eine Woche wandert. Für regelmäßige Schlafzeiten ist die Beleglage ungewöhnlich stark: In einer Kohorte von 60.977 Menschen fanden Windred und Kollegen, dass die Regelmäßigkeit des Schlafs das Sterberisiko stärker vorhersagte als die Schlafdauer (Windred et al., 2024). Das ist ein Zusammenhang, und die Autoren sind vorsichtig, was die Ursache angeht. Das Rohmaterial aber stammt aus Uhrzeit und Beschleunigungssensor, den beiden Teilen, die ein Gerät am besten erfasst. Warum das Timing so viel Gewicht hat, steht in Schlafarchitektur statt Schlafstunden. Behalte die Schlafdauer daneben im Blick, denn du schaust ohnehin hin, und das Gerät liegt dabei ungefähr richtig.

Der zweite Wert ist der Ruhepuls, gemessen an deinem eigenen Verlauf. Quer und Kollegen beobachteten 92.457 Erwachsene in den Vereinigten Staaten, die Tracker am Handgelenk trugen, über einen Median von 320 Tagen pro Person, und von Mensch zu Mensch unterschied sich der normale Ruhepuls um bis zu 70 Schläge pro Minute (Quer et al., 2020), ein Normbereich für die Bevölkerung sagt dir also sehr wenig über dich selbst. Bei ein und derselben Person war der Wert deutlich stabiler, mit einer leichten jahreszeitlichen Verschiebung, und 20 Prozent der Menschen hatten eine Woche oder mehr, in der er sich um mindestens 10 Schläge verschob. Auf diese Wochen lohnt es sich zu achten. Quers Daten erklären sie nicht.

Der Test, den ich vorschlagen würde, kostet nichts. Lies sechs Wochen lang nur diese Werte und nichts anderes auf dem Bildschirm. Immer wenn du vor einer Entscheidung einen Score hättest sehen wollen (eine harte Einheit, ein spätes Essen, noch ein Kaffee), notiere die Entscheidung, die du ohne ihn getroffen hast. Geh am Ende die Liste durch, markiere jede Entscheidung, die ein Score hätte ändern können, und frag dich, ob sie dadurch besser geworden wäre. Meine Vermutung: sehr wenige. Ich würde gern von allen hören, bei denen die Zählung anders ausfällt.


Die Belege im Überblick: gemessen oder berechnet

Jeder Wearable-Wert nach Herkunft und typischem Fehler, aus den auf dieser Seite zitierten Studien
Wert Gemessen oder berechnet Typischer Fehler
Einschlafen, Aufwachen, Schlafdauer Gemessen: Uhrzeit und Bewegung 86 bis 89 Prozent Übereinstimmung; kurzes Aufwachen oft übersehen
Herzfrequenz über Nacht Gemessen: optischer Puls ICC 0,85 bis 0,99 bei vier von sechs Geräten
Herzratenvariabilität Gemessen, aber ungenau ICC 0,63 bis 0,69; Übereinstimmungsgrenzen 55 bis 77 ms
Schlafphasen Berechnet aus Bewegung, Puls, Temperatur und Uhrzeit 50 bis 61 Prozent Übereinstimmung, Phasen und Wachsein zusammen
Readiness-, Erholungs- und Stress-Scores Berechnet, Formel nicht offengelegt Unbekannt; wenige begutachtete Validierungen
VO2max, belastungsbasiert Berechnet aus Herzfrequenz und Geschwindigkeit Im Mittel nah dran; für eine Person etwa 10 ml/kg/min in jede Richtung
VO2max, ruhebasiert Berechnet aus Ruhedaten Im Mittel rund 2 ml/kg/min zu hoch; breiteres Band

Einschränkungen und was mich umstimmen würde

Eine Seite wie diese sollte ehrlich sagen, wo ihre Belege dünn sind, hier also die Grenzen, Studie für Studie.

  • Die besten Validierungsdaten stammen von jungen, gesunden Menschen. Millers Freiwillige waren im Schnitt 25 Jahre alt und verbrachten je eine Nacht im Labor; auch Chinoys Teilnehmende waren gesunde junge Erwachsene. An jemandem in den Fünfzigern mit zerstückeltem Schlaf wurden diese Geräte nicht getestet.

  • Geräte und Algorithmen ändern sich. Firmware-Updates verändern die Modelle, jede einzelne Validierung beschreibt also eine Version zu einem Zeitpunkt. Die Rangfolge, gemessen vor berechnet, hat sich in den Studien hier bestätigt; die genauen Prozentwerte werden nicht so stabil bleiben.

  • Durch die Literatur ziehen sich Verbindungen zur Industrie. Millers Gruppe gibt Forschungsförderung durch einen Hersteller an, und beide Autoren des Ring-Papers waren mit der Firma verbunden, die den Ring herstellt. Keine der beiden Tatsachen macht die Ergebnisse falsch. Das Ring-Paper ist eher noch die offenste Darstellung davon, wie die Phasenerkennung funktioniert.

  • Die Score-Übersicht ist nach ihrem Abstract zitiert. Die Übersicht von Doherty und Kollegen wird hier nur für das herangezogen, was ihr Abstract festhält: den Anteil der Scores, die die jeweilige Eingangsgröße nutzen, das Fehlen offengelegter Formeln und die spärliche Validierung.

  • Der Befund zum Schein-Feedback ist eng begrenzt. Dreiundsechzig Menschen, die die Kriterien einer Insomnie erfüllten, ein Tag Feedback. Er zeigt, dass der Mechanismus möglich ist, nicht wie groß er bei allen anderen ist.

  • Ob der Trend stimmt, ist ungetestet, soweit ich sehe. Eine Studie, die bei denselben Menschen über Monate wiederholt die VO2max im Labor und mit einer Uhr misst, würde zeigen, ob man der Richtung einer Uhr trauen kann, selbst wenn man ihrem Niveau nicht trauen kann. Das würde ändern, wie ich meine eigenen drei Werte lese.

  • Das Argument der untypischen Nacht ist eine Schlussfolgerung. Es verbindet zwei Befunde; ein direkter Test der Phasengenauigkeit in gestörten Nächten, Phase für Phase, mit Modellen, die an Menschen mit gesundem Schlaf trainiert wurden, würde es bestätigen oder widerlegen.


Wo Atlas Cove hineinpasst

Die schlichtesten Zahlen aus Cascais sind immer noch die, denen ich am meisten traue: Herzfrequenz 143 beim Schwimmen, 142 auf dem Rad, 144 beim Laufen, von einem Brustgurt, über mehr als elf Stunden auf zwei Schläge genau gehalten. Da hat kein Modell mitgerechnet. Das Trainingstagebuch, das ich in jenem Jahr führte, erfasste eine einzige Sache, Stunden, und hatte keinen Platz dafür, wann ich ins Bett ging, was ein wenig peinlich ist, wenn man sieht, wo diese Seite am Ende ankommt.

Die erste Messwoche, die wir bei Atlas Cove ausgerichtet haben, folgte derselben Logik. Die Zahl, die die meiste Arbeit leistete, kam von einem Handdynamometer: eine Feder, eine Skala und kein Modell dahinter. Die Griffkraft half jedem Gast zu sehen, ob die kommenden Monate eher auf Kraft, Ausdauer oder Schlaf setzen sollten, und weil wir sie zweimal gemessen haben, haben wir auch gelernt, dass sie sich mit der Tageszeit verschiebt, was man wissen sollte, bevor jemand in einen einzelnen Wert eine Bedeutung hineinliest. Die Schlafdaten verdienten sich ihren Platz allein über das Timing: die Mitte der Nacht, die Minuten bis zum Einschlafen und ob jemand um drei oder um fünf aufwachte.

Deshalb beginnt eine Atlas-Cove-Woche mit Messen. Unsere Gastgeber messen etwas nur, wenn sie vorher sagen können, was ein hohes und was ein niedriges Ergebnis jeweils an deinen Tagen ändern würde. Eine Zahl, die diesen Test nicht besteht, kommt in deiner Auswertung nicht vor, und das ist dieselbe Regel wie in dem Artikel über Laktat.


Häufige Fragen

Sind Schlafscores von Uhr oder Ring genau?

Das Timing dahinter schon. Wann du eingeschlafen und aufgewacht bist, wird gut gemessen, mit 86 bis 89 Prozent Übereinstimmung mit einem Labor im besten Test, den ich kenne. Der Score selbst nicht. Er wird aus nicht offengelegten Eingangsgrößen und Gewichtungen berechnet, also kann dir außerhalb der Firma niemand sagen, wie genau er ist.

Wie genau erfasst ein Wearable den Tiefschlaf?

Ungenau. In einem Laborvergleich markierten Geräte an Handgelenk und Finger zwischen 28 und 62 Prozent des echten Tiefschlafs als Tiefschlaf, weil Tiefschlaf über Hirnwellen definiert ist, die sie nicht aufzeichnen können. Ich würde die nächtliche Tiefschlafsumme als grobe Schätzung lesen und nie als Ziel.

Kann ich dem HRV-Wert meiner Uhr trauen?

Als Trend im Vergleich zu deinem eigenen Normalwert, mit Vorsicht. Mit einem EKG stimmten die meisten Geräte nur mäßig überein, mit Übereinstimmungsgrenzen um 55 bis 77 Millisekunden, ein einzelner Morgenwert sagt also sehr wenig. Mehrere Morgenwerte in Folge, die in dieselbe Richtung zeigen, sagen mehr.

Stimmt die VO2max auf meiner Uhr?

Im Mittel über viele Menschen liegen belastungsbasierte Schätzungen nah dran. Bei einer einzelnen Person können sie um etwa 10 ml/kg/min in jede Richtung danebenliegen, deshalb behandle ich meine als grobe Standortbestimmung und ignoriere Veränderungen, die kleiner sind.

Was sollte ich statt eines Readiness-Scores verfolgen?

Zwei Dinge: wie stark sich deine Schlafmitte über eine Woche verschiebt und dein Ruhepuls im Vergleich zu deiner eigenen Baseline. Beide stammen aus dem, was ein Gerät direkt misst, und für regelmäßige Schlafzeiten ist die Beleglage stärker als für jeden Gesamtscore.


Quellen

  1. Miller, D. J., Sargent, C., & Roach, G. D. (2022). A validation of six wearable devices for estimating sleep, heart rate and heart rate variability in healthy adults. Sensors, 22(16), 6317. DOI: 10.3390/s22166317

  2. Walch, O., Huang, Y., Forger, D., & Goldstein, C. (2019). Sleep stage prediction with raw acceleration and photoplethysmography heart rate data derived from a consumer wearable device. Sleep, 42(12), zsz180. DOI: 10.1093/sleep/zsz180

  3. Chinoy, E. D., Cuellar, J. A., Huwa, K. E., Jameson, J. T., Watson, C. H., Bessman, S. C., Hirsch, D. A., Cooper, A. D., Drummond, S. P. A., & Markwald, R. R. (2021). Performance of seven consumer sleep-tracking devices compared with polysomnography. Sleep, 44(5), zsaa291. DOI: 10.1093/sleep/zsaa291

  4. Windred, D. P., Burns, A. C., Lane, J. M., Saxena, R., Rutter, M. K., Cain, S. W., & Phillips, A. J. K. (2024). Sleep regularity is a stronger predictor of mortality risk than sleep duration: a prospective cohort study. Sleep, 47(1), zsad253. DOI: 10.1093/sleep/zsad253

  5. Quer, G., Gouda, P., Galarnyk, M., Topol, E. J., & Steinhubl, S. R. (2020). Inter- and intraindividual variability in daily resting heart rate and its associations with age, sex, sleep, BMI, and time of year: retrospective, longitudinal cohort study of 92,457 adults. PLOS ONE, 15(2), e0227709. DOI: 10.1371/journal.pone.0227709

  6. Doherty, C., Baldwin, M., Lambe, R., Burke, D., & Altini, M. (2025). Readiness, recovery, and strain: an evaluation of composite health scores in consumer wearables. Translational Exercise Biomedicine, 2(2), 128-144. DOI: 10.1515/teb-2025-0001

  7. Gavriloff, D., Sheaves, B., Juss, A., Espie, C. A., Miller, C. B., & Kyle, S. D. (2018). Sham sleep feedback delivered via actigraphy biases daytime symptom reports in people with insomnia: implications for insomnia disorder and wearable devices. Journal of Sleep Research, 27(6), e12726. DOI: 10.1111/jsr.12726

  8. Molina-Garcia, P., Notbohm, H. L., Schumann, M., Argent, R., Hetherington-Rauth, M., Stang, J., Bloch, W., Cheng, S., Ekelund, U., Sardinha, L. B., Caulfield, B., Brønd, J. C., Grøntved, A., & Ortega, F. B. (2022). Validity of estimating the maximal oxygen consumption by consumer wearables: a systematic review with meta-analysis and expert statement of the INTERLIVE network. Sports Medicine, 52(7), 1577-1597. DOI: 10.1007/s40279-021-01639-y

  9. Altini, M., & Kinnunen, H. (2021). The promise of sleep: a multi-sensor approach for accurate sleep stage detection using the Oura ring. Sensors, 21(13), 4302. DOI: 10.3390/s21134302

  10. de Zambotti, M., Goldstein, C., Cook, J., Menghini, L., Altini, M., Cheng, P., & Robillard, R. (2024). State of the science and recommendations for using wearable technology in sleep and circadian research. Sleep, 47(4), zsad325. DOI: 10.1093/sleep/zsad325


Das ist eine erklärende und strategische Perspektive, keine persönliche medizinische Beratung.

Die Ansichten sind die des Autors und keine Aussagen der Atlas Cove Lda.

Tom Wuerden

Tom Wuerden · Co-Founder

Engineer turned Ironman

Selected Cohorts Now Enrolling

So that every guest receives deep personal attention, our residencies are capped to small groups and available by application only.

Next Cohort: 7–12 November 2026 · Casas na Ferraria, Portugal · All-Inclusive

Begin Your Application

Every guest answers a short health questionnaire when booking, and completes a pre-arrival assessment before the residency.

Prefer to speak with our team first? Ask us anything on WhatsApp →

Next Cohort: 7–12 November 2026Casas na Ferraria, Portugal · All-Inclusive
Begin Your Application