Warum ist die MTTR so wichtig?
Die Mean Time to Recovery, kurz MTTR und auch Time to Recovery genannt, misst, wie schnell ein Team nach einem Ausfall den Normalbetrieb wiederherstellt. Als DORA-Metrik heißt sie seit 2023 Failed Deployment Recovery Time und zählt nur Ausfälle durch Änderungen. Das Elite-Cluster im DORA-Report 2024 stellt in unter einer Stunde wieder her.
Auch bekannt als: MTTR · Mean Time to Repair · Mean Time to Restore · Mittlere Wiederherstellungszeit
Ist Mean Time to Recovery (MTTR) bei Ihnen gerade ein Thema?
Wir fragen kurz, wie dringend das Thema bei Ihnen gerade ist. Je nach Antwort zeigen wir Ihnen direkt den passenden nächsten Schritt — ganz ohne Formular.
Die Formel ist in allen Varianten dieselbe: MTTR = Summe der Ausfallzeiten geteilt durch die Zahl der Ausfälle. Drei Störungen mit 30, 60 und 90 Minuten ergeben eine MTTR von 60 Minuten. Das R steht aber für verschiedene Wörter, und jedes setzt den Endpunkt woanders. Mean Time to Repair endet, wenn das defekte Teil instand gesetzt ist, so rechnet die Instandhaltung. Mean Time to Recovery endet, wenn das System wieder läuft. Mean Time to Restore endet, wenn der Service für die Nutzer wieder verfügbar ist, auch über eine Umgehung. Mean Time to Resolve endet erst, wenn die Ursache behoben ist, einschließlich Nacharbeit. Welche Variante ein Team wählt, ist zweitrangig. Alle Beteiligten müssen dieselbe meinen, und der Startpunkt muss feststehen, meist die Erkennung der Störung.
In der Instandhaltung steht die MTTR neben zwei weiteren Kennzahlen. Die MTBF (Mean Time Between Failures) ist die mittlere Betriebszeit zwischen zwei Ausfällen einer reparierbaren Anlage, berechnet als Betriebszeit geteilt durch die Zahl der Ausfälle. Die MTTF (Mean Time To Failure) gilt für Teile, die nicht repariert, sondern getauscht werden, etwa Sicherungen, Lüfter oder Sensoren. Aus MTBF und MTTR ergibt sich die Verfügbarkeit: MTBF geteilt durch die Summe aus MTBF und MTTR. Ein Rechenbeispiel: Eine Maschine ist im Monat 720 Stunden eingeplant, fällt viermal aus und steht insgesamt 8 Stunden. Die Betriebszeit beträgt 712 Stunden, die MTBF 178 Stunden, die MTTR 2 Stunden, die Verfügbarkeit 178 geteilt durch 180, also 98,9 Prozent. Eine MTBF ist übrigens keine Lebensdauer, darauf weist auch der ZVEI in seinem Leitfaden zum „Mythos MTBF" hin.
In den DORA-Metriken (DevOps Research and Assessment) hatte die Kennzahl lange den Namen Time to Restore Service. Seit dem Report 2023 heißt sie Failed Deployment Recovery Time, und sie wurde dabei enger gefasst. Gemessen wird nur noch die Zeit bis zur Wiederherstellung nach einem Deployment, das eine Störung verursacht hat. Ein Ausfall durch äußere Ursachen wie ein gestörtes Rechenzentrum zählt nicht mehr mit, weil die alte Definition beides vermischte. Im DORA-Report 2024 lag das Elite-Cluster unter einer Stunde, das High- und das Medium-Cluster unter einem Tag und das Low-Cluster zwischen einer Woche und einem Monat. Anders als früher ordnet DORA die Kennzahl inzwischen dem Durchsatz zu und nicht mehr der Stabilität.
In der Fabrik treffen beide Bedeutungen aufeinander. Die Instandhaltung rechnet die MTTR der Maschine, die IT die Recovery Time der Software, und bei einem fehlgeschlagenen Update auf die Steuerung zählt derselbe Stillstand in beiden Statistiken. Wer beide Seiten an einen Tisch bringt, sollte deshalb zuerst die Endpunkte abgleichen. Ein zweiter Fehler betrifft den Mittelwert: Zwanzig harmlose Neustarts von fünf Minuten lassen einen achtstündigen Ausfall in der MTTR fast verschwinden. Das 90. Perzentil neben dem Mittelwert zeigt, wie lange die schlimmen Fälle wirklich dauern.
Health-Check löst den Rollback aus, bevor jemand anruft
Ein Fertigungsbetrieb stellte fehlerhafte Releases seiner Leitstand-Software von Hand wieder her, was je nach Uhrzeit mehrere Stunden dauerte. Das Team verknüpft Health-Checks nach jedem Deployment mit einem automatischen Rollback auf die letzte stabile Version. Schlägt der Check fehl, läuft die alte Version nach wenigen Minuten wieder, und die Fehlersuche findet am nächsten Morgen ohne Zeitdruck statt.
Distributed Tracing verkürzt die Suche nach der Ursache
Ein IT-Team verbrachte bei Störungen den größten Teil der Ausfallzeit damit, herauszufinden, welcher von zwanzig Services betroffen war. Es instrumentiert alle Services mit Distributed Tracing, sodass eine fehlerhafte Anfrage über alle Dienstgrenzen hinweg sichtbar wird. Die Diagnose dauert nun Minuten statt Stunden, und die MTTR fällt von mehreren Stunden auf unter 30 Minuten.
Wo verlieren Sie Zeit bei der Wiederherstellung?
MTTR entscheidet, wie schnell Sie nach einem Ausfall wieder laufen — der Engpass sitzt im Erkennen, Beheben oder Zurückrollen. Zwei Klicks ordnen ein.
Wo geht die meiste Zeit verloren?
- Wie berechnet man die MTTR?
- MTTR = Summe aller Ausfall- oder Reparaturzeiten eines Zeitraums geteilt durch die Zahl der Ausfälle. Drei Störungen mit 30, 60 und 90 Minuten ergeben 180 Minuten geteilt durch 3, also eine MTTR von 60 Minuten. Legen Sie vorher fest, wann die Uhr startet und stoppt, üblich sind die Erkennung der Störung und die wiederhergestellte Funktion.
- Was ist MTBF und MTTR?
- Die MTBF (Mean Time Between Failures) misst, wie lange eine reparierbare Anlage im Mittel zwischen zwei Ausfällen läuft, die MTTR, wie lange die Instandsetzung danach dauert. Die MTBF berechnen Sie als Betriebszeit geteilt durch die Zahl der Ausfälle: 1.000 Betriebsstunden mit vier Ausfällen ergeben 250 Stunden. Zusammen ergeben beide die Verfügbarkeit, MTBF geteilt durch die Summe aus MTBF und MTTR. Bei 250 Stunden MTBF und 2 Stunden MTTR sind das rund 99,2 Prozent.
- Was bedeutet MTTF?
- MTTF steht für Mean Time To Failure, die mittlere Betriebszeit bis zum Ausfall eines Teils, das nicht repariert, sondern ersetzt wird. Fallen zehn baugleiche Sensoren nach zusammen 400.000 Betriebsstunden aus, beträgt die MTTF 40.000 Stunden. Die Kennzahl ist ein statistischer Mittelwert über viele Teile und sagt nicht, wie lange ein einzelnes Exemplar hält.
- Was bedeutet MTTR bei den DORA-Metriken?
- Bei DORA heißt die Kennzahl seit 2023 Failed Deployment Recovery Time und misst die Zeit bis zur Wiederherstellung nach einem Deployment, das eine Störung ausgelöst hat. Ausfälle ohne Zusammenhang mit einer Änderung zählen nicht mit. Im DORA-Report 2024 stellte das Elite-Cluster den Betrieb in unter einer Stunde wieder her, High- und Medium-Cluster in unter einem Tag, das Low-Cluster brauchte eine Woche bis einen Monat.
- Was unterscheidet MTTD, MTTA und MTTR?
- Die drei Kennzahlen zerlegen denselben Vorfall in aufeinanderfolgende Abschnitte. Die MTTD (Mean Time to Detect) misst, bis die Störung bemerkt wird, die MTTA (Mean Time to Acknowledge), bis jemand aus der Rufbereitschaft den Alarm übernimmt, und die MTTR, bis die Funktion wieder da ist. Die Trennung zeigt den Engpass. Liegt der Großteil der Ausfallzeit in der MTTD, fehlt Monitoring. Liegt er in der MTTA, klemmt der Eskalationsweg, und das ist kein technisches Problem.
- Was verkürzt die MTTR am stärksten?
- Am meisten bringt eine schnellere Diagnose, weil in unseren Projekten die Suche nach der Ursache meist länger dauert als die Behebung selbst. Dafür braucht es Observability mit Logs, Metriken und Traces. Automatisierte Rollbacks und Runbooks beschleunigen danach die Behebung. Kleine Deployments helfen zusätzlich, weil die fehlerhafte Änderung schneller gefunden ist, wenn nur drei Commits in Frage kommen.
Wo steht Ihr Team bei Mean Time to Recovery (MTTR)?
Uns interessiert, wo Ihr Team bei diesem Thema steht. Auf Basis Ihrer Antwort schlagen wir Ihnen den sinnvollsten nächsten Schritt vor — ganz ohne Formular.
Weiterführende Primärquellen zu Mean Time to Recovery (MTTR): Normtexte, Hersteller- und Projektdokumentation. Alle Ziele öffnen in einem neuen Tab.
- /01DORA / Google CloudDORA Metrics Guide(externe Seite, öffnet in neuem Tab)
Definition der Wiederherstellungszeit und Abgrenzung zu verwandten Kennzahlen.
- /02Google SRE WorkbookIncident Response(externe Seite, öffnet in neuem Tab)
Rollen, Eskalation und Ablauf, die die Wiederherstellungszeit tatsächlich senken.
- /03AtlassianIncident-Management-Kennzahlen(externe Seite, öffnet in neuem Tab)
Ordnet MTTR, MTTA, MTBF und MTTF sauber gegeneinander ab.
Erstgespräch.
Kostenlos.
90 Tage zum Ergebnis.
Wir klären gemeinsam, wie Sie in 90 Tagen die ersten messbaren Industrial-DevOps-Erfolge erzielen.
Industrie · Automotive · Finance

