Die summative Usability Evaluation ist die abschließende Bewertung, mit der ein Hersteller nachweist, dass die vorgesehenen Benutzer ein Medizinprodukt sicher bedienen können. Sie wird mit dem finalen oder produktionsäquivalenten Produkt, repräsentativen Benutzern und unter realitätsnahen Bedingungen durchgeführt. Im regulatorischen Sprachgebrauch entspricht sie der Validierung der Benutzungsschnittstelle. Für den US-Markt beschreibt die FDA mit dem Human Factors Validation Testing ein eng verwandtes, eigenständig definiertes Nachweisformat.
Zweck und Stellung im Prozess
Die summative Evaluation steht am Ende des Usability-Engineering-Prozesses nach IEC 62366-1. Sie beantwortet eine einzige, klar umrissene Frage: Können die vorgesehenen Benutzer die ausgewählten gefährdungsbezogenen Nutzungsszenarien sicher bewältigen?
Sie ist ausdrücklich kein Optimierungsinstrument. Wer in der summativen Studie noch Verbesserungsideen sammeln will, hat den Prozess falsch aufgesetzt. Dafür ist die formative Evaluation da. Sie ist nicht als explorative Optimierungsstudie angelegt, ihr primärer Zweck ist der abschließende Nachweis. Beobachtete Anwendungsfehler, Use Difficulties oder unerwartete Nutzungsmuster müssen dennoch analysiert und gegebenenfalls in Design, Risikoanalyse und weitere Validierungsaktivitäten zurückgeführt werden.
Geprüft wird nicht das gesamte Produkt, sondern eine begründete Auswahl der zuvor identifizierten gefährdungsbezogenen Nutzungsszenarien. Diese Auswahl muss aus der Nutzungsrisikoanalyse hervorgehen und nachvollziehbar dokumentiert sein.
Abgrenzung zur formativen Evaluation
| Formativ | Summativ | |
|---|---|---|
| Zeitpunkt | Begleitet die Entwicklung | Schließt sie ab |
| Zweck | Verbessern | Nachweisen |
| Produktstand | Prototypen, Mockups oder Klickdummys genügen | Finales oder produktionsäquivalentes Produkt erforderlich, einschließlich finaler Beschriftungen, Verpackung und Gebrauchsanweisung |
| Kriterien | Offen und explorativ | Vorab festgelegte Akzeptanzkriterien |
| Eingriff | Nachfragen und Hilfestellungen sind erlaubt und erwünscht | Jede Hilfestellung verfälscht das Ergebnis |
Eine späte formative Studie wird nicht dadurch zur summativen Evaluation, dass sie mit dem finalen Gerät stattfindet. Entscheidend sind Planung, Stichprobe, Akzeptanzkriterien und Durchführungsdisziplin.
Voraussetzungen: Produktreife, Benutzer, Umgebung
Drei Bedingungen entscheiden über die Verwertbarkeit der Studie:
- Produktionsäquivalentes Produkt: Die geprüfte Benutzungsschnittstelle muss der Serienausführung entsprechen. Spätere Änderungen an sicherheitsrelevanten Elementen können eine Wiederholung erforderlich machen.
- Repräsentative Benutzer: Die Teilnehmer müssen den im Benutzerprofil beschriebenen Gruppen entsprechen. Personen mit Entwicklungs-, Vertriebs- oder projektspezifischem Insiderwissen sind in der Regel ungeeignet und entwerten die Studie. Produktvorerfahrung an sich ist dagegen nicht automatisch ein Ausschlusskriterium. Entscheidend ist, ob sie dem realen Benutzerprofil entspricht, etwa wenn reale Benutzer typischerweise Erfahrung mit Vorgängerprodukten oder vergleichbaren Geräten mitbringen.
- Realistische Anwendungsumgebung: Relevante Störfaktoren wie Lärm, Beleuchtung, Zeitdruck, Unterbrechungen oder Handschuhe müssen abgebildet werden. Ein steriles Labor bildet eine Notaufnahme nicht ab.
Ergänzend ist zu klären, ob und wie ein Training abgebildet wird. Erhält der Benutzer im Realbetrieb eine Einweisung, darf diese auch im Test stattfinden, dann aber realistisch, inklusive des zeitlichen Abstands zwischen Schulung und Anwendung (Decay-Periode).
Stichprobengröße und Benutzergruppen
Die IEC 62366-1 nennt bewusst keine Mindestzahl, sondern fordert eine begründete, repräsentative Stichprobe. Die FDA setzt für den US-Markt häufig eine Größenordnung von mindestens 15 Teilnehmern pro wesentlicher, separat zu betrachtender Benutzergruppe an; diese Guidance-Empfehlung ist keine starre gesetzliche Mindestzahl. Ob Gruppen getrennt untersucht werden müssen, hängt nicht allein von der Berufsbezeichnung ab, sondern davon, ob relevante Unterschiede in Aufgaben, Erfahrung, Fähigkeiten oder möglichen Use Difficulties bestehen.
Praktisch folgenreich ist die Zahl der Benutzergruppen: Ein Produkt für Pflegekräfte, Ärzte und pflegende Angehörige benötigt drei Gruppen à 15 Teilnehmer, also 45 Personen. Genau hier zahlt sich eine eng gefasste Anwendungsspezifikation aus: Jede zusätzlich aufgenommene Benutzergruppe erhöht den Testaufwand erheblich.
Wichtig: Die summative Evaluation ist keine statistische Studie. Sie ist qualitativ angelegt: Ein einziger sicherheitskritischer Anwendungsfehler kann Handlungsbedarf auslösen, unabhängig von seiner Häufigkeit.
Durchführung und Datenerhebung
Die Teilnehmer bearbeiten die ausgewählten Szenarien eigenständig. Der Versuchsleiter beobachtet und protokolliert und greift während der Aufgabenbearbeitung grundsätzlich nicht unterstützend ein, auch nicht, wenn ein Fehler offensichtlich wird. Nur so lässt sich beurteilen, ob das Produkt selbst den Fehler abfängt. Sicherheitsbedingte Interventionen und vorab definierte Abbruchkriterien bleiben davon unberührt; jede notwendige Hilfestellung ist als relevanter Studienbefund zu dokumentieren.
Erhoben werden pro Aufgabe: Erfolg oder Misserfolg, beobachtete Anwendungsfehler, Close Calls, Use Difficulties und Verständnisprobleme bei Kennzeichnung oder Gebrauchsanweisung.
Zentrales Instrument ist das Post-Task-Interview: Nach Abschluss der Aufgaben, nicht währenddessen, wird gezielt nachgefragt, warum der Teilnehmer so gehandelt hat, was er erwartet hatte und wie er die Situation verstanden hat. Ohne diese Befragung bleibt die Ursache eines Fehlers Spekulation. Die Think-Aloud-Methode ist in der summativen Evaluation dagegen unüblich, weil lautes Denken das Verhalten verändert.
Auswertung, Ursachenanalyse und Restrisiken
Für jeden beobachteten Anwendungsfehler und jede Use Difficulty ist eine Ursachenanalyse durchzuführen. Fehler zu zählen genügt nicht. Gefordert ist das Verständnis, ob die Ursache in der Wahrnehmung, der Kognition oder der Handlung lag (Perception-Cognition-Action).
Anschließend wird bewertet, ob der Fehler zu einer Gefährdungssituation führen kann und ob das resultierende Restrisiko nach ISO 14971 vertretbar ist. Ist es das nicht, sind Maßnahmen erforderlich: vorrangig durch Designänderung, nachrangig durch Schutzmaßnahmen und erst zuletzt durch Information für die Sicherheit.
Dokumentation und regulatorische Verwertung
Die Ergebnisse fließen in die Gebrauchstauglichkeitsakte ein und müssen konsistent zur Risikomanagementakte sein. Für den US-Markt werden sie zusätzlich im HFE/UE Report zusammengefasst.
Der Bericht sollte mindestens enthalten: Zielsetzung und Fragestellung, geprüfte Szenarien mit Herleitung aus der Risikoanalyse, Teilnehmerprofile und Rekrutierungskriterien, Beschreibung der Testumgebung, vorab definierte Akzeptanzkriterien, Ergebnisse je Aufgabe, Ursachenanalyse aller Vorkommnisse sowie die abschließende Restrisikobewertung.
Häufigste Auditfeststellung ist nicht ein schlechtes Ergebnis, sondern eine fehlende Herleitung: Geprüfte Szenarien ohne dokumentierten Bezug zur Nutzungsrisikoanalyse machen den gesamten Nachweis angreifbar.
Die summative Usability Evaluation ist der Nachweis, nicht die Optimierung. Sie verlangt ein produktionsäquivalentes Produkt, repräsentative Benutzer, eine realistische Umgebung, vorab definierte Akzeptanzkriterien und eine Ursachenanalyse für jeden beobachteten Fehler. Ihr Wert steht und fällt mit der nachvollziehbaren Herleitung der geprüften Szenarien aus der Nutzungsrisikoanalyse.
Häufige Fragen (FAQ)
Wie viele Teilnehmer braucht eine summative Usability Evaluation?
Die IEC 62366-1 nennt keine feste Zahl, sondern fordert eine begründete, repräsentative Stichprobe. Die FDA erwartet für den US-Markt in der Regel mindestens 15 Teilnehmer je unterscheidbarer Benutzergruppe. Bei mehreren Benutzergruppen vervielfacht sich die Teilnehmerzahl entsprechend.
Darf die summative Evaluation mit einem Prototyp durchgeführt werden?
Nur wenn der Prototyp produktionsäquivalent ist, also die finale Benutzungsschnittstelle einschließlich Beschriftung, Verpackung und Gebrauchsanweisung abbildet. Frühe Prototypen und Klickdummys sind der formativen Evaluation vorbehalten.
Muss die summative Evaluation wiederholt werden, wenn sich das Produkt ändert?
Das hängt vom Umfang der Änderung ab. Betrifft sie sicherheitsrelevante Elemente der Benutzungsschnittstelle, ist eine erneute oder ergänzende Evaluation erforderlich. Betrifft sie nur nicht-sicherheitsrelevante Aspekte, kann eine begründete Bewertung genügen. Die Entscheidung ist zu dokumentieren.
Was passiert, wenn Anwendungsfehler auftreten?
Anwendungsfehler führen nicht automatisch zum Scheitern. Jeder Fehler wird auf seine Ursache hin analysiert, die Tiefe der Analyse richtet sich nach dem Risiko. Anschließend ist zu bewerten, ob das resultierende Restrisiko vertretbar ist. Ist es das nicht, sind vorrangig Designmaßnahmen erforderlich. Informationen für die Sicherheit und Schulungsmaßnahmen haben innerhalb der Risikokontrollhierarchie nachrangigen Charakter.
Ist die summative Evaluation dasselbe wie eine klinische Prüfung?
Nein. Die summative Evaluation prüft die sichere Bedienbarkeit der Benutzungsschnittstelle. Eine klinische Prüfung untersucht klinischen Nutzen und Leistung am Patienten. Beide sind eigenständige Nachweise mit unterschiedlichen Zielen, Methoden und regulatorischen Anforderungen.
Sie planen eine summative Usability Evaluation oder benötigen Unterstützung bei Studiendesign, Rekrutierung und Auswertung? Wir führen summative Studien normkonform durch, von der Szenarienauswahl bis zum auditfesten Bericht.
Mehr zu unserem Usability EngineeringQuellen
- IEC 62366-1:2015+AMD1:2020, Medical devices, Part 1: Application of usability engineering to medical devices
- ISO 14971:2019, Medical devices, Application of risk management to medical devices