Beim 9. Qual.met /Symposium in Hall in Tirol (16.–18. September 2026) haben wir 26 Forschungstagebücher berufsbegleitend Studierender vorgestellt – nicht als Methode, sondern als Datenmaterial. Der wichtigste Befund des Projekts ist allerdings ein methodischer, und er wäre uns beinahe durchgerutscht.
Unter dem Titel „Reflexive Schreibpraxis als Brücke zwischen Wissenschaft und Berufsalltag“ haben Marc-Philipp Crepaz und Eva Maria Jabinger beim diesjährigen Qual.met /Symposium eine Studie präsentiert, die eine Forschungslinie fortsetzt und zugleich ihren Blickwinkel dreht.
Von der Meta-Reflexion zum Material selbst
In zwei Vorstudien haben wir untersucht, wie Studierende die Tagebuchpraxis wahrnehmen – Datengrundlage waren 37 schriftliche Rückmeldungen über das Instrument. Diesmal sind die Tagebücher selbst der Gegenstand: die darin dokumentierten Reflexions-, Schreib- und Entscheidungspraktiken.
Drei Fragen leiteten die Analyse:
- Welche reflexiven Praktiken, Themen und Spannungsfelder artikulieren sich?
- Lassen sich Transferprozesse zwischen Wissenschaft und beruflichem Handeln identifizieren?
- Finden sich Hinweise auf nachhaltigkeitsrelevante Kompetenzen – kritisches Urteilsvermögen, ethische Reflexion, kommunikative und partizipative Entscheidungsfähigkeit?
Die Varianz ist der Gegenstand

Die Tagebücher wurden verpflichtend geführt – ohne jede Vorgabe zu Umfang, Struktur oder Format. Was hier zu sehen ist, ist die Antwort der Studierenden auf diese Offenheit.
Der Korpus umfasst 26 auswertbare Fälle mit 1.929 Seiten und rund 3,07 Millionen Zeichen. Die Spannweite reicht von sechs bis 287 Seiten, die Textdichte von wenigen hundert bis über 4.000 Zeichen je Seite.
Bemerkenswert ist vor allem, was nicht zu sehen ist: Die beiden Studiengänge (Qualitäts- und Prozessmanagement im Gesundheitswesen; MBA im Gesundheitswesen) liegen ineinander. Es gibt kein QPM-Format und kein MBA-Format – der einzige systematische Unterschied ist der Umfang.
Von ursprünglich 29 Tagebüchern sind drei nicht in die Auswertung eingegangen: zwei bestehen praktisch vollständig aus Scans handschriftlicher Einträge und lagen unter 300 Zeichen je Seite, eine Datei war defekt. Die Ausschlussschwelle haben wir nicht gesetzt, sondern am Material abgelesen – die Lücke zwischen den beiden Fällen (158 und 223 Zeichen je Seite) und dem nächsten (527, Median 1.543) ist im Bild deutlich. Ohne Ausschluss wären sie in der Themenmatrix als inhaltlich leer erschienen: ein Artefakt der Textextraktion, das man als Befund gelesen hätte.
Das Verfahren – und warum das Protokoll dazugehört

Blau: Daten bleiben im Haus. Orange: der einzige Punkt der Übermittlung – pseudonymisierter Text, verarbeitet über einen europäischen Auftragsverarbeiter.
Wir folgen der Framework Analysis nach Gale et al. (2013) in fünf Schritten, ergänzt um zwei lokale Vorverarbeitungsschritte. Extraktion, Pseudonymisierung und das Charting laufen vollständig lokal; die Pseudonymisierung regelbasiert, ergänzt um ein lokal ausgeführtes Modell, das Elemente erkennt, aber nichts ersetzt.
Jeder Schritt schreibt für jeden Fall ein maschinenlesbares Protokoll: Modell-ID, Promptversion, Codebook-Version, Ausschlussstand, Tokenverbrauch, Zeitstempel. Das ist keine Fleißarbeit – ohne dieses Protokoll hätten wir den folgenden Befund nicht gefunden. Die Prinzipien dahinter haben wir im Beitrag Vom KI-Werkzeug zur Analysepipeline und im Pre-Symposium-Workshop an der UMIT Tirol ausführlicher dargestellt.
Der Zwischenruf: ein Befund, den wir fast berichtet hätten
In unserer ersten Ergebnisübersicht stand folgender Satz:
„MBA-Tagebücher sind deutlich ergiebiger: 83 gegenüber 35 kodierten Segmenten je Fall.“
1.339 kodierte Segmente, sauber protokolliert, ein Unterschied um mehr als das Doppelte. Und plausibel dazu: MBA-Studierende sind häufiger in Führungsrollen, haben mehr Berührungspunkte mit Organisationsfragen – wir hatten sogar eine Theorie dafür. Genau das ist die Gefahr. Ein Artefakt, für das man eine gute Geschichte hat, sieht aus wie ein Befund.
Aufgefallen ist es nicht durch Verdacht, sondern durch Protokollierung: Bei einem Fall stimmte der protokollierte Tokenverbrauch nicht mit der Textmenge überein, die hätte verarbeitet werden müssen – 36 Prozent statt der 92 bis 99 Prozent aller anderen Fälle. Beim Nachrechnen für alle 26 Fälle zeigte sich das eigentliche Muster.

Faktor 14 mehr Text ergibt Faktor 1,7 mehr Segmente. Das Modell liefert pro Aufruf ungefähr gleich viel, unabhängig davon, was darin steht.
Damit ist die Ausgangsbehauptung erledigt. Die 83 gegenüber 35 Segmenten sind kein Programmunterschied, sondern ein reiner Längeneffekt: MBA-Tagebücher sind im Schnitt viermal so umfangreich, brauchen entsprechend mehr Verarbeitungsabschnitte, und jeder Abschnitt liefert seine rund 28 Segmente.
Der naheliegende zweite Anlauf – auf die Textmenge normieren, also Segmente je 10.000 Zeichen rechnen – ist ebenso falsch. Dann kehrt sich das Artefakt nur um: Plötzlich sind die QPM-Fälle die dichteren, und zwar aus demselben Grund. Wir hatten den Fehler nicht behoben, sondern gespiegelt.
Was belastbar bleibt: ob eine Kategorie in einem Fall vorkommt, das Kategorienprofil innerhalb eines Falls, und der Inhalt der Segmente. Was nicht trägt: „Fall A hat mehr Belege als Fall B.“ Alle folgenden Zahlen sind auf dieser Basis gerechnet – Vorkommenszahlen, keine Rangfolgen.
Was in den Tagebüchern steht

Blau: neu im erweiterten Kategoriensystem. Orange: bereits im deduktiven Ausgangssystem der Vorstudie.
Das deduktive Kategoriensystem aus der Vorstudie hatte elf Kategorien. Nach dem ersten Durchgang haben wir es auf 23 erweitert – auf Basis von 118 induktiven Vorschlägen aus 25 der 26 Fälle. Die vier häufigsten Kategorien sind allesamt neu.
Und ganz unten, mit einem einzigen Beleg im gesamten Korpus: „Metatransfer der Tagebuchpraxis“ – die alte Transferkategorie aus der Vorstudie. Ihre Ankerbeispiele waren Sätze wie „Meine Arbeitsweise hat sich verändert, ich bin strukturierter geworden.“ Das sagt man, wenn man gefragt wird. Ins eigene Tagebuch schreibt es kaum jemand. Die Verschiebung der Datenquelle verschiebt systematisch, welche Kategorien überhaupt sichtbar werden – das ist selbst ein Befund.
Das Tagebuch ist kein einheitliches Genre
„Materialablage statt Reflexion“ ist in allen 26 Fällen belegt und macht je nach Fall 7 bis 29 Prozent der Segmente aus:
„Masterarbeit fertig – zu lange – daher werden einzelne Teile rausgestrichen. Und hier in das Forschungstagebuch eingetragen.“ — 13_qpm, S. 50
Das ist keine Nachlässigkeit, sondern eine Aneignung. In einem anderen Fall nimmt ein vollständig einkopiertes, vierzigseitiges Testinterview mit ChatGPT einen erheblichen Teil eines 283-seitigen Tagebuchs ein.
Die Aufgabe „Führen Sie ein Forschungstagebuch“ wird von einem Teil der Studierenden als Aufforderung zur Selbstreflexion verstanden, von einem anderen als Dokumentationspflicht, von einem dritten als Ablageort – Denkraum, Arbeitslogbuch, Materialarchiv, oft im selben Dokument. Alle drei Lesarten sind mit der Aufgabenstellung vereinbar. Das ist ein didaktischer Befund.
Reflexion entsteht an Bruchstellen

In allen acht Fällen sind die Wendepunkte Störungen. Der störungsärmste Fall ist der einzige mit abnehmender Reflexionstiefe.
An acht Fällen maximaler Variation haben wir vertieft analysiert. Alle vier Stufen sind besetzt – von reiner Protokollierung bis zur kritisch-selbstbezüglichen Reflexion. Interessanter als die Einstufung ist, wie sie entsteht: Die Wendepunkte sind durchgängig Störungen – ein abgebrochenes Interview, eine widerlegte Forschungsfrage, kritisches Feedback, ein Jobwechsel, ein Datenverlust.
Die dichteste Stelle im gesamten Korpus zeigt, wie das aussieht, wenn Reflexion zur überprüfbaren Hypothese wird:
„Aber ich überlege, ob mich die ersten beiden Interviews unterbewusst noch belasten und mich in meiner Interviewführung beeinträchtigt haben könnten, also höre ich mir das Interview später Abends nochmal an.“ — 09_qpm, S. 18
Die Person stellt eine Hypothese über die eigene Wahrnehmungsverzerrung auf – und überprüft sie empirisch. Die didaktische Konsequenz: Eine Aufforderung zu regelmäßigen Einträgen erzeugt Protokolle. Reflexion entsteht dort, wo etwas misslingt – und wo das Misslingen als dokumentationswürdig gilt.
Transfer läuft in die andere Richtung

Die seltenere Richtung bleibt überwiegend Absichtserklärung – Tagebücher enden mit der Abgabe.
Wir hatten erwartet, dass die Forschung in den Berufsalltag zurückwirkt: Dokumentations- und Argumentationsroutinen, die man mitnimmt. Das Material sagt etwas anderes. Der Transfer vom Beruf in die Forschung ist in allen 26 Fällen belegt, die Gegenrichtung in zwölf – und dort überwiegend als Absicht, nicht als vollzogener Vorgang.
„Ich komme ja aus der Pflege und da spricht man immer vom Pflegeprozess. […] trotzdem hatte ich gerade diese geniale Blitzidee, dass man ja auch einen Führungsprozess machen könnte.“ — 27_mba, S. 236
Hier wird ein berufliches Denkschema in ein wissenschaftliches Analyseinstrument übersetzt – die stärkste Form dieses Transfers. Die eigentliche Schnittstelle zwischen Wissenschaft und Beruf ist deshalb nicht der Wissenstransfer, sondern die Positionalität: die Doppelrolle als Praktiker:in und Forschende. Sie ist in zwölf Fällen eigens kodiert und in den Tiefenfällen der am dichtesten reflektierte Gegenstand überhaupt.
Das ist kein Nullbefund, sondern eine Präzisierung: Tagebücher enden mit der Abgabe, zu diesem Zeitpunkt liegen noch keine Ergebnisse vor, die zurückwirken könnten. Nachhaltige Transferwirkung ist mit dieser Textsorte grundsätzlich nicht zu belegen – ein Argument für die geplanten Absolvent:innenstudien.
Nachhaltigkeitskompetenzen: individuell ja, kollektiv kaum

Wo kollektive Kompetenzen auftreten, betreffen sie den Forschungsprozess – nicht die Gestaltung von Versorgung.
Das Bild ist klar gestuft. Kritisches Urteilsvermögen ist in sechs von acht Fällen deutlich ausgeprägt und artikuliert sich auffallend häufig im Umgang mit KI:
„ChatGPT ist ja so nervig. So hilfreich es beim Glätten des Sprachbilds ist, so vorsichtig muss man sein, dass nicht Inhalte verdreht werden.“
Die kollektiven Kompetenzen – kommunikativ-partizipativ, antizipativ-strategisch – bleiben in je sechs von acht Fällen nur ansatzweise. Und wo sie auftreten, betreffen sie den Forschungsprozess: kollegiale Einschulung in die Software, Austausch im Seminar, eine Zweitmeinung zum Kodiersystem. Ein Tagebuch ist ein Ort der Selbstverständigung, kein Ort der Aushandlung. Das ist keine Kompetenzlücke der Studierenden, sondern eine Grenze der Textsorte.
Der blinde Fleck: das forschungssoziale Umfeld
- Betreuungsbeziehung und Feedback – in allen 26 Fällen belegt, häufigste Kategorie überhaupt.
- Feldzugang und Rekrutierung – in 24 Fällen.
- Beides war im ursprünglichen Kategoriensystem nicht vorgesehen.
Das Tagebuch dokumentiert nicht nur individuelle Reflexion, sondern die institutionellen Bedingungen des Forschens: Terminvereinbarungen, eingefügte Feedbackmails, Wartezeiten, Absagen – und deren emotionale Bewertung.
Dazu gehört ein offenes Wort: Die Betreuungspersonen in diesen Tagebüchern sind wir. Studierende schreiben hier über Personen, zu denen sie in einem Abhängigkeitsverhältnis stehen, und die diese Texte anschließend auswerten. Wir haben die Namen pseudonymisiert und prüfen jedes Zitat einzeln. Die Konstellation selbst lässt sich jedoch nicht wegpseudonymisieren – wir halten es für richtig, sie zu benennen statt zu übergehen.
Was diese Studie nicht kann
- Keine Interrater-Reliabilität. Die Doppelkodierung war vorgesehen – aufgrund vom Umfang verworfen. Was stattdessen vorliegt: eine Konfidenzangabe auf jedem einzelnen Segment und der dokumentierte Vergleich zweier Kodierstände.
- Belegzahlen tragen keinen Fallvergleich – siehe oben.
- Tagebücher enden mit der Abgabe.
- Eine Kategorie werten wir ausdrücklich ab: Partizipation hat mit 41 Prozent niedriger Konfidenz die unsicherste Kodierung im ganzen System. Die Abgrenzung zwischen eigener Reflexion und referierter Literatur trägt dort noch nicht.
Auf den Punkt gebracht
- Die offene Aufgabenstellung erzeugt kategorial verschiedene Tagebuchpraktiken – nicht Abstufungen einer einzigen.
- Reflexion entsteht an Bruchstellen, nicht durch Regelmäßigkeit.
- Transfer läuft vom Beruf in die Wissenschaft – der Rückweg beginnt erst nach der Abgabe.
Und ein vierter, methodischer: Wer qualitative Daten KI-gestützt kodiert, braucht ein Protokoll, das den eigenen Apparat sichtbar macht. Wir hätten sonst einen Verfahrensartefakt als Unterschied zwischen zwei Masterprogrammen berichtet.
Beitrag beim 9. Qual.met /Symposium „Zukunft gestalten mit qualitativer Forschung“, 16.–18. September 2026, Hall in Tirol.
Marc-Philipp Crepaz, MA · Prof.in (FH) Eva Maria Jabinger, MBA MSc MSc BSc Tirol Institut für Qualität im Gesundheitswesen · fhg – Health University of Applied Sciences Tyrol Kontakt: marc-philipp.crepaz@fhg-tirol.ac.at
Eckdaten der Auswertung: 26 Fälle · 1.929 Seiten · 3,07 Mio. Zeichen · 1.339 kodierte Segmente · 23 Kategorien in 7 Dimensionen · 8 vertiefte Fallanalysen · 79,7 % der Kodierungen mit hoher Konfidenz.
AI Diligence Statement
Die Auswertung erfolgte KI-gestützt in einer eigens entwickelten Pipeline: Drei der fünf Analyseschritte der Framework Analysis nutzen ein Sprachmodell, verarbeitet werden ausschließlich pseudonymisierte Textsegmente über einen europäischen Auftragsverarbeiter (DSGVO-konform). Extraktion, Pseudonymisierung und Charting laufen lokal. Jeder Schritt ist je Fall protokolliert (Modell-ID, Promptversion, Codebook-Version, Ausschlussstand, Tokenverbrauch, Zeitstempel). Mapping, Synthese, Interpretation und Berichterstattung liegen vollständig bei den Autor:innen; KI-Werkzeuge sind keine Mitautor:innen. Die Studierenden wurden informiert und haben zugestimmt. Bei Strukturierung und sprachlicher Überarbeitung dieses Beitrags hat Claude unterstützt; die inhaltliche Verantwortung liegt beim Autor.
