Zurück zum Blog
Ein ausgedruckter Fragebogen mit einem schwarzen Kugelschreiber darauf auf einem Holztisch, daneben weitere aufgefächerte Fragebogenblätter und ein kleiner rot blühender Kaktus in einem Betontopf
Umfragedesign2. Oktober 202610 Min. Lesezeit

Eine Umfrage wiederholen, ohne den Trend zu zerstören

Eine Umfrage, die du jedes Quartal verschickst, ist nur dann etwas wert, wenn sich dieses Quartal mit dem letzten vergleichen lässt. Das macht diesen Vergleich unbemerkt kaputt, und so änderst du eine Umfrage, ohne den Trend zu verlieren.

Von SurveyLane · Das Team hinter SurveyLane

Eine einmalige Umfrage beantwortet eine Frage. Eine Umfrage, die du jeden Monat oder jedes Quartal wiederholst, soll eine andere beantworten: Hat sich etwas verändert? Genau diese zweite Frage geht leichter kaputt. Ändere ein Wort, tausche eine Skala oder zieh die Umfrage von der E-Mail in ein Pop-up in deinem Produkt um, und die Linie in deinem Diagramm bewegt sich, obwohl sich niemandes Meinung bewegt hat.

Ein Trend ist ein Vergleich

Stellst du den Zufriedenheitswert dieses Quartals neben den des letzten, behauptest du, dass der Unterschied von einer Veränderung bei den befragten Menschen kommt. Das stimmt nur, wenn alles andere gleich blieb: die Frage, die Antwortoptionen, was davor kam, die Einladung, wer eingeladen wurde. Jedes davon verschiebt Antworten aus eigener Kraft. Eine Trendlinie geht stillschweigend davon aus, dass sich nichts davon bewegt hat.

Frag also zuerst, was sich zwischen den Wellen verändert hat, abgesehen von dem, was dich interessiert. Lautet die ehrliche Antwort "Wir haben die Frage umformuliert und das Tool gewechselt", dann hast du zwei getrennte Umfragen, die zufällig ein Diagramm teilen.

Friere das Instrument vor der ersten Welle ein

Die wichtigste Entscheidung für eine Trendumfrage fällt vor Welle eins: Welche Fragen bilden den festen Kern? Diese Fragen werden eingefroren. Gleiche Formulierung, gleiche Optionen, gleiche Reihenfolge, gleiche Position, gleicher Einleitungstext. Alles andere darf wechseln.

Steck mehr Zeit in diesen Kern, als nötig scheint, und teste ihn. Der Leitfaden zum Vortesten einer Umfrage zeigt, wie du Formulierungsprobleme findest, solange ihre Behebung noch nichts kostet. Entdeckst du dasselbe Problem in Welle vier, kostet es dich einen Trendbruch. Im Pretest kostet es einen Nachmittag.

Kleine Formulierungsänderungen verschieben Antworten deutlich

Das bekannteste Beispiel stammt aus dem US-amerikanischen General Social Survey, der seit Jahrzehnten fragt, ob der Staat für eine Reihe von Aufgaben zu viel, zu wenig oder ungefähr genug ausgibt. Eine Version des Items sagt "welfare" (Sozialhilfe). Eine andere sagt "assistance to the poor" (Hilfe für Arme). Ungefähr derselbe Politikbereich. Trotzdem unterscheidet sich der Anteil derer, die sagen, es werde zu wenig ausgegeben, zwischen beiden Jahr für Jahr um zig Prozentpunkte.

"Wie zufrieden bist du mit unserem Support?" verlangt ein Urteil über eine Abteilung. "Wie zufrieden bist du mit der Hilfe, die du von unserem Support-Team bekommen hast?" verlangt ein Urteil über das letzte Gespräch. Wechselst du zwischen Q2 und Q3 von der einen zur anderen, stammt ein Teil jeder Bewegung im Wert von deiner Änderung. Im Beitrag über bessere Umfragefragen steht, warum die Formulierung so viel Gewicht hat.

Die Skala gehört zur Frage

Änderst du die Antwortoptionen, änderst du die Frage, auch wenn der Fragetext Wort für Wort gleich bleibt. Der Wechsel von fünf auf sieben Punkte verändert die Verteilung. Das tut auch eine beschriftete Mitte, ein "Äußerst unzufrieden" statt "Sehr unzufrieden" oder eine umgedrehte Richtung, bei der das positive Ende zuerst kommt. Wer das Ergebnis hinterher zu einer "Top-2-Box" zusammenfasst, macht das nicht rückgängig.

Mehrfachauswahl-Listen verhalten sich genauso. Nimm eine neue Option in eine Liste von Kündigungsgründen auf, und ein Teil der Leute, die vorher "Sonstiges" oder "zu teuer" wählten, nimmt jetzt die neue. Die alten Kategorien schrumpfen, und es sieht aus, als wäre auch das Problem geschrumpft. Wenn du eine Skala willst, mit der du jahrelang leben kannst, lies den Leitfaden zum Entwerfen von Skalenfragen vor der ersten Welle. Nach der fünften ist es zu spät.

Was vor einer Frage steht, verändert sie auch

Kontext gehört zum Instrument. Stellst du die allgemeine Zufriedenheitsfrage direkt nach fünf Fragen zum Ausfall der letzten Woche, fällt sie schlechter aus als an erster Stelle. Die Leute nehmen den Ausfall in ihr Gesamturteil mit. Der Beitrag über Reihenfolgeeffekte erklärt, wie das funktioniert und wann es zählt.

Für eine Trendumfrage folgt daraus etwas Einfaches. Das wechselnde Modul kommt nach dem festen Kern, nie davor. Setz den Kern an den Anfang, in derselben Reihenfolge, jedes Mal.

Ein anderer Modus bringt andere Antworten

Wie eine Umfrage die Menschen erreicht, ist Teil der Messung. 2015 veröffentlichte das Pew Research Center ein Experiment, in dem 3.003 Befragte zufällig zugeteilt wurden: dieselben Fragen entweder am Telefon mit Interviewer oder allein im Web. Über 60 Fragen lag der durchschnittliche Unterschied zwischen den beiden Modi bei 5,5 Prozentpunkten, und manche Unterschiede waren viel größer. Am Telefon sagten 62 %, sie seien mit ihrem Familienleben sehr zufrieden. Im Web waren es 44 %.

Die Richtung ist eindeutig: Ohne Interviewer, der zuhört, geben Menschen weniger sozial erwünschte Antworten. Kleinere Moduswechsel wirken genauso. Eine Umfrage am Laptop nach einer E-Mail-Einladung ist eine andere Situation als eine Zwei-Fragen-Abfrage, die jemanden mitten in deinem Produkt unterbricht. Wechselst du den Kanal, rechne damit, dass sich die Zahlen bewegen. Diese Bewegung kommt vom Kanal.

Muss eine Frage doch anders werden, bau eine Brücke

Manchmal ist eine Frage einfach schlecht, und Einfrieren hieße, für immer das Falsche zu messen. Du kannst sie ändern und trotzdem deine Historie behalten. Die übliche Methode ist eine Brückenwelle: Teile die Befragten für eine Welle zufällig auf, sodass die eine Hälfte die alte Version sieht und die andere die neue.

Beide Hälften sind Zufallsstichproben aus derselben Gruppe, also ist der Unterschied zwischen ihnen der Effekt der Formulierung selbst. Angenommen, die alte Frage ergibt in derselben Welle 68 % zufrieden und die neue 61 %. Dann weißt du, dass die neue Formulierung etwa sieben Punkte niedriger ausfällt, und kannst das im Diagramm vermerken. Sonst glaubt der Leser, die Zufriedenheit sei gesunken. Leg die Brücke in eine Welle mit guter Beteiligung, denn jede Hälfte braucht genug Befragte.

Kein Spielraum für eine Brücke? Dann sei im Diagramm ehrlich. Unterbrich die Linie an der Stelle, an der sich die Frage geändert hat, beschrifte den Bruch und zieh keinen durchgehenden Trend darüber.

Halte auch die Grundgesamtheit konstant

Eingefrorene Fragen helfen nichts, wenn sich die Gruppe verschiebt. Dann bricht der Trend trotzdem. Ging Welle eins an alle Kunden und Welle drei nur an Kunden, die sich in den letzten 30 Tagen eingeloggt haben, ist die zweite Gruppe schon per Definition engagierter und schneidet besser ab. Dasselbe passiert, wenn du einen neuen Markt erschließt oder die Personalabteilung plötzlich auch externe Kräfte als Mitarbeitende zählt.

Halte die Stichprobenregel so sorgfältig fest wie die Fragen: wer infrage kommt, wie ausgewählt wird, wann kontaktiert wird. Verfolge dann neben dem Hauptwert auch die Rücklaufquote und die Zusammensetzung jeder Welle. Ein Zufriedenheitsplus, das damit zusammenfällt, dass Neukunden nicht mehr antworten, ist wahrscheinlich eine Veränderung darin, wer geantwortet hat. Der Beitrag über Stichprobenqualität erklärt, warum die Nichtantwortenden deine Ergebnisse prägen, und der Leitfaden zum Gewichten von Umfragedaten zeigt, wie du eine bekannte Verschiebung in der Zusammensetzung korrigierst.

Panels und neue Stichproben beantworten verschiedene Fragen

Du kannst eine Umfrage auf zwei Arten wiederholen. Entweder ziehst du für jede Welle eine neue Stichprobe, oder du begleitest dieselben Menschen in einem Panel. Neue Stichproben zeigen, wie sich die Grundgesamtheit verändert. Ein Panel zeigt, wie sich einzelne Menschen verändern. Nur so siehst du, dass die Kunden, die im Frühjahr unzufrieden waren, dieselben sind, die im Sommer gekündigt haben.

Panels bringen zwei Sorgen mit. Die erste ist Panelschwund: Menschen steigen aus, und wer bleibt, ist selten eine zufällige Teilmenge. Die zweite ist Panelkonditionierung, bei der das wiederholte Befragen zu einem Thema verändert, wie Menschen sich verhalten oder antworten. Das Pew Research Center hat das 2021 an seinem eigenen American Trends Panel untersucht. Es fand keine Hinweise darauf, dass Konditionierung die Schätzungen zu Nachrichtenkonsum, Gesprächen über Politik, Parteineigung oder Wahlbeteiligung verzerrt hatte. Die einzige Ausnahme war ein leichter Anstieg bei der Registrierung als Wähler, nachdem Menschen dem Panel beigetreten waren. Beruhigend für ein großes Panel mit wechselnden Themen, weniger für ein kleines, das alle zwei Wochen zur selben Produktfunktion befragt wird.

Wie oft du misst, ist eine Designentscheidung

Richte die Frequenz nach zwei Dingen: wie schnell sich das Gemessene wirklich verändern kann und wie schnell du auf das Gelernte reagieren kannst. Jede Woche nach dem allgemeinen Vertrauen in dein Unternehmen zu fragen, bringt nichts: Es verschiebt sich nicht so schnell, und das Rauschen zwischen den Wellen sieht dann aus wie ein Signal. Einmal im Jahr nach einem neuen Onboarding zu fragen, ist zu langsam, denn bis dahin hast du es dreimal umgebaut.

Frequenz kostet auch Beteiligung. Jede Einladung zehrt vom selben Wohlwollen, und wer vermutet, dass niemand die Antworten liest, hört auf zu antworten. Wer weiter antwortet, gleicht nicht denen, die aussteigen, also wird deine Datenbasis schief, während sie dünner wird. Halte jede Welle kurz. Der Beitrag über Umfragelänge und Abbruch zeigt, wie schnell die Antwortqualität sinkt, wenn eine Umfrage wächst.

Echte Veränderung von Rauschen unterscheiden

Zwei Wellen ergeben fast nie dieselbe Zahl, auch wenn sich nichts verändert hat. Jede Welle ist eine Stichprobe mit Fehlertoleranz. Und die Fehlertoleranz für den Unterschied zwischen zwei Wellen ist größer als die jeder einzelnen Welle.

Bei 400 Befragten pro Welle und einem Ergebnis um 50 % hat jede Welle eine Fehlertoleranz von etwa ±4,9 Prozentpunkten bei 95 % Konfidenz. Der Unterschied zwischen zwei solchen Wellen hat eine Fehlertoleranz von etwa ±6,9 Punkten, weil sich die Unsicherheit beider Stichproben addiert. Ein Schritt von 52 % auf 56 % liegt locker darin. Im Beitrag darüber, wie viele Befragte du brauchst, steht, wie du diese Zahlen für deine eigene Umfrage ausrechnest.

Warte drei oder mehr Wellen ab, bevor du eine Richtung ausrufst, denn eine einzelne auffällige Welle ist viel öfter Rauschen als Neuigkeit. Und schreib die Zahl der Befragten neben jeden Wert, damit jeder, der das Diagramm liest, sieht, wann ein Sprung auf einer dünnen Stichprobe beruht.

Führe ein Änderungsprotokoll für deinen Fragebogen

Der praktischste Schutz ist ein schlichtes Änderungsprotokoll für die Umfrage selbst. Jede Welle bekommt einen datierten Eintrag: die Kernfragen, etwaige Änderungen an Formulierung oder Optionen, der Kanal, die Stichprobenregel, der Feldzeitraum, die Zahl der Antworten und was rund um diese Zeit los war, etwa ein großes Release oder eine Preiserhöhung. Fällt der Wert im März, schlägst du nach, warum.

Es hilft auch allen, die die Daten danach auswerten, Mensch oder KI. Fragst du deine Ergebnisse über den MCP-Server von SurveyLane ab, kann der Assistent Wellen vergleichen. Dass sich die Frage in Welle vier geändert hat, kann er aber nicht wissen, solange du es ihm nicht sagst. Genau dafür ist das Protokoll da.

Häufig gestellte Fragen

Darf ich einen Tippfehler in einer Trendfrage korrigieren, ohne den Trend zu brechen?

Einen reinen Tippfehler, den alle ohnehin gleich lesen, etwa einen fehlenden Buchstaben, kannst du gefahrlos korrigieren. Alles, was Bedeutung, Betonung oder Lesefluss verändert, ist eine Formulierungsänderung, so klein sie sich auch anfühlt. Im Zweifel fahr eine Brückenwelle oder markiere den Bruch im Diagramm.

Wie viele Befragte brauche ich für eine Brückenwelle?

Jede Hälfte der Aufteilung muss groß genug sein, um den Unterschied zwischen alter und neuer Formulierung mit brauchbarer Genauigkeit zu schätzen. Mit einigen hundert Befragten pro Hälfte erkennst du Unterschiede von etwa zehn Prozentpunkten, kleinere Formulierungseffekte brauchen größere Gruppen. Ist deine normale Welle klein, verteile die Brücke auf zwei aufeinanderfolgende Wellen.

Sollte ich meine Werte mit Branchen-Benchmarks vergleichen?

Nur wenn der Benchmark dieselbe Frage, dieselbe Skala, denselben Modus und eine vergleichbare Grundgesamtheit verwendet hat. Die meisten Benchmarks dokumentieren diese Details nicht, sodass der Unterschied echte Leistung mit Messunterschieden vermischt, die du nicht auseinanderhalten kannst. Dein eigener Trend über die Zeit ist meist der verlässlichere Vergleich.

Ist es ein Problem, einer Trendumfrage neue Fragen hinzuzufügen?

Neue Fragen sind in Ordnung, solange sie nach dem festen Kern kommen und die Umfrage nicht so lang wird, dass Abschlussrate und Antwortqualität sinken. Fragen vor dem Kern verändern seinen Kontext, und eine längere Umfrage verändert, wer sie beendet, also können beide die Trendwerte indirekt verschieben.

Weiterlesen