Dobór skali wpływa nie tylko na wygodę odpowiadania, ale też na to, jakie obliczenia możesz wykonać i jakie wnioski będą uprawnione. To samo doświadczenie ocenione gwiazdkami, skalą od 0 do 10 lub pięciostopniowym Likertem może dać pozornie inne wyniki.
W tym przewodniku sprawdzisz, czym różnią się najczęściej używane skale, jak liczyć CSAT, CES i NPS, kiedy stosować punkt neutralny oraz jak raportować wyniki bez ukrywania rozkładu odpowiedzi.
W skrócie
- Skalę dobieraj do decyzji, a nie do wyglądu ankiety. CSAT mierzy zadowolenie, CES - wysiłek, a NPS - deklarowaną skłonność do polecenia.
- Pojedyncza odpowiedź Likerta jest zwykle daną porządkową. Mediana i rozkład są bezpieczniejsze niż sama średnia.
- Skala 5-punktowa jest prostsza i zwykle wystarcza w ankietach transakcyjnych. Skala 7-punktowa daje większą czułość, ale wymaga od respondenta dokładniejszego różnicowania.
- Nie zmieniaj kierunku skali między pytaniami. Jeśli 1 oznacza źle, a 5 dobrze, zachowaj ten układ w całej ankiecie.
- CSAT, CES i top-2-box zawsze raportuj razem z liczbą odpowiedzi, okresem badania i rozkładem wyników.
- Orientacyjne progi mogą pomóc w pierwszej interpretacji, ale ważniejsze jest porównanie tego samego procesu, kanału i segmentu w czasie.
Najpierw określ, co chcesz zmierzyć i jaką decyzję podejmiesz na podstawie wyniku. Dopiero potem wybierz skalę.
Poziomy pomiaru: co naprawdę wolno policzyć
Rodzaj skali określa, jakie działania matematyczne mają sens. W ankietach najczęściej spotkasz dane nominalne, porządkowe i interwałowe. W praktyce pojawiają się też dane ilorazowe, na przykład rzeczywisty czas oczekiwania podany w minutach.
| Poziom pomiaru | Co oznacza | Przykład | Co możesz policzyć |
|---|---|---|---|
| Nominalny | Kategorie bez kolejności | Kanał kontaktu: telefon, e-mail, czat | liczebność, udział procentowy, dominanta |
| Porządkowy | Kategorie mają kolejność, ale odstępy nie muszą być równe | bardzo źle, źle, neutralnie, dobrze, bardzo dobrze | liczebność, udział, dominanta, mediana, kwartyle, top-box |
| Interwałowy | Kolejność i równe odstępy, brak naturalnego zera | umowna skala temperatury; w badaniach czasem przybliżenie dla indeksu z wielu pozycji | średnia, odchylenie standardowe, różnice |
| Ilorazowy | Równe odstępy i naturalne zero | czas w sekundach, liczba zakupów | wszystkie podstawowe działania, w tym ilorazy |
Skala nominalna
Pytanie nominalne służy do klasyfikowania respondentów lub zdarzeń.
Przykład:
Z jakiego kanału skorzystałeś podczas kontaktu z obsługą? - Czat - Telefon - E-mail - Formularz kontaktowy - Inny
Nie obliczaj średniej z kodów przypisanych tym odpowiedziom. Jeżeli „czat” ma kod 1, a „telefon” kod 2, średnia 1,6 nie ma interpretacji biznesowej.
Skala porządkowa
Odpowiedzi mają naturalną kolejność, ale nie wiesz, czy odległość między „źle” a „neutralnie” jest taka sama jak między „dobrze” a „bardzo dobrze”.
Przykład:
Jak oceniasz szybkość rozwiązania sprawy? 1 - Bardzo źle 2 - Źle 3 - Ani źle, ani dobrze 4 - Dobrze 5 - Bardzo dobrze
Dla takiego pytania pokaż przede wszystkim:
- rozkład odpowiedzi,
- medianę,
- dominantę,
- top-2-box, czyli udział ocen 4 i 5,
- bottom-2-box, czyli udział ocen 1 i 2.
Średnia jest powszechnie używana, ale traktuj ją jako wygodne przybliżenie, a nie pełny opis wyniku.
Kiedy Likert można analizować jak skalę interwałową
Pojedyncze pytanie Likerta jest porządkowe. Inaczej wygląda sytuacja, gdy tworzysz indeks z kilku pozycji mierzących ten sam konstrukt, na przykład łatwość obsługi.
Przykładowy indeks może składać się z czterech stwierdzeń:
- „Łatwo znalazłem potrzebną funkcję”.
- „Nazwy opcji były dla mnie zrozumiałe”.
- „Wiedziałem, co zrobić w kolejnym kroku”.
- „Mogłem wykonać zadanie bez pomocy”.
Jeżeli pozycje są spójne i zostały sprawdzone na odpowiedniej próbie, sumę lub średnią z nich często analizuje się jak zmienną zbliżoną do interwałowej. Nadal warto raportować rozkład i sprawdzić, czy wynik nie jest zdominowany przez jedną pozycję.
Likert 5 czy 7 punktów
Skala Likerta służy do pomiaru stopnia zgody z konkretnym stwierdzeniem. Nie każde pytanie od 1 do 5 jest więc skalą Likerta.
Poprawny przykład:
Na ile zgadzasz się ze stwierdzeniem: „Proces rejestracji był dla mnie prosty”? 1 - Zdecydowanie się nie zgadzam 2 - Raczej się nie zgadzam 3 - Ani się zgadzam, ani się nie zgadzam 4 - Raczej się zgadzam 5 - Zdecydowanie się zgadzam
Pytanie „Jak oceniasz obsługę od 1 do 5?” jest skalą ocen, ale nie klasyczną pozycją Likerta.
Skala 5-punktowa
Wybierz ją, gdy:
- ankieta ma być krótka i wygodna na telefonie,
- pytasz bezpośrednio po kontakcie, zakupie lub wykonaniu zadania,
- respondenci mogą mieć różny poziom doświadczenia,
- ważniejsza jest czytelność niż wykrywanie małych różnic,
- planujesz raportować top-2-box.
Pięć opcji zwykle pozwala odróżnić ocenę negatywną, neutralną i pozytywną bez nadmiernego obciążenia respondenta.
Skala 7-punktowa
Wybierz ją, gdy:
- mierzysz postawy, wizerunek lub doświadczenie w badaniu pogłębionym,
- respondenci dobrze znają oceniany produkt,
- potrzebujesz większej czułości na niewielkie zmiany,
- analizujesz średnie z wielu powiązanych pozycji,
- ankieta nie jest wypełniana w pośpiechu.
Przykład skali 7-punktowej:
Na ile zgadzasz się ze stwierdzeniem: „Panel daje mi pełną kontrolę nad moimi danymi”? 1 - Zdecydowanie się nie zgadzam 2 - Nie zgadzam się 3 - Raczej się nie zgadzam 4 - Ani się zgadzam, ani się nie zgadzam 5 - Raczej się zgadzam 6 - Zgadzam się 7 - Zdecydowanie się zgadzam
| Kryterium | 5 punktów | 7 punktów |
|---|---|---|
| Obciążenie respondenta | niższe | wyższe |
| Wygoda na telefonie | większa | mniejsza |
| Czułość na małe różnice | umiarkowana | większa |
| Łatwość opisania wszystkich opcji | duża | umiarkowana |
| Ryzyko przypadkowego wyboru | niższe | wyższe |
| Typowe zastosowanie | ankiety transakcyjne | badania postaw i diagnozy UX |
Nie zmieniaj skali z 5 na 7 punktów tylko po to, by wynik wyglądał dokładniej. Więcej kategorii nie naprawi niejasnego pytania.
Etykiety, punkt neutralny i skale parzyste
Sama liczba punktów nie wystarcza. Wynik zależy także od etykiet, obecności środka oraz sposobu prezentacji odpowiedzi.
Pełne etykiety czy tylko krańce
W skali 5-punktowej najlepiej opisać każdą opcję. Zmniejszasz wtedy ryzyko, że respondenci inaczej zinterpretują wartości 2, 3 i 4.
Porównaj:
- słabiej:
1 - źle,2,3,4,5 - świetnie, - lepiej:
bardzo źle,źle,ani źle, ani dobrze,dobrze,bardzo dobrze.
Przy skali 7-, 10- lub 11-punktowej pełne etykiety bywają zbyt długie. Możesz opisać krańce i środek, ale zachowaj tę samą interpretację w kolejnych falach badania.
Kiedy stosować punkt neutralny
Punkt neutralny ma sens, gdy respondent rzeczywiście może:
- nie mieć opinii,
- odczuwać jednocześnie pozytywne i negatywne aspekty,
- oceniać doświadczenie jako ani dobre, ani złe.
Nie używaj środka jako zamiennika odpowiedzi „nie dotyczy” lub „nie wiem”. To różne informacje.
Lepszy zestaw odpowiedzi:
- Zdecydowanie się nie zgadzam
- Raczej się nie zgadzam
- Ani się zgadzam, ani się nie zgadzam
- Raczej się zgadzam
- Zdecydowanie się zgadzam
- Nie wiem / nie mam podstaw do oceny
Skale parzyste
Skala 4- lub 6-punktowa wymusza wybór strony. Może być użyteczna, gdy interesuje Cię konkretna decyzja, ale może też sztucznie przesunąć wynik.
Stosuj skalę parzystą, jeśli:
- respondent zna oceniany obiekt,
- neutralność nie jest interpretacyjnie potrzebna,
- decyzja wymaga rozdzielenia ocen pozytywnych i negatywnych.
Nie stosuj jej tylko dlatego, że obawiasz się zbyt wielu odpowiedzi środkowych. Najpierw sprawdź, czy pytanie jest jasne i czy respondent ma podstawę do oceny.
CSAT, CES i NPS: definicje, wzory i progi
Te trzy wskaźniki odpowiadają na różne pytania. Nie używaj ich zamiennie.
CSAT: zadowolenie z doświadczenia
CSAT, czyli Customer Satisfaction Score, mierzy deklarowane zadowolenie z produktu, kontaktu lub konkretnej interakcji.
Przykład pytania:
Jak oceniasz swoje zadowolenie z rozwiązania tej sprawy? 1 - Bardzo niezadowolony 2 - Niezadowolony 3 - Ani zadowolony, ani niezadowolony 4 - Zadowolony 5 - Bardzo zadowolony
Najczęstszy wzór wykorzystuje top-2-box:
CSAT = liczba odpowiedzi 4 i 5 / liczba wszystkich ważnych odpowiedzi × 100%
Jeżeli otrzymasz 200 ważnych odpowiedzi, z czego 154 to oceny 4 lub 5:
CSAT = 154 / 200 × 100% = 77%
Orientacyjne progi startowe dla skali 1-5:
| CSAT | Wstępna interpretacja |
|---|---|
| poniżej 60% | wyraźny problem do diagnozy |
| 60-74% | wynik wymagający poprawy |
| 75-84% | wynik dobry |
| 85% i więcej | wynik bardzo dobry |
To orientacyjne benchmarki, nie uniwersalne normy. Wynik zależy od branży, momentu wysyłki, kanału, rodzaju sprawy i profilu respondentów. Porównuj przede wszystkim podobne interakcje.
CES: wysiłek klienta
CES, czyli Customer Effort Score, mierzy łatwość wykonania zadania lub rozwiązania sprawy. Jest często lepszy od CSAT, gdy analizujesz proces: rejestrację, zwrot, płatność, znalezienie funkcji albo kontakt z obsługą.
Przykład:
Na ile zgadzasz się ze stwierdzeniem: „Rozwiązanie tej sprawy wymagało ode mnie niewielkiego wysiłku”? 1 - Zdecydowanie się nie zgadzam 2 - Nie zgadzam się 3 - Raczej się nie zgadzam 4 - Ani się zgadzam, ani się nie zgadzam 5 - Raczej się zgadzam 6 - Zgadzam się 7 - Zdecydowanie się zgadzam
CES możesz raportować jako średnią:
CES = suma ocen / liczba ważnych odpowiedzi
Dla 100 odpowiedzi o łącznej wartości 560:
CES = 560 / 100 = 5,6 na 7
Możesz też raportować udział ocen 5-7:
Pozytywny CES = liczba ocen 5-7 / wszystkie ważne odpowiedzi × 100%
Najważniejsze jest zachowanie identycznego brzmienia i kierunku skali. Pytanie o „łatwość” i pytanie o „wysiłek” wymagają odwrotnej interpretacji wysokiej wartości.
CES wybierz zamiast CSAT, gdy chcesz ustalić:
- czy proces ma zbyt wiele kroków,
- czy klient musiał ponawiać kontakt,
- czy instrukcja była łatwa do wykonania,
- czy użytkownik szybko znalazł potrzebną funkcję,
- czy samoobsługa ogranicza wysiłek.
NPS: deklarowana skłonność do polecenia
NPS, czyli Net Promoter Score, opiera się na pytaniu:
Na ile prawdopodobne jest, że polecisz naszą firmę znajomemu lub współpracownikowi? Skala od 0 - Zupełnie nieprawdopodobne do 10 - Bardzo prawdopodobne
Odpowiedzi dzielisz na:
- krytyków: 0-6,
- pasywnych: 7-8,
- promotorów: 9-10.
Wzór:
NPS = % promotorów − % krytyków
Jeżeli promotorzy stanowią 48%, a krytycy 22%:
NPS = 48 − 22 = 26
NPS mieści się od −100 do 100. Nie jest procentem, dlatego zapis „26% NPS” jest błędny.
Orientacyjna interpretacja:
| NPS | Wstępna interpretacja |
|---|---|
| poniżej 0 | więcej krytyków niż promotorów |
| 0-20 | przewaga promotorów, ale dużo barier |
| 21-40 | solidny wynik |
| 41-60 | bardzo dobry wynik |
| powyżej 60 | wyjątkowo wysoki wynik, wymagający kontroli próby |
Progi są orientacyjne. NPS zależy między innymi od kategorii produktu, kraju, relacji klienta z marką oraz sposobu doboru próby.
Porównanie skal ankietowych
Poniższa tabela pomaga dopasować skalę do celu, sposobu raportowania i kontekstu ankiety.
| Skala | Co mierzy | Typowy format lub wzór | Mocne strony | Słabe strony | Kiedy używać |
|---|---|---|---|---|---|
| Nominalna | kategorię lub cechę | wybór jednej albo wielu odpowiedzi | prosta analiza segmentów | brak kolejności i średniej | kanał kontaktu, typ klienta, używana funkcja |
| Porządkowa ocena | kolejność ocen | np. bardzo źle-bardzo dobrze | łatwa dla respondenta | odstępy nie muszą być równe | ocena elementu usługi |
| Likert 5 | zgodę ze stwierdzeniem | 1-5, pełne etykiety | czytelny, wygodny mobilnie | mniejsza czułość | krótkie ankiety UX i CX |
| Likert 7 | zgodę ze stwierdzeniem | 1-7 | większa czułość | większe obciążenie | badania postaw i indeksy |
| CSAT | zadowolenie | odpowiedzi pozytywne / wszystkie × 100% | intuicyjny i transakcyjny | silnie zależy od momentu badania | po zakupie, kontakcie lub realizacji |
| CES | łatwość lub wysiłek | średnia albo udział ocen pozytywnych | dobrze diagnozuje proces | wrażliwy na kierunek pytania | onboarding, zwrot, obsługa, samoobsługa |
| NPS | skłonność do polecenia | % promotorów − % krytyków | prosty wskaźnik relacyjny | traci informację z pełnego rozkładu | cykliczne badanie relacji |
| Semantyczna różnicowa | wizerunek na przeciwstawnych cechach | np. prosty 1-7 skomplikowany | pokazuje profil doświadczenia | trudność w doborze antonimów | marka, interfejs, komunikacja |
| Gwiazdki | ogólną ocenę | zwykle 1-5 | znany format | różne normy interpretacji | produkty, treści, usługi |
| Emoji | szybką reakcję emocjonalną | 3-5 ikon | niskie obciążenie | niejednoznaczność kulturowa | kioski, mikroankiety |
| Slider | pozycję na kontinuum | np. 0-100 | pozorna precyzja i atrakcyjność | trudny na telefonie, przypadkowe wartości | tylko gdy ciągłość ma znaczenie |
| Ranking | względną kolejność opcji | miejsca 1-5 | wymusza priorytety | nie pokazuje wielkości różnic | krótka lista funkcji |
| MaxDiff | względną ważność | najlepsza i najgorsza opcja w zestawie | mocne różnicowanie | wymaga planu i modelowania | priorytetyzacja wielu cech |
| Matryca | kilka ocen na jednej skali | wiersze × wspólne kolumny | oszczędza miejsce | sprzyja automatycznym odpowiedziom | krótki zestaw podobnych pozycji |
Jeżeli jedno pytanie ma dostarczyć odpowiedzi na kilka różnych celów, prawdopodobnie potrzebujesz kilku skal lub lepiej zdefiniowanej decyzji badawczej.
Skale semantyczne, slidery, gwiazdki i emoji
Skala semantyczna różnicowa
Skala semantyczna wykorzystuje pary przeciwstawnych określeń. Respondent wskazuje miejsce między nimi.
Przykład:
Jak odbierasz proces konfiguracji?
| 1 | 2 | 3 | 4 | 5 | 6 | 7 |
|---|---|---|---|---|---|---|
| Skomplikowany | Prosty |
Inne pary:
- chaotyczny - uporządkowany,
- powolny - szybki,
- nieprzewidywalny - przewidywalny,
- przestarzały - nowoczesny,
- bezosobowy - osobisty.
Używaj rzeczywistych przeciwieństw. „Tani - wysokiej jakości” to dwie osobne cechy, a nie antonimy. Produkt może być jednocześnie tani i wysokiej jakości.
Slidery
Slider od 0 do 100 sugeruje dokładność, której respondent często nie odczuwa. Różnica między 63 a 64 zwykle nie ma praktycznej interpretacji.
Slider ma sens, gdy:
- ważna jest orientacyjna pozycja na kontinuum,
- respondent widzi aktualną wartość,
- sterowanie działa poprawnie na telefonie i klawiaturze,
- wartość początkowa nie jest automatycznie zapisywana jako odpowiedź.
Jeśli nie potrzebujesz co najmniej kilkunastu rozróżnialnych poziomów, wybierz przyciski radiowe lub opisaną skalę 5-7 punktów.
Gwiazdki
Gwiazdki są zrozumiałe w ocenach produktów i treści, ale respondenci mogą traktować trzy gwiazdki jako wynik neutralny, przeciętny albo negatywny.
Dopisz znaczenie krańców:
Jak oceniasz instrukcję? 1 gwiazdka - Bardzo słabo 5 gwiazdek - Bardzo dobrze
Nie przeliczaj automatycznie pięciu gwiazdek na NPS. To inna skala i inne progi.
Emoji
Emoji sprawdzają się w bardzo krótkich ankietach, na przykład po skorzystaniu z terminala. Ogranicz liczbę ikon do 3-5 i dodaj tekstowe etykiety.
Przykład:
- 😞 Niezadowolony
- 😐 Ani zadowolony, ani niezadowolony
- 🙂 Zadowolony
Sama mimika może być różnie interpretowana przez osoby z różnych grup wiekowych i kultur.
Ranking, MaxDiff i matryce
Ranking
Ranking odpowiada na pytanie: co jest ważniejsze względem pozostałych opcji?
Ułóż funkcje od najważniejszej do najmniej ważnej: - eksport do arkusza, - automatyczne raporty, - integracje, - logika warunkowa, - personalizacja wyglądu.
Nie każ respondentowi porządkować więcej niż około 5-7 elementów. Przy dłuższej liście zadanie staje się męczące, szczególnie na telefonie.
Ranking nie pokazuje, czy dwie pierwsze opcje są prawie równie ważne ani czy ostatnia jest całkowicie zbędna. Rozważ dodatkową ocenę albo MaxDiff.
MaxDiff
W MaxDiff respondent widzi kilka zestawów opcji i za każdym razem wybiera element najważniejszy oraz najmniej ważny.
Przykład zestawu:
Który element jest dla Ciebie najważniejszy, a który najmniej ważny? - szybkość działania, - cena, - wsparcie techniczne, - liczba integracji.
MaxDiff sprawdza się, gdy masz około 8-30 cech i chcesz uzyskać wyraźniejsze priorytety niż w zwykłej skali ważności. Wymaga jednak przygotowania zbalansowanych zestawów oraz analizy, która uwzględnia liczbę ekspozycji każdej opcji.
Matryce
Matryca pozwala ocenić kilka stwierdzeń na wspólnej skali.
Przykładowe wiersze:
- Formularz był czytelny.
- Pytania były zrozumiałe.
- Wiedziałem, ile czasu zajmie ankieta.
- Wysłanie odpowiedzi przebiegło bez problemu.
Kolumny mogą obejmować skalę od „zdecydowanie się nie zgadzam” do „zdecydowanie się zgadzam”.
Dobra matryca ma zwykle 4-7 wierszy. Dłuższą podziel na kilka ekranów. Kontroluj efekt prostego zaznaczania jednej kolumny, ale nie odwracaj losowo połowy pytań kosztem zrozumiałości.
Spójność skali, tłumaczenia i źródła zniekształceń
Zachowaj jeden kierunek
Jeżeli wyższa wartość oznacza lepszy wynik, utrzymuj tę zasadę w całej ankiecie.
Błędny układ:
- pytanie 1: 1 - bardzo źle, 5 - bardzo dobrze,
- pytanie 2: 1 - bardzo łatwo, 5 - bardzo trudno,
- pytanie 3: 1 - zdecydowanie tak, 5 - zdecydowanie nie.
Taka zmiana zwiększa liczbę pomyłek i utrudnia analizę. Jeśli musisz użyć odwrotnego sformułowania, przekoduj wynik przed agregacją.
Dla skali 1-5:
wynik po odwróceniu = 6 − odpowiedź
Ocena 1 staje się 5, ocena 2 staje się 4, a 3 pozostaje 3.
Tłumaczenie skali
Nie tłumacz wyłącznie słów. Sprawdź, czy stopnie natężenia pozostają równomierne. „Raczej się zgadzam”, „zgadzam się” i „zdecydowanie się zgadzam” nie mogą zostać zastąpione trzema prawie identycznymi określeniami.
Proces kontroli tłumaczenia:
- Jedna osoba tłumaczy pytanie.
- Druga wykonuje tłumaczenie zwrotne bez wglądu w oryginał.
- Porównujesz sens, natężenie i kierunek.
- Testujesz wersję na 5-10 osobach z danej grupy językowej.
- Sprawdzasz, czy respondenci tak samo rozumieją środek i krańce.
Różnice kulturowe
W niektórych grupach respondenci częściej wybierają środek, a w innych chętniej używają krańców. Dlatego bezpośrednie porównanie średniego CSAT lub NPS między krajami może łączyć różnicę w doświadczeniu z różnicą w stylu odpowiadania.
Porównując rynki:
- zachowaj identyczny moment pomiaru,
- kontroluj kanał i typ klienta,
- pokaż pełne rozkłady,
- nie opieraj wniosku na różnicy 1-3 punktów procentowych bez oceny niepewności,
- zbieraj komentarze otwarte, które wyjaśnią wynik.
Błąd centralnej tendencji
Respondenci wybierają środek skali, gdy:
- pytanie jest niejasne,
- nie mają doświadczenia z ocenianym elementem,
- unikają skrajnych deklaracji,
- ankieta zawiera zbyt wiele podobnych pytań,
- odpowiedź „nie wiem” jest niedostępna.
Jeśli środek wybiera wyjątkowo dużo osób, nie usuwaj go automatycznie. Najpierw sprawdź pytanie, próbę i kontekst.
Kiedy skala zaburza wynik
Skala może zmienić rezultat, gdy:
- jedna strona ma więcej kategorii niż druga,
- etykiety są asymetryczne, np. „źle, średnio, dobrze, bardzo dobrze, doskonale”,
- domyślna odpowiedź jest już zaznaczona,
- suwak startuje na środku i można wysłać go bez ruchu,
- kolejność krańców zmienia się między pytaniami,
- pytanie łączy dwa wątki, np. „Czy obsługa była szybka i pomocna?”,
- pytasz zbyt długo po zdarzeniu,
- filtrujesz wyniki bez ujawnienia zasad.
Jak raportować wyniki skal
Jeden wskaźnik rzadko wystarcza. Średnia 4,0 może wynikać z samych ocen 4 albo z mieszaniny ocen 1 i 5. Te sytuacje wymagają innych działań.
Średnia, mediana i dominanta
- Średnia ułatwia obserwowanie niewielkich zmian, ale jest wrażliwa na skrajne oceny i zakłada znaczenie odstępów.
- Mediana pokazuje środkową odpowiedź i dobrze pasuje do danych porządkowych.
- Dominanta wskazuje najczęściej wybieraną kategorię.
Dla odpowiedzi 1, 1, 3, 5, 5 średnia i mediana wynoszą 3, ale nikt poza jedną osobą nie wybrał neutralnej oceny. Sam wynik 3 ukrywa polaryzację.
Top-box i top-2-box
Dla skali 1-5:
- top-box to udział ocen 5,
- top-2-box to udział ocen 4 i 5,
- bottom-2-box to udział ocen 1 i 2.
Przykład dla 500 odpowiedzi:
| Ocena | Liczba | Udział |
|---|---|---|
| 1 | 35 | 7% |
| 2 | 45 | 9% |
| 3 | 70 | 14% |
| 4 | 210 | 42% |
| 5 | 140 | 28% |
Wyniki:
- top-box: 28%,
- top-2-box: 70%,
- bottom-2-box: 16%,
- neutralne: 14%.
Nie nazywaj top-2-box „średnią satysfakcją”. To udział zdefiniowanych odpowiedzi pozytywnych.
Zasady dobrego raportu
Przy każdym wyniku podaj:
- dokładne brzmienie pytania,
- skalę i znaczenie krańców,
- wzór wskaźnika,
- liczbę ważnych odpowiedzi,
- okres zbierania danych,
- kanał i moment wysyłki ankiety,
- udział braków odpowiedzi,
- rozkład, nie tylko średnią,
- zmianę względem porównywalnego okresu.
Praktyczny próg ostrożności: dla segmentów z mniej niż 30 odpowiedziami traktuj wynik jako sygnał jakościowy, nie stabilny wskaźnik. Przy większych próbach nadal uwzględniaj dobór respondentów i niepewność pomiaru.
Ustal próg działania przed analizą, na przykład:
- spadek CSAT o co najmniej 5 punktów procentowych przez dwa okresy - diagnoza procesu,
- bottom-2-box powyżej 20% - analiza komentarzy i segmentów,
- CES poniżej 5,0 na skali 1-7 - przegląd ścieżki,
- różnica między kanałami powyżej 8 punktów procentowych - kontrola typu spraw i profilu klientów.
Są to przykładowe progi operacyjne. Dostosuj je do zmienności własnych danych i kosztu reakcji.
Checklista
Przed uruchomieniem ankiety sprawdź:
- [ ] Czy każde pytanie mierzy jeden jasno określony element?
- [ ] Czy skala odpowiada celowi: satysfakcja, wysiłek, polecenie, zgoda czy priorytet?
- [ ] Czy respondent ma podstawę do udzielenia odpowiedzi?
- [ ] Czy wszystkie opcje w skali 5-punktowej mają etykiety?
- [ ] Czy punkt neutralny jest oddzielony od „nie wiem” i „nie dotyczy”?
- [ ] Czy wyższa wartość wszędzie oznacza ten sam kierunek oceny?
- [ ] Czy żadna odpowiedź nie jest domyślnie zaznaczona?
- [ ] Czy pytanie CSAT dotyczy konkretnej interakcji?
- [ ] Czy pytanie CES jednoznacznie mierzy łatwość albo wysiłek?
- [ ] Czy NPS używa skali 0-10 i standardowych grup 0-6, 7-8, 9-10?
- [ ] Czy matryca ma nie więcej niż około 4-7 wierszy?
- [ ] Czy ranking obejmuje maksymalnie około 5-7 elementów?
- [ ] Czy ankieta działa wygodnie na telefonie?
- [ ] Czy tłumaczenia zachowują natężenie i kierunek skali?
- [ ] Czy raport pokaże liczebność, rozkład i okres badania?
- [ ] Czy progi reakcji zostały ustalone przed obejrzeniem wyników?
- [ ] Czy porównujesz tylko próby zebrane w podobny sposób?
FAQ
Czy można liczyć średnią ze skali Likerta?
Można ją podawać jako praktyczne przybliżenie, szczególnie przy analizie wielu powiązanych pozycji. Dla pojedynczego pytania pokaż również medianę, top-2-box i pełny rozkład. Nie zakładaj, że różnica między 1 a 2 jest odczuwana dokładnie tak samo jak między 4 a 5.
Czy skala 10-punktowa jest dokładniejsza od 5-punktowej?
Nie zawsze. Daje więcej możliwych wartości, ale respondent może nie rozróżniać sensownie ocen 6 i 7. Skala 10- lub 11-punktowa sprawdza się w ustalonych metrykach, takich jak NPS. W prostych ocenach transakcyjnych często wystarczy pięć dobrze opisanych kategorii.
Czy trzeba dodawać odpowiedź „nie wiem”?
Dodaj ją, gdy część respondentów może nie znać ocenianego elementu. Nie używaj jej automatycznie w każdym pytaniu. Jeśli każdy respondent właśnie zakończył konkretną operację, zwykle ma podstawę do oceny jej łatwości.
Co jest lepsze: CSAT czy CES?
CSAT wybierz, gdy chcesz poznać zadowolenie z interakcji. CES jest lepszy, gdy diagnozujesz łatwość procesu i bariery. Po kontakcie z obsługą możesz zastosować oba pytania, ale każde powinno prowadzić do innej decyzji: CSAT do oceny efektu, CES do usprawnienia ścieżki.
Czy można porównywać NPS między krajami?
Można, ale ostrożnie. Kontroluj tłumaczenie, sposób doboru próby, kanał, etap relacji i kulturowy styl odpowiedzi. Pokazuj udziały promotorów, pasywnych i krytyków, zamiast porównywać wyłącznie końcową wartość NPS.
Co zrobić, gdy większość respondentów wybiera środek skali?
Sprawdź, czy pytanie jest jednoznaczne, a respondent zna oceniany obszar. Dodaj „nie wiem”, jeśli jest potrzebne, skróć matrycę i zweryfikuj etykiety. Nie usuwaj neutralnego punktu wyłącznie po to, aby wymusić bardziej zdecydowany wynik.
W REEP możesz zbudować ankietę z opisanymi skalami, zebrać odpowiedzi i porównać rozkłady między segmentami. Zacznij od jednej decyzji badawczej, wybierz odpowiadającą jej skalę i przed publikacją przejdź przez checklistę.
Gotowy zapytać swoich klientów?
Wypróbuj REEP - stwórz ankietę, udostępnij ją krótkim linkiem reep.pl i zbieraj decyzyjne odpowiedzi zamiast domysłów. Pierwsza ankieta zajmuje mniej niż 5 minut.