Raport o AI dla zarządu: które liczby są dowodem, a które dekoracją slajdu
Decyzja, którą podejmiesz po tym tekście
Liczba zapytań do modelu i procent adopcji rosną też tam, gdzie AI nie zarobiła złotówki. Który komplet wskaźników położyć zarządowi na kwartalnym przeglądzie.
Slajd o sztucznej inteligencji na kwartalnym posiedzeniu zarządu składa się najczęściej z trzech liczb: ile zapytań trafiło do modelu, ilu pracowników przeszkolono i jaki odsetek z nich jest zadowolony z narzędzia. Wszystkie trzy potrafią rosnąć w firmie, która na AI nie zarobiła ani złotówki. Żadna nie odpowiada na pytanie, po które zarząd siada do tego punktu agendy: co konkretnie zmieniło się w firmie i skąd to wiadomo.
Skala rozjazdu jest policzona. Trzydzieści dziewięć procent organizacji potrafi przypisać sztucznej inteligencji jakikolwiek wpływ na EBIT, a większość z nich mówi o wpływie poniżej pięciu procent — tak wynika z badania McKinseya opublikowanego w listopadzie 2025 roku na próbie 1993 respondentów ze 105 krajów. W tym samym badaniu 88 procent organizacji deklaruje regularne używanie AI w co najmniej jednej funkcji biznesowej. Odległość między tymi dwiema liczbami to przestrzeń, w której powstaje większość slajdów pokazywanych zarządom — i której nie widać, dopóki raport składa się wyłącznie z warstwy aktywności.
Co właściwie rośnie, kiedy rośnie liczba zapytań do modelu
Liczba zapytań mierzy jedno: że ludzie mają dostęp do narzędzia i z niego korzystają. Jest to warunek konieczny wyniku i nic ponadto. Wskaźnik rośnie tak samo, gdy zespół obsługi klienta skraca czas odpowiedzi o połowę, jak i wtedy, gdy ci sami ludzie generują streszczenia spotkań, których nikt nie czyta.
Rozróżnienie, które porządkuje cały raport zarządczy, jest proste. Wskaźniki aktywności opisują, co dzieje się z narzędziem. Wskaźniki wyniku opisują, co dzieje się z procesem. Wskaźniki finansowe opisują, co dzieje się z rachunkiem. Trzy warstwy mierzą trzy różne rzeczy i żadna nie zastępuje pozostałych, choć w raportach nagminnie występuje sama pierwsza — bo jest najłatwiej dostępna. Systemy do pracy z modelami logują zapytania od pierwszego dnia, a pomiar czasu obsługi sprawy trzeba zaprojektować.
Zasada dla zarządu: warstwa pierwsza jest dopuszczalna wyłącznie jako kontekst dla dwóch pozostałych. Sam slajd z krzywą użycia idącą w górę nie jest raportem o wdrożeniu, tylko raportem o dostępności licencji.
Które liczby są dowodem, a które tylko ruchem
Poniższa tabela porządkuje wskaźniki, które najczęściej trafiają na przeglądy kwartalne. Kolumna trzecia jest tą, o którą trzeba dopytać, zanim liczba zostanie przyjęta jako dowód.
| Wskaźnik | Co faktycznie pokazuje | Kiedy wprowadza w błąd | Czym go uzupełnić |
|---|---|---|---|
| Liczba zapytań lub sesji | Dostępność narzędzia i nawyk korzystania | Zawsze, gdy występuje bez wskaźnika procesu — rośnie także przy pracy bezproduktywnej | Udział spraw obsłużonych z użyciem modelu w całości wolumenu |
| Odsetek pracowników z dostępem | Postęp wdrożenia technicznego | Gdy prezentowany jako adopcja — dostęp to nie użycie, a użycie to nie wynik | Odsetek osób używających narzędzia w procesie co najmniej raz w tygodniu |
| Zaoszczędzone godziny | Szacunek skrócenia czynności, zwykle deklaratywny | Gdy pochodzi z ankiety wśród użytkowników i jest mnożony przez stawkę godzinową | Pomiar czasu przejścia sprawy przed wdrożeniem i po nim, na tej samej próbie |
| Satysfakcja użytkowników | Akceptację narzędzia przez zespół | Gdy zastępuje pomiar jakości wyniku — ludzie lubią narzędzia, które zdejmują nudną pracę, niezależnie od skutku | Odsetek wyników wymagających poprawki przez człowieka |
| Liczba uruchomionych zastosowań | Aktywność zespołu wdrożeniowego | Prawie zawsze — sama liczba uruchomień nie mówi, ile z nich obsługuje realny ruch | Udział wolumenu firmy, który faktycznie przechodzi przez te zastosowania |
| Wyniki benchmarków dostawcy | Zachowanie modelu na cudzych danych | Gdy podstawiane pod pytanie o skuteczność w firmie | Pomiar na własnej próbce spraw, z ręcznie ustaloną poprawną odpowiedzią |
Ile z zaoszczędzonych godzin wraca do rachunku wyników
Zaoszczędzony czas jest najczęściej raportowaną i najsłabiej ugruntowaną liczbą w całym obszarze. Godzina odzyskana pracownikowi zmienia rachunek wyników w trzech sytuacjach i w żadnej innej: kiedy firma faktycznie zmniejsza koszt pracy, kiedy ten sam zespół obsługuje wyższy wolumen bez rekrutacji, albo kiedy czas zostaje przesunięty na działanie, które generuje przychód i da się to działanie wskazać z nazwy.
Jeżeli żaden z tych trzech warunków nie jest spełniony, oszczędność jest realna dla pracownika i niewidoczna dla rachunku. To nie jest argument przeciwko wdrożeniu — komfort pracy i mniejsza rotacja mają wartość. To argument przeciwko wpisywaniu takiej oszczędności do slajdu z jednostką „PLN”.
Pomiar, który to rozstrzyga, wymaga rzeczy nudnej i wykonalnej: opisanego procesu sprzed wdrożenia. Bez wiedzy, z ilu kroków składa się obsługa sprawy, kto je wykonuje i ile trwa przejście od zgłoszenia do zamknięcia, nie ma od czego odjąć poprawy. Organizacje, które nie mają tego opisu, zwykle zaczynają od pytania, które procesy opisać najpierw — i jest to sensowniejszy pierwszy wydatek niż kolejna licencja. Kolejność jest tu jednokierunkowa: punkt odniesienia zbiera się przed uruchomieniem, bo później nie ma już czego zmierzyć.
Trzeźwe pytanie kontrolne brzmi: co konkretnie zrobiono z odzyskanym czasem i kto to zaobserwował. Jeśli odpowiedź brzmi „ludzie mają luźniej”, wskaźnik należy do warstwy jakościowej, a nie finansowej. Deloitte, w badaniu na próbie 1854 kierowników z 14 krajów Europy i Bliskiego Wschodu przeprowadzonym między 15 sierpnia a 5 września 2025 roku, podaje, że większość respondentów osiąga satysfakcjonujący zwrot z typowego zastosowania AI w perspektywie dwóch do czterech lat, a zaledwie 6 procent w ciągu roku. Raport z pierwszego kwartału pokazujący zwrot wyższy niż to, co osiąga górny percentyl rynku, jest sygnałem do sprawdzenia metody liczenia, a nie do gratulacji.
Czego nie pokazywać zarządowi jako sukcesu
Lista rzeczy, które w raportach funkcjonują jako osiągnięcie, a nim nie są:
- Odsetek pracowników z dostępem do narzędzia. Mierzy zakup licencji. Firma może mieć sto procent i zero zmian w procesach.
- Oszczędność liczona jako godziny razy stawka. Prawidłowa tylko wtedy, gdy koszt pracy naprawdę spadł albo wolumen wzrósł. W pozostałych przypadkach to przeliczenie, nie oszczędność.
- Wynik podany bez punktu odniesienia. „Skróciliśmy obsługę do dwóch dni” nie znaczy nic, dopóki nie wiadomo, ile trwała wcześniej i czy liczona była tak samo. Punkt odniesienia zbiera się przed uruchomieniem, a nie odtwarza z pamięci po fakcie.
- Sukcesy pojedynczych osób. Analityk, który skrócił sobie raport z czterech godzin do jednej, jest ciekawą anegdotą. Wskaźnikiem staje się dopiero wtedy, gdy ten sam sposób pracy działa u pozostałych i został opisany.
- Wykres bez opisanej osi i bez okresu porównawczego. Krzywa idąca w górę jest przekonująca niezależnie od tego, co przedstawia. Slajd bez jednostki i bez poprzedniego kwartału obok jest ilustracją, nie danymi.
- Wskaźnik policzony inną metodą niż poprzednio. Zmiana definicji między kwartałami — inna próba, inny zakres spraw, inny licznik — potrafi wygenerować poprawę bez żadnej zmiany w rzeczywistości. Jeżeli metoda się zmieniła, obie wersje pokazuje się obok siebie.
- Bezpieczeństwo raportowane jako brak incydentów. Brak zgłoszeń w organizacji, która nie ma jak wykryć wycieku danych do zewnętrznego modelu, mierzy zdolność wykrywania, a nie skalę zjawiska.
Jak czytać cudze liczby o nieudanych wdrożeniach
Na przeglądach coraz częściej pojawiają się liczby z rynku, używane jako argument w obie strony. Dwie krążą najszerzej i obie wymagają kontekstu.
Pierwsza to ustalenie z raportu The GenAI Divide przygotowanego w ramach projektu NANDA w MIT, w wersji z lipca 2025 roku: około 95 procent inicjatyw generatywnej AI nie przynosi mierzalnego zwrotu, przy wydatkach rzędu 30–40 miliardów dolarów. Liczba jest cytowana jako werdykt o rynku, a opiera się na 52 rozmowach, 153 odpowiedziach ankietowych i przeglądzie ponad 300 ujawnionych publicznie wdrożeń. To sensowna próba na badanie jakościowe i za mała, żeby traktować sam odsetek jako pomiar. Wartość tego raportu leży w diagnozie przyczyny — systemy nie zapamiętują informacji zwrotnej i nie poprawiają się w czasie — a nie w samej liczbie.
Druga to prognoza Gartnera z czerwca 2025 roku, według której ponad 40 procent projektów agentowych zostanie anulowanych do końca 2027 roku, z powodu rosnących kosztów, niejasnej wartości biznesowej albo niewystarczających mechanizmów kontroli ryzyka. To prognoza, nie wynik pomiaru, oparta między innymi na ankiecie wśród 3412 uczestników webinaru ze stycznia 2025 roku. Jako liczba do slajdu jest słaba. Jako lista trzech powodów, przez które projekty się zamyka, jest gotowym zestawem pytań kontrolnych do każdego wdrożenia w portfelu.
Reguła przy cytowaniu cudzych badań na posiedzeniu: podaj próbę i metodę razem z liczbą albo nie podawaj liczby. Zarząd, który zaakceptuje jedno badanie bez metryczki, zaakceptuje też wewnętrzny raport bez punktu odniesienia — to ten sam nawyk.
Jaki komplet liczb położyć na kwartalnym przeglądzie
Minimalny zestaw, który daje się zebrać w każdej organizacji i wystarcza, żeby zarząd rozmawiał o rzeczywistości, a nie o slajdzie. Ostatnia kolumna jest miejscem, w którym raport przestaje być sprawozdaniem, a zaczyna być narzędziem decyzyjnym: wskazuje wartość, przy której temat wraca na agendę zamiast zostać przyjęty do wiadomości.
| Warstwa | Wskaźnik | Skąd pochodzi | Próg wymagający decyzji |
|---|---|---|---|
| Proces | Czas przejścia sprawy: przed wdrożeniem i teraz | System obsługujący proces, nie deklaracje zespołu | Poprawa poniżej 15 procent po dwóch kwartałach |
| Jakość | Odsetek wyników poprawianych przez człowieka | Log akceptacji i korekt | Wzrost między kwartałami przy stałym wolumenie |
| Koszt | Koszt jednostkowy obsłużonej sprawy, z licencjami i pracą zespołu utrzymania | Faktury dostawcy plus ewidencja czasu zespołu | Koszt jednostkowy rosnący mimo rosnącego wolumenu |
| Finanse | Skutek w budżecie jednostki, wskazany w konkretnej pozycji | Controlling, uzgodnione z właścicielem budżetu | Brak możliwości wskazania pozycji po dwóch kwartałach |
| Ryzyko | Liczba działań wykonanych bez zatwierdzenia przez człowieka tam, gdzie było wymagane | Log decyzji systemu | Każde wystąpienie |
| Porównywalność | Odsetek wskaźników policzonych tą samą metodą co kwartał wcześniej | Metryczka pod raportem: próba, zakres, definicja licznika | Każda zmiana metody nieopisana w metryczce |
Pozycja z kosztem jednostkowym jest w tej tabeli najczęściej pomijana, a wyłapuje problem, którego nie widać w żadnej innej. Rozwiązania oparte na modelach rozliczają się za zużycie, więc rachunek rośnie wraz z liczbą obsłużonych spraw — co samo w sobie jest w porządku. Sygnałem alarmowym jest sytuacja, w której koszt jednej sprawy rośnie z miesiąca na miesiąc, bo oznacza to, że system zużywa coraz więcej na tę samą pracę. Mechanika tego zjawiska przy wdrożeniach agentowych jest opisana osobno: rachunek za agenta potrafi rosnąć po miesiącu mimo stałego wolumenu zgłoszeń. Na poziomie zarządu wystarczy jedna liczba i jej trend — bez niej wzrost kosztu ukrywa się w rosnącym wolumenie.
Zestaw ma sześć pozycji, bo tyle mieści się na jednym slajdzie i tyle da się rzetelnie zebrać. Raport z dwudziestoma wskaźnikami nie jest dokładniejszy — jest trudniejszy do zakwestionowania, co bywa jego prawdziwym celem.
Pytania do zadania na najbliższym posiedzeniu
- Który konkretny wskaźnik procesu zmienił się od poprzedniego kwartału i z jakiego systemu pochodzi ta liczba?
- Czy mamy pomiar stanu sprzed wdrożenia dla każdego zastosowania, o którym dziś raportujemy? Jeśli nie — dla których go brakuje?
- Co zrobiliśmy z zaoszczędzonym czasem i w której pozycji budżetu to widać?
- Które wskaźniki w tym raporcie policzono inaczej niż kwartał wcześniej i gdzie to opisano?
- Jaki jest koszt jednostkowy obsłużonej sprawy i jak zmienił się w ciągu trzech ostatnich miesięcy?
- Kto imiennie odpowiada za liczby w tym raporcie i czy jest to ta sama osoba, która odpowiada za wdrożenie?
Ostatnie pytanie jest najbardziej niewygodne i najbardziej potrzebne. Zespół, który wdraża, raportuje o własnej pracy — nie z nieuczciwości, tylko dlatego, że zna wyłącznie swoją perspektywę. Rozdzielenie tych ról albo choćby przepuszczenie raportu przez controlling przed posiedzeniem kosztuje jeden dzień pracy i zmienia jakość każdej kolejnej decyzji o budżecie na AI.