Pilot agentów AI: policz czas, koszt i poprawki przed wdrożeniem
Jak sprawdzić przydatność agenta na własnym procesie. Pomiar czasu, kontrola człowieka, błędy i koszt poprawnie zakończonego zadania.
Dobry pilot porównuje tę samą pracę przed zmianą i po zmianie. Do czasu agenta doliczamy sprawdzenie wyniku, poprawki i koordynację. Liczba agentów ani procent automatyzacji nie są samodzielnym dowodem korzyści.

- 01Praca ręczna
- 02Próba na tych samych sprawach
- 03Kontrola i poprawki
- 04Porównanie kosztu
- 05Decyzja o wdrożeniu
Jedna czynność trafia do pomiaru tylko raz. Wynik pilotażu nie gwarantuje identycznej skuteczności dla innych danych.
Wybierz jedną czynność i ustal wynik
Zacznij od zadania, które pracownik umie dziś wykonać: odczyt pól dokumentu, sprawdzenie importu albo przygotowanie listy nieuzgodnionych kwot. Zapisz, jaki wynik przyjmie osoba odpowiedzialna. „Agent odpowiedział” nie oznacza, że sprawa została poprawnie zakończona.
Mierz cały przebieg, także wyjątki. Łatwy dokument i nieczytelny skan to różne przypadki. Próbka powinna zawierać oba, a także duplikat, brak pola i sprzeczną informację. Oddziel czas oczekiwania od czasu pracy człowieka. Dzięki temu nie przypiszesz modelowi poprawy wynikającej tylko z uporządkowania danych.
Przykład: kontrola dokumentów
Przyjmijmy 100 syntetycznych spraw po 10 minut pracy ręcznej. Agent obsłuży 60 z nich, a sprawdzenie każdej zajmie 3 minuty. Pozostałe 40 nadal wymaga po 10 minut. Dodajmy minutę koordynacji do każdej obsłużonej sprawy. Przed zmianą mamy 1000 minut, po zmianie 640 minut: 400 ręcznej obsługi, 180 kontroli i 60 koordynacji. Różnica to 6 godzin miesięcznie.
Przy koszcie godziny 70 zł wartość odzyskanego czasu wynosi 420 zł. Jeśli utrzymanie kosztuje 300 zł, zostaje 120 zł wartości miesięcznej, nie automatyczna oszczędność gotówki. Przygotowanie za 2000 zł pokryłoby się tą wartością po około 16,7 miesiąca, o ile założenia się utrzymają. Więcej czasu na kontrolę może całkowicie odwrócić wynik.
Nie pomijaj jakości i odmów dostępu
Dokumentacja Anthropic dotycząca ewaluacji agentów opisuje rozdzielenie zadania, wykonania i oceny wyniku. W praktyce firmy warto oceniać nie tylko treść odpowiedzi, lecz także poprawność użycia narzędzi i stan końcowy. Zestaw prób powinien być powtarzalny po zmianie modelu.
Zapisz, czy agent potrafił wstrzymać działanie bez danych, odrzucić cudzy dokument i przekazać sprawę do człowieka. Ponowienie po awarii nie może tworzyć drugiego zadania lub wysyłki. Potrzebne są dowody wykonania, a nie wyłącznie ładnie sformułowane podsumowanie.
Po co sześć specjalizacji i AL?
W iPro sześć modułów ma osobne zakresy: dokumenty, przygotowanie danych KSeF/JPK, płynność, controlling, zamknięcie okresu i jakość importu. AL koordynuje kontekst i przekazanie zadania. To podział odpowiedzialności, nie dowód, że siedem niezależnych modeli wykona więcej pracy.
Kalkulator DS pozwala zaznaczyć potrzebne specjalizacje oraz zmienić liczbę zadań, udział spraw obsługiwanych przez moduł, czas kontroli i koszty. Nie uruchamia agentów ani nie łączy danych firmy. Przed wdrożeniem potwierdzamy połączenia, uprawnienia i wynik ograniczonego pilotażu.
- Porównywalna próbka i ustalony wynik.
- Ręczna obsługa wyjątków uwzględniona w czasie.
- Koszt systemu, modeli i kontroli w jednym rachunku.
- Test odmowy dostępu, ponowienia i przerwania.
- Decyzja właściciela procesu po przejrzeniu dowodów.
Podobny problem w Twojej firmie?
Opisz obecny sposób pracy i oczekiwany wynik. Dane poufne oraz dokumenty omówimy osobno.
Porozmawiajmy o procesie