Praktyczny przewodnik po weryfikacji AI opartej na źródłach

Jak weryfikować wyniki AI względem dokumentów źródłowych (krok po kroku)

Raporty generowane przez AI mogą wyglądać precyzyjnie, a jednocześnie wykorzystywać niewłaściwy mianownik, pomijać wiersze lub formułować twierdzenia, których źródło nie potwierdza. Ten przewodnik pokazuje, jak systematycznie weryfikować wyniki: zidentyfikować pliki źródłowe, ponownie obliczyć istotne dane, prześledzić każde twierdzenie do konkretnego dowodu, sprawdzić wnioskowanie i zapisać jednoznaczny werdykt przed przekazaniem materiału.

Rachel Hu
Rachel Hu
Od ponad dekady tworzę bezpieczne systemy AI dla złożonych i wymagających środowisk — od finansów ilościowych po skalowalne aplikacje z zakresu data science.

Czym jest weryfikacja wyników AI względem dokumentów źródłowych? (Krótka definicja)

Weryfikacja wyników AI względem dokumentów źródłowych to niezależny proces kontroli jakości, który sprawdza, czy wygenerowane liczby, twierdzenia, wykresy i wnioski są zgodne z oryginalnymi plikami. Korzystają z niego analitycy, zespoły finansowe i księgowe, działy operacyjne, badacze, inżynierowie oraz wszystkie osoby odpowiedzialne za materiały, które muszą być odtwarzalne. Proces ten rozwiązuje problem zaufania do dopracowanej odpowiedzi bez wiedzy o tym, czy jej dowody, obliczenia, założenia i porównania są prawidłowe.

Niezależna weryfikacja w praktyce

Oblicz ponownie, nie tylko sprawdzaj

Zgłoszoną liczbę należy obliczyć ponownie bezpośrednio na podstawie źródła. W jednym z audytów wydatków suma za pierwszy kwartał zgadzała się co do centa dla 412 wierszy, natomiast porównanie procentowe było błędne, ponieważ wynik wykorzystywał niepełną sumę częściową za czwarty kwartał.

Prześledź każde istotne twierdzenie

Rzetelny wynik wskazuje plik źródłowy, wiersz lub pole, obliczenie, miejsce w materiale oraz odwołanie do dowodu. Tworzy to możliwy do prześledzenia łańcuch zamiast wskaźnika pewności działającego jak czarna skrzynka.

Sprawdź sam materiał wynikowy

Weryfikacja obejmuje arkusze kalkulacyjne, pliki PDF, pulpity nawigacyjne, wykresy i sformatowane wyniki. Pulpit może zawierać prawidłowe dane, a mimo to nie przejść kontroli, jeśli zakres wykresu pomija ostatni wiersz lub właściwość wymaganego układu jest nieprawidłowa.

Zrzut ekranu raportu audytowego Energent

Skup uwagę na tym, co zostało oznaczone

Praktyczna zmiana polega na odejściu od ręcznego sprawdzania wszystkiego na rzecz przeglądania wyjątków. Wynik pozytywny/negatywny poparty dowodami sprawia, że pozostała praca kontrolna jest bardziej ukierunkowana.

Krótka odpowiedź (Zrób to najpierw)

  • Wymień dokładne dokumenty źródłowe wykorzystane do utworzenia wyniku AI.
  • Wymień każdy materiał wynikowy, który należy sprawdzić, w tym arkusze kalkulacyjne, pliki PDF, pulpity nawigacyjne i pliki tekstowe.
  • Oblicz ponownie każdą istotną liczbę na podstawie wierszy, pól lub komórek źródłowych.
  • Sprawdź mianowniki, okresy porównawcze, jednostki, waluty, daty oraz sposób traktowania brakujących wartości.
  • Prześledź każde ważne twierdzenie do konkretnego miejsca w źródle i materiale wynikowym.
  • Rozdziel wyniki zgłoszone, obliczone, wywnioskowane, częściowe, niepotwierdzone i nieprawidłowe.
  • Przed zaakceptowaniem lub przekazaniem pracy przejrzyj wyłącznie oznaczone problemy.

Wymagania wstępne (Czego potrzebujesz)

  • Oryginalnych plików źródłowych wykorzystanych przez agenta AI tworzącego wynik.
  • Materiałów wynikowych wygenerowanych przez AI, które mają zostać zweryfikowane.
  • Dostępu do wierszy, pól, komórek, oznaczonego tekstu i logiki obliczeń.
  • Spójnych definicji dat, okresów, jednostek, walut i kategorii.
  • Miejsca do zapisywania dowodów, założeń, ograniczeń i werdyktów.
  • Uprawnień do sprawdzania sformatowanych plików i powiązanych wykresów.

Krok po kroku: weryfikacja wyników AI względem dokumentów źródłowych

Krok 1: Zidentyfikuj dokumenty źródłowe

Co zrobić: Zapisz każdy plik użyty do utworzenia wyniku, na przykład vendor_invoices_q1.csv, q4_spend_summary.xlsx, pliki źródłowe SQL, gapminder.csv lub metadane globalnego widoku ulic. Osobno zapisz materiały wynikowe, w tym raporty, skoroszyty, przewodniki i pulpity nawigacyjne.

Jak wygląda sukces: Każdy wniosek można powiązać z co najmniej jednym nazwanym plikiem źródłowym i jednym konkretnym materiałem wynikowym.

Typowy błąd, którego należy unikać: Nie weryfikuj wyłącznie narracji, pomijając skoroszyt, wykres, plik PDF lub pulpit zawierający ostateczny wynik.

Krok 2: Oblicz ponownie każdą istotną wartość

Co zrobić: Oblicz ponownie zgłoszone sumy, średnie, wskaźniki, rankingi i zmiany bezpośrednio na podstawie źródła. Na przykład zsumowanie vendor_invoices_q1.csv dało łączną kwotę 1 284 500,00 USD za pierwszy kwartał w 412 wierszach.

Jak wygląda sukces: Wynik obliczony ponownie zgadza się z materiałem wynikowym albo jest wyraźnie oznaczony jako nieprawidłowy lub częściowy.

Typowy błąd, którego należy unikać: Nie traktuj precyzji wyświetlanej liczby jako dowodu poprawności obliczenia.

Krok 3: Zweryfikuj mianownik i okres porównawczy

Co zrobić: Sprawdź, czy licznik i mianownik wykorzystują zgodne definicje i pełne okresy. W przykładzie dotyczącym wydatków pierwszy kwartał wyniósł 1 284 500 USD, a czwarty kwartał 1 147 000 USD, więc prawidłowy wzrost wyniósł 12,0%, a nie 18%; nieprawidłowy wynik wykorzystywał sumę częściową za czwarty kwartał, z której wyłączono dział Facilities.

Jak wygląda sukces: Porównanie można odtworzyć na podstawie jasno zdefiniowanych wartości porównywalnych między sobą.

Typowy błąd, którego należy unikać: Nie porównuj pełnego okresu z sumą częściową, okresem niepełnym lub kategorią sklasyfikowaną w inny sposób.

Krok 4: Prześledź twierdzenie do dokładnego miejsca w źródle

Co zrobić: Zapisz plik źródłowy, wiersz lub pole, obliczenie, miejsce w materiale wynikowym oraz odwołanie do dowodu. Ranking dostawców można udokumentować jako Acme Logistics z kwotą 312 000 USD, przy czym wydatki w kategorii Logistics uzgodniono do kwoty 512 000 USD.

Jak wygląda sukces: Inny recenzent może prześledzić ścieżkę dowodową bez konieczności proszenia pierwotnego analityka o wyjaśnienie ukrytych kroków.

Typowy błąd, którego należy unikać: Nie podawaj wyłącznie nazwy pliku, gdy twierdzenie zależy od konkretnego wiersza, pola, komórki lub oznaczonego fragmentu.

Krok 5: Sprawdź, czy źródło potwierdza wniosek

Co zrobić: Odróżnij obserwowalną wartość od szerszej interpretacji. Wydatki na oprogramowanie wyniosły 298 000 USD, w tym 84 000 USD rocznych przedpłat, jednak twierdzenie, że wydatki na Software wzrosły o około 30% kwartał do kwartału, było niepotwierdzone, ponieważ nie istniała wartość dla Software z poprzedniego kwartału.

Jak wygląda sukces: Wnioski nie wykraczają poza to, co źródło może ustalić.

Typowy błąd, którego należy unikać: Nie przekształcaj prawdopodobnego wyjaśnienia w zweryfikowany wniosek przyczynowy, gdy źródło zawiera jedynie korelację lub niepełny zakres danych.

Krok 6: Sklasyfikuj status dowodów

Co zrobić: Oznacz każdy wynik jako zgłoszony, obliczony, wywnioskowany, częściowy, niepotwierdzony lub nieprawidłowy. Użyj statusu „Zaliczono”, gdy wynik zgadza się z odtwarzalnym obliczeniem źródłowym, „Częściowo”, gdy metodologia wymaga zastrzeżeń, „Nie zaliczono”, gdy twierdzenie jest sprzeczne ze źródłem lub obliczone nieprawidłowo, oraz „Niepotwierdzone”, gdy źródło nie pozwala go ustalić.

Jak wygląda sukces: Recenzenci mogą od razu rozpoznać, które stwierdzenia mają bezpośrednie potwierdzenie, a które wymagają korekty lub zastrzeżenia.

Typowy błąd, którego należy unikać: Nie zastępuj jednoznacznych werdyktów niejasnym językiem pewności, który ukrywa przyczynę niepewności.

Krok 7: Sprawdź plik końcowy i udokumentuj ograniczenia

Co zrobić: Sprawdź wykresy, właściwości układu, zakresy, formatowanie, brakujące rekordy i zakres danych źródłowych. W audycie pulpitu RTL właściwość arkusza i agregacje przeszły kontrolę, natomiast odwrócenie kolumn i zakres wykresu nie przeszły jej, ponieważ wykres pomijał ostatni wiersz.

Jak wygląda sukces: Końcowy materiał jest poprawny liczbowo i użyteczny strukturalnie, a brakujące dane i ograniczenia są jasno udokumentowane.

Typowy błąd, którego należy unikać: Nie zakładaj, że prawidłowe obliczenie oznacza poprawność gotowego pliku pod każdym względem.

Lista kontrolna walidacji (Upewnij się, że wszystko działa)

  • ☐ Każda istotna liczba jest powiązana z nazwanym plikiem źródłowym.
  • ☐ Każde obliczenie wykorzystuje właściwy licznik i mianownik.
  • ☐ Okresy porównawcze mają zgodne definicje i pełny zakres danych.
  • ☐ Sumy uzgadniają się z podstawowymi wierszami lub polami.
  • ☐ Jednostki, waluty i daty są spójne.
  • ☐ Brakujące wartości są odróżnione od uzasadnionych wartości zerowych.
  • ☐ Sprawdzono zduplikowane i nieprawidłowo sformatowane rekordy.
  • ☐ Wartości pochodne i wywnioskowane są wyraźnie oznaczone.
  • ☐ Wykresy zawierają każdy zamierzony wiersz i każdą zamierzoną kolumnę.
  • ☐ Odwołania do dowodów wskazują dokładne wiersze, pola, komórki lub oznaczony tekst.

Typowe problemy i rozwiązania

Problem Przyczyna Rozwiązanie
Zmiana procentowa jest nieprawidłowa. Mianownik wykorzystuje niepełną sumę częściową lub niedopasowany okres. Odtwórz sumy obu okresów na podstawie tych samych definicji kategorii, a następnie oblicz zmianę ponownie.
Trend jest przedstawiony jako zweryfikowany. Źródło nie zawiera wcześniejszego okresu ani porównywalnej wartości bazowej. Oznacz twierdzenie jako niepotwierdzone albo przedstaw je ponownie jako obserwację dotyczącą bieżącego okresu.
Liczba jest poprawna, ale interpretacja jest słaba. Klasyfikacja lub metodologia zmienia znaczenie tej wartości. Oznacz wynik jako częściowy i wyjaśnij założenie, na przykład konieczność rozliczenia rocznych przedpłat w czasie.
Wykres pulpitu pomija dane. Zakres wykresu nie obejmuje całej tabeli. Rozszerz zakres wykresu do ostatniego zamierzonego wiersza i sprawdź wyrenderowany wykres.
Zakres danych źródłowych dla twierdzenia o lokalizacji jest pusty. Zbiór danych nie zawiera rekordów dotyczących danego kraju, miejsca lub obiektu. Udokumentuj brak możliwości bezpośredniego dopasowania i wskaż alternatywne dowody, nie traktując braku danych jako obalenia twierdzenia.

Najlepsze praktyki (Rób to właściwie w długiej perspektywie)

  • Przechowuj pliki źródłowe i materiały wynikowe w nazwanym wykazie — dzięki temu zakres audytu jest jednoznaczny.
  • Niezależnie obliczaj ponownie istotne wartości — precyzja odpowiedzi AI nie dowodzi poprawności.
  • Zapisuj dokładne miejsca dowodów — inny recenzent powinien móc odtworzyć wynik.
  • Oddzielaj dowody od wnioskowania — zapobiega to przekształcaniu prawdopodobnych wyjaśnień w niepotwierdzone fakty.
  • Stosuj jednoznaczne werdykty „Zaliczono”, „Częściowo”, „Nie zaliczono” i „Niepotwierdzone” — jasne etykiety przyspieszają decyzje kontrolne.
  • Sprawdzaj końcowy plik, a nie tylko narrację — formatowanie, zakresy wykresów i właściwości skoroszytu również mogą być nieprawidłowe.
  • Dokumentuj brakujące lub niepełne dane źródłowe — ograniczenie jest bardziej użyteczne niż fałszywa precyzja.

W przypadku zespołów obsługujących cykliczne zadania finansowe lub operacyjne audyt AI oparty na źródłach może sprawić, że proces będzie powtarzalny. Powiązane procesy mogą również wspierać kontrole uzgadniania finansowego i walidację Power Query.

Dane przypadków użycia: co faktycznie wykazały audyty

Poniższe przykłady pokazują, dlaczego weryfikacja musi sprawdzać zarówno arytmetykę, jak i znaczenie. Wartości pochodzą z dostarczonych przypadków audytowych i są przedstawione jako obserwowalne wyniki, a nie ogólne benchmarki.

Analiza przychodów: od lipca do sierpnia

Przychód brutto: lipiec$83.3k
Przychód brutto: sierpień$84.8k
Przychód netto: lipiec$80.0k
Przychód netto: sierpień$77.0k

Audyt wykazał również wzrost zwrotów z 3,2 tys. USD do 7,8 tys. USD oraz wzrost liczby zwrotów produktu The Original Mr. Fuzzy z 42 do 132 sztuk.

Audyt budżetu: trzy ujęcia

UjęcieŁączne wydatkiZnaczenie
Budżet przyjęty$12.41 billionPierwotny limit prawny i cel
Budżet szacowany$6.06 billionFormalna aktualizacja prognozy
Wydatki rzeczywiste$5.92 billionRzeczywiste wydatki na koniec roku

Wydatki rzeczywiste stanowiły około 47% przyjętego budżetu. Audyt wykazał również, że wydatki na Police przekroczyły przyjęty budżet o 2,4%, a wydatki na Trash & Sanitation o 2,1%.

Status weryfikacji według twierdzeń z audytu wydatków

TwierdzenieWerdyktDowód
Wydatki w pierwszym kwartale wyniosły 1 284 500 USDZaliczonoNiezależnie zsumowano 412 wierszy i uzyskano zgodność.
Wydatki wzrosły o 18% względem czwartego kwartałuNie zaliczonoPrawidłowe porównanie wyniosło 12,0% przy użyciu pełnej sumy za czwarty kwartał.
Acme Logistics było głównym dostawcą z kwotą 312 000 USDZaliczonoPotwierdzono maksymalną wartość dostawcy i uzgodniono wydatki kategorii.
Wydatki na Software wyniosły 298 000 USDCzęściowoWartość była poprawna, ale obejmowała 84 000 USD rocznych przedpłat.
Wydatki na Software wzrosły o około 30% kwartał do kwartałuNiepotwierdzoneŹródło nie zawierało wartości dla Software z poprzedniego kwartału.

Ta sama zasada obowiązuje, gdy zespoły porównują dokumentację finansową, przekształcają poprawki w procesy wielokrotnego użytku lub wykrywają niepotwierdzone twierdzenia AI.

Polecane narzędzie (opcjonalnie): Energent.ai

Energent Audit jest opisywany jako niezależny audytor AI: drugi agent oddzielony od agenta, który utworzył materiał. Ponownie oblicza liczby, śledzi wartości do plików i pól źródłowych, porównuje twierdzenia z odwołaniami, identyfikuje błędy, jeśli to możliwe, oraz wydaje werdykt pozytywny/negatywny wraz z dowodami.

  • Sprawdza arkusze kalkulacyjne, pliki PDF, pliki CAD, skany i inne obsługiwane typy dokumentów.
  • Obsługuje ponad 150 typów plików, w tym CAD, G-code, skany, InDesign, BOM, PDF, XLSX i DOCX.
  • Tworzy ścieżkę dowodową, aby recenzenci mogli skupić się na oznaczonych wynikach.
  • Przekształca powtarzalne zadania i poprawki w procesy wielokrotnego użytku oraz reguły audytowe.
  • Udostępnia materiały gotowe dla interesariuszy, które można oznaczyć własną marką.

Używaj go, gdy wynik jest powtarzalny, wielkoskalowy, oparty na wielu źródłach lub ma wysoką wagę; nie traktuj żadnego narzędzia jako substytutu dokumentowania założeń, ograniczeń i odpowiedzialności człowieka.

Najczęściej zadawane pytania

Co oznacza weryfikacja wyników AI względem dokumentów źródłowych?

Oznacza sprawdzenie wyniku wygenerowanego przez AI względem oryginalnych plików, które go uzasadniają. Kontrola obejmuje ponowne obliczanie liczb, sprawdzanie twierdzeń, śledzenie dowodów i analizę końcowego materiału. Weryfikacja sprawdza również, czy źródło potwierdza wyciągany wniosek. Odpowiedź wyglądająca na precyzyjną nie jest zweryfikowana, dopóki inny recenzent nie będzie mógł odtworzyć jej istotnych wyników. Proces ma ujawnić nieprawidłowe obliczenia, niepotwierdzone trendy, brakujące rekordy oraz błędy formatowania lub wykresów.

Dlaczego trzeba ponownie obliczać liczbę, jeśli AI pokazuje swoje obliczenia?

AI może pokazać prawdopodobne obliczenie, wykorzystując jednocześnie niewłaściwe wiersze, mianownik, okres lub definicję kategorii. Ponowne obliczenie na podstawie źródła niezależnie sprawdza wynik, zamiast bezkrytycznie przyjmować wyjaśnienie. W dostarczonym przykładzie dotyczącym wydatków suma za pierwszy kwartał zgadzała się dla 412 wierszy, ale zgłoszony wzrost o 18% był błędny, ponieważ porównanie wykorzystywało niepełną sumę częściową za czwarty kwartał. Niezależne obliczenie sprawdza więc zarówno arytmetykę, jak i dane wejściowe wybrane do jej wykonania. Jest szczególnie ważne w przypadku sum, wskaźników, rankingów, prognoz i zmian w czasie.

Jaka jest różnica między statusami „Zaliczono”, „Częściowo”, „Nie zaliczono” i „Niepotwierdzone”?

„Zaliczono” oznacza, że wynik zgadza się ze źródłem, a obliczenie można odtworzyć. „Częściowo” oznacza, że liczba może być poprawna, ale jej metodologia, klasyfikacja lub założenia wymagają zastrzeżenia. „Nie zaliczono” oznacza, że twierdzenie jest sprzeczne ze źródłem lub obliczone nieprawidłowo. „Niepotwierdzone” oznacza, że źródło nie zawiera wystarczających informacji, aby ustalić prawdziwość twierdzenia. Kategorie te pokazują przyczynę decyzji kontrolnej zamiast ukrywać ją za ogólną etykietą pewności. Pomagają również zespołom ustalić priorytety korekt przed przekazaniem materiału.

Czy brak danych źródłowych może dowodzić, że twierdzenie AI jest fałszywe?

Brak danych źródłowych nie obala automatycznie twierdzenia. Oznacza, że dostępne źródło nie może go bezpośrednio zweryfikować. W przykładzie geolokalizacyjnym metadane nie zawierały żadnych rekordów dla Ukrainy, Kipti ani Haiove, dlatego bezpośrednie dopasowanie do widoku ulicznego było niemożliwe, a nie obalone. Właściwą reakcją było udokumentowanie ograniczenia i wskazanie alternatywnych źródeł, takich jak zdjęcia satelitarne, Sentinel-2, Maxar, zdjęcia sferyczne przesłane przez użytkowników lub lokalne nagrania z kamer samochodowych. Rzetelny audyt odróżnia brak dowodów od dowodu braku.

Kiedy zespół powinien użyć niezależnego audytora AI?

Niezależny audytor AI jest przydatny, gdy jeden system AI tworzy materiały oparte na wielu źródłach, powtarzalne lub obarczone wysokim ryzykiem, które wymagają osobnej kontroli. Może być szczególnie pomocny przy arkuszach kalkulacyjnych, plikach PDF, skanach, plikach CAD, pulpitach nawigacyjnych i raportach, w których recenzent potrzebuje ścieżki dowodowej. Energent Audit jest opisywany jako drugi agent, który ponownie oblicza, śledzi, porównuje i wydaje wyniki pozytywne/negatywne. Narzędzie może ograniczyć ręczną kontrolę, kierując uwagę na oznaczone elementy. Zespoły nadal powinny dokumentować założenia, ograniczenia i odpowiedzialność, zamiast traktować automatyzację jako zastępstwo osądu.

Zobacz proces weryfikacji

Film przedstawia niezależnego agenta, który dwukrotnie sprawdza dane, ponownie śledzi je do źródeł i prezentuje raport możliwy do przejrzenia.

Zaufało nam ponad 100 tys. firm na całym świecie.

Amazon
AWS
UC Berkeley
Experian
GE
PwC
Stanford
Amazon
AWS
UC Berkeley
Experian
GE
PwC
Stanford

Podsumowanie

Rzetelny wynik AI nie jest akceptowany dlatego, że brzmi przekonująco; jest akceptowany dlatego, że jego istotne liczby, twierdzenia, założenia i materiały wynikowe można prześledzić do dowodów źródłowych. Zacznij od spisania plików, ponownie oblicz dane, sprawdź mianowniki i zakres danych, sklasyfikuj każdy wynik i przejrzyj oznaczone elementy. W przypadku cyklicznych zadań możesz wypróbować Energent Audit lub umówić prezentację, aby poznać niezależny proces weryfikacji.