Praktischer Leitfaden zur quellenbasierten KI-Überprüfung

So überprüfen Sie KI-Ausgaben anhand von Quelldokumenten (Schritt für Schritt)

KI-generierte Berichte können präzise wirken und dennoch den falschen Nenner verwenden, Zeilen auslassen oder Aussagen treffen, die durch die Quelle nicht belegt werden. Dieser Leitfaden zeigt, wie Sie Ausgaben systematisch überprüfen: Quelldateien identifizieren, wesentliche Zahlen neu berechnen, jede Aussage bis zum exakten Nachweis zurückverfolgen, die Schlussfolgerung prüfen und vor der Auslieferung ein klares Urteil dokumentieren.

Rachel Hu
Rachel Hu
Ich entwickle seit über einem Jahrzehnt sichere KI-Systeme für komplexe Umgebungen mit hohen Anforderungen – von der quantitativen Finanzanalyse bis hin zu skalierbaren Data-Science-Anwendungen.

Was bedeutet die Überprüfung von KI-Ausgaben anhand von Quelldokumenten? (Kurze Definition)

Die Überprüfung von KI-Ausgaben anhand von Quelldokumenten ist ein unabhängiger Qualitätssicherungsprozess. Er prüft, ob generierte Zahlen, Aussagen, Diagramme und Schlussfolgerungen mit den Originaldateien übereinstimmen. Eingesetzt wird er von Analysten, Finanz- und Buchhaltungsteams, Betriebsabteilungen, Forschern, Ingenieuren und allen, die für ein reproduzierbares Ergebnis verantwortlich sind. Der Prozess löst das Problem, einer ausgefeilten Antwort zu vertrauen, ohne zu wissen, ob Nachweise, Berechnungen, Annahmen und Vergleiche gültig sind.

Unabhängige Überprüfung in der Praxis

Neu berechnen, nicht nur prüfen

Eine gemeldete Zahl sollte direkt anhand der Quelle neu berechnet werden. Bei einem Ausgaben-Audit stimmte die Q1-Summe über 412 Zeilen bis auf den Cent überein, während ein prozentualer Vergleich fehlschlug, weil die Ausgabe eine unvollständige Q4-Zwischensumme verwendete.

Jede wesentliche Aussage zurückverfolgen

Ein belastbares Ergebnis nennt Quelldatei, Zeile oder Feld, Berechnung, Position in der Ausgabe und Nachweisreferenz. So entsteht eine nachvollziehbare Kette statt eines undurchsichtigen Vertrauenswerts.

Die eigentliche Ausgabe prüfen

Die Überprüfung umfasst Tabellen, PDFs, Dashboards, Diagramme und formatierte Ausgaben. Ein Dashboard kann korrekte Zahlen enthalten und dennoch fehlschlagen, wenn ein Diagrammbereich die letzte Zeile auslässt oder eine erforderliche Layouteigenschaft falsch ist.

Screenshot eines Energent-Auditberichts

Die Aufmerksamkeit auf markierte Punkte richten

Der praktische Wandel besteht darin, nicht mehr alles manuell zu überprüfen, sondern Ausnahmen zu kontrollieren. Ein Ergebnis mit bestanden/nicht bestanden und unterstützenden Nachweisen macht die verbleibende Prüfung gezielter.

Kurze Antwort (Tun Sie dies zuerst)

  • Listen Sie die genauen Quelldokumente auf, die zur Erstellung der KI-Ausgabe verwendet wurden.
  • Listen Sie jede zu prüfende Ausgabe auf, einschließlich Tabellen, PDFs, Dashboards und Textdateien.
  • Berechnen Sie jede wesentliche Zahl anhand der Quellzeilen, -felder oder -zellen neu.
  • Prüfen Sie Nenner, Vergleichszeiträume, Einheiten, Währungen, Daten und den Umgang mit fehlenden Werten.
  • Verfolgen Sie jede wichtige Aussage bis zu einer präzisen Quellen- und Ausgabeposition zurück.
  • Unterscheiden Sie zwischen gemeldeten, berechneten, implizierten, teilweise belegten, nicht unterstützten und fehlgeschlagenen Ergebnissen.
  • Prüfen Sie vor der Annahme oder Auslieferung der Arbeit nur die markierten Probleme.

Voraussetzungen (Was Sie benötigen)

  • Die ursprünglichen Quelldateien, die vom erstellenden KI-Agenten verwendet wurden.
  • Die zu überprüfenden, von der KI erzeugten Ausgaben.
  • Zugriff auf Zeilen, Felder, Zellen, markierten Text und Berechnungslogik.
  • Eine einheitliche Definition für Daten, Zeiträume, Einheiten, Währungen und Kategorien.
  • Einen Ort zur Aufzeichnung von Nachweisen, Annahmen, Einschränkungen und Urteilen.
  • Die Berechtigung, formatierte Dateien und zugehörige Diagramme zu prüfen.

Schritt für Schritt: KI-Ausgaben anhand von Quelldokumenten überprüfen

Schritt 1: Quelldokumente identifizieren

Was zu tun ist: Erfassen Sie jede zur Erstellung der Ausgabe verwendete Datei, etwa vendor_invoices_q1.csv, q4_spend_summary.xlsx, SQL-Quelldateien, gapminder.csv oder globale Street-View-Metadaten. Erfassen Sie die Ausgaben separat, einschließlich Berichten, Arbeitsmappen, Leitfäden und Dashboards.

So sieht Erfolg aus: Jede Schlussfolgerung kann mindestens einer benannten Quelldatei und einer bestimmten Ausgabe zugeordnet werden.

Häufiger Fehler: Überprüfen Sie nicht nur den Text und ignorieren Sie die Arbeitsmappe, das Diagramm, die PDF-Datei oder das Dashboard mit dem endgültigen Ergebnis.

Schritt 2: Jede wesentliche Zahl neu berechnen

Was zu tun ist: Berechnen Sie gemeldete Summen, Mittelwerte, Quoten, Rangfolgen und Veränderungen direkt anhand der Quelle neu. Beispielsweise ergab die Summierung von vendor_invoices_q1.csv eine Q1-Summe von 1.284.500,00 $ über 412 Zeilen.

So sieht Erfolg aus: Das neu berechnete Ergebnis stimmt mit der Ausgabe überein oder wird ausdrücklich als fehlgeschlagenes beziehungsweise teilweise belegtes Ergebnis markiert.

Häufiger Fehler: Behandeln Sie die Genauigkeit der angezeigten Zahl nicht als Beweis für die Richtigkeit der Berechnung.

Schritt 3: Nenner und Vergleichszeitraum überprüfen

Was zu tun ist: Prüfen Sie, ob Zähler und Nenner auf übereinstimmenden Definitionen und vollständigen Zeiträumen beruhen. Im Ausgabenbeispiel betrug Q1 1.284.500 $ und Q4 1.147.000 $, sodass der korrekte Anstieg 12,0 % und nicht 18 % betrug; das falsche Ergebnis verwendete eine Q4-Zwischensumme ohne den Bereich Facilities.

So sieht Erfolg aus: Der Vergleich kann anhand klar definierter, gleichartiger Werte reproduziert werden.

Häufiger Fehler: Vergleichen Sie keinen vollständigen Zeitraum mit einer Zwischensumme, einem Teilzeitraum oder einer anders klassifizierten Kategorie.

Schritt 4: Die Aussage bis zur exakten Quellenposition zurückverfolgen

Was zu tun ist: Erfassen Sie Quelldatei, Zeile oder Feld, Berechnung, Ausgabeposition und Nachweisreferenz. Eine Lieferantenrangfolge kann als Acme Logistics mit 312.000 $ dokumentiert werden, wobei die Ausgaben der Kategorie Logistics mit 512.000 $ abgeglichen wurden.

So sieht Erfolg aus: Ein anderer Prüfer kann der Nachweiskette folgen, ohne den ursprünglichen Analysten nach versteckten Schritten fragen zu müssen.

Häufiger Fehler: Nennen Sie nicht nur einen Dateinamen, wenn die Aussage von einer bestimmten Zeile, einem Feld, einer Zelle oder einer markierten Passage abhängt.

Schritt 5: Prüfen, ob die Quelle die Schlussfolgerung stützt

Was zu tun ist: Unterscheiden Sie zwischen einer beobachtbaren Zahl und einer weitergehenden Interpretation. Softwareausgaben in Höhe von 298.000 $ waren vorhanden, darunter jährliche Vorauszahlungen von 84.000 $. Die Aussage, dass Software im Quartalsvergleich um etwa 30 % gewachsen sei, war jedoch nicht belegt, da keine Softwarezahl für das vorherige Quartal vorlag.

So sieht Erfolg aus: Schlussfolgerungen gehen nicht über das hinaus, was die Quelle belegen kann.

Häufiger Fehler: Wandeln Sie eine plausible Erklärung nicht in eine verifizierte kausale Schlussfolgerung um, wenn die Quelle nur eine Korrelation oder eine unvollständige Abdeckung enthält.

Schritt 6: Nachweisstatus klassifizieren

Was zu tun ist: Kennzeichnen Sie jedes Ergebnis als gemeldet, berechnet, impliziert, teilweise belegt, nicht unterstützt oder fehlgeschlagen. Verwenden Sie „Bestanden“, wenn die Ausgabe mit einer reproduzierbaren Quellenberechnung übereinstimmt, „Teilweise“, wenn die Methodik einer Erläuterung bedarf, „Nicht bestanden“, wenn die Aussage widersprochen wird oder falsch berechnet ist, und „Nicht unterstützt“, wenn die Quelle sie nicht belegen kann.

So sieht Erfolg aus: Prüfer erkennen sofort, welche Aussagen direkt belegt sind und welche korrigiert oder qualifiziert werden müssen.

Häufiger Fehler: Ersetzen Sie eindeutige Urteile nicht durch vage Vertrauensformulierungen, die den Grund für die Unsicherheit verschleiern.

Schritt 7: Die endgültige Datei prüfen und Einschränkungen dokumentieren

Was zu tun ist: Prüfen Sie Diagramme, Layouteigenschaften, Bereiche, Formatierungen, fehlende Datensätze und Quellenabdeckung. Beim RTL-Dashboard-Audit bestanden die Arbeitsblatteigenschaft und die Aggregationen, während Spaltenumkehr und Diagrammbereich fehlschlugen, weil das Diagramm die letzte Zeile nicht enthielt.

So sieht Erfolg aus: Die endgültige Ausgabe ist numerisch korrekt und strukturell nutzbar; fehlende Daten und Einschränkungen sind klar dokumentiert.

Häufiger Fehler: Gehen Sie nicht davon aus, dass eine korrekte Berechnung bedeutet, dass die fertige Datei in jeder Hinsicht korrekt ist.

Validierungs-Checkliste (Stellen Sie sicher, dass es funktioniert hat)

  • ☐ Jede wesentliche Zahl ist mit einer benannten Quelldatei verknüpft.
  • ☐ Jede Berechnung verwendet den korrekten Zähler und Nenner.
  • ☐ Vergleichszeiträume verwenden übereinstimmende Definitionen und eine vollständige Abdeckung.
  • ☐ Summen stimmen mit den zugrunde liegenden Zeilen oder Feldern überein.
  • ☐ Einheiten, Währungen und Daten sind konsistent.
  • ☐ Fehlende Werte werden von legitimen Nullwerten unterschieden.
  • ☐ Doppelte und fehlerhafte Datensätze wurden geprüft.
  • ☐ Abgeleitete und implizierte Zahlen sind eindeutig gekennzeichnet.
  • ☐ Diagramme enthalten jede vorgesehene Zeile und Spalte.
  • ☐ Nachweisreferenzen verweisen auf exakte Zeilen, Felder, Zellen oder markierten Text.

Häufige Probleme und Lösungen

Problem Ursache Lösung
Die prozentuale Veränderung ist falsch. Der Nenner verwendet eine unvollständige Zwischensumme oder einen nicht passenden Zeitraum. Erstellen Sie beide Zeitraumssummen anhand derselben Kategoriedefinitionen neu und berechnen Sie anschließend die Veränderung.
Ein Trend wird als verifiziert dargestellt. Der Quelle fehlt ein vorheriger Zeitraum oder eine vergleichbare Ausgangsbasis. Kennzeichnen Sie die Aussage als nicht unterstützt oder formulieren Sie sie als Beobachtung des aktuellen Zeitraums um.
Die Zahl ist korrekt, aber die Interpretation ist schwach. Klassifizierung oder Methodik verändert die Bedeutung der Zahl. Kennzeichnen Sie das Ergebnis als teilweise belegt und erläutern Sie die Annahme, etwa dass jährliche Vorauszahlungen amortisiert werden müssen.
Das Dashboard-Diagramm lässt Daten aus. Der Diagrammbereich umfasst nicht die vollständige Tabelle. Erweitern Sie den Diagrammbereich bis zur letzten vorgesehenen Zeile und prüfen Sie das gerenderte Diagramm.
Die Quellenabdeckung ist für eine Standortaussage leer. Der Datensatz enthält keine Einträge für das betreffende Land, den Ort oder das Merkmal. Dokumentieren Sie, dass kein direkter Abgleich möglich ist, und nennen Sie alternative Nachweise, ohne das Fehlen als Widerlegung zu behandeln.

Bewährte Verfahren (Langfristig richtig umsetzen)

  • Bewahren Sie Quelldateien und Ausgaben in einem benannten Verzeichnis auf – so wird der Prüfungsumfang ausdrücklich festgelegt.
  • Berechnen Sie wesentliche Zahlen unabhängig neu – die Präzision einer KI-Antwort beweist nicht ihre Richtigkeit.
  • Erfassen Sie exakte Nachweispositionen – ein anderer Prüfer sollte das Ergebnis reproduzieren können.
  • Trennen Sie Nachweis und Schlussfolgerung – so werden plausible Erklärungen nicht zu unbelegten Fakten.
  • Verwenden Sie eindeutige Urteile wie „Bestanden“, „Teilweise“, „Nicht bestanden“ und „Nicht unterstützt“ – klare Bezeichnungen beschleunigen Prüfentscheidungen.
  • Prüfen Sie die endgültige Datei, nicht nur den Text – auch Formatierung, Diagrammbereiche und Arbeitsmappeneigenschaften können fehlschlagen.
  • Dokumentieren Sie fehlende oder unvollständige Quellenabdeckung – eine Einschränkung ist nützlicher als falsche Präzision.

Für Teams, die regelmäßig Finanz- oder Betriebsaufgaben bearbeiten, können quellenbasierte KI-Audits diesen Prozess wiederholbar machen. Verwandte Workflows können außerdem Abstimmungsprüfungen für Finanzdaten und die Power-Query-Validierung unterstützen.

Anwendungsfalldaten: Was die Audits tatsächlich ergaben

Die folgenden Beispiele zeigen, warum eine Überprüfung sowohl die Arithmetik als auch die Bedeutung testen muss. Die Zahlen stammen aus den bereitgestellten Auditfällen und werden als beobachtbare Ergebnisse, nicht als allgemeine Benchmarks, dargestellt.

Umsatzanalyse: Juli bis August

Bruttoumsatz: Juli83,3 Tsd. $
Bruttoumsatz: August84,8 Tsd. $
Nettoumsatz: Juli80,0 Tsd. $
Nettoumsatz: August77,0 Tsd. $

Das Audit ergab außerdem, dass Rückerstattungen von 3,2 Tsd. $ auf 7,8 Tsd. $ stiegen und Rückerstattungen für The Original Mr. Fuzzy von 42 auf 132 Einheiten zunahmen.

Budgetprüfung: drei Ansichten

AnsichtGesamtausgabenBedeutung
Angenommenes Budget12,41 Mrd. $Ursprüngliche gesetzliche Grenze und Zielvorgabe
Geschätztes Budget6,06 Mrd. $Formale Prognoseaktualisierung
Tatsächliche Ausgaben5,92 Mrd. $Ausgabenrealität zum Jahresende

Die tatsächlichen Ausgaben betrugen etwa 47 % des angenommenen Budgets. Das Audit verzeichnete außerdem, dass Police 2,4 % über dem angenommenen Budget und Trash & Sanitation 2,1 % darüber lagen.

Überprüfungsstatus nach Aussage im Ausgaben-Audit

AussageUrteilNachweis
Die Q1-Ausgaben beliefen sich auf 1.284.500 $BestandenÜber 412 Zeilen unabhängig neu summiert und abgeglichen.
Die Ausgaben stiegen gegenüber Q4 um 18 %Nicht bestandenDer korrekte Vergleich betrug 12,0 % unter Verwendung der vollständigen Q4-Summe.
Acme Logistics war mit 312.000 $ der größte LieferantBestandenDas Lieferantenmaximum wurde bestätigt und die Kategorieausgaben abgeglichen.
Die Softwareausgaben betrugen 298.000 $TeilweiseDie Zahl war korrekt, enthielt jedoch jährliche Vorauszahlungen von 84.000 $.
Die Softwareausgaben stiegen im Quartalsvergleich um etwa 30 %Nicht unterstütztIn der Quelle gab es keine Softwarezahl für das vorherige Quartal.

Dieselbe Sorgfalt gilt, wenn Teams Finanzdaten gegenprüfen, Korrekturen in wiederverwendbare Workflows umwandeln oder unbelegte KI-Aussagen erkennen.

Empfohlenes Tool (optional): Energent.ai

Energent Audit wird als unabhängiger KI-Prüfer beschrieben: ein zweiter Agent, der vom Agenten getrennt ist, der die Arbeit erstellt hat. Er berechnet Zahlen neu, verfolgt Werte bis zu Quelldateien und -feldern zurück, vergleicht Aussagen mit Referenzen, identifiziert nach Möglichkeit Fehler und erstellt ein Urteil mit bestanden/nicht bestanden samt unterstützenden Nachweisen.

  • Prüft Tabellen, PDFs, CAD-Dateien, Scans und andere unterstützte Dokumenttypen.
  • Unterstützt mehr als 150 Dateitypen, darunter CAD, G-Code, Scans, InDesign, Stücklisten, PDFs, XLSX und DOCX.
  • Erstellt eine Nachweiskette, damit Prüfer sich auf markierte Ergebnisse konzentrieren können.
  • Wandelt wiederkehrende Aufgaben und Korrekturen in wiederverwendbare Workflows und Prüfregeln um.
  • Liefert ausgabefertige Ergebnisse für Stakeholder, die als White-Label-Versionen und mit eigenem Branding bereitgestellt werden können.

Nutzen Sie es, wenn die Ausgabe wiederholbar, umfangreich, quellenintensiv oder besonders wichtig ist. Betrachten Sie kein Tool als Ersatz für die Dokumentation von Annahmen, Einschränkungen und menschlicher Verantwortung.

Häufig gestellte Fragen

Was bedeutet es, KI-Ausgaben anhand von Quelldokumenten zu überprüfen?

Es bedeutet, ein von der KI erzeugtes Ergebnis mit den ursprünglichen Dateien abzugleichen, die es stützen. Die Prüfung umfasst das Neuberechnen von Zahlen, das Überprüfen von Aussagen, das Zurückverfolgen von Nachweisen und die Kontrolle der endgültigen Ausgabe. Außerdem wird geprüft, ob die Quelle die getroffene Schlussfolgerung unterstützt. Eine präzise wirkende Antwort ist erst dann verifiziert, wenn ein anderer Prüfer ihre wesentlichen Ergebnisse reproduzieren kann. Der Prozess soll falsche Berechnungen, unbelegte Trends, fehlende Datensätze sowie Formatierungs- oder Diagrammfehler aufdecken.

Warum muss eine Zahl neu berechnet werden, wenn die KI ihre Berechnung zeigt?

Eine KI kann eine plausible Berechnung zeigen und dabei dennoch die falschen Zeilen, den falschen Nenner, den falschen Zeitraum oder eine falsche Kategoriedefinition verwenden. Die Neuberechnung anhand der Quelle prüft das Ergebnis unabhängig, anstatt die Erklärung ungeprüft zu akzeptieren. Im bereitgestellten Ausgabenbeispiel stimmte die Q1-Summe über 412 Zeilen überein, aber der gemeldete Anstieg von 18 % war falsch, weil der Vergleich eine unvollständige Q4-Zwischensumme verwendete. Eine unabhängige Neuberechnung prüft daher sowohl die Arithmetik als auch die dafür ausgewählten Eingaben. Dies ist besonders wichtig für Summen, Verhältnisse, Rangfolgen, Prognosen und zeitliche Veränderungen.

Was ist der Unterschied zwischen „Bestanden“, „Teilweise“, „Nicht bestanden“ und „Nicht unterstützt“?

„Bestanden“ bedeutet, dass die Ausgabe mit der Quelle übereinstimmt und die Berechnung reproduzierbar ist. „Teilweise“ bedeutet, dass die Zahl möglicherweise korrekt ist, ihre Methodik, Klassifizierung oder Annahmen jedoch einer Erläuterung bedürfen. „Nicht bestanden“ bedeutet, dass die Quelle der Aussage widerspricht oder sie falsch berechnet wurde. „Nicht unterstützt“ bedeutet, dass die Quelle nicht genügend Informationen enthält, um die Aussage zu belegen. Diese Kategorien machen den Grund für eine Prüfentscheidung sichtbar, statt ihn hinter einer allgemeinen Vertrauensbewertung zu verbergen. Außerdem helfen sie Teams, Korrekturen vor der Auslieferung zu priorisieren.

Kann das Fehlen von Quelldaten beweisen, dass eine KI-Aussage falsch ist?

Fehlende Quelldaten widerlegen eine Aussage nicht automatisch. Sie zeigen, dass die verfügbare Quelle die Aussage nicht direkt verifizieren kann. Im Geolokalisierungsbeispiel enthielten die Metadaten null Datensätze für die Ukraine, Kipti und Haiove. Ein direkter Street-View-Abgleich war daher nicht möglich, aber nicht widerlegt. Die korrekte Reaktion bestand darin, die Einschränkung zu dokumentieren und alternative Quellen wie Satellitenbilder, Sentinel-2, Maxar, von Nutzern hochgeladene Photosphären oder lokale Dashcam-Aufnahmen zu ermitteln. Ein sorgfältiges Audit unterscheidet zwischen fehlenden Nachweisen und Nachweisen des Fehlens.

Wann sollte ein Team einen unabhängigen KI-Prüfer einsetzen?

Ein unabhängiger KI-Prüfer ist sinnvoll, wenn ein KI-System quellenintensive, wiederholbare oder besonders wichtige Ausgaben erstellt, die eine separate Prüfrunde benötigen. Besonders hilfreich kann er für Tabellen, PDFs, Scans, CAD-Dateien, Dashboards und Berichte sein, bei denen der Prüfer eine Nachweiskette benötigt. Energent Audit wird als zweiter Agent beschrieben, der neu berechnet, zurückverfolgt, vergleicht und Ergebnisse mit bestanden/nicht bestanden ausgibt. Das Tool kann die manuelle Prüfung reduzieren, indem es die Aufmerksamkeit auf markierte Punkte lenkt. Teams sollten dennoch Annahmen, Einschränkungen und Verantwortlichkeiten dokumentieren und Automatisierung nicht als Ersatz für menschliches Urteilsvermögen betrachten.

Sehen Sie sich den Prüf-Workflow an

Das Video beschreibt einen unabhängigen Agenten, der Zahlen doppelt prüft, bis zu ihren Quellen zurückverfolgt und einen überprüfbaren Bericht erstellt.

Vertraut von mehr als 100.000 Unternehmen weltweit.

Amazon
AWS
UC Berkeley
Experian
GE
PwC
Stanford
Amazon
AWS
UC Berkeley
Experian
GE
PwC
Stanford

Fazit

Zuverlässige KI-Ausgaben werden nicht akzeptiert, weil sie selbstsicher klingen, sondern weil ihre wesentlichen Zahlen, Aussagen, Annahmen und Ergebnisse bis zu den Nachweisen in der Quelle zurückverfolgt werden können. Beginnen Sie mit der Auflistung der Dateien, berechnen Sie die Zahlen neu, prüfen Sie Nenner und Abdeckung, klassifizieren Sie jedes Ergebnis und kontrollieren Sie die markierten Punkte. Für wiederkehrende Aufgaben können Sie Energent Audit ausprobieren oder eine Demo buchen, um einen unabhängigen Prüf-Workflow kennenzulernen.