단순히 살펴보지 말고 재계산하세요
보고된 수치는 소스에서 직접 다시 계산해야 합니다. 한 지출 감사에서는 412개 행의 1분기 합계가 센트 단위까지 일치했지만, 불완전한 4분기 소계를 사용한 탓에 백분율 비교는 실패했습니다.
AI가 생성한 보고서는 정밀해 보이면서도 잘못된 분모를 사용하거나, 행을 누락하거나, 소스가 뒷받침할 수 없는 주장을 포함할 수 있습니다. 이 가이드에서는 출력을 체계적으로 검증하는 방법을 설명합니다. 소스 파일을 식별하고, 중요한 수치를 재계산하고, 각 주장을 정확한 증거까지 추적하며, 추론을 검증하고, 전달 전에 명확한 판정을 기록하는 과정입니다.
소스 문서와 비교하여 AI 출력을 검증하는 것은 생성된 숫자, 주장, 차트 및 결론이 원본 파일과 일치하는지 확인하는 독립적인 품질 관리 절차입니다. 분석가, 재무 및 회계팀, 운영팀, 연구자, 엔지니어는 물론 재현 가능해야 하는 결과물을 책임지는 모든 사람이 활용할 수 있습니다. 이 과정은 근거, 계산, 가정 및 비교가 유효한지 확인하지 않은 채 정교하게 작성된 답변을 신뢰하는 문제를 해결합니다.
보고된 수치는 소스에서 직접 다시 계산해야 합니다. 한 지출 감사에서는 412개 행의 1분기 합계가 센트 단위까지 일치했지만, 불완전한 4분기 소계를 사용한 탓에 백분율 비교는 실패했습니다.
방어 가능한 결과에는 소스 파일, 행 또는 필드, 계산, 결과물 위치 및 증거 참조가 명시되어야 합니다. 이를 통해 블랙박스 신뢰도 점수가 아닌 추적 가능한 연결 고리를 만들 수 있습니다.
검증 대상에는 스프레드시트, PDF, 대시보드, 차트 및 서식이 적용된 출력물이 포함됩니다. 대시보드의 수치가 정확하더라도 차트 범위가 마지막 행을 누락했거나 필수 레이아웃 속성이 잘못되었다면 실패할 수 있습니다.
실무적 전환점은 모든 것을 수동으로 검증하는 데서 예외 항목을 검토하는 것으로 옮겨가는 것입니다. 근거가 포함된 통과/실패 결과를 사용하면 남은 검토 작업을 더욱 집중적으로 수행할 수 있습니다.
할 일: vendor_invoices_q1.csv, q4_spend_summary.xlsx, 소스 SQL 파일, gapminder.csv 또는 global street-view 메타데이터처럼 출력을 생성하는 데 사용된 모든 파일을 기록하세요. 보고서, 통합 문서, 가이드 및 대시보드를 포함한 결과물은 별도로 기록하세요.
성공 기준: 모든 결론을 하나 이상의 명명된 소스 파일 및 하나의 특정 결과물과 연결할 수 있어야 합니다.
피해야 할 일반적인 실수: 최종 결과가 포함된 통합 문서, 차트, PDF 또는 대시보드를 무시하고 서술형 내용만 검증하지 마세요.
할 일: 보고된 합계, 평균, 비율, 순위 및 변동을 소스에서 직접 다시 계산하세요. 예를 들어 vendor_invoices_q1.csv를 합산하면 412개 행의 1분기 합계는 $1,284,500.00이 됩니다.
성공 기준: 재계산한 결과가 결과물과 일치하거나, 실패 또는 부분 결과로 명시적으로 표시되어야 합니다.
피해야 할 일반적인 실수: 표시된 숫자의 정밀도를 계산이 정확하다는 증거로 간주하지 마세요.
할 일: 분자와 분모가 일치하는 정의와 완전한 기간을 사용하는지 확인하세요. 지출 예시에서 1분기는 $1,284,500, 4분기는 $1,147,000이므로 올바른 증가율은 18%가 아니라 12.0%입니다. 잘못된 결과는 Facilities를 제외한 4분기 소계를 사용했습니다.
성공 기준: 명확하게 정의된 동일 기준의 값으로 비교를 재현할 수 있어야 합니다.
피해야 할 일반적인 실수: 완전한 기간을 소계, 부분 기간 또는 분류가 다른 범주와 비교하지 마세요.
할 일: 소스 파일, 행 또는 필드, 계산, 결과물 위치 및 증거 참조를 기록하세요. 예를 들어 공급업체 순위는 Acme Logistics가 $312,000을 기록했고 Logistics 범주 지출이 $512,000으로 조정되었다고 문서화할 수 있습니다.
성공 기준: 다른 검토자가 원래 분석가에게 숨겨진 단계를 설명해 달라고 요청하지 않고도 증거 추적을 따라갈 수 있어야 합니다.
피해야 할 일반적인 실수: 주장이 특정 행, 필드, 셀 또는 표시된 문구에 의존하는 경우 파일 이름만 인용하지 마세요.
할 일: 관찰 가능한 수치와 더 넓은 해석을 구분하세요. 소프트웨어 지출은 $298,000이었고 여기에는 $84,000의 연간 선지급금이 포함되어 있었지만, 이전 분기의 소프트웨어 수치가 존재하지 않았으므로 소프트웨어가 전 분기 대비 약 30% 증가했다는 주장은 실패했습니다.
성공 기준: 결론이 소스가 입증할 수 있는 범위를 넘어 확장되지 않아야 합니다.
피해야 할 일반적인 실수: 소스에 상관관계나 불완전한 범위만 포함되어 있는데 개연성 있는 설명을 검증된 인과 결론으로 바꾸지 마세요.
할 일: 각 결과를 보고됨, 계산됨, 암시됨, 부분적, 근거 부족 또는 실패로 표시하세요. 재현 가능한 소스 계산과 출력이 일치하면 통과, 방법론에 한정 조건이 필요하면 부분 통과, 주장이 반박되거나 잘못 계산되면 실패, 소스로 입증할 수 없으면 근거 부족으로 표시하세요.
성공 기준: 검토자가 어떤 진술이 직접적인 증거를 갖고 있고 어떤 진술에 수정 또는 한정 조건이 필요한지 즉시 알 수 있어야 합니다.
피해야 할 일반적인 실수: 불확실성의 이유를 숨기는 모호한 신뢰도 표현으로 명시적인 판정을 대체하지 마세요.
할 일: 차트, 레이아웃 속성, 범위, 서식, 누락된 기록 및 소스 범위를 점검하세요. RTL 대시보드 감사에서는 워크시트 속성과 집계는 통과했지만, 차트가 마지막 행을 누락했기 때문에 열 순서 반전과 차트 범위는 실패했습니다.
성공 기준: 최종 결과물이 수치적으로 정확하고 구조적으로도 사용할 수 있어야 하며, 누락된 데이터와 한계가 명확히 기록되어야 합니다.
피해야 할 일반적인 실수: 계산이 정확하다고 해서 완성된 파일의 모든 측면이 정확하다고 가정하지 마세요.
| 문제 | 원인 | 해결 방법 |
|---|---|---|
| 백분율 변화가 잘못되었습니다. | 분모가 불완전한 소계 또는 일치하지 않는 기간을 사용합니다. | 동일한 범주 정의로 두 기간의 합계를 다시 구성한 다음 변화를 재계산하세요. |
| 추세가 검증된 것으로 제시됩니다. | 소스에 이전 기간 또는 비교 가능한 기준선이 없습니다. | 주장을 근거 부족으로 표시하거나 현재 기간의 관찰 결과로 다시 작성하세요. |
| 수치는 정확하지만 해석이 약합니다. | 분류 또는 방법론이 수치의 의미를 바꿉니다. | 결과를 부분 통과로 표시하고 연간 선지급금의 상각이 필요한 경우처럼 가정을 설명하세요. |
| 대시보드 차트에 데이터가 누락됩니다. | 차트 범위에 전체 표가 포함되지 않았습니다. | 차트 범위를 의도한 마지막 행까지 확장하고 렌더링된 차트를 확인하세요. |
| 위치 주장에 대한 소스 범위가 비어 있습니다. | 데이터세트에 해당 국가, 장소 또는 특징에 대한 기록이 없습니다. | 직접 일치가 불가능하다는 점을 기록하고, 부재를 반증으로 간주하지 않으면서 대체 증거를 식별하세요. |
반복적인 재무 또는 운영 업무를 처리하는 팀이라면 소스 기반 AI 감사를 통해 이 프로세스를 반복 가능하게 만들 수 있습니다. 관련 워크플로는 재무 조정 확인 및 Power Query 검증도 지원할 수 있습니다.
아래 예시는 검증이 산술과 의미를 모두 점검해야 하는 이유를 보여줍니다. 수치는 제공된 감사 사례에서 가져온 관찰 가능한 결과이며, 일반화된 벤치마크가 아닙니다.
감사 결과 환불액은 $3.2k에서 $7.8k로 증가했으며, The Original Mr. Fuzzy의 환불 수량은 42개에서 132개로 증가했습니다.
| 관점 | 총지출 | 의미 |
|---|---|---|
| 승인 예산 | $12.41 billion | 최초의 법적 한도 및 목표 |
| 추정 예산 | $6.06 billion | 공식 예측 업데이트 |
| 실제 지출 | $5.92 billion | 연말 실제 지출 |
실제 지출은 승인 예산의 약 47%였습니다. 감사 결과 Police는 승인 예산보다 2.4% 초과했고 Trash & Sanitation은 2.1% 초과한 것으로 기록되었습니다.
| 주장 | 판정 | 증거 |
|---|---|---|
| 1분기 지출은 $1,284,500이었다 | 통과 | 412개 행을 독립적으로 다시 합산하여 일치함을 확인했습니다. |
| 지출이 4분기 대비 18% 증가했다 | 실패 | 완전한 4분기 합계를 사용한 올바른 비교 결과는 12.0%였습니다. |
| Acme Logistics가 $312,000으로 최고 공급업체였다 | 통과 | 공급업체 최대값을 확인하고 범주 지출을 조정했습니다. |
| 소프트웨어 지출은 $298,000이었다 | 부분 통과 | 수치는 정확했지만 $84,000의 연간 선지급금이 포함되어 있었습니다. |
| 소프트웨어가 전 분기 대비 약 30% 증가했다 | 근거 부족 | 소스에 이전 분기의 소프트웨어 수치가 없었습니다. |
동일한 원칙은 팀이 재무 기록을 교차 확인하거나, 수정을 재사용 가능한 워크플로로 전환하거나, 근거 없는 AI 주장을 탐지할 때도 적용됩니다.
Energent Audit는 작업을 생성한 에이전트와 별개의 두 번째 에이전트인 독립적인 AI 감사 도구로 설명됩니다. 숫자를 재계산하고, 수치를 소스 파일 및 필드까지 추적하며, 주장을 참조 자료와 비교하고, 가능한 경우 오류를 식별하며, 뒷받침하는 증거와 함께 통과/실패 판정을 제공합니다.
출력이 반복적이거나, 대량이거나, 소스 중심이거나, 중요한 경우 사용하세요. 단, 어떤 도구도 가정, 한계 및 인간의 책임을 기록하는 일을 대신할 수는 없습니다.
AI가 생성한 결과를 이를 뒷받침하는 원본 파일과 비교해 확인하는 것을 의미합니다. 검토에는 숫자 재계산, 주장 확인, 증거 추적 및 최종 결과물 점검이 포함됩니다. 검증은 소스가 해당 추론을 뒷받침하는지도 확인합니다. 다른 검토자가 중요한 결과를 재현할 수 있기 전까지는 정밀해 보이는 답변도 검증된 것으로 볼 수 없습니다. 이 과정은 잘못된 계산, 근거 없는 추세, 누락된 기록 및 서식이나 차트 오류를 드러내기 위해 설계되었습니다.
AI는 그럴듯한 계산을 보여주면서도 잘못된 행, 분모, 기간 또는 범주 정의를 사용할 수 있습니다. 소스에서 재계산하면 설명을 그대로 받아들이지 않고 결과를 독립적으로 검증할 수 있습니다. 제공된 지출 예시에서 1분기 합계는 412개 행에 걸쳐 일치했지만, 불완전한 4분기 소계를 비교에 사용했기 때문에 보고된 18% 증가는 실패했습니다. 따라서 독립적인 재계산은 산술뿐 아니라 해당 산술에 선택된 입력도 확인합니다. 합계, 비율, 순위, 예측 및 기간별 변화에는 특히 중요합니다.
통과는 출력이 소스와 일치하고 계산을 재현할 수 있다는 뜻입니다. 부분 통과는 수치가 정확할 수 있지만 방법론, 분류 또는 가정에 한정 조건이 필요하다는 뜻입니다. 실패는 주장이 소스와 모순되거나 잘못 계산되었다는 뜻입니다. 근거 부족은 소스에 해당 주장을 입증할 충분한 정보가 없다는 뜻입니다. 이러한 범주는 일반적인 신뢰도 라벨 뒤에 숨기지 않고 검토 결정의 이유를 드러냅니다. 또한 전달 전에 수정 사항의 우선순위를 정하는 데 도움이 됩니다.
소스 데이터가 없다고 해서 주장이 자동으로 반증되는 것은 아닙니다. 다만 사용 가능한 소스만으로는 해당 주장을 직접 검증할 수 없다는 뜻입니다. 지리 위치 사례에서 메타데이터에는 우크라이나, Kipti 및 Haiove에 대한 기록이 0건이었으므로 거리뷰 직접 매칭이 불가능했지만 반증된 것은 아니었습니다. 올바른 대응은 한계를 기록하고 위성 이미지, Sentinel-2, Maxar, 사용자가 업로드한 포토스피어 또는 현지 대시캠 영상과 같은 대체 소스를 확인하는 것이었습니다. 신중한 감사는 증거의 부재와 부재의 증거를 구분합니다.
한 AI 시스템이 별도의 검증 절차가 필요한 소스 중심의 반복적이거나 중요한 결과물을 생성할 때 독립적인 AI 감사 도구가 유용합니다. 검토자가 증거 추적을 필요로 하는 스프레드시트, PDF, 스캔, CAD 파일, 대시보드 및 보고서에 특히 효과적입니다. Energent Audit는 재계산하고, 추적하고, 비교하며, 통과/실패 결과를 제공하는 두 번째 에이전트로 설명됩니다. 이 도구는 표시된 항목에 주의를 집중시켜 수동 검토를 줄일 수 있습니다. 하지만 팀은 자동화를 판단의 대체 수단으로 간주하지 말고 가정, 한계 및 책임을 계속 기록해야 합니다.
이 동영상은 수치를 다시 확인하고, 소스까지 재추적하며, 검토 가능한 보고서를 제공하는 독립 에이전트를 설명합니다.
신뢰할 수 있는 AI 출력은 자신감 있게 들리기 때문에 받아들여지는 것이 아니라, 중요한 수치, 주장, 가정 및 결과물을 소스 증거까지 추적할 수 있기 때문에 받아들여집니다. 먼저 파일을 나열하고, 수치를 재계산하며, 분모와 범위를 확인하고, 각 결과를 분류한 다음 표시된 항목을 검토하세요. 반복 업무의 경우 Energent Audit를 사용해 보거나 데모를 예약하여 독립적인 검증 워크플로를 알아볼 수 있습니다.