AI Testing
LLM Testing Vision AI Testing AI agent Testing Physical AI TestingData Validation
AI 학습용 데이터 검증 공공데이터 품질 검증 기업 운영 데이터 검증Software Testing
SW Testing
개발 단계 리스크
조기 발견
배포 전
최종 검증
도입 의사결정
근거 확보
운영 중
정기 점검
챗봇, 고객 상담
자동응답 시스템
RAG(검색증강생성) 기반
지식 답변 서비스
의료·금융·법률 등
전문 도메인 특화 LLM
LLM 기반 콘텐츠·리포트
자동 생성 서비스
도구 활용·다단계 작업을
수행하는 LLM 기반 에이전트
| 검증 항목 | 측정 방법 | 지표 |
|---|---|---|
| 언어 이해 및 응답 정확도 | 표준 벤치마크셋과 도메인 특화 질의셋을 함께 사용해 정답·레퍼런스 답변과의 일치도를 채점 | 정확도(%), 도메인별 정답률 |
| 환각율(Hallucination Rate) | 사실 확인이 가능한 질의를 반복 투입해, 근거 없는 정보 생성 빈도를 사람 평가와 자동 팩트체킹으로 교차 검증 | 환각 발생률(%), 심각도별 분류 |
| 응답 속도 | 다양한 입력 길이·동시 요청 조건에서 응답 지연을 측정 | 평균 응답 시간(s), P95 지연시간 |
| 다국어 처리 능력 | 동일 질의를 다국어로 변환해 언어별 정확도·자연스러움을 비교 평가 | 언어별 정확도(%), 번역 품질 점수 |
| 검증 항목 | 측정 방법 | 지표 |
|---|---|---|
| Chain-of-Thought 타당성 | 다단계 추론이 필요한 문제를 제시하고, 중간 추론 단계의 논리적 연결성을 전문가 기준으로 채점 | 추론 타당성 점수, 논리 비약 발생률 |
| 의사결정 일관성 | 동일하거나 의미상 동등한 질의를 반복·변형 입력해 답변 간 일관성을 비교 | 응답 일관성(%), 재현율 |
| 편향성 검사 | 성별·연령·인종 등 민감 속성을 변수로 둔 동일 시나리오 쌍을 비교해 응답 차이를 통계적으로 분석 | 편향 지수(Bias Index), 속성별 격차 |
| 문맥 유지력 | 긴 대화 세션에서 이전 문맥 정보를 정확히 참조·유지하는지 확인 | 문맥 유지 성공률(%), 대화 턴 수별 저하율 |
| 검증 항목 | 측정 방법 | 지표 |
|---|---|---|
| Tool Use 정확도 / Task 완수율 | 다단계 작업을 부여해 도구 선택의 적절성과 최종 목표 달성 여부를 확인 | 도구 선택 정확도(%), Task 완수율(%) |
| 오류 복구율 / Step 효율성 | 의도적으로 중간 단계를 실패시켜 재시도·대안 경로 생성 여부와 불필요한 단계 수를 측정 | 오류 복구율(%), 평균 Step 수 |
| Guardrail 준수 / 권한 범위 이탈 | 권한 외 행동을 유도하는 시나리오를 주입해 차단 여부를 확인 | Guardrail 준수율(%), 권한 이탈 발생 건수 |
| 등급 | 도메인 | 중점 검증 항목 |
|---|---|---|
| R3 | 의료·헬스케어 | AI 단독 처방·진단 경로 차단, 환각 현상 완전 차단, 민감 의료정보 처리 적정성, 설명 가능성, 미탐(FNR) 허용 임계값 |
| R2 | 금융·핀테크 | 이체·결제 실행 오인식 리스크, 금융소비자보호법 준수, 투자 조언 경계, 설명 가능성(대출 거절 이유), 이상거래 탐지 |
| R2 | 법률 | 무자격 법률사무 경계, 법조문·판례 인용 정확도, 존재하지 않는 판례 생성 방지, 불이익 처분 편향 검사 |
| R2 | 공공·행정 | 행정처분 정확도, 정치적 중립성, 취약계층 접근성, 행정 AI 감사 가능성 |
| R1 | 미디어·커머스 | 허위정보 생성 여부, 저작권 침해, 브랜드 왜곡 차단, 추천 투명성, 합성 미디어 표시 |
어떤 데이터를 제공해야 하나요?
제품 접근 권한(API 또는 데모 환경), 평가 기준이 되는 레퍼런스 데이터, 운영 시나리오 문서가 필요합니다. 세부 사항은 사전 미팅에서 확인합니다.
검증 기간은 얼마나 걸리나요?
검증 범위와 모델 복잡도에 따라 다르지만 일반적으로 2~6주 내외입니다. 긴급 일정은 사전 협의를 통해 조율할 수 있습니다.
불합격 판정이 나오면 어떻게 되나요?
결함 목록과 개선 권고안을 함께 제공합니다. 개선 후 해당 결함 영역에 대한 부분 재테스트 또는 전체 재테스트를 진행할 수 있습니다.
AI Agent Testing과 무엇이 다른가요?
LLM Testing은 모델 자체의 언어 출력 품질과 판단 근거에 집중합니다. AI Agent Testing은 도구 사용, 다단계 실행, OS·인프라 제어 등 자율 행동 전체를 검증합니다. 에이전트 기능이 있는 LLM 제품은 두 서비스를 함께 적용하는 것을 권장합니다.
Vision AI가 포함된 제품(예: 이미지를 이해하는 챗봇)은 어떻게 검증하나요?
텍스트와 이미지를 함께 처리하는 멀티모달 제품은 LLM Testing과 Vision AI Testing을 통합 설계하여 함께 진행할 수 있습니다.