09 · AI-READY DATA
AI-ready 데이터
AI-ready는 파일을 벡터 DB에 넣었다는 뜻이 아니다. 쓸 권리가 있고 출처와 맥락을 설명하며 학습·검색·추론에서 품질과 삭제를 검증할 수 있어야 한다.
DECISIONOPERATION
목차AI-ready 데이터
- 기본 경로가이드 사용법
- 01 · OPERATING MODEL운영 모델
- 02 · ASSET & OWNERSHIP자산·소유권·분류
- 03 · METADATA메타데이터·리니지
- 04 · ARCHITECTURE아키텍처·생명주기
- 05 · QUALITY품질·계약
- 06 · MASTER DATA마스터·참조 데이터
- 07 · ACCESS접근·개인정보·감사
- 08 · WORKFLOWS운영 워크플로
- 09 · AI-READY DATAAI-ready 데이터
- 10 · MATURITY성숙도·로드맵·지표
- 11 · TOOLKIT실행 도구
- REFERENCE · GLOSSARY용어
- REFERENCE · SOURCES출처·라이선스
AI 이용 권리·출처·맥락·품질을 확인하고 비정형 원본과 청크·임베딩·평가셋 같은 파생 자산을 추적한다.
이 챕터는 데이터의 이용 가능성·권리·품질·출처만 다룬다. AI 유스케이스 승인, 모델 위험 등급, 에이전트 실행 권한과 AI 규제 일반론은 디지털 인프라 거버넌스 가이드에서 다룬다.
AI에 쓸 데이터는 이용 목적, 수집·라이선스·계약상 권리, 개인정보 처리 조건, 대표성, 최신성, 출처 추적 가능성을 먼저 확인한다. “사내에 있다”는 사실은 학습·RAG·평가에 다시 쓸 권리를 뜻하지 않는다. 모델 입력, 파인튜닝, 검색 색인, 평가셋은 목적과 보존 범위가 다를 수 있다.
데이터 오너는 허용 목적과 출처를 승인한다. 법무·개인정보 담당자는 라이선스·계약·개인정보 조건을 검토한다. ML·데이터 엔지니어는 전처리·청킹·임베딩·학습 분할의 재현성과 삭제 전파를 구현한다. 제품 오너는 실제 실패 사례와 평가 기준을 제공한다.
원본 문서에는 출처 URI, 수집 시각, 권리, 언어, 버전, 유효 기간을 붙인다. OCR·전사·정규화·청크·임베딩에는 원본 ID, 변환 코드·모델 버전, 파라미터, 생성 시각을 연결한다. 삭제나 권리 철회가 생기면 검색 색인, 캐시, 평가셋, 파인튜닝 후보에서 같은 계보를 따라 처리한다.
RAG 데이터는 문서 커버리지, 파싱 성공률, 정답 청크 회수율, 최신 문서 반영 지연을 본다. 학습·평가 데이터는 중복과 누수, 클래스·집단 대표성, 라벨 합의도, 분할 기준을 기록한다.
이용 권리 원장, 데이터시트, 원본-파생 리니지, 전처리 버전, 학습·평가 분할, 삭제 처리 로그, RAG 평가 결과가 필요하다. KPI는 권리 미확인 자산 수, 파싱 실패율, 출처 없는 청크 비율, 정답 근거 회수율, 삭제 전파 시간, 데이터 최신성 지연을 본다.
| 파생 자산 | 반드시 연결할 정보 |
|---|---|
| OCR·전사 | 원본 파일, 엔진·언어·오류 검토 |
| 청크 | 원본 위치, 청킹 규칙과 버전 |
| 임베딩 | 청크 ID, 모델·차원·생성일 |
| 평가셋 | 출처, 정답 근거, 검토자·버전 |
| 학습셋 | 권리, 라벨, 분할, 제외·삭제 기록 |
- AI 이용 목적과 원래 수집 목적의 관계를 검토했다.
- 원본에서 청크·임베딩·평가셋까지 계보가 이어진다.
- 라이선스·계약·개인정보 조건을 담당자가 확인했다.
- 삭제·정정이 파생 자산에 전파되는 절차가 있다.
- RAG와 학습 데이터 품질을 실제 실패 사례로 검증한다.
임베딩을 원본과 무관한 기술 부산물로 보면 삭제와 권리 철회에 대응하기 어렵다. 공개 웹 문서라고 해서 모든 학습·재배포가 허용되는 것도 아니다. RAG 답변만 평가하면 파싱·청킹·검색 실패를 구분하지 못한다. 데이터 단계별 지표와 원본 근거를 함께 남겨야 한다.
이 챕터의 출처
- 01데이터 거버넌스 가이드라인 ↗Future Corporation
- 02DAMA 데이터 관리 지식체계(DMBOK) 공식 안내 ↗DAMA International
- 03개인정보 보호법 ↗국가법령정보센터
- 042026 가명정보 처리 가이드라인 ↗개인정보보호위원회