| .. | ||
| precedents.jsonl | ||
| README.md | ||
| selection_audit.json | ||
판례 지식베이스
precedents.jsonl은 표절 탐지 결과에 관련 판례를 연결하기 위한 검증용 데이터다.
2026-08-18 기준 545개의 고유 국내 사건이 등록되어 있다.
데이터 출처
- 한국저작권위원회 저작권판례 목록 2,085건(209페이지)
- 프로젝트 제공 엑셀 3종 182행(고유 사건번호 142개)
공식 목록에서 자서전·출판물의 본문/구조/인용 및 부속 시각·음성 자산과 관련된 제목 후보를 찾고, 상세 페이지나 첨부 판결문 파일명에서 국내 사건번호가 확인된 항목만 수집한다. 엑셀 사건번호는 공식 사이트에서 다시 검색해 중복을 병합한다.
선별·중복·제외 통계와 공식 상세 페이지를 찾지 못한 엑셀 사건번호는
selection_audit.json에 기록한다. 공식 상세 페이지가 확인되지 않은 엑셀 103건은
출처를 임의 생성하지 않고 운영 JSONL에서 제외했다.
운영 적재 조건
필수 필드:
case_id: 국내 법원 사건번호title: 한국저작권위원회 게시물 제목source_url: 사건번호를 확인한 공식 HTTPS 상세 URLholding_summary: 공식 상세 본문의 판시사항·판결요지 또는 공식 게시물 제목
매칭 필드:
work_types:literary,visual,musicallegal_tags:reproduction,derivative_work,public_transmission,distribution,publication,attribution,integrity,citation_missing,false_authorshipcriteria: 실질적 유사성, 의거관계, 창작성, 공정이용 등
법적 태그가 없거나 저작물 유형·판단 기준이 모두 없는 후보 134건은 엔진에서 무차별 매칭되는 것을 막기 위해 제외한다. 현재 JSONL은 검증과 검색 우선순위 보조용이며, 법률상 침해 결론이나 전문가 라벨 확정을 의미하지 않는다.
재생성 및 검증
공식 사이트를 다시 수집하려면 네트워크 연결이 필요하다. 수집 결과는 기본적으로
/tmp/copyright-precedents-cache에 캐시된다.
python3 scripts/collect_copyright_precedents.py \
--pages 209 \
--workers 3 \
--excel-dir "data/출판과제 판례 데이터(컴북스)" \
--output data/precedents/precedents.jsonl \
--audit-output data/precedents/selection_audit.json
python3 -m scripts.validate_precedents data/precedents/precedents.jsonl
사이트 게시물 수가 바뀌면 마지막 페이지 수를 확인해 --pages를 조정한다. 모델이나
LLM이 사건번호나 출처를 자유 생성하게 해서는 안 된다.