58 lines
2.6 KiB
Markdown
58 lines
2.6 KiB
Markdown
# 판례 지식베이스
|
|
|
|
`precedents.jsonl`은 표절 탐지 결과에 관련 판례를 연결하기 위한 검증용 데이터다.
|
|
2026-08-18 기준 545개의 고유 국내 사건이 등록되어 있다.
|
|
|
|
## 데이터 출처
|
|
|
|
- 한국저작권위원회 저작권판례 목록 2,085건(209페이지)
|
|
- 프로젝트 제공 엑셀 3종 182행(고유 사건번호 142개)
|
|
|
|
공식 목록에서 자서전·출판물의 본문/구조/인용 및 부속 시각·음성 자산과 관련된
|
|
제목 후보를 찾고, 상세 페이지나 첨부 판결문 파일명에서 국내 사건번호가 확인된
|
|
항목만 수집한다. 엑셀 사건번호는 공식 사이트에서 다시 검색해 중복을 병합한다.
|
|
|
|
선별·중복·제외 통계와 공식 상세 페이지를 찾지 못한 엑셀 사건번호는
|
|
`selection_audit.json`에 기록한다. 공식 상세 페이지가 확인되지 않은 엑셀 103건은
|
|
출처를 임의 생성하지 않고 운영 JSONL에서 제외했다.
|
|
|
|
## 운영 적재 조건
|
|
|
|
필수 필드:
|
|
|
|
- `case_id`: 국내 법원 사건번호
|
|
- `title`: 한국저작권위원회 게시물 제목
|
|
- `source_url`: 사건번호를 확인한 공식 HTTPS 상세 URL
|
|
- `holding_summary`: 공식 상세 본문의 판시사항·판결요지 또는 공식 게시물 제목
|
|
|
|
매칭 필드:
|
|
|
|
- `work_types`: `literary`, `visual`, `musical`
|
|
- `legal_tags`: `reproduction`, `derivative_work`, `public_transmission`,
|
|
`distribution`, `publication`, `attribution`, `integrity`, `citation_missing`,
|
|
`false_authorship`
|
|
- `criteria`: 실질적 유사성, 의거관계, 창작성, 공정이용 등
|
|
|
|
법적 태그가 없거나 저작물 유형·판단 기준이 모두 없는 후보 134건은 엔진에서 무차별
|
|
매칭되는 것을 막기 위해 제외한다. 현재 JSONL은 검증과 검색 우선순위 보조용이며,
|
|
법률상 침해 결론이나 전문가 라벨 확정을 의미하지 않는다.
|
|
|
|
## 재생성 및 검증
|
|
|
|
공식 사이트를 다시 수집하려면 네트워크 연결이 필요하다. 수집 결과는 기본적으로
|
|
`/tmp/copyright-precedents-cache`에 캐시된다.
|
|
|
|
```bash
|
|
python3 scripts/collect_copyright_precedents.py \
|
|
--pages 209 \
|
|
--workers 3 \
|
|
--excel-dir "data/출판과제 판례 데이터(컴북스)" \
|
|
--output data/precedents/precedents.jsonl \
|
|
--audit-output data/precedents/selection_audit.json
|
|
|
|
python3 -m scripts.validate_precedents data/precedents/precedents.jsonl
|
|
```
|
|
|
|
사이트 게시물 수가 바뀌면 마지막 페이지 수를 확인해 `--pages`를 조정한다. 모델이나
|
|
LLM이 사건번호나 출처를 자유 생성하게 해서는 안 된다.
|