상무님 지적 두 가지를 검증 가능한 형태로 만든다. 1) 중복 원고: 코퍼스 6343건 중 247그룹 503건이 중복이고, 침해의심 103건 중 28건이 여기서 비롯됐다. 다만 247그룹 중 234그룹이 서로 다른 문서 사이의 중복이라 같은 제출자의 재제출인지 다른 제출자의 표절인지 아직 모른다. 지우기 전에 원문째로 남기도록 build_duplicate_report.py 를 둔다. 2) 연속 일치 기준 80자: 근거 없이 잡힌 초기값이다. 무관한 원고 4만 쌍을 대조해 재보니 3어절 100%, 4어절 99.8%, 5어절 47%, 7어절 0% 오탐이다 (한 건을 6343건과 대조하는 효과 반영). 관행인 3~5어절은 쓸 수 없고 7어절 = 공백 포함 27자가 오탐 0% 를 유지하는 최저점이다. 배치에 --exclude-segments 와 --min-exact-span 을 추가한다. 중복은 질의와 색인 양쪽에서 함께 빼야 한다. 한쪽만 빼면 지운 원고가 여전히 상대로 잡힌다. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> |
||
|---|---|---|
| .. | ||
| 01_score_distributions.png | ||
| 02_threshold_curves.png | ||
| 03_model_comparison.png | ||
| dedup_exclude_segments.txt | ||
| infringement_batch_2nd_embed_20260902-100259.jsonl | ||
| infringement_batch_2nd_embed_20260902-100259.xlsx | ||
| infringement_batch_20260902-092852.jsonl | ||
| infringement_batch_20260902-092852.xlsx | ||
| plagia_report.docx | ||
| plagia_report.pdf | ||
| REPORT.md | ||
| 침해판별_결과보고_20260902.xlsx | ||