기준을 9어절(35자)로 확정하고 문서를 그 기준으로 다시 만든다. 중복 제거 + 9어절 재실행 결과는 검사 대상 6087건, 침해의심 80건이다. 9어절 근거는 문서쌍 전수 대조다. 545문서 148,240쌍을 모두 대조하니 100어절(390자)까지 올려도 18쌍이 계속 겹친다. 겹침이 0이 되는 어절 수는 없다. 10~15어절에서 27쌍으로 고정되어 더 줄지 않는데, 오탐이라면 기준을 올릴수록 계속 줄어야 한다. 즉 그 지점부터 남는 것은 실제 유사 원고다. 상투어 노이즈는 4->5어절에서 대부분 걷히므로 9어절이 실질적 하한이다. 배포 파일을 하나로 합친다. 원문 대조 시트를 결과보고에 넣어 의심 80건의 원문을 같은 파일에서 볼 수 있게 하고, 숫자가 맞지 않는 중복 제거 전 파일 두 개는 배포 위치에서 내린다. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> |
||
|---|---|---|
| .. | ||
| 01_score_distributions.png | ||
| 02_threshold_curves.png | ||
| 03_model_comparison.png | ||
| batch_dedup_sweep.jsonl | ||
| batch_final_9eojeol.jsonl | ||
| dedup_exclude_segments.txt | ||
| infringement_batch_2nd_embed_20260902-100259.jsonl | ||
| infringement_batch_2nd_embed_20260902-100259.xlsx | ||
| infringement_batch_20260902-092852.jsonl | ||
| infringement_batch_20260902-092852.xlsx | ||
| plagia_report.docx | ||
| plagia_report.pdf | ||
| REPORT.md | ||
| 침해판별_결과보고_20260902.xlsx | ||