o2o-plagiarism-ai/scripts
hbyang 94a660dc35 feat: finalize report at 9-eojeol threshold
기준을 9어절(35자)로 확정하고 문서를 그 기준으로 다시 만든다.
중복 제거 + 9어절 재실행 결과는 검사 대상 6087건, 침해의심 80건이다.

9어절 근거는 문서쌍 전수 대조다. 545문서 148,240쌍을 모두 대조하니
100어절(390자)까지 올려도 18쌍이 계속 겹친다. 겹침이 0이 되는 어절 수는
없다. 10~15어절에서 27쌍으로 고정되어 더 줄지 않는데, 오탐이라면 기준을
올릴수록 계속 줄어야 한다. 즉 그 지점부터 남는 것은 실제 유사 원고다.
상투어 노이즈는 4->5어절에서 대부분 걷히므로 9어절이 실질적 하한이다.

배포 파일을 하나로 합친다. 원문 대조 시트를 결과보고에 넣어 의심 80건의
원문을 같은 파일에서 볼 수 있게 하고, 숫자가 맞지 않는 중복 제거 전
파일 두 개는 배포 위치에서 내린다.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-09-03 14:29:30 +09:00
..
analyze_case_coverage.py 2단계 고도화 선행 작업: 군집화·요약·평가환경·데이터 스펙 (데이터 수령 전) 2026-06-18 13:16:07 +09:00
apply_precedent_grades.py feat: 전체 판례 검색과 판례 탭 추가 2026-08-20 16:20:37 +09:00
build_ai_training_dataset.py feat: 수령 자서전 데이터 파이프라인과 맞춤 요약 추가 2026-08-20 16:59:17 +09:00
build_persistent_index.py Claude 리뷰 기반 운영 안정성 보강 2026-08-10 16:42:17 +09:00
build_precedent_listup_xlsx.py docs: 적재본 545건의 출처 내역 추가 (컴북스 31 / 위원회 514) 2026-08-20 12:57:34 +09:00
build_precedent_listup.py docs: 자서전·출판물 표절 판단 근거 판례 리스트업 추가 2026-08-19 14:44:20 +09:00
build_preference_dataset.py 2단계 고도화 선행 작업: 군집화·요약·평가환경·데이터 스펙 (데이터 수령 전) 2026-06-18 13:16:07 +09:00
build_report_xlsx.py feat: finalize report at 9-eojeol threshold 2026-09-03 14:29:30 +09:00
build_summary_annotation_packet.py feat: 요약 검수 패킷과 수기집 원본 수집 도구 추가 2026-08-20 17:24:39 +09:00
calibrate_ai_detector_cuts.py feat: OCR·조판 아티팩트 정규화와 백분위 컷 캘리브레이션 2026-08-19 13:53:59 +09:00
clean_ai_samples.py feat: 전달 파일 전용 정책과 AI 표본 품질 감사 추가 2026-08-21 08:44:22 +09:00
collect_copyright_precedents.py feat: 판례 GPT 판단과 연동 가이드 최신화 2026-08-18 11:10:02 +09:00
eval_metadata_f1.py 2단계 고도화 선행 작업: 군집화·요약·평가환경·데이터 스펙 (데이터 수령 전) 2026-06-18 13:16:07 +09:00
eval_rouge.py fix: 요약 ROUGE를 계획서 수식에 맞춤 (F1 → recall, 다중 참조) 2026-08-19 13:54:22 +09:00
evaluate_o2o_dataset.py Initial commit: O2O 저작권 침해 여부 탐지 API 2026-05-13 11:20:17 +09:00
evaluate_pairs.py feat: 수령 자서전 데이터 파이프라인과 맞춤 요약 추가 2026-08-20 16:59:17 +09:00
extract_source_documents.py 3.5만 에피소드 기반 표절·AI·판례 분석 파이프라인 구현 2026-08-10 16:12:15 +09:00
extract_suspected_excerpts.py feat: report original text and judgment criteria for review 2026-09-03 09:49:50 +09:00
generate_ai_samples.py chore: AI 생성 설정 provenance 기록 2026-08-20 17:22:14 +09:00
generate_plagiarism_pairs.py feat: 수령 자서전 데이터 파이프라인과 맞춤 요약 추가 2026-08-20 16:59:17 +09:00
ingest_life_writing.py feat: add anonymized infringement batch reporting 2026-09-02 09:23:45 +09:00
ingest_o2o_xlsx.py feat: 수령 자서전 데이터 파이프라인과 맞춤 요약 추가 2026-08-20 16:59:17 +09:00
run_embedding_infringement_batch.py feat: sweep exact-span threshold from 3 to 9 eojeol 2026-09-03 13:27:10 +09:00
run_infringement_batch.py feat: support sharded infringement batches 2026-09-02 09:28:38 +09:00
sample_curl.sh API Key 인증 완전 제거 2026-05-14 08:58:28 +09:00
sample_python.py API Key 인증 완전 제거 2026-05-14 08:58:28 +09:00
train_ai_detector.py feat: AI 의심도 모델의 학습 범위 노출 2026-08-21 09:06:26 +09:00
validate_precedents.py feat: 판례 GPT 판단과 연동 가이드 최신화 2026-08-18 11:10:02 +09:00
visualize_eval_v2.py 성능지표 및 레포트 업로드 . 2026-05-18 14:54:01 +09:00
visualize_eval.py Initial commit: O2O 저작권 침해 여부 탐지 API 2026-05-13 11:20:17 +09:00