o2o-plagiarism-ai/scripts
hbyang bf3bd5b99b feat: sweep exact-span threshold from 3 to 9 eojeol
상무님 요청대로 어절 기준을 3~9로 바꿔가며 재판정한다. 기준값은 검색
후보를 바꾸지 않고 채택 여부만 정하므로, 후보 판정재료를 한 번 남겨두면
7회 실행 없이 오프라인에서 전부 계산할 수 있다. 27자로 재계산한 값이
실제 실행 결과 85건과 일치해 방식을 검증했다.

배치 스크립트에 하드코딩돼 있던 80 을 걷어낸다. --min-exact-span 을 줘도
이 줄이 설정을 읽지 않아 값이 적용되지 않았다.

겹침률 측정도 바로잡는다. 앞서 7어절 0% 로 봤던 것은 4만 쌍에서 히트가
0~1건이라 해상도가 없었고, 그 1건조차 같은 문서 내부의 반복이었다.
15만 쌍으로 늘리고 엔진과 같이 자기 문서 쌍을 빼면 9어절에서도 4.0% 다.
겹침이 사라지는 지점은 없으므로 '오탐 0 인 최저점' 논리는 성립하지 않는다.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-09-03 13:27:10 +09:00
..
analyze_case_coverage.py 2단계 고도화 선행 작업: 군집화·요약·평가환경·데이터 스펙 (데이터 수령 전) 2026-06-18 13:16:07 +09:00
apply_precedent_grades.py feat: 전체 판례 검색과 판례 탭 추가 2026-08-20 16:20:37 +09:00
build_ai_training_dataset.py feat: 수령 자서전 데이터 파이프라인과 맞춤 요약 추가 2026-08-20 16:59:17 +09:00
build_persistent_index.py Claude 리뷰 기반 운영 안정성 보강 2026-08-10 16:42:17 +09:00
build_precedent_listup_xlsx.py docs: 적재본 545건의 출처 내역 추가 (컴북스 31 / 위원회 514) 2026-08-20 12:57:34 +09:00
build_precedent_listup.py docs: 자서전·출판물 표절 판단 근거 판례 리스트업 추가 2026-08-19 14:44:20 +09:00
build_preference_dataset.py 2단계 고도화 선행 작업: 군집화·요약·평가환경·데이터 스펙 (데이터 수령 전) 2026-06-18 13:16:07 +09:00
build_report_xlsx.py feat: sweep exact-span threshold from 3 to 9 eojeol 2026-09-03 13:27:10 +09:00
build_summary_annotation_packet.py feat: 요약 검수 패킷과 수기집 원본 수집 도구 추가 2026-08-20 17:24:39 +09:00
calibrate_ai_detector_cuts.py feat: OCR·조판 아티팩트 정규화와 백분위 컷 캘리브레이션 2026-08-19 13:53:59 +09:00
clean_ai_samples.py feat: 전달 파일 전용 정책과 AI 표본 품질 감사 추가 2026-08-21 08:44:22 +09:00
collect_copyright_precedents.py feat: 판례 GPT 판단과 연동 가이드 최신화 2026-08-18 11:10:02 +09:00
eval_metadata_f1.py 2단계 고도화 선행 작업: 군집화·요약·평가환경·데이터 스펙 (데이터 수령 전) 2026-06-18 13:16:07 +09:00
eval_rouge.py fix: 요약 ROUGE를 계획서 수식에 맞춤 (F1 → recall, 다중 참조) 2026-08-19 13:54:22 +09:00
evaluate_o2o_dataset.py Initial commit: O2O 저작권 침해 여부 탐지 API 2026-05-13 11:20:17 +09:00
evaluate_pairs.py feat: 수령 자서전 데이터 파이프라인과 맞춤 요약 추가 2026-08-20 16:59:17 +09:00
extract_source_documents.py 3.5만 에피소드 기반 표절·AI·판례 분석 파이프라인 구현 2026-08-10 16:12:15 +09:00
extract_suspected_excerpts.py feat: report original text and judgment criteria for review 2026-09-03 09:49:50 +09:00
generate_ai_samples.py chore: AI 생성 설정 provenance 기록 2026-08-20 17:22:14 +09:00
generate_plagiarism_pairs.py feat: 수령 자서전 데이터 파이프라인과 맞춤 요약 추가 2026-08-20 16:59:17 +09:00
ingest_life_writing.py feat: add anonymized infringement batch reporting 2026-09-02 09:23:45 +09:00
ingest_o2o_xlsx.py feat: 수령 자서전 데이터 파이프라인과 맞춤 요약 추가 2026-08-20 16:59:17 +09:00
run_embedding_infringement_batch.py feat: sweep exact-span threshold from 3 to 9 eojeol 2026-09-03 13:27:10 +09:00
run_infringement_batch.py feat: support sharded infringement batches 2026-09-02 09:28:38 +09:00
sample_curl.sh API Key 인증 완전 제거 2026-05-14 08:58:28 +09:00
sample_python.py API Key 인증 완전 제거 2026-05-14 08:58:28 +09:00
train_ai_detector.py feat: AI 의심도 모델의 학습 범위 노출 2026-08-21 09:06:26 +09:00
validate_precedents.py feat: 판례 GPT 판단과 연동 가이드 최신화 2026-08-18 11:10:02 +09:00
visualize_eval_v2.py 성능지표 및 레포트 업로드 . 2026-05-18 14:54:01 +09:00
visualize_eval.py Initial commit: O2O 저작권 침해 여부 탐지 API 2026-05-13 11:20:17 +09:00