o2o-plagiarism-ai/tests
hbyang 3da7a0a5f2 fix: 요약 ROUGE를 계획서 수식에 맞춤 (F1 → recall, 다중 참조)
계획서 p.24 수식의 분모가 참조 n-gram 수이므로 지표는 recall 인데
eval_rouge.py 는 ROUGE-1 F1 을 목표 0.65 와 대조하고 있었다. 통상 시스템
요약이 참조보다 길면 recall > F1 이므로 우리에게 불리한 자체 기준으로
채점해 온 셈이다(내장 샘플에서 recall 0.5778 vs F1 0.5539).

같은 수식이 Σ_S∈{Reference Summaries} 로 다중 참조를 전제하는데 rouge_n /
rouge_l 은 참조를 문자열 하나만 받았다. 이제 문자열도 리스트도 받는다.
참조가 1개면 기존과 완전히 같은 값이 나오며 이를 테스트로 고정했다.

--iaa 모드를 추가했다. 사람 둘이 같은 글을 요약해도 ROUGE 는 100 이 안
나오고, 그 상한이 65 보다 낮으면 어떤 시스템도 목표를 달성할 수 없다.
정답셋 300건을 만들기 전에 파일럿 20건으로 상한을 먼저 재기 위한 것이다.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-19 13:54:22 +09:00
..
test_ai_detector.py AI 의심도 백분위 캘리브레이션 (학습·지표 없이 운영) 2026-08-11 09:05:48 +09:00
test_ai_training_split.py Claude 리뷰 기반 운영 안정성 보강 2026-08-10 16:42:17 +09:00
test_api.py feat: 저작권 탭 경량 응답 API 추가 2026-08-18 12:47:51 +09:00
test_auth_middleware.py Claude 리뷰 기반 운영 안정성 보강 2026-08-10 16:42:17 +09:00
test_case_coverage.py 2단계 고도화 선행 작업: 군집화·요약·평가환경·데이터 스펙 (데이터 수령 전) 2026-06-18 13:16:07 +09:00
test_clustering.py 2단계 고도화 선행 작업: 군집화·요약·평가환경·데이터 스펙 (데이터 수령 전) 2026-06-18 13:16:07 +09:00
test_coverage_and_features.py Claude 리뷰 기반 운영 안정성 보강 2026-08-10 16:42:17 +09:00
test_dual_similarity.py Initial commit: O2O 저작권 침해 여부 탐지 API 2026-05-13 11:20:17 +09:00
test_frontend_legal_risk.py fix: 사용자 판단 문구에서 모델명 제거 2026-08-18 11:44:56 +09:00
test_generate_ai_samples.py feat: AI 생성 표본 제작 스크립트 2026-08-19 13:54:21 +09:00
test_legal_risk.py fix: 판례 판단 시 사람 검토 안전장치 강제 2026-08-18 11:46:46 +09:00
test_metadata_eval.py 2단계 고도화 선행 작업: 군집화·요약·평가환경·데이터 스펙 (데이터 수령 전) 2026-06-18 13:16:07 +09:00
test_ocr_normalize.py feat: OCR·조판 아티팩트 정규화와 백분위 컷 캘리브레이션 2026-08-19 13:53:59 +09:00
test_pdf_compliance.py Initial commit: O2O 저작권 침해 여부 탐지 API 2026-05-13 11:20:17 +09:00
test_precedent_collector.py feat: 판례 GPT 판단과 연동 가이드 최신화 2026-08-18 11:10:02 +09:00
test_preference.py 2단계 고도화 선행 작업: 군집화·요약·평가환경·데이터 스펙 (데이터 수령 전) 2026-06-18 13:16:07 +09:00
test_provenance_index.py 3.5만 에피소드 기반 표절·AI·판례 분석 파이프라인 구현 2026-08-10 16:12:15 +09:00
test_review_regressions.py Claude 리뷰 기반 운영 안정성 보강 2026-08-10 16:42:17 +09:00
test_rouge.py fix: 요약 ROUGE를 계획서 수식에 맞춤 (F1 → recall, 다중 참조) 2026-08-19 13:54:22 +09:00
test_source_extraction.py 3.5만 에피소드 기반 표절·AI·판례 분석 파이프라인 구현 2026-08-10 16:12:15 +09:00
test_static_ui.py feat: 프론트에 AI 생성 의심도 표시 2026-08-11 09:02:04 +09:00
test_structural.py Initial commit: O2O 저작권 침해 여부 탐지 API 2026-05-13 11:20:17 +09:00
test_summarizer.py 2단계 고도화 선행 작업: 군집화·요약·평가환경·데이터 스펙 (데이터 수령 전) 2026-06-18 13:16:07 +09:00