o2o-plagiarism-ai/app
hbyang 3da7a0a5f2 fix: 요약 ROUGE를 계획서 수식에 맞춤 (F1 → recall, 다중 참조)
계획서 p.24 수식의 분모가 참조 n-gram 수이므로 지표는 recall 인데
eval_rouge.py 는 ROUGE-1 F1 을 목표 0.65 와 대조하고 있었다. 통상 시스템
요약이 참조보다 길면 recall > F1 이므로 우리에게 불리한 자체 기준으로
채점해 온 셈이다(내장 샘플에서 recall 0.5778 vs F1 0.5539).

같은 수식이 Σ_S∈{Reference Summaries} 로 다중 참조를 전제하는데 rouge_n /
rouge_l 은 참조를 문자열 하나만 받았다. 이제 문자열도 리스트도 받는다.
참조가 1개면 기존과 완전히 같은 값이 나오며 이를 테스트로 고정했다.

--iaa 모드를 추가했다. 사람 둘이 같은 글을 요약해도 ROUGE 는 100 이 안
나오고, 그 상한이 65 보다 낮으면 어떤 시스템도 목표를 달성할 수 없다.
정답셋 300건을 만들기 전에 파일럿 20건으로 상한을 먼저 재기 위한 것이다.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-19 13:54:22 +09:00
..
api feat: 저작권 탭 경량 응답 API 추가 2026-08-18 12:47:51 +09:00
core feat: 판례 GPT 판단과 연동 가이드 최신화 2026-08-18 11:10:02 +09:00
engine fix: 요약 ROUGE를 계획서 수식에 맞춤 (F1 → recall, 다중 참조) 2026-08-19 13:54:22 +09:00
jobs Initial commit: O2O 저작권 침해 여부 탐지 API 2026-05-13 11:20:17 +09:00
static fix: 판례 근거 중심으로 판단 문구 개선 2026-08-18 11:41:10 +09:00
__init__.py Initial commit: O2O 저작권 침해 여부 탐지 API 2026-05-13 11:20:17 +09:00
main.py Claude 리뷰 기반 운영 안정성 보강 2026-08-10 16:42:17 +09:00