docs 에 남아 있던 8개를 삭제한다. 내용은 git 이력(bbdda66)에 그대로 있으므로
필요하면 `git show bbdda66:docs/<파일>` 로 꺼낸다.
삭제: TEST_PLAN_2026_PHASE2, PERF_EVIDENCE_CAPTURE_2026, PRECISION_TEST_
PROCEDURE, SCOPE_AND_METRICS, CASE_MATCHING_KPI, IMPLEMENTATION_RUNBOOK,
PRECEDENT_LISTUP, COMBOOKS_CASE_MATCHING_REPLY_20260918.
삭제본을 출처로 가리키던 주석 4곳을 함께 정리했다(legal_risk.py,
build_precedent_listup_xlsx.py 2곳, show_summary_samples.py). 동작에는 영향이
없고 판례 표의 실제 원본은 data/precedents/precedent_listup.csv 와 해당
스크립트의 상수다.
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
요약 항목도 같은 서식으로 준비한다. 정답셋이 없어 수치는 채울 수 없으므로
서식과 시현 절차만 확정하고, 결과 자리는 자리표시자로 둔다.
eval_rouge.py: 성적서 '4. 결과' 형식 JSON 출력(--out 으로 저장). 보고 대상이
ROUGE-1 recall 임을 reported_metric 으로 명시한다. 계획서 수식 분모가 참조
n-gram 수인데 전 차수 코드는 f1 을 반환해 정의가 어긋나 있었다.
show_summary_samples.py: 전 차수 '1. 데이터 준비' 의 {index, original} 형식
출력. 정답셋이 없으면 그 사실과 참조 문서를 알리고 종료한다.
시험방법 수정 두 곳 — 1,000건에서 300건으로(사람 작성 정답이 필요해 1,000건은
구축 비용 과다), 지표를 ROUGE-1 recall 로 명시.
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>