Commit Graph

2 Commits

Author SHA1 Message Date
bbdda66934 chore: prune docs to score-evidence set and drop sweep intermediates
docs 24 -> 12. 성적 수치 문서와 운영에 필요한 문서만 남긴다. 삭제분은 git
이력에 남아 있으므로 필요하면 되살린다.

남김: TEST_PLAN_2026_PHASE2, PERF_EVIDENCE_CAPTURE_2026, PRECISION_TEST_
PROCEDURE, SCOPE_AND_METRICS, AI_TRAINING_RESULT x2, CASE_MATCHING_KPI
(성적 수치) / IMPLEMENTATION_RUNBOOK(King 배포 절차), API_SPEC_BAIKAL(바이칼
연동), AI_DETECTION·PRECEDENT_LISTUP(코드가 참조), COMBOOKS 회신(미발송).

지우면 끊어질 내용은 버리지 않고 합쳤다.
- CASE_MATCHING_API.md -> API_SPEC_BAIKAL.md 7절
- PRECEDENT_SOURCE_GAP.md 의 출처 미확보 14건 표 -> COMBOOKS 회신 2절
남은 문서 6곳과 analyze_case_coverage.py 의 끊어진 링크도 함께 정리했다.

reports: 파라미터 스윕 중간본 4개(batch_*.jsonl, 42MB)를 삭제한다. 참조가 없고
xlsx 짝도 없는 탐색용 산출물이다. 날짜가 붙은 실측 배치(infringement_batch_*)는
xlsx 와 함께 증빙으로 유지한다.

진행 중인 요약(No.7) 작업 파일은 건드리지 않았다.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-09-28 09:55:02 +09:00
0472ae1f8a 2단계 고도화 선행 작업: 군집화·요약·평가환경·데이터 스펙 (데이터 수령 전)
컴북스 데이터 수령 전 가능한 작업을 선행 구현. 데이터 도착 즉시
학습·검증에 착수할 수 있도록 알고리즘·평가 하니스·문서를 준비.

알고리즘/파이프라인:
- engine/clustering.py: 군집화 기반 부분 표절(요소 교체) 판별,
  detect 응답에 partial_signal 필드 노출 (계획서 2단계 표절검출 고도화)
- engine/summarizer.py + POST /v1/summary: TextRank 추출적 요약 +
  통합(LLM) 골격 (과제2 ② 스토리 요약/분석)
- engine/preference.py + scripts/build_preference_dataset.py:
  Human Feedback 선호학습(DPO) 데이터 파이프라인 골격

평가 하니스 (정답셋 도착 즉시 측정):
- engine/rouge.py + scripts/eval_rouge.py: 요약 ROUGE (지표 No.7)
- engine/metadata_eval.py + scripts/eval_metadata_f1.py: 메타 추출 F1
  (지표 No.3, KLUE NER 호환)
- engine/case_coverage.py + scripts/analyze_case_coverage.py:
  39 케이스 갭 분석 → 컴북스 데이터 요청 목록 (정밀도 97% 근거)

문서:
- docs/DATA_REQUEST_SPEC.md: 요청 데이터 스펙 + 요약 정답셋/HF 라벨 가이드
- docs/INTEGRATION_INTERFACE.md: 2단계 통합 인터페이스
- docs/SW_COPYRIGHT_REGISTRATION.md: SW 저작권 등록 준비
- docs/PHASE2_PROGRESS.md, docs/CASE_COVERAGE.md

테스트 31 → 67건 전부 통과.

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
2026-06-18 13:16:07 +09:00