o2o-plagiarism-ai/docs/PHASE2_PROGRESS.md

3.6 KiB

오투오 2단계 진행 현황 (2026-08-20 데이터 수령 반영)

컴북스가 제공한 실제 사람 작성 자서전 에피소드를 익명 human 코퍼스로 적재하는 기능과 AI 대조문 생성·그룹 분할 파이프라인을 구현했다.

1. 한눈에 보기

남은 작업(계획서 2단계) 선행 구현 상태 데이터 도착 후 할 일
표절 검출 고도화 — 군집화 ✅ engine/clustering.py 구현·테스트 실데이터로 임계값 튜닝
표절 검출 고도화 — Human Feedback ✅ 선호데이터 파이프라인 골격 사람 라벨 → DPO 학습
스토리 요약 모듈 ✅ 추출적 요약+통합 골격+API 추상적(sLLM) 연결, 정답셋 평가
메타 추출 F1(No.3) ✅ 평가 하니스(KLUE NER 호환) 정답 라벨로 정식 측정·향상
표절 정밀도 97%(No.4) ✅ 케이스 갭 분석으로 요청목록 산출 자서전 도메인 샘플로 달성
요약 ROUGE 65(No.7) ✅ ROUGE 평가 모듈·CLI 요약 정답셋으로 정식 측정
SW 저작권 등록 ✅ 등록 준비 문서 서류 제출
2단계 통합 ✅ 통합 인터페이스 명세 바이칼/컴북스 E2E
도메인 데이터 적재 ✅ 533문서·6,331에피소드 드라이런 운영 코퍼스 반영
사용자 맞춤형 요약 ✅ 상세도·강조 옵션 요약 정답셋 튜닝
AI 대조문·부가 의심도 ✅ Qwen 5,600건 생성·모델 배포 미학습 생성기 외부검증
ROUGE 라벨링 ✅ 300건·2인 검수 패킷 생성 사람 요약 입력·검수

2. 구현 산출물

코드 모듈 (테스트 포함)

  • app/engine/clustering.py — 군집화 기반 부분 표절(요소 교체) 판별. detect 응답에 partial_signal 필드로 노출. (tests/test_clustering.py)
  • app/engine/summarizer.py — 추출적(TextRank)+통합 요약. /v1/summary 엔드포인트. 외부 의존 0으로 동작, LLM 키 있으면 추상적 단계 결합. (tests/test_summarizer.py)
  • app/engine/rouge.py — ROUGE-1/2/L 자체 구현 (성능지표 No.7). (tests/test_rouge.py)
  • app/engine/metadata_eval.py — 요소 추출 F1(성능지표 No.3). (tests/test_metadata_eval.py)
  • app/engine/case_coverage.py — 39 케이스 커버리지 갭 분석. (tests/test_case_coverage.py)
  • app/engine/preference.py — HF 선호학습 데이터 골격. (tests/test_preference.py)

평가/유틸 스크립트 (데이터 도착 시 즉시 사용)

  • scripts/eval_rouge.py — 요약 ROUGE 평가 (dry-run 내장)
  • scripts/eval_metadata_f1.py — 메타 추출 F1 (KLUE NER --klue 지원)
  • scripts/analyze_case_coverage.py — 케이스 갭 → 데이터 요청 목록
  • scripts/build_preference_dataset.py — 선호데이터 template/convert

문서

  • docs/DATA_REQUEST_SPEC.md — 컴북스 요청 데이터 스펙 + 요약 정답셋 가이드
  • docs/INTEGRATION_INTERFACE.md — 2단계 통합 인터페이스
  • docs/SW_COPYRIGHT_REGISTRATION.md — SW 저작권 등록 준비

3. 추가 데이터·라벨에 묶여 남는 것

  • 표절 정밀도 97% 최종 달성 — 자서전 도메인 표절 샘플 필요
  • 요약 ROUGE 65 학습·최종 평가 — 요약 정답셋 필요
  • HF 실제 선호학습 수행 — 사람 선호 라벨 필요
  • sLLM 학습 실행 — A100급 GPU 인프라 필요

4. 평가환경 (계획서 p.24 기준)

  • 공인인증 평가환경: A100 GPU / Python 3.9 / transformers 4.39.3
  • 본 저장소 평가 스크립트는 위 환경에서 정답셋만 연결하면 동작하도록 작성됨.