o2o-plagiarism-ai/scripts
hbyang a45c79211c docs: 적재본 545건의 출처 내역 추가 (컴북스 31 / 위원회 514)
문제: 리스트업이 선별 57건만 다뤄서, "표절 탐지에 실제로 쓰이는 판례가 무엇인가"에
답할 수 없었다. 엔진이 로드하는 것은 57건이 아니라 적재본 545건 전부이고
(PRECEDENTS_PATH), 판정 1건마다 유형·태그가 맞는 상위 5건을 인용한다.

또 컴북스 제공분이 얼마나 반영됐는지가 어디에도 기재돼 있지 않았다. 데이터에는
레코드의 excel_duplicate 필드로 남아 있는데 문서에 나오지 않아, 회의에서
"우리가 준 판례는 어떻게 됐나"라는 질문에 답할 수 없는 상태였다.

  컴북스 제공 고유 사건번호        142
    공식 상세 페이지 미확인 → 제외 -103
    엔진 라벨 부족 → 제외            -8
  엔진 적재본에 포함                31  (21.8%)
    이 중 리스트업 선정             10  (A 3 · B 6 · C 1)

제외된 103건은 사건번호만으로는 인용 출처가 되지 않아 적재하지 못했다. 판결문
원문이나 확인 경로를 받으면 적재 가능하므로 컴북스에 회신을 요청해야 하고, 그
목록을 Excel 시트에 그대로 실었다.

Excel 에 시트 2개 추가:
  적재본 전체    545건 전수. 출처(컴북스/위원회)와 리스트업 등급을 함께 표시
  컴북스 제공분  단계별 반영 내역, 적재된 31건, 회신 요청할 103건 목록

주의로 남긴 것: 컴북스 목록의 주제 분류와 실제 판시가 어긋나는 건이 리스트업에도
흘러들어갔다. 컴북스 유래 A등급 3건 중 2012다73493(깃털 공예품)은 어문 사건이
아니며 2017다212095(게임)도 마찬가지다. 인용 전 원문 대조가 필요하다.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-08-20 12:57:34 +09:00
..
analyze_case_coverage.py 2단계 고도화 선행 작업: 군집화·요약·평가환경·데이터 스펙 (데이터 수령 전) 2026-06-18 13:16:07 +09:00
build_ai_training_dataset.py 3.5만 에피소드 기반 표절·AI·판례 분석 파이프라인 구현 2026-08-10 16:12:15 +09:00
build_persistent_index.py Claude 리뷰 기반 운영 안정성 보강 2026-08-10 16:42:17 +09:00
build_precedent_listup_xlsx.py docs: 적재본 545건의 출처 내역 추가 (컴북스 31 / 위원회 514) 2026-08-20 12:57:34 +09:00
build_precedent_listup.py docs: 자서전·출판물 표절 판단 근거 판례 리스트업 추가 2026-08-19 14:44:20 +09:00
build_preference_dataset.py 2단계 고도화 선행 작업: 군집화·요약·평가환경·데이터 스펙 (데이터 수령 전) 2026-06-18 13:16:07 +09:00
calibrate_ai_detector_cuts.py feat: OCR·조판 아티팩트 정규화와 백분위 컷 캘리브레이션 2026-08-19 13:53:59 +09:00
collect_copyright_precedents.py feat: 판례 GPT 판단과 연동 가이드 최신화 2026-08-18 11:10:02 +09:00
eval_metadata_f1.py 2단계 고도화 선행 작업: 군집화·요약·평가환경·데이터 스펙 (데이터 수령 전) 2026-06-18 13:16:07 +09:00
eval_rouge.py fix: 요약 ROUGE를 계획서 수식에 맞춤 (F1 → recall, 다중 참조) 2026-08-19 13:54:22 +09:00
evaluate_o2o_dataset.py Initial commit: O2O 저작권 침해 여부 탐지 API 2026-05-13 11:20:17 +09:00
evaluate_pairs.py Initial commit: O2O 저작권 침해 여부 탐지 API 2026-05-13 11:20:17 +09:00
extract_source_documents.py 3.5만 에피소드 기반 표절·AI·판례 분석 파이프라인 구현 2026-08-10 16:12:15 +09:00
generate_ai_samples.py feat: AI 생성 표본 제작 스크립트 2026-08-19 13:54:21 +09:00
generate_plagiarism_pairs.py Initial commit: O2O 저작권 침해 여부 탐지 API 2026-05-13 11:20:17 +09:00
ingest_o2o_xlsx.py 3.5만 에피소드 기반 표절·AI·판례 분석 파이프라인 구현 2026-08-10 16:12:15 +09:00
sample_curl.sh API Key 인증 완전 제거 2026-05-14 08:58:28 +09:00
sample_python.py API Key 인증 완전 제거 2026-05-14 08:58:28 +09:00
train_ai_detector.py 3.5만 에피소드 기반 표절·AI·판례 분석 파이프라인 구현 2026-08-10 16:12:15 +09:00
validate_precedents.py feat: 판례 GPT 판단과 연동 가이드 최신화 2026-08-18 11:10:02 +09:00
visualize_eval_v2.py 성능지표 및 레포트 업로드 . 2026-05-18 14:54:01 +09:00
visualize_eval.py Initial commit: O2O 저작권 침해 여부 탐지 API 2026-05-13 11:20:17 +09:00