성능지표 #4(표절 판별 정밀도) 를 공인시험에서 재현할 수 있게 시험셋 생성기, 평가 실행기, python 3.9 평가 컨테이너, 시험절차서를 둔다. 시험셋은 작성자 단위로 코퍼스를 나눠 만든다. 비표절 시료를 참조 코퍼스에서 뽑으면 인덱스가 자기 자신을 찾아 전부 오탐이 되므로, 인덱스에 없는 작성자의 글만 쓴다. 무관한 글만 넣으면 정밀도가 부풀려져 주제 근접 시료 150건을 따로 섞는다. 실제 오탐이 나는 유형이 그것이다. 대필(인칭 전환)은 제외한다. 원문이 그대로 남지만 표절 여부가 계약·동의로 갈려 텍스트만으로 판정할 수 없다. 자체 측정 결과 정밀도 0.9840 (TP=493 FP=8 TN=492 FN=7). 목표 0.97 을 넘고, 오탐 8건 중 7건이 주제 근접 시료에서 나와 난이도가 운영 조건을 반영한다. 시험셋에는 자서전 원문이 들어가므로 저장소에 두지 않는다. 시드가 manifest 에 고정돼 있어 생성기로 동일하게 재생성된다. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
62 lines
1.3 KiB
Plaintext
62 lines
1.3 KiB
Plaintext
# 환경 / 키 (민감) — 절대 커밋 금지
|
|
.env
|
|
.env.local
|
|
*.key
|
|
*.pem
|
|
|
|
# Python
|
|
.venv/
|
|
.venv-*/
|
|
venv/
|
|
__pycache__/
|
|
*.pyc
|
|
*.pyo
|
|
*.egg-info/
|
|
.pytest_cache/
|
|
.mypy_cache/
|
|
.ruff_cache/
|
|
|
|
# OS / 에디터
|
|
.DS_Store
|
|
Thumbs.db
|
|
.idea/
|
|
.vscode/
|
|
|
|
# 평가 산출물 (재생성 가능)
|
|
data/training/*.jsonl
|
|
data/training/*.json
|
|
data/training/*.csv
|
|
data/training/*.xlsx
|
|
!data/training/.gitkeep
|
|
|
|
# 사용자 업로드 자서전 (개인정보) — 샘플 외 제외
|
|
data/reference/autobio-*.txt
|
|
data/reference/corpus-*.txt
|
|
|
|
# 운영 원고·인덱스·학습 모델 (서버 볼륨에만 저장)
|
|
data/input/
|
|
data/runtime/
|
|
data/models/
|
|
data/life_writing/
|
|
*.joblib
|
|
|
|
# 시각화 리포트 — PNG/MD 함께 보존 (재생성도 가능)
|
|
|
|
# 로그
|
|
*.log
|
|
logs/
|
|
|
|
# Hugging Face 모델 캐시
|
|
.cache/
|
|
~/.cache/huggingface/
|
|
|
|
# 원문(개인 자서전 본문)이 담긴 산출물은 저장소에 두지 않는다.
|
|
# 필요하면 scripts/extract_suspected_excerpts.py 로 킹서버 코퍼스에서 다시 뽑는다.
|
|
reports/excerpts_*.jsonl
|
|
reports/침해판별_원문대조_*.xlsx
|
|
reports/침해판별_의심건검토_*.xlsx
|
|
|
|
# 시험셋에는 자서전 원문이 들어간다. 시드가 manifest.json 에 고정돼 있어
|
|
# build_plagiarism_testset.py 로 언제든 동일하게 재생성할 수 있다.
|
|
data/eval/
|