o2o-plagiarism-ai/.gitignore
hbyang e89cd23ed6 feat: report original text and judgment criteria for review
검토자가 침해 여부를 눈으로 판별하려면 원문이 있어야 하고, 어떤 조건으로
걸렸는지 알아야 한다. 두 가지를 워크북에 싣는다.

- extract_suspected_excerpts.py: 코퍼스 DB(읽기 전용)에서 질의·상대 원문과
  일치 구간을 뽑는다. 킹서버 기본 python 이 3.6 이라 이 파일만 구문을 맞췄다.
- '판정 기준' 시트: 3개 OR 조건과 결합유사도 가중치, 조건별 충족 현황
- '원문 대조' 시트: 판정 사유 컬럼으로 각 건이 걸린 조건을 표시

판례 표기도 바로잡는다. USE_LLM_LEGAL_JUDGE=false 는 LLM 법적 판단만
끈 것이고 판례 검색은 규칙 기반으로 늘 동작한다. legal_risk.assess() 가
점수 하한 없이 상위 5건을 붙이므로 매칭 미탐지 건에도 판례가 채워진다.
한 줄에 뭉쳐 두면 모순으로 읽혀 판례 검색과 법적 판단을 분리해 적었다.

원문이 담긴 산출물은 gitignore 로 제외한다. 필요하면 위 스크립트로
코퍼스에서 다시 뽑을 수 있어 저장소에 영구 보존할 이유가 없다.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-09-03 09:49:50 +09:00

58 lines
1.1 KiB
Plaintext

# 환경 / 키 (민감) — 절대 커밋 금지
.env
.env.local
*.key
*.pem
# Python
.venv/
.venv-*/
venv/
__pycache__/
*.pyc
*.pyo
*.egg-info/
.pytest_cache/
.mypy_cache/
.ruff_cache/
# OS / 에디터
.DS_Store
Thumbs.db
.idea/
.vscode/
# 평가 산출물 (재생성 가능)
data/training/*.jsonl
data/training/*.json
data/training/*.csv
data/training/*.xlsx
!data/training/.gitkeep
# 사용자 업로드 자서전 (개인정보) — 샘플 외 제외
data/reference/autobio-*.txt
data/reference/corpus-*.txt
# 운영 원고·인덱스·학습 모델 (서버 볼륨에만 저장)
data/input/
data/runtime/
data/models/
data/life_writing/
*.joblib
# 시각화 리포트 — PNG/MD 함께 보존 (재생성도 가능)
# 로그
*.log
logs/
# Hugging Face 모델 캐시
.cache/
~/.cache/huggingface/
# 원문(개인 자서전 본문)이 담긴 산출물은 저장소에 두지 않는다.
# 필요하면 scripts/extract_suspected_excerpts.py 로 킹서버 코퍼스에서 다시 뽑는다.
reports/excerpts_*.jsonl
reports/침해판별_원문대조_*.xlsx
reports/침해판별_의심건검토_*.xlsx