검토자가 침해 여부를 눈으로 판별하려면 원문이 있어야 하고, 어떤 조건으로 걸렸는지 알아야 한다. 두 가지를 워크북에 싣는다. - extract_suspected_excerpts.py: 코퍼스 DB(읽기 전용)에서 질의·상대 원문과 일치 구간을 뽑는다. 킹서버 기본 python 이 3.6 이라 이 파일만 구문을 맞췄다. - '판정 기준' 시트: 3개 OR 조건과 결합유사도 가중치, 조건별 충족 현황 - '원문 대조' 시트: 판정 사유 컬럼으로 각 건이 걸린 조건을 표시 판례 표기도 바로잡는다. USE_LLM_LEGAL_JUDGE=false 는 LLM 법적 판단만 끈 것이고 판례 검색은 규칙 기반으로 늘 동작한다. legal_risk.assess() 가 점수 하한 없이 상위 5건을 붙이므로 매칭 미탐지 건에도 판례가 채워진다. 한 줄에 뭉쳐 두면 모순으로 읽혀 판례 검색과 법적 판단을 분리해 적었다. 원문이 담긴 산출물은 gitignore 로 제외한다. 필요하면 위 스크립트로 코퍼스에서 다시 뽑을 수 있어 저장소에 영구 보존할 이유가 없다. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
58 lines
1.1 KiB
Plaintext
58 lines
1.1 KiB
Plaintext
# 환경 / 키 (민감) — 절대 커밋 금지
|
|
.env
|
|
.env.local
|
|
*.key
|
|
*.pem
|
|
|
|
# Python
|
|
.venv/
|
|
.venv-*/
|
|
venv/
|
|
__pycache__/
|
|
*.pyc
|
|
*.pyo
|
|
*.egg-info/
|
|
.pytest_cache/
|
|
.mypy_cache/
|
|
.ruff_cache/
|
|
|
|
# OS / 에디터
|
|
.DS_Store
|
|
Thumbs.db
|
|
.idea/
|
|
.vscode/
|
|
|
|
# 평가 산출물 (재생성 가능)
|
|
data/training/*.jsonl
|
|
data/training/*.json
|
|
data/training/*.csv
|
|
data/training/*.xlsx
|
|
!data/training/.gitkeep
|
|
|
|
# 사용자 업로드 자서전 (개인정보) — 샘플 외 제외
|
|
data/reference/autobio-*.txt
|
|
data/reference/corpus-*.txt
|
|
|
|
# 운영 원고·인덱스·학습 모델 (서버 볼륨에만 저장)
|
|
data/input/
|
|
data/runtime/
|
|
data/models/
|
|
data/life_writing/
|
|
*.joblib
|
|
|
|
# 시각화 리포트 — PNG/MD 함께 보존 (재생성도 가능)
|
|
|
|
# 로그
|
|
*.log
|
|
logs/
|
|
|
|
# Hugging Face 모델 캐시
|
|
.cache/
|
|
~/.cache/huggingface/
|
|
|
|
# 원문(개인 자서전 본문)이 담긴 산출물은 저장소에 두지 않는다.
|
|
# 필요하면 scripts/extract_suspected_excerpts.py 로 킹서버 코퍼스에서 다시 뽑는다.
|
|
reports/excerpts_*.jsonl
|
|
reports/침해판별_원문대조_*.xlsx
|
|
reports/침해판별_의심건검토_*.xlsx
|