o2o-plagiarism-ai/docs/AI_TRAINING_RESULT_20260821.md

1.6 KiB

Qwen3.8-27B 자서전 AI 대조문 학습 결과

데이터

  • human: 컴북스가 사람 작성으로 확인한 자서전 5,579건
  • AI: King RTX 3090 2장에서 Qwen3.8-27B GGUF로 생성한 5,600건
  • AI 품질 감사: 중복 0, 프롬프트 누출 0, 지시형 인사말 1건 제외
  • 학습 결합: human 5,579 / AI 5,598 = 11,177건
  • 작성자 source_group: 291개, train/val/test 간 교차 0건
  • 분할: train 7,785 / validation 1,661 / test 1,731

AI 1건은 품질 감사를 통과했지만 200자 학습 최소길이에 달하지 못해 결합 단계에서 제외됐다.

모델 비교

모델 Test AUROC AUPRC FPR Precision Recall
로지스틱, 길이 특징 제외 0.9976 0.9972 0.0177 0.9830 0.9796
로지스틱, 길이 특징 포함 0.9979 0.9979 0.0165 0.9841 0.9819

차이가 AUROC 0.0003이므로 길이가 주요 구분 근거가 아니다. 운영에는 일반화 위험을 낮추기 위해 길이 특징 제외 모델을 선택했다.

운영 임계값과 한계

  • low/medium 임계값: 0.6635 (validation human FPR 목표 5%)
  • medium/high 임계값: 0.9766 (validation human FPR 목표 1%)
  • test high 정밀도: 0.9974, test high FPR: 0.0024
  • 운영 버전: logreg-nolen-kf-ko-v1-qwen3.8-27b-autobiography-v1-auroc0.998

이 수치는 Qwen3.8-27B와 보유 human 자서전을 구분한 결과다. Claude, GPT, Gemini 등 미학습 생성기에 대한 일반화는 검증되지 않았다. API는 이 학습 범위를 note에 노출하며, 점수는 저자 조치나 AI 작성 확정 근거로 쓰지 않는다.