2.3 KiB
2.3 KiB
Qwen·GPT 자서전 AI 대조문 학습 결과
데이터
- human: 컴북스가 사람 작성으로 확인한 자서전 5,579건
- Qwen: 학습 적합 대조문 5,596건
- GPT: OpenAI API로 생성하고 품질 감사를 통과한 대조문 2,018건
gpt-4.1-mini: 998건gpt-4o-mini: 1,020건
- 결합 데이터: human 5,579 / AI 7,614 = 총 13,193건
- 작성자·소재
source_group: 291개, train/validation/test 간 교차 0건 - 분할: train 9,181 / validation 1,951 / test 2,061
GPT 생성 시 외부 API에는 자서전 원문을 보내지 않았다. 익명 소재의 자서전 제목과 에피소드 제목만 사용했으며, 결과는 길이·한글 비율·지시문 누출·인사말·완전 중복 품질 검사를 거쳤다.
후보 비교와 선택
길이 특징을 제외한 로지스틱 회귀와 비선형 HGB 모델을 비교했다. HGB가 GPT를 포함한 다중 생성기에서 더 높은 재현율을 보여 운영 모델로 선택됐다.
| 모델 | Test AUROC | FPR | Precision | Recall | High precision | High recall |
|---|---|---|---|---|---|---|
| 로지스틱 회귀 | 0.9957 | 0.0165 | 0.9881 | 0.9580 | 0.9978 | 0.7479 |
| HGB(선택) | 0.9965 | 0.0283 | 0.9803 | 0.9835 | 0.9955 | 0.9077 |
HGB 임계값은 validation human 기준으로 산출했다.
- low/medium 임계값: 0.6193 (목표 FPR 5%)
- medium/high 임계값: 0.9645 (목표 FPR 1%)
- test
highFPR: 0.0059
생성기별 테스트 결과
| 생성기 | 테스트 수 | Medium 이상 | High |
|---|---|---|---|
| Qwen3.8-27B | 884 | 98.76% | 92.99% |
| GPT-4.1 mini | 155 | 98.06% | 80.00% |
| GPT-4o mini | 175 | 96.57% | 89.14% |
| Human | 847 | 2.83% | 0.59% |
운영 버전:
hgb-nolen-kf-ko-v1-Qwen3.8-27B-gpt-4.1-mini-gpt-4o-mini-Korean-autobiography-v2-auroc0.997
운영 확인
/v1/health:ai_model_ready=true- GPT-4.1 mini 스모크:
high, 0.9996 - GPT-4o mini 스모크:
high, 0.9985 - Qwen3.8-27B 스모크:
high, 0.9993 - human 스모크:
low, 0.0002
이 결과는 Qwen 및 위 두 GPT 모델의 한국어 자서전형 생성문 범위에 대한 검증이다. Claude, Gemini, AI 윤문·혼합 문장과 범위 밖 장르의 일반화는 아직 검증되지 않았다. AI 작성 확정 판정이 아니라 사람 검토 우선순위 신호로만 사용한다.