# Qwen·GPT 자서전 AI 대조문 학습 결과 ## 데이터 - human: 컴북스가 사람 작성으로 확인한 자서전 5,579건 - Qwen: 학습 적합 대조문 5,596건 - GPT: OpenAI API로 생성하고 품질 감사를 통과한 대조문 2,018건 - `gpt-4.1-mini`: 998건 - `gpt-4o-mini`: 1,020건 - 결합 데이터: human 5,579 / AI 7,614 = 총 13,193건 - 작성자·소재 `source_group`: 291개, train/validation/test 간 교차 0건 - 분할: train 9,181 / validation 1,951 / test 2,061 GPT 생성 시 외부 API에는 자서전 원문을 보내지 않았다. 익명 소재의 자서전 제목과 에피소드 제목만 사용했으며, 결과는 길이·한글 비율·지시문 누출·인사말·완전 중복 품질 검사를 거쳤다. ## 후보 비교와 선택 길이 특징을 제외한 로지스틱 회귀와 비선형 HGB 모델을 비교했다. HGB가 GPT를 포함한 다중 생성기에서 더 높은 재현율을 보여 운영 모델로 선택됐다. | 모델 | Test AUROC | FPR | Precision | Recall | High precision | High recall | |---|---:|---:|---:|---:|---:|---:| | 로지스틱 회귀 | 0.9957 | 0.0165 | 0.9881 | 0.9580 | 0.9978 | 0.7479 | | HGB(선택) | 0.9965 | 0.0283 | 0.9803 | 0.9835 | 0.9955 | 0.9077 | HGB 임계값은 validation human 기준으로 산출했다. - low/medium 임계값: 0.6193 (목표 FPR 5%) - medium/high 임계값: 0.9645 (목표 FPR 1%) - test `high` FPR: 0.0059 ## 생성기별 테스트 결과 | 생성기 | 테스트 수 | Medium 이상 | High | |---|---:|---:|---:| | Qwen3.8-27B | 884 | 98.76% | 92.99% | | GPT-4.1 mini | 155 | 98.06% | 80.00% | | GPT-4o mini | 175 | 96.57% | 89.14% | | Human | 847 | 2.83% | 0.59% | 운영 버전: `hgb-nolen-kf-ko-v1-Qwen3.8-27B-gpt-4.1-mini-gpt-4o-mini-Korean-autobiography-v2-auroc0.997` ## 운영 확인 - `/v1/health`: `ai_model_ready=true` - GPT-4.1 mini 스모크: `high`, 0.9996 - GPT-4o mini 스모크: `high`, 0.9985 - Qwen3.8-27B 스모크: `high`, 0.9993 - human 스모크: `low`, 0.0002 이 결과는 Qwen 및 위 두 GPT 모델의 한국어 자서전형 생성문 범위에 대한 검증이다. Claude, Gemini, AI 윤문·혼합 문장과 범위 밖 장르의 일반화는 아직 검증되지 않았다. AI 작성 확정 판정이 아니라 사람 검토 우선순위 신호로만 사용한다.