docs: GPT 확장 AI 탐지 학습 결과 기록
This commit is contained in:
parent
16ce1c7d68
commit
d5e0f4346d
56
docs/AI_TRAINING_RESULT_20260825.md
Normal file
56
docs/AI_TRAINING_RESULT_20260825.md
Normal file
@ -0,0 +1,56 @@
|
|||||||
|
# Qwen·GPT 자서전 AI 대조문 학습 결과
|
||||||
|
|
||||||
|
## 데이터
|
||||||
|
|
||||||
|
- human: 컴북스가 사람 작성으로 확인한 자서전 5,579건
|
||||||
|
- Qwen: 학습 적합 대조문 5,596건
|
||||||
|
- GPT: OpenAI API로 생성하고 품질 감사를 통과한 대조문 2,018건
|
||||||
|
- `gpt-4.1-mini`: 998건
|
||||||
|
- `gpt-4o-mini`: 1,020건
|
||||||
|
- 결합 데이터: human 5,579 / AI 7,614 = 총 13,193건
|
||||||
|
- 작성자·소재 `source_group`: 291개, train/validation/test 간 교차 0건
|
||||||
|
- 분할: train 9,181 / validation 1,951 / test 2,061
|
||||||
|
|
||||||
|
GPT 생성 시 외부 API에는 자서전 원문을 보내지 않았다. 익명 소재의 자서전 제목과
|
||||||
|
에피소드 제목만 사용했으며, 결과는 길이·한글 비율·지시문 누출·인사말·완전 중복 품질
|
||||||
|
검사를 거쳤다.
|
||||||
|
|
||||||
|
## 후보 비교와 선택
|
||||||
|
|
||||||
|
길이 특징을 제외한 로지스틱 회귀와 비선형 HGB 모델을 비교했다. HGB가 GPT를 포함한
|
||||||
|
다중 생성기에서 더 높은 재현율을 보여 운영 모델로 선택됐다.
|
||||||
|
|
||||||
|
| 모델 | Test AUROC | FPR | Precision | Recall | High precision | High recall |
|
||||||
|
|---|---:|---:|---:|---:|---:|---:|
|
||||||
|
| 로지스틱 회귀 | 0.9957 | 0.0165 | 0.9881 | 0.9580 | 0.9978 | 0.7479 |
|
||||||
|
| HGB(선택) | 0.9965 | 0.0283 | 0.9803 | 0.9835 | 0.9955 | 0.9077 |
|
||||||
|
|
||||||
|
HGB 임계값은 validation human 기준으로 산출했다.
|
||||||
|
|
||||||
|
- low/medium 임계값: 0.6193 (목표 FPR 5%)
|
||||||
|
- medium/high 임계값: 0.9645 (목표 FPR 1%)
|
||||||
|
- test `high` FPR: 0.0059
|
||||||
|
|
||||||
|
## 생성기별 테스트 결과
|
||||||
|
|
||||||
|
| 생성기 | 테스트 수 | Medium 이상 | High |
|
||||||
|
|---|---:|---:|---:|
|
||||||
|
| Qwen3.8-27B | 884 | 98.76% | 92.99% |
|
||||||
|
| GPT-4.1 mini | 155 | 98.06% | 80.00% |
|
||||||
|
| GPT-4o mini | 175 | 96.57% | 89.14% |
|
||||||
|
| Human | 847 | 2.83% | 0.59% |
|
||||||
|
|
||||||
|
운영 버전:
|
||||||
|
`hgb-nolen-kf-ko-v1-Qwen3.8-27B-gpt-4.1-mini-gpt-4o-mini-Korean-autobiography-v2-auroc0.997`
|
||||||
|
|
||||||
|
## 운영 확인
|
||||||
|
|
||||||
|
- `/v1/health`: `ai_model_ready=true`
|
||||||
|
- GPT-4.1 mini 스모크: `high`, 0.9996
|
||||||
|
- GPT-4o mini 스모크: `high`, 0.9985
|
||||||
|
- Qwen3.8-27B 스모크: `high`, 0.9993
|
||||||
|
- human 스모크: `low`, 0.0002
|
||||||
|
|
||||||
|
이 결과는 Qwen 및 위 두 GPT 모델의 한국어 자서전형 생성문 범위에 대한 검증이다.
|
||||||
|
Claude, Gemini, AI 윤문·혼합 문장과 범위 밖 장르의 일반화는 아직 검증되지 않았다.
|
||||||
|
AI 작성 확정 판정이 아니라 사람 검토 우선순위 신호로만 사용한다.
|
||||||
@ -103,8 +103,8 @@
|
|||||||
"score": 0.02,
|
"score": 0.02,
|
||||||
"is_stub": false,
|
"is_stub": false,
|
||||||
"available": true,
|
"available": true,
|
||||||
"model_version": "logreg-nolen-kf-ko-v1-qwen3.8-27b-autobiography-v1-auroc0.998",
|
"model_version": "hgb-nolen-kf-ko-v1-Qwen3.8-27B-gpt-4.1-mini-gpt-4o-mini-Korean-autobiography-v2-auroc0.997",
|
||||||
"note": "한국어 자서전 범위의 검토 우선순위 점수이며 AI 작성 확정 판정이 아님"
|
"note": "Qwen·GPT 한국어 자서전 범위의 검토 우선순위 점수이며 AI 작성 확정 판정이 아님"
|
||||||
},
|
},
|
||||||
"matches": [],
|
"matches": [],
|
||||||
"extracted_elements": {
|
"extracted_elements": {
|
||||||
|
|||||||
@ -40,6 +40,10 @@ human 데이터만으로는 이진 AI 생성 판별기를 학습할 수 없다.
|
|||||||
결합해 길이 특징 제외 모델을 학습·배포했다. 세부 결과는
|
결합해 길이 특징 제외 모델을 학습·배포했다. 세부 결과는
|
||||||
`AI_TRAINING_RESULT_20260821.md`에 있다. 복수 생성기 일반화 검증은 아직 남아 있다.
|
`AI_TRAINING_RESULT_20260821.md`에 있다. 복수 생성기 일반화 검증은 아직 남아 있다.
|
||||||
|
|
||||||
|
2026-08-25에는 원문을 외부로 보내지 않고 익명 제목 메타데이터만 사용해
|
||||||
|
`gpt-4.1-mini`와 `gpt-4o-mini` 대조문 2,018건을 추가했다. Qwen·GPT 결합 모델의
|
||||||
|
세부 지표와 생성기별 검증 결과는 `AI_TRAINING_RESULT_20260825.md`에 있다.
|
||||||
|
|
||||||
## 4. 실행 순서
|
## 4. 실행 순서
|
||||||
|
|
||||||
```bash
|
```bash
|
||||||
|
|||||||
Loading…
Reference in New Issue
Block a user