From d5e0f4346d5c26b56189cfe187a3822a95feefcd Mon Sep 17 00:00:00 2001 From: hbyang Date: Tue, 25 Aug 2026 13:42:23 +0900 Subject: [PATCH] =?UTF-8?q?docs:=20GPT=20=ED=99=95=EC=9E=A5=20AI=20?= =?UTF-8?q?=ED=83=90=EC=A7=80=20=ED=95=99=EC=8A=B5=20=EA=B2=B0=EA=B3=BC=20?= =?UTF-8?q?=EA=B8=B0=EB=A1=9D?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- docs/AI_TRAINING_RESULT_20260825.md | 56 +++++++++++++++++++++++++++++ docs/API_SPEC_BAIKAL.md | 4 +-- docs/RECEIVED_DATA_PIPELINE.md | 4 +++ 3 files changed, 62 insertions(+), 2 deletions(-) create mode 100644 docs/AI_TRAINING_RESULT_20260825.md diff --git a/docs/AI_TRAINING_RESULT_20260825.md b/docs/AI_TRAINING_RESULT_20260825.md new file mode 100644 index 0000000..6c7f238 --- /dev/null +++ b/docs/AI_TRAINING_RESULT_20260825.md @@ -0,0 +1,56 @@ +# Qwen·GPT 자서전 AI 대조문 학습 결과 + +## 데이터 + +- human: 컴북스가 사람 작성으로 확인한 자서전 5,579건 +- Qwen: 학습 적합 대조문 5,596건 +- GPT: OpenAI API로 생성하고 품질 감사를 통과한 대조문 2,018건 + - `gpt-4.1-mini`: 998건 + - `gpt-4o-mini`: 1,020건 +- 결합 데이터: human 5,579 / AI 7,614 = 총 13,193건 +- 작성자·소재 `source_group`: 291개, train/validation/test 간 교차 0건 +- 분할: train 9,181 / validation 1,951 / test 2,061 + +GPT 생성 시 외부 API에는 자서전 원문을 보내지 않았다. 익명 소재의 자서전 제목과 +에피소드 제목만 사용했으며, 결과는 길이·한글 비율·지시문 누출·인사말·완전 중복 품질 +검사를 거쳤다. + +## 후보 비교와 선택 + +길이 특징을 제외한 로지스틱 회귀와 비선형 HGB 모델을 비교했다. HGB가 GPT를 포함한 +다중 생성기에서 더 높은 재현율을 보여 운영 모델로 선택됐다. + +| 모델 | Test AUROC | FPR | Precision | Recall | High precision | High recall | +|---|---:|---:|---:|---:|---:|---:| +| 로지스틱 회귀 | 0.9957 | 0.0165 | 0.9881 | 0.9580 | 0.9978 | 0.7479 | +| HGB(선택) | 0.9965 | 0.0283 | 0.9803 | 0.9835 | 0.9955 | 0.9077 | + +HGB 임계값은 validation human 기준으로 산출했다. + +- low/medium 임계값: 0.6193 (목표 FPR 5%) +- medium/high 임계값: 0.9645 (목표 FPR 1%) +- test `high` FPR: 0.0059 + +## 생성기별 테스트 결과 + +| 생성기 | 테스트 수 | Medium 이상 | High | +|---|---:|---:|---:| +| Qwen3.8-27B | 884 | 98.76% | 92.99% | +| GPT-4.1 mini | 155 | 98.06% | 80.00% | +| GPT-4o mini | 175 | 96.57% | 89.14% | +| Human | 847 | 2.83% | 0.59% | + +운영 버전: +`hgb-nolen-kf-ko-v1-Qwen3.8-27B-gpt-4.1-mini-gpt-4o-mini-Korean-autobiography-v2-auroc0.997` + +## 운영 확인 + +- `/v1/health`: `ai_model_ready=true` +- GPT-4.1 mini 스모크: `high`, 0.9996 +- GPT-4o mini 스모크: `high`, 0.9985 +- Qwen3.8-27B 스모크: `high`, 0.9993 +- human 스모크: `low`, 0.0002 + +이 결과는 Qwen 및 위 두 GPT 모델의 한국어 자서전형 생성문 범위에 대한 검증이다. +Claude, Gemini, AI 윤문·혼합 문장과 범위 밖 장르의 일반화는 아직 검증되지 않았다. +AI 작성 확정 판정이 아니라 사람 검토 우선순위 신호로만 사용한다. diff --git a/docs/API_SPEC_BAIKAL.md b/docs/API_SPEC_BAIKAL.md index c8f094b..e07adf0 100644 --- a/docs/API_SPEC_BAIKAL.md +++ b/docs/API_SPEC_BAIKAL.md @@ -103,8 +103,8 @@ "score": 0.02, "is_stub": false, "available": true, - "model_version": "logreg-nolen-kf-ko-v1-qwen3.8-27b-autobiography-v1-auroc0.998", - "note": "한국어 자서전 범위의 검토 우선순위 점수이며 AI 작성 확정 판정이 아님" + "model_version": "hgb-nolen-kf-ko-v1-Qwen3.8-27B-gpt-4.1-mini-gpt-4o-mini-Korean-autobiography-v2-auroc0.997", + "note": "Qwen·GPT 한국어 자서전 범위의 검토 우선순위 점수이며 AI 작성 확정 판정이 아님" }, "matches": [], "extracted_elements": { diff --git a/docs/RECEIVED_DATA_PIPELINE.md b/docs/RECEIVED_DATA_PIPELINE.md index 9e3b4d6..3662787 100644 --- a/docs/RECEIVED_DATA_PIPELINE.md +++ b/docs/RECEIVED_DATA_PIPELINE.md @@ -40,6 +40,10 @@ human 데이터만으로는 이진 AI 생성 판별기를 학습할 수 없다. 결합해 길이 특징 제외 모델을 학습·배포했다. 세부 결과는 `AI_TRAINING_RESULT_20260821.md`에 있다. 복수 생성기 일반화 검증은 아직 남아 있다. +2026-08-25에는 원문을 외부로 보내지 않고 익명 제목 메타데이터만 사용해 +`gpt-4.1-mini`와 `gpt-4o-mini` 대조문 2,018건을 추가했다. Qwen·GPT 결합 모델의 +세부 지표와 생성기별 검증 결과는 `AI_TRAINING_RESULT_20260825.md`에 있다. + ## 4. 실행 순서 ```bash