From c5f66eff30d32a1eba39e2bfdbd522afd50fa79f Mon Sep 17 00:00:00 2001 From: hbyang Date: Fri, 21 Aug 2026 09:10:41 +0900 Subject: [PATCH] =?UTF-8?q?docs:=20Qwen=20=EB=8C=80=EC=A1=B0=EB=AC=B8=20?= =?UTF-8?q?=ED=95=99=EC=8A=B5=EA=B3=BC=20=EC=9A=B4=EC=98=81=20=EA=B2=B0?= =?UTF-8?q?=EA=B3=BC=20=EA=B8=B0=EB=A1=9D?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- .gitignore | 1 + docs/AI_TRAINING_RESULT_20260821.md | 34 +++++++++++++++++++++++++++++ docs/PHASE2_PROGRESS.md | 2 ++ docs/RECEIVED_DATA_PIPELINE.md | 9 ++++++-- 4 files changed, 44 insertions(+), 2 deletions(-) create mode 100644 docs/AI_TRAINING_RESULT_20260821.md diff --git a/.gitignore b/.gitignore index 94f6c6d..fc53583 100644 --- a/.gitignore +++ b/.gitignore @@ -26,6 +26,7 @@ Thumbs.db data/training/*.jsonl data/training/*.json data/training/*.csv +data/training/*.xlsx !data/training/.gitkeep # 사용자 업로드 자서전 (개인정보) — 샘플 외 제외 diff --git a/docs/AI_TRAINING_RESULT_20260821.md b/docs/AI_TRAINING_RESULT_20260821.md new file mode 100644 index 0000000..dc4eae0 --- /dev/null +++ b/docs/AI_TRAINING_RESULT_20260821.md @@ -0,0 +1,34 @@ +# Qwen3.8-27B 자서전 AI 대조문 학습 결과 + +## 데이터 + +- human: 컴북스가 사람 작성으로 확인한 자서전 5,579건 +- AI: King RTX 3090 2장에서 Qwen3.8-27B GGUF로 생성한 5,600건 +- AI 품질 감사: 중복 0, 프롬프트 누출 0, 지시형 인사말 1건 제외 +- 학습 결합: human 5,579 / AI 5,598 = 11,177건 +- 작성자 `source_group`: 291개, train/val/test 간 교차 0건 +- 분할: train 7,785 / validation 1,661 / test 1,731 + +AI 1건은 품질 감사를 통과했지만 200자 학습 최소길이에 달하지 못해 결합 단계에서 +제외됐다. + +## 모델 비교 + +| 모델 | Test AUROC | AUPRC | FPR | Precision | Recall | +|---|---:|---:|---:|---:|---:| +| 로지스틱, 길이 특징 제외 | 0.9976 | 0.9972 | 0.0177 | 0.9830 | 0.9796 | +| 로지스틱, 길이 특징 포함 | 0.9979 | 0.9979 | 0.0165 | 0.9841 | 0.9819 | + +차이가 AUROC 0.0003이므로 길이가 주요 구분 근거가 아니다. 운영에는 일반화 위험을 낮추기 +위해 길이 특징 제외 모델을 선택했다. + +## 운영 임계값과 한계 + +- low/medium 임계값: 0.6635 (validation human FPR 목표 5%) +- medium/high 임계값: 0.9766 (validation human FPR 목표 1%) +- test high 정밀도: 0.9974, test high FPR: 0.0024 +- 운영 버전: `logreg-nolen-kf-ko-v1-qwen3.8-27b-autobiography-v1-auroc0.998` + +**이 수치는 Qwen3.8-27B와 보유 human 자서전을 구분한 결과다.** Claude, GPT, Gemini 등 +미학습 생성기에 대한 일반화는 검증되지 않았다. API는 이 학습 범위를 `note`에 +노출하며, 점수는 저자 조치나 AI 작성 확정 근거로 쓰지 않는다. diff --git a/docs/PHASE2_PROGRESS.md b/docs/PHASE2_PROGRESS.md index 96c251e..88be7bc 100644 --- a/docs/PHASE2_PROGRESS.md +++ b/docs/PHASE2_PROGRESS.md @@ -17,6 +17,8 @@ | 2단계 통합 | ✅ 통합 인터페이스 명세 | 바이칼/컴북스 E2E | | 도메인 데이터 적재 | ✅ 533문서·6,331에피소드 드라이런 | 운영 코퍼스 반영 | | 사용자 맞춤형 요약 | ✅ 상세도·강조 옵션 | 요약 정답셋 튜닝 | +| AI 대조문·부가 의심도 | ✅ Qwen 5,600건 생성·모델 배포 | 미학습 생성기 외부검증 | +| ROUGE 라벨링 | ✅ 300건·2인 검수 패킷 생성 | 사람 요약 입력·검수 | ## 2. 구현 산출물 diff --git a/docs/RECEIVED_DATA_PIPELINE.md b/docs/RECEIVED_DATA_PIPELINE.md index f3568a4..9e3b4d6 100644 --- a/docs/RECEIVED_DATA_PIPELINE.md +++ b/docs/RECEIVED_DATA_PIPELINE.md @@ -32,8 +32,13 @@ - 분할: train 3,946 / val 729 / test 904 - 길이: 평균 847.1자; AI 생성 목표는 human 길이 분포에서 표본화 -human 데이터만으로는 이진 AI 생성 판별기를 학습할 수 없다. 다음 단계에서 적어도 -2개 생성 모델로 순수 AI 대조문을 생성하고, 독립된 사람 검토용 세트는 별도 보존한다. +human 데이터만으로는 이진 AI 생성 판별기를 학습할 수 없다. 순수 AI 대조문을 +생성하되 최종 일반화 평가는 적어도 2개 이상의 생성 모델과 독립된 human 검토용 +세트로 수행한다. + +2026-08-21에 King GPU의 Qwen3.8-27B로 5,600건을 생성했고 5,598건을 human과 +결합해 길이 특징 제외 모델을 학습·배포했다. 세부 결과는 +`AI_TRAINING_RESULT_20260821.md`에 있다. 복수 생성기 일반화 검증은 아직 남아 있다. ## 4. 실행 순서