- feature_dqn_policy: ScoreNet(상태+카드특징 → 점수) 학습 정책 (replay+타깃넷) - feature_builder: 이산화 없는 연속 상태 벡터(9) + 테넌트 성향 벡터(5) - dqn_store: numpy 전용 서빙(컨테이너 PyTorch 불필요), DQN_SERVING 플래그, 미지원 테넌트는 Q-table 자동 폴백 - 파이프라인: build_card_embeddings -> train_feature_dqn -> export_dqn_serving(npz) - retrain_from_logs: 실로그 재학습 + OPE(SNIPS) 게이트, 통과 시에만 번들 교체(.prev 백업) - probe_serving_dqn / compare_qtable_vs_dqn: 배포 전 행동 점검 도구 Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
14 lines
306 B
JSON
14 lines
306 B
JSON
{
|
|
"rows": 25,
|
|
"episodes": 4,
|
|
"skipped": {
|
|
"종료행/카드턴 없음(미완결 세션)": 8
|
|
},
|
|
"min_episodes": 1,
|
|
"deployed": false,
|
|
"ope_candidate": 0.9029104414200676,
|
|
"ope_candidate_ess": 1.0,
|
|
"ope_current": 0.9029104414200676,
|
|
"ope_current_ess": 1.0,
|
|
"result": "gate_failed"
|
|
} |