설정이 .env(시크릿)+toml(설정)로 갈려 있던 것을 config.local.toml 하나로 통합. DB 비번이 이미 toml 에 있어 분리 기준이 임의적이었고, backend(하우스 패턴)도 toml 단일이라 일관성 확보. 환경별로 바뀌는 값(DB_HOST 등)만 env override 유지. - config_models: NaverConfig(keys 로테이션)·OpenAIConfig·DecodoConfig 추가 - server_configs: 3개 로드, load_dotenv 제거(python-dotenv 의존성도 제거) - proxy/naver/similarity/keyword/worker_main: os.environ → config 객체 참조 - config.local.toml.example: [NaverConfig]/[OpenAIConfig]/[DecodoConfig] 섹션 - .env/.env.example 삭제, README/주석 갱신 (배포는 toml 마운트 or env override) - tests: DecodoConfig 기반으로 갱신 → 전체 44/44 Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
69 lines
3.2 KiB
Python
69 lines
3.2 KiB
Python
"""AI 유사도 판정 — 검색 결과가 '찾는 상품과 동일한 상품'인지 OpenAI 로 판별.
|
|
|
|
파이프라인(이상치 제거 뒤, top-N 앞) 슬롯에 결합한다. 규칙 고정 파싱이 취약한 문제를
|
|
LLM 판단으로 대체 — 액세서리/호환부품/다른 상품/명백히 다른 규격을 걸러 최저가 오염을 막는다.
|
|
structured output(Pydantic)으로 정규식 파싱 없이 안정적으로 결과를 받는다.
|
|
"""
|
|
|
|
from openai import AsyncOpenAI
|
|
from pydantic import BaseModel, Field
|
|
|
|
from common.logger import LOG
|
|
from config.server_configs import openai_config
|
|
from services.search.contract import NormalizedProduct
|
|
|
|
_SYSTEM = (
|
|
"너는 최저가 비교 시스템의 상품 매칭기다. 검색 결과 후보가 '찾는 상품과 동일한 상품'인지 판별하라.\n"
|
|
"규칙:\n"
|
|
"- 액세서리·호환부품·부속품(빨대마개·뚜껑·커버·거치대·스트랩·보호필름 등)은 불일치(false).\n"
|
|
"- 다른 종류/브랜드/모델은 불일치. 모델명이 주어지면 모델 일치를 우선한다.\n"
|
|
"- 용량·규격이 명백히 다르면 불일치.\n"
|
|
"- 판매자·색상·포장(개수/박스)·사은품 차이는 동일 상품으로 본다.\n"
|
|
"- 확신이 낮으면 score 를 낮게 준다."
|
|
)
|
|
|
|
|
|
class Judgment(BaseModel):
|
|
index: int = Field(description="후보 번호(1부터)")
|
|
is_match: bool = Field(description="찾는 상품과 동일 상품이면 true")
|
|
score: int = Field(description="동일 확신도 0~100")
|
|
|
|
|
|
class JudgmentList(BaseModel):
|
|
judgments: list[Judgment]
|
|
|
|
|
|
class SimilarityJudge:
|
|
def __init__(self, model: str | None = None, api_key: str | None = None):
|
|
self._model = model or openai_config.model
|
|
self._client = AsyncOpenAI(api_key=api_key or openai_config.api_key)
|
|
|
|
async def judge(self, target: dict, candidates: list[NormalizedProduct]) -> list[Judgment]:
|
|
"""후보별 동일상품 여부 판정. candidates 와 같은 순서/길이로 Judgment 리스트 반환."""
|
|
if not candidates:
|
|
return []
|
|
|
|
lines = "\n".join(f"{i + 1}. {c.name} ({c.price}원)" for i, c in enumerate(candidates))
|
|
user = (
|
|
f"[찾는 상품]\n"
|
|
f"상품명: {target.get('product_name', '')}\n"
|
|
f"모델: {target.get('model', '')}\n"
|
|
f"규격: {target.get('specification', '')}\n"
|
|
f"제조사/브랜드: {target.get('company', '')}\n\n"
|
|
f"[검색 결과 후보]\n{lines}\n\n"
|
|
f"각 후보가 찾는 상품과 동일 상품인지 index 별로 판별하라."
|
|
)
|
|
|
|
resp = await self._client.beta.chat.completions.parse(
|
|
model=self._model,
|
|
messages=[{"role": "system", "content": _SYSTEM}, {"role": "user", "content": user}],
|
|
response_format=JudgmentList,
|
|
temperature=0,
|
|
)
|
|
parsed = resp.choices[0].message.parsed
|
|
by_idx = {j.index: j for j in (parsed.judgments if parsed else [])}
|
|
# 누락된 후보는 보수적으로 불일치 처리
|
|
out = [by_idx.get(i + 1, Judgment(index=i + 1, is_match=False, score=0)) for i in range(len(candidates))]
|
|
LOG.d(f"[ai] 판정 {len(candidates)}건 중 매칭 {sum(1 for j in out if j.is_match)}건")
|
|
return out
|