o2o-site-AEO/solution/backend/services/vision_service.py
김성경 dbae2d4f35 [feat] solution/backend: LLM 공급자를 OpenAI 기본값으로 전환, Perplexity 실비용 계측 추가
## 1. Gemini -> OpenAI 공급자 추상화

Gemini 쿼터/인증 실패로 COPY 잡(소개문·FAQ 생성)이 반복 DEAD 되는 걸 보고, 공급자를
OpenAI로 바꾸되 설정 하나로 되돌릴 수 있게 했다.

- services/llm/errors.py·types.py(신규): 공급자 무관 예외·Usage·ImagePart·LlmResult
- services/llm/gemini.py: 기존 call() 은 그대로 두고 generate() 인터페이스 추가
- services/llm/openai.py(신규): OpenAI Chat Completions 구현. 실측(2026-09-16):
  gpt-5.6-luna 는 temperature 커스텀 값을 거부한다("Only the default (1) value is
  supported") — 아예 안 보낸다.
- services/llm/provider.py(신규): LLM_PROVIDER 설정(기본 openai, 모르는 값은 gemini)으로
  둘 중 하나를 고른다.
- gemini_text.py·gemini.py(vision)·gemini_extract.py: 공개 함수 이름은 그대로 두고
  내부만 provider.active() 로 배선 — vision_service.py 등 6개 호출부는 무변경.
  단 model 선택 로직(vision_service.py·copy_steps.py)은 공급자에 맞는 모델명을 고르도록 한 줄씩 고쳤다.
- config_models.py: llm_provider·openai_api_key·openai_text_model·openai_vision_model 추가.

## 2. Perplexity 실비용 계측 추가

OpenAI 전환 김에 실제 발행 파이프라인(스테이,머뭄 기준)을 끝까지 돌려 LLM 비용을 재보니,
services/llm/perplexity.py 에는 애초에 토큰·비용 계측이 없었다. 추가하는 과정에서
실측(2026-09-16, 실제 API 응답): `usage.cost` 는 문서 예시(평평한 숫자)와 달리
`{input_tokens_cost, output_tokens_cost, request_cost, total_cost}` 객체였다 — 그대로
가정하고 배포했다가 지역 이야기 생성(LOCAL_SYNC) 잡이 재시도 3회 후 DEAD 로 떨어지는 걸
라이브에서 확인하고 고쳤다. 어떤 모양이 와도 예외를 던지지 않게 방어했다.

- services/llm/perplexity.py: Usage·read_usage() 추가(usage.cost.total_cost 를 그대로 읽는다
  — 토큰 단가표로 역산하지 않는다. 검색 컨텍스트 요금까지 포함된 진짜 값이라서다)
- external/perplexity.py·place_research.py·story_service.py·itinerary_llm_service.py·
  external/restaurant_discovery.py: 각 호출부에 tokens/비용 로그 추가

실측(스테이,머뭄 1건 발행, 지역 콘텐츠는 캐시): Perplexity $0.050(일정 생성이 절반 이상),
OpenAI $0.019(비전 $0.015 + 소개문·FAQ $0.003 + 가사 $0.0006).

검증: 신규/영향받은 테스트 전부 통과(services/llm 신규 3파일, gemini_extract 최초 HTTP
계층 테스트, perplexity 비용 계측 등). 실 OpenAI/Perplexity API로 사업장 수집→비전→
소개문·FAQ→발행까지 라이브로 왕복 확인.

## 3. site/EssentialInfoSection.tsx

미확인 항목 개수 안내 문구 제거(별도 작업, 스테이징된 상태 그대로 포함).

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-09-16 17:30:11 +09:00

124 lines
5.2 KiB
Python

"""사진 분류 + alt 생성 — VISION 잡이 하는 일.
수집된 사진을 Gemini Vision 에 넘겨 분류 라벨과 alt 텍스트를 받아 media 에 반영한다.
★ 신뢰도가 낮은 항목은 자동 반영하지 않는다. 라벨·alt 는 저장하되(사람이 보고 고칠 재료)
status 는 PENDING_REVIEW 로 남겨 사람 확인 큐에 둔다. 임계값은 설정값 하나로만 판단한다.
★ 사진 20~50장을 한 번에 처리하므로 배치·재시도·부분 실패는 클라이언트가 담당한다.
여기서는 "결과를 어떻게 반영할 것인가"만 판단한다.
"""
import uuid
from common.database.db_session_manager import DB_SESSION_MNG
from common.database.model.models import place_photos, places
from common.enums import DBWRType, ErrorType, MediaStatus, PlaceCategory
from common.logger import LOG
from common.utils.gtime import GTime
from config.server_configs import external_api_config
from crud.media_crud import MediaCRUD
from crud.place_crud import PlaceCRUD
from services.external import gemini
from services.llm import provider
from common.job_errors import PermanentJobError
_media_crud = MediaCRUD()
_place_crud = PlaceCRUD()
class VisionAborted(PermanentJobError):
"""재시도해도 소용없는 중단 — 잡의 last_error 로 남는다."""
async def run_vision(job: dict) -> dict:
"""VISION 잡 핸들러. payload: {place_id, owner_user_id, force?}"""
payload = job["payload"]
place_id = payload["place_id"]
owner_user_id = payload["owner_user_id"]
force = bool(payload.get("force"))
if not gemini.is_configured():
raise VisionAborted("API 키 미설정 — 사진 분석을 할 수 없다")
err, place = await DB_SESSION_MNG.execute_lambda(
places.DBType(),
DBWRType.DB_READ.value,
lambda s: _place_crud.get_place(s, uuid.UUID(owner_user_id), uuid.UUID(place_id)),
)
if err != ErrorType.SUCCESS or place is None:
raise VisionAborted(f"사업장을 찾을 수 없다: {place_id}")
# force 가 아니면 아직 분석 안 된 사진만 — 같은 사진을 다시 태우면 요금만 나간다.
list_err, rows = await DB_SESSION_MNG.execute_lambda(
place_photos.DBType(),
DBWRType.DB_READ.value,
lambda s: _media_crud.list_media(s, uuid.UUID(place_id), unlabeled_only=not force),
)
if list_err != ErrorType.SUCCESS:
raise VisionAborted(f"사진 조회 실패: {list_err.name}")
if not rows:
return {"place_id": place_id, "analyzed": 0, "note": "분석할 사진이 없다"}
# 객실·메뉴 이름을 힌트로 준다 — 라벨이 units 와 같은 어휘로 나오면 매칭이 쉬워진다.
unit_err, unit_rows = await DB_SESSION_MNG.execute_lambda(
place_photos.DBType(),
DBWRType.DB_READ.value,
lambda s: _place_crud.list_units(s, uuid.UUID(place_id)),
)
unit_names = [u.name for u in (unit_rows or [])] if unit_err == ErrorType.SUCCESS else []
unit_by_id = {u.unit_id: u.name for u in (unit_rows or [])} if unit_err == ErrorType.SUCCESS else {}
images = [
gemini.ImageInput(
origin_url=r.origin_url or r.url,
fetch_url=r.url,
unit_name_hint=unit_by_id.get(r.unit_id),
)
for r in rows
]
by_key = {(r.origin_url or r.url): r for r in rows}
threshold = external_api_config.vision_confidence_threshold
active_provider = provider.active()
model = (
external_api_config.openai_vision_model if active_provider.__name__.endswith("openai")
else external_api_config.gemini_vision_model
)
try:
results = await gemini.analyze_images(
images,
category=PlaceCategory(place.category),
unit_names=unit_names,
model=model,
confidence_threshold=threshold,
)
except gemini.GeminiNotConfigured as ex:
raise VisionAborted(str(ex)) from ex
now = GTime.UTC()
stat = {"place_id": place_id, "analyzed": len(rows), "approved": 0, "needs_review": 0, "failed": 0}
for result in results:
row = by_key.get(result.origin_url)
if row is None:
continue
if not result.ok:
# 분석 실패 — 사진은 그대로 두고 사람 확인 큐에 남긴다. 잡을 실패시키지 않는다.
stat["failed"] += 1
continue
# ★ 신뢰도 미달이면 라벨은 저장하되 승인 상태로 올리지 않는다.
approved = not result.needs_review
status = MediaStatus.APPROVED.value if approved else MediaStatus.PENDING_REVIEW.value
run_err, _rc = await DB_SESSION_MNG.execute_lambda_claim(
place_photos.DBType(),
lambda s, r=result, st=status: _media_crud.apply_vision(
s, by_key[r.origin_url].media_id, r.label, r.alt_text, r.confidence, st, now
),
)
if run_err != ErrorType.SUCCESS:
stat["failed"] += 1
continue
stat["approved" if approved else "needs_review"] += 1
LOG.i(f"[vision] place={place_id} {stat['analyzed']}장 → 자동반영 {stat['approved']} · "
f"확인필요 {stat['needs_review']} · 실패 {stat['failed']} (임계값 {threshold})")
return stat