o2o-site-AEO/solution/backend/services/external/perplexity.py
Mina Choi 9d25ed613e 구조: 사장님(solution)과 내부 운영(admin)을 두 앱으로 가른다
최상단을 프로젝트 단위로 평평하게 둔다 — o2o-negosium 과 같은 규약이고, 이 레포만
다르게 갈 이유가 없다. negodata/{backend,front} 가 프로젝트 안에서 f/b 를 가르는 선례,
lps-admin/ 이 백엔드 없이 프론트만 가진 최상단 폴더의 선례다.

  backend/ frontend/{admin,site,shared}  →  solution/{backend,front,site,shared} + admin/

## 왜

내부 라우트(/local-content, /places/:id/seo)의 이름과 화면 코드가 사장님 번들에
그대로 실려 나가고 있었다. UserRole.DEVELOPER 주석의 "고객사에 존재를 노출하지 않는다"를
번들이 깨고 있었다 — 라우트 가드는 화면을 가리지 번들은 못 가린다.
번들을 갈라 확인했다: 사장님 dist 에서 local-content · /places · SeoAudit 이 전부 0건이다.

그 과정에서 두 곳이 더 새고 있었다.
- AppShell 의 NAV 배열이 내부 메뉴를 하드코딩하고 있었다. 앱을 가른 뒤에도 dist 에
  local-content 가 남아서 찾았다. 메뉴는 이제 앱이 prop 으로 들고 온다.
- EditorHeader·BuilderPage·LoginPage 가 /places 로 링크하고 있었다. 그 화면이 admin 으로
  나갔으니 사장님 앱에서는 404 다. 링크를 걷어내고 LoginPage 기본 도착지는 '/' 로 바꿨다
  (앱마다 홈이 다르고 각 라우터의 '/' 가 이미 그걸 안다).

## admin 에 백엔드를 두지 않았다

내부 화면이 부르는 훅이 전부 router/v1/{place,fact,local,validator} 에 이미 있다.
자체 백엔드를 두면 place·fact·link 를 같은 DB 에 대고 두 번 구현하게 된다.
대가는 solution/backend 가 죽으면 admin 도 멈추는 것 — 내부 도구라 감수한다.

## admin 의 `@` 는 solution/front/src 를 가리킨다

내부 화면이 쓰는 API 클라이언트·UI·수집 배선이 solution 에 한 벌만 있고 그 파일들끼리도
`@/...` 로 서로를 부른다. admin 에서 `@` 를 자기 src 로 잡으면 그 참조가 전부 깨진다
(실측 TS2307 14건). 복제하는 길도 있지만 RecollectPanel 주석이 금지한다 —
"수집 경로를 두 벌 만들면 확정 게이트"가 갈라진다.
admin 자기 파일만 `@admin` 이고, 의존 방향은 admin → solution 한 쪽뿐이다.

admin 이 여는 빌더는 다른 오리진이라 절대 URL + 새 탭이다(admin/src/lib/solutionUrl.ts).
react-router Link 로 두면 admin 안에서 라우트를 찾다 404 다.

## 그 밖

- npm 워크스페이스 루트를 레포 루트로 올렸다(admin 이 solution 밖이라).
- docker-compose 를 255→174줄로 줄이고 admin(:3002) 서비스를 넣었다. ADMIN_BIND 기본값은
  127.0.0.1 — 0.0.0.0 으로 열면 앱을 가른 의미가 없다.
- 발행 호스트를 프론트 .env 에 따로 적지 않는다. compose 가 루트의 SITE_PUBLIC_HOST 를
  VITE_PUBLISH_HOST 로 흘려보낸다 — 두 곳에 적으면 canonical 과 화면 주소가 조용히 갈라진다.
- nginx/site.conf 를 git 에서 빼고 .example 만 남겼다(.env·*.toml 과 같은 규약).
  compose 가 bind mount 하므로 클론 직후 복사해야 한다 — 없으면 Docker 가 그 자리에
  디렉토리를 만들어 nginx 가 설정 없이 뜬다.
- config.test.toml.example 을 추가했다. 없으면 클론한 사람이 pytest 를 아예 못 돌린다
  (conftest import 단계에서 죽는다). 외부 API 키는 전부 빈값이다 —
  APP_ENV=test 가 .env 를 안 읽는 이유를 여기서 우회하면 안 된다.
- 경로가 한 칸 깊어져 test_schema_ddl(parents[2]→[3]) 과 test_site_theme 을 고쳤다.

검증: front·admin·site 전부 lint 0 / build 0. 백엔드 514 passed.
남은 4건(test_build_publish 3 · test_snapshot 1)은 이 변경 전부터 실패하던 것으로,
손대지 않은 메인 체크아웃에서 같은 4건이 같게 실패하는 것을 확인했다.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_019uYhHQdssRubirPirrdJJC
2026-08-31 15:12:09 +09:00

144 lines
5.9 KiB
Python

"""채널 URL 발견 — 겹들을 엮어 결과를 만드는 자리.
이 파일이 하는 일은 **엮는 것뿐**이다. 고칠 것이 생기면 해당 겹으로 바로 간다:
무엇을 묻는가 services/prompts/channel_discovery.py 프롬프트·응답 스키마
어떻게 부르는가 services/llm/perplexity.py HTTP·타임아웃·인증
답을 믿을 것인가 services/grounding/channels.py 채널 판정·상세 페이지 필터
무엇을 돌려주는가 여기 호출 → 필터 → 결과 조립
★ Perplexity 응답을 **사실로 쓰지 않는다.** 산출물은 "여기를 보라"는 URL 포인터일 뿐이고,
사실은 그 URL 을 크롤링해 얻는다. 원문(raw)은 감사·환각 추적용으로 통째로 박제한다.
"""
from dataclasses import dataclass, field
import httpx
from common.logger import LOG
from services.grounding.channels import (
DiscoveredLink,
classify_url,
collect_links,
filter_links,
search_count,
)
from services.llm.perplexity import (
DEFAULT_MAX_TOKENS,
DEFAULT_MODEL,
DEFAULT_TIMEOUT,
PerplexityError,
PerplexityNotConfigured,
call,
is_configured,
)
from services.prompts.channel_discovery import RESPONSE_SCHEMA, SYSTEM_PROMPT, build_prompt
# 후기 유입을 막기 위해 공식 채널 도메인만 검색한다.
SEARCH_DOMAIN_FILTER = [
"yanolja.com",
"goodchoice.kr",
"place.naver.com",
"map.naver.com",
"naver.me",
]
# 이 횟수를 넘으면 프롬프트·도메인 필터를 의심한다 — 검색 요금은 토큰 요금과 별도다.
SEARCH_COUNT_WARN_THRESHOLD = 8
@dataclass
class ChannelDiscovery:
"""채널 발견 결과.
links : 상세 페이지로 판정돼 살아남은 후보 URL. 동일 업소 검증을 통과해야 크롤링 대상이 된다
raw : 응답 원문(본문 + search_results). place_links.raw 에 통째로 박제한다
search_count : 이번 호출에서 발생한 검색 횟수 — **검색 요금이 토큰 요금과 별도**라 추적한다
filtered_out : 걸러낸 URL 과 사유 [(url, reason), ...].
★ 조용히 버리지 않는다 — 운영자가 "왜 이 URL 이 빠졌나"를 볼 수 있어야
필터가 과했는지(진짜 채널을 버렸는지) 판단할 수 있다
"""
links: list[DiscoveredLink] = field(default_factory=list)
raw: dict = field(default_factory=dict)
search_count: int = 0
filtered_out: list[tuple[str, str]] = field(default_factory=list)
def reason_counts(self) -> dict[str, int]:
"""탈락 사유별 건수. 로그·운영 화면에서 쓴다."""
counts: dict[str, int] = {}
for _url, reason in self.filtered_out:
counts[reason] = counts.get(reason, 0) + 1
return counts
async def discover_channels(
name: str,
address: str | None = None,
category_hint: str | None = None,
*,
model: str = DEFAULT_MODEL,
include_blogs: bool = False,
client: httpx.AsyncClient | None = None,
) -> ChannelDiscovery:
"""상호명으로 채널 URL 후보를 찾는다. **URL 발견 전용 — 답변을 사실로 쓰지 마라.**
돌려주는 URL 은 아직 '이 가게의 것'이라는 보장이 없다. 동일 업소 검증을 통과해
확정(place_links.confirmed_at)된 URL 만 크롤링 대상이 된다.
발견된 URL 중 **상세 페이지가 아닌 것(루트·목록·SEO 랜딩)과 블로그는 걸러낸다.**
걸러낸 목록은 `filtered_out` 에 사유와 함께 남는다 — 조용히 버리지 않는다.
args:
include_blogs : 블로그·카페 URL 도 후보로 남길지. **기본 False** —
블로그는 채널이 아니라 후기라 크롤링해도 공식 정보가 아니다
raises:
PerplexityNotConfigured : 키 미설정(이 어댑터만 비활성)
PerplexityError : 타임아웃·5xx·응답 파싱 불가
"""
if not (name or "").strip():
raise PerplexityError("상호명이 비어 있다")
body = {
"model": model,
"messages": [
{
"role": "system",
"content": SYSTEM_PROMPT,
},
{"role": "user", "content": build_prompt(name, address, category_hint)},
],
"max_tokens": DEFAULT_MAX_TOKENS,
"temperature": 0, # URL 수집이라 창의성이 해롭다
"response_format": RESPONSE_SCHEMA,
"search_domain_filter": SEARCH_DOMAIN_FILTER, # ★ 야놀자·여기어때·네이버로 한정
}
payload = await call(body, client=client)
found, dropped_raw = collect_links(payload)
links, dropped_quality = filter_links(found, include_blogs)
filtered_out = dropped_raw + dropped_quality
searches = search_count(payload)
result = ChannelDiscovery(
links=links, raw=payload, search_count=searches, filtered_out=filtered_out
)
# 내부 검색 횟수는 품질·지연 관측값이다. Sonar 과금은 토큰 + 요청 컨텍스트 요금이다.
usage = payload.get("usage") or {}
reasons = result.reason_counts()
reason_text = " ".join(f"{k}{v}" for k, v in sorted(reasons.items())) or "없음"
LOG.i(
f"[perplexity] '{name}' 검색={searches}회 발견={len(found)} 통과={len(links)} "
f"탈락={len(filtered_out)}({reason_text}) tokens={usage.get('total_tokens', '?')}"
)
if searches > SEARCH_COUNT_WARN_THRESHOLD:
LOG.w(
f"[perplexity] 검색 {searches}회 — 기준({SEARCH_COUNT_WARN_THRESHOLD}회) 초과. "
f"지연·오탐 후보가 늘 수 있으니 도메인 필터·프롬프트를 확인하라"
)
# raw 는 응답 전체를 그대로 둔다 — 나중에 환각 추적에 쓴다(사실 근거로는 쓰지 않는다).
return result