o2o-site-AEO/solution/backend/services/seo_audit.py
민헌 8a09af6599 [feat] solution,postgres-init: FAQ 를 20개까지 채운다 — 펜션 공통 질문 30개 + 문의 안내
COPY 잡은 확인된 fact 로만 FAQ 를 써서 4~8개에서 끝났다(실측 로컬: 스테이머뭄 fact 8건,
산하연 풀빌라 fact 4건 · FAQ 4건). fact 가 0건이면 start_copy 가 FAQ_UNGROUNDED 로 잡을 만들지 않아 0개였다.
생성 상한을 20으로 올리고, 모자라면 펜션 카탈로그에서 겹치지 않는 질문을 **문의 안내** 답으로 채운다.
공통 답에 값·가능 여부를 적으면 업종 시드 FAQ 가 가공의 가격을 사이트에 내보낸 사고와 같다 —
답은 "…은 전화(…)로 문의해 주시면 안내해 드립니다" 뿐이고, 그래서 화면에만 나간다.

- common/faq_catalog(신규): 로더 + resources/pension.json 30문항. fact_keys 가 업종 스키마에 없으면 로드 시 예외
- services/faq_fill.py(신규): 고르기 규칙 — fact 로 답할 수 있는 질문 · 기존 FAQ 와 근거 key 또는 질문 키워드가
  겹치는 질문은 건너뛴다(LLM 은 "주차 및 와이파이" 처럼 묶어 쓰고, 사장님 입력은 근거 key 가 없다)
- copy_service: max_faqs=20, 생성 뒤 _fill_faqs. 근거가 없거나 키가 없으면 LLM 없이 채우기만
- place_service.start_copy: 카탈로그가 있으면 fact 0건이어도 잡 생성(FAQ_UNGROUNDED 는 카탈로그 없는 업종만)
- SourceType.TEMPLATE=5(백엔드·shared·orval 모델). fact_service 규칙 4 로 fact 에는 못 쓴다
- faq_crud.expire_generated: TEMPLATE 도 재생성 때 내린다 — 새 fact 로 답이 생긴 주제에 옛 문의 안내가 남지 않게
- prompts/copy: fact 로 답할 수 있는 카탈로그 질문을 싣고 "한 문항 한 주제" 규칙(생성 FAQ 4건 중 3건이 묶여 있었다)
- shared selectAnsweredFaqs · jsonld · llms · prerender(↔ conftest) · seo_audit: 문의 안내는 FAQPage JSON-LD ·
  llms.txt · 고유 콘텐츠 계수 · FAQ 점수에서 뺀다 — 모든 펜션에 같은 문구라 세면 빈 사이트가 게이트를 통과한다
- site FaqSection: 문의 안내가 섞이면 "모두 사업자가 확인한 내용" 문구를 달지 않는다
- frontend FaqPanel "노출 N건 (문의 안내 M)" · notifyCopy 가 faq_fill 을 본다
- postgres-init: 컬럼 변경 없음(CHECK 없는 SMALLINT). 0012 + init.sql 에 generated_by·source_fact_ids COMMENT ON,
  0012 는 컬럼이 있을 때만(DO $$ IF EXISTS). init.sql 의 "비면 발행 게이트가 반려" 주석은 사실이 아니어서 고쳤다
- docs/DECISIONS.md 8절 · DATA_MODEL.md · DEVLOG.md

백엔드 664 passed(신규 test_faq_fill 10건 · test_copy_api 3건). 실패 2건은 이 변경 전 HEAD 에서도 같다:
test_rate_limit_closes_the_tap · test_사이트_디렉터리_밖의_thumbs_에_올린다
site·frontend·admin tsc 통과 · site vitest 63 passed · FaqPanel·collectNotify eslint 통과
로컬 실사업장(하늘물빛정원, fact 4건): 생성 4건 + 문의 안내 16건 = 20건, 질문 중복 0
0012: 새 DB(init.sql → migrate 규칙)와 로컬 DB 사본 양쪽에서 두 번씩 적용 통과

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_011yLDuinzgyCxmqAutE1tse
2026-09-14 17:05:43 +09:00

112 lines
7.4 KiB
Python

"""발행 사이트 SEO/AEO 준비도 채점.
점수는 검색 순위를 보장하는 외부 공인 점수가 아니라, 우리 빌더가 통제할 수 있는 신호의
완성도다. 같은 입력은 언제나 같은 결과를 내도록 순수 함수로 두어 UI와 발행 흐름이 서로
다른 기준을 말하지 않게 한다.
"""
from dataclasses import dataclass
from common.enums import SourceType
@dataclass(frozen=True)
class AuditCheck:
id: str
group: str
label: str
points: int
earned: int
status: str
detail: str
recommendation: str | None = None
def as_dict(self) -> dict:
return self.__dict__.copy()
def _check(id, group, label, points, passed, detail, recommendation=None, partial=0):
earned = points if passed else min(points, max(0, partial))
status = "pass" if earned == points else ("warn" if earned > 0 else "fail")
return AuditCheck(id, group, label, points, earned, status, detail, recommendation)
def evaluate(snapshot: dict, *, verified: bool, site=None, version=None, ai_checks: list | None = None) -> dict:
place = snapshot.get("place") or {}
facts = snapshot.get("facts") or []
# 문의 안내(TEMPLATE)는 답이 아니다 — "질문형 FAQ" 에 세면 채우기만으로 만점이 난다.
faqs = [q for q in (snapshot.get("faqs") or []) if q.get("generated_by") != SourceType.TEMPLATE.value]
media = snapshot.get("media") or []
built = bool(version and getattr(version, "built_at", None))
unique_count = int(getattr(version, "unique_content_count", 0) or 0) if version else 0
domain = (getattr(site, "domain", None) or "").strip() if site else ""
fact_count = len([f for f in facts if str(f.get("value") or "").strip()])
sourced = len([f for f in facts if f.get("source_url") or f.get("verified_at")])
image_with_alt = len([m for m in media if str(m.get("alt_text") or "").strip()])
seo = [
_check("built", "기술 SEO", "정적 HTML 빌드", 15, built,
"크롤러가 자바스크립트 없이 읽을 수 있는 발행본이 있습니다." if built else "아직 빌드된 정적 발행본이 없습니다.",
"사이트를 빌드·발행하세요."),
_check("domain", "기술 SEO", "고유 주소와 canonical", 10, bool(domain),
f"고유 주소 {domain}이 canonical 기준이 됩니다." if domain else "고유 사이트 주소가 정해지지 않았습니다.",
"발행 전 사이트 주소를 확정하세요."),
_check("machine_files", "기술 SEO", "robots·sitemap·구조화 데이터", 15, built,
"robots.txt, sitemap.xml, JSON-LD가 발행본에 포함됩니다." if built else "기계용 파일은 빌드 시 생성됩니다.",
"빌드를 완료해 기계용 파일을 생성하세요."),
_check("address", "콘텐츠 SEO", "주소", 8, bool(place.get("road_address") or place.get("address")),
"지역 검색에 사용할 주소가 있습니다." if place.get("road_address") or place.get("address") else "주소가 없습니다.",
"도로명 주소를 확인하세요."),
_check("phone", "콘텐츠 SEO", "전화번호", 7, bool(place.get("phone")),
"전화 문의 답변에 사용할 번호가 있습니다." if place.get("phone") else "전화번호가 없습니다.",
"공식 전화번호를 등록하세요."),
_check("facts", "콘텐츠 SEO", "고유 정보량", 15, fact_count >= 8,
f"확인된 사업장 정보가 {fact_count}건입니다.", "영업시간·가격·시설 등 확인된 정보를 8건 이상 채우세요.",
partial=min(10, fact_count)),
_check("images", "콘텐츠 SEO", "설명 있는 이미지", 10, image_with_alt >= 3,
f"alt 설명이 있는 이미지가 {image_with_alt}장입니다.", "대표·내부·상품 사진을 3장 이상 승인하세요.",
partial=min(6, image_with_alt * 2)),
_check("unique", "신뢰·품질", "고유 콘텐츠", 10, unique_count > 0,
f"최근 빌드의 고유 콘텐츠 판정은 {unique_count}건입니다." if version else "고유 콘텐츠를 판정할 빌드가 없습니다.",
"복제 문구가 아닌 사업장 고유 소개·FAQ·사진을 추가하세요."),
_check("verified", "신뢰·품질", "동일 업소 검증", 10, verified,
"공식 사업장으로 검증되었습니다." if verified else "동일 업소 검증 전입니다.", "사업장 검증을 완료하세요."),
]
aeo = [
_check("entity", "엔티티", "사업장 엔티티 식별", 20, verified and bool(place.get("road_address") or place.get("address")),
"상호와 검증된 주소로 사업장을 명확히 식별합니다." if verified else "사업장 정체성 신호가 부족합니다.",
"사업장을 검증하고 공식 주소를 채우세요."),
_check("geo", "엔티티", "좌표와 지역 문맥", 10, place.get("latitude") is not None and place.get("longitude") is not None,
"좌표를 구조화 데이터에 제공할 수 있습니다." if place.get("latitude") is not None else "좌표가 없습니다.",
"검증된 위도·경도를 등록하세요."),
_check("answers", "답변 가능성", "확인된 사실", 20, fact_count >= 8,
f"AI가 답변에 사용할 확인된 사실이 {fact_count}건입니다.", "고객이 자주 묻는 영업·이용 정보를 보강하세요.",
partial=min(15, fact_count * 2)),
_check("faq", "답변 가능성", "질문형 FAQ", 20, len(faqs) >= 3,
f"발행 가능한 FAQ가 {len(faqs)}건입니다.", "실제 고객 질문과 짧고 단정적인 답변을 3건 이상 승인하세요.",
partial=min(12, len(faqs) * 4)),
_check("llms", "기계 가독성", "JSON-LD·llms.txt", 15, built,
"구조화 데이터와 llms.txt가 생성되었습니다." if built else "빌드 전이라 기계용 요약이 없습니다.",
"사이트를 빌드해 JSON-LD와 llms.txt를 생성하세요."),
_check("sources", "신뢰성", "출처와 검증 시각", 10, fact_count > 0 and sourced == fact_count,
f"확인된 정보 {fact_count}건 중 {sourced}건에 출처 또는 검증 시각이 있습니다.",
"출처가 없는 정보는 사장님 확인을 거쳐 검증 시각을 남기세요.", partial=5 if sourced else 0),
_check("freshness", "신뢰성", "최신 발행본", 5, built,
"최근 빌드 시각을 검색엔진에 제공합니다." if built else "발행 시각 신호가 없습니다.", "변경 내용을 다시 빌드하세요."),
]
ai_checks = ai_checks or []
cited = sum(1 for row in ai_checks if getattr(row, "is_own_site_cited", False))
return {
"seo_score": sum(c.earned for c in seo),
"aeo_score": sum(c.earned for c in aeo),
"overall_score": round((sum(c.earned for c in seo) + sum(c.earned for c in aeo)) / 2),
"checks": [c.as_dict() for c in (*seo, *aeo)],
"summary": {
"facts": fact_count, "faqs": len(faqs), "images_with_alt": image_with_alt,
"built": built, "domain": domain or None,
},
"visibility": {"checks": len(ai_checks), "own_site_cited": cited},
"disclaimer": "준비도 점수이며 검색 순위나 AI 인용을 보장하지 않습니다.",
}