o2o-infinith-backend

Commit Graph

Author	SHA1	Message	Date
Mina Choi	86af23b56d	feat(kpi): 규모별 성장률 공식으로 KPI dashboard 코드 산출 Perplexity Sonar가 KPI target schema 필드를 구조적으로 못 채우는 한계 검증됨 (프롬프트 강화·sonar-pro·sonar-reasoning-pro·hint 주입 다 실패). mockup 7개(irum/grand/o2o/ts/banobagi/wonjin/viewclinic) 역분석으로 추출한 채널 규모별 성장률 공식을 코드에서 결정적으로 산출 → 100% 재현성 확보. - kpi_dashboard.py(신규): _target_multiplier 4단계 + _blog_frequency cadence + 강남언니 리뷰 보수적 multiplier - 8 metric 산출: YouTube 구독자 / Instagram KR·EN 팔로워 / Facebook KR·EN 팔로워 / TikTok 팔로워 / Naver Cafe 회원 / 네이버 블로그 포스팅 빈도 / 강남언니 리뷰 - analysis.py: _build_overrides에서 build_kpi_dashboard 호출, _patch_report에서 LLM 출력 무시하고 코드값 강제 - common/utils.parse_ts: facebook_audit._parse_ts 옮겨 공용화 (FB·블로그 RSS 둘 다 사용). ISO 8601 / epoch / RFC 2822(네이버 RSS) 통합 처리 - report_prompt: kpi_dashboard는 코드 강제 치환 안내 + overall_score는 channel_scores 평균으로 0/null 금지 가드 추가 mockup viewclinic YT 구독자 104K→115K→200K 정확 일치 검증. 라이프사이클 4단계로 같은 raw_data 입력 시 매번 동일 output 보장. Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-06-01 15:45:06 +09:00
Mina Choi	e5a9036e47	fix(report+analysis): Instagram/Facebook Optional 완화 + viewclinic mock 제거 + brand_assets 강제주입 - schemas/report.py: InstagramAccount/InstagramAudit/FacebookPage/FacebookAudit 필드 Optional 완화 (LLM이 page 1·2개 모두 language/label/logo/has_whatsapp 등 빼먹는 케이스 차단) - analysis.py: viewclinic mock 분기(_is_mock, _load_mock_report, _load_mock_plan) 제거 — raw_data 충분 - analysis.py: _build_clinic_snapshot에 brandAssets.logo_images/brand_colors 강제 주입 (LLM 프롬프트 가드 무시하고 null 두는 케이스 차단) - analysis.py: facebook_audit.pages 머지 방식 변경 — LLM 첫 페이지 템플릿 복제 후 코드 patch로 인덱스별 덮어쓰기 (EN(index 1) 드랍 + label/logo 누락 검증 실패 동시 회피) Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-06-01 08:50:35 +09:00
Mina Choi	5dbc7d7ffe	fix(report): ClinicSnapshot/YouTubeAudit/Instagram/Facebook Optional 완화 required로 두면 LLM 응답이나 수집 데이터 누락 시 pydantic ValidationError로 리포트 endpoint 전체가 500으로 죽음. 실제 테스트(청담오라클)에서 LLM이 weekly_view_growth, established 등 10개 필드를 null 반환하는 케이스 확인. - ClinicSnapshot/YouTubeAudit: schemas + models 양쪽 모두 Optional (LLM 입력 검증 + FastAPI 응답 검증 둘 다 통과 필요) - InstagramAccount/InstagramAudit/FacebookPage/FacebookAudit: models만 (인스타·페북 빈 계정/페이지 케이스 대응) - list[T] 필드는 기본값 [] 부여 트레이드오프: 스키마 레벨 데이터 완결성 보장 약화. 운영하며 자주 비는 필드 패턴 보고 collection 단계 보강 필요. Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-05-29 16:42:04 +09:00
Mina Choi	71b605eaa6	Merge branch 'wip/channel-brand-2026-05-29' 채널 확장 + 브랜드 자산 파이프라인을 main에 통합. 신규/주요 변경: - 5채널 외 부가 수집 (틱톡/IG·FB 영문/네이버 카페/카카오톡) — collect_extras.py - 브랜드 자산: 홈페이지 로고 URL + CSS 색상 추출 (color_extractor.py) + Gemini Vision 로고 묘사 (vision.py) - 채널 로고 비교: 공식 로고와 각 채널 프로필 이미지 일치 여부 평가 - 인스타/페북 audit 빌더 분리 (instagram_audit.py, facebook_audit.py) - mock_urls.py: 78개 병원 영문 채널 51건 + 필드 캐노니컬 순서 정규화 - ReportInput/PlanInput 신규 채널 필드 추가 - ChannelBrandingRule literal "missing" → "N/A" teammate eed5772와의 conflict 해결: - ClinicSnapshot/YouTubeAudit: teammate가 신뢰 못하는 필드 제거 (established/years_in_business/price_range/media_appearances/medical_tourism/nearest_station/subscriber_rank) - services/analysis.py: teammate의 _build_clinic_snapshot/_build_youtube_audit/duration helpers + 우리의 _naver_blog_summary 둘 다 보존 - imports: youtube_diagnosis_prompt + build_instagram_accounts/build_facebook_pages 모두 채택 Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-05-29 16:40:21 +09:00
Mina Choi	aff2b2720d	WIP: channel-brand merge + Optional 모델 완화 + collect_extras rename + mock_urls 영문 채널 51건 머지 본체: - 5채널 외 부가 수집(틱톡/IG·FB EN/네이버 카페/카카오톡) - 브랜드 자산/채널 로고 Vision 분석 - ReportInput/PlanInput에 신규 채널 필드 추가 - ChannelBrandingRule literal "missing" → "N/A" 후속 로컬 작업 (분리 커밋 예정): - fix(report): ClinicSnapshot/YouTubeAudit/Instagram/Facebook required→Optional (LLM null 응답 대응) - refactor: enrichment.py → collect_extras.py (네이밍 명확화) - data(mock_urls): 38개 병원 영문 채널 51건 추가 + 78개 필드 캐노니컬 순서 정규화 Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-05-29 16:22:17 +09:00
jaehwang	eed57729d9	clinic_overview , youtube analysis 정리	2026-05-29 16:19:06 +09:00
Mina Choi	56fa2c6238	chore: schema/model 잔여 sync (이전 커밋에 빠진 스키마 필드) - ReportInput / Channels: kakao_talk, naver_cafe 필드 (이전 카카오/카페 채널 커밋 092bfe7 에서 누락) - PlanInput: naver_blog 필드 (이번 네이버 블로그 채널 커밋 `9da285e` 에서 누락) - ChannelBrandingRule literal: "missing" → "N/A" 통일 (이전 missing→N/A 커밋 5f1eee8 에서 누락) Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-05-29 10:46:15 +09:00
Mina Choi	bed5f0c274	chore: TIKTOK_ACTOR 상수 + 수집기 옵저버빌리티 정리 apify.py: 라이브 actor id 들을 모두 모듈 상단 상수로 통일 (TIKTOK_ACTOR 추가). fetch_tiktok_profile 이 raw 문자열 'clockworks~tiktok-scraper' 쓰던 것 정리. 이제 IG_PROFILE / IG_HIGHLIGHTS / FB_PAGES / FB_POSTS / TIKTOK 5개 상수. 수집기 옵저버빌리티 정리: - collect.py: 채널별 done 로그에 붙이던 _summarize (followers/posts 등 데이터 shape inspection) 제거 — production 로그가 아니라 진단용에 가까워 test_raw.py 의 summarize() 로 대신 충분. - enrichment.py / pipeline.py / collect.py: 저레벨 수집기의 timing instrumentation 은 정리. orchestrator 레벨(pipeline 의 stage_times, analysis/market 의 LLM 호출 timing)은 유지. Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-05-29 10:45:23 +09:00
Mina Choi	fa32109658	fix(color_extractor): CSS .logo 패턴 우선순위 + lang/flag noise 필터 강화 문제: JK 성형외과 (jkplastic.com) 처럼 <h1 class="logo"><a>JK PLASTIC</a></h1> 형태로 logo 텍스트만 있고 진짜 이미지는 외부 CSS의 .logo { background-image: url(...) } 로 들어가는 사이트에서, generic <header> 첫 img 패턴이 한국어 깃발(lang-kor.png)을 먼저 잡아 잘못된 로고가 박혔음. 수정: - find_logo_url_in_html 흐름 재정렬: 1) class/id/alt/src 명시 + 부모 class="logo" + 중첩 img (specific) 2) 외부 CSS 의 .logo background-image ← generic 보다 앞으로 (class-based 라 더 specific) 3) <header>/<nav> 첫 img (가장 generic, 잘못 잡힐 위험) - noise 필터 강화: lang-kor / lang-eng / flag / country / icon- / btn- / arrow / prev / next / search 같이 logo 아닌 게 명백한 src 는 모든 단계에서 skip 검증: JK 는 lang-kor.png → logo-color.png 로 정확히 잡힘. Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-05-29 10:45:08 +09:00
Mina Choi	db42805fdb	fix(report): LLM 환각 잠금 — channel mapping 보호 + URL prefix + registry_data brand_inconsistencies 데이터 보호: - 채널-묘사 mapping 을 LLM이 swap·재해석해서 Brand Consistency Map 이 어긋났던 문제 (VIEW 한국페북에 영문 인스타 묘사가 박힌다든가) 해결. - channel_logos.channel_logos[] 의 channel / logo_description / is_official 을 그대로 박을 것 명시. 절대 swap·변형 금지. URL 환각 잠금: - LLM이 'https://www.facebook.com/' 같은 prefix를 raw URL 앞에 붙여서 'https://www.facebook.com/https://facebook.com/THEPS16445998' 같이 깨지던 문제 차단. - "URL prefix 절대 직접 만들지 마세요. 받은 URL = 출력 URL" 강제. registry_data 환각 잠금: - registry_data.website_en 같은 자유 필드를 LLM이 그럴듯하게 ('thepsclinic.com' 같이) 지어내던 문제. "데이터에 없으면 반드시 null" 강제. Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-05-29 10:44:38 +09:00
Mina Choi	9da285e905	feat(plan): 네이버 블로그 채널 + brand_guide profile_photo 시스템 박기 네이버 블로그 채널 추가: - naver.fetch_blog_total_count: RSS에 totalCount 없으면 blog.naver.com 의 PostList 페이지 HTML에서 '(\d+)개의 글' 패턴으로 진짜 전체 글 수 추출 (RSS는 최근 50개만 줘서 그동안 totalResults=50 으로 잘못 박혔음 — 뷰성형외과 실제 554개) - analysis._naver_blog_summary 다이어트: totalPosts + latestPostDate 만 LLM에 보냄 (posts 본문/링크/제목 빼서 토큰 절약 + LLM의 무관 정보 hallucinate 방지) - plan_prompt: channelStrategies 리스트에 네이버 블로그 명시 포함 brand_guide.channel_branding.profile_photo 코드 박기: - 기존: LLM이 "공식 로고로 통일 (가이드 미보유)" 같은 fallback 문구 hallucinate - 수정: analysis._patch_plan 이 모든 채널의 profile_photo 를 brand_assets.logo_description 으로 일괄 박음 (채널 통일 전략이라 모두 동일 값) - plan_prompt: "profilePhoto 는 빈 문자열로 두세요 — 시스템이 채웁니다" 명시 Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-05-29 10:44:18 +09:00
Mina Choi	8c1e513dc0	fix(vision): channel logo describe — 3채널씩 청크 호출로 매칭 정확도 향상 기존: 공식 로고 + 모든 채널 프로필 이미지를 한 번에 묶어 Gemini에 보냄 → LLM이 채널-이미지 매칭을 헷갈려 같은 묘사를 여러 채널에 복사하는 문제. VIEW 케이스에서 한국 페북·영문 인스타가 둘 다 "보라/노란 V자형 공식 로고" 묘사로 잘못 박혔음 (실제로는 흰배경 V자 심볼 vs 금색 VIEW로 완전히 다름). 수정: describe_channel_logos를 3채널씩 청크로 분리 + 명시적 이미지 번호 매핑: - "이미지 1 = 공식 로고, 이미지 2 = Instagram 채널, 이미지 3 = Facebook..." 식 - "공식 로고 묘사를 절대 복사하지 마세요" 강한 지시 - 청크별 병렬 호출 (asyncio.gather) - inconsistency_summary / recommendation 은 LLM 한 번 더 안 부르고 결정적 산출 비용: 호출 1회 → 청크 수 만큼 (보통 2회), 페니 수준 증가 시간: 병렬이라 거의 동일 정확도: 사용자가 본 실제 묘사와 일치하게 됨 (개별 호출 테스트로 검증) Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-05-29 10:44:00 +09:00
Mina Choi	652265cd19	페북 수집·지표·저장 파이프라인 정리 수집: - pages + posts 두 actor 병렬 호출 (facebook-pages-scraper, facebook-posts-scraper) - 저장 필드 슬림화: 페이지 메타에서 likes/rating/email/phone/address 제거 (followers/reviews와 중복이거나 클리닉 raw_data에 이미 있음) - 게시물 저장은 캡션 160자 + likes/reactions/shares/views/isVideo/timestamp만 지표 계산 위치 이동: 리포트 시점 → 수집 시점: - recent_post_age / post_frequency / engagement 를 transform_for_storage에서 결정적으로 산출해 DB에 박음 (재계산 불필요) - 저장된 게시물은 LLM용 캡션·타입 2필드만 — 추가 슬림 단계 제거 리팩토링: - services/facebook_audit.py 신설 (instagram_audit 패턴) — _build_overrides의 인라인 클로저(_fb_page_patch)와 analysis.py의 _fb_post_metrics 분리 - collect.py / enrichment.py 가 transform_for_storage를 호출하도록 엔게이지먼트 표기: - 범위(min~max)로 표시, 전부 0인 지표는 제외 - 댓글은 actor 미제공이라 "댓글 거의 없음" 고정 부가 콘텐츠 유형: - top_content_type 은 캡션 본문 주제 추론이 필요해 LLM에 위임 - report_prompt.txt 에 facebook_audit.pages[].top_content_type 작성 지침 추가 Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-05-28 13:49:22 +09:00
Mina Choi	4f756cf001	인스타 highlights/계정 수집 개선 (VIEW actor + 코드로 계정 구성) - apify: 프로필 coderx, 하이라이트 igview actor로 교체. highlights/category/ following(followsCount)/profileImage(hdProfilePicUrl)/latestPosts.mediaType 수집. reel 스크래퍼 제거, post 스크래퍼 비활성화(주석) - instagram_audit.py(신규): KR·EN 계정 hard 필드를 수집 데이터로 구성 - analysis: _build_overrides에서 위 함수로 계정 구성, _patch_report가 accounts를 코드값으로 주입 (LLM은 diagnosis만, 프롬프트에서 accounts는 []로 두게 지시) Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-05-28 09:43:03 +09:00
Mina Choi	163e9d1c02	리포트/플랜에 브랜드·영문채널 반영 - overrides에 brandAssets·영문 인스타/페북 audit 보장 (채널별 빌더 분리) - logoRules·other_channels·channel_scores 프롬프트 수정, 스키마 입력 필드 추가 Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-05-27 14:24:21 +09:00
Mina Choi	843ccdb806	브랜드 자산(로고/색상)·채널 로고 Vision 분석 추가 - color_extractor: 홈페이지 HTML/CSS에서 로고 URL·브랜드 hex 추출 - vision: Gemini Vision 로고 묘사·채널 로고 일치 평가 - youtube: 채널 profileImage 추출 / firecrawl: clinic_info 추출 보정 Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-05-27 13:27:39 +09:00
Mina Choi	9817b53be1	틱톡·영문 인스타/페북 채널 수집 추가 - apify: 틱톡 프로필 액터 - mock_urls.py: 클리닉별 채널 URL 매핑 (mockUrls.json → 파이썬 모듈) - api/analysis: homepage 매칭으로 미지원 채널 보충 (추후 DB) Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-05-27 13:27:39 +09:00
jaehwang	0e68cbe71b	뷰성형외과 전용 mock데이터 외삽 알고리즘 추가	2026-05-21 15:41:43 +09:00
jaehwang	cb798f7acc	instagram externalurl 수집 비활성화 (LLM이 혼동을 일으킴)	2026-05-20 18:36:29 +09:00
jaehwang	8e5ce3e012	add phone formating	2026-05-20 18:16:35 +09:00
jaehwang	e8406dc0ee	의료진 수 firecrawl 해킹, 만약 필요하다면 직접 스크래핑으로 해결 필요	2026-05-20 17:58:58 +09:00
jaehwang	1f45b3e53d	fix 유튜브 채널 수집 실패 버그	2026-05-20 10:00:39 +09:00
Mina Choi	18d01357c0	file 업로드 엔드포인트 추가 (Azure Blob 연동)	2026-05-19 16:13:31 +09:00
jaehwang	20fdf53264	마켓 분석 데이터 추가	2026-05-19 15:45:44 +09:00
jaehwang	cda518c027	시장 조사 llm 추가 및 파이프라인 정리, db 커넥션 풀 문제 처리	2026-05-19 15:22:34 +09:00
jaehwang	42e09ae2d1	plan report 이름 통일 및 코드 정리	2026-05-18 17:15:50 +09:00
jaehwang	9b4e99abf9	report output format 변경 및 clinic info출력 추가	2026-05-18 15:40:37 +09:00
jaehwang	602c69543c	plan 추가, analysis 오탈자 제거	2026-05-18 10:23:17 +09:00
jaehwang	2b8a90e857	llm 붙임 및 리포트 생성 확인	2026-05-14 16:16:09 +09:00
jaehwang	d930679e90	integration 1차 데이터 및 DB 정의, 테스트	2026-04-24 14:19:29 +09:00

30 Commits (b844951ad86e6bcbbad408b96ad8d636f959e5bb)