최상단을 프로젝트 단위로 평평하게 둔다 — o2o-negosium 과 같은 규약이고, 이 레포만
다르게 갈 이유가 없다. negodata/{backend,front} 가 프로젝트 안에서 f/b 를 가르는 선례,
lps-admin/ 이 백엔드 없이 프론트만 가진 최상단 폴더의 선례다.
backend/ frontend/{admin,site,shared} → solution/{backend,front,site,shared} + admin/
## 왜
내부 라우트(/local-content, /places/:id/seo)의 이름과 화면 코드가 사장님 번들에
그대로 실려 나가고 있었다. UserRole.DEVELOPER 주석의 "고객사에 존재를 노출하지 않는다"를
번들이 깨고 있었다 — 라우트 가드는 화면을 가리지 번들은 못 가린다.
번들을 갈라 확인했다: 사장님 dist 에서 local-content · /places · SeoAudit 이 전부 0건이다.
그 과정에서 두 곳이 더 새고 있었다.
- AppShell 의 NAV 배열이 내부 메뉴를 하드코딩하고 있었다. 앱을 가른 뒤에도 dist 에
local-content 가 남아서 찾았다. 메뉴는 이제 앱이 prop 으로 들고 온다.
- EditorHeader·BuilderPage·LoginPage 가 /places 로 링크하고 있었다. 그 화면이 admin 으로
나갔으니 사장님 앱에서는 404 다. 링크를 걷어내고 LoginPage 기본 도착지는 '/' 로 바꿨다
(앱마다 홈이 다르고 각 라우터의 '/' 가 이미 그걸 안다).
## admin 에 백엔드를 두지 않았다
내부 화면이 부르는 훅이 전부 router/v1/{place,fact,local,validator} 에 이미 있다.
자체 백엔드를 두면 place·fact·link 를 같은 DB 에 대고 두 번 구현하게 된다.
대가는 solution/backend 가 죽으면 admin 도 멈추는 것 — 내부 도구라 감수한다.
## admin 의 `@` 는 solution/front/src 를 가리킨다
내부 화면이 쓰는 API 클라이언트·UI·수집 배선이 solution 에 한 벌만 있고 그 파일들끼리도
`@/...` 로 서로를 부른다. admin 에서 `@` 를 자기 src 로 잡으면 그 참조가 전부 깨진다
(실측 TS2307 14건). 복제하는 길도 있지만 RecollectPanel 주석이 금지한다 —
"수집 경로를 두 벌 만들면 확정 게이트"가 갈라진다.
admin 자기 파일만 `@admin` 이고, 의존 방향은 admin → solution 한 쪽뿐이다.
admin 이 여는 빌더는 다른 오리진이라 절대 URL + 새 탭이다(admin/src/lib/solutionUrl.ts).
react-router Link 로 두면 admin 안에서 라우트를 찾다 404 다.
## 그 밖
- npm 워크스페이스 루트를 레포 루트로 올렸다(admin 이 solution 밖이라).
- docker-compose 를 255→174줄로 줄이고 admin(:3002) 서비스를 넣었다. ADMIN_BIND 기본값은
127.0.0.1 — 0.0.0.0 으로 열면 앱을 가른 의미가 없다.
- 발행 호스트를 프론트 .env 에 따로 적지 않는다. compose 가 루트의 SITE_PUBLIC_HOST 를
VITE_PUBLISH_HOST 로 흘려보낸다 — 두 곳에 적으면 canonical 과 화면 주소가 조용히 갈라진다.
- nginx/site.conf 를 git 에서 빼고 .example 만 남겼다(.env·*.toml 과 같은 규약).
compose 가 bind mount 하므로 클론 직후 복사해야 한다 — 없으면 Docker 가 그 자리에
디렉토리를 만들어 nginx 가 설정 없이 뜬다.
- config.test.toml.example 을 추가했다. 없으면 클론한 사람이 pytest 를 아예 못 돌린다
(conftest import 단계에서 죽는다). 외부 API 키는 전부 빈값이다 —
APP_ENV=test 가 .env 를 안 읽는 이유를 여기서 우회하면 안 된다.
- 경로가 한 칸 깊어져 test_schema_ddl(parents[2]→[3]) 과 test_site_theme 을 고쳤다.
검증: front·admin·site 전부 lint 0 / build 0. 백엔드 514 passed.
남은 4건(test_build_publish 3 · test_snapshot 1)은 이 변경 전부터 실패하던 것으로,
손대지 않은 메인 체크아웃에서 같은 4건이 같게 실패하는 것을 확인했다.
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_019uYhHQdssRubirPirrdJJC
126 lines
5.7 KiB
Python
126 lines
5.7 KiB
Python
"""워커 루프 + reaper. (LPS `worker/runner.py` 이식)
|
|
|
|
워커는 큐에서 잡을 원자적으로 claim → 핸들러 실행 → complete/fail 한다.
|
|
- 처리 중 heartbeat 로 lease 를 갱신(긴 잡이 reaper 에 회수되지 않게).
|
|
수집·비전분석은 몇 분이 정상이라 heartbeat 없이는 lease 가 먼저 만료된다.
|
|
- 핸들러엔 데드라인(job_deadline_sec)을 건다 — heartbeat 가 lease 를 계속 갱신하므로
|
|
핸들러가 행하면 reaper 로는 영원히 회수 불가.
|
|
초과 시 취소 후 fail 처리 → 백오프 재큐(소진 시 DEAD), 워커 슬롯은 즉시 다음 잡으로.
|
|
- claim 이 비면 LISTEN 알림 또는 짧은 타임아웃까지 대기(폴링 최소화).
|
|
- 핸들러는 주입식(async def(job)->dict) — 프로덕션은 수집 파이프라인, 테스트는 fake.
|
|
"""
|
|
|
|
import asyncio
|
|
|
|
from common.enums import JobStatus
|
|
from common.logger import LOG
|
|
from crud.job_crud import JobQueue, compute_backoff
|
|
|
|
|
|
class Worker:
|
|
"""큐에서 잡을 원자적으로 claim → 핸들러 실행 → complete/fail 하는 워커 루프."""
|
|
|
|
def __init__(
|
|
self,
|
|
worker_id: str,
|
|
queue: JobQueue,
|
|
handler,
|
|
lease_sec: int = 120,
|
|
backoff_fn=compute_backoff,
|
|
job_deadline_sec: float = 900.0,
|
|
):
|
|
self.worker_id = worker_id
|
|
self.queue = queue
|
|
self.handler = handler
|
|
self.lease_sec = lease_sec
|
|
self.backoff_fn = backoff_fn
|
|
# 잡 1건 처리 시간 상한(0 이면 무제한 — 테스트용).
|
|
# 수집 파이프라인은 Perplexity(10~30s) + 크롤링 + Vision(사진 20~50장) 이라 15분을 기본으로 둔다.
|
|
self.job_deadline_sec = job_deadline_sec
|
|
|
|
async def process_one(self) -> bool:
|
|
"""대기 잡 1건을 claim·처리. 처리했으면 True, 없으면 False."""
|
|
job = await self.queue.claim(self.worker_id, self.lease_sec)
|
|
if not job:
|
|
return False
|
|
await self._process(job)
|
|
return True
|
|
|
|
async def drain(self) -> int:
|
|
"""큐가 빌 때까지 처리(테스트/일회성 배치용). 처리한 잡 수 반환."""
|
|
n = 0
|
|
while await self.process_one():
|
|
n += 1
|
|
return n
|
|
|
|
async def run(self, listener=None, stop: asyncio.Event | None = None, idle_timeout: float = 5.0):
|
|
"""상시 루프. stop 이 설정될 때까지 처리하고, 유휴 시 알림/타임아웃까지 대기."""
|
|
stop = stop or asyncio.Event()
|
|
while not stop.is_set():
|
|
try:
|
|
worked = await self.process_one()
|
|
except Exception as ex:
|
|
# claim 자체가 실패(DB 순단 등) — 루프를 죽이지 않는다. 잠깐 쉬고 다시 시도.
|
|
LOG.e_no_callstack(f"[{self.worker_id}] claim 실패(계속): {type(ex).__name__}: {ex}")
|
|
worked = False
|
|
if not worked:
|
|
if listener is not None:
|
|
await listener.wait(idle_timeout)
|
|
else:
|
|
await asyncio.sleep(idle_timeout)
|
|
|
|
async def _process(self, job: dict):
|
|
jid = job["job_id"]
|
|
hb = asyncio.create_task(self._heartbeat(jid))
|
|
try:
|
|
if self.job_deadline_sec > 0:
|
|
result = await asyncio.wait_for(self.handler(job), timeout=self.job_deadline_sec)
|
|
else:
|
|
result = await self.handler(job)
|
|
await self.queue.complete(jid, self.worker_id, result)
|
|
LOG.d(f"[{self.worker_id}] done {jid}")
|
|
except (asyncio.TimeoutError, TimeoutError):
|
|
# 데드라인 초과 — wait_for 가 핸들러 태스크를 취소한 뒤 여기로 온다.
|
|
# 행이 워커 슬롯을 영구 점유하는 것보다 낫다.
|
|
backoff = self.backoff_fn(job["attempts"])
|
|
st = await self.queue.fail(jid, self.worker_id, f"JobDeadlineExceeded: {self.job_deadline_sec:.0f}s", backoff)
|
|
LOG.w(f"[{self.worker_id}] deadline {jid} → {JobStatus(st).name if st else '?'} "
|
|
f"({self.job_deadline_sec:.0f}s 초과, 핸들러 취소)")
|
|
except Exception as ex:
|
|
backoff = self.backoff_fn(job["attempts"])
|
|
st = await self.queue.fail(jid, self.worker_id, f"{type(ex).__name__}: {ex}", backoff)
|
|
LOG.w(f"[{self.worker_id}] fail {jid} → {JobStatus(st).name if st else '?'} ({type(ex).__name__}: {ex})")
|
|
finally:
|
|
hb.cancel()
|
|
try:
|
|
await hb
|
|
except asyncio.CancelledError:
|
|
pass
|
|
|
|
async def _heartbeat(self, jid: str):
|
|
interval = max(1, self.lease_sec // 3)
|
|
while True:
|
|
await asyncio.sleep(interval)
|
|
try:
|
|
await self.queue.renew_lease(jid, self.worker_id, self.lease_sec)
|
|
except Exception as ex:
|
|
# 갱신 실패는 치명적이지 않다(다음 틱 재시도). 계속 실패하면 lease 만료 → reaper 회수.
|
|
LOG.w(f"[{self.worker_id}] lease 갱신 실패(계속): {type(ex).__name__}")
|
|
|
|
|
|
async def run_reaper(queue: JobQueue, stop: asyncio.Event, interval: float = 30.0):
|
|
"""만료 lease(워커 사망) 잡을 주기적으로 회수. 재시도 남으면 재큐, 소진되면 DEAD.
|
|
|
|
도커에서 워커 컨테이너가 재시작되면 진행 중이던 잡이 여기서 되살아난다."""
|
|
while not stop.is_set():
|
|
try:
|
|
reclaimed = await queue.reap()
|
|
if reclaimed:
|
|
LOG.w(f"[reaper] reclaimed {len(reclaimed)} stale job(s)")
|
|
except Exception as ex:
|
|
LOG.e_no_callstack(f"[reaper] {type(ex).__name__}: {ex}")
|
|
try:
|
|
await asyncio.wait_for(stop.wait(), interval)
|
|
except asyncio.TimeoutError:
|
|
pass
|