Go to file
민헌 8b9e81777c feat(lps): 알림 확장 — AlertManager 쿨다운·회복, DB풀 포화·소스별 장기실패 룰
기존 ops-monitor 는 임계 초과가 지속되면 30초마다 같은 웹훅을 반복 발송했고
(쿨다운 없음), 해소 여부도 알 수 없었다. 감시 항목도 큐 지표 4종뿐이었다.

- common/alerts.py AlertManager 신설: 룰 키별 상태 관리 — 발화 1회 +
  쿨다운(LPS_ALERT_COOLDOWN_MIN, 기본 30분)마다 리마인드, 해소 시 회복
  알림 1회. sender/clock 주입으로 네트워크·대기 없이 단위 테스트.
- 워커 ops-monitor 를 AlertManager 로 이관(기존 4룰 유지) + 신규 2룰:
  db_pool(풀 포화율 ≥ LPS_ALERT_POOL_PCT 90%) ·
  source_fail:<src>(최근 30분 시도 ≥ LPS_ALERT_SOURCE_FAIL_30M(5) & 성공 0
  — 쿼터 소진·셀렉터 드리프트·전면 차단 신호).
- DBSessionManager.pool_status(): 전 엔진 합산 checked_out/capacity/pct.
- SearchAdapter 에 시간 윈도우 성공/실패 카운터(recent_stats) — 누적
  카운터로는 '최근 30분 성공 0건'을 볼 수 없어 추가. 쿠팡(브라우저)·
  네이버(API) 성공/실패 지점에 배선.
- API 자체 풀 모니터: lifespan 백그라운드 태스크(run_pool_monitor) —
  대량 폴링으로 풀을 고갈시키는 주범이 API 자신일 수 있다.
  /v1/lps/ops 에 pool_checked_out/pool_capacity/pool_pct 노출(스모크 확인).
- 테스트 9건 추가(발화·쿨다운·회복·룰 독립·윈도우 카운터·풀 현황), 전체 135 passed.

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-07-13 16:42:12 +09:00
agent [feat] agent: 협상 고도화 — LLM 표현/이해층 + 카드 전술 실행계층 + ktcommerce 정리 2026-07-10 13:37:36 +09:00
backend feat(negotiation): 세션 목록 기본 그룹 정렬 + order 지정 시 전체 정렬 2026-07-08 14:12:56 +09:00
frontend fix(list): 견적 유형(qt_type)에 신규협상·신규견적(3·4) 추가 2026-07-08 14:15:46 +09:00
lps feat(lps): 알림 확장 — AlertManager 쿨다운·회복, DB풀 포화·소스별 장기실패 룰 2026-07-13 16:42:12 +09:00
lps-temp-fe chore(lps): FE 원가 타일 AI/DECODO 비용 분해 + config example cost_per_gb 2026-07-09 15:34:57 +09:00
negodata Merge branch 'main' into feature/negodata-lps 2026-07-13 13:55:36 +09:00
postgres-init feat(lps): IP 선제 로테이션 — 요청 예산·포트 쿨다운·ip_session 관측 2026-07-13 16:35:44 +09:00
schedules/anchoring [refactor] 공급유형 기준을 상품-협력사 매핑으로 전환 2026-07-07 17:05:07 +09:00
.env.example feat(lps): API 스케일 파라미터를 .env 로 노출 — PROCESS_COUNT·커넥션 예산 2026-07-10 12:02:17 +09:00
.gitignore chore: 로컬 리서치 노트(Temp.md·new.md) gitignore 처리 2026-07-09 14:03:08 +09:00
docker-compose.yml feat(lps): 알림 확장 — AlertManager 쿨다운·회복, DB풀 포화·소스별 장기실패 룰 2026-07-13 16:42:12 +09:00
README.md refactor(db): postgres-init 2파일 체계로 통합 — 00-init.sql(스키마 전체) + temp-data.sql(시드) 2026-07-07 10:20:44 +09:00

O2O Negosium

동일 구조의 두 서비스(negosium, negodata)가 하나의 PostgreSQL 인스턴스를 공유한다.

구성

o2o-negosium/
├── docker-compose.yml          # 두 backend (DB 는 외부)
├── postgres-init/        # DB·테이블 셋업 SQL (대상 DB 에 1회 적용)
├── backend/                     # negosium 백엔드 (포트 9300)
├── negodata/backend/            # negodata 백엔드 (포트 9400)
├── agent/  front/               # (예정)
└── negodata/front/              # (예정)

두 백엔드는 같은 코드 골격(MVC · 람다 DB · Depends 주입 · JWT 로그인)을 쓴다. 아키텍처/패턴 상세는 각 서버 README 참고: backend · negodata/backend

DB 는 compose 밖 (config 로 연결)

DB 는 docker-compose 에서 관리하지 않는다. 각 backend 는 config.<APP_ENV>.toml 의 접속 정보대로 외부 PostgreSQL(호스트 로컬 postgres, 또는 따로 떠 있는 docker postgres)에 연결한다. 한 PostgreSQL 안에 서비스별 database 를 둔다.

PostgreSQL (외부, 5432)
├── negosium_db     ← negosium-backend
└── negodata_db     ← negodata-backend
  • 컨테이너(docker env)에서 호스트 DB 접근: host.docker.internal:5432 (config.docker.toml)
  • 로컬 실행/테스트(local·test env): 127.0.0.1:5432 (config.local/test.toml)
  • 계정/database 명은 config 에 맞춘다 (기본 postgres / password).
서비스 서버 docs database
negosium-backend http://localhost:9300 /docs negosium_db
negodata-backend http://localhost:9400 /docs negodata_db

빠른 시작

# 1) DB 준비 (최초 1회) — 사용할 PostgreSQL 에 스키마 + 시드 적용
psql -h 127.0.0.1 -p 5432 -U postgres -f postgres-init/00-init.sql     # 스키마 전체 (negosium_db + 도메인·learning·anchoring schema)
psql -h 127.0.0.1 -p 5432 -U postgres -f postgres-init/temp-data.sql   # 임시 데이터 시드 (admin / admin1234)

# 2) 백엔드 기동
docker compose up -d            # 두 backend (DB 는 config 대로 외부 연결)
docker compose logs -f
docker compose down

테스트

# config.test.toml 의 PostgreSQL(기본 127.0.0.1:5432) 이 떠 있어야 한다
cd backend            # 또는 negodata/backend
pip install pytest pytest-asyncio httpx
python -m pytest
  • httpx ASGITransport 로 네트워크 없이 앱을 직접 호출하는 e2e (각 5개).
  • DB_SESSION_MNG 싱글톤의 커넥션 풀이 첫 이벤트 루프에 묶이므로, 모든 테스트가 단일 session 루프를 공유한다(pytest.ini).

성능 / 벤치마크

/loginbcrypt(CPU 바운드) 가 비용의 대부분이다. 초기에는 bcrypt 가 asyncio 이벤트 루프를 막아 아무 일도 안 하는 /healthz 조차 p99 3.3s 가 나왔다.

두 가지 최적화

  1. bcrypt 를 asyncio.to_thread 로 오프로드 — 이벤트 루프 비차단. bcrypt 는 해싱 중 GIL 을 해제하므로 스레드들이 여러 코어에서 실제 병렬 실행된다.
  2. 워커 수 증가 (process_count 1 → 4) — login 처리량을 코어만큼 확장.

Before / After (동일 부하: 100 users)

지표 Before After 변화
/healthz median 1700ms 2ms 850배 개선
/healthz p99 3300ms 14ms 235배 개선
/me p99 3100ms 12ms 258배 개선
/login median 9900ms 220ms 45배 개선
/login p99 15000ms 1400ms 11배 개선
/login RPS 5.5 19.3 3.5배 개선
전체 RPS 17.6 75.2 4.3배 개선

최적화 후 Locust 차트 (100 users)

RPS 가 ~71 로 안정, p95 ~250ms(bcrypt), 실패 0%. median 은 초기 계정생성 버스트 후 바닥으로 떨어진다.

Locust Benchmark

login 은 여전히 가장 느리다(bcrypt 의 의도된 비용). 핵심은 그게 서버 전체를 막지 않는다는 점. 더 높은 처리량은 워커/인스턴스 수평 확장이 정석이다(bcrypt cost 낮추기는 보안 트레이드오프). ⚠️ to_thread 가 이미 단일 워커에서 멀티코어 병렬화를 하므로, 워커를 코어 수만큼 늘리면서 to_thread 까지 쓰면 워커 x 스레드 가 코어를 넘어 오버서브스크립션이 된다(워커는 코어의 절반 안팎).

부하 재현:

docker compose up -d
cd backend && pip install locust
python -m locust -f loadtest/locustfile.py --host http://localhost:9300 --headless -u 100 -r 10 -t 2m
# 부하 중 커넥션 모니터링: psql -h 127.0.0.1 -U postgres -c "SELECT count(*) FROM pg_stat_activity;"

기술 스택

FastAPI · SQLAlchemy(async) · asyncpg · PostgreSQL 16 · python-jose(JWT) · bcrypt · uvicorn · Docker Compose