o2o-site-ontology/scripts/db-dump.sh
hbyang 8322bd45cb 배포용 DB 덤프 산출물 추가
엑셀이 DB 와 일치하지 않았다. 기존 엑셀은 전국 JSON 에서만 뽑아
군산 상세 데이터셋 850건이 빠져 있었다 (DB 7,093 vs 엑셀 6,243).

- scripts/export-db-xlsx.py — DB 를 기준으로 뽑는다 (JSON 아님)
  시트 6개: 키워드 7,093 / 지역 70 / 업종 9 / 업체 4 / QA 20 / 배포가이드
  임베딩은 담지 않는다 (384 float × 7천 행). 같은 모델로 재생성하면 복원된다
- scripts/db-dump.sh — 임베딩 포함 pg_dump (13MB, .gitignore)
- npm run db:export-xlsx / db:dump

복원 검증 완료: 6개 테이블 행수 일치, 임베딩 7,093/7,093 보존,
HNSW 인덱스 재생성, 복원본에서 벡터 검색 동작 확인.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-09-14 10:26:05 +09:00

11 lines
542 B
Bash
Executable File

#!/usr/bin/env bash
# 임베딩 포함 전체 덤프 — 배포 대상에서 재임베딩 없이 그대로 복원된다.
set -euo pipefail
OUT="${1:-data/ontology-dump.sql.gz}"
mkdir -p "$(dirname "$OUT")"
docker exec -i ontology-postgres pg_dump -U ontology -d ontology \
--no-owner --no-privileges --clean --if-exists | gzip -9 > "$OUT"
echo "✅ $OUT ($(du -h "$OUT" | cut -f1))"
echo " 복원: gunzip -c $OUT | psql \"\$TARGET_DATABASE_URL\""
echo " (대상 DB 에 vector · ltree · pg_trgm 확장이 설치돼 있어야 한다)"