문서 입력
검사할 본문과 문서 ID를 수신하고 요청 옵션을 확인합니다.
입력 문서와 기준 코퍼스를 비교해 본문 의미, 형태소 구조, 인물과 모티프의 유사도를 계산하고, 요소만 교체한 부분 표절까지 검토할 수 있도록 원문·점수·일치 구간을 제공합니다.
검사할 본문과 문서 ID를 수신하고 요청 옵션을 확인합니다.
공통 표현을 제거하고 개체명을 마스킹해 일상 문장 오탐을 줄입니다.
MinHash·LSH로 대규모 코퍼스에서 비교 가능성이 있는 원문 후보를 찾습니다.
KoSimCSE 의미, lemma 구조, 인물, 모티프 신호를 가중 결합합니다.
구조는 유지하고 인물·모티프만 교체했는지 요소 단위로 분해합니다.
원문, 세부 점수, 일치 구간과 검토용 태그를 함께 제공합니다.
판정에 사용할 원문과 문서 정보를 API에서 수신합니다.
routes.detect()
JSON 요청을 Pydantic 스키마로 검증합니다.
detect_request()
doc_id·text·options를 탐지기로 전달합니다.
detector.detect()
임계값과 자서전 모드를 결정합니다.
preprocess_for_autobiography()
공통 표현 제거와 개체명 마스킹을 수행합니다.
extract() + extract_lemmas()
인물·모티프·키워드와 lemma를 만듭니다.
LshIndex.query()
MinHash 기반으로 후보 문서 ID를 찾습니다.
DualSimilarityIndex.query()
KoSimCSE와 세부 신호를 가중 결합합니다.
ClusterIndex.partial_signal()
유지·변경된 구성요소를 구분합니다.
_assign_tags() + find_case()
검토용 법령 태그와 케이스를 연결합니다.
DetectResponse
점수·원문·증거 구간을 JSON으로 반환합니다.
모델 이름보다 입력, 전처리, 네 가지 유사도, 임계값, 증거 생성 순서로 설명합니다.
고정 데이터셋, 라벨 기준, 실행환경, Confusion Matrix와 원본 로그를 제시합니다.
표절 위험 신호와 법률상 저작권 침해 확정을 분리해 과장 없이 설명합니다.
| 계획서 항목 | 현재 구현 | 상태 | 기관 대응 표현 |
|---|---|---|---|
| 복합 유사도 탐지 | KoSimCSE + lemma + 인물 + 모티프 | 구현 | 세부 점수와 일치 구간 시연 가능 |
| 군집 기반 부분 표절 | 요소별 군집 및 교체 신호 | 구현 | 인물 교체 시나리오로 설명 |
| Human Feedback | 선호 데이터 생성·변환 파이프라인 | 골격 준비 | 사람 선호 라벨 확보 후 실제 학습 |
| Precision 97% | 평가 도구 및 내부 보고서 | 최종 검증 필요 | 자서전 정답셋·고정 임계값으로 평가 예정 |
| 39개 침해 케이스 | 분류체계와 API 응답 매핑 | 데이터 필요 | 케이스별 평가 샘플 확보 필요 |
| 기관 통합 | 단건·배치·분류체계 API | E2E 필요 | 외부 DB 계약 및 연계시험 예정 |