문서 입력
+검사할 본문과 문서 ID를 수신하고 요청 옵션을 확인합니다.
+diff --git a/app/static/institution_briefing.html b/app/static/institution_briefing.html new file mode 100644 index 0000000..a5cd9f2 --- /dev/null +++ b/app/static/institution_briefing.html @@ -0,0 +1,1394 @@ + + +
+ + + ++ 입력 문서와 기준 코퍼스를 비교해 본문 의미, 형태소 구조, 인물과 모티프의 유사도를 계산하고, + 요소만 교체한 부분 표절까지 검토할 수 있도록 원문·점수·일치 구간을 제공합니다. +
+검사할 본문과 문서 ID를 수신하고 요청 옵션을 확인합니다.
+공통 표현을 제거하고 개체명을 마스킹해 일상 문장 오탐을 줄입니다.
+MinHash·LSH로 대규모 코퍼스에서 비교 가능성이 있는 원문 후보를 찾습니다.
+KoSimCSE 의미, lemma 구조, 인물, 모티프 신호를 가중 결합합니다.
+구조는 유지하고 인물·모티프만 교체했는지 요소 단위로 분해합니다.
+원문, 세부 점수, 일치 구간과 검토용 태그를 함께 제공합니다.
+판정에 사용할 원문과 문서 정보를 API에서 수신합니다.
+routes.detect()
+ JSON 요청을 Pydantic 스키마로 검증합니다.
+detect_request()
+ doc_id·text·options를 탐지기로 전달합니다.
+detector.detect()
+ 임계값과 자서전 모드를 결정합니다.
+preprocess_for_autobiography()
+ 공통 표현 제거와 개체명 마스킹을 수행합니다.
+extract() + extract_lemmas()
+ 인물·모티프·키워드와 lemma를 만듭니다.
+LshIndex.query()
+ MinHash 기반으로 후보 문서 ID를 찾습니다.
+DualSimilarityIndex.query()
+ KoSimCSE와 세부 신호를 가중 결합합니다.
+ClusterIndex.partial_signal()
+ 유지·변경된 구성요소를 구분합니다.
+_assign_tags() + find_case()
+ 검토용 법령 태그와 케이스를 연결합니다.
+DetectResponse
+ 점수·원문·증거 구간을 JSON으로 반환합니다.
+모델 이름보다 입력, 전처리, 네 가지 유사도, 임계값, 증거 생성 순서로 설명합니다.
고정 데이터셋, 라벨 기준, 실행환경, Confusion Matrix와 원본 로그를 제시합니다.
표절 위험 신호와 법률상 저작권 침해 확정을 분리해 과장 없이 설명합니다.
| 계획서 항목 | 현재 구현 | 상태 | 기관 대응 표현 |
|---|---|---|---|
| 복합 유사도 탐지 | KoSimCSE + lemma + 인물 + 모티프 | 구현 | 세부 점수와 일치 구간 시연 가능 |
| 군집 기반 부분 표절 | 요소별 군집 및 교체 신호 | 구현 | 인물 교체 시나리오로 설명 |
| Human Feedback | 선호 데이터 생성·변환 파이프라인 | 골격 준비 | 사람 선호 라벨 확보 후 실제 학습 |
| Precision 97% | 평가 도구 및 내부 보고서 | 최종 검증 필요 | 자서전 정답셋·고정 임계값으로 평가 예정 |
| 39개 침해 케이스 | 분류체계와 API 응답 매핑 | 데이터 필요 | 케이스별 평가 샘플 확보 필요 |
| 기관 통합 | 단건·배치·분류체계 API | E2E 필요 | 외부 DB 계약 및 연계시험 예정 |