Commit Graph

2 Commits

Author SHA1 Message Date
09647a3958 feat: add id offset and prediction array output to NER sample viewer
성적서 '3. 테스트 데이터 예시' 는 평가 데이터 id 를 학습 데이터 뒤에 이어서
매기고(11480~), 바로 아래 '예측 결과 예시' 에 마지막 예시 문장의 태그 배열을
전체로 싣는다. 두 가지를 스크립트에서 바로 낼 수 있게 한다.

--id-offset : id 시작값. 미지정 시 validation 은 학습셋 크기만큼 이어서 매김
--predict   : 마지막 예시 문장의 original_tags / predicted_tags 를 전체 배열로 출력

공백 토큰은 서브워드가 없어 word_ids 에서 빠지므로, 음절 수만큼 자리를 잡아
두고 word_id 위치에만 예측을 채워 정답과 길이를 맞춘다.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-09-16 14:40:29 +09:00
be25b6c053 feat: add KLUE NER sample viewer for scorecard capture
성적서 "1. 데이터 준비" 는 KLUE NER 을 원본 배포 형식인 인라인 태그
(`<영동고속도로:LC>`) 로 싣는데, HuggingFace datasets 판은 tokens/ner_tags
배열이라 모양이 다르다. BIO 를 엔티티 단위로 묶어 원본 형식으로 되돌린다.

전 차수 성적서 8p 첫 예시와 문자 단위로 일치함을 확인했다.
열람 전용이며 학습 경로에는 관여하지 않는다.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
2026-09-16 13:18:07 +09:00