용어 사전, 2026-09-26 기준
용어 사전
이 기록에 나오는 용어 26개를 한 줄씩 풀었습니다. Jev의 요청과 답, 운영 장치, 측정 방법, 검색의 네 묶음입니다.
RequestJev의 요청과 답
- Choice
- 정해 둔 선택지(최대 255개) 가운데 하나와 선택지별 확률을 돌려주는 판단 형태입니다.
- Noul
- 예 또는 아니오에 대해 0~1 사이 값 하나를 돌려주는 판단 형태이며, confidence 필드가 없습니다.
- Score
- 순서 있는 2~10단계 가운데 어디쯤인지를 확률 가중 값으로 돌려주는 판단 형태입니다.
- State
- Jev가 읽고 판단할 근거 전부로, 코드가 필요한 필드만 골라 텍스트로 조립합니다.
- Criteria
- 허용되는 답의 목록과 그 뜻으로, 조직의 정책을 문장으로 적는 자리입니다.
- confidence
- 확률 분포에서 계산한 요약 값이며, 정확도나 보정과는 다른 것입니다.
Ops운영 장치
- PROPOSE
- Jev는 제안만 하고 실행은 코드와 사람이 한다는 이 프로젝트의 판정이자 원칙입니다.
- 판단 영수증receipt
- 한 번의 호출에서 무엇을 보내고 무엇을 받았는지, 어떤 규칙으로 결정했는지를 다시 계산할 수 있게 남긴 기록입니다.
- shadow log
- Jev 제안을 실제로 반영하지 않고 사람의 최종 선택 옆에 같은 행으로 적는 병렬 기록입니다.
- 역순 재질문
- 선택지 순서를 뒤집어 한 번 더 물어 두 답이 같은지 확인하는 검사입니다.
- fail-open, fail-closed
- 실패 시 원래 화면을 그대로 보이는 방식과, 실패 시 행동을 막는 방식입니다.
- 모델 핀
- 요청 모델을 jev-1.13.0으로 고정하고 응답 모델이 다르면 결과를 버리는 규칙입니다.
Method측정 방법
- 사전 등록pre-registration
- 첫 호출 전에 절차와 조건을 고정하고 해시를 남겨, 결과를 본 뒤 규칙을 바꾸지 못하게 하는 방법입니다.
- 봉인한 최종 분할sealed final split
- 임계값을 다 고른 뒤 조건마다 딱 한 번만 여는 시험 표본입니다.
- 새 데이터 재시험fresh-data re-test
- 결과를 보고 세운 가설을 앞 라운드가 쓰지 않은 자료로 다시 재는 절차입니다.
- 블라인드 채점blind grading
- 어느 모델의 답인지 가린 채 미리 잠근 정답 키와 루브릭으로 채점하는 방법입니다.
- 사람 골드human gold
- Jev 답을 보기 전에 사람이 새로 매긴 정답 라벨입니다.
- 기준선baseline
- 같은 항목에서 Jev 없이 코드만으로 낸 결과로, 모든 비교에 함께 붙입니다.
- Wilson 95% 구간
- 표본이 작을 때 비율의 불확실성을 보여 주는 구간입니다.
- 헤드 모델
- 여러 모델의 결과를 종합하는 모델로, 자기 편향이 있어 그 모델의 순위는 독립 순위로 읽지 않습니다.
Search검색
- 음절 구문 BM25
- 한글을 음절 단위로 저장하는 검색 색인에 맞춰 질의를 음절 구문으로 바꾼 키워드 검색입니다.
- 끝단 정확도
- 후보 목록에 정답이 들어간 비율과, 그 안에서 Jev가 정답을 고른 비율을 곱한 최종 정확도입니다.