용어 사전, 2026-09-26 기준

용어 사전

이 기록에 나오는 용어 26개를 한 줄씩 풀었습니다. Jev의 요청과 답, 운영 장치, 측정 방법, 검색의 네 묶음입니다.

RequestJev의 요청과 답

Choice
정해 둔 선택지(최대 255개) 가운데 하나와 선택지별 확률을 돌려주는 판단 형태입니다.
Noul
예 또는 아니오에 대해 0~1 사이 값 하나를 돌려주는 판단 형태이며, confidence 필드가 없습니다.
Score
순서 있는 2~10단계 가운데 어디쯤인지를 확률 가중 값으로 돌려주는 판단 형태입니다.
State
Jev가 읽고 판단할 근거 전부로, 코드가 필요한 필드만 골라 텍스트로 조립합니다.
Criteria
허용되는 답의 목록과 그 뜻으로, 조직의 정책을 문장으로 적는 자리입니다.
confidence
확률 분포에서 계산한 요약 값이며, 정확도나 보정과는 다른 것입니다.

Ops운영 장치

PROPOSE
Jev는 제안만 하고 실행은 코드와 사람이 한다는 이 프로젝트의 판정이자 원칙입니다.
유지 집합keep-set
검색 후보마다 필요 여부를 Noul로 묻고 컷을 넘은 후보만 남긴 묶음입니다.
판단 영수증receipt
한 번의 호출에서 무엇을 보내고 무엇을 받았는지, 어떤 규칙으로 결정했는지를 다시 계산할 수 있게 남긴 기록입니다.
shadow log
Jev 제안을 실제로 반영하지 않고 사람의 최종 선택 옆에 같은 행으로 적는 병렬 기록입니다.
보류hold
동률, 역순 불일치, 금지 조건일 때 제안을 내지 않고 사람에게 넘기는 결정입니다.
역순 재질문
선택지 순서를 뒤집어 한 번 더 물어 두 답이 같은지 확인하는 검사입니다.
fail-open, fail-closed
실패 시 원래 화면을 그대로 보이는 방식과, 실패 시 행동을 막는 방식입니다.
모델 핀
요청 모델을 jev-1.13.0으로 고정하고 응답 모델이 다르면 결과를 버리는 규칙입니다.

Method측정 방법

사전 등록pre-registration
첫 호출 전에 절차와 조건을 고정하고 해시를 남겨, 결과를 본 뒤 규칙을 바꾸지 못하게 하는 방법입니다.
봉인한 최종 분할sealed final split
임계값을 다 고른 뒤 조건마다 딱 한 번만 여는 시험 표본입니다.
새 데이터 재시험fresh-data re-test
결과를 보고 세운 가설을 앞 라운드가 쓰지 않은 자료로 다시 재는 절차입니다.
블라인드 채점blind grading
어느 모델의 답인지 가린 채 미리 잠근 정답 키와 루브릭으로 채점하는 방법입니다.
사람 골드human gold
Jev 답을 보기 전에 사람이 새로 매긴 정답 라벨입니다.
재현 기준
볼트에 이미 적힌 분류와 위치를 정답으로 삼아 잰 값이라는 뜻으로, 사람 대비 정확도가 아닙니다.
기준선baseline
같은 항목에서 Jev 없이 코드만으로 낸 결과로, 모든 비교에 함께 붙입니다.
Wilson 95% 구간
표본이 작을 때 비율의 불확실성을 보여 주는 구간입니다.
헤드 모델
여러 모델의 결과를 종합하는 모델로, 자기 편향이 있어 그 모델의 순위는 독립 순위로 읽지 않습니다.
음절 구문 BM25
한글을 음절 단위로 저장하는 검색 색인에 맞춰 질의를 음절 구문으로 바꾼 키워드 검색입니다.
RRF
키워드 검색과 벡터 검색의 순위를 하나로 합치는 순위 융합 방법입니다.
끝단 정확도
후보 목록에 정답이 들어간 비율과, 그 안에서 Jev가 정답을 고른 비율을 곱한 최종 정확도입니다.

이 용어들이 쓰인 측정과 설계는 결과, 시스템, 해설에 있습니다.

Upcoming다가오는 행사

요즘 제가 진행하는 세미나와 컨퍼런스입니다. 궁금하시면 오세요.