CMDS × Jev, 판단 모델 실측 기록, 2026-09-15부터 2026-09-26까지
Jev는 판단 부품이지 실행 주체가 아닙니다.
제안은 Jev가, 실행은 코드와 사람이 합니다.
글을 쓰지 않고 판단만 하는 모델 Jev를 10,000+ 노트 볼트의 입력과 검색에 붙였습니다. 검색 후보를 고르는 자리에서 가장 강했고, 새 노트를 분류하는 자리에서는 후보 셋을 제안하는 데서 멈췄습니다.
Numbers헤드라인 숫자
2026-09-26 새벽 세 라운드, Jev 3,560회 호출에서 나온 숫자입니다. 숫자마다 분모와 비교 대상을 붙였습니다.
처음 보는 위키 질문에서 Jev가 고른 후보가 찾던 페이지였던 수
같은 후보 목록의 1위는 16/49
2026-09-26, 3라운드
유지 집합 필터(Noul 컷 0.3)가 지킨 정답 페이지 수
후보 평균 17.55개가 2.39개로 줄어듦
2026-09-26, 3라운드
처음 보는 폴더에서 87개 서브카테고리 1순위 재현
같은 조건의 2라운드 최종 표본은 91/120
2026-09-26, 3라운드
세 라운드 전체 비용
3,560회 호출, 입력 8,264,570 토큰, 입력 100만 토큰당 $0.042
2026-09-26 03:22~06:36 (KST)
읽는 법. 모든 수치는 볼트에 이미 적힌 분류와 위치를 얼마나 재현하는지이고, 사람이 새로 만든 정답은 2026-09-26 기준 0건입니다. 모델은 jev-1.13.0 하나, 조건마다 1회 실행했습니다. 라운드별 수치 보기
Video영상 4부작, 제브와 지식관리
TypeSafe의 판단 모델 Jev를 10,000+ 노트 볼트의 검색과 분류에 붙여 실행하고 잰 4부작 모션 시리즈입니다. 2026-09-26 기준 네 편 모두 제작 중입니다.
1편
판단만 하는 AI
글을 쓰지 않고 판단만 돌려주는 TypeSafe의 System One 모델, 제브를 소개합니다. 2026-09-24 첫 실측 341회 호출에서 응답 시간 중앙값은 0.52초, 총비용은 $0.0309였습니다. 저는 여기서 원칙 하나를 세웠습니다: 제안은 제브가 하고, 실행은 코드와 제가 합니다.
341회는 하루치 첫 실측 표본이고, 응답 시간은 그날 제 환경에서 잰 값입니다.
- EP1판단만 하는 AI
- EP2만 개를 세 개로
- EP3규칙표가 무너진 날
- EP4여덟 모델, 같은 문제
Map둘러보기
페이지마다 하나의 질문을 다룹니다.
Timeline타임라인
2026-09-15 공개부터 2026-09-26 서비스 반영까지입니다. 시각은 한국 표준시(KST) 기준입니다.
-
Jev 공개
- TypeSafe가 System One 판단 모델 Jev를 early access로 공개했습니다. 모델 버전 jev-1.13.0, 가격은 입력 100만 토큰당 $0.042이고 출력 요금은 없습니다. 같은 날 DCVC가 $40M Series Seed를 발표했습니다.
-
조사와 첫 판정
- AI 조사 세션 7개로 공개 자료를 모았고, 결과가 나온 5개를 바탕으로 판단을 세웠습니다. 판정은 PROPOSE, PoC는 미실행이었습니다.
- 첫 후보 셋: 노트 분류 제안, 문서와 주장의 관계 판정, 검색 후보 재정렬.
-
7모델 논리검증, 첫 실측, 공개 발표
- 낮, 7모델 논리검증. 같은 패킷(사실 원장, 논리 문항 10개, 설계 과제)을 일곱 모델에 주고, 정답 키와 위반 목록을 먼저 잠근 뒤 블라인드로 채점했습니다.
점수와 비용
- 밴드 A: Claude Opus 5.5 94.0, GPT-6 Astra 92.4, Claude Fable 5.1 91.6, Grok 4.7 91.5, GPT-6 Sol 91.4
- 밴드 B와 C: Gemini 3.8 Flash 77.4, Gemini 3.1 Pro 69.4
- 논리 문항 10개 합계 69/70. 점수가 갈린 문항은 하나였고, 순위를 가른 것은 스스로 선언한 권한 경계를 지켰는가였습니다.
- 비용: 실제 청구액 $0(구독 쿼터 사용). 공식 단가로 환산하면 밴드 A 안에서 GPT-6 Sol $0.1739, Claude Fable 5.1 $1.5688로 9배 차이입니다.
- 산출: 코드와 규칙, Jev, 생성 LLM, 사람의 4층 프레임과 23행 활용 포트폴리오.
- 17:29~17:32, 첫 실측. 341회 호출, 오류 0, 재시도 0, 입력 736,861 토큰, $0.0309. 호출 지연 p50 0.524초, p95 0.632초.
과제별 수치
- 채점 재현(Score, 70건): 전체 일치 51/70(72.9%), confidence 0.7 이상 구간 37/38(97.4%, 이 구간은 70건 중 38건), 질문 역순에도 답 불변 69/70(98.6%).
- CMDS 87분류(Choice, 109건): 1순위 56/109(51.4%), 선택지 역순에서 답이 바뀐 건 29/109(26.6%), 상위 9분류만 줬을 때 23/109(21.1%), confidence 0.7 이상 구간 8/13(61.5%).
- 같은 confidence 컷이 과제에 따라 97.4%(37/38)와 61.5%(8/13)로 갈린다는 것을 확인했습니다.
- 저녁, AI & Beyond 목요 세션 발표. 24분 호스트 데모 가운데 Jev의 정의, Playground 시연, 볼트 라우팅 계획을 보였고, 이어서 Jev 활용 아이디어를 14분 동안 토론했습니다. 활성 프로젝트만 선택지로 쓰는 동적 선택지, 필요할 때만 켜는 발동 방식, 앞단 게이트 같은 아이디어가 나왔습니다. 강연 요약
- 공개 학습 페이지. labs.cmdspace.work/jev/ 공개(검색엔진 비색인). 핵심 용어, 호출 흐름, 커뮤니티 사례 26건, 약점 9종의 설계 규칙을 담았습니다.
- 실행 코드 첫 판. 모델 핀, 예산 상한, 422 무재시도, 호출 영수증을 갖춘 호출기와 판단 모듈 4개, 테스트 32개.
- 낮, 7모델 논리검증. 같은 패킷(사실 원장, 논리 문항 10개, 설계 과제)을 일곱 모델에 주고, 정답 키와 위반 목록을 먼저 잠근 뒤 블라인드로 채점했습니다.
-
아이디어 원장과 계획 v2
- 아이디어 원장 64행. 09-15부터 모인 Jev 활용 아이디어를 한 표로 묶었습니다. 코드 있음 19, 설계만 25, 발언만 20.
- 익명화 패킷. 사람 이름, 고객, 로컬 경로를 뺀 패킷(47,225 bytes)을 만들었습니다.
- 22:41, R1 독립 기획. GPT-6 Astra, GPT-6 Sol, Grok 4.7이 같은 패킷으로 활용 계획을 따로 썼습니다.
- 23:09, R2 익명 교차 검토. 각 모델이 다른 두 편을 이름 없이 받아 비평했습니다.
- 블라인드 심사 2건. GPT-6 Astra 85.0, Grok 4.7 84.0, GPT-6 Sol 77.0. 같은 계획서에 두 심사가 준 점수 차가 2~4점이라 앞 두 편은 동률로 읽습니다.
- 계획 v2. 헤드 모델이 기여 단위로 채택했습니다. 64행 판정은 지금 20, 단기 데모 4, 다음 물결 15, 보류 20, 기각 5이고, 세 모델이 같았던 행은 45/64입니다. 사실 정정 16건을 기록했고 판단 원칙 8개를 더했습니다. 공개판 보기
-
8모델 논리검증, 세 라운드 실측, 서비스 반영
- 02:38, 8모델 논리검증. 모델 로스터를 확인한 뒤 "지식 입력과 검색에서의 Jev" 패킷을 여덟 모델에 보내 7편을 블라인드로 채점했습니다. 상위 세 모델은 2.2점 안이라 동률로 읽습니다. 여덟 모델
순위와 한계
- Grok 4.7 89.4, Claude Opus 5.5 88.6, GPT-6 Sol 87.2: 2.2점 안이라 동률로 읽습니다(이틀 전 재채점 분산 ±1.6).
- GPT-6 Astra 80.6, GPT-6 Luna 64.0, Gemini 3.1 Pro 57.7, Gemini 3.8 Flash 56.0.
- Claude Fable 5.1은 두 번 시도에서 본문이 나오지 않아 순위 밖입니다.
- 헤드 모델, 채점자 두 명, 반박자, 조정자가 모두 Claude Opus 5.5라 Opus 5.5의 2위는 독립 검증된 순위가 아닙니다.
- Jev 기능을 틀리게 서술한 위반은 일곱 편 모두 0건입니다.
- 03:22~06:36, Jev API 세 라운드. 라운드마다 첫 호출 전에 절차를 등록했습니다. 합계 3,560회, 입력 8,264,570 토큰, $0.3471(미리 건 상한 1,500만 토큰의 55.1%). 전부 HTTP 200, 재시도 0, 볼트 쓰기 0. 실측 결과
라운드별 수치
- 1라운드(03:22 등록): 설계와 임계값 표본, 1,557회, 입력 3,269,848 토큰, $0.1373
- 2라운드(04:51 등록): 임계값 적합과 봉인한 최종 표본 1회 평가, 1,726회, 입력 3,974,285 토큰, $0.1669
- 3라운드(06:34 등록): 앞 두 라운드가 쓰지 않은 노트로 사후 가설 2개 재시험, 277회, 입력 1,020,437 토큰, $0.0429
- 검색 후보 재선택은 세 라운드 모두 목록 1위를 앞섰고, frontmatter 규칙표를 먼저 쓰자는 가설은 새 폴더에서 유지되지 않았습니다.
- 낮, 서비스 반영. 바뀐 곳은 모두 제안만 내고 볼트에 쓰지 않으며, 키가 없거나 호출이 실패하면 원래 절차로 돌아갑니다.
반영한 것
- 명령줄 도구에 검색 재선택(retrieve), 87분류 top-3 제안(classify), 프로젝트 제안(project) 명령 추가. 테스트 90개 통과, 실호출 스모크 14회, 입력 47,658 토큰, $0.0020. 시스템
- 볼트 질의 명령과 노트 인테이크 명령에 Jev shadow 단계 추가.
- CMDS 87개 서브카테고리 가운데 정의가 비어 있던 14개를 채움(소유자 확인 전).
- labs 페이지에 09-26 실측 절 추가, 12:09 배포(v1.2, 검토 전 표기).
- LLM Wiki의 Jev 항목에 현장 실측 절 추가, 신뢰도 표기는 low 유지.
- 실습 키트 v2: 입력 라우팅 3종과 검색 3종, 합성 요청 파일 6개. 실습
- 판단 영수증 뷰어: 호출 기록을 호출별 영수증으로 펼치고, 사람의 수락과 수정을 따로 내보내는 로컬 단일 HTML. 뷰어
- 16:53, 코드 백업. 실행 코드를 비공개 GitHub 저장소에 올렸습니다(커밋 8개).
- 16:57~17:02, 증거 정리. 실험 증거 파일 184개를 볼트 밖 아카이브로 옮기고 사본 187개의 해시를 대조했습니다. API 키 없이 분석을 다시 돌리는 재개 시험도 통과했습니다.
- 오후, 모션 영상 4부작 "제브와 지식관리". 시나리오를 확정하고 제작을 시작했습니다. EP1 판단만 하는 AI, EP2 만 개를 세 개로, EP3 규칙표가 무너진 날, EP4 여덟 모델, 같은 문제. 영상
- 02:38, 8모델 논리검증. 모델 로스터를 확인한 뒤 "지식 입력과 검색에서의 Jev" 패킷을 여덟 모델에 보내 7편을 블라인드로 채점했습니다. 상위 세 모델은 2.2점 안이라 동률로 읽습니다. 여덟 모델
Plan v2활용 계획 v2, 공개판
2026-09-25에 세 모델의 독립 기획, 익명 교차 검토, 블라인드 심사 2건을 거쳐 만든 계획 v2에 2026-09-26 실측을 겹쳐 고친 공개판입니다. 이 절의 순서와 다음 측정은 방향이며 일정 약속이 아닙니다.
지금 shadow로 붙이는 네 자리
주장하지 않는 것
- 사람 판단 대비 정확도, 검토 시간 절감, 일반적인 추천 품질 향상
- 메인 볼트 검색 성능(3라운드 검색 표적은 모두 위키 페이지)
- "찾는 노트가 없다"를 알려 준다는 것(표적 부재 때 "해당 없음" 0/5, 0/4)
- 실제 사용자 질문에서의 성능(질문은 생성 모델이 노트 설명을 보고 만든 것)
- 0.3 컷이 다른 과제에도 맞는다는 것
- 결정성(조건마다 1회 실행), 제공사의 속도 비교, "환각 0"
- 커뮤니티 사례의 속도, 비용, 정확도(작성자 주장이며 재현하지 않음)
그다음 순서: 기반, 첫 운영 적용 후보, 다음 물결, 보류, 기각
근거: 세 라운드 재시도 0, 차단해야 하는 테스트 입력 35개 모두 차단 (2026-09-26)
근거: 채점 재현 confidence 0.7 이상 97.4% (n=38, 2026-09-24). 컷 값은 옮기지 않습니다.
근거: 문의 메일 가상 5통은 모두 confidence 0.96 이상이라 저확신 분기는 미검증 (2026-09-24)
판단 원칙 13개
- 제안은 Jev, 실행은 코드와 사람(PROPOSE). Jev의 답은 제안 필드로만 저장하고, 실행 코드와 제안 필드를 직접 잇지 않습니다.
- 정답은 사람이 만듭니다. 모델끼리의 합의는 정답이 아닙니다. 사람은 Jev 답을 보기 전에 판정하고, 기존 메타데이터는 재현 대상일 뿐 골드가 아닙니다.
- 상시 호출하지 않습니다. 에이전트가 문서를 읽고 부르는 경로가 아니라 코드가 직접 부르고, 후보 풀이 클 때만 켭니다.
- 컷은 모양만 옮기고 값은 과제마다 고릅니다. 같은 confidence 0.7 이상 구간이 채점 재현에서 97.4%(n=38), 87분류에서 61.5%(n=13)였습니다(2026-09-24). 검색 유지 집합에서 2라운드에 고른 0.5는 최종 표본에서 43/50으로 떨어졌고, 등록 전에 고정한 0.3은 3라운드에서 44/45를 지켰습니다(2026-09-26).
- 경계 동률과 역순 불일치는 보류입니다. 1위와 2위가 같거나, 선택지 순서를 뒤집어 다시 물었을 때 답이 바뀌면 답하지 않습니다. 3라운드 검색에서 이 규칙을 걸면 49건 중 46건에 답했고 그중 43건이 맞았습니다(2026-09-26).
- Noul에는 confidence가 없습니다. Choice와 Score용 게이트를 Noul에 씌우지 않고, 세 척도의 확률을 더하거나 곱하지 않습니다.
- 개인정보 필터는 샘플링 전에, 그리고 전송 직전 조립된 payload 전체에 겁니다. 제목과 설명만 보는 필터는 본문 머리의 정보를 놓칩니다. API로 보내도 되는 자료와 공개해도 되는 자료는 다르므로 화면, 영상, 페이지, 내보낸 로그에는 두 번째 경계를 둡니다.
- Jev 없는 기준선을 모든 비교에 남깁니다. 가장 흔한 분류, 규칙표, 검색 목록 1위, 로컬 검색 1위를 같은 항목에 붙이고, 코드만으로 된 구성이 더 나으면 그것을 씁니다.
- 보류는 공짜가 아닙니다. 보류와 역순 게이트는 사람이 다시 볼 양을 늘리므로 보류 건당 검토 시간을 비용에 넣습니다.
- 요청 크기 이중 상한을 코드가 먼저 잽니다. 요청 전체 64k 토큰, 개별 판단 32k 토큰. 넘으면 관련 부분만 추출하고, 그래도 넘으면 호출하지 않습니다.
- 모든 호출은 영수증을 남깁니다. 요청 모델, 응답 모델, 보낸 payload의 해시, 두 순서의 확률 분포, 결정과 이유를 적고, shadow 로그에 사람의 최종 선택과 같은 행으로 둡니다. 로그는 검색 색인 밖에 둡니다.
- 결과를 보고 세운 가설은 새 데이터로 다시 잽니다. 사전 등록, 봉인한 최종 표본, 새 데이터 재시험을 한 묶음으로 씁니다.
- 실패 방향을 먼저 정합니다. 제안 기능은 fail-open(제안 없이 원래 화면), 공개, 발행, 권한, 셸 명령은 fail-closed입니다. 응답 모델이 핀과 다르면 제안을 버립니다.
다음 측정 6단계 (계획)
Inventory이 사이트에 담긴 것
구요한이 직접 실행하고 잰 기록입니다. 수치는 페이지마다 적은 측정일 기준입니다.
- 기간
- 2026-09-15부터 2026-09-26까지 (KST)
- Jev 호출
- 첫 실측 341회($0.0309, 2026-09-24), 세 라운드 3,560회($0.3471, 2026-09-26). 모델은 jev-1.13.0 하나입니다.
- 모델 비교
- 7모델(2026-09-24)과 8모델(2026-09-26) 논리검증. 정답 키를 먼저 잠근 블라인드 채점입니다.
- 공개 자료
- 가상 데이터로 쓴 합성 요청 파일 6개, 판단 영수증 뷰어, 사례 다섯 개, 2026-09-24 공개 강연 요약, 영상 4부작(2026-09-26 기준 제작 중)
- 비공개
- 실행 코드 저장소. 이 사이트는 명령의 입출력 규약과 설계를 설명합니다.
- 주장하지 않는 것
- 사람 판단 대비 정확도와 검토 시간 절감. 사람이 새로 만든 정답은 2026-09-26 기준 0건입니다.