CMDS × Jev, 판단 모델 실측 기록, 2026-09-15부터 2026-09-26까지

Jev는 판단 부품이지 실행 주체가 아닙니다.

제안은 Jev가, 실행은 코드와 사람이 합니다.

글을 쓰지 않고 판단만 하는 모델 Jev를 10,000+ 노트 볼트의 입력과 검색에 붙였습니다. 검색 후보를 고르는 자리에서 가장 강했고, 새 노트를 분류하는 자리에서는 후보 셋을 제안하는 데서 멈췄습니다.

Numbers헤드라인 숫자

2026-09-26 새벽 세 라운드, Jev 3,560회 호출에서 나온 숫자입니다. 숫자마다 분모와 비교 대상을 붙였습니다.

검색 후보 재선택
44/49

처음 보는 위키 질문에서 Jev가 고른 후보가 찾던 페이지였던 수

같은 후보 목록의 1위는 16/49

2026-09-26, 3라운드

유지 집합 필터
44/45

유지 집합 필터(Noul 컷 0.3)가 지킨 정답 페이지 수

후보 평균 17.55개가 2.39개로 줄어듦

2026-09-26, 3라운드

87분류, 새 폴더
28/65

처음 보는 폴더에서 87개 서브카테고리 1순위 재현

같은 조건의 2라운드 최종 표본은 91/120

2026-09-26, 3라운드

세 라운드 비용
$0.3471

세 라운드 전체 비용

3,560회 호출, 입력 8,264,570 토큰, 입력 100만 토큰당 $0.042

2026-09-26 03:22~06:36 (KST)

읽는 법. 모든 수치는 볼트에 이미 적힌 분류와 위치를 얼마나 재현하는지이고, 사람이 새로 만든 정답은 2026-09-26 기준 0건입니다. 모델은 jev-1.13.0 하나, 조건마다 1회 실행했습니다. 라운드별 수치 보기

Video영상 4부작, 제브와 지식관리

TypeSafe의 판단 모델 Jev를 10,000+ 노트 볼트의 검색과 분류에 붙여 실행하고 잰 4부작 모션 시리즈입니다. 2026-09-26 기준 네 편 모두 제작 중입니다.

제작 중 EP1 판단만 하는 AI 목표 60~80초

1편

판단만 하는 AI

글을 쓰지 않고 판단만 돌려주는 TypeSafe의 System One 모델, 제브를 소개합니다. 2026-09-24 첫 실측 341회 호출에서 응답 시간 중앙값은 0.52초, 총비용은 $0.0309였습니다. 저는 여기서 원칙 하나를 세웠습니다: 제안은 제브가 하고, 실행은 코드와 제가 합니다.

341회는 하루치 첫 실측 표본이고, 응답 시간은 그날 제 환경에서 잰 값입니다.

  1. EP1판단만 하는 AI
  2. EP2만 개를 세 개로
  3. EP3규칙표가 무너진 날
  4. EP4여덟 모델, 같은 문제
4부작 소개 보기

Map둘러보기

페이지마다 하나의 질문을 다룹니다.

Timeline타임라인

2026-09-15 공개부터 2026-09-26 서비스 반영까지입니다. 시각은 한국 표준시(KST) 기준입니다.

  1. Jev 공개

    • TypeSafe가 System One 판단 모델 Jev를 early access로 공개했습니다. 모델 버전 jev-1.13.0, 가격은 입력 100만 토큰당 $0.042이고 출력 요금은 없습니다. 같은 날 DCVC가 $40M Series Seed를 발표했습니다.
  2. 조사와 첫 판정

    • AI 조사 세션 7개로 공개 자료를 모았고, 결과가 나온 5개를 바탕으로 판단을 세웠습니다. 판정은 PROPOSE, PoC는 미실행이었습니다.
    • 첫 후보 셋: 노트 분류 제안, 문서와 주장의 관계 판정, 검색 후보 재정렬.
  3. 7모델 논리검증, 첫 실측, 공개 발표

    • 낮, 7모델 논리검증. 같은 패킷(사실 원장, 논리 문항 10개, 설계 과제)을 일곱 모델에 주고, 정답 키와 위반 목록을 먼저 잠근 뒤 블라인드로 채점했습니다.
      점수와 비용
      • 밴드 A: Claude Opus 5.5 94.0, GPT-6 Astra 92.4, Claude Fable 5.1 91.6, Grok 4.7 91.5, GPT-6 Sol 91.4
      • 밴드 B와 C: Gemini 3.8 Flash 77.4, Gemini 3.1 Pro 69.4
      • 논리 문항 10개 합계 69/70. 점수가 갈린 문항은 하나였고, 순위를 가른 것은 스스로 선언한 권한 경계를 지켰는가였습니다.
      • 비용: 실제 청구액 $0(구독 쿼터 사용). 공식 단가로 환산하면 밴드 A 안에서 GPT-6 Sol $0.1739, Claude Fable 5.1 $1.5688로 9배 차이입니다.
      • 산출: 코드와 규칙, Jev, 생성 LLM, 사람의 4층 프레임과 23행 활용 포트폴리오.
    • 17:29~17:32, 첫 실측. 341회 호출, 오류 0, 재시도 0, 입력 736,861 토큰, $0.0309. 호출 지연 p50 0.524초, p95 0.632초.
      과제별 수치
      • 채점 재현(Score, 70건): 전체 일치 51/70(72.9%), confidence 0.7 이상 구간 37/38(97.4%, 이 구간은 70건 중 38건), 질문 역순에도 답 불변 69/70(98.6%).
      • CMDS 87분류(Choice, 109건): 1순위 56/109(51.4%), 선택지 역순에서 답이 바뀐 건 29/109(26.6%), 상위 9분류만 줬을 때 23/109(21.1%), confidence 0.7 이상 구간 8/13(61.5%).
      • 같은 confidence 컷이 과제에 따라 97.4%(37/38)와 61.5%(8/13)로 갈린다는 것을 확인했습니다.
    • 저녁, AI & Beyond 목요 세션 발표. 24분 호스트 데모 가운데 Jev의 정의, Playground 시연, 볼트 라우팅 계획을 보였고, 이어서 Jev 활용 아이디어를 14분 동안 토론했습니다. 활성 프로젝트만 선택지로 쓰는 동적 선택지, 필요할 때만 켜는 발동 방식, 앞단 게이트 같은 아이디어가 나왔습니다. 강연 요약
    • 공개 학습 페이지. labs.cmdspace.work/jev/ 공개(검색엔진 비색인). 핵심 용어, 호출 흐름, 커뮤니티 사례 26건, 약점 9종의 설계 규칙을 담았습니다.
    • 실행 코드 첫 판. 모델 핀, 예산 상한, 422 무재시도, 호출 영수증을 갖춘 호출기와 판단 모듈 4개, 테스트 32개.
  4. 아이디어 원장과 계획 v2

    • 아이디어 원장 64행. 09-15부터 모인 Jev 활용 아이디어를 한 표로 묶었습니다. 코드 있음 19, 설계만 25, 발언만 20.
    • 익명화 패킷. 사람 이름, 고객, 로컬 경로를 뺀 패킷(47,225 bytes)을 만들었습니다.
    • 22:41, R1 독립 기획. GPT-6 Astra, GPT-6 Sol, Grok 4.7이 같은 패킷으로 활용 계획을 따로 썼습니다.
    • 23:09, R2 익명 교차 검토. 각 모델이 다른 두 편을 이름 없이 받아 비평했습니다.
    • 블라인드 심사 2건. GPT-6 Astra 85.0, Grok 4.7 84.0, GPT-6 Sol 77.0. 같은 계획서에 두 심사가 준 점수 차가 2~4점이라 앞 두 편은 동률로 읽습니다.
    • 계획 v2. 헤드 모델이 기여 단위로 채택했습니다. 64행 판정은 지금 20, 단기 데모 4, 다음 물결 15, 보류 20, 기각 5이고, 세 모델이 같았던 행은 45/64입니다. 사실 정정 16건을 기록했고 판단 원칙 8개를 더했습니다. 공개판 보기
  5. 8모델 논리검증, 세 라운드 실측, 서비스 반영

    • 02:38, 8모델 논리검증. 모델 로스터를 확인한 뒤 "지식 입력과 검색에서의 Jev" 패킷을 여덟 모델에 보내 7편을 블라인드로 채점했습니다. 상위 세 모델은 2.2점 안이라 동률로 읽습니다. 여덟 모델
      순위와 한계
      • Grok 4.7 89.4, Claude Opus 5.5 88.6, GPT-6 Sol 87.2: 2.2점 안이라 동률로 읽습니다(이틀 전 재채점 분산 ±1.6).
      • GPT-6 Astra 80.6, GPT-6 Luna 64.0, Gemini 3.1 Pro 57.7, Gemini 3.8 Flash 56.0.
      • Claude Fable 5.1은 두 번 시도에서 본문이 나오지 않아 순위 밖입니다.
      • 헤드 모델, 채점자 두 명, 반박자, 조정자가 모두 Claude Opus 5.5라 Opus 5.5의 2위는 독립 검증된 순위가 아닙니다.
      • Jev 기능을 틀리게 서술한 위반은 일곱 편 모두 0건입니다.
    • 03:22~06:36, Jev API 세 라운드. 라운드마다 첫 호출 전에 절차를 등록했습니다. 합계 3,560회, 입력 8,264,570 토큰, $0.3471(미리 건 상한 1,500만 토큰의 55.1%). 전부 HTTP 200, 재시도 0, 볼트 쓰기 0. 실측 결과
      라운드별 수치
      • 1라운드(03:22 등록): 설계와 임계값 표본, 1,557회, 입력 3,269,848 토큰, $0.1373
      • 2라운드(04:51 등록): 임계값 적합과 봉인한 최종 표본 1회 평가, 1,726회, 입력 3,974,285 토큰, $0.1669
      • 3라운드(06:34 등록): 앞 두 라운드가 쓰지 않은 노트로 사후 가설 2개 재시험, 277회, 입력 1,020,437 토큰, $0.0429
      • 검색 후보 재선택은 세 라운드 모두 목록 1위를 앞섰고, frontmatter 규칙표를 먼저 쓰자는 가설은 새 폴더에서 유지되지 않았습니다.
    • 낮, 서비스 반영. 바뀐 곳은 모두 제안만 내고 볼트에 쓰지 않으며, 키가 없거나 호출이 실패하면 원래 절차로 돌아갑니다.
      반영한 것
      • 명령줄 도구에 검색 재선택(retrieve), 87분류 top-3 제안(classify), 프로젝트 제안(project) 명령 추가. 테스트 90개 통과, 실호출 스모크 14회, 입력 47,658 토큰, $0.0020. 시스템
      • 볼트 질의 명령과 노트 인테이크 명령에 Jev shadow 단계 추가.
      • CMDS 87개 서브카테고리 가운데 정의가 비어 있던 14개를 채움(소유자 확인 전).
      • labs 페이지에 09-26 실측 절 추가, 12:09 배포(v1.2, 검토 전 표기).
      • LLM Wiki의 Jev 항목에 현장 실측 절 추가, 신뢰도 표기는 low 유지.
      • 실습 키트 v2: 입력 라우팅 3종과 검색 3종, 합성 요청 파일 6개. 실습
      • 판단 영수증 뷰어: 호출 기록을 호출별 영수증으로 펼치고, 사람의 수락과 수정을 따로 내보내는 로컬 단일 HTML. 뷰어
    • 16:53, 코드 백업. 실행 코드를 비공개 GitHub 저장소에 올렸습니다(커밋 8개).
    • 16:57~17:02, 증거 정리. 실험 증거 파일 184개를 볼트 밖 아카이브로 옮기고 사본 187개의 해시를 대조했습니다. API 키 없이 분석을 다시 돌리는 재개 시험도 통과했습니다.
    • 오후, 모션 영상 4부작 "제브와 지식관리". 시나리오를 확정하고 제작을 시작했습니다. EP1 판단만 하는 AI, EP2 만 개를 세 개로, EP3 규칙표가 무너진 날, EP4 여덟 모델, 같은 문제. 영상

Plan v2활용 계획 v2, 공개판

2026-09-25에 세 모델의 독립 기획, 익명 교차 검토, 블라인드 심사 2건을 거쳐 만든 계획 v2에 2026-09-26 실측을 겹쳐 고친 공개판입니다. 이 절의 순서와 다음 측정은 방향이며 일정 약속이 아닙니다.

판정PROPOSE 유지. 범위는 볼트에 쓰지 않는 shadow 실험입니다.병합, 이동, 삭제, 발행, 발송, 노출, 배포, 창 이동, 클릭은 Jev 성능과 무관하게 코드와 사람이 합니다. 좋은 결과가 바꾸는 것은 제안이 보이는 범위와 검토 순서뿐입니다.

지금 shadow로 붙이는 네 자리

검색 후보 재선택
Jev가 후보 목록과 "해당 없음" 중 하나를 Choice로 고르고, 순서를 뒤집어 한 번 더 답합니다. 보류나 오류면 원래 목록을 보이고, 읽을 노트는 사람이 확정합니다.
3라운드 44/49 대 목록 1위 16/49, 2라운드 최종 45/55 대 로컬 검색 1위 26/55 (2026-09-26)
유지 집합 필터
후보마다 "이 질문에 필요한가"를 Noul로 답하고, 0.3 초과만 남깁니다. 컷 변경은 새 라운드 등록으로만 합니다.
44/45 유지, 후보 17.55개에서 2.39개로 86.4% 축소 (2026-09-26)
새 노트 분류 후보
87개 서브카테고리와 정의를 받아 상위 3개를 제안합니다. 사람이 고르고 최종 선택을 로그에 기록하며, 자동 기입은 없습니다.
top-3 적중 2라운드 112/120, 3라운드 새 폴더 42/65 (2026-09-26)
활성 프로젝트 제안
허용된 프로젝트 목록 중 하나를 고릅니다. 프로젝트마다 README 설명 한 줄을 판단 재료로 넣고, 이동은 사람이 합니다.
이름만 69/80, 설명 추가 78/80 (2026-09-26)

주장하지 않는 것

그다음 순서: 기반, 첫 운영 적용 후보, 다음 물결, 보류, 기각
기반Jev 없음
예산 카운터, 모델 핀, 오류 처리(401 중단, 422 무재시도, 429와 529만 지수 백오프, 월 상한 도달 시 정지). 전송 규칙과 영수증: 금지 경로 규칙, 조립 payload 개인정보 검사, shadow 로그, 판단 영수증 뷰어. 위험한 셸 명령은 하드코딩 차단이 확률보다 먼저이고, Jev는 2차 의견만 냅니다.
근거: 세 라운드 재시도 0, 차단해야 하는 테스트 입력 35개 모두 차단 (2026-09-26)
첫 운영 적용 후보
문서와 주장의 관계 검증(지지, 반박, 근거 없음, 보류 중 하나). 인용문 존재는 문자열 검색이, 상태 갱신은 사람이 합니다. 평가 제출물의 기준별 증거 심사는 제출자 동의가 있는 자료만 쓰며, 설계 단계입니다.
근거: 채점 재현 confidence 0.7 이상 97.4% (n=38, 2026-09-24). 컷 값은 옮기지 않습니다.
다음 물결
설명과 태그의 의미 검증, 의미 모순 점검, 스킬 오발동 경고, 발행 게이트, 에이전트 복잡도 게이트, 문의 메일 분류, 공지 변경 감지. 충돌 쌍과 변경분은 코드가 먼저 찾고, 발행 게이트는 fail-closed입니다.
근거: 문의 메일 가상 5통은 모두 confidence 0.96 이상이라 저확신 분기는 미검증 (2026-09-24)
보류
메인 볼트 대 위키 라우팅은 사람 골드 대기열만 둡니다(2라운드 최종 51/80, 63.8%, 순서에 따라 답이 바뀐 7건, 2026-09-26). 세션 로그 분류, 창 배치 제어, 클릭 판정, Score 기반 노출은 허용 메타데이터 범위와 가치 측정이 먼저이고, 실행 권한은 넘기지 않습니다.
기각
상위 9분류로 먼저 거르는 깔때기(23/109, 21.1% 대 87분류 56/109, 51.4%, 2026-09-24). 인물 노트 라우팅과 학생 음성 전사 태깅(전송 금지 경로, 정책). 실시간 오디오 경로(약 0.5초 판단과 3ms 동기는 다른 문제).
판단 원칙 13개
  1. 제안은 Jev, 실행은 코드와 사람(PROPOSE). Jev의 답은 제안 필드로만 저장하고, 실행 코드와 제안 필드를 직접 잇지 않습니다.
  2. 정답은 사람이 만듭니다. 모델끼리의 합의는 정답이 아닙니다. 사람은 Jev 답을 보기 전에 판정하고, 기존 메타데이터는 재현 대상일 뿐 골드가 아닙니다.
  3. 상시 호출하지 않습니다. 에이전트가 문서를 읽고 부르는 경로가 아니라 코드가 직접 부르고, 후보 풀이 클 때만 켭니다.
  4. 컷은 모양만 옮기고 값은 과제마다 고릅니다. 같은 confidence 0.7 이상 구간이 채점 재현에서 97.4%(n=38), 87분류에서 61.5%(n=13)였습니다(2026-09-24). 검색 유지 집합에서 2라운드에 고른 0.5는 최종 표본에서 43/50으로 떨어졌고, 등록 전에 고정한 0.3은 3라운드에서 44/45를 지켰습니다(2026-09-26).
  5. 경계 동률과 역순 불일치는 보류입니다. 1위와 2위가 같거나, 선택지 순서를 뒤집어 다시 물었을 때 답이 바뀌면 답하지 않습니다. 3라운드 검색에서 이 규칙을 걸면 49건 중 46건에 답했고 그중 43건이 맞았습니다(2026-09-26).
  6. Noul에는 confidence가 없습니다. Choice와 Score용 게이트를 Noul에 씌우지 않고, 세 척도의 확률을 더하거나 곱하지 않습니다.
  7. 개인정보 필터는 샘플링 전에, 그리고 전송 직전 조립된 payload 전체에 겁니다. 제목과 설명만 보는 필터는 본문 머리의 정보를 놓칩니다. API로 보내도 되는 자료와 공개해도 되는 자료는 다르므로 화면, 영상, 페이지, 내보낸 로그에는 두 번째 경계를 둡니다.
  8. Jev 없는 기준선을 모든 비교에 남깁니다. 가장 흔한 분류, 규칙표, 검색 목록 1위, 로컬 검색 1위를 같은 항목에 붙이고, 코드만으로 된 구성이 더 나으면 그것을 씁니다.
  9. 보류는 공짜가 아닙니다. 보류와 역순 게이트는 사람이 다시 볼 양을 늘리므로 보류 건당 검토 시간을 비용에 넣습니다.
  10. 요청 크기 이중 상한을 코드가 먼저 잽니다. 요청 전체 64k 토큰, 개별 판단 32k 토큰. 넘으면 관련 부분만 추출하고, 그래도 넘으면 호출하지 않습니다.
  11. 모든 호출은 영수증을 남깁니다. 요청 모델, 응답 모델, 보낸 payload의 해시, 두 순서의 확률 분포, 결정과 이유를 적고, shadow 로그에 사람의 최종 선택과 같은 행으로 둡니다. 로그는 검색 색인 밖에 둡니다.
  12. 결과를 보고 세운 가설은 새 데이터로 다시 잽니다. 사전 등록, 봉인한 최종 표본, 새 데이터 재시험을 한 묶음으로 씁니다.
  13. 실패 방향을 먼저 정합니다. 제안 기능은 fail-open(제안 없이 원래 화면), 공개, 발행, 권한, 셸 명령은 fail-closed입니다. 응답 모델이 핀과 다르면 제안을 버립니다.
다음 측정 6단계 (계획)
사람 골드 먼저
순서를 뒤집어 물었을 때 답이 갈린 7건과 3라운드 불일치 묶음을 판정하고, 판정 시간을 함께 잽니다. 이후에는 shadow 로그의 사람 최종 선택 칸이 골드가 됩니다.
검색 기권 측정
표적을 일부러 뺀 단위 10개 이상으로 "해당 없음"을 따로 잽니다.
결정성
같은 payload를 반복해 답이 얼마나 흔들리는지 잽니다.
규칙표 재설계
폴더별로 정밀도를 확인한 규칙 행만 쓰고, 등록 뒤 새로 생긴 노트로만 검증합니다.
정식 PoC 500건
설계 100, 임계값 100, 최종 300으로 나누고, 최종 표본은 한 번만 채점해 Wilson 95% 구간을 붙입니다. Brier와 ECE는 구간 수를 미리 고정합니다.
HOLD 규칙
라벨링 담당(500건 약 8.3시간, 추정)을 정하지 못하면 정식 PoC는 HOLD하고, 교육 자산과 위생 장치, shadow만 유지합니다.

Inventory이 사이트에 담긴 것

구요한이 직접 실행하고 잰 기록입니다. 수치는 페이지마다 적은 측정일 기준입니다.

기간
2026-09-15부터 2026-09-26까지 (KST)
Jev 호출
첫 실측 341회($0.0309, 2026-09-24), 세 라운드 3,560회($0.3471, 2026-09-26). 모델은 jev-1.13.0 하나입니다.
모델 비교
7모델(2026-09-24)과 8모델(2026-09-26) 논리검증. 정답 키를 먼저 잠근 블라인드 채점입니다.
공개 자료
가상 데이터로 쓴 합성 요청 파일 6개, 판단 영수증 뷰어, 사례 다섯 개, 2026-09-24 공개 강연 요약, 영상 4부작(2026-09-26 기준 제작 중)
비공개
실행 코드 저장소. 이 사이트는 명령의 입출력 규약과 설계를 설명합니다.
주장하지 않는 것
사람 판단 대비 정확도와 검토 시간 절감. 사람이 새로 만든 정답은 2026-09-26 기준 0건입니다.

Upcoming다가오는 행사

요즘 제가 진행하는 세미나와 컨퍼런스입니다. 궁금하시면 오세요.