모션 영상 4부작

제브와 지식관리

제안은 제브가, 실행은 제가.

TypeSafe의 판단 모델 Jev(제브)를 10,000+ 노트 볼트의 검색과 분류에 붙여 실행하고 잰 4부작 모션 시리즈입니다. 편마다 로그라인, 대본 발췌, 영상에 나오는 수치와 그 한계를 적었습니다.

EP 01판단만 하는 AI

Impact목표 60~80초, 나레이션 녹음 기준 약 1:13측정

영상

글을 쓰지 않고 판단만 돌려주는 TypeSafe의 System One 모델, 제브를 소개합니다. 첫 실측 341회 호출에서 응답 시간 중앙값은 0.52초, 총비용은 약 $0.03이었습니다. 저는 여기서 원칙 하나를 세웠습니다: 제안은 제브가 하고, 실행은 코드와 제가 합니다.

대본 발췌

글을 한 줄도 쓰지 않는 AI가 있습니다. 이 모델은 판단만 합니다.

TypeSafe가 9월 15일에 공개한 System One 판단 모델, 제브입니다. 문장을 만드는 대신, 판단 하나를 돌려줍니다.

영상 속 수치와 근거

  • 판단 형태 세 가지: Choice는 주어진 선택지마다 확률, Noul은 예 아니오의 확률, Score는 기준에 따른 점수를 돌려줍니다.
  • 341회 호출( 첫 실측): 응답 시간 중앙값 0.52초, 총비용 약 $0.03
  • 요금은 입력 토큰에만 붙습니다: 입력 100만 토큰당 $0.042, 출력 무료
  • 모든 호출은 영수증(보낸 질문, 선택지 순서를 뒤집은 두 결과, 결정과 이유)과, 제가 최종으로 고른 답을 적는 섀도 로그를 남깁니다.

한계: 341회는 하루치 첫 실측 표본이고, 응답 시간은 그날 제 환경에서 잰 값입니다.

판단층 설계와 영수증 보기

EP 02만 개를 세 개로

Explain약 2분, 3분 이내, 나레이션 녹음 기준 약 1:46측정

영상

검색은 후보를 넓게 찾고, 제브는 그중 읽을 노트를 고릅니다. 세 라운드 실측에서 처음 보는 위키 질문 49개 중 제브가 고른 노트는 44개가 정답이었고, 후보 목록 1위는 16개였습니다. 기준 0.3의 킵셋(유지 집합) 필터는 후보를 평균 17.55개에서 2.39개로 줄이면서 정답 45개 중 44개를 남겼습니다.

대본 발췌

제 볼트에는 10,000+ 노트가 있습니다. 검색은 후보를 많이 찾아 주지만, 무엇부터 읽을지는 정해 주지 않습니다.

그래서 역할을 나눴습니다. 검색이 후보 목록을 만들고, 제브가 그중 읽을 노트를 고릅니다. 10,000+ 노트가 두세 개로 줄어드는 과정입니다.

챕터시각은 나레이션 녹음 기준 근사치

  1. 01세 라운드로 잰다사전 등록, 봉인, 새 데이터0:15
  2. 02제브가 고른 노트후보 목록 1위와 비교0:37
  3. 03읽을 것만 남긴다킵셋 필터, 기준 0.30:57
  4. 04정답이 없을 때없다고 말하지 않는다1:13

영상 속 수치와 근거

  • 세 라운드(사전 등록, 봉인한 최종 분할, 새 데이터 재시험) 합계 3,560회 호출, 입력 8,264,570 토큰, 총비용 $0.35, 오류 0, 모델 jev-1.13.0 고정 ()
  • 처음 보는 위키 질문: 제브 재선택 44/49, 후보 목록 1위 16/49 (3라운드, )
  • 한국어 질문 봉인 최종: 제브 45/55, 목록 1위 30/55, 로컬 qmd query 26/55 (2라운드, )
  • 킵셋 필터 기준 0.3: 후보 평균 17.55개에서 2.39개로 86.4% 감소, 정답 45개 중 44개 유지 (95% 구간 88.4~99.6%, )

한계: 정답이 후보 안에 없을 때 제브가 '없음'을 고른 경우는 3라운드 4번 중 0번, 2라운드 5번 중 0번이었습니다. 그래서 이 경우에는 항상 원래 후보 목록으로 돌아갑니다. 정답은 볼트에 이미 적혀 있던 메타데이터이며, 사람이 새로 판정한 정답은 기준 0건입니다. 결과는 이 볼트와 이 질문 세트의 값입니다.

검색 후보 재선택과 유지 집합 결과 보기

EP 03규칙표가 무너진 날

Explain약 2분, 3분 이내, 나레이션 녹음 기준 약 1:58측정

영상

CMDS 87개 소분류로 노트를 분류할 때, 칸 이름만 주면 120개 중 24개(20.0%), 모든 칸에 정의 한 줄을 붙이고 형식부터 보게 하면 91개(75.8%)가 맞았습니다. 같은 데이터에서 120개 중 101개를 맞혀 가장 좋아 보였던 타입 기반 규칙표는, 처음 보는 폴더에서 27개 중 1개만 맞혔습니다. 결과를 보고 세운 가설은 새 데이터로 다시 잽니다.

대본 발췌

새 노트가 들어오면 어느 칸에 넣을지, 판단 모델 제브에게 물어봤습니다.

칸은 폴더가 아니라 메타데이터입니다. 아홉 개 대분류 아래 여든일곱 개 소분류가 있습니다.

챕터시각은 나레이션 녹음 기준 근사치

  1. 01이름만 줬을 때87개 칸의 이름0:16
  2. 02가장 좋아 보였던 규칙타입으로 분류를 정한다0:48
  3. 03새 폴더에서 무너지다처음 보는 데이터1:03
  4. 04제브는 후보 셋만마지막 선택은 나1:28

영상 속 수치와 근거

  • 칸 이름만: 24/120 (20.0%). 모든 칸 정의 한 줄과 형식 먼저 지시: 91/120 (75.8%, 95% 구간 67.5~82.6%) (2라운드, )
  • type 기반 규칙표: 2라운드 101/120, 처음 보는 폴더 1/27 (3라운드, )
  • 처음 보는 폴더, 같은 설명을 준 제브: 28/65 (43.1%, 95% 구간 31.8~55.2%). 규칙을 먼저 쓰고 제브를 뒤에 붙인 방식: 20/65 (3라운드, )
  • 프로젝트 폴더 라우팅: README 설명 한 줄 추가 후 78/80 (97.5%, 2라운드, )
  • 운영 방식: 제브는 후보 칸 셋을 제안하고, 최종 선택은 제가 하며, 그 선택을 다음 측정의 정답으로 기록합니다.

한계: 처음 보는 폴더에서 규칙표(1/27)와 제브(28/65)는 분모가 달라 같은 문항 위의 맞대결로 읽지 않습니다. 메인 볼트와 위키를 가르는 판단은 분할에 따라 63.8%(2라운드 최종 51/80)에서 80.0%(1라운드 설계 32/40) 사이라 아직 맡기지 않습니다. 정답은 볼트에 이미 적혀 있던 메타데이터입니다.

87분류와 라우팅 결과 보기

EP 04여덟 모델, 같은 문제

Impact목표 70~90초, 나레이션 녹음 기준 약 1:12측정

영상

제브 실험 기록을 한 묶음의 문제지로 만들어 프런티어 모델 여덟 개에게 똑같이 건넸습니다. 답안 키가 있는 논리 문항과 10축 루브릭으로 이름을 가리고 채점했고, 반박 검토자가 결과를 다시 공격했습니다. 답안을 낸 일곱 모델 중 상위 셋은 2.2점 안에 모인 동률권이었고, 논리 점수는 가까웠으며 순위를 가른 것은 이 볼트 맥락에 맞춘 실행 설계였습니다.

대본 발췌

제브 실험 기록을 한 묶음의 문제지로 만들어, 프런티어 모델 여덟 개에게 똑같이 건넸습니다.

문제지에는 정답이 정해진 논리 문항이 들어 있었습니다. 채점은 평가 축 열 개로, 누구 답인지 가리고 했고, 반박만 하는 검토자가 결과를 다시 공격했습니다.

영상 속 수치와 근거

모델가중총점 (100점 만점)
Grok 4.7동률권89.4
Claude Opus 5.5동률권88.6
GPT-6 Sol동률권87.2
GPT-6 Astra80.6
GPT-6 Luna64.0
Gemini 3.1 Pro57.7
Gemini 3.8 Flash56.0
Claude Fable 5.1답안 없음, 순위 밖

, 이 문제지 한 벌의 결과입니다. 동률권 표시를 단 상위 셋은 2.2점 안이고, 에 잰 재채점 분산 ±1.6과 겹쳐 동률로 읽습니다.

  • Claude Fable 5.1은 두 번의 시도 모두 실행 환경에서 작업이 중단돼 답안이 없습니다. 0점이 아니라 순위 밖입니다.

한계: 실험을 이끈 헤드 모델 Claude Opus 5.5가 보고서도 쓰고 채점, 반박, 조정도 맡았기 때문에, Opus 5.5의 2위는 독립 검증된 순위가 아닙니다. 블라인드 슬롯과 별도 반박자는 편향을 줄일 뿐 없애지 않습니다. 이 순위는 이 문제지 한 벌의 결과입니다.

여덟 모델 논리검증 전체 보기

읽는 법: 수치는 편마다 적은 측정일(한국 표준시) 기준입니다. 방법, 분모, 이 기록이 주장하지 않는 것은 실측 결과와 여덟 모델 페이지에 모두 적었습니다.

Upcoming다가오는 행사

요즘 제가 진행하는 세미나와 컨퍼런스입니다. 궁금하시면 오세요.