여덟 모델 논리검증, 2026-09-26 한 번 실행

8모델 논리검증: 같은 과제, 블라인드 채점, 그리고 실측

저는 Jev(TypeSafe System One)를 CMDS 지식 입력과 검색의 어디에 쓸지 정하려고, 같은 과제를 최신 모델 여덟 개에 동시에 맡겼습니다. 논리력은 닫힌 정답으로 재고, 모델이 낸 설계는 그대로 믿지 않고 같은 날 Jev API를 세 라운드 3,560회 호출해 직접 쟀습니다. 모든 수치는 2026-09-26(KST) 한 번 실행한 결과이고, 분모를 함께 적었습니다.

순위
2.2점
상위 세 모델은 동률권입니다
Grok 4.7, Claude Opus 5.5, GPT-6 Sol의 총점이 2.2점 안에 있습니다. 논리 블록만 보면 상위 넷이 1.6점 안입니다.
실측
2번
입력 쪽 합의는 새 자료에서 틀렸습니다
검색 쪽 설계는 세 라운드 실측에서 모두 지지됐습니다. 모델 합의는 증거가 아닙니다.

01 Method무엇을 시험했나

같은 패킷, 미리 쓴 루브릭, 닫힌 정답 문항, 이름을 가린 채점입니다.

같은 패킷, 여덟 모델

여덟 모델은 모두 같은 프롬프트(52,202자)를 받았고, 동일성은 해시로 확인했습니다. 패킷에는 과제, Jev 공개 사양과 문서화된 약점 9종, 09-24 첫 실측 결과, CMDS 구조, 볼트 메타데이터로 만든 실행 가능 자료 네 세트(분류, 메인 대 위키, 검색, 프로젝트 라우팅), 그리고 논리 문항 10개가 들어 있었습니다.

모델reasoning effort제출
GPT-6 Astraxhigh제출
GPT-6 Solxhigh제출
GPT-6 Lunahigh제출
Grok 4.7high1차 실패(HTTP 500, 503, 503), 같은 프롬프트로 재시도해 제출
Gemini 3.8 Flashhigh제출
Gemini 3.1 Pro (preview)high제출
Claude Opus 5.5high제출 (헤드와 같은 모델)
Claude Fable 5.1high미제출 (두 번 모두 본문 없이 종료)
effort가 같지 않았습니다. GPT-6 Astra와 GPT-6 Sol만 xhigh였으므로, 모델 간 차이에는 effort 차이가 섞여 있습니다. 헤드는 실험을 이끈 모델이고 Claude Opus 5.5입니다. 이 모델이 보고서도 쓰고 채점, 반박, 조정도 맡았습니다.

10축 루브릭, 논리가 절반 이상

채점 기준은 여덟 편의 보고서가 존재하기 전(03:20 KST)에 썼고, 보고서를 읽은 뒤에는 고치지 않았습니다. 논리 블록이 100점 중 54점으로 절반을 넘도록 설계했습니다. 화려한 아이디어가 논리 결함을 덮지 못하게 하려는 의도입니다.

왼쪽부터 논리 54, 맥락 23, 실행 14, 품질 9. 합 100점.

논리54
  • L1논리 정확성P1~P10 문항 합에서 Tier A 위반 수를 뺌26
  • L2사실 충실성패킷 사실과 어긋난 서술 감점16
  • L3경계 판단코드, Jev, 생성 LLM, 사람 사이의 역할 배정12
맥락23
  • C1CMDS 지식 시스템 적합성9
  • C2아이디어 레버리지7
  • C3지식 입력과 검색 설계 품질7
실행14
  • E1사전 등록 실험의 실행 가능성8
  • E2리스크와 데이터 거버넌스6
품질9
  • Q1자기검토 정직성5
  • Q2문서 품질과 형식 준수4

닫힌 정답이 있는 논리 문항 10개

문항은 모두 패킷 안의 수치로 답이 닫히도록 만들었고, 정답 키를 따로 두었습니다. 문항마다 0, 0.5, 1점입니다.

  1. P1검색 필터의 토큰 비용과 예산 안 가능 여부
  2. P2요청 크기 한도 두 개를 동시에 지키는 분할
  3. P3한 과제의 임계값을 다른 과제로 옮기는 함정
  4. P4검색 끝단 정확도의 상한
  5. P5확률을 더하고 곱해도 되는 경우와 안 되는 경우
  6. P6파이프라인 단계를 코드, Jev, 생성 LLM, 사람에 배정
  7. P7외부 평가 수치를 결론으로 쓸 수 있는가
  8. P8처리량과 병목
  9. P9점진적 메타데이터 공개 설계
  10. P10순서 교차의 경제성

전제에 일부러 함정을 넣은 문항도 있습니다. 미검증 발언을 "확인된 대로"라고 적어 두거나, 예산 카운터와 실제 하드캡을 다르게 두는 식입니다. 전제를 그대로 받아들이면 감점입니다.

블라인드 채점의 순서

이름 가리기
여덟 보고서를 모델명이 지워진 슬롯(R1~R8)으로 감쌌습니다. 채점자는 영수증과 원본 파일을 열지 않았습니다.
논리 축 채점
채점자 A가 논리 축(L1~L3)을 정답 키로 채점했습니다.
맥락, 실행, 품질 축 채점
채점자 B가 C1~Q2를 채점했습니다.
반박
반박자가 위반 기록을 하나씩 다시 확인했고, 반박자가 확인한 위반만 남겼습니다.
조정과 블라인드 해제
헤드가 인용을 다시 읽고 조정(reconcile)한 뒤 블라인드를 풀었습니다.

비용은 채점이 끝난 뒤에 영수증을 열어 따로 계산했습니다. 채점 중에 영수증을 열면 블라인드가 깨지기 때문입니다. 실측 결과도 총점에 넣지 않았습니다. 결과를 보고 점수를 바꾸면 사후 편향이 되고, 논리력과 실험 결과는 다른 질문이기 때문입니다.

밴드

밴드조건쓰임
A총점 85 이상, 논리 블록 46 이상, Tier A 0건실험 설계의 기준 문서로 쓸 수 있음
B총점 70~84, 논리 블록 38 이상, Tier A 0건보완 뒤 참고
C총점 55~69, 또는 Tier A 1건사실과 경계 검증 없이 인용 금지
D총점 55 미만, 또는 Tier A 2건 이상참고 자료로 쓰지 않음

02 Ranking순위와 동률

가중총점 순서로 적고, 2점 안의 점수는 한 묶음으로 표시했습니다. 제출한 7편 기준, 2026-09-26입니다.

기준 문서는 논리 블록 순위를 먼저 보고하게 합니다. 논리 블록(만점 54)은 Grok 4.7과 GPT-6 Astra가 51.5로 공동 1위, GPT-6 Sol 50.2, Claude Opus 5.5 49.9, GPT-6 Luna 42.7, Gemini 3.8 Flash 37.0, Gemini 3.1 Pro 35.4 순입니다.

막대는 가중총점(0~100)이고, 눈금 세 개는 밴드 경계 55, 70, 85입니다.

여덟 모델의 가중총점, 논리 블록, 문항 합, 밴드. 동률권은 묶음으로 표시.
순위모델가중총점 (/100)논리 블록 (/54)문항 합 ΣP (/10)밴드
동률권: 이웃한 차 0.8점, 1.4점 (2점 안)
1Grok 4.7
89.4
51.5 (공동 1위)9.5A
2Claude Opus 5.5헤드 모델
88.6
49.9 (4위)9.5A
3GPT-6 Sol
87.2
50.2 (3위)9.0A
6.6점 간격 (87.2 → 80.6)
4GPT-6 Astra
80.6
51.5 (공동 1위)9.5B
16.6점 간격 (80.6 → 64.0)
5GPT-6 Luna
64.0
42.7 (5위)7.5C
동률권: 차 1.7점 (2점 안)
6Gemini 3.1 Pro
57.7
35.4 (7위)7.0C
7Gemini 3.8 Flash
56.0
37.0 (6위)7.0C
순위 밖Claude Fable 5.1
미제출, 0점이 아님
없음없음없음

Tier A(Jev 기능 허위 서술)는 제출한 7편 모두 0건입니다.

동률과 한계를 먼저 읽어 주세요

큰 간격은 두 곳입니다

문항별 점수

칸마다 0, 0.5, 1점입니다. 마지막 열은 제출한 7편의 평균입니다.

문항Grok 4.7Claude Opus 5.5GPT-6 SolGPT-6 AstraGPT-6 LunaGemini 3.1 ProGemini 3.8 Flash평균 (/1, n=7)
P1111100.510.79
P211111111.00
P3111110.510.93
P4110.5110.50.50.79
P511111111.00
P611111111.00
P711111111.00
P80.51110.50.50.50.71
P911110.50.500.71
P1010.50.50.50.50.500.50
ΣP (/10)9.59.59.09.57.57.07.08.43

1점0.5점0점

모델마다 한 문장

각 보고서에서 짧게 한 줄씩만 옮깁니다.

03 Cost비용, 공식 단가 환산

2026-09-26 한 번의 실행, 한 과제 기준입니다. 비용은 채점이 끝난 뒤에 열었습니다.

아래 금액은 실제 청구액이 아닙니다. 각 모델의 토큰 사용량(영수증 값)에 벤더 공식 단가($/1M tokens)를 곱한 공식 단가 환산액입니다. 같은 프롬프트를 한 번 입력한 토큰과 실제 청구 대상 출력 토큰으로 계산한 동등 비교 값입니다.

가중총점 (/100)

가로축은 공식 단가 환산액(로그 눈금), 세로축은 가중총점입니다. 가로선은 밴드의 총점 경계입니다. 정확한 값은 아래 표에 있습니다.
모델입력 tokens청구 출력 tokens (그중 추론)단가 입력 / 출력 ($/1M)환산액총점 (/100)총점 ÷ 환산액
Grok 4.730,935 (캐시 1,152)65,400 (45,081)2.00 / 6.00$0.452589.4198
Claude Opus 5.528,200 (추정)101,163 (31,092)4.00 / 20.00$2.136188.641
GPT-6 Sol27,17719,169 (3,167)2.00 / 10.00$0.246087.2354
GPT-6 Astra27,17720,404 (6,036)10.00 / 50.00$1.292080.662
GPT-6 Luna27,17716,011 (2,731)0.10 / 0.50$0.010764.05,968
Gemini 3.1 Pro28,30426,193 (7,136)2.00 / 12.00$0.370957.7156
Gemini 3.8 Flash28,30449,195 (13,507)0.75 / 3.75$0.205756.0272

계산에서 주의한 것

해석

같은 날 Jev API 실측 비용

모델 보고서와 별도로, 저는 Jev API를 세 라운드(r1, r2, r3) 직접 호출했습니다. Jev 과금은 입력 tokens × $0.042/1M이고 출력은 과금되지 않습니다.

라운드호출 (전부 HTTP 200)입력 tokens금액 (입력)
r11,5573,269,848$0.1373
r21,7263,974,285$0.1669
r32771,020,437$0.0429
합계3,5608,264,570$0.3471

04 Ideas채택한 아이디어와 출처

일곱 보고서의 아이디어를 중복끼리 묶고, 실측으로 판정할 수 있는 것은 실측으로 판정했습니다. 모델 이름은 그 아이디어를 보고서에 맞게 쓴 모델입니다.

역할을 나누는 원칙

실측으로 지지된 설계

운영 장치

귀속 표시에 헤드와 같은 모델 Claude Opus 5.5가 자주 등장합니다. 그래서 채택 여부는 가능한 한 실측으로 판정했고, 다음 절에 이 모델의 제안이 틀린 경우도 적었습니다.

05 Evidence모델 합의는 증거가 아니다

일곱 보고서는 모두 "도입하되 제안으로만(PROPOSE)"을 냈고, 여러 설계에서 의견이 모였습니다. 저는 그 합의를 결론으로 쓰지 않고 실측으로 확인했습니다.

실측을 어떻게 했나

제안과 실측의 대조

실행이 바꾼 것

합의가 틀린 방식

입력 쪽에서 합의는 두 번 틀렸습니다. 일곱 편의 합의(코드 압축 중심)는 r2에서, 헤드와 같은 모델의 제안(type 규칙표 우선)은 r3에서 새 자료에 무너졌습니다. 가장 정확했던 것은 다수 의견이 아니라 소수 경고였습니다. 검색 쪽에서는 상위 세 모델이 함께 쓴 설계가 세 라운드 내내 맞았고, 틀린 것은 기권 행동 하나였습니다. 합의의 크기와 실측의 방향은 서로 독립이었습니다.

말할 수 있는 것과 없는 것

말할 수 있는 것
각 조건 한 번 실행, 기존 메타데이터 재현 기준입니다.
  • 한국어 질의 검색에서 Jev 후보 재선택은 세 라운드 모두 후보 풀 1위를 앞섰습니다(r3 44/49 대 16/49).
  • 유지 집합 컷 0.3은 등록 전 고정값으로 새 표본의 표적 44/45를 평균 2.39개 안에 남겼습니다.
  • 정의가 빈 클래스에 정의와 형식 지시를 주면 재현이 크게 오릅니다(r2 24/120 → 91/120). 두 변경이 함께 바뀌어 기여는 가를 수 없습니다.
  • 87분류에서 확률로 자동 승인하면 안 됩니다(r3 확률 0.7 이상 구간 16/33).
말할 수 없는 것
  • 사람 판단 대비 정확도. 이 실험군의 사람 골드 라벨은 아직 0건입니다. 불일치는 볼트의 드리프트이거나 다른 타당한 라벨일 수 있습니다.
  • 결정성과 안정성. 한 모델 버전, 하루, 조건당 한 번이고 같은 요청을 반복하지 않았습니다.
  • 작은 n의 세밀한 차이. r3는 분류 65건, 검색 49단위이고 클래스 대부분이 1~9건입니다.
  • 메인 볼트 검색과 실제 사용자 질의. r3 검색 표적은 모두 위키 페이지이고, 한국어 질의는 한 모델이 description을 보고 만든 질문입니다.
  • 검토 시간 절감. 검토 분은 아직 잰 적이 없습니다.

06 Lessons이번 실행에서 배운 것

잘한 것을 먼저, 개선할 것을 다음에 적습니다.

잘한 것

개선할 것

Next이어서 보기

결과
세 라운드 사전 등록 실험
이 페이지의 실측 숫자를 과제별로 풀고 Wilson 95% 구간까지 적었습니다.
영상 4편
여덟 모델, 같은 문제
같은 문제지, 이름을 가린 채점, 동률권으로 읽는 상위 셋을 영상 4부작의 4편으로 다룹니다.
시스템
명령 뒤의 판단층
채택한 아이디어가 들어간 네 층 분업과 retrieve, classify, project 명령입니다.

Upcoming다가오는 행사

요즘 제가 진행하는 세미나와 컨퍼런스입니다. 궁금하시면 오세요.