LECTURE EVIDENCE / 2026-09-28

숫자와 함께
비교 조건을 남깁니다.

강의용 공개 집계입니다. 개인 노트, 원시 호출 로그, 사람별 응답은 포함하지 않습니다.

찾기형 검색 / r4

방법적중 / 54해석
같은 후보 풀 RRF 1위28검색 순위 결합 기준선
Jev 제안3768.5%, 같은 풀 대비 조건부 GO
qmd query 1위34Jev 우위가 통계적으로 확인되지 않음
Gemini 3.8 Flash 선택43등록 지표에서 Jev보다 높음

보류, 오류, 시간초과, 정답이 후보 밖인 경우는 실패로 셌습니다. 모델 생성 질문의 표적을 기준으로 평가했으며 사람 골드 검증 전입니다. r3의 44/49(89.8%)는 description에서 질문을 만든 순환 편향이 있었습니다. r4는 다른 본문 구간에서 질문을 만들었고 표본과 운영 경로도 바뀌었습니다.

분류와 프로젝트 / r2–r4

  • r2 CMDS 이름만 24/120 → 정의 보강과 형식 우선 지시를 함께 적용하면 91/120. 정의만의 순수 인과효과를 측정한 실험은 아닙니다.
  • r3 새 폴더 Jev 단독 28/65, top-3 42/65. 기존 type 규칙표는 새 폴더 부분집합에서 1/27이었습니다.
  • r2 프로젝트 이름만 69/80 → README 설명 추가 78/80. r4 프로젝트 제안은 19/21, 등록상 GO 없음.
  • 담당 9부문 라우팅은 미측정입니다. 프로젝트 선택 성능과 구분합니다.
  • r4 분류 top-3는 14/25(56.0%), 보류=실패 기준에서 판정보류입니다.

멈춘 적용과 답변 비용 / r4

  • 부재 기권 10/30, 확신 제안 오답 14/30. 부재 판단은 STOP입니다.
  • 합성형 12건의 근거 재현율 0.583(컷 0.3), 해당 축소 적용은 STOP입니다.
  • T4의 A는 Jev 선택 맥락, B는 qmd 상위 8개, D는 A와 같은 글자 수로 자른 검색 순서 맥락입니다.
  • A 대 D는 23승/40무/3패. 두 모델 채점이며 D의 문서 절단 방식에 한계가 있습니다.
  • A 대 B는 14승/30무/21패(65건, 채점 한 건 누락). 품질 비열등은 입증하지 못했습니다.
  • 당시 Flash 단가를 적용한 항목당 비용은 A $0.00224, B $0.00380으로 약 41% 감소했습니다. Jev 입력까지 더하면 총 입력 토큰은 A가 더 많았습니다.
  • T4 전체 66건은 찾기 54+합성 12의 혼합 구성입니다. 합성 STOP을 적용한 운영 정책의 품질과 비용은 별도로 측정하지 않았습니다.

Interpretation limits

These are aggregate experimental results, not a guarantee of production accuracy. Human-gold validation is pending. Jev scored 37/54 versus 28/54 for the same-pool first result, 34/54 for qmd query, and 43/54 for the Flash selector. The 41% cost reduction does not establish equal quality. The adopted policy after stopping synthesis filtering was not measured.

解釈の範囲

これは実験の集計値であり、本番環境での正確性を保証するものではありません。人手による正解検証は未実施です。Jevは37/54、同じ候補集合の先頭は28/54、qmd queryは34/54、Flashは43/54でした。費用約41%減は品質同等性の証明ではありません。統合型質問の絞り込みを停止した運用方針の品質と費用は、別途測定していません。

公開実装と公式仕様

以下は2026-09-28に一次資料を確認しました。API再実行や性能の独立測定はしていません。

CMDSPACE의 구현은 시스템 소개, 공개 분류기, 영수증 뷰어에서 살펴볼 수 있습니다. 구현 존재와 의미 판단의 효과는 별개입니다.

Upcoming다가오는 행사

요즘 제가 진행하는 세미나와 컨퍼런스입니다. 궁금하시면 오세요.