Columns · 주제 노트 · 작은 모델 · AI 에이전트
Jev 모아보기 · 판단 전용 AI를 두고 오가는 이야기와 저희 의견
주제 노트 · 판단 전용 AI
글 신치훈 (명성심재 대표 · 컴퓨터공학 박사) · 게재 2026. 9. 24. · 약 7분
Jev는 글을 쓰지 않고 고르기만 하는 AI입니다. 지금 상황과 고를 수 있는 보기를 주면, 고른 답 하나와 보기마다의 확률, 확신도를 돌려줍니다. 발표 뒤 한 주 동안 여러 사람이 직접 재 보고, 그려 보고, 써 봤습니다. 그 가운데 원문을 직접 열어 확인한 것만 모았습니다. 수치는 모두 각 원문에서 옮겼고, 저희가 다시 잰 값이 아닙니다.
저희 생각을 먼저 적으면 이렇습니다. 이런 판단기는 큰 AI를 대신하는 것이 아니라 그 앞에서 되풀이되는 작은 결정을 거르는 자리에 맞습니다. 그리고 쓸모를 가르는 것은 속도보다 확신도가 믿을 만한지, 그 기준값을 누가 정하는지입니다.
1. 공식 발표 · TypeSafe
Introducing System One Models & Jev
요약: 「정리되지 않은 상태가 들어가고, 형식이 정해진 확률적 결정이 나오는 함수 호출」. 응답 70~500ms, 출력 토큰 무료, 보기는 최대 255개, 확신도가 정직하도록 훈련(RLCD)했다고 밝힙니다.
저희 의견: 70~500ms는 회사가 잰 값으로 서버 왕복이 포함됩니다. 다른 숫자와 견줄 때는 잰 방식부터 맞춰야 합니다. 저희 영상에서 2.4ms와 나란히 놓지 않은 이유이기도 합니다.
2. Jev 호출 한 번을 한 장에 · Stanislav Beliaev
One Jev call, start to finish (링크드인)
요약: 요청 하나가 들어가 고르기(CHOICE), 점수(SCORE), 예/아니오(NOUL) 가운데 하나로 나오는 흐름을 화이트보드 한 장에 그렸습니다. 글쓰기·요약·코드 생성·계산·연쇄 추론에는 쓰지 말라는 줄도 있습니다.
저희 의견: 가장 좋은 대목은 「기준값은 모델이 아니라 내 코드에 있다」입니다. 사람이 책임질 자리가 거기라는 뜻입니다.
3. 공개 데이터 791건 독립 시험 · Adel Dahani
Jev vs GPT and Claude: Independent Benchmark
요약: 의도 분류 두 종류와 프롬프트 공격 탐지, 모두 791건. Jev는 중간값 0.33초로 큰 범용 모델(1.17초)보다 약 3.6배 빨랐고, 정확도는 작은 범용 모델들과 비슷, 큰 모델보다는 의도 분류에서 5~6점 낮았습니다. 확신도 0.80 이상만 Jev가 답하고 나머지를 큰 모델로 넘기자, 큰 모델 단독과 같은 정확도를 비용 26~28%로 냈습니다.
저희 의견: 이 글에서 가장 중요한 결과는 속도가 아니라 0.80으로 나누는 설계입니다. 저희가 말하는 「게이트 앞 판단기」와 같은 구조입니다. 다만 0.80은 이 데이터에서 정한 값이고, 자기 일에서는 다시 정해야 합니다. 저자도 신뢰구간이 6~13점으로 넓다고 적었습니다.
4. 라우터 분류 240회 비교 · LiteLLM
JEV Classifier: 5.43x as Fast as Haiku, 96% Lower Cost
요약: 요청을 어느 모델로 보낼지 정하는 분류를 80건 × 3회 = 240회. 중간값 126.81ms 대 688.40ms로 약 5.4배 빠르고, 비용은 96% 적었고, 정해 둔 등급과 맞은 비율은 95% 대 73.75%였습니다.
저희 의견: 보기가 몇 개로 정해진 라우터는 이런 판단기가 가장 잘 맞는 자리입니다. 그런데 정답 등급을 한 사람이 만들었다고 저자가 스스로 밝혔습니다. 자기 데이터로 다시 재기 전에는 숫자를 그대로 가져오지 않는 편이 안전합니다.
5. 모델 라우팅을 바꿔 본 실험 · 森永大志
I tried replacing model routing with TypeSafe (Jev)
요약: 대화 난이도를 네 등급으로 나누는 호출 40회. 0.64~0.67초로 기존 방식보다 약 3배 이상 빨랐습니다. 「중간」 등급에서는 확신도가 0.57~0.67로 낮게 나왔습니다.
저희 의견: 가운데 등급에서 확신도가 낮게 나온 것 자체가 쓸모 있는 신호입니다. 애매한 건은 애매하다고 말해 주면, 그 건만 사람이나 큰 모델로 보내면 됩니다.
6. 작은 시험 17건 · Souvik R.
요약: 예/아니오, 고르기, 점수 세 형태로 17건 23개 점검. 비교한 모델 모두 전부 맞혔고, Jev 중간값 452ms, 비용은 큰 모델들보다 약 35배와 190배 쌌습니다. 저자는 쉬운 문제 한 번 돌린 결과라고 적었습니다.
저희 의견: 쉬운 문제에서는 누구나 맞힙니다. 그때 차이는 속도와 비용뿐입니다. 진짜 시험은 어려운 건에서 확신도가 정직하게 낮아지는가입니다.
7. Jev는 가면 쓴 BERT인가 · Denis Timonin
Jev: an LLM for decisions, not chat (링크드인)
요약: Jev가 하는 일은 BERT 같은 분류기가 오래 해 온 일과 닮았다. 차이는, 새 보기가 생길 때마다 다시 학습해야 하는 분류기와 달리 요청마다 보기를 받는다는 점이다. 계산·날짜·간접 추론에 약하고 긴 무관한 맥락이 정확도를 떨어뜨린다는 회사 스스로의 주의도 옮겼습니다.
저희 의견: 저희는 반대쪽을 겪었습니다. 한 가지 일로 좁힌 작은 판단기는 아주 빠르지만 그 일만 압니다. 보기가 자주 바뀌면 Jev 쪽, 한 가지 일에 고정이면 작게 직접 만드는 쪽이 맞습니다.
8. 기준값은 사람 검토를 사는 예산 · Laurie Voss
Will TypeSafe's Jev change how we build AI applications? (링크드인)
요약: 싸고 빠른 판단기가 있으면 표본만 보던 채점을 모든 결과에 할 수 있다. 확신도가 정직하면 「기준값을 정하는 것은 사람 검토를 얼마나 살지 정하는 것」이 된다. 대신 큰 호출 하나를 작은 질문 여러 개로 쪼개도록 앱을 다시 짜야 한다.
저희 의견: 이 글에서 남길 문장은 기준값 이야기입니다. 기준값은 사람의 주의에 쓰는 예산이므로 기본값으로 두지 말고 담당자를 정해야 합니다.
9. 국내에서 게이트웨이에 붙여 본 기록 · Seulbi Lee
TypeSafe Jev connects to LiteLLM (링크드인)
요약: LiteLLM 게이트웨이에 연결하면 모델 목록에는 없고 경로로만 붙지만, 토큰과 비용은 모두 기록된다. 직접 연결 177ms, 게이트웨이 경유 약 400ms. 작은 모델보다 늘 싼 것은 아니었고, 장점은 비용보다 믿을 만한 확신도였다.
저희 의견: 국내에서 직접 붙여 본 기록이라 반갑습니다. 「싸서가 아니라 확신도가 정직해서 쓴다」는 결론에 동의합니다.
10. 저희가 직접 만들어 본 것 · 명성심재
요약: 들어가고 나오는 모양만 빌려 한 가지 일(슈팅 게임)로 좁히고 PC 한 대에서 돌렸습니다. 판단 한 번에 보통 2.4ms, 58판 평균 명중률 98.2%였습니다.
저희 의견: 범위를 좁히면 작고 빨라집니다. 하지만 위의 시험들과 같은 결론으로 돌아옵니다. 속도보다 먼저 정답을 아는 사례로 시험하고, 확신이 낮은 건은 사람에게 넘기는 기준을 세워야 합니다.
공개 계획
관심이 모이면 저희 작은 판단기를 깃허브에 공개하겠습니다. 그렇지 않으면 계속 다듬어, 의미 있는 결과가 나올 때 공개하겠습니다. 관심이 있으시면 문의로 한 줄 남겨 주세요.
새 논의 추천
Jev나 판단 전용 AI를 두고 좋은 시험이나 글을 보셨다면 문의로 알려 주세요. 원문을 확인하고 의견을 붙여 여기에 더하겠습니다.
