Columns · 인사이트 · 작은 모델

Jev 같은 작은 판단기는 어떤 모습일까. 약 2ms에 판단하는 것을 만들어 봤습니다

인사이트 02 (한국어판)

신치훈 (명성심재 대표 · 컴퓨터공학 박사) · 게재 2026. 9. 24. · 약 4

링크드인에 영어로 먼저 올린 글을 한국어로 옮겼습니다. 작은 판단기가 게임의 한 수 한 수를 고르는 60초 시연 영상은 영어 원문 페이지에 있습니다.

왜 Jev가 눈에 들어왔나

0.5초 늦었을 뿐인데, 거의 완벽한 스크립트가 한 발도 맞히지 못했습니다. 이 글은 그 문제에 관한 이야기입니다.

TypeSafe는 Jev를 「최고 수준 지능의 함수 호출: 정리되지 않은 상태가 들어가고, 형식이 정해진 확률적 결정이 나온다」고 설명합니다. 소프트웨어가 「손으로 짠 로직으로는 너무 깨지기 쉬운 곳에서 분류하고, 넘기고, 점수를 매기고, 뽑아내고, 갈라야 하는」 자리를 위해 만들었다고 합니다.

저희는 Jev가 받은 관심을 하나의 신호로 읽었습니다. 에이전트가 실제 업무로 들어오고 있습니다. 에이전트를 만드는 사람 1,340명을 조사한 결과, 57%가 이미 실제 운영에 쓰고 있었습니다. 실제 업무란 작은 결정이 많고, 빨라야 하며, 하루 종일 이어진다는 뜻입니다. Jev는 그 필요에 분명한 이름을 붙였습니다.

그래서 물었습니다. 좁은 한 분야만을 위해 만든 작은 판단기는 어떤 모습일까?

문제: 게이트는 확실하지만 뻣뻣하다

대부분의 에이전트 흐름은 고정된 게이트로 끝납니다. 규칙이거나, 스크립트 검사이거나, 결재하는 사람입니다. 게이트는 같은 결과에 같은 답을 줍니다. 되돌릴 수 없는 단계 앞에서 바로 그것이 필요합니다.

하지만 게이트는 적어 둔 경우만 압니다. 진짜 질문이 「얼마나 그럴 법한가」일 때, 고정된 규칙은 좋은 일을 막거나 나쁜 일을 통과시킵니다.

생각: 게이트 앞에 빠른 판단기

저희는 게이트 앞에 작고 빠른 판단기를 두었습니다. 모든 건을 먼저 보고 나눕니다.

  • 확신이 높고 비용이 낮으면: 곧장 게이트로.
  • 확신이 낮거나 비용이 크면: 사람에게.
  • 확신이 높은 건 중 무작위로 뽑은 일부도: 사람에게. 그 신뢰가 맞는지 확인하기 위해서입니다.

게이트와 사람은 그대로 남습니다. 판단기는 그들의 주의를 어디에 쓸지 정합니다.

저희 판단기는 SimThink D라고 부릅니다. 혼합 설계입니다. 작은 로컬 언어모델이 과제를 한 번 읽고, 작은 신경망들이 빠른 판단을 내립니다. Jev와 같은 종류의 약속을 지킵니다. 상태가 들어가고, 확률과 확신도가 붙은 정해진 선택이 나옵니다. 속은 한 분야에 맞게 단순화했습니다.

저희가 본 것

시간이 아주 짧은 곳에서 시험했습니다. 빠른 슈팅 게임(ViZDoom)인데, 모든 판단이 게임 한 틱, 곧 28.6ms 안에 끝나야 합니다. 과제가 바뀌지 않으므로 신경망 부분만 돕니다.

가장 중요한 것은 속도입니다. 손으로 짠 강한 스크립트를 일부러 늦추자, 30ms만 늦어도 명중률이 99.5%에서 87.8%로 떨어졌고, 0.5초 늦으면 0이 됐습니다.

모든 판단을 혼자 내리도록 한 언어모델들은 시계를 따라가지 못했습니다.

저희가 하지 못한 것: 스크립트를 이기지 못했습니다. 그리고 게임이 기다려 주지 않는 진짜 실시간 플레이는 다음 과제입니다.

저희가 한 것: 저희 판단기는 보통 약 2ms에 판단하고, 토큰도 바깥 호출도 쓰지 않습니다. 서로 다른 58판에서 명중률 98.2%로, 스크립트의 99.5%에 가깝습니다. 시간 예산 안에서 그 수준의 플레이를 유지합니다.

어디에 두나: 게이트 층

저희 설계 도구 SimThink Abyss에서는 에이전트의 일을 줄별로 펼칩니다. 사람, 게이트, 작업, 기록입니다. SimThink D는 게이트 줄, 중앙 게이트 바로 앞에 놓입니다. 기준값은 담당자 이름이 붙은 설정 하나이므로, 그것을 조정하는 일은 설계 변경입니다.

SimThink Abyss의 예시 흐름: 빠른 판단기가 게이트 줄에 놓인다
SimThink Abyss의 예시 흐름: 빠른 판단기가 게이트 줄에 놓인다

반대편의 이야기

  • 게임은 사업이 아닙니다. 사업에서는 결과가 늦게 나오고, 사람마다 결과를 다르게 봅니다.
  • 확신도는 속일 수 있습니다. 모델은 매우 확신하면서도 틀릴 수 있습니다.
  • 소유에는 비용이 듭니다. 작은 모델도 데이터, 감시, 갱신이 필요합니다.

그래서 게이트와 사람은 남고, 기준값에는 담당자가 있습니다.

열린 질문

여러분 일에서 따로 작은 판단기를 둘 만큼 좁고 자주 일어나는 결정은 무엇입니까? 그리고 그 기준값은 누가 맡겠습니까?

원문

근거·확인 경로

  • TypeSafe, "Introducing System One Models and Jev" (2026-09-15)
  • LangChain, State of AI Agents (응답 1,340건, 2025)
  • 명성심재 AX 연구소 SimThink D 실험 기록 (ViZDoom, 2026)

← 칼럼 목록