Jev 모델에 대해 조금 더 이해하고 싶으신 분들께 드리는 글.
Jev를 딱 본 뒤 드는 첫 판단은 둘 중 하납니다. "저건 아예 LLM과 다르네", 혹은 "그냥 LLM의 출력헤드만 바꿨네"
뭐... 둘 다 맞는 말일 수 있습니다.
Jev의 출력은 크게 세 가지 형태로 볼 수 있습니다.
1. Noul: yes/no 질문에 대해 0에서 1 사이의 확률을 반환.
2. Choice: 주어진 선택지 중 하나를 선택, 각 선택지의 확률 분포와 confidence를 함께 출력.
3. Score: 특정 척도 위에서 점수와 그 분포, 그리고 confidence를 출력.
즉 긴 자연어 답변을 생성(다음 토큰을 예측)하는 것이 아니라, 처음부터 의사결정에 필요한 값을 직접 출력하도록 만들어진 모델입니다. Noul의 확률은 그 자체로 0 또는 1이 아니라, 애플리케이션이 임계값을 정해 이진 결정으로 바꿀 수 있는 값입니다.
예를 들어 기상 데이터를 state로 넣고 "내일 비가 올 확률은?"이라는 question을 함께 입력한다고 생각해보겠습니다.
일반적인 LLM이라면 먼저 입력을 토큰 단위로 처리하고, 필요하다면 내부적인 reasoning을 거친 뒤 "내일 비가 올 확률은 약 80%입니다" 같은 텍스트를 생성합니다. 답변을 만들기 위해서는 여러 개의 토큰을 순차적으로 생성해야 합니다.
Jev는 이 과정이 다릅니다.
state(기상 데이터)와 typed question(내일 비가 올 확률은?)을 입력으로 받아 모델의 계산을 수행하고, 그 결과를 decision 형태로 바로 출력합니다.
결과가 "80%"에 해당하는 Score일 수도 있고, "비가 온다 / 오지 않는다" 중 하나를 고르는 Choice일 수도 있으며, "내일 비가 온다"는 명제의 참 확률을 내는 Noul일 수도 있습니다.
중요한 것은 모델이 답변을 설명하는 텍스트를 생성하는 것이 목적이 아니라, 주어진 state에 대한 question의 decision을 계산하는 것이 목적이라는 점입니다. 공개된 설명에 따르면 Jev는 여러 question을 같은 state에 대해 병렬로 평가하며, 일반적인 LLM처럼 토큰을 하나씩 이어 붙이며 글을 쓰지 않습니다.
그렇다고 Jev가 단순한 if문이나 규칙 기반 프로그램이라는 뜻은 아닙니다. 예를 들어 사람이 습도 > 80%이고 강수확률 > 60%이면 비 = 1 같은 규칙을 직접 작성해놓은 시스템과는 완전히 다릅니다.
Jev 역시 학습된 신경망의 파라미터를 사용합니다. 입력은 여러 단계의 연산을 거치며 변환되고, 학습 과정에서 형성된 가중치에 의해 최종 출력이 결정됩니다. 따라서 특정 조건문을 사람이 하나하나 작성해놓은 것이 아니라, 학습을 통해 state와 question 사이의 관계를 모델의 파라미터에 내재화한 것에 가깝습니다.
이런 의미에서 Jev의 내부 구조를 기존 LLM과 완전히 다른 종류의 계산이라고 단정할 수 없습니다. Almeida는 인터뷰에서 “a different kind of language model”이라고 했습니다. 결국 언어모델이긴 한 거죠.
다만 현재 공개된 범위에서는 backbone이 Transformer인지, 기존 언어 모델을 얼마나 재사용했는지까지는 확인되지 않습니다. 언어를 입력으로 받아 그 분포나 의미를 모델링하면 language model이라고 부를 수 있으니... (n-gram, RNN, LSTM 등등)
아무튼 회사가 강조하는 차이는 레이어 구성의 이름보다, 새로운 모델 아키텍처와 parallel sampler를 사용해 구조화된 decision을 한 번에 산출하도록 설계했다는 점입니다. Attention이나 MLP 같은 구성요소를 쓸 수는 있지만, 그것은 현재로서는 추론이지 공개된 사실이 아닙니다.
차이에 대해 충분히 설명드린 것 같지만, 더 들어가보겠습니다.
일반적인 LLM의 대표적인 학습 목표는 주어진 문맥에서 다음 토큰을 예측하는 것입니다. 그래서 최종적으로 vocabulary 전체에 대한 확률 분포를 만들고, 그중 하나의 토큰을 선택해 다시 다음 토큰을 예측하는 과정을 반복합니다. 이후 RLHF 같은 방식으로 사람이 선호하는 글을 쓰도록 다듬는 경우가 많습니다.
반면 Jev는 처음부터 이런 텍스트 생성이 목적이 아닙니다. TypeSafe는 이를 Reinforcement Learning for Calibrated Decisions(RLCD)로 학습한다고 설명합니다.
즉, 모델이 최종적으로 해야 하는 일이 decision이라면, 그 decision과 함께 실제 정답률과 맞게 보정된 확률을 출력하도록 학습합니다.
따라서 텍스트 생성용 LM head로 문장을 이어 쓰는 대신, Noul, Choice, Score와 같은 decision output을 만들어내는 방향으로 모델을 사용합니다..
여기에 Jev가 엄청나게 저렴한 이유가 있습니다.
일반 LLM은 답을 여러 번 순전파(파라미터 전체를 쭉 통과)해서 한 글자씩 만듭니다. 인풋이 길어질 수록 순전파를 토큰 수만큼 반복해 굉장히 느려지게 됩니다. 그래서 파라미터가 커질수록 일을 잘 하고 비싼 거죠.
Jev는 인풋을 state, question 이 두 개로만 받습니다. 그리고 한 번의 순전파로 decision을 바로 냅니다.
그 정형화된 3개(Noul, Choice, Score)에 따라 decoding(최종 출력값 생성)도 끝납니다. 무시무시하게 저렴하고 빠른 이유죠.
즉, 즉즉즉즉즉...
LLM은 "무슨 말을 다음에 생성할 것인가?"를 계산하고, Jev는 "현재 상태에서 어떤 판단을 내려야 하는가?"를 계산합니다.
그렇다고 Jev가 '의미'를 아예 버린 확률 계산기란 것도 또 아닙니다. 물론 reasoning trace를 생성하지 않는 것은 맞습니다.
일반적으로 생각하는 Reasoning 과정, 즉 문제를 여러 단계로 쪼개고 중간 결과를 글로 만들어가면서 최종 답을 도출하는 방식을 쓰지 않습니다.
신경망 내부에서는 당연히 입력된 값들의 관계를 표현하고 학습된 패턴을 이용합니다.
예를 들어 기상 데이터에서 기온, 습도, 기압, 바람, 구름 등의 여러 변수와 "내일 비가 올 확률"이라는 question 사이의 관계를 모델이 학습했다면, 이를 이용해 최종 Score나 Noul을 계산할 수 있습니다. 이 과정은 단순한 조건문보다 훨씬 복잡한 함수이며, 모델의 수많은 파라미터를 거쳐 수행됩니다.
따라서 Jev를 "추론을 전혀 하지 않는 모델"이라고 부르는 것도 정확하지 않습니다. 넓은 의미에서는 입력을 받아 내부 계산을 수행하고 결론을 도출하기 때문에 inference는 분명히 일어납니다. 다만 일반적인 reasoning LLM처럼 중간 추론을 토큰으로 생성하면서 답을 만들어내는 방식이 아니라, 학습된 신경망의 forward computation을 통해 decision을 직접 산출하는 방식이라고 이해하는 편이 정확합니다.
결국 LLM은 언어를 생성하는 범용 인터페이스에 가깝고, reasoning LLM은 그 언어 생성 과정에서 더 많은 계산을 사용해 복잡한 문제를 해결하도록 만들어집니다.
Jev는 그와 달리 언어 생성 자체를 목적에서 빼고, state와 question으로부터 decision을 직접 계산하는 방향으로 설계된 모델입니다.
회사가 말하는 "can't hallucinate(할루시네이션이 불가)"도 사실이 틀리지 않는다는 뜻이 아니라, 미리 정한 스키마 밖의 답을 만들어내지 않는다는 뜻에 가깝습니다. 판단 자체는 틀릴 수 있습니다 ㅋㅋㅋ
한마디로 정리하면, Jev는 생각을 글로 써서 답을 만드는 모델이라기보다, 주어진 상태와 질문을 학습된 신경망에 통과시켜 필요한 decision을 직접 반환하는 모델이라고 볼 수 있습니다.
헉, 200배 빠르고 출력토큰이 영원히 0달러? 어떤 모델일까요?
바로 "Jev"입니다. Jev는 TypeSafe AI가 2026년 9월 15일 스텔스에서 나와 공개한 System One 계열의 첫 모델입니다. 따끈따끈하죠.
ChatGPT/InstructGPT의 RLHF(랄프루프의 그것) 작업에 기여한 Diogo Almeida가 2인과 공동 창업했습니다.
핵심 철학은 “사람용 채팅 모델이 아니라 소프트웨어가 사용하는 의사결정 모델”입니다.
Almeida는 “우리는 prod를 만들지, 신을 만들지 않는다”고 말합니다. 기존 LLM이 토큰을 하나씩 생성해 글을 쓰는 반면, Jev는 상태(state)를 넣고 미리 정의한 질문을 병렬로 평가해 타입이 정해진 답 + 확률 분포 + 신뢰도만 돌려줍니다.
즉, 텍스트를 생성하지 않기 때문에 전통적인 환각(잘못된 문장 생성)이 구조적으로 불가능합니다.
어떻게 쓰는가... 하면
입력은 state(티켓 본문, 문서, 로그 등)와 여러 개의 typed question이며, 질문은 세 종류로 미리 정리되어 있습니다.
Noul: “환불을 요청하는가?”처럼 참/거짓. 0~1 확률을 반환.
Choice: 고정된 선택지 중 하나(예: billing / technical / returns)와 각 옵션 확률, confidence.
Score: 루브릭에 따른 점수(예: 긴급도 low/medium/high)와 분포.
한 번의 API 호출에서 여러 질문을 동시에 던질 수 있고, 질문 수가 늘어도 응답 시간은 거의 늘지 않습니다. 복잡한 판단은 질문을 쪼개서 Jev에 맡긴 뒤, 코드에서 확률과 confidence를 보고 분기·에스컬레이션하는 방식입니다.
학습 방식은 RLCD(Reinforcement Learning for Calibrated Decisions)입니다. RLHF가 “사람이 좋아하는 답”을 최적화했다면, RLCD는 “실제 결과에 맞게 확률이 캘리브레이션된 결정”을 최적화합니다.
뭔가 좀 복잡하긴 하죠. 그럼 가격은 어떨까요.
입력 토큰만 받습니다. 10억 개당 42달러($0.042/MTok).
출력 토큰은 “너무 싸서 계량할 가치가 없다”며 영원히 무료.
이름은 제본스의 역설(Jevons paradox)에서 따왔다고 합니다. 효율이 올라가면 사용량이 폭증한다는 의미로, “더 똑똑한 모델 한 방”보다 “훨씬 싸고 빠른 결정을 대량으로 넣는 것”이 자동화의 지름길이라는 입장인 거죠.
사실상 저희가 쓰고 있는 LLM과는 많이 다른 물건이라 써먹기 좋은 곳과 안 맞는 곳이 확연히 차이납니다.
티켓 라우팅, 고객 불만·긴급도 스코어링, 보험 언더라이팅 판단, 실시간 필터/게이트, 대량 데이터에 대한 map-reduce식 분류, 에이전트 워크플로 안의 “작은 판단”을 수천 번 반복하는 경우는 정말 잘 맞습니다.
반대로 채팅, 코드 작성, 긴 설명, 창작, 자유 형식 추론 같은 “텍스트를 생성하는 경우”에는 그냥 못 씁니다.
Jev는 일반 LLM을 대체하는 모델이 아닙니다. 한 리뷰는 “수천 번의 작은 의미 판단을 하는 팀에 가치가 있지, 더 좋은 ChatGPT를 원하는 사람에게는 아니다”라고 정리했습니다.
Hacker News 등에서는 “대형 분류기/스코어러를 프론티어 모델처럼 포장했다”는 비판도 있는데, 확실히 재미있고 유용한 프로젝트인건 맞아 보입니다. 현재는 얼리 액세스(웨이팅리스트) 단계입니다.