2026년 9월 15일, 미국 스타트업 TypeSafe AI가 텍스트를 전혀 생성하지 않는 AI 모델 Jev를 얼리 액세스로 공개했습니다. 프로그램의 상태와 타입이 지정된 질문을 건네면, 타입이 정해진 판단과 확률만 돌아옵니다. 회사를 이끄는 사람은 ChatGPT의 토대가 된 InstructGPT 논문의 공동 저자 Diogo Almeida입니다. 이 글에서는 Jev와, 이 회사가 제시한 새로운 분류인 System One 모델을 공식 문서를 근거로 정리합니다.
Jev란 무엇인가
Jev는 TypeSafe AI가 'System One 모델 1호'로 공개한 판단 전용 AI 모델이며, 현재 버전은 jev-1.13입니다. 기존 대규모 언어 모델(LLM)과의 가장 큰 차이는 출력 형식에 있습니다.
- LLM: 사람이 읽는 문장을 생성합니다. 구조화된 데이터가 필요해도 일단 문장으로 만들게 하고, 프로그램에서 파싱해야 합니다
- Jev: 텍스트를 생성하지 않습니다. 프로그램 상태(state)와 타입이 지정된 질문(questions)을 받아, 타입이 정해진 값·확률 분포·확신도를 반환합니다
TypeSafe는 이 설계를 '문장 생성 시스템에 구조화된 판단을 억지로 출력하게 하는' 불일치를 해소한 것이라고 설명합니다. 파싱도 재시도도 필요 없고, 돌아온 값을 그대로 분기·정렬·라우팅에 쓸 수 있는 것이 장점입니다.
System One 모델이라는 개념
이름은 대니얼 카너먼의 '빠른 생각과 느린 생각'에서 왔습니다. 긴 추론이나 글쓰기는 System 2, 즉 LLM이 잘하는 영역이고, 순간적으로 정해지는 판단은 System 1인데 Jev는 후자에 특화되어 있습니다. '그 분야 전문가라면 5초면 판단할 수 있는 일'을 대량으로 빠르게 처리하는 부품이라고 생각하면 위치가 잡힙니다.
세 가지 질문 유형(프리미티브)
Jev에 던질 수 있는 질문은 세 가지이며, 한 번의 API 호출에 섞어 쓸 수 있습니다. 질문들은 같은 상태에 대해 병렬로, 서로 독립적으로 평가되며, 공식 문서에 따르면 질문을 늘려도 응답 시간은 거의 변하지 않습니다.
- Choice(선택): 정해진 선택지에서 하나를 고릅니다. 선택된 항목, 전체 선택지의 확률 분포, 확신도가 돌아옵니다. 문의 분류나 문서 종류 판정에 적합합니다. 선택지가 모든 경우를 담지 못할 수 있다면 '기타'를 넣으라고 권장합니다
- Score(점수): 순서가 있는 단계(예: 차분함/다소 불만/매우 화남)에서의 위치를 반환하며, 단계 사이의 값도 나옵니다. 심각도, 만족도, 숙련도 판정에 적합합니다
- Noul(참·거짓): 하나의 진술에 대해 0에서 1 사이의 확률을 반환합니다. 1.0에 가까우면 '그렇다', 0.5 근처는 판단이 서지 않는 상태입니다. 버그 리포트인지, 환불 요청인지 같은 판정에 씁니다
각 답변에는 확률 분포가 얼마나 뾰족한지를 나타내는 확신도(confidence)가 함께 옵니다. '확신이 낮은 건만 사람이나 LLM에 넘긴다'는 설계의 핵심 장치입니다.
속도와 요금(회사 발표치)
- 응답 시간은 70~500밀리초. 동등한 지능이 필요한 이 종류의 작업에서 프런티어 LLM 대비 40~200배 빠르다고 설명합니다
- 요금은 입력 100만 토큰당 0.042달러(10억 토큰에 42달러). 출력은 무료이며 과금은 입력만 대상입니다
- 속도 제한은 초당 25만 토큰, 분당 1,200요청이며 수요에 따라 동적으로 조정된다고 합니다
- 컨텍스트는 요청당 6만 4,000토큰까지, 상태와 가장 긴 질문을 합쳐 3만 2,000토큰까지입니다
- 입력은 텍스트만 지원합니다(문자열, JSON 객체, 텍스트 배열). 이미지·음성·영상은 지원하지 않습니다
TechCrunch 보도에 따르면 Vercel은 분류 작업에서 기존보다 5~18배 빠르고 정확도도 높았다는 결과를, Bryo AI는 이메일 분류에서 Gemini보다 10~20배 저렴했다는 결과를 얻었습니다. 모두 공급사와 도입 기업이 공개한 수치이므로, 자사 데이터로 다시 측정해 볼 단서로 읽는 것이 안전합니다.
'환각이 없다'는 말의 올바른 해석
Jev의 홍보 문구에는 '타입 오류도 환각도 발생하지 않는다'가 들어갑니다. 여기서 보장되는 것은 출력의 형식입니다. 선택지 밖의 값이나 깨진 JSON이 돌아오지 않으므로, 파싱 오류 처리와 재시도 로직 자체가 사라집니다.
반면 판단 내용이 틀릴 가능성은 0이 아닙니다. 돌아오는 것은 보정된 확률이고, 확률 0.7의 판단은 설계상 30% 정도는 틀립니다. 공식 문서도 확신도로 처리를 분기하라고 권합니다. '사실을 만들어내지 않는다'와 '항상 정답을 낸다'는 별개라는 점이 도입 판단에서 가장 중요합니다.
공식이 공개한 약점
TypeSafe AI는 jev-1.13이 약한 영역을 공식 문서로 공개합니다. 도입을 검토할 때 가장 참고가 되는 페이지입니다.
- 계산과 개수 세기에 약함: 글자 수, 등장 횟수, 목록 개수는 신뢰할 수 없고 입력이 커질수록 오차가 커집니다. 문서에 'Jev는 계산기가 아니다'라고 명시되어 있습니다
- 날짜·시간 비교가 불안정: 어느 날짜가 먼저인지, 특정 기간 안에 들어가는지, 며칠 차이인지 같은 판정이 흔들립니다
- 다단계 추론에 약함: 속성의 속성을 따라가는 질문이나 이중 부정 표현에서 정확도가 떨어집니다
- 무관한 정보가 섞이면 정확도가 떨어짐: 판단과 관계없는 내용이 상태에 늘어날수록 나빠집니다
- 텍스트 생성은 불가: 선택을 연쇄시켜 생성하게 해도 느리고 품질도 낮습니다
- 지시는 문자 그대로 읽힘: '쓴 대로의 질문'에 답하므로 경계 조건은 기준에 명시해야 합니다
- 적대적 입력에 대한 내성은 보장되지 않음: 상태에 심어진 지시에 끌려갈 수 있습니다
- 영어 우선: 공식은 한국어·중국어·일본어 등 CJK도 '처리하지만 영어와 동등하지는 않다'고 밝힙니다
한국어로 쓸 때는 지시문과 선택지 설명을 영어로 작성하고, 판정 대상 본문만 한국어로 넘기는 식으로 정확도를 실측하며 설계하는 것이 현실적입니다.
잘 맞는 용도
- 의도 라우팅: 문의 내용을 분류해 담당 부서나 처리 흐름으로 보냅니다
- 우선순위·심각도 판정: 긴급도를 점수로 받아 처리 순서를 정합니다
- 가드레일과 모니터링: 에이전트의 입출력이 정책을 위반하지 않는지 밀리초 단위로 판정합니다. LLM 탈옥 탐지에도 쓰이고 있습니다
- 모델 라우팅: 쉬운 요청은 저렴한 모델로, 어려운 요청은 고성능 모델로 보냅니다
- 재랭킹과 검색 보조: 후보 정렬, 관련성 판정
- 에이전트 분기 판단: '다음에 무엇을 할지'의 선택을 코드가 쥐게 합니다
LLM과 함께 쓰는 것이 기본
Jev는 글을 쓸 수 없으므로 LLM의 대체가 아니라 앞단·뒷단에 두는 사용법이 기본입니다.
- 대량 판단은 Jev로 빠르게 처리하고 확신도가 낮은 것만 LLM이나 사람에게 넘깁니다(확신도 게이트)
- 복잡한 판단은 하나의 큰 질문이 아니라 작은 질문으로 나눠 코드에서 합성합니다
- 글쓰기는 LLM, 판단은 Jev로 역할을 나눕니다
시작하는 방법
- 얼리 액세스로 제공되며, 콘솔(console.typesafe.ai)에서 API 키를 발급해 사용합니다
- Python SDK, JavaScript/TypeScript SDK, HTTP API가 제공됩니다. 기본 모델 별칭은 jev-latest이고 현재 jev-1.13.0을 가리킵니다
- 인증은 환경 변수 TYPESAFE_API_KEY로 합니다. Claude Code와 Codex용 에이전트 스킬도 공개되어 있습니다
- 공식 문서는 영어만 제공됩니다. 요금·속도 제한·제공 조건은 변경될 수 있으므로 도입 전에 공식 페이지에서 최신 조건을 확인하세요
정리
Jev는 'LLM의 다음 세대'가 아니라 LLM이 약했던 영역을 담당하는 다른 부품입니다. 문장을 만들 필요가 없는 판단, 즉 분류·분배·채점·가드레일을 대량으로 빠르게 돌려야 하는 장면에서 효과가 크고, 반대로 계산이나 날짜 처리, 텍스트 생성, 한국어 중심의 미묘한 뉘앙스 판정에서는 신중한 검증이 필요합니다. 현실적인 첫걸음은 기존 워크플로에서 'LLM에 분류만 시키고 있는 지점'을 찾아 Jev로 바꿔 보고 속도·비용·정확도를 실측하는 것입니다.
출처: TypeSafe AI 공식 블로그, 공식 문서, TechCrunch(2026년 9월 18일). 이 글은 2026년 9월 19일에 확인한 공개 정보를 기준으로 작성되었습니다.