![]()
Jev는 소프트웨어 안에서 분류와 평가 같은 작은 판단을 빠르게 처리하도록 만든 AI 모델입니다. TypeSafe AI가 2026년 9월 15일 공개했으며, 회사가 ‘System One 모델’이라고 부르는 모델 계열의 첫 공개 모델입니다. 판단 결과를 프로그램이 바로 사용할 수 있는 형태로 반환한다는 점이 핵심입니다. 공식 발표
안녕하세요. 자바파커입니다.
고객 문의를 읽고 담당 부서를 정하는 일을 생각해 보겠습니다. 이때 프로그램에 필요한 정보는 ‘배송팀’, ‘결제팀’, ‘기술지원팀’ 중 어디로 보내야 하는지입니다. 그 결과를 받으면 문의를 전달하는 다음 작업을 진행할 수 있습니다.
Jev는 이런 업무 흐름 속의 분류 담당자로 생각하면 이해하기 쉽습니다. 어떤 판단을 맡길 수 있는지, 실제 자동화에서는 어떻게 사용하는지 살펴보겠습니다.
Jev가 받는 입력과 돌려주는 결과
Jev에는 판단에 필요한 정보인 state와 구체적인 질문인 questions를 전달합니다. 고객 문의 내용과 주문 정보를 주고, “어느 부서에서 처리할 문의인가?”라고 물어보는 식입니다.
자연어 입력을 이해하지만, 답은 개발자가 정의한 선택지나 평가 기준에 맞춰 나옵니다. 프로그램은 이 결과를 읽어 분기하거나 정렬할 수 있습니다. 공식 소개 문서
System One이라는 이름은 대니얼 카너먼이 설명한 빠르고 직관적인 사고인 ‘시스템 1’에서 가져왔습니다. 여기서는 범위가 좁고 빠른 판단에 초점을 맞춘다는 뜻으로 이해하면 됩니다. 사람이 생각하는 방식을 그대로 재현한다는 의미로 볼 필요는 없습니다. System One 문서
Choice와 Score와 Noul
Jev에 맡기는 질문은 세 종류로 나뉩니다.
| 유형 | 하는 일 | 질문 예시 |
|---|---|---|
| Choice | 정해진 선택지 중 하나 고르기 | 배송·결제·기술지원·기타 중 어느 부서로 보낼까? |
| Score | 설명이 붙은 단계에 따라 평가하기 | 이 버그의 심각도는 낮음·보통·높음 중 어느 정도일까? |
| Noul | ‘예’일 확률 판단하기 | 고객이 환불을 요청했을까? |
Choice는 담당 부서나 문서 종류처럼 순서가 없는 선택에 사용합니다. 선택지에 들어맞지 않는 입력을 받을 수 있다면 ‘기타’도 마련해야 합니다.
Score는 심각도나 관련성처럼 정도를 평가할 때 사용합니다. 각 단계의 의미를 정의하면 그 사이에 해당하는 점수도 반환할 수 있습니다.
Noul은 0에서 1 사이의 값을 반환합니다. 1에 가까우면 ‘예’, 0에 가까우면 ‘아니요’, 0.5 부근이면 판단이 애매하다는 뜻입니다. 0.5가 ‘반쯤 환불을 원한다’는 뜻은 아닙니다. Noul 문서
같은 입력을 사용하는 질문 여러 개를 한 번에 보낼 수도 있습니다. 같은 요청 안의 질문은 각각 독립적으로 평가되므로, 앞선 답이 다음 질문에 필요한 경우에는 요청을 나누어야 합니다. 질문 유형 문서
고객 문의 자동화에 적용하는 예시
고객이 다음과 같은 문의를 보냈다고 가정해 보겠습니다.
주문한 상품이 아직 도착하지 않았어요. 배송이 어렵다면 환불받고 싶습니다.
프로그램은 문의 내용과 주문 상태를 Jev에 전달하고, 담당 부서와 환불 요청 여부를 각각 물어볼 수 있습니다. 그런 다음 배송 확인이 필요한 문의로 분류하면서, 환불 검토가 필요하다는 표시도 함께 붙이는 흐름을 구성할 수 있습니다.
다음은 이런 시스템을 설계했을 때의 처리 순서입니다. 실제 Jev 실행 결과를 보여주는 예시는 아닙니다.
- 프로그램이 문의 내용과 주문 정보를 모읍니다.
- Jev가 담당 부서와 환불 요청 여부를 판단합니다.
- 프로그램이 판단 결과와 업무 규칙을 조합합니다.
- 결과가 애매하면 담당자가 확인하도록 보냅니다.
실제 문의 전달이나 환불 처리는 프로그램의 코드가 실행합니다. 확신도가 낮은 결과를 담당자에게 보내는 흐름도 코드에서 구성합니다. 확신도에 따른 처리 경로
확신도가 자동화에 도움이 되는 이유
Choice와 Score는 선택지별 확률과 함께 confidence 값을 제공합니다. 한 결과에 확률이 몰리면 확신도가 높아지고, 여러 결과로 퍼져 있으면 낮아집니다.
이를 활용하면 분류가 뚜렷한 문의는 자동으로 전달하고, 담당 부서가 애매한 문의는 사람이 확인하도록 만들 수 있습니다. Noul은 별도의 confidence 필드 없이 ‘예’일 확률 자체로 불확실성을 표현합니다.
여기서 구분해야 할 점이 있습니다. confidence가 0.9라고 해서 해당 답의 정확도가 반드시 90%라는 뜻은 아닙니다. 이는 모델이 반환한 확률 분포를 요약한 값입니다. 자동 처리 기준은 실제 문의 데이터로 결과를 확인하면서 정해야 합니다. 확신도 문서
속도와 비용 수치를 읽는 방법
TypeSafe는 공개 당시 응답 시간을 약 70~500밀리초로 제시했습니다. 짧은 판단을 여러 번 수행하는 프로그램에서 응답 시간을 줄이겠다는 방향입니다.
다만 이는 회사가 발표한 수치입니다. 공식 발표는 평가가 주로 서비스가 위치한 미국 서부에서 실행됐다고 설명합니다. 한국에서 호출할 때는 입력 크기와 네트워크 환경을 포함한 실제 응답 시간을 확인해야 합니다.
홈페이지의 ‘193.6배 빠름’과 ‘444.6배 저렴함’도 회사의 특정 업무 흐름 평가에서 나온 비교입니다. 모든 작업에서 같은 차이가 난다고 읽으면 곤란합니다. TypeSafe도 해당 수치가 실제 개선 폭의 높은 쪽에 해당할 것으로 예상한다고 밝혔습니다. 공식 발표의 성능 비교와 평가 조건
개발자가 주목할 지점
Jev에서 제가 흥미롭게 보는 부분은 AI의 판단을 작은 단위로 나누어 소프트웨어에 넣는 방식입니다. 문의 분류, 자료 평가, 다음 처리 경로 선택처럼 반복되는 판단을 모델에 맡기고, 전체 업무 흐름은 코드에서 구성하는 것입니다.
이런 구성이 늘어난다면, AI 모델을 선택하는 기준에도 ‘우리 프로그램에 필요한 판단을 얼마나 빠르고 일관되게 처리하는가’가 더 큰 비중을 차지할 것 같습니다. 이는 Jev의 설계 방향을 보고 든 제 생각입니다.
직접 적용한다면 우선 문의 하나를 어느 부서로 보낼지처럼 범위가 좁은 작업부터 시작할 수 있습니다. 명확한 문의와 애매한 문의를 함께 모으고, 잘못 분류한 사례와 자동 처리 비율을 확인합니다. 빠르게 답하더라도 업무 기준에 맞게 분류해야 자동화에 도움이 되기 때문입니다.
자주 묻는 질문
Jev로 글이나 코드를 작성할 수 있나요
Jev는 글, 코드, 판단 이유에 대한 설명을 생성하지 않습니다. 현재 공식 문서 기준으로 텍스트 입력을 받아 정해진 형태의 판단을 반환합니다. 이미지·음성·영상 입력은 지원하지 않습니다. 지원 범위
일반 LLM의 구조화된 출력과는 어떻게 다른가요
일반 LLM도 JSON이나 스키마에 맞춘 출력을 사용할 수 있습니다. TypeSafe는 Jev를 판단과 확률 반환에 맞춰 설계하고 학습한 모델로 설명하며, 여러 결과를 병렬로 반환하는 방식을 강조합니다. 실제 도입 효과는 같은 입력과 평가 기준으로 비교해야 합니다. 공식 비교 설명
Jev는 판단을 틀리지 않나요
정해진 형식으로 결과를 반환하더라도 잘못된 선택을 할 수 있습니다. 출력 형식이 맞는 것과 판단 내용이 맞는 것은 별개입니다. 공식 문서도 확률의 보정이 개별 답의 정답을 보장하지 않는다고 설명합니다. 확률과 정답의 관계
함께 읽을 글
Jev를 처음 살펴본다면, 우리 서비스에서 사람이 반복해서 분류하거나 평가하는 일이 무엇인지 떠올려 보면 좋겠습니다. 그중 입력 정보와 판단 기준을 분명히 정할 수 있는 작업이 실험의 출발점이 될 수 있습니다.
AI를 실제 업무 흐름에 연결하는 방식은 AI 에이전트 가이드와 하네스 엔지니어링에서도 살펴볼 수 있습니다. 관련 글은 AI 카테고리에 모아 두었습니다.
공식 발표와 문서 확인일: 2026년 10월 10일. 표지 이미지는 Jev의 동작 개념을 설명하기 위해 AI로 제작한 일러스트입니다.