생성형 AI는 답변, 요약, 글쓰기, 계획에 강합니다. 그러나 기업 업무의 중요한 단계에서 필요한 것은 더 긴 문장이 아니라 소프트웨어가 바로 사용할 수 있는 판단입니다. 이 티켓을 어느 팀으로 보낼지, 거래 위험 점수는 얼마인지, 이 작업을 자동 실행해도 되는지, 언제 사람에게 넘겨야 하는지를 결정해야 합니다.
2026년 9월 TypeSafe AI의 JEV가 Vercel AI Gateway에 출시됐습니다. Vercel은 JEV를 확률적 의사결정 모델로 설명합니다. 애플리케이션이 구조화된 상태와 제한된 답변 공간을 선언하면 Choice, Score, Boolean 형식의 결과와 확률을 반환합니다. 긴 콘텐츠를 만들고 폭넓게 추론하며 다양한 도구를 사용하는 범용 LLM을 대체하기보다, “다음에 무엇을 할 것인가”를 검증 가능한 구성요소로 좁힙니다.
중요한 것은 새 모델 이름보다 아키텍처 변화입니다. 범용 LLM은 이해와 생성을, 의사결정 모델은 정의된 선택지와 신뢰도를, 기업 코드·정책·사람은 실제 실행 허가를 담당합니다. AIOS를 구축하는 조직에서 JEV는 모델 능력과 운영 통제 사이의 간격을 채울 수 있습니다.

그림: JEV의 가치는 더 많은 콘텐츠 생성이 아니라 형식, 확률, 임계값을 가진 판단을 통제 경로에 놓는 데 있다.
1. JEV란 무엇인가: “판단해 달라”를 경계가 있는 질문으로 바꾸기
Vercel의 JEV 설명은 이를 “System One” 모델이라고 부릅니다. 현재 상태와 미리 선언한 질문을 입력하면 자유 형식 문장이 아닌 제한된 형식의 답을 반환합니다. 분류, 점수화, 위험 플래그, 라우팅처럼 빈도가 높고 범위가 분명한 판단에 적합합니다.
| 출력 형식 | 예시 | 소프트웨어 사용 방식 | 주요 위험 |
|---|---|---|---|
| Choice | billing/technical/sales |
정의된 대기열로 바로 라우팅 | 선택지가 불완전해 잘못된 분류를 강제함 |
| Score | 0~100 우선순위 | 정렬, 등급화, SLA 트리거 | 보정되지 않은 점수가 새 데이터에서 왜곡됨 |
| Boolean | 자동 처리를 허용할지 | 통과, 차단, 사람 검토 요청 | 확률 판단을 확정 사실로 취급함 |
채팅 모델과의 핵심 차이는 추론 전에 답변 공간이 정해진다는 점입니다. 🔗 대규모 언어 모델의 기본 원리는 생성 계층을 이해하는 데 도움이 되고, 의사결정 모델은 좁은 과제를 프로그램이 소비할 수 있는 결과로 만듭니다. 형식이 정확성을 보장하지는 않지만 자유 텍스트 파싱, 표기 흔들림, 필드 누락을 줄입니다.
2. AI 에이전트에 별도 의사결정 계층이 필요한 이유
기업 에이전트는 보통 입력 이해, 정보 검색, 다음 행동 선택, 도구 실행을 함께 수행합니다. 하나의 범용 모델이 네 가지를 모두 맡으면 프롬프트가 정책 엔진, 라우터, 출력 스키마까지 겸합니다. 흐름이 길어질수록 오류가 데이터, 추론, 형식, 권한 중 어디서 발생했는지 찾기 어려워집니다.
JEV의 아키텍처 가치는 분리입니다. 🔗 AI 에이전트 개발은 계획과 실행을, 🔗 MCP와 AI 에이전트는 표준화된 도구 연결을 다룹니다. 의사결정 계층은 현재 상태에서 어떤 행동이 임계값을 충족하는지, 사람 승인이 필요한지, 판단이 얼마나 불확실한지를 답합니다.
통제 가능한 흐름은 다음과 같습니다.
- 범용 LLM이 이메일, 통화, 문서를 구조화된 상태로 바꿉니다.
- RAG나 업무 시스템이 고객, 계약, 이력 정보를 보완합니다.
- JEV가 라우팅, 우선순위, 위험, 자동화 가능성을 병렬 평가합니다.
- 코드가 확률, 역할 권한, 정책 임계값을 결합합니다.
- 영향이 크거나 신뢰도가 낮은 사례는 사람에게 보냅니다.
- 최종 결과를 관측·재평가 가능한 증거로 저장합니다.
이 구조는 데이터 품질과 의사결정 품질을 분리해 관찰하게 합니다. 검색이 틀리면 데이터 경로를, 임계값이 틀리면 보정을 개선하면 됩니다.
3. 속도와 비용 수치를 읽는 방법
Vercel 출시 공지는 TypeSafe AI의 워크플로 평가에서 JEV가 특정 테스트 기준 LLM보다 최대 193.6배 빠르고 444.6배 저렴했다고 소개합니다. 이는 공급업체가 보고한 특정 평가 결과이며 모든 데이터, 지역, 공급업체, 기업 업무에 대한 보편적 보장이 아닙니다.
Vercel 채택 보고서는 출시 24시간 안에 유료 팀의 약 13%가 JEV를 사용했다고 밝혔습니다. 이 역시 AI Gateway 내부의 플랫폼 데이터이며 글로벌 시장 점유율이 아닙니다. 다만 장문 생성보다 빠르고 제한된 결정을 원하는 개발 수요가 많다는 점은 보여 줍니다.
| 영역 | 측정할 항목 | 단독으로 믿지 말아야 할 수치 |
|---|---|---|
| 품질 | 클래스별 precision/recall, 보정 오차, 사람의 번복률 | 평균 정확도 하나 |
| 지연 | P50, P95, P99, 대기열 시간 | 가장 빠른 한 번 |
| 비용 | 1,000회 판단, 재시도, 검토, 오류 영향 | 표시된 모델 단가 |
| 운영 | 자동 완료율, 검토율, 사고율, 복구 시간 | API 성공률 |
잘못된 판단의 손실이 크다면 추론이 수백 배 저렴해도 자동 승인 근거가 되지 않습니다. 허용 가능한 위험 수준에서 업무 한 건을 완료하는 총비용이 핵심입니다.
4. 확률은 정답이 아니다: 임계값, 보정, 기권
확률이 있으면 1위 결과를 사실로 취급하지 않고 임계값을 설정할 수 있습니다. 고객 문의의 1위 분류가 0.61이고 2위가 0.37이면 사람에게 보내고, 1위가 0.96이며 과거 보정이 안정적이면 자동 분배할 수 있습니다.
그러나 모델의 0.9가 실제로 90% 정확함을 뜻하지는 않습니다. 자사 데이터에서 신뢰도 구간별 실제 정확도를 측정하고 언어, 제품, 고객 유형, 시간에 따라 나눠야 합니다. 영어에서 작동한 임계값이 한국어에서도 같다고 가정하면 안 됩니다.
- 자동 영역: 높은 신뢰도, 낮은 영향, 되돌릴 수 있는 행동.
- 사람 검토 영역: 후보가 비슷하거나 데이터가 부족하고 영향이 중간 이상인 경우.
- 기권/차단 영역: 범위 밖 입력, 이상 징후, 명확한 정책 금지.
법규, 금액 한도, 역할 권한은 결정적 규칙이 담당하고, 의미의 모호성·우선순위·위험 성향은 확률 모델이 보완합니다. 최종 행동은 규칙, 모델, 사람이 함께 결정합니다.
5. JEV와 범용 LLM의 역할 분담
Vercel의 JEV와 GPT-6 Astra 비교는 경계를 제시합니다. JEV는 정의된 답과 고유 확률이 필요한 집중 의사결정에, 범용 모델은 콘텐츠 생성·개방형 추론·폭넓은 도구 작업에 적합합니다.
| 업무 | JEV 우선 | 범용 LLM 우선 | 조합 패턴 |
|---|---|---|---|
| 티켓 분류 | 범주 고정, 대량, 신뢰도 필요 | 새로운 문제 유형을 먼저 이해 | LLM 요약, JEV 라우팅 |
| 위험 등급 | 고정 등급 또는 점수 | 전체 조사 설명 작성 | JEV 등급, LLM 설명 초안 |
| 도구 작업 | 허용 또는 검토 여부 결정 | 여러 단계와 매개변수 계획 | LLM 계획, JEV 게이트, 코드 실행 |
| 고객 답변 | 전략이나 톤 선택 | 개인화 문장 생성 | JEV 선택, LLM 작성, 사람 표본검사 |
🔗 WAIC 2026의 에이전트·로봇·칩이 보여 주듯 산업의 관심은 “모델이 무엇을 말하는가”에서 “시스템이 무엇을 끝내는가”로 이동합니다. 의사결정 계층은 비싼 LLM 호출 전에 작업을 라우팅하고, 도구 실행 직전에 위험을 차단할 수 있습니다.
6. JEV를 AIOS 안에 배치하기
JEV 자체는 기업의 신원, 데이터 계약, 컴퓨팅, 정책, 버전, 감사를 관리하지 않습니다. 각 팀이 질문과 임계값을 따로 만들면 연결되지 않은 의사결정 API만 늘어납니다.
AIOS는 여섯 가지 공통 기능을 제공해야 합니다.
- 모델·질문 레지스트리: 버전, 스키마, 선택지, 용도, 책임자.
- 데이터 계약: 필수 필드, 출처, 민감도, 결측 처리.
- 임계값 정책: 테넌트, 역할, 위험, 지역별 자동·검토·차단.
- 라우팅·용량: 적절한 모델과 자원, 실패 시 대체 경로.
- 관측성: 확률, 선택지, 버전, 지연, 사람의 번복, 최종 결과.
- 지속 평가: 데이터 드리프트, 신뢰도 이동, 클래스 불균형, 정책 노후화.
인프라도 중요합니다. 🔗 GPU·NPU·TPU·LPU의 차이는 가속기 특성을, 🔗 GPU 자원 관리는 공유·격리·활용률을 설명합니다. AIOS는 이런 자원 신호를 모델, 판단, 업무 결과와 연결해야 합니다.
NIST AI Risk Management Framework의 Govern, Map, Measure, Manage 관점에 따라 각 JEV 용도에 업무 경계, 영향도, 측정, 예외 경로를 정의할 수 있습니다. 확률 출력은 이 통제면에 들어갈 때 비로소 관리 가능한 기업 판단이 됩니다.
7. 먼저 하기 좋은 세 가지, 나쁜 세 가지
좋은 시작점
- 티켓·콘텐츠 라우팅: 범주가 안정적이고 오류를 되돌릴 수 있으며 사람 라벨이 자연스럽게 쌓입니다.
- 경보 우선순위: Score로 순서를 정하되 기존 규칙이 필수 경보를 유지합니다.
- 저위험 자동화 게이트: 데이터 보강, 재시도, 사람 검토 요청처럼 복구와 기록이 가능한 작업입니다.
나쁜 시작점
- 되돌릴 수 없는 고액 금융 판단: 법규, 공정성, 데이터 의무가 단일 확률보다 중요합니다.
- 인사 징계, 의료, 법률 결론: 영향이 큰 전문 판단은 책임 있는 사람에게 남겨야 합니다.
- 답변 공간이 계속 변하는 업무: 범용 모델과 사람으로 먼저 탐색하고 분류 체계가 안정된 후 제한 질문을 만듭니다.
8. 90일 도입: 하나의 완전한 의사결정 루프 증명
1~30일: 질문과 실패 비용 정의
대량·저위험·가역적인 판단 하나를 선택합니다. Choice/Score/Boolean, 데이터 출처, 정답, 기권 조건, 책임자를 정하고, 과거 데이터의 언어·제품·고객 분포를 보존합니다.
31~60일: 섀도 모드와 보정
JEV 결과를 실제 실행하지 않고 사람의 결정과 비교합니다. precision, recall, 보정, 지연, 비용, 집단별 차이를 측정해 자동·검토·차단 영역을 설정합니다.
61~90일: 되돌릴 수 있는 작업만 자동화
영향이 낮고 복구 가능한 사례부터 자동 실행합니다. 사람의 모든 번복과 최종 결과를 기록하고, 모델이나 데이터 이상 시 정지 스위치를 둡니다. 출시를 평가의 끝으로 보지 말고 임계값을 매주 재검토합니다.
JEV가 보여 주는 방향은 분명합니다. 기업 AI의 모든 단계를 자유 형식 생성으로 만들 필요는 없습니다. 질문을 제한할 수 있다면 형식화된 결과, 고유 확률, 외부 정책이 에이전트를 더 빠르고 저렴하며 통제 가능하게 만듭니다. 하지만 속도와 형식만으로 거버넌스가 되지는 않습니다. AIOS가 질문, 데이터, 임계값, 권한, 사람, 감사 증거를 연결할 때 JEV는 운영 가능한 의사결정 계층이 됩니다.