채팅하지 못하는 Jev가 Agent에 맞는 이유

Agent에 종종 없는 것은 긴 텍스트가 아니라, 분기에 바로 들어갈 수 있는 판단입니다. 이 글은 세 가지 질문, 워크플로 평가가 비교하는 것, 핫 패스가 채팅을 기다릴 수 없는 이유를 설명합니다.

공동 작성자: folkbench.com (Folkbench는 AI API, 모델 서비스, 관련 사이트를 위한 검증 가능한 평가·선택 플랫폼입니다. 공개된 서비스 정보, 가격, 가용성, 지연, 증거 구간을 바탕으로 사용자가 경로를 비교하고 고를 수 있게 합니다.)

이 시리즈는 열 편입니다:

Agent에 종종 없는 것은 또 한 덩어리의 긴 텍스트가 아닙니다. 제어 흐름에 바로 들어갈 수 있는 판단입니다. 흔한 것은, 이 경보를 닫아 둘지, 이 청구서를 지급할지, 이 trace를 사람이 봐야 하는지, 다음 고객 응대 문장을 상위 단계로 넘길지입니다. 이 노드들은 모델이 분석을 쓰라고 있는 것이 아닙니다. 코드에 필요한 것은 비교하고 분기할 수 있는 값입니다. Jev가 하는 일이 그것입니다.

TypeSafe의 정식화는, 프런티어 지능의 함수 호출이라는 뜻입니다. 상태가 들어옵니다. 타입이 있는 확률적 결정이 나갑니다. 문자열을 생성하지 않습니다. 사람을 위한 문장과, 프로그램을 위한 판단은 같은 출구가 아닙니다.

출력을 먼저 고정합니다

지금 대형 모델의 출력은 문자열입니다. 이어서 가야 하는 소프트웨어는 여전히 그것을 파싱하고, 검증하고, 흘러가는 것을 막아야 합니다. 필드가 하나 더 나타납니다. 문단은 완전해 보이는데, enum은 맞지 않습니다. 채팅 상자의 사람은 알아채고 다시 묻습니다. 코드는 알아채지 못하고, 오류를 안고 걸어갑니다. 호출 몇 겹 아래에 묻히면, 더 똑똑한 모델도 되돌리지 못합니다.

Jev는 출력 공간을 미리 고정합니다. 무엇을 돌려줘도 되는지를 말하면, 그 공간 안에서만 확률을 나눕니다. 타입 오류는 수학적으로 일어날 수 없습니다. 정의하지 않은 모양을 돌려줄 수 없습니다. 그것은 판단이 맞다는 것과 같지 않습니다. 확률은 잘못된 쪽으로 기울 수 있고, 선택지도 잘못된 것일 수 있습니다. 타입 안전이 닫는 것은 모양이지, 맞음과 틀림이 아닙니다. 모양이 고정되면 그 뒤의 분기를 적을 수 있습니다. 문단에서 값을 먼저 건져 낼 필요가 없습니다.

질문은 세 가지뿐입니다.

Noul은 예/아니오입니다. 모델은 0에서 1까지의 확률을 줍니다. 1에 가까우면 예입니다. 0에 가까우면 아니오입니다. 0.5에 가까우면 확신할 수 없습니다. 별도의 확신도를 붙이지 않습니다. 확률이 신호입니다. Choice는 단일 선택입니다. 선택지를 먼저 적고, 상한은 255입니다. 돌아오는 것은 고른 선택지, 모든 선택지 위의 분포, 그리고 확신도입니다. 코드는 그 분포로, 스스로 할지 사람에게 넘길지를 정합니다. Score는 등급입니다. 등급은 2에서 10까지이고, 각 등급의 뜻을 적습니다. 돌아오는 것은 점수, 등급 위의 분포, 그리고 확신도입니다. 점수는 두 등급 사이에, 눈금 위의 위치로 떨어질 수 있습니다.

예/아니오는 조건으로 적습니다. 단일 선택과 등급은 다릅니다. 전자는 어느 선택지에 떨어졌는지를 보고, 후자는 점수에 임계값을 겁니다. 좋은 질문도 여전히 좁습니다. 분야를 아는 사람이 자료를 읽고 1초 안에 내리는 판단이, 여기에 줄 종류입니다. 고객이 환불을 청하는지는 그런 질문입니다. 편지 전체를 읽고 최선의 행동을 정하는 것은 아닙니다. 두 번째 문장이 원하는 것은 느린 추론입니다. 쪼갠 다음 묻습니다. 쪼갠 질문은 같은 상태를 보고, 서로 독립이며, 한 요청에서 함께 돌아옵니다. 가중치는 코드에 남습니다. 정책이 바뀌면 숫자를 바꿉니다. prompt 전체를 다시 쓰지 않습니다.

사람을 멈추게 하는 것은 갈림입니다

사람을 실제로 멈추게 하는 것은 종종 이런 모양의 노드입니다. 경보가 기계에 이미 있는 기록과 함께 오고, 결론은 닫기, 분석가에게 보내기, 또는 지금 격리입니다. 청구서가 주문과 배송 기록에 걸려 있고, 누군가는 지급, 보류, 또는 돌려보내기를 정해야 합니다. 고객 응대 Agent가 끝났고, 도구 호출이 모두 trace에 있으며, 누군가는 이 trace를 볼지와 얼마나 빨리 볼지를 정해야 합니다. 고객이 다시 쓰고, 스레드와 계정 상태가 둘 다 있습니다. 다음 문장을 어떻게 이어야 하는지, 상위 단계로 넘겨야 하는지는 같은 모양의 질문입니다.

규칙이 얼려 둘 수 있는 부분은 코드입니다. 깨지기 쉬운 것은 끝낼 수 없는 예외입니다. 영수증은 맞는데 사유는 흐리고, trace의 한 걸음이 이상해 보입니다. 손으로 적은 논리는 여기서 부서집니다. 정책 전체를 prompt 하나에 넣고 모델이 한 번에 생각하게 하면, 조건문은 덜 씁니다. 출구는 다시 텍스트 한 조각이 됩니다. 텍스트가 제어 흐름에 들어가려면 파싱 층을 하나 더 씁니다. 그 층은 스스로 틀릴 수 있습니다.

TypeSafe의 워크플로 평가가 재는 것은 이 연결 방식입니다. 평가는 과제를 많은 좁은 질문으로 쪼갭니다. 코드가 정할 수 있는 것은 코드가 정합니다. 모델은 코드가 정하지 못하는 판단만 답합니다. 공개된 흐름 네 가지는 보안 사건, Agent trace 관측, 청구서 처리, 고객 응대입니다. 같은 흐름에서, 워크플로 위의 모델은 정책 전체를 prompt 하나에 넣는 것보다 더 정확하고, 비용은 더 적으며 시간도 더 적습니다. 네 과제를 평균하면, 시험한 모델들은 그 방향으로 움직입니다.

그 뒤의 행동은 확률을 따르고, 쾅 닫아 버린 라벨을 따르지 않습니다. 시스템을 떠나는 결과는 여전히 이산적인 행동 하나입니다. 가운데의 공학은 매번 같은 방식으로 해야 합니다.

평가가 재는 것은 가까움입니다

이 평가는 흐름 자체가 잘못 쓰였는지를 두고 다투지 않습니다. 하네스가 맞다고 가정합니다. 기준 답은 사람이 질문마다 매긴 정답 라벨이 아닙니다. GPT-6 Astra와 Claude Fable 5.1이 high thinking으로 모든 질문에 답하고, 두 답을 평균합니다. 다른 모델은 공급자의 기본 추론을 씁니다. 흐름이 고정된 뒤에야 비교할 수 있습니다. 평가가 비교하는 것은, 모델이 그 두 대형 모델의 판단에 얼마나 가까운지, 그리고 속도와 비용입니다.

그래서 이 차트는 Jev가 Astra보다 업무를 더 잘 이해한다고 증명하지 않습니다. 여기서 Astra와 Fable은 자입니다. Jev는 그들의 판단에 가까워야 하고, 지연과 비용에서도 격차를 벌려야 합니다. 질문을 잘못 쪼개면, 더 가까운 자도 도움이 되지 않습니다. 질문을 쪼개는 것은 흐름을 쓰는 사람의 일입니다.

Jev는 “빠르고 싸다”의 프런티어에서 멀리 바깥에 있습니다. 공식 사이트의 더 높은 배수, 약 193.6배 더 빠르고 444.6배 더 싼 것은 이 평가의 높은 쪽입니다. 그 배수는 모든 호출이 아닙니다. 여기의 호출은, 실제로 내보낼 자동화 부하에 더 가깝습니다.

가까워지는 것은 쪼갠 뒤 그 좁은 질문들 위의 확률이지, 긴 분석을 쓰는 일이 아닙니다. Jev는 그 긴 분석을 쓰지 않습니다.

핫 패스는 기다릴 수 없습니다

지연은 Agent에게 단단합니다. 사람은 3초를 아직 기다릴 수 있습니다. 층이 층을 감으면 기다릴 수 없습니다. 같은 연쇄에는 검색, 데이터베이스 쓰기, 다음 호출도 있고, 모든 홉이 같은 시간을 씁니다. 70에서 500밀리초 안에서는 판단을 핫 패스에 둘 수 있습니다. 그 범위를 벗어나면, 호출 스택은 그것을 막는 것으로 취급합니다.

사람과 이야기할 때, 지금의 프런티어 모델은 끝에서 끝까지 3초에서 300초가 넘는 경우가 흔합니다. 그 속도는 코파일럿에는, 또는 사람이 지켜보는 코딩 Agent에는 말이 됩니다. 핫 패스의 조건으로는 그 속도가 말이 되지 않습니다. Jev는 문장을 토큰마다 내보내지 않습니다. 돌아와야 할 확률이 함께 도착합니다. 속도는 거기서 옵니다.

TypeSafe는 Jev로 검사도 합니다. 다른 모델의 prompt, 추론 trace, 출력을 Jev가 점수로 매기고, 가드레일이 되어 jailbreak를 찾습니다. 생성은 채팅 모델에 남습니다. 이 문을 통과하는지는, 문자열을 생성하지 않는 모델이 정합니다. 그것은 Agent 안의 관절이지, 채팅이 아닙니다. 끄덕임과 재검토가 여전히 긴 텍스트 위에 있으면, 그것을 읽을 다른 프로그램을 찾아야 합니다. Jev는 결과를 확률과 등급으로 닫고, 재검토는 코드로 적을 수 있습니다.

사용자를 위해 쓴 문장은 여전히 채팅 모델의 일입니다. Jev는 그 문장을 받지 않습니다. 앞의 라우팅과 뒤의 검사를 받습니다. 여기서 Agent에 없는 것은, 하나 더 길고 더 긴 설명이 아닙니다. 타입이 이미 고정되어, 코드가 그것을 안고 걸을 수 있는 판단입니다.

출처

시리즈