“환각할 수 없다”는 말이 어디까지인가
TypeSafe는 Jev가 환각할 수 없다고 합니다. 그 문장이 서는 층은 타입뿐입니다. 답은 미리 준 표를 벗어나지 못합니다. 보정과 맞음은 따로이고, 워크플로 평가는 Astra와 Fable의 평균에 맞춥니다.
공동 작성자: folkbench.com (Folkbench는 AI API, 모델 서비스, 관련 사이트를 위한 검증 가능한 평가·선택 플랫폼입니다. 공개된 서비스 정보, 가격, 가용성, 지연, 증거 구간을 바탕으로 사용자가 경로를 비교하고 고를 수 있게 합니다.)
이 시리즈는 열 편입니다:
- JEV - 관절에는 뇌가 필요 없습니다
- JEV - 채팅하지 못하는 Jev가 Agent에 맞는 이유
- JEV - “환각할 수 없다”는 말이 어디까지인가
- JEV - 예/아니오, 선택, 등급이 하나의 언어로 충분한가?
- JEV - 연구소는 만들 수 있습니다. 그래도 만들지 않을 수 있습니다.
- JEV - 내가 돌려 본 두 demo
- JEV - 사람은 루프의 가운데에서 가장자리로 물러납니다
- JEV - 그 선을 넘으면, 나는 누가 더 똑똑한지 더 이상 가리지 못합니다
- JEV - 어떤 질문은 여기에 속하지 않습니다
- JEV - 덜어 낸 모델, 스위트, 그리고 말하지 않는 하나
TypeSafe는 Jev가 “환각할 수 없다”고 합니다. 그 문장은 환각을 한 번에 금지한 것처럼 들립니다. 같은 글은 그것을 좁힙니다. 그들이 쓴 것은, 스키마 일치가 보장이지 통계가 아니므로 타입 오류를 0%로 적을 수 있다는 말입니다. 반례 하나면 그것을 반박하기에 충분합니다. 그들은 수학적으로 불가능하다고 합니다.
그 문장이 설 수 있는 층은 타입뿐입니다. Jev는 문자열 생성을 포기했습니다. 그 자리에서 생성한 텍스트 한 단락이 아니라, 미리 고정한 구조를 돌려줍니다. 확률이 정확한지, 판단이 맞는지, 그것은 다른 두 일입니다. 읽는 사람이 둘을 나누지 않으면, “산문을 쓰지 않았다”가 “답이 맞다”로 들립니다.
그 표를 벗어날 수 없습니다
질문 유형은 세 가지뿐이고, 모두 봉해져 있습니다. Noul은 한 가지가 성립하는지를 묻고, 돌아오는 것은 0에서 1까지의 확률입니다. Choice의 선택지는 호출자가 미리 적어야 하고, 표 하나에 최대 255개입니다. 돌아오는 것은 고른 선택지이고, 모든 선택지에 확률과 확신도가 붙습니다. Score의 등급도 미리 적어야 하며, 최소 둘, 최대 열입니다. 점수는 두 등급 사이에 떨어질 수 있습니다. 답에는 각 등급의 확률과 확신도가 동시에 실립니다. 그 점수는 여전히 눈금 위의 위치이지, 새로 시작한 문단이 아닙니다.
선택지 표를 벗어날 수 없습니다. 모델이 갑자기 산문 한 편을 써서 답을 말로 꿰맞출 수도 없습니다. 문서는 이것을 곧게 말합니다. 모델이 돌려주는 것은, 호출자가 제출한 선택지나 등급 위의 분포입니다. 그 분포 밖의 값은 돌려주지 않습니다. 코드는 이 값을 바로 쓸 수 있고, 생성된 문단에서 필드를 먼저 파낼 필요가 없습니다.
채팅 모델은 보통 이렇게 일을 넘기지 않습니다. 문자열을 넘깁니다. 문자열은 정상적인 답일 수도 있고, 환각일 수도 있습니다. 소프트웨어는 여전히 파싱하고 검증해야 합니다. 검증이 실패하면 프로그램은 그것을 바로 쓸 수 없습니다. TypeSafe는 타입 안전과 환각을 같이 놓고, 타입 안전을 자동화의 최소 조건으로 봅니다. 호출 사슬 깊은 곳에서 타입이 틀리면, 뒤의 분기는 잘못된 곳에 이어집니다. 공식 글은 또, 지금의 모델이 아무리 똑똑해도 여전히 환각하고 여전히 타입 오류를 낸다고 합니다.
타입 안에 머문다고 판단이 틀리지 않는 것은 아닙니다. 닫힌 질문에서 잘못된 항목을 고르는 것은 여전히 틀립니다. 공개된 보안 경보 흐름에서 모델은 닫기, 분석가에게 넘기기, 지금 봉쇄하기 중에서 골라야 합니다. 세 선택지 모두 표 위에 있습니다. 모델이 잘못 골라도 타입은 여전히 합법입니다.
공식 설명은 System One을 언제나 맞다고 부르지 않습니다. 그들은 System 1 사고가 실수하기 쉽다는 인상을 준다고 썼습니다. 그들은 System One 모델이 대안보다 더 믿을 만하게 만들어질 수 있다고 믿습니다. 구체적인 이유는 나중으로 남깁니다. 그것은 그들의 방향입니다. “언제나 맞다”가 아닙니다.
Choice에는 또 하나의 단단한 가장자리가 있습니다. 선택지가 255를 넘으면 표 하나가 담지 못합니다. 링크를 따라가는 Wikipedia 경주는 한 걸음에서 수백에서 수천 개의 링크 중 하나를 골라야 합니다. 그들은 두 단계로 바꿉니다. 따로 점수를 매긴 다음, 선택을 합니다. 가끔 느려집니다. 그 느려짐은 Wikipedia 경주 demo에서 나타났습니다. 높은 기수는 무한이 아닙니다. 여기서 “환각이 없다”는 여전히, 표에 없는 링크를 돌려주지 않는다는 뜻일 뿐입니다. 선택지는 제한 없이 더할 수 없습니다.
확신은 따로인 질문입니다
보정은 따로인 일입니다. 공식 설명은, 답에 확률과 확신도가 실린다는 것입니다. 확신도가 더 높으면 정확도도 더 높습니다. 비슷한 입력은 비슷한 답을 돌려줍니다. 반대편에서 그들은 채팅 모델을 씁니다. 확신도를 보고하라고 prompt해도, 그것은 종종 과신하고 불안정합니다. 과제를 95%는 맞게 할 수 있는데 모델이 어느 5%를 확신하지 못하는지 말하지 않으면, 그 과제는 자동화할 수 없습니다.
Choice와 Score의 확신도는, 모델이 따로 보고하는 확신의 문장이 아닙니다. 그 수는 분포의 모양에서 계산됩니다. 확률이 선택지 하나나 등급 하나에 쌓이면 수는 높습니다. 확률이 여러 곳으로 퍼지면 수는 낮습니다. 호출자는 수가 높으면 스스로 하고, 낮으면 사람에게 넘깁니다. Noul은 별도의 확신도를 붙이지 않습니다. 예 또는 아니오의 확률 자체가 신호입니다. 공식 비교표는 확률과 확신도를 같이 적습니다. 세 질문에 적용하면, Choice와 Score는 둘 다 있고 Noul은 확률만 있습니다.
확신도 1.0은, 분포가 결과 하나에 전부 눌려 있다는 뜻일 뿐입니다. 그것은 이 답의 모양을 묘사합니다. 분포가 잘못된 선택지에 전부 눌려 있을 때도 확신도는 높을 수 있습니다. 수가 크다고 결과가 맞는 것은 아닙니다.
타입 오류는 나올 수 없습니다. 수학적으로 불가능합니다. 보정에는 그런 종류의 보장이 없습니다. 공식 설명이 주는 것은 대응입니다. 확신도가 더 높으면 정확도도 더 높습니다. 그 대응이 끊기면 타입은 여전히 벗어나지 못하고, 확신도는 더 이상 임계값이 될 수 없습니다. 그래서 이 층에는 메커니즘이 있고, 주장도 있습니다. 수가 더 높을 때 오류가 더 적은지, 비슷한 입력이 비슷한 분포로 돌아오는지, 둘 다 따로 봐야 합니다. 필드가 매번 있다는 것은, 호출자가 그 수를 읽을 수 있다는 뜻일 뿐입니다.
맞음은 세계가 아닙니다
맞음과 틀림은 한 번 더 갈라야 합니다. 워크플로 평가가 재는 것은, 같은 흐름 안에서 모델이 기준에 얼마나 가까운지입니다. 그 기준은 세계의 객관적 답이 아닙니다. 그들은 흐름의 코드가 맞다고 가정하고, 라벨이 맞는지 다투지 않습니다. 기준 라벨은 GPT-6 Astra와 Claude Fable 5.1의 평균입니다. 둘 다 high thinking을 쓰고, 각자 흐름의 모든 질문에 답합니다. 다른 모델은 각 공급자의 기본 추론으로 비교합니다.
Jev가 그 평균에 가까워진다는 것은, 그 두 모델의 합의에 가까워진다는 뜻입니다. 사실보다 더 참되다고 적을 수 없습니다. 합의가 기울면, 합의에 붙는 답도 기울니다. 공식 글은, 이 둘의 평균을 기준으로 쓰면 답이 OpenAI와 Anthropic의 모델 쪽으로 기운다고 합니다.
비교하는 동안 대형 모델은 System One LLM adapter에 싸입니다. 그것은 그들 역시 구조화된 결정을 내보내게 강제해서, 같은 질문 유형 안에서 비교할 수 있게 합니다. 공식 설명은, 확률을 달고 묻는 방식이 보통 확률 없는 결정보다 더 느리고 더 비싸다고 인정합니다. 그들의 결론은, 이것이 대형 모델에서 결정을 가져오는 가장 정확한 방법이라는 것입니다. 그 정확함은 확률을 싣지 않은 결정과 비교한 것입니다. 결정이 바깥의 사실과 맞았다는 뜻은 아닙니다.
차트의 대형 모델 타입 오류 숫자는 OpenRouter에서 오고, 편향이 있습니다. 더 복잡한 질의는 더 강한 모델로 라우팅될 수 있습니다. Jev의 0%는 같은 종류의 통계가 아닙니다. 공식 글은 그들의 숫자가 경험적 결과가 아니라고 합니다. 스키마 일치가 보장되므로, 차트는 0%로 채울 수 있습니다. 한쪽은 라우팅 뒤의 관측입니다. 다른 쪽은 보장에서 채워 넣은 숫자입니다. 이것은 같은 오류율이 아닙니다.
GPT-5.6 Terra와의 나란히 보기는 기본 추론을 썼습니다. 공식 쪽이 그 모델을 고른 이유는, 그들이 읽어 보니 지능이 평균적으로 Jev에 가장 가깝기 때문입니다. 기록된 실행에서 유일한 불일치는 “Churn likelihood level”입니다. 공식의 견해는, 그 질문이 모호해서 답을 깨끗이 말할 수 없다는 것입니다. 모호한 질문에서는 분포가 단단한 라벨보다 정직합니다.
“환각할 수 없다”는, 끝에서 보면 타입 밖의 출력을 만들지 않는다는 뜻입니다. 그래서 그들은 타입 오류를 0%로 적습니다. 보정은 따로 받아들여야 하고, 기준은 확신도를 임계값으로 쓸 수 있는지입니다. 판단이 맞는지를, 이 흐름 평가는 세계 자신의 답으로 줄 수 없습니다. 그것이 맞추는 것은 Astra와 Fable의 평균입니다.
출처
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://evals.typesafe.ai/
- https://github.com/typesafe-ai/system-one-adapter-python
- https://docs.typesafe.ai/primitives/choice
- https://docs.typesafe.ai/primitives/score
- https://docs.typesafe.ai/confidence