내가 돌려 본 두 demo
같은 업무 상태가 demo 둘을 통과했습니다. 닫힌 질문을 한 번에 묻고, 확신이 오르지 않는 위험 질문은 멈췄습니다. GPT-5.6 Terra와의 공식 나란히 보기는 어느 질문이 어긋나는지만 보기 위한 것이었습니다.
공동 작성자: folkbench.com (Folkbench는 AI API, 모델 서비스, 관련 사이트를 위한 검증 가능한 평가·선택 플랫폼입니다. 공개된 서비스 정보, 가격, 가용성, 지연, 증거 구간을 바탕으로 사용자가 경로를 비교하고 고를 수 있게 합니다.)
이 시리즈는 열 편입니다:
- JEV - 관절에는 뇌가 필요 없습니다
- JEV - 채팅하지 못하는 Jev가 Agent에 맞는 이유
- JEV - “환각할 수 없다”는 말이 어디까지인가
- JEV - 예/아니오, 선택, 등급이 하나의 언어로 충분한가?
- JEV - 연구소는 만들 수 있습니다. 그래도 만들지 않을 수 있습니다.
- JEV - 내가 돌려 본 두 demo
- JEV - 사람은 루프의 가운데에서 가장자리로 물러납니다
- JEV - 그 선을 넘으면, 나는 누가 더 똑똑한지 더 이상 가리지 못합니다
- JEV - 어떤 질문은 여기에 속하지 않습니다
- JEV - 덜어 낸 모델, 스위트, 그리고 말하지 않는 하나
오늘 나는 Jev를 시험하며 demo 두 개를 돌렸습니다. 둘 다 채팅을 시키지 않았습니다. 나는 업무 상태 한 덩어리를 넣고, 닫힌 질문을 묻고, 무엇이 돌아오는지 보았습니다.
상태는 업무의 한 조각이고, 판단하기에 충분합니다. 나는 그것을 이야기로 만들지 않았습니다. 채팅 모델은 이런 입력을 받으면 종종 이해의 문단으로 시작한 다음 조언을 붙입니다. 나는 조언을 원하지 않았습니다. 나는 그것이 흐름 한가운데 관절로 머물 수 있는지, 수를 내보내고 코드가 이어가게 할 수 있는지를 보고 싶었습니다.
첫 번째 demo
나는 그 상태를 넣고 닫힌 질문을 한 번에 물었습니다. 나는 클릭했습니다. 바로 돌아왔습니다.
공식 범위는 70에서 500밀리초입니다. 나는 시간을 재지 않아서, 내가 범위의 어디에 떨어졌는지는 말할 수 없습니다. 내가 느낀 것은, 초조해질 때까지 가지 않았다는 점입니다. 긴 답을 쓰는 모델에서는, 나는 창을 두고 다른 일을 하는 데 익숙합니다. 이번에는 창을 두는 데까지 가지 못했습니다. 내가 다른 곳으로 바꾸기 전에 결과가 이미 페이지에 있었습니다.
돈은 따로 계산했습니다. 출력은 과금되지 않습니다. 입력은 100만 토큰당 $0.042입니다. 상태가 짧으면, 호출 한 번의 입력 비용은 계정에 가서 찾아봐야 보입니다. 관절로 쓰면 쌉니다. 이런 노드는 여러 번 걸립니다. 출력도 과금하는 대형 모델이면, 나는 두 번째 문장부터 아끼기 시작합니다. 여기서는 질문을 하나 더 물어도 그 부담이 없습니다.
질문은 그 세 가지였습니다.
예/아니오에는 Noul을 썼습니다. 나는 이 주문을 자동 흐름에서 들어 올려 사람에게 먼저 줘야 하는지를 물었습니다. 그것은 마른 “예”나 “아니오”로 답하지 않습니다. “예”의 확률로 답하고, 그 값은 0과 1 사이입니다. 나는 그것이 어느 끝에 붙는지를 봅니다. 한 끝에 붙으면, 나는 그 질문을 정해진 것으로 봅니다. 가운데에서 흔들리면, 그 질문은 아직 열려 있습니다.
분류에는 Choice를 썼고, 단일 선택입니다. 선택지와 각각의 뜻은 내가 적었습니다. 나는 255를 향해 쌓지 않았습니다. 공식 상한은 255이고, 이 질문에는 그것이 필요 없었습니다. 항목이 너무 많으면 나 스스로 볼 수 없습니다. 항목이 적으면 판단할 수 있습니다. 무게가 선택지 하나에 분명히 쌓이고 나머지는 아주 얇을 때, 그런 1등만 분기에 넣습니다. 1등과 2등이 바짝 물리면, 1등이 있다고 해서 받지 않습니다. 조금 더 높을 뿐인 1등은 아직 갈라지지 않았습니다.
위험에는 Score를 써서, 어느 등급에 떨어지는지 보았습니다. Score의 눈금은 2에서 10등급입니다. 나는 이 질문을 그 범위 안에서, 가벼운 쪽에서 무거운 쪽으로 잘랐습니다. 다른 눈금을 만들지 않았습니다. 그것은 모든 등급의 확률과, 그 확률로 가중된 위치를 돌려줍니다. 나는 그 위치를 혼자 쓸 엄두가 나지 않습니다. 확률이 한 등급에 쌓이면, 그 위치는 그 등급입니다. 확률이 이웃한 두 등급으로 갈라지면, 위치는 가운데로 떨어집니다. 위치는 더 고와 보이고, 두 등급은 여전히 있습니다. 나는 그런 종류의 위치를 나중 조건에 적지 않습니다.
그것은 설명을 쓰지 않습니다. 확률을 보고, 설명을 보지 않습니다. 예전에 같은 종류의 판단에 채팅 모델을 썼을 때, 결론은 문단 안에 싸여 있었습니다. 나는 필드에 채울 엄두가 나기 전에 말을 벗겨야 했고, 공손을 입장으로 받아들일까 두려웠습니다. 오늘 그런 말의 층은 없습니다. 안에는 타입과 확률입니다. 이 demo가 내게 확인시켜 준 것은, 그것이 관절로 맞는다는 점입니다. 나는 짧은 글을 다 읽은 다음에야 코드를 이을 필요가 없습니다.
나는 순간의 느낌이 아니라 분포에서 취사선택을 했습니다. 가장자리에 붙은 예/아니오는 자동으로 통과시켰습니다. 범주의 무게가 항목 하나에 쌓이면, 코드가 잇게 했습니다. 위험 질문의 분포는 모이지 않았고, 나는 이 demo에서 그것을 고정하지 않았습니다. 다음 것으로 남겼습니다.
두 번째는 같은 것을 쪼갭니다
두 번째 demo는 같은 상태를 썼습니다. 나는 새것을 찾으러 가지 않았습니다. 나는 질문을 쪼개서, 사람이 모든 루프의 한가운데 설 필요는 없다는 그 문장을 확인하려 했습니다.
확신도가 높으면 코드에 줄 준비가 되어 있었습니다. 낮으면 내가 보려고 남겼습니다. 시험해 보니, 높은 것들은 놓아도 괜찮았습니다. 가장자리에 붙은 예/아니오와, 한쪽으로 쌓인 범주는 프로그램이 스스로 걷게 했습니다. 높은 것은 곧장 분기로 들어갑니다. 규칙은 코드에 적혀 있습니다. 확신이 충분하면 프로그램은 계속합니다. 확신이 충분하지 않으면 프로그램은 내 앞에 멈춥니다. 내가 로그를 읽을 때, 그 높은 루프들은 내 끄덕임을 기다리지 않았습니다. 나는 하나씩 확인하지 않았습니다.
낮은 것은 위험 질문이었습니다. 나는 그것을 충분히 단단히 묻지 않았고, 상태에도 이웃한 두 등급을 가를 자료가 빠져 있었습니다. 분포는 퍼져 있었고, 확신도는 오르지 않았습니다. 보는 동안 나는 사실 등급 하나를 대신 고르고 싶었습니다. 흐름 전체가 끝나게 하려고입니다. 그 생각은 따르면 안 됩니다. 일단 퍼지면, 나는 그것을 대신 닫고 싶지 않습니다. 내가 아무 등급이나 골라 적어 넣으면, 뒤의 단계는 그 등급을 사실로 취급합니다. 그것은 내가, 그것이 하지 않은 결정을 보태고, 이미 끝난 답으로 꾸미는 일입니다.
그래서 그 질문은 멈췄습니다. 그것은 내가 보도록 남았고, 자동 분기에는 들어가지 않았습니다. 나는 운을 보려고 다시 돌리지 않았습니다. 자료는 여전히 같았고, 분포는 대개 여전히 퍼져 있을 것이었습니다. 이 질문은 강요하면 안 됩니다. 나중에 나는 상태를 두껍게 할 수도 있고, 등급을 실제로 떨어져 서는 말로 적을 수도 있습니다. 지금 등급 하나를 억지로 꺼내면, 돌아오는 것은 평균입니다. 그 수를 분기에 넣으면, 뒤는 그것을 이미 정해진 위험으로 취급합니다.
나는 옆에 “더 심각하다고 느낀다”고 적지 않았습니다. 내 느낌이 퍼진 분포를 누르고, 그다음 자동으로 실행되게 보낼 수는 없습니다. 분포가 정말로 기울었다면, 무게는 스스로 한쪽으로 쌓입니다. 쌓아 넘기지 못하면, 나는 그것을 대신 쌓을 입장이 없습니다. 나는 두 번째 demo를 거기서 멈췄습니다.
공식의 나란히 보기
두 demo를 끝낸 뒤에야, 나는 공식 playground의 나란히 보기 예를 열었습니다. 한쪽은 Jev입니다. 다른 쪽은 GPT-5.6 Terra입니다. Terra는 기본 추론을 썼습니다. 나는 누가 더 똑똑한지 판단하러 간 것이 아닙니다. 불일치가 어느 질문에 떨어지는지만 보았습니다.
나는 그것들을 끝까지 대조했습니다. 양쪽이 다른 것은 “Churn likelihood level”뿐이었습니다. 다른 질문들은 맞았습니다. 질문 자체가 흐립니다. 이탈이 얼마나 높을지는 깨끗한 등급으로 닫기 쉽지 않습니다. 흐릴 때 그것이 주는 것은 분포입니다. 다른 쪽은 답을 끝내려면 단어 하나를 내보내야 합니다. 나는 그 불일치를 승패로 적지 않았습니다. 분포를 주는 것이, 단어를 억지로 꺼내는 것보다 정직합니다. 그 단어는 사람이 말하는 문장 안에 있을 수 있습니다. 스스로 실행할 분기에는 속하지 않습니다.
나는 내 낮은 위험 질문을 돌아보았습니다. 내 것과 이 나란히 보기는 같은 종류입니다. 옆에 두 번째 모델은 없고, 그래도 나는 퍼진 확률을 등급 하나로 집으면 안 됩니다.
채팅하지 못하는 것을, 나는 처음에는 결함으로 받았습니다. 써 본 뒤로는 그렇게 보지 않습니다. 반환에 여는 말이 없습니다. 나는 여는 말을 지울 필요가 없습니다. 예전에 채팅 인터페이스에서 판단을 파낼 때, 나는 먼저 인사치레를 건너뛰어야 했고, 나중에 마음을 바꿀까도 막아야 했습니다. 오늘 치울 텍스트는 없습니다. 내게 그것은 해방입니다. 틀리기 쉬운 일이 하나 줄어든 것입니다.
오늘 내가 돌린 것은 이 두 demo입니다. playground의 나란히 보기는 열어서 보기만 했습니다. 내가 만든 세 번째로 치지 않습니다. 첫 번째는, 그것이 관절 위에 있을 수 있고 확신도가 높은 것은 코드에 줄 수 있다는 점을 내게 정했습니다. 두 번째에서 나는 분포가 퍼진 질문을 멈췄고, 이미 답한 것처럼 꾸미지 않았습니다. 빠릅니다. 이 가격이면 거듭 호출하는 것도 싸다고 느낍니다. 돌아오는 것은 글이 아닙니다. 분포입니다.
출처
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://console.typesafe.ai/playground?share=shr_13a74b495fb786c4bd7964f11597301e7c9