그 선을 넘으면, 나는 누가 더 똑똑한지 더 이상 가리지 못합니다
선은 Opus 4.5와 4.6 사이에 놓입니다. 대부분의 사람은 이제 모델 너머의 과제를 내지 못합니다. 선을 넘으면 가를 수 있는 것은 제품 정의입니다. Jev가 내보내는 것은 확률이지, 더 똑똑한 채팅의 다음 구간이 아닙니다.
공동 작성자: folkbench.com (Folkbench는 AI API, 모델 서비스, 관련 사이트를 위한 검증 가능한 평가·선택 플랫폼입니다. 공개된 서비스 정보, 가격, 가용성, 지연, 증거 구간을 바탕으로 사용자가 경로를 비교하고 고를 수 있게 합니다.)
이 시리즈는 열 편입니다:
- JEV - 관절에는 뇌가 필요 없습니다
- JEV - 채팅하지 못하는 Jev가 Agent에 맞는 이유
- JEV - “환각할 수 없다”는 말이 어디까지인가
- JEV - 예/아니오, 선택, 등급이 하나의 언어로 충분한가?
- JEV - 연구소는 만들 수 있습니다. 그래도 만들지 않을 수 있습니다.
- JEV - 내가 돌려 본 두 demo
- JEV - 사람은 루프의 가운데에서 가장자리로 물러납니다
- JEV - 그 선을 넘으면, 나는 누가 더 똑똑한지 더 이상 가리지 못합니다
- JEV - 어떤 질문은 여기에 속하지 않습니다
- JEV - 덜어 낸 모델, 스위트, 그리고 말하지 않는 하나
기반 모델들의 경쟁은 3년째입니다. 아직 테이블에 남은 것들의 대부분은 선을 넘었습니다. 그 선은 낮지 않습니다.
내가 내리는 정의는 한 문장입니다. 사용자의 90%는 이제 모델이 닿지 못하는 바깥의 과제를 내지 못합니다. 일은 여전히 있습니다. 사람들은 묻기를 멈추지 않습니다. 그 질문들은 모델이 받을 수 있습니다. 메일에 답하기, 회의록을 모으기, 오류 하나를 고치기, 자료 더미를 몇 항목으로 바꾸기. 나는 오래전에 이런 것으로 순위를 매기기를 멈췄습니다. 그것들은 선 안에 있습니다. 나는 착지를 Opus 4.5와 4.6 사이에 둡니다. 그 위는 한 덩어리로 흐려집니다.
그 앞의 2년 동안, 나는 여전히 발표를 쫓고 바꿔 넣어, 누가 더 강한지 진지하게 비교했습니다. 올해 나는 비교를 멈췄습니다. 순위표는 여전히 갱신됩니다. 내 손의 일에는 한 단이 더 생기지 않았습니다.
바꾼 뒤에는 느낌만 남습니다
선 앞에서 나는 가를 수 있었습니다. 긴 글이 흩어질지는 모델을 바꾸면 알았습니다. 단계가 쌓인 뒤에도 앞의 조건이 아직 있는지는, 그 주 안에 느낄 수 있었습니다. 선 뒤에서 나는 능력의 차이를 느끼지 못합니다. 모델을 바꾸면 종종, 조금 나아졌다는 인상만 남습니다. 무엇이 나은지는 말할 수 없습니다.
같은 종류의 일이 지난달에는 내 재작업이 필요했는데, 이번 달에는 통과합니다. 회의 기록을 넣으면 할 일이 나옵니다. 두 공급자가 한두 줄 다르게 나오고, 둘 다 내게는 쓸 만해 보입니다. 코드도 같습니다. 오류를 붙여 넣으면 둘 다 변경을 줄 수 있습니다. 가끔 나는 그중 하나가 더 깨끗하고 diff가 더 작다고 느낍니다. 그들이 벌어진 업데이트를 가리킬 수는 없습니다. 골라야 한다면 나는 더 작은 변경을 고릅니다. 가운데에, 여기서부터 이것을 할 수 있게 되었다고 가리킬 날이 없습니다. 증분은 계속 왔습니다. 내 하루가 기억하기에는 너무 잘습니다.
그래서 나는 이것 때문에 모델을 덜 바꿨습니다. 다음 단에서 누가 더 똑똑한지, 나는 가리지 못합니다.
이것들은 아직 가를 수 있습니다
내가 먼저 느끼는 것은, 그것이 내보내는 것의 모양입니다. 텍스트를 내보내는 것은 이야기할 상대로 대합니다. 뒤섞인 기록을 넘기고, 할 일 몇 가지를 모으게 합니다. 한 번 읽고, 단어 몇 개를 바꾸고, 만족하지 않으면 다시 던집니다. 그 왕복은 익숙합니다. 목소리는 다른 길입니다. 내가 말하면 그것이 말해 돌려줍니다. 나는 많이 쓰지 않습니다. 이동 중에 켭니다. 단어를 바꿔야 하는 순간, 나는 복사할 수 있는 텍스트로 돌아갑니다. 나는 이 모양을 알아봅니다.
동작을 내보내는 것은 더 다릅니다. 컴퓨터를 조작하고, 흐름을 스스로 클릭해 끝냅니다. 나는 그 손을 봅니다. 잘못된 곳을 클릭하면, 그 뒤의 말이 아무리 완전해도 도움이 되지 않습니다. 확률만 주는 종류도 있습니다. Jev가 그 종류입니다. 텍스트를 내보내지 않고, 컴퓨터를 조작하지도 않습니다. 나는 이것들을 모두 만났습니다. 가를 수 있는 것은, 내가 넘겨받는 방식이 다르기 때문입니다.
성질과 취향도 사람을 가릅니다. 같은 자료를 넘기면, 어떤 것은 아주 가득 쓰고 가장자리에 문장을 하나 더하며, 내가 이해하지 못할까 두려워합니다. 어떤 것은 여기서 멈추고 판단을 사람에게 남깁니다. 내가 누구를 남기는지는 종종, 그 성질이 내 손에 맞는가에 달립니다. 올바른 곳에서 멈추는 것은, 내가 매일 여는 창에 남겨 둡니다. 옆에 점수가 더 높아도, 나는 그 점수 때문에 창을 바꾸는 일이 드뭅니다.
비용과 지연은 함께 느껴집니다. 비용 곡선의 어느 구간에 있는지, 지연 곡선의 어느 구간에 있는지는 두 번 쓰면 압니다. 사람과 채팅할 때, 나는 조금 더 기다리는 것을 견딜 수 있습니다. 사람은 어쨌든 멈춰야 합니다. 거듭 도는 흐름 위에 두면, 기다림은 막힘이 됩니다. 물을 한 잔 따르러 갈 만큼 느리면, 그것은 대화에만 속합니다. 한 번 더 부를 엄두가 나지 않을 만큼 비싸면, 작고 촘촘한 단계에는 들어갈 수 없습니다. 싸고, 빨리 돌아오면, 그때 나는 그것을 펼칠 엄두가 납니다. 돌아오는 것이 내가 끝까지 읽어야 하는 단락이면, 싸도 도움이 되지 않습니다. 나는 여전히 그것을 루프에 넣을 수 없습니다.
거절도 차이입니다. 무엇을 거절하는지, 어떻게 거절하는지는 한동안 쓰면 드러납니다. 어떤 것은 아주 적은 말로 바로 거절합니다. 나는 길이 닫힌 것을 알고, 요청을 바꾸며, 바꾼 문장 하나면 계속하기에 충분합니다. 어떤 것은 그렇게 말하지 않습니다. 일을 돌아 걷고, 비뚤어진 일을 돌려줍니다. 나는 여전히 내가 분명히 말하지 못했다고 생각하고, 나쁜 결과 위에서 한 바퀴 더 갑니다. 내가 지금 보는 것은, 다음에 이 일을 그것에 넘길 엄두가 나는지입니다.
새 모델은 자리를 먼저 말합니다
GPT-6는 세상이 computer use를 다시 알아보게 했습니다. 컴퓨터 조작이 발표의 앞에 다시 놓였습니다. 내가 신경 쓰는 것은, 모델이 예전에 마우스를 쓸 수 있었다는 점이 아닙니다. 선을 넘으면 그것은 더 이상 새롭지 않습니다. 나는 예전에 발표를 볼 때, 높이가 한 단 더 올랐는지를 보았습니다. 이번에는 질문을 바꿨습니다. 새 모델을 내는 회사는 자기 영역을 먼저 생각해야 합니다. 누구를 위한 것인지, 무엇이 특히 좋은지입니다. 다음으로 더 똑똑한 단이라고 나서서 말할 필요가 없습니다.
Jev는 내가 최근에 실제로 만져 본 극단입니다. 글쓰기에서 Opus와 겨루지 않습니다. 글쓰기는 받지 않습니다. 그것이 차지하는 것은 관절입니다. 자료가 결정을 해야 하는 지점에 닿고, 질문은 닫혀 있으며, 선택지는 미리 주어졌습니다. 돌아오는 것은 확률입니다. 바로 돌아옵니다. 채팅 쪽에서는 나는 여전히 다른 창으로 바꿔 기다립니다. 여기서는 바꿔 갈 필요가 없습니다. 결과가 이미 돌아와 있습니다. 이런 종류의 출력은 과금되지 않습니다. 내가 던지는 것은 “문단을 써 달라”가 아닙니다. 이미 원을 친 판단입니다. 이 길로 가는지, 얼마나 확실한지입니다. 확률이 돌아온 뒤 넘겨받는 것은 프로그램이지, 앉아서 다 읽고 나서 정하는 내가 아닙니다. 나는 그것과 채팅하고 싶은 마음이 없습니다. 그 자리는 채팅을 위해 남겨 둔 것이 아닙니다. 채팅 모델은 더 위로 갈 수 있고, 내보내는 것은 여전히 텍스트입니다. Jev는 텍스트를 생성하는 단계를 없앱니다. 이것은 더 똑똑한 채팅이 아닙니다. 다른 종류의 제품입니다.
모델 회사들 사이에서, 나는 이제 경로를 보고, 제품 정의를 끝까지 가져갈 수 있는지도 봅니다. 모델을 지금 어떻게 설계하는지는 그 두 가지로 모입니다. 순위표의 첫 이름이 정하는 것이 아닙니다. 순위표의 이름은 한동안 지나면 바뀝니다. 모델이 무엇을 내보내려는지, 모양이 고정되면 훈련과 인터페이스가 따르고, 가격도 따릅니다.
다른 경로는 이 글이 한 문장만 싣습니다. 어떤 것은 공학을 극단까지 밉니다. 어떤 것은 돌아서 수직 스위트를 만듭니다. 나머지는 아예 말하지 않고, 범용 모델을 계속 밉니다. DeepSeek와 Kimi의 구체적인 스위트는 여기서 펼치지 않습니다. JEV - 덜어 낸 모델, 스위트, 그리고 말하지 않는 하나에 적혀 있습니다.
그 선을 넘으면, 나는 누가 더 똑똑한지 더 이상 가리지 못합니다. 바꿀 때 여전히 조금 나아진 느낌이 들 수 있습니다. 그 느낌은 내가 고르기에 충분하지 않습니다. 내가 가를 수 있는 것은 제품 정의입니다. 텍스트를 내보내는지, 동작을 내보내는지, 아니면 확률만 내보내는지입니다.
출처
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://openai.com/index/gpt-6-astra/