Два demo, которые я прогнал
Один и тот же деловой state прошёл два demo: закрытые вопросы за один проход, затем остановлен вопрос о риске, чья уверенность не поднималась. Сравнение рядом с GPT-5.6 Terra нужно было только чтобы увидеть, на каком вопросе расхождение.
Соавтор: folkbench.com (Folkbench — проверяемая платформа оценки и выбора для API ИИ, модельных сервисов и связанных сайтов. Она опирается на опубликованные сведения о сервисе, цены, доступность, задержку и окна доказательств, чтобы помочь пользователям сравнить варианты и выбрать путь.)
Десять текстов в этой серии:
- JEV - Суставу не нужен мозг
- JEV - Почему Jev, который не умеет общаться, подходит Agent
- JEV - Как далеко на самом деле заходит «не может галлюцинировать»
- JEV - Хватает ли «да или нет», выбора и уровня на язык?
- JEV - Лаборатория могла бы это собрать. Почему всё равно может не выпустить.
- JEV - Два demo, которые я прогнал
- JEV - Люди отходят от середины цикла к краю
- JEV - За этой чертой я уже не различаю, кто умнее
- JEV - Некоторые вопросы ему не принадлежат
- JEV - Предельно простая модель, комплект и одна, которая не говорит
Сегодня я прогнал два demo, пробуя Jev. Ни одно не просило его общаться. Я положил кусок делового state, задал закрытые вопросы и посмотрел, что вернулось.
State — это срез дела, достаточный, чтобы судить. Я не превратил его в историю. Чат-модель на таком входе часто начинает с абзаца понимания, потом совет. Совет мне был не нужен. Я хотел увидеть, может ли он остаться посередине потока как сустав, выдать числа и дать коду продолжить.
Первое demo
Я положил этот state и задал закрытые вопросы за один проход. Я нажал. Оно вернулось сразу.
Официальный диапазон — от 70 до 500 миллисекунд. Я не засекал, поэтому не могу сказать, куда я попал внутри диапазона. Что я почувствовал: до нетерпения я так и не дошёл. С моделями, которые пишут длинные ответы, я привык оставлять окно и делать что-то другое. В этот раз окно я так и не оставил. Результат уже был на странице, прежде чем я переключился.
Деньги я посчитал отдельно. Выход не тарифицируется. Вход — $0.042 за миллион token. Когда state короткий, цена входа одного вызова — то, что мне надо идти искать на счёте, прежде чем я это увижу. Как сустав он дешёвый. Такой узел проходят много раз. Большую модель, которая тарифицирует ещё и выход, я начинаю экономить со второй фразы. Здесь задать ещё один вопрос этой тяжести не несёт.
Вопросы были те три.
Для «да или нет» я использовал Noul. Я спросил, надо ли этот заказ сначала вынуть из автоматического потока и отдать человеку. Он не отвечает голым «да» или «нет». Он отвечает вероятностью «да», между 0 и 1. Я смотрю, к какому концу он липнет. Если он липнет к одному концу, я считаю вопрос решённым. Если он колеблется посередине, вопрос всё ещё открыт.
Для классификации я использовал Choice, одиночный выбор. Варианты и смысл каждого написал я. Я не громоздил их к 255. Официальный потолок — 255, и этому вопросу он был не нужен. Слишком много пунктов, и я сам их не вижу. При немногих пунктах я могу судить. Вес явно свален на один вариант, а остальные очень тонкие: только такое первое место я пускаю в ветку. Если первые два кусаются близко, я не приму это только потому, что первое место есть. Первое место, которое лишь чуть выше, ещё не отделилось.
Для риска я использовал Score, чтобы увидеть, на какой уровень он сел. Шкала Score — от 2 до 10 уровней. Я резал этот вопрос внутри этого диапазона, от лёгкого к тяжёлому. Другую шкалу я не выдумывал. Он возвращает вероятность каждого уровня и положение, взвешенное этими вероятностями. Это положение одно я использовать не решаюсь. Если вероятность свалена на один уровень, положение — этот уровень. Если вероятность расколота по двум соседним уровням, положение падает посередине. Положение выглядит тоньше, а оба уровня всё ещё на месте. Такое положение я в позднее условие не запишу.
Он не пишет объяснение. Смотрите на вероятность, а не на объяснение. Когда я использовал чат-модель для того же рода суждения, вывод был завёрнут в абзац. Мне надо было содрать слова, прежде чем я решался заполнить поле, и я боялся принять вежливость за позицию. Сегодня такого слоя слов нет. Внутри тип и вероятность. Что это demo подтвердило для меня: он годится как сустав. Мне не надо дочитывать короткий очерк, прежде чем я подключу код.
Компромисс я взял из распределения, а не из чувства момента. «Да или нет», прилипшее к краю, я пропускал автоматически. Вес категории, сваленный на один пункт, я давал коду подключить. Распределение вопроса о риске не собралось, и в этом demo я его не замораживал. Я оставил его следующему.
Второе разбирает то же самое
Второе demo использовало тот же state. Новый я искать не пошёл. Я разбил вопросы, чтобы проверить фразу: человеку не надо стоять посередине каждого цикла.
Высокую уверенность я был готов отдать коду. Низкую оставил, чтобы смотреть. После пробы я был готов отпустить высокие. «Да или нет», прилипшее к краю, и категория, сваленная на одну сторону, — я дал программе идти самой. Высокие идут прямо в ветку. Правило записано в коде. Уверенности достаточно — программа продолжается. Уверенности недостаточно — программа останавливается передо мной. Когда я читал журнал, эти высокие циклы не ждали моего кивка. Я не подтверждал их один за другим.
Низким был вопрос о риске. Я спросил его недостаточно жёстко, и в state также не хватало материала, который мог бы разделить два соседних уровня. Распределение было размазано, и уверенность не поднималась. Пока я смотрел, я на самом деле хотел выбрать за него уровень, чтобы весь поток мог закончиться. За этой мыслью идти нельзя. Раз оно размазано, я не хочу закрывать его за него. Если я наугад выберу уровень и впишу его, поздние шаги примут этот уровень за факт. Это я подставляю решение, которого он не делал, и наряжаю его как уже законченный ответ.
Так вопрос остановился. Он остался, чтобы я смотрел, и в автоматическую ветку не вошёл. Я не прогнал его снова, чтобы попытать удачу. Материал был всё тот же, и распределение, скорее всего, всё ещё было бы размазано. Этот вопрос не следует принуждать. Позже я могу утолстить state или записать уровни формулировками, которые на самом деле стоят врозь. Если я сейчас выдавлю из него уровень, обратно придёт среднее. Если я положу это число в ветку, то, что следует, примет его за риск, который уже решён.
Я не написал рядом «я чувствую, что это серьёзнее». Моё чувство не может пересилить размазанное распределение и затем уйти на автоматическое исполнение. Если бы распределение на самом деле кренилось, вес сам свалился бы на одну сторону. Если он не может перевалиться, у меня нет права валить его за него. Второе demo я остановил там.
Официальное сравнение рядом
Только после двух demo я открыл пример сравнения рядом в официальном playground. Одна сторона — Jev. Другая — GPT-5.6 Terra. Terra использовал рассуждение по умолчанию. Я был там не затем, чтобы судить, кто умнее. Я только смотрел, на какой вопрос легло расхождение.
Я проверил их насквозь. Только «Churn likelihood level» различался на двух сторонах. Остальные вопросы выстроились. Сам вопрос туманен. Насколько высоким может быть отток, нелегко закрыть в чистый уровень. Когда туманно, он даёт распределение. Другая сторона, чтобы закончить ответ, должна выдать слово. Я не записал расхождение как победу или поражение. Дать распределение честнее, чем выдавливать слово. Это слово может сидеть внутри фразы, которую говорит человек. В ветке, которая исполнится сама, ему не место.
Я оглянулся на свой низкий вопрос о риске. Мой и это сравнение рядом — одного рода. Рядом нет второй модели, и мне всё равно не следует щипать размазанную вероятность в один уровень.
Неумение общаться я сначала принял за дефект. После использования я так не вижу. В возврате нет вступительной ремарки. Мне не надо удалять вступительную ремарку. Когда я раньше выкапывал суждение из чатового интерфейса, мне надо было сначала перескочить любезность и ещё стеречь, чтобы он потом не передумал. Сегодня нет текста, который надо убирать. Для меня это облегчение. На одну вещь, которую легко сделать неверно, меньше.
Что я прогнал сегодня — эти два demo. Сравнение рядом в playground я только открыл и посмотрел. Оно не считается третьим, которое я сделал. Первое для меня установило, что он может сидеть на суставе и что высокую уверенность можно отдать коду. Во втором я остановил вопрос, чьё распределение было размазано, и не нарядил его как уже отвеченный. Он быстрый, и по этой цене повторные вызовы мне тоже кажутся дешёвыми. Обратно приходит не статья. Приходит распределение.
Источники
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://console.typesafe.ai/playground?share=shr_13a74b495fb786c4bd7964f11597301e7c9