Суставу не нужен мозг
Jev — модель System One от TypeSafe. Он не пишет свободный текст. На каждый закрытый вопрос он возвращает вероятность, на тех узлах, где правила уже не покрывают случай, а звать чат-модель было бы лишним.
Соавтор: folkbench.com (Folkbench — платформа проверяемой оценки и выбора для AI API, модельных сервисов и связанных сайтов. Она опирается на опубликованные сведения об услугах, цены, доступность, задержку и окна доказательств, чтобы помочь сравнить пути и выбрать один.)
Десять текстов в этой серии:
- JEV - Суставу не нужен мозг
- JEV - Почему Jev, который не умеет общаться, подходит Agent
- JEV - Как далеко на самом деле заходит «не может галлюцинировать»
- JEV - Хватает ли «да или нет», выбора и уровня на язык?
- JEV - Лаборатория могла бы это собрать. Почему всё равно может не выпустить.
- JEV - Два demo, которые я прогнал
- JEV - Люди отходят от середины цикла к краю
- JEV - За этой чертой я уже не различаю, кто умнее
- JEV - Некоторые вопросы ему не принадлежат
- JEV - Предельно простая модель, комплект и одна, которая не говорит
Фундаментальные модели перешли черту. Большинство людей уже не может поставить задачу, которая лежит за их пределами. Вопросы, которые вы можете придумать, нынешние модели в основном берут. Сравнивать, кто чуть лучше болтает, уже не вытягивает новый продукт. Разница перешла к определению продукта. Jev определён для этого этапа.
Это модель System One от TypeSafe AI. Она не генерирует свободный текст. Вы даёте ей кусок state, текст или состояние программы, плюс набор закрытых вопросов. Каждый вопрос возвращается распределением вероятностей.
Он продаёт не чат. Он продаёт суставы в системе.
Узлы бывают разные. Одни можно записать правилами, и на этом конец. Другие надо раскладывать в рассуждении и договаривать человеку до конца. Это работа для мозга. В середине остаётся пачка. Правила её не исчерпывают. Звать ради неё мозг — расточительство. Сустав стоит на этой пачке.
Достаточно согнуться
Когда вы идёте, колено не спрашивает мозг. Земля твёрдая — оно чуть сгибается. Склон крутой — оно держит. Ни объяснения, ни черновика.
Суставу не нужен интеллект. Суставу нужен инстинкт. Инстинкт стоит выше правил. То, что можно исчерпать, уходит правилам: состояние совпало — берите эту ветку; не совпало — стойте. То, чего правила всё ещё не решают, но опытный человек с одного взгляда уже склоняется, уходит инстинкту. Когда причину надо разложить и с кем-то надо говорить, зовите интеллект. Не ждите, что один вопрос сделает работу и правил, и мозга.
Jev остаётся в этом среднем слое. Вопрос закрыт, и форма ответа закрыта. Вероятность может размазаться. Размазанность значит, что он не уверен. Он раскладывает вероятность только внутри ответов, которые вы ему дали. Официальная планка подходящего вопроса жёсткая: суждение, которое человек, знающий область, делает за секунду, глядя на контекст. Всё, чему нужен долгий разбор, не годится как один вопрос. Разбейте его.
Это та же работа, что у общего классификатора до GPT. Понимание смысла лучше, и он быстрее. Он читает фразу, которая идёт в обход, и читает намерение, заложенное в состояние программы. Не берите его в чат.
Официальное имя этой позиции — System One. Оно берёт System 1 у Kahneman: быстро, интуитивно. Медленное мышление, которое выписывает шаги, чтобы человек прочитал, в эту позицию не входит.
Имя взято у William Stanley Jevons. После того как уголь и паровые машины стали эффективнее, спрос не упал. Он вырос. Официальное употребление имени говорит: как только суждение дёшево, число узлов в системе, которым нужно суждение, растёт вместе с этим.
Только эти три вопроса
Типов вопросов только три.
«Да или нет», называется Noul. Фраза, которую истина или ложь могут закрыть. Обратно приходит вероятность «да», от 0 до 1. Код ставит на это число порог. За чертой он выполняется. Не дотягивает до черты — останавливается или отдаёт случай человеку.
Одиночный выбор, называется Choice. Варианты зафиксированы заранее, не больше 255. За каждым вариантом может идти фраза о том, что он значит. Обратно приходит всё распределение плюс вариант с самой высокой вероятностью. Того, чего нет в списке, он не добавляет.
Упорядоченные уровни, называются Score. От 2 до 10 уровней. Снизу вверх, каждый уровень записан как конкретная ситуация. Не отдавайте ему только число. Точка может лечь между двумя уровнями, и вероятность каждого уровня всё ещё на месте. Если бизнесу нужно целое, его собирает код.
Все три можно спросить в одном запросе. Один и тот же state, каждый вопрос сам по себе. «Да или нет» не пишет черновик одиночного выбора. Какой вопрос взять и какой выбросить, решает код. Добавить вопросы почти не добавляет времени. Вы добавляете собственные token вопроса. Вход считается по token. Лишняя цена — вот этот маленький кусок.
Выборка не чатового рода. Официально это новая архитектура, параллельная выборка. Один проход собирает каждый выход. Не token за token. Чат-модели медленные, потому что одно слово ждёт следующее, и выход по дороге дорожает. Jev не растит по одному слову.
Метод обучения называется RLCD, Reinforcement Learning for Calibrated Decisions. Цель — калибровка: уверенность, которую он сообщает, должна совпадать с тем, как часто он на самом деле прав. «Читается как человек» — не цель.
Вход — $0.042 за миллион token. Выход бесплатный. От конца до конца примерно от 70ms до 500ms. Семьдесят миллисекунд бывает, и пятьсот миллисекунд бывает. Официальное суждение об интеллекте сказано рядом: на задачах System One примерно как нынешние большие модели и на один-два порядка быстрее. Это «примерно как» держится только для закрытых суждений. Писать им статью или договаривать незакрытый вопрос до конца в это утверждение не входит.
Там, где правила кончаются
Узлы такой формы не редкость. Классификация, маршрутизация, оценка, проверка, контроль риска, плюс узлы суждения внутри Agent, — у всех она есть. В какую очередь входит заявка, какой отрезок кода берёт следующий прыжок, насколько горяча жалоба, пропускать ли одну фразу, похожа ли операция на исключение, которое надо остановить, отдавать ли инструмент на развилке. Всё это можно спросить быстро, и всё это можно закрыть.
Правила съедают тот отрезок, который легко записать. Как только исключения громоздятся, условия путаются. Измените одно — соседние могут сломаться вместе с ним, и потом никто не решается их трогать.
Кто-то кидает весь state модели, которая умеет в чат, и просит фразу совета. Чат-модель это может. Узлу нужен только уклон. Вам всё равно надо разобрать фразу в ветку и пробовать снова, когда это не выходит. Время уходит на форму текста.
Мозг разрешён. Этот узел не заслуживает его первым. Jev берёт этот отрезок. Закрытый вопрос входит, распределение выходит. Пересекает ли он черту и нужно ли эскалировать, записано в коде рядом. Как идёт поток, по-прежнему дело кода.
Возврат делится на три вопроса: просят ли возврат; просьба — это возврат, переоформление билета или только вопрос о правилах; и на какой уровень ложится злость. Noul, Choice и Score смотрят на один и тот же state. Фразы, записанные в политику, остаются у правил. То, чего правила не ловят, читается из распределения. Ответ клиенту писать — не его работа.
Agent делится так же. Фраза, которую человек в итоге читает, остаётся модели, которая умеет говорить. Суждения посередине не должны будить мозг на каждом шаге. Разбудите один раз — этот шаг идёт по цене чата. Замените суждение на сустав, и ответ наружу может остаться как был.
Для текста нужна другая модель
Статью он написать не может. Он не генерирует текст. Положите тему и тон в state, и он всё равно ответит только на закрытые вопросы, которые вы написали. Ушло ли что-то от темы — это он судит. Фразы должны прийти от другой модели.
Не вдавливайте открытый вопрос в одиночный выбор. У «что нам делать дальше» нет клетки в Choice, пока вы не дописали способы. Сначала разбейте. То, что можно исчерпать, остаётся у правил. То, на что отвечает инстинкт, запишите этими тремя вопросами. То, чему нужно разложенное рассуждение и человек, которому договаривают до конца слов, — вот тогда приходит интеллект. Если это не разбить, это ещё не сустав.
Кто-то слышит в System One понижение. Ниже как раз правила. System One — это инстинкт над правилами. Он быстрый и не пишет объяснение. Смысл ему всё равно надо понимать, иначе хватило бы правил. Выше этого — интеллект. Официальное заявление об интеллекте — «примерно как» на закрытых задачах, а заявление о скорости — на один-два порядка быстрее. С такой скоростью вызов может сидеть внутри цикла, а не пережидать один чат.
Когда фундаментальные модели выровняли задачи, которые может поставить большинство людей, продукт должен закрыться в определённый интерфейс. Jev закрывается в сустав. Чат не продаётся. Узлы, где правила нельзя дописать и где звать мозг было бы расточительством, — его место.
Источники
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://evals.typesafe.ai/
- https://docs.typesafe.ai/primitives