Люди отходят от середины цикла к краю
Ловить сбой и смотреть каждый вопрос — разные вещи. «Да или нет» и одиночный выбор с высокой уверенностью входят в ветку напрямую. Человек разбирает только срез, который отскакивает, и уверенность должна на самом деле работать как порог.
Соавтор: folkbench.com (Folkbench — проверяемая платформа оценки и выбора для API ИИ, модельных сервисов и связанных сайтов. Она опирается на опубликованные сведения о сервисе, цены, доступность, задержку и окна доказательств, чтобы помочь пользователям сравнить варианты и выбрать путь.)
Десять текстов в этой серии:
- JEV - Суставу не нужен мозг
- JEV - Почему Jev, который не умеет общаться, подходит Agent
- JEV - Как далеко на самом деле заходит «не может галлюцинировать»
- JEV - Хватает ли «да или нет», выбора и уровня на язык?
- JEV - Лаборатория могла бы это собрать. Почему всё равно может не выпустить.
- JEV - Два demo, которые я прогнал
- JEV - Люди отходят от середины цикла к краю
- JEV - За этой чертой я уже не различаю, кто умнее
- JEV - Некоторые вопросы ему не принадлежат
- JEV - Предельно простая модель, комплект и одна, которая не говорит
Последние два года почти каждая серьёзная система ИИ, которую я видел, предполагала человека внутри цикла, то, что называют human in the loop. На выход нельзя рассчитывать. Система заканчивает отрывок и сама не знает, можно ли отрывок использовать напрямую, поэтому человеку надо его ловить.
Ловить его, если так и продолжать, превращается в то, что человек смотрит каждое суждение. С этим я и столкнулся. Звать человека только когда что-то пошло не так — редко. Человек, сидящий в цикле всё время, — обычно. Когда вопросов мало, этот взгляд ещё похож на ответственность. Когда их много, человек только пропускает их через руки, и после пропуска работа всё равно идёт. Те два года я принимал это за штатное оснащение серьёзной системы. Выход такой формы — и человеку надо сидеть посередине. Я не читаю это как лень.
Позже я разделил две вещи. Ловить — это человек, стоящий сбоку и ждущий момента, который неуверен. Человек в каждом цикле значит, что каждый вопрос должен пройти через его руки. Раньше я считал это одним, и тогда не мог вынуть человека из большинства циклов. Если я даже не знаю, какой вопрос неуверен, я могу смотреть только все сам.
Что модель мне отдавала — отрывок. Отрывок можно написать очень полно, и он может очень походить на вывод, но в поток управления он войти не может. Мне надо сначала прочитать, прочитать, в какую сторону он хочет увести дело, и потом самому поставить ветку. Этот шаг я убрать не могу. Код хочет значение, а отрывок ещё не значение. Человек остаётся посередине цикла, потому что ветка должна ждать, пока я дочитаю.
Что я проверял, было не редким исключением. Выпустить или эскалировать — мне надо было сначала дочитать причину, кусок за куском. После достаточного чтения я принимаю цельный кусок письма за мышление, которое уже закончено. Человек всё ещё сидел посередине цикла, и суждение шло за отрывком.
Суждение, достаточно малое, чтобы войти в код
Jev это переворачивает. Суждение прижато достаточно мало и достаточно закрыто, чтобы войти в поток управления кода напрямую. Вопрос записывают закрытым до того, как его задают: «да или нет», или одиночный выбор, или иначе Score. Модель отвечает только на вопрос, который уже закрыт. Она не рассказывает всё дело отрывком. Ответ входит в ветку. Человека посередине больше нет.
Малость, которую я имею в виду, — вопрос. Само дело не стало меньше. Дело остаётся таким большим, каким должно быть. Меньше становится фраза, которую спрашивают у модели. Эта фраза должна уметь войти в ветку в коде. То, что в ветку войти не может, всё ещё записка, которую человеку надо прочитать, и человек снова посередине цикла.
Я держусь этого, когда пишу вопрос. Если варианты можно записать и границы не спорят, вопрос можно задать. Если я пишу только «судите сами», это не закрытый вопрос. Либо я всё ещё сужу его сам, либо он становится более длинным отрывком. Такие я оставляю. Модель я не спрашиваю.
Точнее, что он переворачивает — не человека. Он переворачивает «каждое суждение нуждается в том, чтобы человек на него взглянул». Каждый вопрос несёт уверенность. Когда уверенности можно доверять, система посылает человеку только наименее уверенный срез. Человек отходит от середины цикла к краю. На части, которая уверена, человек больше не появляется.
Я держу в голове четыре неглубокие картины: закрыта ли тревога, оплачен ли счёт, эскалирует ли следующая фраза поддержки и нужен ли прогону Agent человек, чтобы посмотреть. Они одного рода. Дело сначала режется на закрытые маленькие вопросы, и код идёт от результата. Человек раньше стоял посередине этих циклов. После разбиения большинство веток не должны звать человека.
Я разбираю только то, что отскакивает
Я использую это так. «Да или нет» и одиночный выбор с высокой уверенностью идут прямо в ветку. Содержание я не открываю. Score, который садится на средний уровень, с плоским распределением, — вот что отскакивает ко мне. Тот, который только садится на средний уровень, а распределение не плоское, я тоже не смотрю. Код продолжается. Третьего способа нет. Я не даю ему сначала написать причину и потом решать по ней, смотрю ли я. Сделанное так, человек всё ещё пропускает каждый вопрос. То, что отскакивает, — только маленький срез, и я могу его взять. Когда я раньше пропускал каждый вопрос, я мог досмотреть и всё ещё не сказать, что я судил.
Когда оно отскакивает, смотрите на распределение, а не на длинный кусок. Длинный кусок берёт человека в заложники. Как только причина разложена, вывод обычно уже выбран, и слова пишутся вниз вдоль этого вывода. У меня может быть другое суждение, и мне всё равно надо сначала разобрать отрывок. Я не могу указать на фразу, которую он написал неверно. Я только менее уверен, чем он, и мне неловко возражать, и к концу разбирания я часто киваю вслед. Распределение со мной не спорит. Насколько тяжёл каждый уровень, разложено. Плоское место я вижу с одного взгляда. Если я меняю решение, я его меняю, без того чтобы сначала победить отрывок, написанный очень полно.
Я всё ещё в этой системе, и меня нет в большинстве циклов. Время, когда оно отскакивает, — время, которое принадлежит мне. В руках у меня распределение, которое не разделилось. Сторону я выбираю сам. Код идёт по тому, что я выбрал. То, что уже разделилось, заканчивается внутри кода, и смотреть не моя очередь. Я больше не пишу отрывок, чтобы договариваться с моделью, и не жду, что она пришлёт мне объяснение.
Уверенность должна работать как порог
Я решаюсь использовать это так при одном условии. Уверенность должна на самом деле работать как порог. Если модель может делать вопросы, но не может сказать, в какой раз она неуверена, человек всё ещё не может покинуть середину цикла. Официально говорят, что они тренируют с RLCD калибровку: выше уверенность — точнее, и похожие входы дают похожие ответы. Я доверяю этому направлению. Первая фраза делает порог осмысленным. Вторая фраза мне важнее. Если похожие вопросы сегодня одни, а завтра другие, порог, который я поставил, не останется фиксированным. Поэтому я и решаюсь вынести человека из середины цикла.
Если уверенность — украшение, вещь переворачивается. Человек не отошёл к краю. Человека заменила машина, которая лучше изображает уверенность. Она даёт каждому вопросу очень полное число, и число не имеет отношения к тому, точно ли оно. Если я использую его как условие, чтобы пропускать, я отпускаю, когда не должен. В том, как я использую это сейчас, оно так не делает. Высокую уверенность я отдаю коду. То, что отскакивает, — распределение плоское, без вежливой фразы неуверенности при нём.
Бывают и времена, когда человеку надо шагнуть обратно. То, что не закрыто хорошо, автоматизировать не следует. У варианта не хватает куска, или две границы спутаны, и уверенность только заполняет число на плохом вопросе. Я возвращаюсь и сначала меняю вопрос. Промежуток я моделью не подпираю. Последствия, слишком большие, чтобы купить их порогом вероятности, я оставляю внутри цикла. У всех четырёх картин есть цикл такого рода, и как бы ни была высока уверенность, я не отдаю его порогу. Это не провал модели. Этот цикл не следует автоматизировать.
После того как человек отходит к краю, вопросов, на которые я смотрю, гораздо меньше. Те, в которых я уверен, я больше не смотрю. Наименее уверенный срез всё ещё в моих руках. Циклы, которые не следует отдавать порогу, человек остаётся внутри.
Источники
Серия
- Предыдущая: JEV - Два demo, которые я прогнал
- Следующая: JEV - За этой чертой я уже не различаю, кто умнее