Люди отходят от середины цикла к краю

Ловить сбой и смотреть каждый вопрос — разные вещи. «Да или нет» и одиночный выбор с высокой уверенностью входят в ветку напрямую. Человек разбирает только срез, который отскакивает, и уверенность должна на самом деле работать как порог.

Соавтор: folkbench.com (Folkbench — проверяемая платформа оценки и выбора для API ИИ, модельных сервисов и связанных сайтов. Она опирается на опубликованные сведения о сервисе, цены, доступность, задержку и окна доказательств, чтобы помочь пользователям сравнить варианты и выбрать путь.)

Десять текстов в этой серии:

Последние два года почти каждая серьёзная система ИИ, которую я видел, предполагала человека внутри цикла, то, что называют human in the loop. На выход нельзя рассчитывать. Система заканчивает отрывок и сама не знает, можно ли отрывок использовать напрямую, поэтому человеку надо его ловить.

Ловить его, если так и продолжать, превращается в то, что человек смотрит каждое суждение. С этим я и столкнулся. Звать человека только когда что-то пошло не так — редко. Человек, сидящий в цикле всё время, — обычно. Когда вопросов мало, этот взгляд ещё похож на ответственность. Когда их много, человек только пропускает их через руки, и после пропуска работа всё равно идёт. Те два года я принимал это за штатное оснащение серьёзной системы. Выход такой формы — и человеку надо сидеть посередине. Я не читаю это как лень.

Позже я разделил две вещи. Ловить — это человек, стоящий сбоку и ждущий момента, который неуверен. Человек в каждом цикле значит, что каждый вопрос должен пройти через его руки. Раньше я считал это одним, и тогда не мог вынуть человека из большинства циклов. Если я даже не знаю, какой вопрос неуверен, я могу смотреть только все сам.

Что модель мне отдавала — отрывок. Отрывок можно написать очень полно, и он может очень походить на вывод, но в поток управления он войти не может. Мне надо сначала прочитать, прочитать, в какую сторону он хочет увести дело, и потом самому поставить ветку. Этот шаг я убрать не могу. Код хочет значение, а отрывок ещё не значение. Человек остаётся посередине цикла, потому что ветка должна ждать, пока я дочитаю.

Что я проверял, было не редким исключением. Выпустить или эскалировать — мне надо было сначала дочитать причину, кусок за куском. После достаточного чтения я принимаю цельный кусок письма за мышление, которое уже закончено. Человек всё ещё сидел посередине цикла, и суждение шло за отрывком.

Суждение, достаточно малое, чтобы войти в код

Jev это переворачивает. Суждение прижато достаточно мало и достаточно закрыто, чтобы войти в поток управления кода напрямую. Вопрос записывают закрытым до того, как его задают: «да или нет», или одиночный выбор, или иначе Score. Модель отвечает только на вопрос, который уже закрыт. Она не рассказывает всё дело отрывком. Ответ входит в ветку. Человека посередине больше нет.

Малость, которую я имею в виду, — вопрос. Само дело не стало меньше. Дело остаётся таким большим, каким должно быть. Меньше становится фраза, которую спрашивают у модели. Эта фраза должна уметь войти в ветку в коде. То, что в ветку войти не может, всё ещё записка, которую человеку надо прочитать, и человек снова посередине цикла.

Я держусь этого, когда пишу вопрос. Если варианты можно записать и границы не спорят, вопрос можно задать. Если я пишу только «судите сами», это не закрытый вопрос. Либо я всё ещё сужу его сам, либо он становится более длинным отрывком. Такие я оставляю. Модель я не спрашиваю.

Точнее, что он переворачивает — не человека. Он переворачивает «каждое суждение нуждается в том, чтобы человек на него взглянул». Каждый вопрос несёт уверенность. Когда уверенности можно доверять, система посылает человеку только наименее уверенный срез. Человек отходит от середины цикла к краю. На части, которая уверена, человек больше не появляется.

Я держу в голове четыре неглубокие картины: закрыта ли тревога, оплачен ли счёт, эскалирует ли следующая фраза поддержки и нужен ли прогону Agent человек, чтобы посмотреть. Они одного рода. Дело сначала режется на закрытые маленькие вопросы, и код идёт от результата. Человек раньше стоял посередине этих циклов. После разбиения большинство веток не должны звать человека.

Я разбираю только то, что отскакивает

Я использую это так. «Да или нет» и одиночный выбор с высокой уверенностью идут прямо в ветку. Содержание я не открываю. Score, который садится на средний уровень, с плоским распределением, — вот что отскакивает ко мне. Тот, который только садится на средний уровень, а распределение не плоское, я тоже не смотрю. Код продолжается. Третьего способа нет. Я не даю ему сначала написать причину и потом решать по ней, смотрю ли я. Сделанное так, человек всё ещё пропускает каждый вопрос. То, что отскакивает, — только маленький срез, и я могу его взять. Когда я раньше пропускал каждый вопрос, я мог досмотреть и всё ещё не сказать, что я судил.

Когда оно отскакивает, смотрите на распределение, а не на длинный кусок. Длинный кусок берёт человека в заложники. Как только причина разложена, вывод обычно уже выбран, и слова пишутся вниз вдоль этого вывода. У меня может быть другое суждение, и мне всё равно надо сначала разобрать отрывок. Я не могу указать на фразу, которую он написал неверно. Я только менее уверен, чем он, и мне неловко возражать, и к концу разбирания я часто киваю вслед. Распределение со мной не спорит. Насколько тяжёл каждый уровень, разложено. Плоское место я вижу с одного взгляда. Если я меняю решение, я его меняю, без того чтобы сначала победить отрывок, написанный очень полно.

Я всё ещё в этой системе, и меня нет в большинстве циклов. Время, когда оно отскакивает, — время, которое принадлежит мне. В руках у меня распределение, которое не разделилось. Сторону я выбираю сам. Код идёт по тому, что я выбрал. То, что уже разделилось, заканчивается внутри кода, и смотреть не моя очередь. Я больше не пишу отрывок, чтобы договариваться с моделью, и не жду, что она пришлёт мне объяснение.

Уверенность должна работать как порог

Я решаюсь использовать это так при одном условии. Уверенность должна на самом деле работать как порог. Если модель может делать вопросы, но не может сказать, в какой раз она неуверена, человек всё ещё не может покинуть середину цикла. Официально говорят, что они тренируют с RLCD калибровку: выше уверенность — точнее, и похожие входы дают похожие ответы. Я доверяю этому направлению. Первая фраза делает порог осмысленным. Вторая фраза мне важнее. Если похожие вопросы сегодня одни, а завтра другие, порог, который я поставил, не останется фиксированным. Поэтому я и решаюсь вынести человека из середины цикла.

Если уверенность — украшение, вещь переворачивается. Человек не отошёл к краю. Человека заменила машина, которая лучше изображает уверенность. Она даёт каждому вопросу очень полное число, и число не имеет отношения к тому, точно ли оно. Если я использую его как условие, чтобы пропускать, я отпускаю, когда не должен. В том, как я использую это сейчас, оно так не делает. Высокую уверенность я отдаю коду. То, что отскакивает, — распределение плоское, без вежливой фразы неуверенности при нём.

Бывают и времена, когда человеку надо шагнуть обратно. То, что не закрыто хорошо, автоматизировать не следует. У варианта не хватает куска, или две границы спутаны, и уверенность только заполняет число на плохом вопросе. Я возвращаюсь и сначала меняю вопрос. Промежуток я моделью не подпираю. Последствия, слишком большие, чтобы купить их порогом вероятности, я оставляю внутри цикла. У всех четырёх картин есть цикл такого рода, и как бы ни была высока уверенность, я не отдаю его порогу. Это не провал модели. Этот цикл не следует автоматизировать.

После того как человек отходит к краю, вопросов, на которые я смотрю, гораздо меньше. Те, в которых я уверен, я больше не смотрю. Наименее уверенный срез всё ещё в моих руках. Циклы, которые не следует отдавать порогу, человек остаётся внутри.

Источники

Серия