JEV - ¿Bastan el sí o no, la opción y el nivel como lenguaje?

Noul, Choice y Score son un lenguaje para el código. Este texto usa una nota de gastos para mostrar cómo se parten las tres preguntas, y cuándo el lenguaje no basta.

Coautor: folkbench.com (Folkbench es una plataforma revisable de evaluación y selección de API de IA, servicios de modelos y sitios relacionados. Se apoya en información de servicio publicada, precios, disponibilidad, latencia y ventanas de evidencia para ayudar a los usuarios a comparar y a elegir un camino.)

Diez textos en esta serie:

Si este lenguaje basta depende de qué quiera usted que diga. Tres preguntas cerradas compran velocidad, y compran composabilidad. El coste es que lo que necesita desplegarse, no puede decirlo. Este es un lenguaje para el código. No es para que lo lea una persona.

La documentación y el sitio de evaluación lo parten del mismo modo: Noul, Choice y Score. En la página no hay una cuarta clase.

Las tres clases en la documentación

Noul solo pregunta sí o no. Devuelve una probabilidad. En la documentación ese número va de 0 a 1. Cerca de 1, es un sí con confianza. Cerca de 0, es un no con confianza. Si se para cerca de 0.5, eso solo significa que los dos lados son igual de posibles. No significa «un grado mediano». La documentación nombra esta trampa: pregunte si alguien es fuerte en Python, y 0.5 no es un nivel mediano. Si usted de verdad quiere medir el nivel, pase a Score y escriba cómo es cada nivel. Noul tampoco adjunta una confianza aparte. La probabilidad es la señal.

Choice elige un elemento de un conjunto que ya se ha fijado. Lo que vuelve es el elemento elegido, más la distribución entera y una confianza. La confianza mira si la distribución es aguda. Si la probabilidad está repartida, la confianza es baja, y el código sabe que esta pregunta es inestable. El tope de cardinalidad de esta pregunta para Jev es 255. Por encima, Jev toma dos etapas. Dos etapas quiere decir puntuar primero por separado, y luego hacer una elección explícita. A veces es un poco más lento. La lentitud es el paso de más, no que la misma pregunta estrecha se vuelva de pronto cara.

Score son niveles en una escala. En el uso es una escala ordenada de 2 a 10 niveles. La documentación dice como mínimo dos niveles, y la interfaz acepta como máximo diez. Un nivel tiene que escribirse como una situación con la que se pueda casar. Escriba solo «un poco alto» o «está bien», y el modelo no tiene nada con qué casar. La puntuación puede caer entre dos niveles. Ese número es la suma de la posición de cada nivel multiplicada por su probabilidad. Un decimal entre dos niveles es normal. No es un cálculo roto. Devuelve la puntuación, y a la vez la distribución sobre los niveles y una confianza. La misma puntuación podría ser todo apretado sobre el nivel de en medio, o un reparto entre los dos extremos. Mire solo la puntuación, y tratará esas dos cosas como la misma. Lea juntas la distribución y la confianza.

Ninguna de las tres respuestas puede salir de las casillas que usted dio de antemano. Las preguntas sobre el mismo material son independientes entre sí. Añada una o quite una, y las otras preguntas no cambian. Si un juicio depende de varias cosas a la vez, pregúntelas por separado y deje los pesos en el código. Más adelante, cuando ajuste la política, usted cambia estos números. No reescribe un prompt entero.

Una nota de gastos, desmontada

La página oficial de evaluación usa una nota de gastos como juguete. A la izquierda hay un párrafo que escribió una persona, la clase de política que un equipo apuntaría. Cada nota tiene que llevar un recibo. Si el recibo no se puede leer, pida al empleado otro. Luego vea si el gasto es una comida, un viaje o equipo. Si una comida pasa de $75 y la descripción no casa con el recibo, un responsable tiene que firmar. Las demás notas se tratan como aprobadas.

A la derecha, el mismo párrafo se parte en un flujo. Cada frase de política es una pregunta, o una regla de código. Si el recibo se puede leer es un sí o no. Si no se puede, el código pide uno nuevo, y ese paso no vuelve a preguntar al modelo. La categoría usa una opción única, y las opciones son comida, viaje o equipo. Si el importe pasa de $75, el código lo compara por su cuenta. Solo la media frase sobre que la descripción no casa con el recibo necesita que se pregunte al modelo una vez más. Junto con el importe, eso decide si firma un responsable. Las notas que no necesitan la firma de un responsable, el código las trata como aprobadas. El modelo no escribe aquí un comentario.

La dirección en la página de evaluación es una frase: la estructura siempre es mejor que un prompt grande. Promediados los cuatro flujos de ejemplo, cada modelo en el workflow tiene más exactitud que la política entera como un solo prompt, y el gasto y el tiempo son menores. El lado del prompt entrega la política entera y deja que el modelo recorra la lógica dentro de una respuesta. El lado del workflow da al código lo que se pueda escribir como regla, y deja solo los juicios estrechos como preguntas.

El flujo real más estable no suele ser una pregunta grande. Son muchas preguntas estrechas, independientes entre sí. El comportamiento depende de la probabilidad, no solo de una etiqueta discreta. La categoría puede parecer zanjada mientras las otras opciones aún guardan una parte de la probabilidad. El código puede dar un paso más en el umbral que usted escribió, sin tirar la distribución. Fuera del flujo, sigue siendo una rama. La capa de en medio es ingeniería de dominio. Qué pregunta no se usa esta vez, y qué número cuenta como cruzar la línea, hay que escribirlo para este negocio, y ejecutarlo del mismo modo cada vez. Una vez que las respuestas a las preguntas estrechas están en el código, los pesos y los umbrales se fijan en esta capa.

Después de renunciar a generar cadenas

Jev renuncia a generar cadenas y a cambio toma muestreo en paralelo. Las preguntas de una petición se calculan juntas. Cada salida sale de una vez. No token a token. Un modelo de chat tiene que crecer un token tras otro, cada uno mirando al de antes. Aquí no hay un paso letra a letra. Añada unas pocas preguntas estrechas ordinarias, y el tiempo apenas sube con ellas. El coste de más es sobre todo los tokens propios de la pregunta.

El precio oficial no es el precio de la interfaz de chat. La entrada es $0.042 por millón de tokens. La salida es FREE. Sin una tirada larga de palabras generadas y facturadas por token, la salida no se cobra. La latencia cae en 70–500 milisegundos. Ese intervalo es para una cadena de llamadas, no para esperar dentro de un cuadro de chat.

El valor de retorno va directo al código. La probabilidad de Noul puede entrar en un if. El enrutado usa la etiqueta de Choice. Un umbral de puntuación usa la posición de Score. Sin analizar primero. Si un modelo de chat devuelve un trozo de Markdown, usted tiene que partir primero las palabras, y una frase de más puede torcer el formato de modo que el resto no pueda conectar. Las tres preguntas no devuelven ese texto, porque Jev no lo genera.

Explicar por qué se rechazó esta nota no cabe en las tres preguntas, y tampoco caben una disculpa y una negociación. Una razón escrita para que la lea una persona tampoco está en el valor de retorno. Eso va a un modelo que puede hablar. Jev se para en el juicio.

Cuando no basta, los casos son concretos. Si las opciones son nombres de un mundo abierto, siguen apareciendo nombres de empresa y de producto, y el conjunto no se puede fijar de antemano. 255 es un tope de cardinalidad, no una lista infinita. Cuando una razón debe citar una frase de la fuente, no hay tal frase que entregar. Cuando un usuario espera una frase humana, la interfaz quiere palabras legibles. Forzar entonces a Jev es tratar una articulación como una boca.

Cuando la política se puede cerrar en sí o no, opción única y niveles, lo que sigue es una rama, y el juicio se vuelve a montar en el mismo código. Si lo que usted quiere es velocidad, y esta clase de composabilidad, basta. Lo que necesita desplegarse, no puede decirlo. La velocidad y la composabilidad son lo que compra ese intercambio.

Fuentes

Serie