JEV - Los dos demos que ejecuté

El mismo state de negocio pasó por dos demos: preguntas cerradas de una pasada, y luego se paró una pregunta de riesgo cuya confianza no subía. El cara a cara oficial con GPT-5.6 Terra solo sirvió para ver en qué pregunta no coincidían.

Coautor: folkbench.com (Folkbench es una plataforma revisable de evaluación y selección de API de IA, servicios de modelos y sitios relacionados. Se apoya en información de servicio publicada, precios, disponibilidad, latencia y ventanas de evidencia para ayudar a los usuarios a comparar y a elegir un camino.)

Diez textos en esta serie:

Hoy ejecuté dos demos, probando Jev. Ninguno le pidió que chateara. Metí un fragmento de state de negocio, pregunté preguntas cerradas, y miré lo que volvía.

El state es un corte del negocio, bastante para juzgar. No lo convertí en un relato. Un modelo de chat, con esta clase de entrada, a menudo empieza con un párrafo de comprensión, y luego un consejo. Yo no quería consejo. Quería ver si podía quedarse en medio de un flujo como articulación, emitir números, y dejar que el código siguiera.

El primer demo

Metí ese state y pregunté las preguntas cerradas de una pasada. Hice clic. Volvió de inmediato.

El intervalo oficial es de 70 a 500 milisegundos. No lo cronometré, así que no puedo decir dónde caí dentro del intervalo. Lo que sentí es que nunca llegué a la impaciencia. Con modelos que escriben respuestas largas, tengo la costumbre de dejar la ventana y hacer otra cosa. Esta vez no llegué a dejar la ventana. El resultado ya estaba en la página antes de que yo cambiara de sitio.

Conté el dinero aparte. La salida no se cobra. La entrada es $0.042 por millón de tokens. Cuando el state es corto, el coste de entrada de una llamada es algo que tengo que ir a buscar en la cuenta antes de poder verlo. Como articulación, es barato. Un nodo así se recorre muchas veces. Un gran modelo que también factura la salida, yo empiezo a ahorrar en la segunda frase. Aquí, preguntar una pregunta más no carga con eso.

Las preguntas eran esas tres.

Para el sí o no usé Noul. Pregunté si este pedido debía sacarse del flujo automático y darse primero a una persona. No responde con un «sí» o un «no» pelado. Responde con la probabilidad de «sí», entre 0 y 1. Miro a qué extremo se pega. Si se pega a un extremo, trato la pregunta como zanjada. Si vacila en medio, la pregunta sigue abierta.

Para la clasificación usé Choice, una opción única. Las opciones y el sentido de cada una las escribí yo. No las amontoné hacia 255. El tope oficial es 255, y esta pregunta no lo necesitaba. Demasiados elementos, y yo mismo no los veo. Con pocos elementos puedo juzgar. Peso claramente amontonado en una opción, y las otras muy finas: solo esa clase de primer puesto dejo entrar en una rama. Si los dos primeros se muerden muy cerca, no lo acepto solo porque haya un primer puesto. Un primer puesto que solo está un poco más alto aún no se ha separado.

Para el riesgo usé Score, para ver en qué nivel caía. La escala de Score es de 2 a 10 niveles. Corté esta pregunta dentro de ese intervalo, de leve a grave. No inventé otra escala. Devuelve la probabilidad de cada nivel, y una posición ponderada por esas probabilidades. No me atrevo a usar esa posición sola. Si la probabilidad está amontonada en un nivel, la posición es ese nivel. Si la probabilidad se parte entre dos niveles vecinos, la posición cae en medio. La posición parece más fina, y los dos niveles siguen ahí. No escribiré esa clase de posición en una condición posterior.

No escribe una explicación. Mire la probabilidad, no una explicación. Cuando usaba un modelo de chat para la misma clase de juicio, la conclusión iba envuelta en un párrafo. Tenía que pelar las palabras antes de atreverme a rellenar un campo, y temía tomar la cortesía por una postura. Hoy no hay esa capa de palabras. Dentro hay tipo y probabilidad. Lo que este demo me confirmó es que encaja como articulación. No tengo que terminar de leer un ensayo corto antes de conectar el código.

Tomé el intercambio a partir de la distribución, no de una sensación del momento. Un sí o no pegado a un borde, lo dejé pasar automáticamente. Peso de categoría amontonado en un elemento, dejé que el código conectara. La distribución de la pregunta de riesgo no se reunió, y no la congelé en este demo. La dejé para el siguiente.

El segundo parte la misma cosa

El segundo demo usó el mismo state. No fui a buscar uno nuevo. Partí las preguntas, para comprobar la frase de que una persona no tiene que estar en medio de cada bucle.

Confianza alta, yo estaba dispuesto a darla al código. Confianza baja, la guardé para mirarla. Después de probarlo, estuve dispuesto a soltar las altas. Sí o no pegado a un borde, y categoría amontonada a un lado, dejé que el programa caminara solo. Las altas van directas a una rama. La regla está escrita en el código. La confianza basta, y el programa sigue. La confianza no basta, y el programa se para delante de mí. Cuando leí el registro, esos bucles altos no habían esperado mi asentimiento. No los confirmé uno por uno.

La baja era la pregunta de riesgo. No la había preguntado con bastante cierre, y al state también le faltaba material que pudiera separar dos niveles vecinos. La distribución estaba repartida, y la confianza no subía. Mientras miraba, en realidad quería elegir un nivel por él, para que el flujo entero pudiera terminar. Ese pensamiento no se puede seguir. Una vez repartida, no quiero cerrarla por él. Si elijo un nivel al tuntún y lo escribo, los pasos de después tratarán ese nivel como un hecho. Eso soy yo aportando una decisión que él no hizo, y vistiéndola de respuesta ya terminada.

Así que la pregunta se paró. Se quedó para que yo la mirara, y no entró en una rama automática. No la ejecuté otra vez para probar suerte. El material seguía siendo el mismo, y lo más probable era que la distribución siguiera repartida. Esta pregunta no debería forzarse. Más adelante puedo engrosar el state, o escribir los niveles como formulaciones que de verdad queden aparte. Si le fuerzo ahora un nivel, lo que vuelve es un promedio. Si meto ese número en una rama, lo que sigue lo tratará como un riesgo ya decidido.

No escribí al lado «siento que es más grave». Mi sensación no puede anular una distribución repartida y luego enviarse a ejecutarse sola. Si la distribución de verdad se inclinara, el peso se amontonaría a un lado por su cuenta. Si no puede amontonarse hacia allí, yo no tengo título para amontonarlo por él. Paré ahí el segundo demo.

El cara a cara oficial

Solo después de los dos demos abrí el ejemplo cara a cara del playground oficial. Un lado es Jev. El otro es GPT-5.6 Terra. Terra usó el razonamiento por defecto. No estaba allí para juzgar quién es más listo. Solo miré en qué pregunta caía el desacuerdo.

Los repasé. Solo «Churn likelihood level» difería en los dos lados. Las otras preguntas se alineaban. La pregunta en sí es vaga. Cuán alta pueda ser la fuga no es fácil de cerrar en un nivel limpio. Cuando es vaga, lo que da es una distribución. El otro lado, para terminar una respuesta, tiene que emitir una palabra. No anoté el desacuerdo como victoria o derrota. Dar una distribución es más honesto que forzar una palabra. Esa palabra puede sentarse dentro de una frase que dice una persona. No cabe en una rama que se ejecutará sola.

Volví a mirar mi propia pregunta de riesgo baja. La mía y este cara a cara son de la misma clase. No hay un segundo modelo al lado, y aun así no debería pellizcar una probabilidad repartida hasta un solo nivel.

No poder chatear, yo al principio lo tomé como un defecto. Después de usarlo, no lo veo así. En el retorno no hay frase de apertura. No tengo que borrar una frase de apertura. Cuando antes sacaba un juicio de una interfaz de chat, tenía que saltarme primero la cortesía, y también guardarme de que luego cambiara de idea. Hoy no hay texto que limpiar. Para mí eso es un alivio. Es una cosa menos fácil de hacer mal.

Lo que ejecuté hoy son estos dos demos. El cara a cara del playground, solo lo abrí y lo miré. No cuenta como un tercero que yo hiciera. El primero zanjó, para mí, que puede sentarse en una articulación, y que la confianza alta se puede dar al código. En el segundo, paré la pregunta cuya distribución estaba repartida, y no la vestí de ya respondida. Es rápido, y a este precio también encuentro baratas las llamadas repetidas. Lo que vuelve no es un artículo. Es una distribución.

Fuentes

Serie