JEV - Una articulación no necesita cerebro
Jev es el modelo System One de TypeSafe. No escribe texto libre. Devuelve una probabilidad por cada pregunta cerrada, en los nodos donde las reglas se agotan y un modelo de chat sería un desperdicio.
Coautor: folkbench.com (Folkbench es una plataforma revisable de evaluación y selección de API de IA, servicios de modelos y sitios relacionados. Se apoya en información de servicio publicada, precios, disponibilidad, latencia y ventanas de evidencia para ayudar a los usuarios a comparar y a elegir un camino.)
Diez textos en esta serie:
- JEV - Una articulación no necesita cerebro
- JEV - Por qué un Jev que no puede chatear encaja en un Agent
- JEV - Hasta dónde llega de verdad «no puede alucinar»
- JEV - ¿Bastan el sí o no, la opción y el nivel como lenguaje?
- JEV - Un laboratorio podría hacerlo. Por qué quizá no.
- JEV - Los dos demos que ejecuté
- JEV - Las personas pasan del centro del bucle al borde
- JEV - Pasada esa línea, ya no distingo quién es más listo
- JEV - Hay preguntas que no le corresponden
- JEV - Un modelo reducido, una suite y uno que no habla
Los modelos fundacionales han cruzado la línea. La mayoría de la gente ya no puede plantear una tarea que quede más allá. Las preguntas que a usted se le ocurren, los modelos actuales en general las aceptan. Comparar quién chatea un poco mejor no sostiene un producto nuevo. La diferencia se ha desplazado a la definición de producto. Jev está definido para esta etapa.
Es el modelo System One de TypeSafe AI. No genera texto libre. Usted le da un fragmento de state, texto o estado de programa, más un conjunto de preguntas cerradas. Cada pregunta vuelve como una distribución de probabilidad.
No vende chat. Vende las articulaciones de un sistema.
Los nodos vienen en clases. Algunos se pueden escribir como reglas, y entonces ya están hechos. Otros hay que razonarlos a la vista y decirlos hasta el final a una persona. Eso es trabajo de cerebro. Queda un lote en medio. Las reglas no lo agotan. Llamar a un cerebro para eso es desperdicio. La articulación se apoya en ese lote.
Con doblar basta
Cuando usted camina, la rodilla no consulta al cerebro. Suelo duro, se dobla un poco. Una pendiente fuerte, aguanta. Sin explicación, y sin borrador.
Una articulación no necesita inteligencia. Una articulación necesita instinto. El instinto está por encima de las reglas. Lo que se puede agotar va a las reglas: el state coincide, se toma esa rama; no coincide, se para. Lo que las reglas siguen sin poder decidir, pero hacia lo que una persona ducha se inclina de un vistazo, va al instinto. Cuando hay que desplegar la razón, y hay que hablarle a alguien, llame a la inteligencia. No espere que una pregunta haga a la vez el trabajo de las reglas y el del cerebro.
Jev se queda en esa capa de en medio. La pregunta está cerrada, y la forma de la respuesta también. La probabilidad puede dispersarse. Una dispersión significa que no está seguro. Solo reparte probabilidad dentro de las respuestas que usted le dio. La línea oficial sobre una pregunta adecuada es estrecha: un juicio que una persona que conoce el dominio puede hacer en un segundo mientras mira el contexto. Lo que exige un análisis largo no cabe como una sola pregunta. Divídala.
Es el mismo tipo de trabajo que un clasificador general de antes de GPT. La comprensión semántica es mejor, y es más rápido. Puede leer una frase que da un rodeo, y puede leer una intención metida en el estado del programa. No lo lleve a chatear.
El nombre oficial de la posición es System One. Toma prestado el System 1 de Kahneman: rápido, intuitivo. El pensamiento lento que escribe sus pasos para que una persona los lea no está en esta posición.
El nombre viene de William Stanley Jevons. Cuando el carbón y las máquinas de vapor se hicieron más eficientes, la demanda no bajó. Subió. El uso oficial del nombre dice que, en cuanto el juicio es barato, crece con él el número de nodos de un sistema que necesitan un juicio.
Solo estas tres preguntas
Solo hay tres tipos de pregunta.
Sí o no, llamado Noul. Una frase que verdadero o falso pueden cerrar. Lo que vuelve es la probabilidad de «sí», de 0 a 1. El código pone un umbral a ese número. Pasada la línea, se ejecuta. Por debajo de la línea, se para, o entrega el caso a una persona.
Opción única, llamada Choice. Las opciones se fijan de antemano, como máximo 255. Cada opción puede ir seguida de una frase que dice qué significa. Lo que vuelve es la distribución entera, más la opción de mayor probabilidad. No añade nada que no esté en la lista.
Niveles ordenados, llamados Score. De 2 a 10 niveles. Ordenados de menor a mayor, cada nivel escrito como una situación concreta. No le entregue solo un número. El punto de llegada puede quedar entre dos niveles, y la probabilidad de cada nivel sigue ahí. Si el negocio necesita un entero, lo recoge el código.
Las tres se pueden preguntar en la misma petición. El mismo state, cada pregunta por su cuenta. Un sí o no no redacta la opción única. Qué pregunta usar, y cuál descartar, lo decide el código. Añadir preguntas apenas añade tiempo. Lo que usted añade son los tokens propios de la pregunta. La entrada se factura por token. El coste de más es ese trozo pequeño.
El muestreo no es el del chat. El relato oficial es una arquitectura nueva, muestreo en paralelo. Una pasada recoge cada salida. No token a token. Los modelos de chat son lentos porque una palabra espera a la siguiente, y la salida se encarece por el camino. Jev no crece una palabra cada vez.
El método de entrenamiento se llama RLCD, Reinforcement Learning for Calibrated Decisions. El objetivo es la calibración: la confianza que declara tiene que coincidir con la frecuencia con que acierta de verdad. «Se lee como una persona» no es el objetivo.
La entrada es $0.042 por millón de tokens. La salida es gratis. De extremo a extremo, unos 70ms a 500ms. Pasan setenta milisegundos, y pasan quinientos milisegundos. El juicio oficial sobre la inteligencia se enuncia al lado: en tareas System One, más o menos como los grandes modelos actuales, y de uno a dos órdenes de magnitud más rápido. Ese «más o menos igual» solo vale para juicios cerrados. Usarlo para escribir un artículo, o para hablar hasta el final una pregunta no cerrada, no entra en esa afirmación.
Donde se paran las reglas
Los nodos de esta forma no son raros. Clasificación, enrutado, puntuación, revisión, control de riesgo, más los nodos de juicio dentro de un Agent, todos la tienen. A qué cola entra un ticket, qué tramo de código toma el salto siguiente, lo airada que va una queja, si se deja pasar una frase, si una operación parece la excepción que hay que parar, si en una bifurcación se entrega una herramienta. Todo esto se puede preguntar deprisa, y todo se puede cerrar.
Las reglas pueden comerse el tramo fácil de escribir. En cuanto se amontonan las excepciones, las condiciones se enredan. Cambie una, y las de al lado pueden fallar con ella, así que después nadie se atreve a tocarlas.
Hay quien lanza el state entero a un modelo que puede chatear y le pide una frase de consejo. Un modelo de chat puede hacerlo. El nodo solo necesita una inclinación. Usted aún tiene que convertir la frase en una rama, y volver a intentarlo cuando eso falla. El tiempo se gasta en la forma del texto.
Un cerebro está permitido. Este nodo no se merece uno de entrada. Jev toma este tramo. Entra una pregunta cerrada, sale una distribución. Si cruza la línea, y si escala, se escribe en el código de al lado. Cómo se mueve el flujo sigue siendo cosa del código.
Un reembolso se parte en tres preguntas: si se está pidiendo un reembolso, si lo pedido es un reembolso, un cambio de billete o solo una pregunta sobre las reglas, y en qué nivel cae el enfado. Noul, Choice y Score, mirando el mismo state. Las frases escritas en la política se quedan con las reglas. Lo que las reglas no casan se lee en la distribución. La respuesta al cliente no le toca escribirla.
Un Agent se parte del mismo modo. La frase que una persona acaba leyendo se deja a un modelo que puede hablar. Los juicios de en medio no deberían despertar un cerebro en cada paso. Despiértelo una vez, y ese paso corre al coste de un chat. Cambie el juicio por una articulación, y la respuesta que sale puede quedarse como está.
Para escribir hace falta otro modelo
No puede escribir un artículo. No genera texto. Ponga el tema y el tono en el state, y aun así solo responde las preguntas cerradas que usted escribió. Si algo se sale del tema, eso sí puede juzgarlo. Las frases tienen que salir de otro modelo.
No meta a presión una pregunta abierta en una opción única. «Qué deberíamos hacer a continuación» no tiene casilla en Choice hasta que usted haya terminado de listar los caminos. Parta primero. Lo que se puede agotar se queda con las reglas. Lo que el instinto puede responder, escríbalo como estas tres preguntas. Lo que necesita el razonamiento desplegado, y que se hable a una persona hasta terminar las palabras, ahí entra la inteligencia. Si no se puede partir, todavía no es una articulación.
Hay quien oye System One como un descenso de nivel. Más abajo están las reglas. System One es el instinto por encima de las reglas. Es rápido, y no escribe una explicación. Aun así tiene que entender el sentido, o las reglas habrían bastado. Por encima está la inteligencia. La afirmación oficial de inteligencia es «más o menos igual» en tareas cerradas, y la de velocidad es de uno a dos órdenes de magnitud más rápido. Con esa velocidad, una llamada puede meterse en un bucle en vez de esperar a que acabe un chat.
Cuando los modelos fundacionales han allanado las tareas que la mayoría de la gente puede plantear, un producto tiene que cerrarse en una interfaz definida. Jev se cierra en una articulación. El chat no está a la venta. Los nodos donde las reglas no se pueden terminar, y donde llamar a un cerebro sería desperdicio, son su sitio.
Fuentes
- https://typesafe.ai/blog/introducing-system-one-models-and-jev
- https://evals.typesafe.ai/
- https://docs.typesafe.ai/primitives