JEV - Hasta dónde llega de verdad «no puede alucinar»

TypeSafe dice que Jev no puede alucinar. La frase solo se sostiene en el tipo: una respuesta no puede salir de la tabla fijada de antemano. La calibración y el acierto van aparte, y el workflow eval se alinea con el promedio de Astra y Fable.

Coautor: folkbench.com (Folkbench es una plataforma revisable de evaluación y selección de API de IA, servicios de modelos y sitios relacionados. Se apoya en información de servicio publicada, precios, disponibilidad, latencia y ventanas de evidencia para ayudar a los usuarios a comparar y a elegir un camino.)

Diez textos en esta serie:

TypeSafe dice que Jev «can't hallucinate». La frase suena a que la alucinación se ha prohibido de un golpe. El mismo texto la estrecha. Lo que escribieron es que la correspondencia con el esquema es una garantía, no una estadística, así que los errores de tipo se pueden escribir como 0%. Un contraejemplo bastaría para refutarlo. Dicen que es matemáticamente imposible.

La única capa en la que esa frase puede sostenerse es el tipo. Jev renunció a generar cadenas. Devuelve una estructura fijada de antemano, no un pasaje de texto generado en el momento. Si la probabilidad es exacta, y si el juicio es correcto, son otros dos asuntos. Si quien lee no los separa, «no escribió prosa» se oye como «la respuesta es correcta».

No puede salir de la tabla

Solo hay tres tipos de pregunta, y todos están sellados. Noul pregunta si una cosa se sostiene, y lo que vuelve es una probabilidad de 0 a 1. Las opciones de Choice las tiene que escribir de antemano quien llama, como máximo 255 en una tabla. Lo que vuelve es la opción elegida, con una probabilidad en cada opción y una confianza. Los niveles de Score también hay que escribirlos de antemano, como mínimo dos y como máximo diez. La puntuación puede caer entre dos niveles. La respuesta lleva a la vez la probabilidad de cada nivel y una confianza. Esa puntuación sigue siendo una posición en la escala, no un párrafo nuevo.

No puede salir de la tabla de opciones. El modelo tampoco puede ponerse de pronto a escribir un trozo de prosa y hablar la respuesta hasta darle forma. La documentación lo dice derecho. Lo que el modelo devuelve es una distribución sobre las opciones o los niveles que envió quien llama. No devuelve un valor fuera de esa distribución. El código puede usar estos valores directamente, sin sacar primero campos de un párrafo generado.

Los modelos de chat no suelen entregar el trabajo así. Entregan cadenas. Una cadena puede ser una respuesta normal, y puede ser una alucinación. El software aún tiene que analizarla y validarla. Si la validación falla, el programa no puede usarla directamente. TypeSafe pone juntas la seguridad de tipos y la alucinación, y trata la seguridad de tipos como la condición mínima de la automatización. Si el tipo es incorrecto en lo hondo de una cadena de llamadas, las ramas de después conectan en el sitio equivocado. El texto oficial también dice que los modelos actuales, por listos que sean, siguen alucinando, y siguen cometiendo errores de tipo.

Quedarse dentro del tipo no impide que el juicio sea incorrecto. Elegir el elemento equivocado en una pregunta cerrada sigue siendo un error. En el flujo público de alerta de seguridad, el modelo tiene que elegir entre cerrarla, entregarla a un analista, y contenerla ahora. Las tres opciones están en la tabla. Si el modelo elige la incorrecta, el tipo sigue siendo legal.

El relato oficial no llama a System One siempre correcto. Escribieron que el pensamiento System 1 da la impresión de ser propenso al error. Creen que los modelos System One pueden hacerse más fiables que las alternativas. Dejan las razones concretas para más adelante. Esa es su dirección. No es «siempre correcto».

Choice tiene otro borde duro. En cuanto las opciones pasan de 255, una tabla no puede contenerlas. Una carrera de Wikipedia que recorre enlaces tiene que elegir, en un paso, entre cientos o miles de enlaces. Pasan a dos etapas: puntuar por separado, y luego hacer una elección. De vez en cuando se ralentiza. Esa ralentización apareció en el demo de la carrera de Wikipedia. Una cardinalidad alta no es infinita. «Sin alucinación» aquí sigue queriendo decir solo que no devolverá un enlace que no esté en la tabla. Las opciones no se pueden añadir sin límite.

La confianza es otra pregunta

La calibración es un asunto aparte. El relato oficial es que las respuestas llevan probabilidad y confianza. Cuando la confianza es más alta, la exactitud es más alta. Entradas parecidas devuelven respuestas parecidas. Del otro lado, escriben sobre los modelos de chat. Aunque usted indique a uno que declare una confianza, a menudo es demasiado confiado, e inestable. Si una tarea se puede hacer bien el 95% de las veces y el modelo no dice de qué 5% no está seguro, esa tarea no se puede automatizar.

La confianza de Choice y de Score no es una frase aparte de certeza que el modelo declare. El número se calcula a partir de la forma de la distribución. Probabilidad amontonada en una opción o en un nivel, y el número es alto. Probabilidad repartida en varios sitios, y el número es bajo. Quien llama actúa cuando el número es alto, y entrega el caso a una persona cuando es bajo. Noul no adjunta una confianza aparte. La probabilidad de sí o no es en sí la señal. La tabla oficial de comparación escribe juntas la probabilidad y la confianza. Aplicado a las tres preguntas, Choice y Score tienen ambas, y Noul solo tiene la probabilidad.

Una confianza de 1.0 solo significa que la distribución está apretada por entero sobre un resultado. Describe la forma de esta respuesta. Cuando la distribución está apretada por entero sobre la opción incorrecta, la confianza puede seguir siendo alta. Un número grande no significa que el resultado sea correcto.

Un error de tipo no puede salir. Eso es matemáticamente imposible. La calibración no tiene una garantía de esa clase. Lo que da el relato oficial es una correspondencia: más confianza, más exactitud. Si esa correspondencia se rompe, el tipo sigue sin poder escapar, y la confianza ya no puede ser un umbral. Así que esta capa tiene un mecanismo, y tiene una afirmación. Si hay menos errores cuando el número es más alto, y si entradas parecidas vuelven con distribuciones parecidas, las dos cosas hay que mirarlas aparte. Que el campo esté presente cada vez solo significa que quien llama puede leer el número.

Lo correcto no es el mundo

El acierto y el error hay que partirlos una vez más. El workflow eval mide cuánto se acerca un modelo a una referencia dentro del mismo flujo. Esa referencia no es una respuesta objetiva del mundo. Dan por hecho que el código del flujo es correcto, y no discuten si las etiquetas son correctas. Las etiquetas de referencia son el promedio de GPT-6 Astra y Claude Fable 5.1. Los dos usan high thinking, y cada uno responde cada pregunta del flujo. Los demás modelos se comparan con el razonamiento por defecto de cada proveedor.

Que Jev se acerque a ese promedio significa acercarse al consenso de esos dos modelos. No se puede escribir como más verdadero que los hechos. Si el consenso se inclina, una respuesta pegada al consenso también se inclina. El texto oficial dice que usar el promedio de estos dos como referencia sesga las respuestas hacia los modelos de OpenAI y de Anthropic.

Durante la comparación, los grandes modelos se envuelven en el System One LLM adapter, que los obliga también a emitir decisiones estructuradas, para poder compararlos dentro de los mismos tipos de pregunta. El relato oficial admite que preguntar con probabilidades suele ser más lento y más caro que dar una decisión sin probabilidades. Su conclusión es que esta es la forma más exacta de sacar una decisión de un gran modelo. Esa exactitud se compara con una decisión que no lleva probabilidades. No significa que la decisión coincidiera con un hecho externo.

Los números de error de tipo de los grandes modelos en el gráfico vienen de OpenRouter, y están sesgados. Las consultas más complejas pueden enrutarse a un modelo más fuerte. El 0% de Jev no es la misma clase de estadística. El texto oficial dice que su número no es un resultado empírico. La correspondencia con el esquema está garantizada, así que el gráfico se puede rellenar con 0%. Un lado es una observación después del enrutado. El otro lado es un número rellenado a partir de una garantía. No son la misma tasa de error.

El cara a cara con GPT-5.6 Terra usó el razonamiento por defecto. El relato oficial eligió ese modelo porque, según lo leen, su inteligencia es por término medio la más cercana a Jev. En la ejecución registrada, el único desacuerdo es «Churn likelihood level». La visión oficial es que la pregunta es ambigua y la respuesta no se puede decir con limpieza. En una pregunta ambigua, una distribución es más honesta que una etiqueta dura.

«No puede alucinar», al final, significa que no produce salida fuera del tipo. Por eso escriben los errores de tipo como 0%. La calibración hay que aceptarla por su cuenta, según si la confianza se puede usar como umbral. Si el juicio es correcto, esta evaluación de flujo no puede dar la respuesta propia del mundo. Con lo que se alinea es con el promedio de Astra y Fable.

Fuentes

Serie