JEV - Un laboratorio podría hacerlo. Por qué quizá no.

TypeSafe publicó Jev el 15 de septiembre de 2026, aún en early access. Este texto pone el precio oficial y el relato del entrenamiento junto a la lista de precios de los incumbentes, y explica por qué un modelo de juicio con salida gratis choca con vender la salida larga por token.

Coautor: folkbench.com (Folkbench es una plataforma revisable de evaluación y selección de API de IA, servicios de modelos y sitios relacionados. Se apoya en información de servicio publicada, precios, disponibilidad, latencia y ventanas de evidencia para ayudar a los usuarios a comparar y a elegir un camino.)

Diez textos en esta serie:

El 15 de septiembre de 2026, TypeSafe publicó Jev, y seguía en early access. Este es su primer modelo System One. Solo hace juicios. No se apoya en la charla de relleno. El fundador, Diogo Almeida, trabajaba antes en el seguimiento de instrucciones en OpenAI, en la investigación que llegó a ser ChatGPT.

Jev en sí no tiene foso técnico. Cualquier laboratorio de modelos, con un equipo pequeño, podría hacer su propia versión en medio mes. Técnicamente, nada lo impide.

El trabajo oficial sí hizo algo nuevo. Construyeron una arquitectura nueva. El muestreador es paralelo: una consulta termina el juicio, sin generar un token tras otro. Construyeron un método de entrenamiento aparte, llamado RLCD, aprendizaje por refuerzo sobre decisiones calibradas. La confianza que declara el modelo tiene que alinearse con la parte de decisiones posteriores que son correctas. Eso es su implementación. Lo que otro imitaría es la forma del producto: no generar cadenas, y emitir probabilidades calibradas solo en preguntas cerradas. La pregunta se fija de antemano, el modelo devuelve un juicio con una probabilidad, y el código ramifica sobre ese número. Medio mes imita esa forma. No copia la investigación de TypeSafe tal como está. Quien la imita no tiene que desmontar primero esa investigación.

Un foso es difícil de afirmar. Una vez fijada la forma, la implementación se puede sustituir entera. Después del cambio, el sistema en el que se enchufa sigue recibiendo lo mismo: state delante, un juicio detrás.

El producto de un modelo de chat es una cadena. Una cadena se puede escribir muy larga, y el software que de verdad necesita esa cadena tiene que analizarla una vez más. Jev no produce cadenas. Sin ese tramo de texto que se puede alargar, la salida no tiene una factura que suba con la longitud.

La lista de precios de los incumbentes

El precio lo deja claro. La entrada de Jev es $0.042 por millón de tokens, cerca de gratis, y la salida es gratis. El relato oficial dice que la salida es demasiado barata para medirla. También admiten que no pueden demostrar que este precio no esté subvencionado. A largo plazo, esperan que el precio baje, no que suba.

La lista de precios de los incumbentes es el otro extremo. La entrada va de $0.20 a $10 por millón de tokens, y la salida es unas cinco veces más cara otra vez. El dinero de un modelo de chat se sienta en la salida larga. Una respuesta para que la lea una persona, y los pasos que un Agent sigue ejecutando, los dos tienen que escribirse como texto. En cuanto el texto es largo, el dinero cae del lado de la salida. Aunque la entrada se apriete muy baja, una escritura larga sigue siendo el grueso de la llamada.

Los dos lados no se encuentran. Los incumbentes venden tokens. Un modelo cuya salida es gratis, y cuya entrada está cerca de ser gratis, se come el negocio del token.

El conflicto es estructural. Cuanto más se use un modelo de juicio con salida gratis, menos gente compra los tokens que antes querían decir «deja que un gran modelo clasifique, enrute y puntúe». Una nota de gastos se comprueba contra un recibo, y alguien tiene que juzgar si la descripción casa con la prueba. Salta una alerta de seguridad, y alguien tiene que juzgar si esta máquina se aísla ahora. Articulaciones de esa clase se entregaban enteras a un modelo de chat, que escribía una razón, después de lo cual la conclusión se sacaba del texto. El texto sacado se tarifa como salida, en el tramo más caro. Una pregunta cerrada entrega el juicio directamente. Lo que vuelve es un conjunto de probabilidades, la longitud se fija de antemano, y no hay texto que se pueda seguir escribiendo hacia abajo. La razón puede quedarse sin escribir, y ese tramo de cargos no tiene dónde caer.

Lo que el incumbente daña es su propio informe. Cuanto más se use el modelo, más deprisa cae la columna vieja. Este es un negocio que entra desde abajo. El juicio barato viaja con el flujo y sustituye las decisiones pequeñas que antes llamaban a un gran modelo. Lo que se sustituye no es la llamada de arriba que escribe un texto largo. Es la decisión pequeña que hay que tomar a mitad del flujo. Las llamadas que aún hay que escribir despacio se pueden seguir vendiendo. La expectativa oficial de que su propio precio siga bajando no rellena la columna que el incumbente perdió.

El nombre Jev viene de William Stanley Jevons. La analogía oficial es el carbón y la máquina de vapor. Después de que la máquina de vapor subiera la eficiencia de quemar carbón, no se quemó menos carbón. Se quemó más. La eficiencia sube, y el uso no se encoge. Crece. Las llamadas de juicio barato hacen existir el uso. Preguntar a un modelo una vez antes no era barato, así que la gente le entregaba solo los pocos pasos más valiosos, y escribía el resto como reglas muertas, o lo miraba ella. En cuanto el juicio es lo bastante barato para preguntarse una y otra vez dentro del código, llegan juntas las preguntas que no merecía la pena preguntar. Lo que sube es el recuento.

El uso que se hace existir no es la clase de token que los incumbentes más quieren vender hoy. La longitud escrita en una sola llamada baja, y la salida no se cobra. Por alto que se apile el recuento, no entra en la tabla que usan hoy, la que gana dinero con la salida larga.

La persona que define esta clase de modelo

Lo difícil es la persona.

Solo quien sostiene a la vez una mirada de negocio y una mirada de modelo ve articulaciones por todo un sistema. Lo que una articulación necesita no es lo que necesita un cerebro. Un cerebro necesita un tramo de palabras que pueda seguir. Una articulación no quiere palabras. Quiere un resultado sobre el que se pueda ramificar. Si la probabilidad es sólida, el programa sigue. Si la probabilidad no está segura, se deja a una persona. Quien solo construye modelos ve esto con facilidad como un formato de salida. Quien solo hace el negocio siente con facilidad que llamar una vez más al gran modelo basta. Las dos miradas tienen que sentarse en una persona antes de que esa persona defina esta clase de modelo. Esa gente es poca. El elemento no aparece solo en una hoja de ruta.

Usar bien esta clase de modelo, una persona encuentra la misma dificultad. El instinto solo puede responder preguntas que el instinto puede responder. Si algo es así, y cuál de unos pocos elementos fijos elegir, el instinto puede responderlo. Escribir un tramo de contenido que no estaba, o pensar los pasos hasta el final en una pregunta que no se ha encuadrado, el instinto no puede sostenerlo. Eso es trabajo de otra clase de modelo. El instinto es rápido, y es barato. Cuando el programa necesita preguntar, pregunta una vez, y el tiempo y el dinero lo aguantan. Por muchas veces que pregunte, las preguntas siguen siendo las que el instinto puede sostener. Así que se queda dentro de un programa que sigue en marcha.

Los grandes laboratorios pueden construirlo. La gente y el cómputo están ahí. Cerrar la salida desde una cadena hasta una pregunta cerrada es algo que la ingeniería puede atravesar, y eso no es lo mismo que reproducir la investigación de TypeSafe en medio mes. Lo que medio mes produce es una forma usable. La implementación de TypeSafe sigue en sus propias manos.

Esa columna sigue ingresando dinero. En cuanto el juicio se cambia a una pregunta cerrada, y la salida se hace gratis, la columna pierde un tramo. La parte perdida se ve en un informe trimestral. El sitio más adelante se deja a proyectos que aún escriben la salida larga. El contexto sigue creciendo, los Agent dan unas vueltas más, y lo que sale de más es justo el token que esta lista de precios reconoce.

Pueden construirlo. No se programará al frente.

Fuentes

Serie