JEV - Un modelo reducido, una suite y uno que no habla

DeepSeek, Kimi y Jev no son puestos en un mismo tablero general. Uno sirve para apilar caudal, otro es una fachada que ya está hecha, y Jev se sienta dentro de un flujo, emite una probabilidad y no habla.

Coautor: folkbench.com (Folkbench es una plataforma revisable de evaluación y selección de API de IA, servicios de modelos y sitios relacionados. Se apoya en información de servicio publicada, precios, disponibilidad, latencia y ventanas de evidencia para ayudar a los usuarios a comparar y a elegir un camino.)

Diez textos en esta serie:

El grupo de clase vuelve a pasarse tableros. Alguien lanza la puntuación de DeepSeek. Alguien lanza la puntuación de Kimi. Debajo, alguien arrastra a Jev y pregunta cuál de los tres es más fuerte. Miré una vez y me fui. No respondí. Lo que el grupo quiere es un nombre, y yo no tengo a mano esa clase de nombre. Estos tres no son puestos en el mismo tablero. Fuerce un orden, y el ruido se queda en el grupo. Tiene poco que ver con cómo trabajo yo esta semana.

Ahora los uso por nicho, no por un tablero general. El éxito que reconozco es así de estrecho: un modelo lidera en su propio nicho, y no tiene que ser el primero en todo. Pasada la línea de Opus 4.5 a 4.6, ese hábito está fijo. Creo que el 90% de los usuarios ya no puede plantear una tarea más allá del modelo. Suba la inteligencia general otro tramo, y mis días apenas se mueven. Compare otra vez la inteligencia general, y no puedo sentirla. Si algo habla o no, eso lo elijo cada día. La interfaz también afecta a si puedo seguir usándolo. El precio es más directo. Tiene que ser lo bastante barato para que me atreva a escribirlo en un bucle antes de meter el modelo en el código.

Los que hablan, los uso aparte

DeepSeek, para mí, es el camino empujado hasta el extremo simple. Ingeniería llevada hasta donde da, la tasa llena, el precio cortado a la mitad. Lo abro, y en la página no hay mucho por donde vagar, y no espera un banco de trabajo de un sector. DeepSeek pone su esfuerzo en correr deprisa y en bajar el precio. Me atrevo a correr la misma cosa varias vueltas más. Cambie a uno más caro, y empiezo a calcular si ahorrar. El trabajo por lotes de noche, también se lo lanzo. La gente duerme, las llamadas siguen corriendo, y con un modelo caro me siento incómodo.

Lo uso para trabajo que quiere caudal. Empujo un lote de registros para escanearlo, y aprieto borradores de interfaz de un lado a otro, muchas vueltas de la misma clase de pregunta. Miro dos cosas: que no se atasque, y que no se ponga caro. El cursor gira demasiado, o una vuelta empieza a doler en dinero, y la tubería se rompe sola. También puede escribir frases. Yo suelo cambiarlas de paso y usarlas. Rara vez me paro a catarlas. Tampoco le hablo de gusto en este trabajo. El gusto hay que molerlo palabra a palabra. No se tarifó así para que una persona moliera frases.

Pongo a Kimi del otro lado. No para demostrar quién es más listo. La capacidad de fachada está llena. Entra un material largo, aparece un índice, las citas siguen ahí, y la fuente se puede abrir para leerla en paralelo. Si yo montara eso, se iría una tarde. También construyó suites hechas a propósito para finanzas y derecho. Las fuentes de datos están conectadas dentro, las habilidades que hay que usar están ahí sentadas, y hay una superficie lista cuando se entrega el trabajo. Normativa y informes financieros, los paso en esa superficie. No abro un montón de otras páginas. Cuando finanzas o derecho se abren como material largo, no quiero construir yo primero el entorno. Lo que quiero es sentarme y pasarlo, no pasar la mitad del tiempo haciendo de mi propia fachada. Lo abro cuando necesito leer documentos largos, y cuando necesito un banco de trabajo que ya esté ahí.

Lo que acepto después de usarlos es una cosa. Esto es un producto. No es un modelo que se vuelve más listo y por eso le crece un sitio web de lado. De qué casa se conectan los datos, y a qué cláusula de una norma se llega, no crecen solos porque un modelo sea más listo. Cómo se ve un informe cuando se entrega, alguien tiene que hacer primero del flujo una interfaz. Cuando el habla es rápida y barata, apilo llamadas, y lo que uso es DeepSeek. Cuando de verdad necesito leer material y entregar trabajo, abro la fachada de Kimi. Los dos pueden hablar. No sustituyo uno por el otro.

El que no habla, lo meto dentro del flujo

No llevo a Jev a chatear. Entra el state, se preguntan las preguntas cerradas, y lo que vuelve es probabilidad. Qué elemento elegir, o en qué nivel cae, incluido un sí o no llano, el tipo tiene que escribirse cerrado de antemano. Si la pregunta aún no se ha cerrado, no lo llamo. La salida es gratis. La entrada es $0.042 por millón de tokens. La velocidad es de la clase rápida, de 70 a 500 milisegundos. A este precio me atrevo a preguntar una y otra vez dentro de un flujo, sin aritmética mental de la factura en cada pregunta. Lo trato como una llamada dentro del flujo. Pregunto, y sigo.

Metido dentro de mi propio flujo como articulación. El código limpia primero el state, y luego lanza una pregunta cerrada. Vuelve la probabilidad, y la rama la camina el programa de después. Para mí trata la clasificación y el enrutado, trata los niveles, y trata si este paso debería llamar a una persona. Después de la clasificación sigo y pregunto en qué nivel cae, y después de que sale el nivel pregunto si llamar a una persona. Todas preguntas cerradas, todas la misma clase de llamada. Las razones y las explicaciones escritas para que las lea otra persona no son su trabajo. El texto que de verdad tiene que ver una persona, le conecto un modelo que pueda hablar. Si esta clase de juicio se da a un modelo que puede chatear, a menudo vuelve como un párrafo entero, con una actitud y con un consejo. Luego tengo que escribir otra capa, y sacar el párrafo hasta una rama. Una capa más en la articulación, y no creo que merezca la pena.

La evaluación solo la he abierto una vez. Dentro del workflow, sus juicios se comparan con Astra y Fable 5.1. Lo que se compara es la cercanía, y el coste, no una victoria o una derrota en el chat. Ese es otro sistema de coordenadas. En cuanto lo entendí, cerré la página.

Un lanzamiento debería decir para quién es

La ola de GPT-6 volvió a hacer del computer use algo que la gente reconoce. El modelo va y hace clic en la pantalla él mismo, abre software, y termina una cosa en el escritorio. Había gente haciendo esto antes. Después de que salió Astra, operar un ordenador volvió a ser algo que la gente puede señalar, ya no solo un extra fuera del cuadro de chat. Puesto al lado de estos tres, eso queda aún más asentado. En el momento en que se publica un modelo, la gente que lo publica tiene que decir con claridad para quién es.

La gente dispuesta a entregar la máquina entera puede usar el computer use. Otro grupo se sienta delante de un cuadro de chat y quiere que el habla se termine. DeepSeek y Kimi hablan los dos, pero uno es para apilar caudal y el otro es para una fachada que ya está construida, y esos ya no son el mismo uso. Jev no está del lado del habla. El código es mío. Solo es responsable de emitir una probabilidad, para que el programa de después pueda caminar. Si le hiciera una página de chat, lo usaría mal. En el momento en que hay un cuadro de chat, quiero que escriba la razón.

No escribiré un texto llamado «quién es el más fuerte en 2026». Esa frase no ayuda este año. Los dos de dentro del cuadro de chat, y este que no habla, los separé en el uso hace tiempo. Tampoco me preparo para escribir esa clase de texto.

Así es como los tomo. El trabajo que quiere caudal, se lo doy a DeepSeek. No me gasto en un tira y afloja de estilo, y no quiero subir a uno caro. Material largo, si además viene con un banco de trabajo ya construido, abro Kimi. Cuando el código llega al paso que tiene que hacer un juicio —clasificación y enrutado, un nivel, y si llamar a una persona—, meto ahí a Jev, y hago que no abra la boca. El tablero general puede actualizarse si quiere. Los tomo por nicho. El puesto, ya no lo miro.

Fuentes

Serie