
Un aumento de 37 veces en la valoración en 24 días: esta es la historia más emocionante del año en la industria de la IA
Jev está en boca de todos. Un modelo de IA no textual consiguió hoy 870 millones de dólares en financiación, liderada por a16Z, lo que eleva la valoración de la empresa a 7.500 millones de dólares.
Cuando se lanzó por primera vez el 15 de septiembre, TypeSafe solo había recaudado 40 millones de dólares en su ronda de financiación inicial y estaba valorada en unos 200 millones de dólares; en 24 días, su valoración aumentó 37 veces.

Según los logros compartidos por el fundador de Jev en X, Jev superó el millón de usuarios en tan solo unos días, y a las tres semanas del lanzamiento de su modelo, procesaba billones de tokens diariamente. Aproximadamente un tercio de las empresas de Fortune 500 utilizan este modelo de toma de decisiones.
En poco tiempo, han surgido modelos de toma de decisiones por doquier. Desde la API Decisions, presentada en la Conferencia de Desarrolladores OpenAI , hasta la plataforma de código abierto vLLM, que lanzó seis modelos de toma de decisiones a la vez, y ahora Microsoft también ha lanzado su propio modelo de toma de decisiones: Microsoft-Decision-1.

¿Qué es un modelo de decisión? Es un modelo que no puede chatear, escribir código ni resumir documentos. Le proporcionamos un contexto y un conjunto de respuestas candidatas predefinidas, y puede devolver la probabilidad calibrada de cada opción en poco tiempo. Eso es todo.
La razón por la que se ha vuelto tan popular ahora es que el agente realmente está trabajando.
Una tarea de agente implica docenas de pequeñas decisiones de ramificación: a qué modelo dirigir la llamada, si permitir o no una llamada a una herramienta y si continuar o detenerse. Estas decisiones tienen un espacio de respuesta limitado, un alto volumen de llamadas y todas se encuentran en la ruta crítica. Utilizar un LLM de última generación para tomar cada decisión provocará que la latencia de la tarea se acumule en segundos y que la facturación aumente en tokens.
Como mencionó Microsoft en su publicación de blog técnico sobre el modelo Decision-1, una vez que la IA agencial se convierta en una realidad, el costo se convertirá en el factor principal en las decisiones de las personas sobre cómo usar la IA.

Cuando todos empiezan a construir modelos de decisión
Cuando un modelo típico de gran tamaño recibe una tarea, genera texto paso a paso según el token. Incluso si el usuario solicita que genere texto en formato JSON similar a una decisión, el modelo aún debe manejar problemas comunes de modelado de texto, como errores de formato, mezclas de interpretaciones y campos faltantes.
El modelo Microsoft-Decision-1, lanzado hoy, es similar a modelos de toma de decisiones anteriores. Su entrada consiste en una evidencia, una pregunta y un conjunto de opciones fijas. El modelo genera la probabilidad de cada opción en una sola pasada hacia adelante, y estos resultados son para uso del programa, no para ser interpretados por humanos.

Por ejemplo, el agente está listo para llamar a una herramienta externa. Decision-1 puede proporcionar probabilidades para "continuar la ejecución", "reintentar", "cambiar de herramienta" y "transferir a intervención humana". La aplicación decide entonces el siguiente paso en función de un umbral.
- Si el nivel de confianza es lo suficientemente alto, proceda directamente;
- Si varias opciones son similares, envíelas a un modelo más amplio;
- Si aparece la frase "no se puede determinar", la solicitud se remitirá a un revisor humano.
Actualmente, Decision-1 admite respuestas de sí/no, selección múltiple, puntuación y clasificación. También puede puntuar las respuestas de la IA o las acciones de los agentes según un conjunto de reglas. Puede procesar un máximo de 32 000 tokens a la vez, con entrada y salida en formato de texto y JSON, sin generar explicaciones ni procesos de razonamiento.
Este modelo se basa en Qwen3.5-9B y ha sido entrenado por Microsoft. Los datos de entrenamiento provienen de conjuntos de datos públicos que han pasado por el proceso de Datos Abiertos de Microsoft, así como de datos sintéticos generados por el equipo.

En resumen, su función es más parecida a la de un evaluador: el modelo principal se encarga de proponer soluciones, y Decision-1 se encarga de comprobar si las soluciones cumplen las condiciones; el modelo principal se encarga de redactar las respuestas, y Decision-1 se encarga de determinar si las respuestas se pueden entregar.
Es muy probable que este tipo de modelos de toma de decisiones permanezcan como una capa de la infraestructura de agentes, pero no reemplazarán a los modelos grandes convencionales.
Microsoft mencionó en su blog técnico que Decision-1 logró la mayor precisión en 36 conjuntos de pruebas y casi 150.000 preguntas, y fue 4,5 veces más rápido que Quyet-1.0-Large y 35 veces más rápido que GPT-6 Sol.

Más allá de la precisión y la latencia, la característica más destacada de Microsoft Decision-1 es su probabilidad de calibración. Cuando el modelo afirma tener un 90 % de certeza y cumple con esa promesa, podemos establecer un umbral: por encima del 90 %, se ejecuta automáticamente; por debajo del 90 %, pasa a la intervención manual o se actualiza a un modelo más avanzado.
OpenAI está impulsando un producto similar: la API Decisions, que ya se presentó en la conferencia de desarrolladores y que ahora está oficialmente abierta para pruebas beta públicas, con tecnología de GPT-6 Luna.
Permite determinar la probabilidad de que se cumplan ciertas condiciones a partir de texto e imágenes, seleccionar opciones predefinidas o puntuar según criterios específicos. Puede utilizarse para tareas como la clasificación de quejas, la inspección de imágenes, el enrutamiento de modelos y la evaluación de riesgos.

Según datos publicados por OpenAI , la API Decisions puede ser hasta 10 veces más rápida para ciertas tareas en comparación con la llamada al mismo modelo a través de la API Responses, con un coste de 0,10 dólares por millón de tokens de entrada, sin tarifas de salida ni de almacenamiento en caché.
En la comunidad de código abierto, vLLM también ha publicado seis modelos de decisión. Al igual que Microsoft Decision-1, también se entrenan posteriormente basándose en diferentes versiones del modelo Qwen.


Algunos internautas han recopilado los modelos de toma de decisiones que han surgido recientemente y han descubierto que la mayoría de ellos son versiones diferentes del modelo Qianwen, a excepción de la API de decisiones de OpenAI y el propio Jev.

También podemos experimentar cómo funcionan estos modelos de decisión en la página principal de vLLM Decision 2.0. Es la más adecuada para estas tareas:
- Categorización de solicitudes, enrutamiento de modelos y evaluación de la relevancia de los resultados de búsqueda;
- Califica la respuesta de la IA o las acciones del agente;
- Intercepción de seguridad, verificación de datos y enrutamiento de órdenes de trabajo;
- Elija el siguiente paso entre las acciones predefinidas;
- Anotación de texto a gran escala.
El proyecto de demostración principalmente enumera funciones como el enrutamiento LLM. ¿Cuál es el resultado de la solicitud de entrada del usuario de 17 x 24 palabras? La salida del modelo de decisión es el resultado de 6 decisiones, que incluyen el modelo, la complejidad, si se debe intentar el jailbreak, qué herramientas se necesitan, si se necesita verificación de hechos y la prioridad de demora.

El sistema estándar de selección y categorización destaca por su capacidad para manejar reglas claras, como asignar archivos con la extensión .jpg al procesador de imágenes y requerir una confirmación secundaria para importes superiores a 10.000 yuanes.
Sin embargo, es difícil que el código emita juicios basándose únicamente en reglas, como "¿Es urgente este mensaje de atención al cliente?", "¿Responde este resultado de búsqueda a la pregunta?" y "¿Es destructivo este comando?".
Los modelos de decisión como Jev están diseñados para manejar estos juicios ambiguos, pero las ramificaciones y las acciones siguen estando controladas por código.

En rigor, no inventó el concepto de "juicio" desde cero. Los clasificadores, los modelos de reordenamiento, los modelos de recompensa, los validadores y los modelos de moderación de contenido llevan mucho tiempo lidiando con opciones limitadas.
La novedad reside en que el modelo de decisión integra estas capacidades en una interfaz transversal: las aplicaciones pueden declarar preguntas, candidatos y criterios de puntuación al realizar una solicitud, y el modelo devuelve resultados y probabilidades categorizados.

El futuro de la inteligencia barata
Cuando TypeSafe lanzó Jev, lo denominó el primer modelo de System One.
Su mayor atractivo reside en su asequibilidad y velocidad: algunas tareas pueden alcanzar una latencia de entre 70 y 500 milisegundos, con un coste de entrada de 0,042 dólares por millón de tokens. Según TypeSafe, en algunos casos, puede ser entre diez y cientos de veces más rápido y rentable que los flujos de trabajo a gran escala convencionales.

Para los flujos de trabajo de los agentes que requieren el procesamiento constante de pequeñas decisiones, esto significa que muchas tareas que antes no resultaban rentables con modelos grandes ahora se pueden realizar utilizando inteligencia artificial.

En un reciente informe sobre financiación, Diogo, fundador de Jev, declaró a a16z que la IA ya es muy potente, pero que el software en sí apenas ha cambiado en la última década. Como mucho, los productos incorporan un chatbot que puede realizar algunas operaciones, pero no permiten que el software comprenda realmente la intención, emita juicios o realice más tareas por sí mismo.

La IA está ayudando a los humanos a escribir software más rápido, pero aún no ha hecho que el software en sí sea más inteligente; el valor de Jev reside en incorporar las capacidades de los modelos más recientes a un coste que el software tradicional puede permitirse.

El número de preguntas que una persona puede formular a una IA al día es limitado, pero un programa informático puede necesitar procesar decenas de miles de consultas diarias. Cuando cada consulta sea lo suficientemente económica como para ser insignificante, la escala de uso de la IA ya no estará limitada por la cantidad de personas dispuestas a abrir una ventana de chat.

En los últimos años, toda la industria se ha esforzado por elevar el nivel de inteligencia artificial, permitiendo que los modelos resuelvan problemas cada vez más complejos. Ahora, cada vez más empresas compiten por algo más: lograr que incluso los juicios más comunes y minuciosos sean dignos de recurrir a la IA.
Desde esta perspectiva, la valoración de TypeSafe se disparó a 7.500 millones de dólares en tan solo 24 días, y con la incorporación de Microsoft y OpenAI , es posible que estén apostando precisamente por un futuro así:
Puede que la gente no utilice más productos de IA, pero cada programa informático que usamos a diario puede estar recurriendo a la IA miles de veces en segundo plano.
