Saltar al contenido

Centraliza el juicio. Distribuye el trabajo.

5 de septiembre de 2026 · 9 min de lectura

McKinsey publicó su encuesta State of AI el 25 de agosto, 1.719 profesionales y directivos de todos los sectores. Dos números de ahí hay que leerlos juntos. Entre las organizaciones que facturan más de 1.000 millones de dólares, el 40% dice estar escalando agentes de IA, frente al 27% de hace un año. Y el 6% de los encuestados entra en la categoría de alto rendimiento, es decir, atribuye a la IA al menos un 5% del EBIT con impacto significativo. Ese segundo número no se ha movido. Tampoco el 37% que declara algún impacto en EBIT.

O sea que la adopción corrió y el valor no fue detrás. Las explicaciones de siempre son la calidad del dato, la gestión del cambio y que un piloto es más fácil que producción. Todas ciertas, todas discutidas hasta el aburrimiento. Hay una cuarta que nadie pone en una diapositiva porque suena a detalle de implementación, y es la que me encuentro cada vez que abro el sistema de otro.

El agente es un solo modelo. Lee la entrada, decide qué hacer, llama a la herramienta, limpia el resultado, formatea la respuesta y revisa su propio trabajo, y cada uno de esos pasos va al mismo endpoint frontera al mismo precio. Un cerebro pensándolo todo, incluidas las partes que no requieren pensar nada. La misma encuesta recoge un 20% que dice que el coste operativo de la IA ya les ha limitado el uso. Esa es la factura de la arquitectura, y llega antes que el valor.

Agent adoption against earnings impact McKinsey State of AI 2026: 40 percent of organizations above one billion dollars in revenue are scaling AI agents, up from 27 percent a year earlier; 37 percent attribute at least some EBIT impact to AI; and 6 percent qualify as high performers, attributing at least 5 percent of EBIT to AI with significant impact. Only the first figure moved. McKinsey State of AI · 25 Aug 2026 · n=1,719 Scaling AI agents · firms above $1bn revenue 40% Attribute at least some EBIT impact to AI 37% High performers · 5%+ of EBIT, significant impact 6% Adoption moved: 27% → 40% Earnings did not: 6% → 6%

Adoptar es una decisión. Mover el beneficio es una arquitectura. Solo una de las tres barras se movió este año.

Casi ningún paso de una vuelta de agente necesita juicio

Abre la traza de cualquier agente que lleve un trimestre en producción y cuenta lo que de verdad le estás pidiendo al modelo. Leer un formulario. Sacar un campo de un párrafo. Decidir cuál de cuatro herramientas aplica. Convertir una respuesta desordenada de una API en tres claves. Comprobar que una fecha es una fecha. Reintentar porque el JSON vino con una coma de más.

Después busca el paso donde de verdad ocurre algo ambiguo, donde la entrada está infraespecificada y equivocarse cuesta dinero. Suele haber uno. Como mucho dos.

Peter Belcak y sus colegas de NVIDIA Research formalizaron este argumento en Small Language Models are the Future of Agentic AI, y lo útil está en la observación de debajo. Los sistemas agénticos consisten en modelos "realizando un número pequeño de tareas especializadas de forma repetitiva y con poca variación". Eso no es una afirmación sobre capacidad. Es una afirmación sobre la forma del trabajo. Un agente no es una conversación. Es un bucle que ejecuta los mismos seis pasos mil veces al día con argumentos distintos, y a un modelo general se le está pagando precio de general por un trabajo estrecho que no necesita generalidad para terminar.

Where judgment lives inside one agent turn A closed loop of six steps: read the input, interpret intent, call the tool, normalize, format, validate, and back to the start. Only the second step, interpret intent, requires judgment. The other five are repetitive transformations with narrow inputs, narrow outputs and a checkable right answer. One agent turn 01 Read the input 02 Interpret intent 03 Call the tool 04 Normalize 05 Format 06 Validate Five of six steps are the same transformation on new arguments. Narrow in, narrow out. Step 02 is the only one that is underspecified. The loop runs a thousand times a day · the price does not know the difference

El paso 02 es para lo que compraste un modelo frontera. El 01 y del 03 al 06 son por lo que la factura te sorprendió.

Esto sobrevive en producción porque nunca falla de forma ruidosa. Un único modelo que se ocupa de todos los pasos es lo más rápido de construir, funciona el primer día, y su problema de coste aparece como una línea en una factura mensual en vez de como una incidencia. A nadie le suena el busca por gastar demasiado por turno. El sistema simplemente se queda demasiado caro como para apuntarlo al volumen que lo habría hecho importar, que es exactamente lo que significa "el coste operativo nos ha limitado el uso" cuando lo traduces del idioma encuesta.

Los pequeños se pusieron a la altura mientras la arquitectura seguía igual

El contraargumento fue real. Hace dos años los modelos abiertos pequeños no sostenían un esquema de herramientas sin despeinarse, y partir el trabajo significaba cuidar una segunda clase de fallo a cambio de un ahorro que no cubría la ingeniería.

Eso cambió y casi nadie reescribió nada. Google publicó Gemma 4 el 2 de abril bajo Apache 2.0, una familia que va de una variante de 2B a un modelo denso de 31B, con 256K de contexto y llamada a herramientas en toda la línea, apuntando explícitamente a portátiles, estaciones de trabajo y hardware de borde. Qwen y el resto del campo abierto se movieron en la misma dirección esos mismos meses. La afirmación que defiendo es estrecha y con eso basta: para extracción, clasificación, normalización y formateo contra un esquema fijo, un modelo pequeño bien elegido hoy pasa el listón, corre dentro de tu perímetro y cuesta una fracción por llamada.

Lo que significa que la restricción se movió. Ya no es si el modelo pequeño puede hacer el paso. Es si alguien se ha molestado en nombrar los pasos.

Nombrarlos es el trabajo. No puedes enrutar lo que no has descompuesto, y casi ningún agente está descompuesto. Son un prompt largo con herramientas colgadas, y dentro de ese prompt hay seis trabajos distintos enredados sin una frontera entre ellos. Es el mismo fallo del que escribí cuando las capacidades iban antes que el proveedor: la primitiva que falta se parchea dentro del agente, y un año después nadie sabe decir dónde acaba una responsabilidad y empieza la siguiente. Un monolito que no sabes describir es un monolito que no sabes partir, cueste lo que cueste la alternativa.

Distribuir el trabajo no distribuye la responsabilidad

Aquí es donde el entusiasmo necesita freno, porque "muchos modelos pequeños" se está vendiendo como una historia de coste y en realidad es una historia de gobierno con un beneficio de coste encima.

Un cerebro tiene un modo de fallo y una suite de evals. Seis modelos tienen seis de cada. Si partes el bucle y no construyes los contratos, no has descentralizado la inteligencia. Has descentralizado la depuración, y te enterarás en producción de cuál de los seis empezó a devolver null en un campo que tres pasos aguas abajo daban por hecho que siempre venía.

Planner and workers after the split One planner running a frontier model sits at the top and holds ambiguity, planning, escalation and the expensive calls. Four curved connectors run down to four workers on small models: extract, classify, normalize and format. Each worker carries a named contract, its own eval set and a named owner. Where the judgment stays Frontier model Planner Ambiguity · plan · escalation · the expensive calls Small model Extract Contract · eval set Named owner Small model Classify Contract · eval set Named owner Small model Normalize Contract · eval set Named owner Small model Format Contract · eval set Named owner A step leaves the planner only when its expected output can be written down in advance

La línea entre el planner y los workers es una frontera de contrato antes que una frontera de coste. Trázala mal y tendrás seis problemas en vez de uno.

Así que la regla que le exijo a un equipo es que un paso solo sale del planner cuando tiene tres cosas. Un contrato con nombre, es decir, forma de entrada fija, forma de salida fija y un listón de calidad declarado. Su propio conjunto de evals, es decir, casos reales con salidas esperadas, ejecutados en cada cambio de modelo. Y un responsable, una persona, no un squad.

La tercera es la que la gente se salta y la que decide si esto aguanta. Un modelo worker sin responsable es un componente que se degrada en silencio durante dos trimestres porque actualizaron el modelo de debajo y nadie estaba mirando esa costura. El cerebro centralizado al menos tenía un solo cuello que apretar.

Lo que se gana yendo bien va más allá de la factura. Cuando cada paso es una llamada con nombre, con sus entradas y sus salidas, la traza deja de ser un muro de tokens y se convierte en un registro que se puede leer. Qué paso decidió, sobre qué entrada, contra qué versión. En agosto argumenté que un agente actuando con la credencial de una persona envenena el registro de auditoría en el origen. El problema de composición es el hermano de aquel. Un agente monolítico no puede decirte qué parte de sí mismo tomó la decisión que un candidato va a impugnar el año que viene, porque no tiene partes. Uno descompuesto responde con un número de línea.

Cómo se ve esto un miércoles en Shakers

Nuestro flujo de Matchmaking empieza con un brief escrito por una persona con prisa. Texto libre, a menudo contradictorio, y normalmente sin la restricción que resulta ser la importante. Alguien escribe "React senior" y quiere decir alguien que haya sacado adelante un design system, o quiere decir alguien barato y disponible el lunes, y esas son búsquedas distintas.

Averiguar cuál de las dos es, a partir de un párrafo que no lo dice, es juicio. Está infraespecificado, equivocarse cuesta una mala shortlist delante de un cliente, y se queda en el modelo frontera. No tengo ningún interés en ahorrar ahí.

Todo lo que rodea a eso no es juicio. Normalizar una etiqueta de stack a nuestra taxonomía. Sacar una ventana de disponibilidad de una frase. Parsear un rango de tarifas escrito de seis maneras. Comprobar un perfil contra un filtro duro. Dar forma a un resultado estructurado para el siguiente paso. Esas llamadas corren sin parar, tienen entradas y salidas estrechas, y la respuesta correcta es comprobable, que es la propiedad que hace barato escribir un conjunto de evals y seguro confiar en un modelo pequeño.

El mismo corte atraviesa Alma y Talent Insight. Un paso interpretativo donde el modelo está decidiendo qué dice de verdad la historia de una persona. Y una cola larga de recuperación, extracción y formateo donde no decide nada, solo aplica la misma transformación a argumentos nuevos.

La prueba que uso cuando un equipo propone sacar un paso del planner es una sola pregunta. Escribe la salida esperada para veinte entradas reales. Si puedes, el paso tiene contrato y puede irse. Si no conseguís poneros de acuerdo en la salida esperada, el paso es juicio y se queda donde está el juicio, y la discusión sobre coste es prematura.

Cierre

Centralizado y descentralizado es el marco equivocado, y por eso el debate da vueltas. Nadie está eligiendo entre una inteligencia y muchas. La elección real es qué se centraliza, y la respuesta es el juicio, la ambigüedad y las llamadas que salen caras cuando se fallan. Todo lo demás es trabajo de transformación con respuesta comprobable, y el trabajo de transformación va al borde, cerca del dato, barato, con dueño y con sus propias evals.

El 6% de la encuesta de McKinsey no encontró un modelo mejor que el resto. Hay un solo estante y todos compramos ahí. Lo que los separa es que en algún punto de su pila alguien se sentó a nombrar los pasos, y una vez los pasos tienen nombre lo demás es ingeniería.

El resto del campo está ejecutando un único cerebro que piensa igual de fuerte para parsear una fecha que para la decisión por la que el negocio paga. Funciona. Va a seguir funcionando. Y va a seguir costando exactamente lo mismo a diez veces el volumen, que es el volumen donde el número del beneficio cambia.

Te aviso cuando publico

Un par de veces al mes. Nada más. Al suscribirte aceptas la política de privacidad.

Relacionados

¿Hablamos de esto?

Agendar 30 minutos