OPINIÓN

La productividad de la IA empieza donde terminan los benchmarks


Dirección copiada

La IA puede resolver en horas problemas que exigirían meses de trabajo humano, pero eso no significa que siempre resulte más barata

Publicado el 2 oct 2026

Julián Gómez Bejarano

Chief Digital Officer LedaMC



Julián Gómez Bejarano, LedaMC
Julián Gómez Bejarano, LedaMC.



El caso reciente de un problema matemático vuelve a poner sobre la mesa una pregunta que el entusiasmo por los agentes de IA suele dejar en segundo plano, ¿cuánto nos cuesta realmente producir un resultado útil?

¿La IA permite producir más software útil por el mismo dinero? Quizá esta sea la pregunta que deberíamos hacernos en plena fiebre por los agentes de inteligencia artificial y que, paradójicamente, estamos dejando en segundo plano.

Resulta extraordinario que una máquina sea capaz de desarrollar software. Puede escribir código en segundos, trabajar durante horas sin descanso, explorar miles de alternativas y abordar problemas que exigirían una capacidad de búsqueda difícilmente asumible por un equipo humano. Pero ninguna de esas capacidades responde por sí sola a la cuestión que realmente importa en una empresa.

En realidad, si no sabemos cuánto producto obtenemos y cuánto nos cuesta conseguirlo, decidir entre un equipo interno, un proveedor, un conjunto de agentes de IA o una combinación de todos ellos termina convirtiéndose en una cuestión de fe. Y la fe, conviene recordarlo, es una metodología bastante mala para gestionar presupuestos.

Si no sabemos cuánto producto obtenemos y cuánto nos cuesta conseguirlo, decidir entre un equipo interno, un proveedor o un conjunto de agentes de IA termina convirtiéndose en una cuestión de fe

Hay una resolución reciente relacionada con uno de los problemas del milenio que ofrece una interesante paradoja. Diego Córdoba y Luis Martínez-Zoroa fueron determinantes en el planteamiento que permitió avanzar sobre el problema. El tramo final se completó mediante OpenAI tras unas 88 horas de cómputo y con alrededor de 15 millones de coste estimado.

Lo interesante no es decidir quién hizo la parte más importante del trabajo. Lo revelador es observar cuánto costó conseguirlo y qué aportó cada uno.

Han sido los investigadores los que han proporcionado el planteamiento, el marco de trabajo y la hipótesis que permitieron orientar la búsqueda. La máquina realizó después una exploración intensiva hasta cerrar una parte del problema. Según los propios investigadores, sin aquella idea inicial el sistema no habría llegado al resultado final.

Máquinas o humanos, determinar el coste

Y precisamente es de ahí de donde surge un cálculo tan provocador como interesante. Si dos matemáticos pueden dedicar meses a resolver la mayor parte de un problema y una máquina extraordinariamente potente necesita millones para completar el tramo restante, quizá los seres humanos resulten, en determinadas circunstancias, sorprendentemente baratos.

Y esa es una conversación mucho más relevante para una empresa que averiguar qué modelo ha quedado primero en el último benchmark.

Llevamos años midiendo el progreso de la IA comparando modelos. Quién programa mejor, quién razona mejor, quién resuelve más ejercicios o quién alcanza el porcentaje más alto en una determinada prueba. Tiene sentido hacerlo. Los benchmarks permiten comparar tecnologías pero de manera controlada, por lo menos, relativamente.

Sin embargo, aparece el problema cuando trasladamos directamente esa competición al mundo empresarial.

A una compañía debería importarle mucho menos que un modelo haya obtenido dos puntos más que otro en una clasificación que cuánto producto es capaz de conseguir con los recursos que está destinando a ello. En desarrollo de software, la lógica es exactamente la misma.

Igualmente, no es determinante cuántas líneas de código haya generado un Agente, cuántas tareas haya completado un desarrollador o cuántas personas haya colocado un proveedor en un proyecto. Lo que finalmente utiliza una empresa es producto software. Y, por tanto, el resultado que medimos debería ser ese.

Probablemente la alternativa que termine siendo más habitual sea equipos híbridos en los que trabajan conjuntamente personas y agentes de IA

Y es precisamente aquí dónde además aparee un cambio importante. Hasta hace poco, cuando una empresa necesitaba desarrollar software, la decisión consistía fundamentalmente en determinar quién iba a hacerlo, si se trataba del equipo interno o un proveedor externo. Ahora existe un tercer participante, los agentes de IA. Y probablemente la alternativa que termine siendo más habitual sea una cuarta, equipos híbridos en los que trabajan conjuntamente personas y agentes de IA.

Y es ahí dónde surge la tentación de pensar que la IA tiene que ser necesariamente más barata. Un agente no cobra salario, no disfruta vacaciones y puede trabajar sin horario. Además, genera código a una velocidad que ningún desarrollador humano puede conseguir.

Y todo ello nos lleva al mismo punto, código no es producto.

Un sistema puede producir cantidades enormes de código y exigir después un esfuerzo considerable de revisión, integración, pruebas, corrección y mantenimiento. Del mismo modo, un equipo humano puede escribir relativamente poco código y entregar una funcionalidad de enorme valor.

Un sistema puede producir cantidades enormes de código y exigir después un esfuerzo considerable de revisión, integración, pruebas, corrección y mantenimiento; lo que se necesita comparar son los resultados

Por eso tampoco sirve demasiado comparar simplemente horas de cómputo con de trabajo humano. Lo que se necesita comparar son los resultados.

Y es que, si un equipo humano consigue entregar determinada cantidad de software útil por un coste concreto y un conjunto de agentes consigue entregar más por ese mismo coste, tendremos una respuesta. Si sucede al contrario, también.

Y si un equipo formado por personas que utilizan agentes consigue multiplicar el resultado que ambos obtienen trabajando por separado, estaremos ante una alternativa diferente que también podremos medir.

Productividad del desarrollo de software

El producto software se convierte así en el experimento porque, paradójicamente, la llegada de los agentes nos ofrece una oportunidad extraordinaria para hacer algo que durante años hemos hecho mal, medir de verdad la productividad del desarrollo de software.

Se puede observar cuánto producto consigue nuestro equipo interno, cuánto obtiene un proveedor, cuánto producen los agentes por sí solos y qué sucede cuando incorporamos IA al trabajo de los desarrolladores. Después podemos relacionar todos esos resultados con el coste necesario para obtenerlos.

La discusión por tanto deja entonces de ser filosófica. Ya no necesitamos adivinar si la IA sustituirá a los programadores, si desaparecerán los proveedores o si el futuro pertenecerá exclusivamente a los agentes.

Podemos experimentar y observar los datos. Incluso podríamos descubrir algo parecido a lo ocurrido con aquellos matemáticos, que una máquina extraordinariamente potente resulte económicamente ineficiente para determinados problemas y que el aparentemente anticuado ser humano siga siendo imbatible en coste. O, podríamos descubrir exactamente lo contrario.

La IA está cambiando el desarrollo de software y probablemente lo hará mucho más en los próximos años. Pero sería un error sustituir nuestra antigua obsesión por medir desarrolladores mediante horas o líneas de código por otra basada en prompts, número de agentes desplegados o tokens consumidos.

Serían simplemente versiones distintas del mismo error.

Sería un error sustituir nuestra antigua obsesión por medir desarrolladores mediante horas o líneas de código por otra basada en prompts, número de agentes desplegados o tokens consumidos

El producto sigue siendo lo que importa. Por eso, cada vez que incorporemos IA al desarrollo deberíamos hacernos una pregunta extraordinariamente sencilla y no es otra que si estamos obteniendo más software útil que antes y cuánto nos está costando producirlo.

Y será entonces cundo podremos saber si necesitamos cinco desarrolladores, cinco agentes o dos desarrolladores acompañados por veinte agentes.

Tal vez descubramos que la IA puede sustituir equipos completos, o que convierte a los buenos equipos en organizaciones mucho más productivas y, quizá comprobemos que, para determinados trabajos, los humanos siguen siendo sorprendentemente baratos. No necesitamos adivinar cuál de esos escenarios será el futuro. Es necesario medirlo.

Y es que la revolución no consiste en tener más inteligencia artificial, consiste en conseguir más producto con los mismos recursos y hasta que podamos demostrar que eso está ocurriendo, todo lo demás seguirá siendo, por muy espectacular que resulte la demostración, una demo con una factura detrás.

Artículos relacionados