Hay una idea de HarnessTax que me parece especialmente importante: cuando evaluamos agentes de AI solemos atribuir casi todo el mérito (o culpa) al modelo.
Pero en realidad estamos evaluando un sistema entero: el modelo, las herramientas, el contexto que tiene, el bucle de ejecución, los reintentos y hasta el criterio utilizado para decidir cuándo parar.
El estudio comparó 21 combinaciones de siete modelos y tres harnesses en SWE-bench Lite y Terminal-Bench 2.0. Y el resultado que más me llamó la atención no fue qué modelo quedó primero.
Fue comprobar que cambiar el harness podía modificar muchísimo el coste sin apenas alterar la tasa de éxito. En algunos casos, la diferencia llegó a ser de cinco veces. Además, usar el harness del propio proveedor no siempre produjo la combinación más eficaz.
Esto me hace cuestionar cómo estamos comparando y comprando estas herramientas.
Un data-dashboard puede estar premiando un contexto mejor preparado, una política de reintentos más agresiva o una integración de herramientas más eficiente. No necesariamente un modelo más capaz.
Por eso, para evaluar un agente en un equipo, miraría bastante más que el porcentaje de tareas resueltas: coste por tarea completada, tokens consumidos, número de turnos, fiabilidad, latencia y facilidad para entender qué hizo y por qué.
La conclusión no es que los harnesses sencillos sean siempre mejores. Es que tenemos que medir el sistema completo y hacerlo con tareas que se parezcan al trabajo real.
La capa de orquestación también es parte del producto.
Gracias por leer hasta aquí 👈.