Empecé comparando un modelo local con varios modelos frontier. Terminé respondiendo a algo bastante más interesante: cuánto de la aparente inteligencia de un agente es en realidad planificación, diseño del harness y saber cuándo dejar de programar y empezar a comprobar el producto.
La idea original era sencilla. Dar a varios agentes de programación un encargo serio en un único intento, sin rescate humano; dejar que cada uno trabajara y comparar lo que entregaban de verdad. No fragmentos de código. No una función de benchmark. Aplicaciones completas que tenían que compilar, arrancar, sobrevivir a comprobaciones en el navegador y parecer productos.
Probamos un juego al estilo FarmVille, una web para un restaurante, un editor de píxeles y, por último, una herramienta CAD para planos de interiores. Las primeras rondas sirvieron, pero hicieron imposible ignorar un problema: estaba comparando modelos a través de harnesses de agente muy distintos. Claude y Codex llegan acompañados por años de trabajo de producto alrededor del modelo. Mi instalación local de Qwen, no.
Eso importa. Un modelo potente dentro de un bucle flojo puede perder una hora releyendo archivos, olvidar la tarea después de usar una herramienta o terminar con medio producto precioso. Llamar «calidad del modelo» a todo eso es cómodo, pero no es exacto.
01 / LA PRUEBA
Seis agentes y un encargo deliberadamente incómodo
La última tarea fue una aplicación CAD de interiores llamada Planform Studio. Tenía que incluir habitaciones, paredes, puertas, ventanas, muebles, medidas, deshacer y rehacer, persistencia, exportaciones, controles de teclado, layouts adaptables, accesibilidad y un proyecto inicial que permitiera entender el editor nada más abrirlo.
Todas las ejecuciones empezaron con el mismo prompt. Cuando un agente paró, su espacio de trabajo quedó congelado. No arreglé funciones rotas antes de la revisión. En el repositorio siguen las cuatro trayectorias incompletas, porque esconder los fallos habría hecho bastante menos interesante el experimento.
| Participante | Entrada | Harness | Tiempo | Puntuación |
|---|---|---|---|---|
| Qwen3.8 27B local | Prompt + plan de Sol | OpenCode + Ollama | 53 min 34 s | 90,75 |
| Codex GPT-5.6 Terra | Solo prompt | Codex CLI | 47 min 18 s | 86,73 |
| Codex GPT-5.6 Sol high | Solo prompt | Codex CLI | 35 min 39 s | 74,98 |
| Qwen3.8 27B local | Solo prompt | OpenCode + Ollama | 89 min 51 s | 68,57 |
| Claude Opus 4.8 | Solo prompt | Claude Code | 80 min 47 s | 68,48 |
| Claude Opus 4.6 | Solo prompt | Claude Code | 69 min 30 s | 67,68 |
02 / EL PLAN
El primer resultado de Qwen fue normalito. Después dejé de pedirle que también fuese el arquitecto.
Qwen con solo el prompt agotó casi todo el límite de 90 minutos y produjo 407.074 tokens de salida a lo largo del bucle de herramientas. Sacó 68,57 puntos. Quedó en la misma franja que las dos ejecuciones de Opus, pero el producto tenía los síntomas habituales de un agente resolviendo lo que tenía justo delante: código local decente, decisiones de producto inconsistentes y demasiado poco tiempo reservado para integrar y comprobar.
Para la ejecución planificada mantuve el modelo local, su modo de razonamiento, OpenCode, Ollama, la ventana de contexto de 262K y la regla de un único intento. Sol high recibió el encargo CAD y produjo un plan de ejecución antes de que empezara Qwen. Qwen recibió después el prompt original de 4.908 tokens y ese plan de 11.044.
El plan no era relleno motivacional. Fijaba la arquitectura, nombraba los invariantes del estado, dividía la entrega en fases ordenadas por dependencias, especificaba el modelo de interacción, definía objetivos visuales y adjuntaba comprobaciones a cada función arriesgada. Le dejaba claro a Qwen qué significaba «terminado» cuando todavía quedaba tiempo para hacer algo al respecto.




03 / LA REVISIÓN
No quería que el resultado dependiera de mi gusto
Copié los seis espacios de trabajo CAD en paquetes de revisión sellados. Quité los nombres de los modelos, la telemetría de generación, las rutas originales, los tiempos y los informes que cada agente había escrito sobre sí mismo. La clave que relacionaba cada entrega con su modelo siguió oculta hasta que hubo tres votos válidos.
Codex Sol, Claude Opus y AGY Gemini 3.1 Pro High revisaron por separado el código y el producto en diez categorías definidas de antemano. El producto valía 60 puntos; la ingeniería, 40. Los tres eligieron independientemente la entrega de Qwen con plan. Sus puntuaciones fueron 93,50, 88,75 y 90,00.




04 / EL DINERO
El plan fue pequeño comparado con la implementación
El plan completo de Sol contenía 11.044 tokens y le asigné un coste equivalente vía API de 2,82 $. Qwen local no tiene una factura de tokens del proveedor, aunque eso no convierte en gratis la electricidad ni la 5090.


05 / LO QUE CREO QUE PASÓ
Tener contexto no es lo mismo que saber utilizarlo
Qwen no se convirtió de repente en un modelo mejor. El plan eliminó las partes del trabajo en las que había sido más débil: decidir la arquitectura del producto mientras escribía código, mantener prioridades durante un bucle largo de herramientas y reconocer cuándo un avance local estaba creando un riesgo global.
Con esas decisiones ya tomadas, el modelo local fue muy bueno en el trabajo que quedaba. Implementó una arquitectura amplia y explícita dentro de una ventana de 262K, comprobó lo que había hecho y entregó una aplicación coherente. El plan usó solo una parte pequeña de esa ventana. La mejora vino de la estructura de la información, no de llenar el contexto hasta arriba.
Esto también ayuda a explicar por qué Sol sin plan no ganó. Sol high tenía capacidad para escribir el mejor plan, pero durante su ejecución con solo prompt todavía tenía que planificar e implementar a la vez. Entregó la aplicación con mejor acabado visual y acabó con 74,98 puntos porque la estructura de ingeniería y la facilidad de mantenimiento eran mucho más débiles.
LA CONCLUSIÓN
Si ya tienes un modelo local capaz, gasta el siguiente dólar en el plan
Los agentes frontier siguen teniendo una ventaja importante: sus harnesses resuelven bien todo lo que rodea al modelo. Pero este experimento sugiere que esa ventaja quizá sea menos duradera de lo que parece. Un modelo local de 27B no necesitó un fine-tuning nuevo ni una ventana de contexto mayor para competir. Necesitó una descripción mucho mejor del trabajo.
El resultado que me importa es el controlado: 68,57 se convirtió en 90,75. Mismo modelo, misma máquina, mismo harness, misma tarea. Un plan de 11K tokens convirtió un intento errático de 90 minutos en el ganador unánime. Es un resultado bastante más útil que otra discusión sobre qué modelo encabeza el leaderboard esta semana.
COMPRUEBA EL TRABAJO