NOTAS DE CAMPO · 18 DE AGOSTO DE 2026

El plan de 2,82 $ que hizo que un modelo local de 27B ganara a todos los agentes frontier que probé

Mismo Qwen. Mismo harness de OpenCode. Misma máquina. El único cambio importante fue un plan de ejecución de 11.044 tokens escrito por Sol. La puntuación pasó de 68,57 a 90,75 y los tres revisores a ciegas lo pusieron primero.

+22,18puntos gracias al plan
3 / 3victorias entre revisores a ciegas
2,82 $coste equivalente del plan vía API
6,1 %de la ventana de 262K ocupada por prompt + plan
Clasificación a ciegas con Qwen planificado primero con 90,75 puntos, Terra segundo con 86,73 y otros cuatro agentes por debajo de 75
01 El resultado final a ciegas entre los seis. Este es el gráfico que me hizo repetir las cuentas.

Empecé comparando un modelo local con varios modelos frontier. Terminé respondiendo a algo bastante más interesante: cuánto de la aparente inteligencia de un agente es en realidad planificación, diseño del harness y saber cuándo dejar de programar y empezar a comprobar el producto.

La idea original era sencilla. Dar a varios agentes de programación un encargo serio en un único intento, sin rescate humano; dejar que cada uno trabajara y comparar lo que entregaban de verdad. No fragmentos de código. No una función de benchmark. Aplicaciones completas que tenían que compilar, arrancar, sobrevivir a comprobaciones en el navegador y parecer productos.

Probamos un juego al estilo FarmVille, una web para un restaurante, un editor de píxeles y, por último, una herramienta CAD para planos de interiores. Las primeras rondas sirvieron, pero hicieron imposible ignorar un problema: estaba comparando modelos a través de harnesses de agente muy distintos. Claude y Codex llegan acompañados por años de trabajo de producto alrededor del modelo. Mi instalación local de Qwen, no.

Eso importa. Un modelo potente dentro de un bucle flojo puede perder una hora releyendo archivos, olvidar la tarea después de usar una herramienta o terminar con medio producto precioso. Llamar «calidad del modelo» a todo eso es cómodo, pero no es exacto.

Seis agentes y un encargo deliberadamente incómodo

La última tarea fue una aplicación CAD de interiores llamada Planform Studio. Tenía que incluir habitaciones, paredes, puertas, ventanas, muebles, medidas, deshacer y rehacer, persistencia, exportaciones, controles de teclado, layouts adaptables, accesibilidad y un proyecto inicial que permitiera entender el editor nada más abrirlo.

Todas las ejecuciones empezaron con el mismo prompt. Cuando un agente paró, su espacio de trabajo quedó congelado. No arreglé funciones rotas antes de la revisión. En el repositorio siguen las cuatro trayectorias incompletas, porque esconder los fallos habría hecho bastante menos interesante el experimento.

ParticipanteEntradaHarnessTiempoPuntuación
Qwen3.8 27B localPrompt + plan de SolOpenCode + Ollama53 min 34 s90,75
Codex GPT-5.6 TerraSolo promptCodex CLI47 min 18 s86,73
Codex GPT-5.6 Sol highSolo promptCodex CLI35 min 39 s74,98
Qwen3.8 27B localSolo promptOpenCode + Ollama89 min 51 s68,57
Claude Opus 4.8Solo promptClaude Code80 min 47 s68,48
Claude Opus 4.6Solo promptClaude Code69 min 30 s67,68
Matriz que compara harness, razonamiento, entrada, intentos y pruebas de entrega de las seis ejecuciones
02 Nunca se puede controlar del todo una comparación entre proveedores. Aquí están las condiciones, a la vista.

El primer resultado de Qwen fue normalito. Después dejé de pedirle que también fuese el arquitecto.

Qwen con solo el prompt agotó casi todo el límite de 90 minutos y produjo 407.074 tokens de salida a lo largo del bucle de herramientas. Sacó 68,57 puntos. Quedó en la misma franja que las dos ejecuciones de Opus, pero el producto tenía los síntomas habituales de un agente resolviendo lo que tenía justo delante: código local decente, decisiones de producto inconsistentes y demasiado poco tiempo reservado para integrar y comprobar.

Para la ejecución planificada mantuve el modelo local, su modo de razonamiento, OpenCode, Ollama, la ventana de contexto de 262K y la regla de un único intento. Sol high recibió el encargo CAD y produjo un plan de ejecución antes de que empezara Qwen. Qwen recibió después el prompt original de 4.908 tokens y ese plan de 11.044.

El plan no era relleno motivacional. Fijaba la arquitectura, nombraba los invariantes del estado, dividía la entrega en fases ordenadas por dependencias, especificaba el modelo de interacción, definía objetivos visuales y adjuntaba comprobaciones a cada función arriesgada. Le dejaba claro a Qwen qué significaba «terminado» cuando todavía quedaba tiempo para hacer algo al respecto.

Tamaño del prompt y del plan frente a la ventana de contexto de 262K de Qwen
03 El prompt y el plan juntos solo ocuparon el 6,1 % de la ventana configurada.
Minutos de reloj empleados por las seis ejecuciones
04 Qwen con plan terminó 36 minutos antes que Qwen solo con el prompt.
Total de tokens generados por las seis ejecuciones
05 Generar más tokens no produjo una aplicación mejor. La ejecución ganadora generó aproximadamente la mitad que el primer Qwen.
Contabilidad agregada de entrada y caché entre proveedores
06 Los totales de entrada del bucle son orientativos porque cada proveedor expone la caché de una forma distinta.

No quería que el resultado dependiera de mi gusto

Copié los seis espacios de trabajo CAD en paquetes de revisión sellados. Quité los nombres de los modelos, la telemetría de generación, las rutas originales, los tiempos y los informes que cada agente había escrito sobre sí mismo. La clave que relacionaba cada entrega con su modelo siguió oculta hasta que hubo tres votos válidos.

Codex Sol, Claude Opus y AGY Gemini 3.1 Pro High revisaron por separado el código y el producto en diez categorías definidas de antemano. El producto valía 60 puntos; la ingeniería, 40. Los tres eligieron independientemente la entrega de Qwen con plan. Sus puntuaciones fueron 93,50, 88,75 y 90,00.

Tres votos de revisores que colocan primero a Qwen con plan y segundo a Terra
07 Tres jueces distintos coincidieron en los dos primeros: Qwen con plan y después Terra.
Mapa de calor con las puntuaciones medias en diez categorías de producto e ingeniería
08 El ganador no fue el mejor en todo. Sol lideró el acabado visual; Terra, el flujo de trabajo, las interacciones y la seguridad. Qwen con plan fue el paquete más completo.
Número de pruebas automáticas de entrega disponibles para cada aplicación
09 El plan dio a Qwen el mismo objetivo de 36 pruebas que tenían las ejecuciones más fuertes de Codex.
Dispersión que compara puntuación y tiempo de ejecución
10 El ganador no fue ni el que más tardó ni el que menos. El tiempo explica muy poco por sí solo.

El plan fue pequeño comparado con la implementación

El plan completo de Sol contenía 11.044 tokens y le asigné un coste equivalente vía API de 2,82 $. Qwen local no tiene una factura de tokens del proveedor, aunque eso no convierte en gratis la electricidad ni la 5090.

Comparación del coste de generación de las seis entregas
11 Cada proveedor calcula los costes de forma distinta: esto es contabilidad, no una tarifa universal.
Plan de Sol de 11.044 tokens y su coste equivalente vía API de 2,82 dólares
12 Al plan de 11.044 tokens se le asigna un coste equivalente vía API de 2,82 $.

Tener contexto no es lo mismo que saber utilizarlo

Qwen no se convirtió de repente en un modelo mejor. El plan eliminó las partes del trabajo en las que había sido más débil: decidir la arquitectura del producto mientras escribía código, mantener prioridades durante un bucle largo de herramientas y reconocer cuándo un avance local estaba creando un riesgo global.

Con esas decisiones ya tomadas, el modelo local fue muy bueno en el trabajo que quedaba. Implementó una arquitectura amplia y explícita dentro de una ventana de 262K, comprobó lo que había hecho y entregó una aplicación coherente. El plan usó solo una parte pequeña de esa ventana. La mejora vino de la estructura de la información, no de llenar el contexto hasta arriba.

Esto también ayuda a explicar por qué Sol sin plan no ganó. Sol high tenía capacidad para escribir el mejor plan, pero durante su ejecución con solo prompt todavía tenía que planificar e implementar a la vez. Entregó la aplicación con mejor acabado visual y acabó con 74,98 puntos porque la estructura de ingeniería y la facilidad de mantenimiento eran mucho más débiles.

Si ya tienes un modelo local capaz, gasta el siguiente dólar en el plan

Los agentes frontier siguen teniendo una ventaja importante: sus harnesses resuelven bien todo lo que rodea al modelo. Pero este experimento sugiere que esa ventaja quizá sea menos duradera de lo que parece. Un modelo local de 27B no necesitó un fine-tuning nuevo ni una ventana de contexto mayor para competir. Necesitó una descripción mucho mejor del trabajo.

El resultado que me importa es el controlado: 68,57 se convirtió en 90,75. Mismo modelo, misma máquina, mismo harness, misma tarea. Un plan de 11K tokens convirtió un intento errático de 90 minutos en el ganador unánime. Es un resultado bastante más útil que otra discusión sobre qué modelo encabeza el leaderboard esta semana.

Todas las aplicaciones, prompts, puntuaciones y trayectorias fallidas son públicas.

Abrir las 13 aplicaciones Ejecutar la aplicación CAD ganadora Revisar los resultados en bruto