Qwen 3.6 vs Qwen 3.5: Comparativa de benchmarks (2026)
Qwen 3.6 35B supera a Qwen 3.5 en todos los benchmarks oficiales: 73,4 vs 70,0 en SWE-bench, con grandes mejoras en tareas agénticas y de herramientas.
Qwen 3.6 vs Qwen 3.5: Comparativa de benchmarks (2026)
Qwen 3.6 35B-A3B supera a la versión anterior Qwen 3.5 35B-A3B en todos los benchmarks de la ficha oficial de modelo de Alibaba, con las mayores ganancias en tareas agénticas y de uso de herramientas. Obtiene 73,4 en SWE-bench Verified (frente a 70,0), 51,5 en Terminal-Bench 2.0 (frente a 40,5) y 37,0 en MCPMark (frente a 27,0), manteniendo la misma eficiencia de mezcla de expertos de aproximadamente 3 mil millones de parámetros activos sobre 35 mil millones. No hay ninguna regresión en los benchmarks: el razonamiento y las matemáticas también mejoran.
Comparativa de benchmarks: Qwen 3.6 vs Qwen 3.5
Todas las cifras siguientes provienen de la ficha oficial del modelo Qwen3.6-35B-A3B y comparan las dos versiones 35B-A3B directamente. Ambos modelos comparten el mismo presupuesto de parámetros, por lo que se trata de una comparación generacional limpia y no de una diferencia de tamaño.
| Benchmark | Qwen 3.6 35B-A3B | Qwen 3.5 35B-A3B | Cambio |
|---|---|---|---|
| SWE-bench Verified (código) | 73,4 | 70,0 | +3,4 |
| Terminal-Bench 2.0 (agéntico) | 51,5 | 40,5 | +11,0 |
| MCPMark (uso de herramientas) | 37,0 | 27,0 | +10,0 |
| LiveCodeBench v6 (código) | 80,4 | 74,6 | +5,8 |
| GPQA Diamond (razonamiento) | 86,0 | 84,2 | +1,8 |
| AIME 2026 (matemáticas) | 92,7 | 91,0 | +1,7 |
Cómo interpretar estas cifras
Las diferencias entre benchmarks solo tienen sentido si se sabe qué mide cada prueba. SWE-bench Verified comprueba si un modelo puede resolver problemas reales de GitHub validados por humanos de principio a fin, por lo que es el indicador más cercano al trabajo de software cotidiano. Terminal-Bench 2.0 mide la competencia agéntica en un shell real: ejecutar comandos, leer la salida y recuperarse de fallos a lo largo de muchos pasos. MCPMark puntúa la fiabilidad con la que un modelo utiliza herramientas externas a través del Model Context Protocol. LiveCodeBench v6 es una prueba de código resistente a la contaminación que renueva sus problemas con el tiempo. GPQA Diamond es un conjunto de razonamiento científico de nivel de posgrado, y AIME 2026 es matemática de competición.
Leídos en conjunto, el patrón es claro. Las dos pruebas de razonamiento y matemáticas (GPQA, AIME) ya eran altas en Qwen 3.5 y suben uno o dos puntos, mientras que las pruebas agénticas y de uso de herramientas (Terminal-Bench, MCPMark) saltan dos dígitos. Qwen 3.6 no es un pequeño pulido generalizado. Es una actualización dirigida específicamente a las cargas de trabajo de agentes y herramientas.
Donde Qwen 3.6 toma ventaja: agentes y uso de herramientas
El titular no es la codificación bruta, sino el trabajo agéntico. Terminal-Bench 2.0 sube 11 puntos (de 40,5 a 51,5) y MCPMark sube 10 puntos (de 27,0 a 37,0). En la práctica, eso significa que el modelo es mucho mejor en tareas de varios pasos: ejecutar un comando, leer el resultado, decidir la siguiente acción y recuperarse cuando algo falla a mitad de una sesión. Esos son exactamente los modos de fallo que hacen frustrantes a los modelos más antiguos dentro de los bucles de agentes, donde una sola llamada de herramienta incorrecta puede descarrilar toda una ejecución.
Si estás construyendo agentes, conectando el modelo a servidores MCP o ejecutándolo detrás de un asistente de código que ejecuta comandos de shell, esta es la actualización que más importa. Un modelo que puntúa 11 puntos más en Terminal-Bench es uno que necesita menos reintentos y menos supervisión por tarea.
Mejoras en codificación
En codificación, SWE-bench Verified sube de 70,0 a 73,4 y LiveCodeBench v6 sube de 74,6 a 80,4. La ganancia en SWE-bench es la más significativa de las dos porque refleja trabajo real en repositorios en lugar de puzzles aislados: configurar el cambio, editar los archivos correctos y producir un parche que realmente supere las pruebas del proyecto. Un salto de casi seis puntos en LiveCodeBench, un benchmark diseñado para resistir la contaminación de datos de entrenamiento, sugiere que la mejora es una generalización genuina y no soluciones memorizadas.
Para los equipos que ya usan Qwen 3.5 como backend de codificación, la actualización tiene poco riesgo: el modelo utiliza la misma API compatible con OpenAI y mantiene el mismo presupuesto de contexto, por lo que se heredan las puntuaciones más altas sin necesidad de reescribir los prompts.
Razonamiento y matemáticas: sin regresión
Una afirmación persistente que circula en foros y algunos análisis de terceros es que Qwen 3.6 regresó en razonamiento, concretamente en GPQA. La ficha oficial del modelo no lo respalda. GPQA Diamond mejora de 84,2 a 86,0 y AIME 2026 mejora de 91,0 a 92,7. Ambos avanzan en la dirección correcta.
La confusión probablemente proviene de comparar diferentes tamaños de modelo o diferentes variantes de Qwen 3.6, ya que varias pruebas públicas evaluaron versiones más pequeñas o con cuantización diferente en lugar de la versión 35B-A3B. Cuando se mantiene constante la clase de parámetros y se leen las cifras oficiales, Qwen 3.6 35B-A3B no cede terreno en razonamiento para ganar en tareas agénticas. Mejora en ambos.
Misma arquitectura, misma eficiencia
Qwen 3.6 mantiene el diseño de mezcla de expertos 35B-A3B: 35 mil millones de parámetros totales con aproximadamente 3 mil millones activos por token, por lo que el cómputo por token se mantiene cercano al de Qwen 3.5 en el mismo hardware. El salto generacional proviene del entrenamiento y no de una arquitectura más pesada, razón por la cual las puntuaciones suben sin un mayor número de parámetros activos ni una mayor huella de memoria. Para quienes presupuestan memoria de GPU, esa continuidad es el punto clave: no se paga más por token para obtener el modelo mejorado.
Se distribuye bajo Apache 2.0 (publicado el 16 de abril de 2026) para uso comercial sin restricciones, lo que lo mantiene viable para productos cerrados que generan ingresos sin fricciones de licencia. La referencia de modelos disponibles lista las especificaciones exactas de despliegue.
Ventana de contexto y modo de pensamiento
Qwen 3.6 35B-A3B admite un contexto nativo de 262.144 tokens que se extiende a aproximadamente 1.010.000 tokens con escalado YaRN. Ese margen importa para transcripciones largas de agentes, bases de código grandes cargadas en un único prompt y pipelines de recuperación que introducen muchos documentos en el contexto. También incluye un modo de pensamiento nativo, donde el modelo dedica tokens adicionales a razonar antes de responder, lo que resulta más útil en las tareas de codificación y matemáticas de varios pasos que impulsan las ganancias en los benchmarks anteriores. La guía de respuesta directa frente a modo de pensamiento explica cuándo activarlo, ya que el modo de pensamiento intercambia latencia y coste en tokens por precisión y rara vez merece la pena en consultas simples.
¿Deberías actualizar desde Qwen 3.5?
Para cargas de trabajo de agentes y uso de herramientas, la respuesta es directa: sí. Las ganancias de dos dígitos en Terminal-Bench y MCPMark se traducen directamente en menos llamadas de herramienta fallidas y ejecuciones de agente más cortas, y la migración es casi gratuita porque la superficie de la API no ha cambiado.
Para backends de codificación, la actualización también vale la pena. Una ganancia de 3,4 puntos en SWE-bench y de 5,8 puntos en LiveCodeBench es suficientemente grande como para notarse en la calidad real de las pull requests, y no hay ninguna regresión en otro lugar que pese en contra.
Para chat puro, resumen o respuesta a preguntas simples, las ganancias son menores. Ambas versiones ya puntúan bien en razonamiento, así que si tu carga de trabajo nunca toca herramientas, agentes ni codificación intensiva, la actualización es conveniente pero no urgente. El factor decisivo suele ser si tu aplicación ejecuta el modelo dentro de un bucle o simplemente lo llama una vez por solicitud.
Ejecutar Qwen 3.6 en producción
Qwen 3.6 35B-A3B expone una API compatible con OpenAI, por lo que la mayoría de las aplicaciones migran cambiando la URL base y el nombre del modelo en lugar de reescribir el código de integración. Tessera lo sirve en GPUs dedicadas en regiones de la UE y LATAM a un precio mensual fijo en lugar de facturación por token, lo que mantiene el coste de inferencia predecible para cargas de trabajo de codificación y agentes de alto volumen, y mantiene los datos dentro de la región elegida. Ese modelo de precios encaja precisamente con los bucles de agentes donde Qwen 3.6 destaca, ya que esas cargas de trabajo consumen muchos tokens por tarea y son las más expuestas a picos de factura en APIs de pago por uso. Si vienes de una API de pago por uso, consulta cómo funciona el alojamiento con residencia de datos en la UE y los benchmarks completos de Qwen 3.6 35B para la tabla completa y la comparación con competidores.
Conclusión
Qwen 3.6 35B-A3B es una victoria clara sobre la versión 3.5 del mismo tamaño. Mejora en todos los benchmarks que publica Alibaba, registra ganancias de dos dígitos en las pruebas agénticas y de uso de herramientas que determinan si un bucle de agente es utilizable, y lo hace sin aumentar el número de parámetros activos ni reducir la ventana de contexto. La historia de la regresión en razonamiento no se sostiene frente a las cifras oficiales. Si hoy ejecutas agentes, asistentes de código o pipelines de llamada a herramientas sobre Qwen 3.5, pasar a 3.6 es una actualización de bajo esfuerzo y alto retorno. Si solo usas el modelo para prompts simples de un solo paso, las ganancias son reales pero menos urgentes.
Preguntas frecuentes
¿Es Qwen 3.6 mejor que Qwen 3.5?
Sí. En la ficha oficial del modelo de Alibaba, Qwen 3.6 35B-A3B supera a la versión Qwen 3.5 35B-A3B en todos los benchmarks listados. Las mayores ganancias están en agentes y uso de herramientas: Terminal-Bench 2.0 sube de 40,5 a 51,5 y MCPMark de 27,0 a 37,0.
¿Cuánto mejor es Qwen 3.6 en codificación?
SWE-bench Verified mejora de 70,0 a 73,4 y LiveCodeBench v6 de 74,6 a 80,4. Ambos miden la capacidad de codificación práctica en lugar de puzzles sintéticos, y la prueba LiveCodeBench está diseñada para resistir la contaminación de datos de entrenamiento.
¿Regresó Qwen 3.6 en algún benchmark respecto a 3.5?
No. En la suite oficial de la ficha del modelo no hay ninguna regresión. GPQA Diamond mejora de 84,2 a 86,0 y AIME 2026 de 91,0 a 92,7, en contra de algunas afirmaciones de terceros sobre una regresión en razonamiento que comparaban diferentes tamaños o variantes del modelo.
¿Puedo ejecutar Qwen 3.6 con una API compatible con OpenAI?
Sí. Qwen 3.6 35B-A3B se sirve a través de endpoints compatibles con OpenAI, por lo que el código de aplicación existente funciona apuntándolo a una nueva URL base y nombre de modelo.
¿Es Qwen 3.6 de código abierto?
Sí. Alibaba lo publicó bajo Apache 2.0 el 16 de abril de 2026, permitiendo el uso comercial sin restricciones.