Benchmarks de código Qwen 3.6 35B: SWE-bench y LiveCode
Blog

Benchmarks de código Qwen 3.6 35B: SWE-bench y LiveCode

Qwen 3.6 35B-A3B obtiene 73,4 en SWE-bench Verified y 80,4 en LiveCodeBench v6. Compara benchmarks y despliega con Tessera AI.

Tessera 8 min de lectura AlibabaQwenSWE-benchTerminal-BenchLiveCodeBench

Benchmarks de código Qwen 3.6 35B: SWE-bench y LiveCode

Qwen 3.6 35B-A3B obtiene 73,4 en SWE-bench Verified, 51,5 en Terminal-Bench 2.0 y 80,4 en LiveCodeBench v6. Estos resultados representan un avance significativo respecto a la versión anterior Qwen 3.5 35B-A3B y confirman al modelo como una de las opciones de peso abierto de tamaño medio más potentes para cargas de trabajo de codificación agéntica. Publicado por Alibaba el 16 de abril de 2026 bajo la licencia Apache 2.0, combina puntuaciones de ingeniería de software de nivel frontera con una arquitectura dispersa que mantiene la inferencia económica.

Esta guía recorre cada puntuación de codificación publicada, explica qué mide cada benchmark y compara el modelo 35B directamente con su predecesor del mismo tamaño para que puedas valorar si la actualización merece la pena. También señala dónde divergen los números oficiales y los resultados de la comunidad, para que no sobreinterpretes ningún benchmark de forma aislada.

Puntuaciones de benchmark de código de Qwen 3.6 35B-A3B

Alibaba publica los números de codificación principales en su tarjeta de modelo oficial en Hugging Face. La tabla siguiente muestra los resultados de Qwen 3.6 35B-A3B junto a la línea base de Qwen 3.5 35B-A3B para que la ganancia generación a generación quede clara.

BenchmarkQwen 3.6 35B-A3BQwen 3.5 35B-A3B
SWE-bench Verified73,470,0
Terminal-Bench 2.051,540,5
LiveCodeBench v680,474,6
MCPMark37,027,0
GPQA Diamond86,084,2
AIME 202692,791,0

Las mayores ganancias de codificación se concentran en los benchmarks agénticos. Terminal-Bench 2.0 sube 11 puntos y MCPMark 10 puntos; ambos premian el uso de herramientas en múltiples pasos en lugar de la generación de código en un solo intento. SWE-bench Verified, el benchmark de ingeniería de software del mundo real más citado, sube 3,4 puntos hasta 73,4.

Cobertura temprana de terceros reporta variantes adicionales de SWE-bench para el modelo, incluyendo aproximadamente 67,2 en SWE-bench Multilingual y 49,5 en SWE-bench Pro, según una reseña detallada en DEV Community. Trata esas cifras secundarias como reportadas por la comunidad hasta que Alibaba publique la tabla extendida completa.

Qué mide cada benchmark de codificación

Las cifras de benchmark solo son útiles si sabes qué tarea representan. Esto es lo que evalúan las puntuaciones principales.

  • SWE-bench Verified pide al modelo que resuelva issues reales de GitHub en proyectos Python de código abierto, con un subconjunto verificado por humanos que filtra tareas rotas o ambiguas. Una puntuación de 73,4 significa que el modelo produjo un parche que superó la suite de pruebas oculta en aproximadamente tres de cada cuatro issues.
  • Terminal-Bench 2.0 mide con qué eficacia un modelo maneja un shell real para completar tareas de extremo a extremo: editar archivos, ejecutar comandos y reaccionar a la salida. Premia la planificación y la recuperación de errores, por lo que el resultado de 51,5 importa más para los constructores de agentes que una puntuación bruta de completado de código.
  • LiveCodeBench v6 utiliza problemas de programación competitiva publicados después del corte de entrenamiento del modelo, lo que lo hace resistente a la contaminación por soluciones memorizadas. El resultado de 80,4 apunta a un razonamiento genuino sobre problemas nuevos.
  • MCPMark evalúa el uso de herramientas a través del Model Context Protocol, la misma interfaz que muchos frameworks de agentes usan ahora para exponer herramientas a un modelo.

Las pruebas estándar de generación en un solo intento, como las variantes más antiguas de HumanEval y MBPP, muestran al modelo aproximadamente a la par con la generación anterior de Qwen, como señalan las primeras reseñas de la comunidad. El verdadero salto está en la codificación agéntica y de múltiples turnos, no en el completado de funciones individuales.

Qwen 3.6 35B vs Qwen 3.5 35B, mismo tamaño

La forma más limpia de leer esta versión es mantener el tamaño del modelo constante y comparar 35B-A3B contra 35B-A3B. En esa base, Qwen 3.6 mejora en todos los benchmarks de codificación de la tabla anterior, con las ganancias más pronunciadas en las suites agénticas. Para una comparación más detallada que incluya también tareas de razonamiento y conocimiento, consulta nuestra comparación de rendimiento Qwen 3.6 vs 3.5.

Un hilo de Hacker News ampliamente compartido captura el matiz del uso práctico: en una suite de codificación comunitaria «Power Ranking», Qwen 3.6 35B-A3B resolvió 11 de 98 tareas (mejor de dos intentos) frente a 10 de 98 del Qwen 3.5 del mismo tamaño. Es una brecha absoluta pequeña en un benchmark privado difícil, un recordatorio útil de que las suites oficiales y los conjuntos de tareas reales difíciles pueden contar historias ligeramente distintas.

La conclusión: la ganancia generación a generación es real y consistente en los benchmarks agénticos públicos, mientras que los conjuntos de tareas a medida más difíciles muestran una ventaja más estrecha. Para la mayoría de los equipos que evalúan una actualización, las ganancias publicadas en SWE-bench y Terminal-Bench son las cifras que se traducen en agentes de codificación del día a día. Nuestro hub de benchmarks de Qwen 3.6 35B sigue el panorama completo en codificación, razonamiento y conocimiento.

Cómo los entornos agénticos cambian los números

Las puntuaciones de codificación de los modelos abiertos dependen en gran medida del entorno que los rodea. Las pruebas de la comunidad en r/LocalLLaMA reportan que combinar Qwen 3.6 35B-A3B con un bucle de agente diseñado específicamente lo sitúa en el top 10 público de Polyglot con una tasa de éxito de alrededor del 78,7%, competitivo con modelos en la nube mucho más grandes en esa prueba.

La lección práctica es que las cifras de benchmark publicadas con un scaffold potente no coincidirán con una configuración ingenua de llamada única. Si planeas ejecutar el modelo como agente de codificación, reserva tiempo para ajustar el entorno: las definiciones de herramientas, la lógica de reintento y la gestión del contexto mueven la tasa de éxito en el mundo real tanto como la versión del modelo.

Arquitectura y ventana de contexto

Qwen 3.6 35B-A3B es un modelo de mezcla de expertos con 35B parámetros totales y aproximadamente 3B parámetros activos por token. El enrutamiento disperso activa solo las capas de expertos que necesita un prompt determinado, lo que permite que un modelo de clase 35B ofrezca el coste de inferencia y la latencia más cercanos a un modelo denso de 3B. Esa eficiencia es la razón por la que se ejecuta en hardware de consumo localmente y resulta económico de servir a través de una API.

El modelo incluye una ventana de contexto nativa de 262.144 tokens, ampliable a alrededor de un millón de tokens con escalado YaRN. Para agentes de codificación que cargan repositorios grandes, diffs extensos y transcripciones largas de herramientas, ese margen elimina un modo de fallo habitual en el que el agente pierde el contexto anterior a mitad de tarea. Los detalles de arquitectura y licencia están en la tarjeta de modelo de Hugging Face; el modelo es Apache 2.0, por lo que puede alojarse de forma autónoma o servirse a través de un proveedor gestionado sin términos restrictivos.

Hardware para ejecutar Qwen 3.6 35B-A3B localmente

Como solo 3B parámetros están activos por token, Qwen 3.6 35B-A3B es mucho más accesible para ejecutar localmente de lo que sugiere su tamaño total de 35B. Las pruebas de la comunidad reportan que una compilación GGUF cuantizada funciona en una configuración de 24 GB, incluidos los Mac con Apple Silicon, según la reseña de Build Fast with AI. La cuantización de menor precisión intercambia algo de exactitud por una huella de memoria más pequeña, por lo que las puntuaciones de codificación anteriores asumen un despliegue de alta calidad o precisión completa en lugar de una cuantización agresiva.

Para los equipos que comparan local frente a API, la decisión suele depender de tres factores: el rendimiento sostenido bajo concurrencia, el coste operativo de mantener GPUs y un runtime de agente, y si la inferencia debe permanecer en una región específica por cumplimiento normativo. Un desarrollador individual que experimenta en un portátil está bien atendido por una compilación GGUF local. Un agente de codificación en producción que gestiona muchas sesiones concurrentes, ventanas de contexto largas y garantías de disponibilidad suele ser más económico y sencillo de ejecutar a través de un endpoint gestionado, donde el proveedor absorbe el trabajo de GPU y escalado.

Ejecuta Qwen 3.6 35B-A3B en Tessera

Si prefieres no gestionar GPUs, cuantización y un runtime de agente por tu cuenta, Tessera sirve Qwen 3.6 35B-A3B a través de una suscripción mensual fija con una API compatible con OpenAI. Apuntas tu cliente existente a una nueva URL base y mantienes tus herramientas. Tessera sirve únicamente modelos de código abierto, con residencia de datos en la UE y LATAM para los equipos que necesitan que su inferencia permanezca en la región.

El precio es fijo en lugar de por token, por lo que un agente de codificación que consume ventanas de contexto largas no genera una factura sorpresa a final de mes. Puedes consultar la lista de modelos en nuestra página de modelos disponibles y la estructura de costes en precios de IA privada. Para cargas de trabajo de codificación agéntica, un coste predecible en un modelo de contexto largo suele ser la diferencia entre un prototipo y algo que puedes dejar funcionando en producción.

Preguntas frecuentes

¿Cómo se compara Qwen 3.6 35B con Qwen 3.5 35B?

Qwen 3.6 35B-A3B mejora respecto al Qwen 3.5 del mismo tamaño en todos los benchmarks de codificación publicados, incluyendo SWE-bench Verified de 70,0 a 73,4, Terminal-Bench 2.0 de 40,5 a 51,5 y LiveCodeBench v6 de 74,6 a 80,4. Las mayores ganancias están en los benchmarks agénticos de múltiples pasos.

¿Cuál es la ventana de contexto de Qwen 3.6 35B?

El modelo admite una ventana de contexto nativa de 262.144 tokens, ampliable a aproximadamente un millón de tokens con escalado YaRN.

¿Es Qwen 3.6 35B-A3B un modelo denso o MoE?

Es un modelo de mezcla de expertos con 35B parámetros totales y aproximadamente 3B parámetros activos por token, lo que mantiene el coste de inferencia y la latencia cercanos a los de un modelo denso mucho más pequeño.

¿Se mantienen estas puntuaciones de benchmark en agentes de codificación reales?

Las ganancias oficiales de SWE-bench y Terminal-Bench son consistentes y reproducibles, pero el éxito en el mundo real también depende del entorno del agente. Las pruebas de la comunidad muestran que el mismo modelo varía ampliamente en tasa de éxito según el scaffold, la lógica de reintento y la gestión del contexto que lo rodean.

¿Dónde puedo desplegar Qwen 3.6 35B?

Puedes alojarlo de forma autónoma bajo Apache 2.0, o ejecutarlo a través de Tessera con una suscripción mensual fija, una API compatible con OpenAI y residencia de datos en la UE o LATAM.