Navegación
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY Compare

Anthropic: Claude Sonnet 4.6 vs Qwen: Qwen3.5-Flash

Resumen

Comparación benchmark de Claude Sonnet 4.6 vs Qwen3.5-Flash: Claude Sonnet 4.6 lidera en puntuación media con 7.3 vs 6.8. Qwen3.5-Flash tiene menor coste de benchmark con $0.080 vs $0.316. Claude Sonnet 4.6 es más rápido con 5.04s vs 63.29s, con tasas de acierto de 55.6% vs 71.4%.

Modelo recomendado: Claude Sonnet 4.6 - Tiene la mejor puntuación aquí (7.3) y responde aproximadamente 12.6x más rápido que Qwen3.5-Flash.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-06-18

Métrica Claude Sonnet 4.6 Claude Sonnet 4.6 none Lanzamiento: 2026-02-17 Qwen3.5-Flash Qwen3.5-Flash medium Lanzamiento: 2026-02-24
Puntuación 7.3 6.8
Rango #55 #70
Fiabilidad 10.0 10.0
Consistencia 9.7 8.1
Pruebas correctas
Tasa de aciertos por intento 55.6% 71.4%
Pruebas inestables 1 5
Ejecuciones totales 63 63
Costo por resultado 2.870 0.871
Costo total $0.316 $0.080
Precio de entrada $3.000 / 1M $0.065 / 1M
Precio de salida $15.000 / 1M $0.260 / 1M
Total de tokens de entrada 57,886 38,926
Tokens de salida 9,465 2,088
Tokens de razonamiento 0 294,598
Tiempo de respuesta (promedio) 5.04s 63.29s
Tiempo de respuesta (máximo) 23.84s 234.29s
Tiempo de respuesta (total) 70.60s 1265.85s

Generación showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#55 Claude Sonnet 4.6

none
Coste
$0.038
Tiempo
27.3s
Tokens
2,598 tok

#70 Qwen3.5-Flash

medium
Coste
$0.002
Tiempo
25.8s
Tokens
4,294 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 4.8 10.0 25.0% 0 2.94s 636 1,214 0
Qwen3.5-Flash 10.0 10.0 100.0% 0 59.11s 672 383 32,992
Programación Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 5.5 10.0 33.3% 0 5.19s 8,522 2,127 0
Qwen3.5-Flash 3.7 7.2 22.2% 1 58.87s 6,685 302 90,081
Combinado Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 9.5 10.0 100.0% 0 23.84s 26,024 3,766 0
Qwen3.5-Flash 10.0 10.0 100.0% 0 17.78s 14,934 483 8,270
Análisis y extracción de datos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 10.0 10.0 100.0% 0 3.43s 8,574 252 0
Qwen3.5-Flash 7.3 5.9 83.3% 1 56.99s 6,061 235 16,237
Específico del dominio Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 7.7 10.0 66.7% 0 3.54s 759 413 0
Qwen3.5-Flash 5.3 7.2 44.4% 1 146.50s 581 58 43,615
Inteligencia general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 6.1 3.1 66.7% 1 2.56s 513 192 0
Qwen3.5-Flash 6.1 3.1 66.7% 1 40.05s 516 99 38,486
Seguimiento de instrucciones Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 6.5 10.0 50.0% 0 1.96s 690 90 0
Qwen3.5-Flash 10.0 10.0 100.0% 0 63.49s 699 98 14,139
Resolución de acertijos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 7.7 10.0 66.7% 0 2.53s 663 533 0
Qwen3.5-Flash 8.2 7.2 88.9% 1 27.61s 381 89 12,457
Llamada de herramientas Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 10.0 10.0 100.0% 0 4.11s 11,301 447 0
Qwen3.5-Flash 10.0 10.0 100.0% 0 10.33s 8,193 309 1,284
Cultura general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 3.0 10.0 0.0% 0 4.67s 204 431 0
Qwen3.5-Flash 3.0 10.0 0.0% 0 48.98s 204 32 37,037

Comparación rápida

Cambiar par de comparación