Navegación
AI BENCHY
Advertise here

AI BENCHY Compare

Anthropic: Claude Sonnet 4.6 vs Qwen: Qwen3.5-27B

Resumen

Comparación benchmark de Claude Sonnet 4.6 vs Qwen3.5-27B: Qwen3.5-27B lidera en puntuación media con 7.9 vs 7.8. Qwen3.5-27B tiene menor coste de benchmark con $0.536 vs $1.418. Claude Sonnet 4.6 es más rápido con 17.06s vs 68.39s, con tasas de acierto de 65.1% vs 73.0%.

Modelo recomendado: Qwen3.5-27B - Tiene la mejor puntuación aquí (7.9) y cuesta aproximadamente 2.6x menos que Claude Sonnet 4.6.

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-06-18

Métrica Claude Sonnet 4.6 Claude Sonnet 4.6 medium Lanzamiento: 2026-02-17 Qwen3.5-27B Qwen3.5-27B medium Lanzamiento: 2026-02-24
Puntuación 7.8 7.9
Rango #31 #29
Fiabilidad 10.0 10.0
Consistencia 9.1 8.5
Pruebas correctas
Tasa de aciertos por intento 65.1% 73.0%
Pruebas inestables 2 4
Ejecuciones totales 63 63
Costo por resultado 10.904 4.901
Costo total $1.418 $0.536
Precio de entrada $3.000 / 1M $0.195 / 1M
Precio de salida $15.000 / 1M $1.560 / 1M
Total de tokens de entrada 49,112 42,164
Tokens de salida 54,703 8,534
Tokens de razonamiento 29,970 329,289
Tiempo de respuesta (promedio) 17.06s 68.39s
Tiempo de respuesta (máximo) 46.35s 234.36s
Tiempo de respuesta (total) 221.83s 1436.24s

Generación showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#31 Claude Sonnet 4.6

medium
SVG inválido
Coste
$0.000
Tiempo
300.0s
Tokens
0 tok

#29 Qwen3.5-27B

medium
Coste
$0.008
Tiempo
62.0s
Tokens
3,099 tok

Mejores modelos por puntuación

Puntuación vs costo total

Tiempo de respuesta (promedio)

Puntuación vs Tiempo de respuesta (promedio)

Total de tokens de salida

Puntuación vs Total de tokens de salida

Desglose por categoría

Trucos anti-IA Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 6.5 10.0 50.0% 0 2.98s 789 1,046 1,093
Qwen3.5-27B 8.7 7.9 91.7% 1 19.75s 672 569 31,505
Programación Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
Qwen3.5-27B 6.2 7.1 55.6% 1 160.69s 7,895 6,381 89,388
Combinado Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 10.0 10.0 100.0% 0 46.35s 18,351 5,871 3,962
Qwen3.5-27B 10.0 10.0 100.0% 0 163.96s 14,946 483 9,991
Análisis y extracción de datos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 10.0 10.0 100.0% 0 13.90s 8,676 649 742
Qwen3.5-27B 10.0 10.0 100.0% 0 30.26s 7,782 270 16,150
Específico del dominio Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 2.9 7.2 11.1% 1 0ms 471 25,790 16,919
Qwen3.5-27B 5.3 10.0 33.3% 0 79.53s 553 43 52,368
Inteligencia general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 10.0 10.0 100.0% 0 4.94s 564 256 433
Qwen3.5-27B 6.1 3.1 66.7% 1 101.41s 524 70 23,147
Seguimiento de instrucciones Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 10.0 10.0 100.0% 0 2.61s 792 318 552
Qwen3.5-27B 10.0 10.0 100.0% 0 19.66s 699 97 11,638
Resolución de acertijos Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 10.0 10.0 100.0% 0 5.31s 816 592 646
Qwen3.5-27B 8.2 7.7 77.8% 1 59.60s 696 242 70,096
Llamada de herramientas Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 10.0 10.0 100.0% 0 7.48s 11,454 655 351
Qwen3.5-27B 10.0 10.0 100.0% 0 7.45s 8,193 348 1,323
Cultura general Puntuación Consistencia Tasa de aciertos por intento Pruebas inestables Pruebas correctas Tiempo de respuesta (promedio) Tokens de entrada Tokens de salida Tokens de razonamiento
Claude Sonnet 4.6 3.0 10.0 0.0% 0 30.09s 204 3,437 1,586
Qwen3.5-27B 3.0 10.0 0.0% 0 85.11s 204 31 23,683

Comparación rápida

Cambiar par de comparación