Comparar Gráficos

Idioma:

❤️ Made by XCS

AI BENCHY Compare

OpenAI: GPT-5.4 vs Qwen: Qwen3 Coder Next

Comparar:

Benchmarks generados a partir de los suites de prueba de AI BENCHY en: 2026-03-05

Métrica	OpenAI: GPT-5.4 none Lanzamiento: 2026-03-05	Qwen: Qwen3 Coder Next medium Lanzamiento: 2026-02-03
Rango	#44	#51
Puntaje prom.	4.6	3.3
Pruebas correctas
Consistencia	8.9	9.5
Costo por resultado	1.496	0.224
Costo total	$0.090	$0.007
Tasa de aciertos por intento	44.4%	24.4%
Pruebas inestables	2	1
common.totalAttempts	45 (15 x 3)	45 (15 x 3)
Tokens de salida	1,635	2,793
Tokens de razonamiento	0	0
Tiempo de respuesta (promedio)	1.46s	13.77s
Tiempo de respuesta (máximo)	2.89s	81.80s
Tiempo de respuesta (total)	21.86s	123.93s

Mejores modelos por puntuación

Tiempo de respuesta (promedio)

Puntuación vs costo total

Puntaje prom. vs Tiempo de respuesta (promedio)

Desglose por categoría

Trucos anti-IA	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
OpenAI: GPT-5.4	10.0	7.3	11.1%	1		1.41s	388	0
Qwen: Qwen3 Coder Next	1.3	7.5	22.2%	1		15.28s	1,246	0

Combinado	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
OpenAI: GPT-5.4	10.0	10.0	0.0%	0		2.89s	291	0
Qwen: Qwen3 Coder Next	10.0	10.0	0.0%	0		4.28s	317	0

Análisis y extracción de datos	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
OpenAI: GPT-5.4	9.9	10.0	100.0%	0		1.04s	222	0
Qwen: Qwen3 Coder Next	5.4	10.0	50.0%	0		81.80s	246	0

Específico del dominio	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
OpenAI: GPT-5.4	4.0	7.2	44.4%	1		1.07s	50	0
Qwen: Qwen3 Coder Next	4.0	10.0	33.3%	0		638ms	25	0

Seguimiento de instrucciones	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
OpenAI: GPT-5.4	5.5	10.0	50.0%	0		1.07s	81	0
Qwen: Qwen3 Coder Next	4.5	10.0	0.0%	0		7.34s	63	0

Puzzle Solving	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
OpenAI: GPT-5.4	4.0	9.8	33.3%	0		1.52s	357	0
Qwen: Qwen3 Coder Next	10.0	10.0	0.0%	0		2.30s	641	0

Llamada de herramientas	Puntuación	Consistencia	Tasa de aciertos por intento	Pruebas inestables	Pruebas correctas	Tiempo de respuesta (promedio)	Tokens de salida	Tokens de razonamiento
OpenAI: GPT-5.4	10.0	10.0	100.0%	0		2.75s	246	0
Qwen: Qwen3 Coder Next	10.0	10.0	100.0%	0		2.64s	255	0

Comparación rápida

Cambiar par de comparación

Mercury 2nonevsQwen3 Coder Nextmedium MiniMax M2.5mediumvsGPT-5.4none Qwen3 Coder NextmediumvsGrok 4.1 Fastnone Kimi K2.5nonevsQwen3 Coder Nextmedium Qwen3 Coder NextmediumvsMiMo-V2-Flashnone Qwen3 Coder NextmediumvsGLM 4.7 Flashnone LFM2-24B-A2BnonevsQwen3 Coder Nextmedium GPT-4o-mininonevsQwen3 Coder Nextmedium Mercury 2mediumvsGPT-5.4none Trinity Large Preview (free)noneDisponible gratisvsQwen3 Coder Nextmedium GPT-5.4nonevsQwen3.5-35B-A3Bmedium GPT-5.4nonevsGLM 4.7 Flashmedium