Ranking de modelos de Resolución de acertijos

Mira qué modelos de IA rinden mejor en Resolución de acertijos, cuáles se mantienen fiables y dónde aparecen las mayores diferencias. Ordenar por: Métrica ↑.

Modelos mostrados

Promedio de Puntuación de Resolución de acertijos

6.7

Mejor modelo

Step 3.5 Flash 0.0

Motivos de fallo

Con motivo de fallo Respuesta incorrecta201 Con motivo de fallo No siguió las instrucciones90 Con motivo de fallo Error de API12 Con motivo de fallo Formato extra8 Con motivo de fallo Tiempo agotado5 Con motivo de fallo Sin respuesta3

210/210

Rango	Modelo	Empresa	Puntuación de Resolución de acertijos	Puntuación	Costo total	Pruebas correctas	Tiempo de respuesta (promedio)
#171	North Mini Code none	Cohere	3.5	5.1	$0.000	0/3	24.4s
Pruebas totales 3 Pruebas incorrectas 3 Costo total $0.000 Tiempo de respuesta (promedio) 24.4s
#174	GPT-4o-mini none	OpenAI	3.5	5.0	$0.010	0/3	1.21s
Pruebas totales 3 Pruebas incorrectas 3 Costo total $0.010 Tiempo de respuesta (promedio) 1.21s
#144	KAT-Coder-Air V2.5 high	Kwaipilot	3.5	5.6	$0.077	0/3	2.47s
Pruebas totales 3 Pruebas incorrectas 3 Costo total $0.077 Tiempo de respuesta (promedio) 2.47s
#183	Trinity Large Preview none	Arcee AI	3.6	4.8	$0.008	0/3	1.97s
Pruebas totales 3 Pruebas incorrectas 3 Costo total $0.008 Tiempo de respuesta (promedio) 1.97s
#188	Cobuddy medium	Baidu	3.6	4.7	$0.000	0/3	12.8s
Pruebas totales 3 Pruebas incorrectas 3 Costo total $0.000 Tiempo de respuesta (promedio) 12.8s
#149	KAT-Coder-Air V2.5 medium	Kwaipilot	3.6	5.6	$0.048	0/3	1.87s
Pruebas totales 3 Pruebas incorrectas 3 Costo total $0.048 Tiempo de respuesta (promedio) 1.87s
#127	Qwen3.5-35B-A3B none	Qwen	3.7	6.1	$0.106	0/3	1.35s
Pruebas totales 3 Pruebas incorrectas 3 Costo total $0.106 Tiempo de respuesta (promedio) 1.35s
#142	Qwen3.5-122B-A10B none	Qwen	3.8	5.7	$0.247	0/3	1.00s
Pruebas totales 3 Pruebas incorrectas 3 Costo total $0.247 Tiempo de respuesta (promedio) 1.00s
#210	LFM2-24B-A2B none	Liquid	3.8	2.2	$0.001	0/3	1.78s
Pruebas totales 3 Pruebas incorrectas 3 Costo total $0.001 Tiempo de respuesta (promedio) 1.78s
#111	LongCat 2.0 none	Meituan	4.0	6.3	$0.044	0/3	2.74s
Pruebas totales 3 Pruebas incorrectas 3 Costo total $0.044 Tiempo de respuesta (promedio) 2.74s
#53	GPT-5.4 Nano medium	OpenAI	4.1	7.5	$0.138	0/3	3.79s
Pruebas totales 3 Pruebas incorrectas 3 Costo total $0.138 Tiempo de respuesta (promedio) 3.79s
#193	Elephant Alpha none	Openrouter	4.2	4.3	$0.000	0/3	807ms
Pruebas totales 3 Pruebas incorrectas 3 Costo total $0.000 Tiempo de respuesta (promedio) 807ms
#116	Seed-2.0-Lite none	Bytedance Seed	5.3	6.2	$0.066	1/3	2.78s
Pruebas totales 3 Pruebas incorrectas 2 Costo total $0.066 Tiempo de respuesta (promedio) 2.78s
#121	gpt-oss-120b medium	OpenAI	5.3	6.1	$0.019	1/3	21.7s
Pruebas totales 3 Pruebas incorrectas 2 Costo total $0.019 Tiempo de respuesta (promedio) 21.7s
#146	Owl Alpha medium	Openrouter	5.3	5.6	$0.000	1/3	3.40s
Pruebas totales 3 Pruebas incorrectas 2 Costo total $0.000 Tiempo de respuesta (promedio) 3.40s

Ranking de Resolución de acertijos

Filtrar modelos

Mejores modelos por Puntuación de Resolución de acertijos

Puntuación de Resolución de acertijos vs costo total

Mejores modelos por Tiempo de respuesta (promedio)