Navigation
Advertise here

Modèles comparés

Comparaison benchmark GLM 5 (medium) vs GLM 5.1 (medium) vs Kimi K2.5 (medium) vs Qwen3.6 Plus Preview (medium): GLM 5 (medium) mène sur Score avec 7.7. GLM 5 (medium) mène sur Fiabilité avec 10.0. Qwen3.6 Plus Preview (medium) a le Coût total le plus bas à $0.000. Qwen3.6 Plus Preview (medium) est le plus rapide à 15.25s.

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-09-10

Modèles comparés

Rang
#92
Total des jetons de sortie
124,566
Temps de réponse (moy.)
33.54s
Coût total
$0.228
Rang
#142
Total des jetons de sortie
215,889
Temps de réponse (moy.)
58.80s
Coût total
$0.727
Rang
#147
Total des jetons de sortie
220,942
Temps de réponse (moy.)
98.19s
Coût total
$0.479
Rang
#280
Total des jetons de sortie
63,350
Temps de réponse (moy.)
15.25s
Coût total
$0.000
Modèle recommandé GLM 5 (medium)

Il obtient le meilleur score ici (7.7) tout en coûtant environ 2.7x moins que les autres modèles de cette comparaison.

Comparaison détaillée

Métrique GLM 5 GLM 5 medium Sortie: 2026-02-12 GLM 5.1 GLM 5.1 medium Sortie: 2026-04-07 Kimi K2.5 Kimi K2.5 medium Sortie: 2026-01-27 Qwen3.6 Plus Preview Qwen3.6 Plus Preview medium Sortie: 2026-04-20 Disponible gratuitement
Score 7.7 7.0 7.0 4.9
Rang #92 #142 #147 #280
Fiabilité 10.0 8.1 10.0 N/D
Cohérence 8.1 8.4 7.0 8.6
Tentatives 63/66 66/66 66/66 57/66
Tests corrects
Taux de réussite par tentative 78.8% 65.2% 63.6% 40.9%
Tests instables 4 4 8 0
Exécutions totales 63 66 66 57
Coût par résultat 1.668 6.923 4.849 0.000
Coût total $0.228 $0.727 $0.479 $0.000
Prix d'entrée $0.600 / 1M $0.966 / 1M $0.450 / 1M $0.000 / 1M
Prix de sortie $1.920 / 1M $3.036 / 1M $2.250 / 1M $0.000 / 1M
Total des jetons d'entrée 35,224 82,592 118,496 32,639
Jetons de sortie 21,570 16,089 53,522 1,153
Jetons de raisonnement 102,996 199,800 167,420 62,197
Temps de réponse (moy.) 33.54s 58.80s 98.19s 15.25s
Temps de réponse (max) 99.85s 308.75s 281.00s 43.55s
Temps de réponse (total) 435.99s 1234.72s 1571.05s 182.96s
Paramètres 744B au total (40B actifs) 744B au total (40B actifs) 1T au total (32B actifs) ~397B au total (~17B actifs)
Disponibilité Open source Open source Poids disponibles Source fermée

Génération showcase de modèles

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#92 GLM 5

medium
Coût
$0.005
Temps
20.7s
Tokens
2,068 tok

#142 GLM 5.1

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Coût
$0.000
Temps
300.0s
Tokens
0 tok

#147 MoonshotAI: Kimi K2.5

medium
Coût
$0.030
Temps
58.6s
Tokens
8,683 tok

#280 Qwen3.6 Plus Preview

medium
Aucun résultat showcase n'a encore été généré pour ce modèle.
Coût
N/D
Temps
-
Tokens
0 tok

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Programmation Score Cohérence Taux de réussite par tentative Tests instables Tests corrects Temps de réponse (moy.) Jetons d'entrée Jetons de sortie Jetons de raisonnement
GLM 5 10.0 10.0 100.0% 0 74.30s 7,254 2,997 52,930
GLM 5.1 4.6 3.7 44.5% 2 109.63s 5,702 4,871 37,826
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
Qwen3.6 Plus Preview 9.8 3.3 0.0% 0 0ms 0 0 0

Comparaison rapide

Changer la paire de comparaison