Navigation
AI BENCHY
Advertise here

Modèles comparés

Comparaison benchmark Kimi K2.6 (medium) vs Kimi K2.5 (medium) vs GLM 5 (medium) vs Claude Opus 4.7 (medium): Claude Opus 4.7 (medium) mène sur Score avec 8.7. Kimi K2.5 (medium) mène sur Fiabilité avec 10.0. GLM 5 (medium) a le Coût total le plus bas à $0.307. Claude Opus 4.7 (medium) est le plus rapide à 7.61s.

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-07-28

Rang
#78
Total des jetons de sortie
391,540
Temps de réponse (moy.)
109.98s
Coût total
$0.831
Rang
#87
Total des jetons de sortie
227,367
Temps de réponse (moy.)
99.00s
Coût total
$0.600
Rang
#50
Total des jetons de sortie
124,566
Temps de réponse (moy.)
33.54s
Coût total
$0.307
Rang
#20
Total des jetons de sortie
29,990
Temps de réponse (moy.)
7.61s
Coût total
$1.477
Modèle recommandé Claude Opus 4.7 (medium)

Il obtient le meilleur score ici (8.7) et répond environ 10.6x plus vite que les autres modèles de cette comparaison.

Comparaison détaillée

Métrique Kimi K2.6 Kimi K2.6 medium Sortie: 2026-04-20 Kimi K2.5 Kimi K2.5 medium Sortie: 2026-01-27 GLM 5 GLM 5 medium Sortie: 2026-02-12 Claude Opus 4.7 Claude Opus 4.7 medium Sortie: 2026-04-16
Score 7.2 7.0 7.7 8.7
Rang #78 #87 #50 #20
Fiabilité 9.4 10.0 10.0 10.0
Cohérence 8.3 7.0 8.1 9.6
Tests corrects
Taux de réussite par tentative 63.6% 65.2% 78.8% 83.3%
Tests instables 4 8 4 1
Exécutions totales 66 66 63 66
Coût par résultat 9.821 4.789 1.668 8.201
Coût total $0.831 $0.600 $0.307 $1.477
Prix d'entrée $0.646 / 1M $0.571 / 1M $0.950 / 1M $5.000 / 1M
Prix de sortie $2.720 / 1M $2.850 / 1M $2.551 / 1M $25.000 / 1M
Total des jetons d'entrée 68,902 118,448 35,224 145,252
Jetons de sortie 111,680 62,124 21,570 24,948
Jetons de raisonnement 279,860 165,243 102,996 5,042
Temps de réponse (moy.) 109.98s 99.00s 33.54s 7.61s
Temps de réponse (max) 876.20s 281.00s 99.85s 65.40s
Temps de réponse (total) 2309.56s 1485.04s 435.99s 159.91s

Génération showcase de modèles

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#78 MoonshotAI: Kimi K2.6

medium
Coût
$0.013
Temps
103.4s
Tokens
3,620 tok

#87 MoonshotAI: Kimi K2.5

medium
Coût
$0.030
Temps
58.6s
Tokens
8,683 tok

#50 GLM 5

medium
Coût
$0.005
Temps
20.7s
Tokens
2,068 tok

#20 Claude Opus 4.7

medium
Coût
$0.059
Temps
26.8s
Tokens
2,475 tok

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Programmation Score Cohérence Taux de réussite par tentative Tests instables Tests corrects Temps de réponse (moy.) Jetons d'entrée Jetons de sortie Jetons de raisonnement
Kimi K2.6 5.7 8.6 33.3% 0 214.42s 2,925 9,970 77,189
Kimi K2.5 6.1 4.6 66.7% 2 217.49s 6,935 5,705 74,693
GLM 5 10.0 10.0 100.0% 0 74.30s 7,254 2,997 52,930
Claude Opus 4.7 7.6 7.2 77.8% 1 12.96s 10,635 7,629 1,114

Comparaison rapide

Changer la paire de comparaison