Navigation
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Modèles comparés

Comparaison benchmark Claude Sonnet 4.6 (medium) vs Claude Sonnet 5 (medium) vs Claude Opus 4.8 (medium) vs GLM 5.2 (medium): Claude Opus 4.8 (medium) mène sur Score avec 8.8. Claude Sonnet 4.6 (medium) mène sur Fiabilité avec 10.0. GLM 5.2 (medium) a le Coût total le plus bas à $0.146. Claude Sonnet 5 (medium) est le plus rapide à 12.54s.

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-08-14

Rang
#65
Total des jetons de sortie
120,427
Temps de réponse (moy.)
28.08s
Coût total
$2.126
Rang
#46
Total des jetons de sortie
63,204
Temps de réponse (moy.)
12.54s
Coût total
$0.922
Rang
#26
Total des jetons de sortie
51,927
Temps de réponse (moy.)
12.97s
Coût total
$1.983
Rang
#63
Total des jetons de sortie
61,761
Temps de réponse (moy.)
23.28s
Coût total
$0.146
Modèle recommandé GLM 5.2 (medium)

Il offre le meilleur compromis global: score compétitif (7.8), coût inférieur à les autres modèles de cette comparaison et temps de réponse équilibré.

Comparaison détaillée

Métrique Claude Sonnet 4.6 Claude Sonnet 4.6 medium Sortie: 2026-02-17 Claude Sonnet 5 Claude Sonnet 5 medium Sortie: 2026-06-30 Claude Opus 4.8 Claude Opus 4.8 medium Sortie: 2026-05-28 GLM 5.2 GLM 5.2 medium Sortie: 2026-06-17
Score 7.8 8.2 8.8 7.8
Rang #65 #46 #26 #63
Fiabilité 10.0 10.0 10.0 9.5
Cohérence 9.5 9.0 9.2 8.0
Tentatives 66/66 66/66 66/66 63/66
Tests corrects
Taux de réussite par tentative 65.2% 75.8% 83.3% 80.3%
Tests instables 1 3 2 4
Exécutions totales 66 66 66 63
Coût par résultat 15.182 6.144 11.662 2.159
Coût total $2.126 $0.922 $1.983 $0.146
Prix d'entrée $3.000 / 1M $2.000 / 1M $5.000 / 1M $0.630 / 1M
Prix de sortie $15.000 / 1M $10.000 / 1M $25.000 / 1M $1.981 / 1M
Total des jetons d'entrée 106,316 145,953 138,448 37,199
Jetons de sortie 79,338 52,330 40,765 12,261
Jetons de raisonnement 41,089 10,874 11,162 49,500
Temps de réponse (moy.) 28.08s 12.54s 12.97s 23.28s
Temps de réponse (max) 140.96s 66.71s 70.54s 101.36s
Temps de réponse (total) 421.15s 275.90s 285.29s 488.94s
Paramètres ~1T au total (~100B actifs) ~1T au total (~100B actifs) ~5T au total (~500B actifs) 744B au total (40B actifs)
Disponibilité Source fermée Source fermée Source fermée Open source

Génération showcase de modèles

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#65 Claude Sonnet 4.6

medium
SVG invalide
Coût
$0.000
Temps
300.0s
Tokens
0 tok

#46 Claude Sonnet 5

medium
Coût
$0.007
Temps
6.4s
Tokens
832 tok

#26 Claude Opus 4.8

medium
Coût
$0.057
Temps
23.1s
Tokens
2,412 tok

#63 GLM 5.2

medium
Coût
$0.041
Temps
195.8s
Tokens
9,287 tok

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Programmation Score Cohérence Taux de réussite par tentative Tests instables Tests corrects Temps de réponse (moy.) Jetons d'entrée Jetons de sortie Jetons de raisonnement
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
Claude Sonnet 5 9.0 7.9 88.9% 1 17.28s 10,590 13,153 2,379
Claude Opus 4.8 10.0 10.0 100.0% 0 15.33s 10,590 9,945 1,381
GLM 5.2 8.2 7.2 88.9% 1 40.96s 7,317 1,475 17,123

Comparaison rapide

Changer la paire de comparaison