Navigation
AI BENCHY
Advertise here

Modèles comparés

Comparaison benchmark Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium): Gemini 3.1 Pro Preview (medium) mène sur Score avec 9.2. Claude Opus 4.6 (medium) mène sur Fiabilité avec 10.0. GPT-5.3-Codex (medium) a le Coût total le plus bas à $0.920. GPT-5.3-Codex (medium) est le plus rapide à 16.96s.

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-08-07

Rang
#60
Total des jetons de sortie
100,601
Temps de réponse (moy.)
34.27s
Coût total
$3.059
Rang
#56
Total des jetons de sortie
115,865
Temps de réponse (moy.)
25.91s
Coût total
$2.057
Rang
#18
Total des jetons de sortie
55,525
Temps de réponse (moy.)
16.96s
Coût total
$0.920
Rang
#9
Total des jetons de sortie
97,958
Temps de réponse (moy.)
21.47s
Coût total
$1.361
Modèle recommandé GPT-5.3-Codex (medium)

Son score reste proche du meilleur score ici (8.9 vs 9.2) tout en coûtant environ 2.3x moins que les autres modèles de cette comparaison.

Comparaison détaillée

Métrique Claude Opus 4.6 Claude Opus 4.6 medium Sortie: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium Sortie: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium Sortie: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Sortie: 2026-02-19
Score 7.7 7.8 8.9 9.2
Rang #60 #56 #18 #9
Fiabilité 10.0 10.0 10.0 10.0
Cohérence 8.8 9.2 8.6 10.0
Couverture du benchmark 22/22 tests · 66/66 tentatives 22/22 tests · 66/66 tentatives 22/22 tests · 66/66 tentatives 22/22 tests · 66/66 tentatives
Tests corrects
Taux de réussite par tentative 63.6% 66.7% 83.3% 90.9%
Tests instables 3 2 4 0
Exécutions totales 66 66 66 66
Coût par résultat 23.524 14.692 5.748 6.801
Coût total $3.059 $2.057 $0.920 $1.361
Prix d'entrée $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
Prix de sortie $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
Total des jetons d'entrée 108,615 106,292 81,268 92,287
Jetons de sortie 72,286 80,748 6,251 5,232
Jetons de raisonnement 28,315 35,117 49,274 92,726
Temps de réponse (moy.) 34.27s 25.91s 16.96s 21.47s
Temps de réponse (max) 151.51s 140.96s 100.93s 88.68s
Temps de réponse (total) 513.99s 362.78s 373.19s 322.08s

Génération showcase de modèles

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 Claude Opus 4.6

medium
SVG invalide
Coût
$0.000
Temps
300.0s
Tokens
0 tok

#56 Claude Sonnet 4.6

medium
SVG invalide
Coût
$0.000
Temps
300.0s
Tokens
0 tok

#18 GPT-5.3-Codex

medium
Coût
$0.049
Temps
54.9s
Tokens
3,580 tok

#9 Gemini 3.1 Pro Preview

medium
Coût
$0.115
Temps
87.2s
Tokens
9,629 tok

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Programmation Score Cohérence Taux de réussite par tentative Tests instables Tests corrects Temps de réponse (moy.) Jetons d'entrée Jetons de sortie Jetons de raisonnement
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

Comparaison rapide

Changer la paire de comparaison