Navigation
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Modèles comparés

Comparaison benchmark Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium): GPT-5.3-Codex (medium) mène sur Score avec 9.1. Claude Opus 4.6 (medium) mène sur Fiabilité avec 10.0. GPT-5.3-Codex (medium) a le Coût total le plus bas à $1.318. GPT-5.3-Codex (medium) est le plus rapide à 18.87s.

Benchmarks générés à partir des suites de tests AI BENCHY le: 2026-10-06

Modèles comparés

Rang
#228
Total des jetons de sortie
96,722
Temps de réponse (moy.)
32.23s
Coût total
$2.961
Rang
#212
Total des jetons de sortie
120,427
Temps de réponse (moy.)
28.08s
Coût total
$2.126
Rang
#34
Total des jetons de sortie
66,287
Temps de réponse (moy.)
18.87s
Coût total
$1.318
Rang
#71
Total des jetons de sortie
102,691
Temps de réponse (moy.)
22.71s
Coût total
$1.585
Modèle recommandé GPT-5.3-Codex (medium)

Il obtient le meilleur score ici (9.1) tout en coûtant environ 1.7x moins que les autres modèles de cette comparaison.

Comparaison détaillée

Métrique Claude Opus 4.6 Claude Opus 4.6 medium Sortie: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium Sortie: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium Sortie: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Sortie: 2026-02-19
Score 6.3 6.4 9.1 8.4
Rang #228 #212 #34 #71
Fiabilité 10.0 10.0 10.0 9.8
Cohérence 8.5 9.1 8.6 9.6
Tentatives 66/69 66/69 69/69 69/69
Tests corrects
Taux de réussite par tentative 60.9% 62.3% 84.1% 89.9%
Tests instables 3 1 4 1
Exécutions totales 66 66 69 69
Coût par résultat 22.777 15.182 7.753 7.924
Coût total $2.961 $2.126 $1.318 $1.585
Prix d'entrée $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
Prix de sortie $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
Prix de lecture du cache $0.500 / 1M $0.300 / 1M $0.175 / 1M $0.200 / 1M
Prix d’écriture du cache $6.250 / 1M $3.750 / 1M N/D $0.375 / 1M
Total des jetons d'entrée 108,573 106,316 222,794 176,208
Jetons de sortie 69,994 79,338 7,357 6,093
Jetons de raisonnement 26,728 41,089 58,930 96,598
Temps de réponse (moy.) 32.23s 28.08s 18.87s 22.71s
Temps de réponse (max) 151.51s 140.96s 100.93s 88.68s
Temps de réponse (total) 515.65s 421.15s 433.94s 386.11s
Paramètres ~5T au total (~500B actifs) ~1T au total (~100B actifs) ~1.2T au total (~80B actifs) ~1.2T au total (~20B actifs)
Disponibilité Source fermée Source fermée Source fermée Source fermée

Les prix du cache concernent les tokens d’entrée. La lecture réutilise les prompts en cache ; l’écriture les stocke et peut coûter plus cher. Les tokens de sortie utilisent le prix de sortie.

Génération showcase de modèles

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#228 Claude Opus 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Coût
$0.000
Temps
300.0s
Tokens
0 tok

#212 Claude Sonnet 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Coût
$0.000
Temps
300.0s
Tokens
0 tok

#34 GPT-5.3-Codex

medium
Coût
$0.049
Temps
54.9s
Tokens
3,580 tok

#71 Gemini 3.1 Pro Preview

medium
Coût
$0.115
Temps
87.2s
Tokens
9,629 tok

Meilleurs modèles par score

Score vs coût total

Temps de réponse (moy.)

Score vs Temps de réponse (moy.)

Total des jetons de sortie

Score vs Total des jetons de sortie

Répartition par catégorie

Programmation Score Cohérence Taux de réussite par tentative Tests instables Tests corrects Temps de réponse (moy.) Jetons d'entrée Jetons de sortie Jetons de raisonnement
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

Comparaison rapide

Changer la paire de comparaison