Navigare
AI BENCHY
Advertise here

Modele comparate

Comparație benchmark Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium): Gemini 3.1 Pro Preview (medium) conduce la Scor cu 9.2. Claude Opus 4.6 (medium) conduce la Fiabilitate cu 10.0. GPT-5.3-Codex (medium) are cel mai mic Cost total, $0.920. GPT-5.3-Codex (medium) are cel mai rapid timp de răspuns, 16.96s.

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-08-07

Rang
#60
Total tokenuri de ieșire
100,601
Timp de răspuns (mediu)
34.27s
Cost total
$3.059
Rang
#56
Total tokenuri de ieșire
115,865
Timp de răspuns (mediu)
25.91s
Cost total
$2.057
Rang
#18
Total tokenuri de ieșire
55,525
Timp de răspuns (mediu)
16.96s
Cost total
$0.920
Rang
#9
Total tokenuri de ieșire
97,958
Timp de răspuns (mediu)
21.47s
Cost total
$1.361
Model recomandat GPT-5.3-Codex (medium)

Scorul rămâne aproape de cel mai bun scor de aici (8.9 vs 9.2) și costă de aproximativ 2.3x mai puțin decât celelalte modele din această comparație.

Comparație detaliată

Metrică Claude Opus 4.6 Claude Opus 4.6 medium Lansare: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium Lansare: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium Lansare: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Lansare: 2026-02-19
Scor 7.7 7.8 8.9 9.2
Rang #60 #56 #18 #9
Fiabilitate 10.0 10.0 10.0 10.0
Consistență 8.8 9.2 8.6 10.0
Acoperire benchmark 22/22 teste · 66/66 încercări 22/22 teste · 66/66 încercări 22/22 teste · 66/66 încercări 22/22 teste · 66/66 încercări
Teste corecte
Rată de trecere pe încercare 63.6% 66.7% 83.3% 90.9%
Teste instabile 3 2 4 0
Rulări totale 66 66 66 66
Cost per rezultat 23.524 14.692 5.748 6.801
Cost total $3.059 $2.057 $0.920 $1.361
Preț de intrare $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
Preț de ieșire $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
Total tokenuri de intrare 108,615 106,292 81,268 92,287
Tokenuri de ieșire 72,286 80,748 6,251 5,232
Tokenuri de raționament 28,315 35,117 49,274 92,726
Timp de răspuns (mediu) 34.27s 25.91s 16.96s 21.47s
Timp de răspuns (maxim) 151.51s 140.96s 100.93s 88.68s
Timp de răspuns (total) 513.99s 362.78s 373.19s 322.08s

Prezentare generare modele

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#60 Claude Opus 4.6

medium
SVG invalid
Cost
$0.000
Timp
300.0s
Tokenuri
0 tok

#56 Claude Sonnet 4.6

medium
SVG invalid
Cost
$0.000
Timp
300.0s
Tokenuri
0 tok

#18 GPT-5.3-Codex

medium
Cost
$0.049
Timp
54.9s
Tokenuri
3,580 tok

#9 Gemini 3.1 Pro Preview

medium
Cost
$0.115
Timp
87.2s
Tokenuri
9,629 tok

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Programare Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

Comparație rapidă

Schimbă perechea de comparație