Navigare
Advertise here

Modele comparate

Comparație benchmark Claude Opus 4.6 (medium) vs Claude Sonnet 4.6 (medium) vs GPT-5.3-Codex (medium) vs Gemini 3.1 Pro Preview (medium): GPT-5.3-Codex (medium) conduce la Scor cu 9.1. Claude Opus 4.6 (medium) conduce la Fiabilitate cu 10.0. GPT-5.3-Codex (medium) are cel mai mic Cost total, $1.318. GPT-5.3-Codex (medium) are cel mai rapid timp de răspuns, 18.87s.

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-10-06

Modele comparate

Rang
#228
Total tokenuri de ieșire
96,722
Timp de răspuns (mediu)
32.23s
Cost total
$2.961
Rang
#212
Total tokenuri de ieșire
120,427
Timp de răspuns (mediu)
28.08s
Cost total
$2.126
Rang
#34
Total tokenuri de ieșire
66,287
Timp de răspuns (mediu)
18.87s
Cost total
$1.318
Rang
#71
Total tokenuri de ieșire
102,691
Timp de răspuns (mediu)
22.71s
Cost total
$1.585
Model recomandat GPT-5.3-Codex (medium)

Are cel mai bun scor aici (9.1) și costă de aproximativ 1.7x mai puțin decât celelalte modele din această comparație.

Comparație detaliată

Metrică Claude Opus 4.6 Claude Opus 4.6 medium Lansare: 2026-02-05 Claude Sonnet 4.6 Claude Sonnet 4.6 medium Lansare: 2026-02-17 GPT-5.3-Codex GPT-5.3-Codex medium Lansare: 2026-02-05 Gemini 3.1 Pro Preview Gemini 3.1 Pro Preview medium Lansare: 2026-02-19
Scor 6.3 6.4 9.1 8.4
Rang #228 #212 #34 #71
Fiabilitate 10.0 10.0 10.0 9.8
Consistență 8.5 9.1 8.6 9.6
Încercări 66/69 66/69 69/69 69/69
Teste corecte
Rată de trecere pe încercare 60.9% 62.3% 84.1% 89.9%
Teste instabile 3 1 4 1
Rulări totale 66 66 69 69
Cost per rezultat 22.777 15.182 7.753 7.924
Cost total $2.961 $2.126 $1.318 $1.585
Preț de intrare $5.000 / 1M $3.000 / 1M $1.750 / 1M $2.000 / 1M
Preț de ieșire $25.000 / 1M $15.000 / 1M $14.000 / 1M $12.000 / 1M
Preț citire cache $0.500 / 1M $0.300 / 1M $0.175 / 1M $0.200 / 1M
Preț scriere cache $6.250 / 1M $3.750 / 1M N/D $0.375 / 1M
Total tokenuri de intrare 108,573 106,316 222,794 176,208
Tokenuri de ieșire 69,994 79,338 7,357 6,093
Tokenuri de raționament 26,728 41,089 58,930 96,598
Timp de răspuns (mediu) 32.23s 28.08s 18.87s 22.71s
Timp de răspuns (maxim) 151.51s 140.96s 100.93s 88.68s
Timp de răspuns (total) 515.65s 421.15s 433.94s 386.11s
Parametri ~5T în total (~500B activi) ~1T în total (~100B activi) ~1.2T în total (~80B activi) ~1.2T în total (~20B activi)
Disponibilitate Închis Închis Închis Închis

Prețurile de cache se aplică tokenurilor de intrare. Citirea reutilizează prompturi salvate; scrierea le stochează și poate costa în plus. Tokenurile de ieșire folosesc prețul de ieșire.

Prezentare generare modele

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#228 Claude Opus 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Cost
$0.000
Timp
300.0s
Tokenuri
0 tok

#212 Claude Sonnet 4.6

medium
Reached the allocated time limit (300 seconds) without receiving showcase output.
Cost
$0.000
Timp
300.0s
Tokenuri
0 tok

#34 GPT-5.3-Codex

medium
Cost
$0.049
Timp
54.9s
Tokenuri
3,580 tok

#71 Gemini 3.1 Pro Preview

medium
Cost
$0.115
Timp
87.2s
Tokenuri
9,629 tok

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Programare Scor Consistență Rată de trecere pe încercare Teste instabile Teste corecte Timp de răspuns (mediu) Tokenuri de intrare Tokenuri de ieșire Tokenuri de raționament
Claude Opus 4.6 5.7 7.1 44.4% 1 30.10s 8,522 13,057 4,121
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
GPT-5.3-Codex 10.0 10.0 100.0% 0 19.50s 7,302 535 10,890
Gemini 3.1 Pro Preview 7.9 9.9 66.7% 0 40.17s 8,124 435 41,247

Comparație rapidă

Schimbă perechea de comparație