AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.3 Chat

Rezumat

Comparație benchmark Claude Opus 4.8 vs GPT-5.3 Chat: Claude Opus 4.8 conduce la scorul mediu cu 8.8 vs 7.5. GPT-5.3 Chat are costul de benchmark mai mic, $0.433 vs $1.107. GPT-5.3 Chat este mai rapid cu 6.34s vs 9.66s, cu rate de reușită de 84.1% vs 66.7%.

Model recomandat: GPT-5.3 Chat - Oferă cel mai bun compromis per total: scor competitiv (7.5), cost mai mic decât Claude Opus 4.8 și timp de răspuns echilibrat.

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-06-18

Metrică	Claude Opus 4.8 Claude Opus 4.8 medium Lansare: 2026-05-28	GPT-5.3 Chat GPT-5.3 Chat none Lansare: 2026-03-03

Metrică	Claude Opus 4.8 Claude Opus 4.8 medium Lansare: 2026-05-28	GPT-5.3 Chat GPT-5.3 Chat none Lansare: 2026-03-03
Scor	8.8	7.5
Rang	#12	#45
Fiabilitate	10.0	10.0
Consistență	9.6	8.1
Teste corecte
Rată de trecere pe încercare	84.1%	66.7%
Teste instabile	1	5
Rulări totale	63	63
Cost per rezultat	6.512	3.605
Cost total	$1.107	$0.433
Preț de intrare	$5.000 / 1M	$1.750 / 1M
Preț de ieșire	$25.000 / 1M	$14.000 / 1M
Total tokenuri de intrare	61,007	34,209
Tokenuri de ieșire	26,495	26,617
Tokenuri de raționament	5,901	0
Timp de răspuns (mediu)	9.66s	6.34s
Timp de răspuns (maxim)	38.03s	18.33s
Timp de răspuns (total)	202.89s	133.13s

Prezentare generare

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#12 Claude Opus 4.8

medium

Cost: $0.057
Timp: 23.1s
Tokenuri: 2,412 tok

#45 GPT-5.3 Chat

none

Cost: $0.008
Timp: 8.1s
Tokenuri: 634 tok

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	834	1,179	478
GPT-5.3 Chat	6.7	8.1	58.3%	1		3.86s	606	3,167	0

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	10.0	10.0	100.0%	0		15.33s	10,590	9,945	1,381
GPT-5.3 Chat	5.6	4.7	55.6%	2		10.52s	7,302	6,632	0

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	9.8	10.0	100.0%	0		38.03s	23,561	5,260	1,588
GPT-5.3 Chat	10.0	10.0	100.0%	0		11.96s	11,019	2,614	0

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	7.1	5.6	83.3%	1		12.29s	10,503	481	312
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.21s	7,140	942	0

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	5.3	10.0	33.3%	0		14.15s	975	7,477	900
GPT-5.3 Chat	3.5	4.4	33.3%	2		13.01s	723	8,264	0

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	10.0	10.0	100.0%	0		2.46s	708	237	0
GPT-5.3 Chat	4.6	10.0	0.0%	0		1.99s	477	319	0

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	10.0	10.0	100.0%	0		3.32s	909	373	320
GPT-5.3 Chat	9.8	10.0	100.0%	0		3.51s	660	1,491	0

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	10.0	10.0	100.0%	0		3.95s	894	791	483
GPT-5.3 Chat	10.0	10.0	100.0%	0		2.99s	642	1,758	0

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	10.0	10.0	100.0%	0		8.96s	11,775	301	225
GPT-5.3 Chat	10.0	10.0	100.0%	0		8.36s	5,445	861	0

Cultură generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de intrare	Tokenuri de ieșire	Tokenuri de raționament
Claude Opus 4.8	3.0	10.0	0.0%	0		6.14s	258	451	214
GPT-5.3 Chat	3.0	10.0	0.0%	0		4.38s	195	569	0

Comparație rapidă

Schimbă perechea de comparație

Mercury 2mediumvsGPT-5.3 Chatnone Kimi K2.5mediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsQwen3.6 Flashmedium DeepSeek V3.2mediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsGrok Build 0.1medium DeepSeek V4 ProhighvsGPT-5.3 Chatnone Seed-2.0-MinimediumvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsMiMo-V2.5-Promedium MiniMax M3mediumvsGPT-5.3 Chatnone Gemini 3 Flash PreviewlowvsGPT-5.3 Chatnone GPT-5.3 ChatnonevsGrok 4.20medium GPT-5.3 ChatnonevsStep 3.7 Flashlow