AI BENCHY Compare

DeepSeek: DeepSeek V4 Pro vs xAI: Grok Build 0.1

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-05-22

Metrică	DeepSeek V4 Pro DeepSeek V4 Pro none Lansare: 2026-04-24	Grok Build 0.1 Grok Build 0.1 none Lansare: 2026-05-21

Metrică	DeepSeek V4 Pro DeepSeek V4 Pro none Lansare: 2026-04-24	Grok Build 0.1 Grok Build 0.1 none Lansare: 2026-05-21
Scor	6.0	6.6
Rang	#95	#82
Fiabilitate	8.1	10.0
Consistență	8.9	8.0
Teste corecte
Rată de trecere pe încercare	48.3%	60.4%
Teste instabile	3	4
Rulări totale	60	57
Cost per rezultat	0.564	7.805
Cost total	$0.046	$0.547
Preț de intrare	$0.435 / 1M	$1.000 / 1M
Preț de ieșire	$0.870 / 1M	$2.000 / 1M
Tokenuri de ieșire	5,347	267,275
Tokenuri de raționament	0	0
Timp de răspuns (mediu)	13.48s	28.69s
Timp de răspuns (maxim)	58.65s	138.35s
Timp de răspuns (total)	269.56s	459.00s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
DeepSeek V4 Pro	3.5	8.0	16.7%	1		14.02s	704	0
Grok Build 0.1	8.7	7.9	91.7%	1		6.30s	11,162	0

Programare	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
DeepSeek V4 Pro	5.4	6.8	33.3%	1		8.27s	527	0
Grok Build 0.1	10.0	10.0	100.0%	0		21.41s	16,568	0

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
DeepSeek V4 Pro	9.5	10.0	100.0%	0		25.49s	1,911	0
Grok Build 0.1	0.0	0.0	0.0%	0		0ms	0	0

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
DeepSeek V4 Pro	8.8	10.0	100.0%	0		30.54s	170	0
Grok Build 0.1	4.7	1.6	66.7%	1		9.33s	6,359	0

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
DeepSeek V4 Pro	5.3	10.0	33.3%	0		3.17s	18	0
Grok Build 0.1	3.6	7.2	22.2%	1		103.71s	179,469	0

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
DeepSeek V4 Pro	4.3	9.9	0.0%	0		3.75s	132	0
Grok Build 0.1	4.3	10.0	0.0%	0		12.47s	6,647	0

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
DeepSeek V4 Pro	6.3	10.0	50.0%	0		8.23s	64	0
Grok Build 0.1	9.8	10.0	100.0%	0		7.36s	8,970	0

Rezolvare de puzzle-uri	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
DeepSeek V4 Pro	7.6	7.2	77.8%	1		19.72s	175	0
Grok Build 0.1	6.4	7.7	55.6%	1		9.55s	14,982	0

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
DeepSeek V4 Pro	10.0	10.0	100.0%	0		5.92s	219	0
Grok Build 0.1	0.0	0.0	0.0%	0		0ms	0	0

Cultură generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
DeepSeek V4 Pro	3.0	10.0	0.0%	0		15.59s	1,427	0
Grok Build 0.1	3.0	10.0	0.0%	0		36.09s	23,118	0

Comparație rapidă

Schimbă perechea de comparație

Qwen3.6 27BmediumvsGrok Build 0.1none DeepSeek V4 ProhighvsGrok Build 0.1none Kimi K2.5mediumvsGrok Build 0.1none Gemini 3.1 Flash LiteminimalvsGrok Build 0.1none DeepSeek V4 PrononevsGPT-5 Nanomedium DeepSeek V4 PrononevsNemotron 3 SupermediumDisponibil gratuit DeepSeek V4 PrononevsOwl Alphamedium DeepSeek V4 PrononevsMercury 2medium CobuddymediumDisponibil gratuitvsDeepSeek V4 Pronone GPT-5 MinimediumvsGrok Build 0.1none Grok Build 0.1nonevsMiMo-V2-Omnimedium Mercury 2mediumvsGrok Build 0.1none