AI BENCHY Compare

OpenAI: gpt-oss-120b vs xAI: Grok 4.20 Beta

Benchmark-urile au fost generate din suitele de teste AI BENCHY la: 2026-03-12

Metrică	gpt-oss-120b gpt-oss-120b medium Lansare: 2025-08-05 Disponibil gratuit	Grok 4.20 Beta Grok 4.20 Beta none Lansare: 2026-03-12

Metrică	gpt-oss-120b gpt-oss-120b medium Lansare: 2025-08-05 Disponibil gratuit	Grok 4.20 Beta Grok 4.20 Beta none Lansare: 2026-03-12
Rang	#43	#52
Scor mediu	5.1	4.4
Consistență	7.4	9.1
Cost per rezultat	0.135	2.214
Cost total	$0.010	$0.089
Teste corecte
Rată de trecere pe încercare	54.2%	33.3%
Teste instabile	5	2
Rulări totale	48	48
Tokenuri de ieșire	13,210	1,511
Tokenuri de raționament	34,230	0
Timp de răspuns (mediu)	16.65s	1.22s
Timp de răspuns (maxim)	50.92s	6.48s
Timp de răspuns (total)	149.88s	19.53s

Top modele după scor

Scor vs cost total

Timp de răspuns (mediu)

Scor mediu vs Timp de răspuns (mediu)

Total tokenuri de ieșire

Scor mediu vs Total tokenuri de ieșire

Defalcare pe categorii

Trucuri anti-AI	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	7.0	9.8	66.7%	0		19.76s	3,463	2,077
Grok 4.20 Beta	3.3	7.9	22.2%	1		562ms	245	0

Combinat	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	10.0	10.0	100.0%	0		31.18s	694	5,072
Grok 4.20 Beta	10.0	10.0	0.0%	0		6.48s	282	0

Parsare și extragere de date	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	5.5	5.9	66.7%	1		1.98s	241	1,114
Grok 4.20 Beta	9.9	10.0	100.0%	0		601ms	197	0

Specific domeniului	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	10.0	4.4	22.2%	2		50.92s	6,784	20,606
Grok 4.20 Beta	10.0	10.0	0.0%	0		611ms	160	0

Inteligență generală	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	3.0	10.0	0.0%	0		7.90s	107	387
Grok 4.20 Beta	5.0	10.0	0.0%	0		541ms	87	0

Respectarea instrucțiunilor	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	9.5	10.0	100.0%	0		7.63s	126	1,799
Grok 4.20 Beta	4.5	10.0	0.0%	0		687ms	60	0

Puzzle Solving	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	1.7	4.7	22.2%	2		11.80s	1,508	2,092
Grok 4.20 Beta	4.0	7.2	55.6%	1		541ms	291	0

Apelare instrumente	Scor	Consistență	Rată de trecere pe încercare	Teste instabile	Teste corecte	Timp de răspuns (mediu)	Tokenuri de ieșire	Tokenuri de raționament
gpt-oss-120b	9.0	10.0	100.0%	0		6.91s	287	1,083
Grok 4.20 Beta	10.0	10.0	100.0%	0		4.79s	189	0

Comparație rapidă

Schimbă perechea de comparație

gpt-oss-120bmediumDisponibil gratuitvsQwen3.5-122B-A10Bnone Gemini 2.5 Flashnonevsgpt-oss-120bmediumDisponibil gratuit gpt-oss-120bmediumDisponibil gratuitvsQwen3.5-Flashnone Seed-2.0-Litenonevsgpt-oss-120bmediumDisponibil gratuit gpt-oss-120bmediumDisponibil gratuitvsQwen3.5-27Bnone MiniMax M2.5mediumvsGrok 4.20 Betanone gpt-oss-120bmediumDisponibil gratuitvsQwen3.5-35B-A3Bnone DeepSeek V3.2nonevsgpt-oss-120bmediumDisponibil gratuit gpt-oss-120bmediumDisponibil gratuitvsHunter Alphanone Trinity Large PreviewnoneDisponibil gratuitvsgpt-oss-120bmediumDisponibil gratuit Mercury 2mediumvsGrok 4.20 Betanone Qwen3 Coder NextmediumvsGrok 4.20 Betanone