AI BENCHY Compare

OpenAI: GPT-5.4 vs xAI: Grok 4.20

Benchmark zimetengenezwa kutoka seti za majaribio za AI BENCHY tarehe: 2026-04-02

Kipimo	GPT-5.4 GPT-5.4 none Toleo: 2026-03-05	Grok 4.20 Grok 4.20 none Toleo: 2026-03-31

Kipimo	GPT-5.4 GPT-5.4 none Toleo: 2026-03-05	Grok 4.20 Grok 4.20 none Toleo: 2026-03-31
Alama	5.6	5.4
Nafasi	#64	#69
Uthabiti	9.0	9.5
Majaribio sahihi
Kiwango cha kupita kwa kila jaribio	39.2%	31.4%
Majaribio yasiyo thabiti	2	1
Jumla ya uendeshaji	51	51
Gharama kwa matokeo	1.573	1.809
Jumla ya gharama	$0.095	$0.091
Bei ya ingizo	$2.500 / 1M	$2.000 / 1M
Bei ya toleo	$15.000 / 1M	$6.000 / 1M
Tokeni za matokeo	1,837	1,655
Tokeni za hoja	0	0
Muda wa majibu (wastani)	1.43s	1.11s
Muda wa majibu (upeo)	2.89s	6.04s
Muda wa majibu (jumla)	24.27s	18.80s

Modeli bora kwa alama

Alama dhidi ya gharama ya jumla

Muda wa majibu (wastani)

Alama vs Muda wa majibu (wastani)

Jumla ya tokeni za matokeo

Alama vs Jumla ya tokeni za matokeo

Mgawanyo wa kategoria

Mbinu za kupinga AI	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
GPT-5.4	3.2	8.0	8.3%	1		1.21s	406	0
Grok 4.20	4.8	10.0	25.0%	0		501ms	267	0

Mchanganyiko	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
GPT-5.4	3.0	10.0	0.0%	0		2.89s	291	0
Grok 4.20	3.0	10.0	0.0%	0		6.04s	282	0

Uchanganuzi na uchimbaji wa data	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
GPT-5.4	10.0	10.0	100.0%	0		1.04s	222	0
Grok 4.20	10.0	10.0	100.0%	0		522ms	207	0

Mahususi kwa domeni	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
GPT-5.4	5.3	7.2	44.4%	1		1.07s	50	0
Grok 4.20	3.0	10.0	0.0%	0		687ms	325	0

Akili ya jumla	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
GPT-5.4	4.4	9.9	0.0%	0		1.78s	184	0
Grok 4.20	4.8	10.0	0.0%	0		659ms	83	0

Ufuataji wa maagizo	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
GPT-5.4	6.5	10.0	50.0%	0		1.07s	81	0
Grok 4.20	4.8	10.0	0.0%	0		455ms	60	0

Puzzle Solving	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
GPT-5.4	5.6	9.8	33.3%	0		1.52s	357	0
Grok 4.20	5.3	7.4	44.4%	1		487ms	242	0

Mwito wa zana	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
GPT-5.4	10.0	10.0	100.0%	0		2.75s	246	0
Grok 4.20	10.0	10.0	100.0%	0		4.63s	189	0

Ulinganisho wa haraka

Badilisha jozi ya ulinganisho

Mistral Small 4mediumvsGPT-5.4none Mistral Small 4mediumvsGrok 4.20none MiniMax M2.5mediumInapatikana burevsGPT-5.4none MiniMax M2.7mediumvsGrok 4.20none MiniMax M2.5mediumInapatikana burevsGrok 4.20none Qwen3 Coder NextmediumvsGrok 4.20none GPT-5.4nonevsGrok 4.20 Multi Agent Betamedium gpt-oss-120bmediumInapatikana burevsGrok 4.20none MiniMax M2.7mediumvsGPT-5.4none Mercury 2mediumvsGPT-5.4none Grok 4.20nonevsGLM 4.7 Flashmedium GPT-5.4nonevsQwen3 Coder Nextmedium