AI BENCHY Compare

Elephant Alpha vs xAI: Grok 4.20

Benchmark zimetengenezwa kutoka seti za majaribio za AI BENCHY tarehe: 2026-05-29

Kipimo	Elephant Alpha Elephant Alpha medium Toleo: 2026-04-14	Grok 4.20 Grok 4.20 none Toleo: 2026-03-31

Kipimo	Elephant Alpha Elephant Alpha medium Toleo: 2026-04-14	Grok 4.20 Grok 4.20 none Toleo: 2026-03-31
Alama	5.4	5.4
Nafasi	#127	#125
Uaminifu	Haipo	Haipo
Uthabiti	9.6	10.0
Majaribio sahihi
Kiwango cha kupita kwa kila jaribio	33.3%	33.3%
Majaribio yasiyo thabiti	1	0
Jumla ya uendeshaji	60	54
Gharama kwa matokeo	0.000	1.570
Jumla ya gharama	$0.000	$0.095
Bei ya ingizo	$0.000 / 1M	$1.250 / 1M
Bei ya toleo	$0.000 / 1M	$2.500 / 1M
Tokeni za matokeo	2,596	1,923
Tokeni za hoja	0	0
Muda wa majibu (wastani)	1.27s	1.11s
Muda wa majibu (upeo)	3.70s	6.04s
Muda wa majibu (jumla)	22.82s	19.96s

Modeli bora kwa alama

Alama dhidi ya gharama ya jumla

Muda wa majibu (wastani)

Alama vs Muda wa majibu (wastani)

Jumla ya tokeni za matokeo

Alama vs Jumla ya tokeni za matokeo

Mgawanyo wa kategoria

Mbinu za kupinga AI	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
Elephant Alpha	6.6	10.0	50.0%	0		1.19s	815	0
Grok 4.20	4.8	10.0	25.0%	0		501ms	267	0

Uandishi wa msimbo	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
Elephant Alpha	4.0	6.7	16.7%	1		1.30s	365	0
Grok 4.20	3.4	9.3	0.0%	0		1.22s	312	0

Mchanganyiko	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
Elephant Alpha	3.0	10.0	0.0%	0		3.70s	562	0
Grok 4.20	3.0	10.0	0.0%	0		6.04s	282	0

Uchanganuzi na uchimbaji wa data	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
Elephant Alpha	6.5	10.0	50.0%	0		979ms	246	0
Grok 4.20	10.0	10.0	100.0%	0		522ms	207	0

Mahususi kwa domeni	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
Elephant Alpha	3.0	10.0	0.0%	0		925ms	24	0
Grok 4.20	3.0	10.0	0.0%	0		687ms	325	0

Akili ya jumla	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
Elephant Alpha	4.3	10.0	0.0%	0		920ms	105	0
Grok 4.20	4.8	10.0	0.0%	0		659ms	83	0

Ufuataji wa maagizo	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
Elephant Alpha	9.8	10.0	100.0%	0		987ms	82	0
Grok 4.20	6.3	10.0	50.0%	0		445ms	60	0

Utatuzi wa mafumbo	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
Elephant Alpha	5.3	10.0	33.3%	0		868ms	166	0
Grok 4.20	5.3	10.0	33.3%	0		473ms	198	0

Mwito wa zana	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
Elephant Alpha	3.0	10.0	0.0%	0		2.83s	231	0
Grok 4.20	10.0	10.0	100.0%	0		4.63s	189	0

Maarifa ya jumla	Alama	Uthabiti	Kiwango cha kupita kwa kila jaribio	Majaribio yasiyo thabiti	Majaribio sahihi	Muda wa majibu (wastani)	Tokeni za matokeo	Tokeni za hoja
Elephant Alpha	0.0	0.0	0.0%	0		0ms	0	0
Grok 4.20	-	-	-	-	-	-	-	-

Ulinganisho wa haraka

Badilisha jozi ya ulinganisho

MiniMax M2.5mediumInapatikana burevsGrok 4.20none Elephant AlphamediumvsQwen3.5-122B-A10Bnone Mistral Small 4mediumvsGrok 4.20none MiniMax M2.7mediumvsGrok 4.20none gpt-oss-120bnoneInapatikana burevsElephant Alphamedium Elephant AlphamediumvsGLM 5 Turbonone Kimi K2.5nonevsElephant Alphamedium Ling-2.6-flashnonevsElephant Alphamedium Elephant AlphamediumvsQwen3.6 Flashnone Elephant AlphamediumvsMiMo-V2.5-Pronone GPT-5.4nonevsElephant Alphamedium Kimi K2.6noneInapatikana burevsElephant Alphamedium