AI BENCHY Compare

Trinity Large Preview vs xAI: Grok 4.20

Benchmark dihasilkan dari suite pengujian AI BENCHY pada: 2026-06-03

Metrik	Trinity Large Preview Trinity Large Preview none Rilis: 2026-01-27	Grok 4.20 Grok 4.20 none Rilis: 2026-03-31

Metrik	Trinity Large Preview Trinity Large Preview none Rilis: 2026-01-27	Grok 4.20 Grok 4.20 none Rilis: 2026-03-31
Skor	4.7	5.4
Peringkat	#148	#127
Keandalan	10.0	T/A
Konsistensi	9.3	10.0
Tes benar
Tingkat lulus per percobaan	23.3%	33.3%
Tes tidak stabil	2	0
Total Run	60	54
Biaya per hasil	0.017	1.570
Total Biaya	$0.008	$0.057
Harga input	$0.243 / 1M	$1.250 / 1M
Harga output	$0.243 / 1M	$2.500 / 1M
Total token input	29,828	41,313
Token output	2,169	1,923
Token penalaran	0	0
Waktu respons (rata-rata)	2.98s	1.11s
Waktu respons (maks)	14.34s	6.04s
Waktu respons (total)	56.57s	19.96s

Model teratas berdasarkan skor

Skor vs Total Biaya

Waktu respons (rata-rata)

Skor vs Waktu respons (rata-rata)

Total token output

Skor vs Total token output

Rincian Kategori

Trik anti-AI	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Trinity Large Preview	3.1	10.0	0.0%	0		2.07s	651	550	0
Grok 4.20	4.8	10.0	25.0%	0		501ms	1,986	267	0

Pemrograman	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Trinity Large Preview	4.0	6.6	16.7%	1		14.34s	738	397	0
Grok 4.20	3.4	9.3	0.0%	0		1.22s	1,074	312	0

Gabungan	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Trinity Large Preview	3.0	10.0	0.0%	0		8.91s	12,053	294	0
Grok 4.20	3.0	10.0	0.0%	0		6.04s	17,673	282	0

Parsing dan ekstraksi data	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Trinity Large Preview	10.0	10.0	100.0%	0		3.26s	6,900	186	0
Grok 4.20	10.0	10.0	100.0%	0		522ms	7,749	207	0

Spesifik domain	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Trinity Large Preview	5.3	10.0	33.3%	0		877ms	738	25	0
Grok 4.20	3.0	10.0	0.0%	0		687ms	1,746	325	0

Kecerdasan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Trinity Large Preview	4.5	10.0	0.0%	0		873ms	498	104	0
Grok 4.20	4.8	10.0	0.0%	0		659ms	819	83	0

Kepatuhan instruksi	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Trinity Large Preview	3.5	10.0	0.0%	0		822ms	678	63	0
Grok 4.20	6.3	10.0	50.0%	0		445ms	1,350	60	0

Pemecahan teka-teki	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Trinity Large Preview	3.6	7.7	11.1%	1		1.97s	669	265	0
Grok 4.20	5.3	10.0	33.3%	0		473ms	1,671	198	0

Pemanggilan alat	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Trinity Large Preview	10.0	10.0	100.0%	0		6.67s	6,699	267	0
Grok 4.20	10.0	10.0	100.0%	0		4.63s	7,245	189	0

Pengetahuan umum	Skor	Konsistensi	Tingkat lulus per percobaan	Tes tidak stabil	Tes benar	Waktu respons (rata-rata)	Token input	Token output	Token penalaran
Trinity Large Preview	3.0	10.0	0.0%	0		777ms	204	18	0
Grok 4.20	-	-	-	-	-	-	-	-	-

Perbandingan Cepat

Ganti Pasangan Perbandingan

Trinity Large PreviewnonevsQwen3 Coder Nextmedium MiniMax M2.7mediumvsGrok 4.20none MiniMax M2.5mediumvsGrok 4.20none Mistral Small 4mediumvsGrok 4.20none Elephant AlphamediumvsGrok 4.20none Trinity Large PreviewnonevsGLM 4.7 Flashmedium CobuddymediumvsGrok 4.20none Owl AlphamediumvsGrok 4.20none Trinity Large PreviewnonevsQwen3.5-9Bmedium gpt-oss-120bmediumTersedia gratisvsGrok 4.20none Nemotron 3 SupermediumTersedia gratisvsGrok 4.20none Trinity Large PreviewnonevsElephant Alphamedium