AI BENCHY Compare

Trinity Large Preview vs xAI: Grok 4.20

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-06-03

Metrik	Trinity Large Preview Trinity Large Preview none Veröffentlichung: 2026-01-27	Grok 4.20 Grok 4.20 none Veröffentlichung: 2026-03-31

Metrik	Trinity Large Preview Trinity Large Preview none Veröffentlichung: 2026-01-27	Grok 4.20 Grok 4.20 none Veröffentlichung: 2026-03-31
Punktzahl	4.7	5.4
Rang	#148	#127
Zuverlässigkeit	10.0	k. A.
Konsistenz	9.3	10.0
Korrekte Tests
Erfolgsquote pro Versuch	23.3%	33.3%
Instabile Tests	2	0
Gesamtläufe	60	54
Kosten pro Ergebnis	0.017	1.570
Gesamtkosten	$0.008	$0.057
Eingabepreis	$0.243 / 1M	$1.250 / 1M
Ausgabepreis	$0.243 / 1M	$2.500 / 1M
Gesamte Eingabe-Token	29,828	41,313
Ausgabe-Token	2,169	1,923
Denk-Token	0	0
Antwortzeit (Durchschnitt)	2.98s	1.11s
Antwortzeit (Maximum)	14.34s	6.04s
Antwortzeit (Gesamt)	56.57s	19.96s

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Anti-KI-Tricks	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Trinity Large Preview	3.1	10.0	0.0%	0		2.07s	651	550	0
Grok 4.20	4.8	10.0	25.0%	0		501ms	1,986	267	0

Programmierung	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Trinity Large Preview	4.0	6.6	16.7%	1		14.34s	738	397	0
Grok 4.20	3.4	9.3	0.0%	0		1.22s	1,074	312	0

Kombiniert	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Trinity Large Preview	3.0	10.0	0.0%	0		8.91s	12,053	294	0
Grok 4.20	3.0	10.0	0.0%	0		6.04s	17,673	282	0

Datenanalyse und -extraktion	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Trinity Large Preview	10.0	10.0	100.0%	0		3.26s	6,900	186	0
Grok 4.20	10.0	10.0	100.0%	0		522ms	7,749	207	0

Domänenspezifisch	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Trinity Large Preview	5.3	10.0	33.3%	0		877ms	738	25	0
Grok 4.20	3.0	10.0	0.0%	0		687ms	1,746	325	0

Allgemeine Intelligenz	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Trinity Large Preview	4.5	10.0	0.0%	0		873ms	498	104	0
Grok 4.20	4.8	10.0	0.0%	0		659ms	819	83	0

Befolgung von Anweisungen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Trinity Large Preview	3.5	10.0	0.0%	0		822ms	678	63	0
Grok 4.20	6.3	10.0	50.0%	0		445ms	1,350	60	0

Rätsellösen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Trinity Large Preview	3.6	7.7	11.1%	1		1.97s	669	265	0
Grok 4.20	5.3	10.0	33.3%	0		473ms	1,671	198	0

Werkzeugaufrufe	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Trinity Large Preview	10.0	10.0	100.0%	0		6.67s	6,699	267	0
Grok 4.20	10.0	10.0	100.0%	0		4.63s	7,245	189	0

Allgemeinwissen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Trinity Large Preview	3.0	10.0	0.0%	0		777ms	204	18	0
Grok 4.20	-	-	-	-	-	-	-	-	-

Schnellvergleich

Vergleichspaar wechseln

Trinity Large PreviewnonevsQwen3 Coder Nextmedium MiniMax M2.7mediumvsGrok 4.20none MiniMax M2.5mediumvsGrok 4.20none Mistral Small 4mediumvsGrok 4.20none Elephant AlphamediumvsGrok 4.20none Trinity Large PreviewnonevsGLM 4.7 Flashmedium CobuddymediumvsGrok 4.20none Owl AlphamediumvsGrok 4.20none Trinity Large PreviewnonevsQwen3.5-9Bmedium gpt-oss-120bmediumKostenlos verfügbarvsGrok 4.20none Nemotron 3 SupermediumKostenlos verfügbarvsGrok 4.20none Trinity Large PreviewnonevsElephant Alphamedium