AI BENCHY Compare

Inception: Mercury 2 vs xAI: Grok 4.20

Zusammenfassung

Mercury 2 vs Grok 4.20 Benchmark-Vergleich: Mercury 2 führt beim Durchschnittsscore mit 4.6 vs 4.4. Mercury 2 hat die niedrigeren Benchmark-Kosten mit $0.011 vs $0.057. Mercury 2 ist schneller mit 653ms vs 1.11s, mit Erfolgsraten von 23.8% vs 28.6%.

Empfohlenes Modell: Mercury 2 - Es hat hier die beste Punktzahl (4.6) und kostet etwa 5.5x weniger als Grok 4.20.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-06-18

Metrik	Mercury 2 Mercury 2 none Veröffentlichung: 2026-02-24	Grok 4.20 Grok 4.20 none Veröffentlichung: 2026-03-31

Metrik	Mercury 2 Mercury 2 none Veröffentlichung: 2026-02-24	Grok 4.20 Grok 4.20 none Veröffentlichung: 2026-03-31
Punktzahl	4.6	4.4
Rang	#151	#155
Zuverlässigkeit	10.0	k. A.
Konsistenz	9.2	8.5
Korrekte Tests
Erfolgsquote pro Versuch	23.8%	28.6%
Instabile Tests	2	0
Gesamtläufe	63	54
Kosten pro Ergebnis	0.259	1.570
Gesamtkosten	$0.011	$0.057
Eingabepreis	$0.250 / 1M	$1.250 / 1M
Ausgabepreis	$0.750 / 1M	$2.500 / 1M
Gesamte Eingabe-Token	28,113	41,313
Ausgabe-Token	4,439	1,923
Denk-Token	0	0
Antwortzeit (Durchschnitt)	653ms	1.11s
Antwortzeit (Maximum)	1.43s	6.04s
Antwortzeit (Gesamt)	13.72s	19.96s

Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#151 Mercury 2

none

Kosten: $0.002
Zeit: 1.8s
Token: 1,514 tok

#155 xAI: Grok 4.20

none

Kosten: $0.004
Zeit: 6.5s
Token: 1,367 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Anti-KI-Tricks	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Mercury 2	3.0	10.0	0.0%	0		483ms	631	286	0
Grok 4.20	4.8	10.0	25.0%	0		501ms	1,986	267	0

Programmierung	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Mercury 2	3.4	9.6	0.0%	0		1.03s	7,229	3,088	0
Grok 4.20	1.1	3.1	0.0%	0		1.22s	1,074	312	0

Kombiniert	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Mercury 2	3.0	10.0	0.0%	0		606ms	4,821	131	0
Grok 4.20	3.0	10.0	0.0%	0		6.04s	17,673	282	0

Datenanalyse und -extraktion	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Mercury 2	7.3	5.9	83.3%	1		667ms	6,362	180	0
Grok 4.20	10.0	10.0	100.0%	0		522ms	7,749	207	0

Domänenspezifisch	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Mercury 2	5.3	7.2	44.4%	1		534ms	784	46	0
Grok 4.20	3.0	10.0	0.0%	0		687ms	1,746	325	0

Allgemeine Intelligenz	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Mercury 2	4.8	10.0	0.0%	0		628ms	495	159	0
Grok 4.20	4.8	10.0	0.0%	0		659ms	819	83	0

Befolgung von Anweisungen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Mercury 2	6.5	10.0	50.0%	0		551ms	691	82	0
Grok 4.20	6.3	10.0	50.0%	0		445ms	1,350	60	0

Rätsellösen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Mercury 2	3.1	10.0	0.0%	0		535ms	694	251	0
Grok 4.20	5.3	10.0	33.3%	0		473ms	1,671	198	0

Werkzeugaufrufe	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Mercury 2	10.0	10.0	100.0%	0		1.27s	6,193	197	0
Grok 4.20	10.0	10.0	100.0%	0		4.63s	7,245	189	0

Allgemeinwissen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Mercury 2	3.0	10.0	0.0%	0		548ms	213	19	0
Grok 4.20	0.0	0.0	0.0%	0		0ms	0	0	0

Schnellvergleich

Vergleichspaar wechseln

Mercury 2nonevsQwen3 Coder Nextmedium Grok 4.20nonevsGLM 4.7 Flashmedium Mercury 2nonevsMiniMax M2.5medium CobuddymediumvsMercury 2none Qwen3 Coder NextmediumvsGrok 4.20none Mercury 2nonevsGLM 4.7 Flashmedium MiniMax M2.5mediumvsGrok 4.20none Mercury 2nonevsMistral Small 4medium Mercury 2nonevsMiniMax M2.7medium CobuddymediumvsGrok 4.20none Qwen3.5-9BmediumvsGrok 4.20none Mistral Small 4mediumvsGrok 4.20none