AI BENCHY Compare

Google: Gemma 4 26B A4B vs Inception: Mercury 2

Zusammenfassung

Gemma 4 26B A4B vs Mercury 2 Benchmark-Vergleich: Gemma 4 26B A4B führt beim Durchschnittsscore mit 5.5 vs 4.6. Gemma 4 26B A4B hat die niedrigeren Benchmark-Kosten mit $0.004 vs $0.011. Mercury 2 ist schneller mit 653ms vs 5.91s, mit Erfolgsraten von 44.4% vs 23.8%.

Empfohlenes Modell: Gemma 4 26B A4B - Es hat hier die beste Punktzahl (5.5) und kostet etwa 3.4x weniger als Mercury 2.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-06-18

Metrik	Gemma 4 26B A4B Gemma 4 26B A4B none Veröffentlichung: 2026-04-03 Kostenlos verfügbar	Mercury 2 Mercury 2 none Veröffentlichung: 2026-02-24

Metrik	Gemma 4 26B A4B Gemma 4 26B A4B none Veröffentlichung: 2026-04-03 Kostenlos verfügbar	Mercury 2 Mercury 2 none Veröffentlichung: 2026-02-24
Punktzahl	5.5	4.6
Rang	#121	#151
Zuverlässigkeit	10.0	10.0
Konsistenz	9.2	9.2
Korrekte Tests
Erfolgsquote pro Versuch	44.4%	23.8%
Instabile Tests	2	2
Gesamtläufe	63	63
Kosten pro Ergebnis	0.068	0.259
Gesamtkosten	$0.004	$0.011
Eingabepreis	$0.060 / 1M	$0.250 / 1M
Ausgabepreis	$0.330 / 1M	$0.750 / 1M
Gesamte Eingabe-Token	40,038	28,113
Ausgabe-Token	1,824	4,439
Denk-Token	0	0
Antwortzeit (Durchschnitt)	5.91s	653ms
Antwortzeit (Maximum)	57.10s	1.43s
Antwortzeit (Gesamt)	124.05s	13.72s

Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#121 Gemma 4 26B A4B

none

Kosten: $0.001
Zeit: 39.5s
Token: 790 tok

#151 Mercury 2

none

Kosten: $0.002
Zeit: 1.8s
Token: 1,514 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Anti-KI-Tricks	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemma 4 26B A4B	8.3	10.0	75.0%	0		1.28s	852	230	0
Mercury 2	3.0	10.0	0.0%	0		483ms	631	286	0

Programmierung	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemma 4 26B A4B	3.7	7.2	22.2%	1		4.16s	7,736	476	0
Mercury 2	3.4	9.6	0.0%	0		1.03s	7,229	3,088	0

Kombiniert	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemma 4 26B A4B	3.0	10.0	0.0%	0		30.53s	13,650	309	0
Mercury 2	3.0	10.0	0.0%	0		606ms	4,821	131	0

Datenanalyse und -extraktion	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemma 4 26B A4B	10.0	10.0	100.0%	0		1.70s	8,352	285	0
Mercury 2	7.3	5.9	83.3%	1		667ms	6,362	180	0

Domänenspezifisch	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemma 4 26B A4B	3.6	7.2	22.2%	1		2.49s	903	27	0
Mercury 2	5.3	7.2	44.4%	1		534ms	784	46	0

Allgemeine Intelligenz	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemma 4 26B A4B	4.0	10.0	0.0%	0		3.54s	576	85	0
Mercury 2	4.8	10.0	0.0%	0		628ms	495	159	0

Befolgung von Anweisungen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemma 4 26B A4B	6.3	10.0	50.0%	0		690ms	795	75	0
Mercury 2	6.5	10.0	50.0%	0		551ms	691	82	0

Rätsellösen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemma 4 26B A4B	6.2	10.0	33.3%	0		744ms	828	114	0
Mercury 2	3.1	10.0	0.0%	0		535ms	694	251	0

Werkzeugaufrufe	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemma 4 26B A4B	10.0	10.0	100.0%	0		57.10s	6,123	210	0
Mercury 2	10.0	10.0	100.0%	0		1.27s	6,193	197	0

Allgemeinwissen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemma 4 26B A4B	3.0	10.0	0.0%	0		778ms	223	13	0
Mercury 2	3.0	10.0	0.0%	0		548ms	213	19	0

Schnellvergleich

Vergleichspaar wechseln

Mercury 2nonevsQwen3 Coder Nextmedium Mercury 2nonevsMiniMax M2.5medium Gemma 4 26B A4BnoneKostenlos verfügbarvsMiniMax M2.7medium CobuddymediumvsMercury 2none Mercury 2nonevsGLM 4.7 Flashmedium North Mini CodemediumKostenlos verfügbarvsGemma 4 26B A4BnoneKostenlos verfügbar Gemma 4 26B A4BnoneKostenlos verfügbarvsMistral Small 4medium Mercury 2nonevsMistral Small 4medium CobuddymediumvsGemma 4 26B A4BnoneKostenlos verfügbar Mercury 2nonevsMiniMax M2.7medium Gemma 4 26B A4BnoneKostenlos verfügbarvsMiniMax M2.5medium Gemma 4 26B A4BnoneKostenlos verfügbarvsQwen3 Coder Nextmedium