AI BENCHY Compare

Laguna M.1 vs xAI: Grok 4.20

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-04-29

Metrik	Laguna M.1 Laguna M.1 none Veröffentlichung: 2026-04-28 Kostenlos verfügbar	Grok 4.20 Grok 4.20 none Veröffentlichung: 2026-03-31

Metrik	Laguna M.1 Laguna M.1 none Veröffentlichung: 2026-04-28 Kostenlos verfügbar	Grok 4.20 Grok 4.20 none Veröffentlichung: 2026-03-31
Punktzahl	5.1	5.2
Rang	#117	#108
Zuverlässigkeit	9.9	k. A.
Konsistenz	8.7	9.5
Korrekte Tests
Erfolgsquote pro Versuch	33.3%	29.6%
Instabile Tests	3	1
Gesamtläufe	54	54
Kosten pro Ergebnis	0.000	1.889
Gesamtkosten	$0.000	$0.095
Eingabepreis	$0.000 / 1M	$2.000 / 1M
Ausgabepreis	$0.000 / 1M	$6.000 / 1M
Ausgabe-Token	2,870	1,967
Denk-Token	0	0
Antwortzeit (Durchschnitt)	2.79s	1.11s
Antwortzeit (Maximum)	15.42s	6.04s
Antwortzeit (Gesamt)	50.24s	20.02s

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Anti-KI-Tricks	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Laguna M.1	3.4	7.9	16.7%	1		1.23s	485	0
Grok 4.20	4.8	10.0	25.0%	0		501ms	267	0

Programmierung	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Laguna M.1	7.5	3.8	66.7%	1		2.93s	543	0
Grok 4.20	3.4	9.3	0.0%	0		1.22s	312	0

Kombiniert	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Laguna M.1	3.0	10.0	0.0%	0		4.32s	622	0
Grok 4.20	3.0	10.0	0.0%	0		6.04s	282	0

Datenanalyse und -extraktion	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Laguna M.1	10.0	10.0	100.0%	0		3.37s	246	0
Grok 4.20	10.0	10.0	100.0%	0		522ms	207	0

Domänenspezifisch	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Laguna M.1	3.6	7.2	22.2%	1		5.50s	33	0
Grok 4.20	3.0	10.0	0.0%	0		687ms	325	0

Allgemeine Intelligenz	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Laguna M.1	4.0	10.0	0.0%	0		3.08s	212	0
Grok 4.20	4.8	10.0	0.0%	0		659ms	83	0

Befolgung von Anweisungen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Laguna M.1	6.3	10.0	50.0%	0		683ms	80	0
Grok 4.20	4.8	10.0	0.0%	0		455ms	60	0

Rätsellösen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Laguna M.1	3.2	10.0	0.0%	0		951ms	340	0
Grok 4.20	5.3	7.4	44.4%	1		487ms	242	0

Werkzeugaufrufe	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Laguna M.1	10.0	10.0	100.0%	0		7.54s	309	0
Grok 4.20	10.0	10.0	100.0%	0		4.63s	189	0

Schnellvergleich

Vergleichspaar wechseln

Nemotron 3 Nano Omni 30b A3b ReasoningmediumKostenlos verfügbarvsGrok 4.20none Elephant AlphamediumvsGrok 4.20none MiniMax M2.7mediumvsGrok 4.20none Nemotron 3 Nano Omni 30b A3b ReasoningmediumKostenlos verfügbarvsLaguna M.1noneKostenlos verfügbar Elephant AlphamediumvsLaguna M.1noneKostenlos verfügbar MiniMax M2.7mediumvsLaguna M.1noneKostenlos verfügbar Laguna M.1noneKostenlos verfügbarvsQwen3 Coder Nextmedium Mistral Small 4mediumvsGrok 4.20none Laguna M.1noneKostenlos verfügbarvsGLM 4.7 Flashmedium MiniMax M2.5mediumKostenlos verfügbarvsGrok 4.20none Qwen3 Coder NextmediumvsGrok 4.20none Mistral Small 4mediumvsLaguna M.1noneKostenlos verfügbar