AI BENCHY Compare

Google: Gemini 3 Flash Preview vs Z.ai: GLM 5 Turbo

Zusammenfassung

Gemini 3 Flash Preview vs GLM 5 Turbo Benchmark-Vergleich: Gemini 3 Flash Preview führt beim Durchschnittsscore mit 9.6 vs 8.4. GLM 5 Turbo hat die niedrigeren Benchmark-Kosten mit $0.323 vs $0.667. Gemini 3 Flash Preview ist schneller mit 18.64s vs 23.00s, mit Erfolgsraten von 98.4% vs 74.6%.

Empfohlenes Modell: Gemini 3 Flash Preview - Es hat die stärkste Punktzahl in diesem Vergleich (9.6) und die beste Gesamtbalance aus Kosten und Antwortzeit über alle 2 Modelle.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-06-12

Metrik	Gemini 3 Flash Preview Gemini 3 Flash Preview medium Veröffentlichung: 2025-12-17	GLM 5 Turbo GLM 5 Turbo medium Veröffentlichung: 2026-03-15

Metrik	Gemini 3 Flash Preview Gemini 3 Flash Preview medium Veröffentlichung: 2025-12-17	GLM 5 Turbo GLM 5 Turbo medium Veröffentlichung: 2026-03-15
Punktzahl	9.6	8.4
Rang	#2	#24
Zuverlässigkeit	10.0	10.0
Konsistenz	9.7	8.5
Korrekte Tests
Erfolgsquote pro Versuch	98.4%	74.6%
Instabile Tests	1	4
Gesamtläufe	63	63
Kosten pro Ergebnis	3.335	2.011
Gesamtkosten	$0.667	$0.323
Eingabepreis	$0.500 / 1M	$1.200 / 1M
Ausgabepreis	$3.000 / 1M	$4.000 / 1M
Gesamte Eingabe-Token	37,017	35,593
Ausgabe-Token	2,006	12,245
Denk-Token	214,153	62,277
Antwortzeit (Durchschnitt)	18.64s	23.00s
Antwortzeit (Maximum)	117.26s	194.23s
Antwortzeit (Gesamt)	391.35s	482.97s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#2 Gemini 3 Flash Preview

medium

Cost: $0.010
Time: 17.9s
Tokens: 3,236 tok

#24 GLM 5 Turbo

medium

Cost: $0.074
Time: 206.0s
Tokens: 18,549 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Anti-KI-Tricks	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		3.88s	494	330	3,216
GLM 5 Turbo	10.0	10.0	100.0%	0		4.82s	555	362	3,137

Programmierung	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemini 3 Flash Preview	8.6	7.6	88.9%	1		84.40s	8,122	462	161,084
GLM 5 Turbo	8.2	9.3	66.7%	0		45.90s	5,941	363	25,381

Kombiniert	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		22.42s	12,873	351	10,485
GLM 5 Turbo	10.0	10.0	100.0%	0		13.88s	12,714	390	2,037

Datenanalyse und -extraktion	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		5.43s	7,548	279	4,893
GLM 5 Turbo	10.0	10.0	100.0%	0		6.19s	7,107	577	3,632

Domänenspezifisch	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		15.27s	633	12	21,684
GLM 5 Turbo	2.9	4.4	22.2%	2		71.07s	489	9,665	19,279

Allgemeine Intelligenz	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		5.19s	486	72	1,905
GLM 5 Turbo	6.1	3.1	66.7%	1		10.05s	477	60	2,216

Befolgung von Anweisungen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		4.04s	615	72	2,709
GLM 5 Turbo	10.0	10.0	100.0%	0		5.38s	636	255	2,183

Rätsellösen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		4.05s	558	183	4,365
GLM 5 Turbo	8.7	7.9	77.8%	1		5.23s	609	312	2,647

Werkzeugaufrufe	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		12.60s	5,532	234	1,487
GLM 5 Turbo	10.0	10.0	100.0%	0		9.84s	6,879	241	446

Allgemeinwissen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Eingabe-Token	Ausgabe-Token	Denk-Token
Gemini 3 Flash Preview	10.0	10.0	100.0%	0		5.50s	156	11	2,325
GLM 5 Turbo	3.0	10.0	0.0%	0		40.17s	186	20	1,319

Schnellvergleich

Vergleichspaar wechseln

GPT-5.2 ChatnonevsGLM 5 Turbomedium DeepSeek V4 FlashhighvsGLM 5 Turbomedium Gemini 3 Flash PreviewmediumvsGPT-5.5low Step 3.7 FlashlowvsGLM 5 Turbomedium Gemini 3.5 FlashlowvsGLM 5 Turbomedium GPT-5.3 ChatnonevsGLM 5 Turbomedium GPT-5.5lowvsGLM 5 Turbomedium Gemini 3 Flash PreviewlowvsGLM 5 Turbomedium Gemini 3 Flash PreviewmediumvsGPT-5.2 Chatnone Claude Sonnet 4.6nonevsGLM 5 Turbomedium Claude Opus 4.8nonevsGLM 5 Turbomedium Qwen3.7 PlusnonevsGLM 5 Turbomedium