AI BENCHY Compare

Qwen: Qwen3 Coder Next vs Z.ai: GLM 5.1

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-05-19

Metrik	Qwen3 Coder Next Qwen3 Coder Next none Veröffentlichung: 2026-02-03	GLM 5.1 GLM 5.1 none Veröffentlichung: 2026-04-07

Metrik	Qwen3 Coder Next Qwen3 Coder Next none Veröffentlichung: 2026-02-03	GLM 5.1 GLM 5.1 none Veröffentlichung: 2026-04-07
Punktzahl	5.2	5.7
Rang	#128	#108
Zuverlässigkeit	10.0	10.0
Konsistenz	9.7	8.0
Korrekte Tests
Erfolgsquote pro Versuch	29.8%	42.1%
Instabile Tests	1	5
Gesamtläufe	57	57
Kosten pro Ergebnis	0.151	0.876
Gesamtkosten	$0.008	$0.053
Eingabepreis	$0.110 / 1M	$0.000 / 1M
Ausgabepreis	$0.800 / 1M	$0.000 / 1M
Ausgabe-Token	3,629	3,731
Denk-Token	0	0
Antwortzeit (Durchschnitt)	9.44s	4.23s
Antwortzeit (Maximum)	45.14s	32.57s
Antwortzeit (Gesamt)	122.73s	80.36s

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Anti-KI-Tricks	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3 Coder Next	3.6	10.0	0.0%	0		3.31s	1,321	0
GLM 5.1	4.0	6.3	25.0%	2		2.11s	305	0

Programmierung	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3 Coder Next	7.3	3.7	66.7%	1		3.14s	585	0
GLM 5.1	5.1	9.1	0.0%	0		9.79s	501	0

Kombiniert	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3 Coder Next	3.0	10.0	0.0%	0		45.14s	317	0
GLM 5.1	2.8	2.1	33.3%	1		32.57s	2,129	0

Datenanalyse und -extraktion	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3 Coder Next	6.5	10.0	50.0%	0		1.32s	246	0
GLM 5.1	10.0	10.0	100.0%	0		1.08s	204	0

Domänenspezifisch	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3 Coder Next	5.3	10.0	33.3%	0		962ms	26	0
GLM 5.1	2.9	7.2	11.1%	1		1.99s	24	0

Allgemeine Intelligenz	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3 Coder Next	10.0	10.0	100.0%	0		1.34s	152	0
GLM 5.1	5.0	10.0	0.0%	0		790ms	39	0

Befolgung von Anweisungen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3 Coder Next	6.3	10.0	50.0%	0		7.71s	63	0
GLM 5.1	9.8	10.0	100.0%	0		1.58s	66	0

Rätsellösen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3 Coder Next	3.0	10.0	0.0%	0		22.86s	652	0
GLM 5.1	6.1	7.8	44.4%	1		1.48s	152	0

Werkzeugaufrufe	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3 Coder Next	10.0	10.0	100.0%	0		2.47s	255	0
GLM 5.1	10.0	10.0	100.0%	0		10.68s	300	0

Allgemeinwissen	Punktzahl	Konsistenz	Erfolgsquote pro Versuch	Instabile Tests	Korrekte Tests	Antwortzeit (Durchschnitt)	Ausgabe-Token	Denk-Token
Qwen3 Coder Next	3.0	10.0	0.0%	0		601ms	12	0
GLM 5.1	3.0	10.0	0.0%	0		2.34s	11	0

Schnellvergleich

Vergleichspaar wechseln

gpt-oss-120bmediumKostenlos verfügbarvsGLM 5.1none MiniMax M2.7mediumvsQwen3 Coder Nextnone CobuddymediumKostenlos verfügbarvsGLM 5.1none MiniMax M2.5mediumKostenlos verfügbarvsGLM 5.1none Mistral Small 4mediumvsGLM 5.1none Elephant AlphamediumvsGLM 5.1none Owl AlphamediumvsGLM 5.1none Elephant AlphamediumvsQwen3 Coder Nextnone Mistral Small 4mediumvsQwen3 Coder Nextnone MiniMax M2.5mediumKostenlos verfügbarvsQwen3 Coder Nextnone Nemotron 3 SupermediumKostenlos verfügbarvsGLM 5.1none GPT-5 NanomediumvsGLM 5.1none