Modell-Ranking für Programmierung

AI BENCHY Kategorie

Sieh, welche KI-Modelle bei Programmierung am besten abschneiden, welche zuverlässig bleiben und wo die größten Unterschiede liegen. Sortieren nach: Korrekte Tests ↑.

Angezeigte Modelle

Durchschnittlicher Wert für Programmierung-Score

5.7

Bestes Modell

Qwen3.6 Flash 5.0

Fehlergründe

Mit Fehlergrund Falsche Antwort230 Mit Fehlergrund API-Fehler43 Mit Fehlergrund Zeitüberschreitung25 Mit Fehlergrund Keine Antwort18 Mit Fehlergrund Anweisungen nicht befolgt16 Mit Fehlergrund Zusätzliche Formatierung12

189/189

Rang	Modell	Unternehmen	Programmierung-Score	Punktzahl	Gesamtkosten	Korrekte Tests	Antwortzeit (Durchschnitt)
#60	Qwen3.6 Flash medium	Qwen	5.0	7.5	$0.288	0/3	42.9s
Gesamttests 3 Falsche Tests 3 Gesamtkosten $0.288 Antwortzeit (Durchschnitt) 42.9s
#72	Gemma 4 26B A4B medium	Google	2.9	7.2	$0.045	0/3	272.5s
Gesamttests 3 Falsche Tests 3 Gesamtkosten $0.045 Antwortzeit (Durchschnitt) 272.5s
#74	GLM 5.2 none	Z.ai	3.7	7.1	$0.042	0/3	7.55s
Gesamttests 3 Falsche Tests 3 Gesamtkosten $0.042 Antwortzeit (Durchschnitt) 7.55s
#76	Step 3.7 Flash high	Stepfun	4.0	7.1	$1.148	0/3	206.2s
Gesamttests 3 Falsche Tests 3 Gesamtkosten $1.148 Antwortzeit (Durchschnitt) 206.2s
#77	GLM 5.1 medium	Z.ai	4.6	7.1	$0.288	0/3	109.6s
Gesamttests 3 Falsche Tests 3 Gesamtkosten $0.288 Antwortzeit (Durchschnitt) 109.6s
#84	Qwen3.5-Flash medium	Qwen	3.7	6.8	$0.080	0/3	58.9s
Gesamttests 3 Falsche Tests 3 Gesamtkosten $0.080 Antwortzeit (Durchschnitt) 58.9s
#87	Mimo V2 Omni medium	Xiaomi	3.3	6.8	$0.683	0/3	183.9s
Gesamttests 3 Falsche Tests 3 Gesamtkosten $0.683 Antwortzeit (Durchschnitt) 183.9s
#94	Step 3.5 Flash medium	Stepfun	2.4	6.6	$0.070	0/2	258.4s
Gesamttests 2 Falsche Tests 2 Gesamtkosten $0.070 Antwortzeit (Durchschnitt) 258.4s
#101	Nemotron 3 Super medium	NVIDIA	3.1	6.3	$0.020	0/3	147.3s
Gesamttests 3 Falsche Tests 3 Gesamtkosten $0.020 Antwortzeit (Durchschnitt) 147.3s
#103	Gemma 4 31B medium	Google	4.3	6.3	$0.033	0/3	219.8s
Gesamttests 3 Falsche Tests 3 Gesamtkosten $0.033 Antwortzeit (Durchschnitt) 219.8s
#106	Gemini 3 PRO Preview medium	Google	3.0	6.2	$0.385	0/3	0ms
Gesamttests 3 Falsche Tests 3 Gesamtkosten $0.385 Antwortzeit (Durchschnitt) 0ms
#111	Gemini 3.1 Flash Lite Preview high	Google	0.0	6.1	$2.310	0/0	0ms
Gesamttests 0 Falsche Tests 0 Gesamtkosten $2.310 Antwortzeit (Durchschnitt) 0ms
#116	Qwen3.6 Max Preview none	Qwen	3.8	6.0	$0.075	0/3	3.12s
Gesamttests 3 Falsche Tests 3 Gesamtkosten $0.075 Antwortzeit (Durchschnitt) 3.12s
#118	GLM 5 none	Z.ai	4.0	6.0	$0.027	0/3	5.12s
Gesamttests 3 Falsche Tests 3 Gesamtkosten $0.027 Antwortzeit (Durchschnitt) 5.12s
#123	Qwen3.5 Plus 2026-02-15 none	Qwen	4.3	5.8	$0.016	0/3	2.05s
Gesamttests 3 Falsche Tests 3 Gesamtkosten $0.016 Antwortzeit (Durchschnitt) 2.05s

Programmierung-Ranking

Modelle filtern

Top-Modelle nach Programmierung-Score

Programmierung-Score vs. Gesamtkosten

Top-Modelle nach Antwortzeit (Durchschnitt)