Modell-Ranking für Kombiniert

AI BENCHY Kategorie

Sieh, welche KI-Modelle bei Kombiniert am besten abschneiden, welche zuverlässig bleiben und wo die größten Unterschiede liegen. Sortieren nach: Antwortzeit (Durchschnitt) ↑.

Angezeigte Modelle

Durchschnittlicher Wert für Kombiniert-Score

6.3

Bestes Modell

Gemini 3.5 Flash 3.0

Fehlergründe

Mit Fehlergrund Falsche Antwort52 Mit Fehlergrund Ungültiger Werkzeugaufruf19 Mit Fehlergrund API-Fehler13 Mit Fehlergrund Keine Antwort2 Mit Fehlergrund Zeitüberschreitung2 Mit Fehlergrund Anweisungen nicht befolgt1

Rang	Modell	Unternehmen	Kombiniert-Score	Punktzahl	Korrekte Tests	Antwortzeit (Durchschnitt)
#20	Gemini 3.5 Flash none	Google	3.0	8.1	0/1	0ms
#27	Gemma 4 31B medium	Google	3.0	7.8	0/1	0ms
#46	Qwen3.6 35B A3B medium	Qwen	3.0	7.4	0/1	0ms
#83	Step 3.5 Flash none	Stepfun	3.0	6.6	0/1	0ms
#84	Grok 4.20 Multi Agent Beta medium	X AI	3.0	6.6	0/1	0ms
#85	Gemma 4 31B none	Google	3.0	6.5	0/1	0ms
#96	Ring-2.6-1T none	Inclusionai	3.0	6.2	0/1	0ms
#100	Grok Build 0.1 none	X AI	3.0	6.0	0/1	0ms
#126	gpt-oss-120b none	OpenAI	3.0	5.4	0/1	0ms
#149	Nemotron 3 Nano Omni 30b A3b Reasoning medium	NVIDIA	3.0	4.6	0/1	0ms
#153	Qwen3.6 35B A3B none	Qwen	3.0	4.6	0/1	0ms
#160	LFM2-24B-A2B none	Liquid	3.0	4.2	0/1	0ms
#161	Qwen3.5-9B medium	Qwen	3.0	4.2	0/1	0ms
#162	Nemotron 3 Nano Omni 30b A3b Reasoning none	NVIDIA	3.0	4.1	0/1	0ms
#155	Mercury 2 none	Inception	3.0	4.5	0/1	606ms

Kombiniert-Ranking

Top-Modelle nach Kombiniert-Score

Kombiniert-Score vs. Gesamtkosten

Top-Modelle nach Antwortzeit (Durchschnitt)