Navigation
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (low) vs Grok 4.20 (medium)

Der Durchschnittsscore ist mit 6.3 vs 6.3 praktisch gleichauf. Trinity Large Thinking (low) hat die niedrigeren Benchmark-Kosten mit $0.700 vs $1.582. Grok 4.20 (medium) ist schneller mit 36.73s vs 95.16s, mit Erfolgsraten von 47.8% vs 58.0%.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-10-01

Verglichene Modelle

Rang
#222
Gesamte Ausgabe-Token
842,200
Antwortzeit (Durchschnitt)
95.16s
Gesamtkosten
$0.700
Rang
#224
Gesamte Ausgabe-Token
302,087
Antwortzeit (Durchschnitt)
36.73s
Gesamtkosten
$1.582
Empfohlenes Modell Trinity Large Thinking (low)

Es hat hier die beste Punktzahl (6.3) und kostet etwa 2.3x weniger als Grok 4.20 (medium).

Detaillierter Vergleich

Metrik Trinity Large Thinking Trinity Large Thinking low Veröffentlichung: 2026-07-28 Grok 4.20 Grok 4.20 medium Veröffentlichung: 2026-03-31
Punktzahl 6.3 6.3
Rang #222 #224
Zuverlässigkeit 10.0 10.0
Konsistenz 8.1 8.2
Versuche 69/69 69/69
Korrekte Tests
Erfolgsquote pro Versuch 47.8% 58.0%
Instabile Tests 6 5
Gesamtläufe 69 69
Kosten pro Ergebnis 9.163 14.374
Gesamtkosten $0.700 $1.582
Eingabepreis $0.250 / 1M $1.250 / 1M
Ausgabepreis $0.800 / 1M $2.500 / 1M
Gesamte Eingabe-Token 347,980 392,127
Ausgabe-Token 121,898 7,754
Denk-Token 720,302 294,333
Antwortzeit (Durchschnitt) 95.16s 36.73s
Antwortzeit (Maximum) 540.96s 199.66s
Antwortzeit (Gesamt) 2188.74s 844.68s
Parameter 398B insgesamt (13B aktiv) ~1T insgesamt (~100B aktiv)
Verfügbarkeit Gewichte verfügbar Geschlossen

Modell-Generierungs-Showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#222 Trinity Large Thinking

low
Kosten
$0.021
Zeit
173.2s
Token
24,586 tok

#224 SpaceXAI: Grok 4.20

medium
Kosten
$0.041
Zeit
110.3s
Token
16,336 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Trinity Large Thinking 5.3 10.0 33.3% 0 344.45s 5,441 27,039 217,241
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150

Schnellvergleich

Vergleichspaar wechseln