- Rang
- #222
- Gesamte Ausgabe-Token
- 842,200
- Antwortzeit (Durchschnitt)
- 95.16s
- Gesamtkosten
- $0.700
Trinity Large Thinking (low) vs DeepSeek V4 Flash 0731
Trinity Large Thinking (low) führt beim Durchschnittsscore mit 6.3 vs 6.2. DeepSeek V4 Flash 0731 hat die niedrigeren Benchmark-Kosten mit $0.055 vs $0.700. DeepSeek V4 Flash 0731 ist schneller mit 27.42s vs 95.16s, mit Erfolgsraten von 47.8% vs 30.4%.
Verglichene Modelle
- Rang
- #228
- Gesamte Ausgabe-Token
- 39,789
- Antwortzeit (Durchschnitt)
- 27.42s
- Gesamtkosten
- $0.055
Empfohlenes Modell
DeepSeek V4 Flash 0731
Die Punktzahl bleibt nah an der besten hier (6.2 vs 6.3) und es kostet etwa 12.9x weniger als Trinity Large Thinking (low).
Detaillierter Vergleich
| Metrik | Trinity Large Thinking Trinity Large Thinking low | DeepSeek V4 Flash 0731 DeepSeek V4 Flash 0731 none |
|---|---|---|
| Punktzahl | 6.3 | 6.2 |
| Rang | #222 | #228 |
| Zuverlässigkeit | 10.0 | 10.0 |
| Konsistenz | 8.1 | 8.7 |
| Versuche | 69/69 | 69/69 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 47.8% | 30.4% |
| Instabile Tests | 6 | 4 |
| Gesamtläufe | 69 | 69 |
| Kosten pro Ergebnis | 9.163 | 0.826 |
| Gesamtkosten | $0.700 | $0.055 |
| Eingabepreis | $0.250 / 1M | $0.010 / 1M |
| Ausgabepreis | $0.800 / 1M | $1.280 / 1M |
| Gesamte Eingabe-Token | 347,980 | 349,876 |
| Ausgabe-Token | 121,898 | 39,789 |
| Denk-Token | 720,302 | 0 |
| Antwortzeit (Durchschnitt) | 95.16s | 27.42s |
| Antwortzeit (Maximum) | 540.96s | 387.15s |
| Antwortzeit (Gesamt) | 2188.74s | 630.70s |
| Parameter | 398B insgesamt (13B aktiv) | 284B insgesamt (13B aktiv) |
| Verfügbarkeit | Gewichte verfügbar | Geschlossen |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#222 Trinity Large Thinking
low- Kosten
- $0.021
- Zeit
- 173.2s
- Token
- 24,586 tok
#228 DeepSeek V4 Flash 0731
none- Kosten
- $0.004
- Zeit
- 198.4s
- Token
- 14,316 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Agentenaufgaben | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Trinity Large Thinking | 7.4 | 3.8 | 66.7% | 1 | 63.23s | 225,126 | 2,088 | 21,753 | |
| DeepSeek V4 Flash 0731 | 10.0 | 10.0 | 100.0% | 0 | 174.89s | 255,310 | 14,363 | 0 |
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Trinity Large Thinking | 8.3 | 10.0 | 75.0% | 0 | 5.70s | 663 | 1,451 | 5,431 | |
| DeepSeek V4 Flash 0731 | 3.4 | 8.3 | 8.3% | 1 | 4.19s | 540 | 801 | 0 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Trinity Large Thinking | 5.3 | 10.0 | 33.3% | 0 | 344.45s | 5,441 | 27,039 | 217,241 | |
| DeepSeek V4 Flash 0731 | 4.3 | 10.0 | 0.0% | 0 | 1.72s | 7,275 | 505 | 0 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Trinity Large Thinking | 5.2 | 6.0 | 33.3% | 1 | 291.02s | 99,467 | 9,848 | 234,039 | |
| DeepSeek V4 Flash 0731 | 3.7 | 1.8 | 50.0% | 2 | 202.44s | 65,531 | 22,822 | 0 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Trinity Large Thinking | 7.3 | 5.8 | 83.3% | 1 | 14.30s | 6,906 | 459 | 9,451 | |
| DeepSeek V4 Flash 0731 | 10.0 | 10.0 | 100.0% | 0 | 2.37s | 7,290 | 199 | 0 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Trinity Large Thinking | 2.9 | 7.2 | 11.1% | 1 | 140.26s | 756 | 72,049 | 217,598 | |
| DeepSeek V4 Flash 0731 | 5.3 | 10.0 | 33.3% | 0 | 1.17s | 675 | 26 | 0 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Trinity Large Thinking | 10.0 | 10.0 | 100.0% | 0 | 12.65s | 501 | 5,138 | 5,695 | |
| DeepSeek V4 Flash 0731 | 4.4 | 9.9 | 0.0% | 0 | 3.22s | 471 | 153 | 0 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Trinity Large Thinking | 4.4 | 6.8 | 16.7% | 1 | 4.07s | 684 | 45 | 3,710 | |
| DeepSeek V4 Flash 0731 | 5.0 | 6.8 | 33.3% | 1 | 1.42s | 627 | 69 | 0 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Trinity Large Thinking | 6.3 | 7.9 | 44.4% | 1 | 3.28s | 678 | 2,625 | 3,077 | |
| DeepSeek V4 Flash 0731 | 3.2 | 9.9 | 0.0% | 0 | 2.74s | 594 | 302 | 0 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Trinity Large Thinking | 10.0 | 10.0 | 100.0% | 0 | 5.19s | 7,551 | 299 | 1,430 | |
| DeepSeek V4 Flash 0731 | 9.5 | 10.0 | 100.0% | 0 | 4.61s | 11,380 | 536 | 0 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Trinity Large Thinking | 3.0 | 10.0 | 0.0% | 0 | 2.10s | 207 | 857 | 877 | |
| DeepSeek V4 Flash 0731 | 3.0 | 10.0 | 0.0% | 0 | 1.85s | 183 | 13 | 0 |
Schnellvergleich
Vergleichspaar wechseln
Trinity Large ThinkinglowvsDeepSeek V3.2mediumTrinity Large ThinkinglowvsSpace Bunny AlphamediumDeepSeek V4 Flash 0731nonevsKAT-Coder-Pro V2.5mediumTrinity Large ThinkinglowvsDeepSeek V4 Flash 0423noneTrinity Large ThinkinglowvsGrok 4.20mediumDeepSeek V4 Flash 0731nonevsSpace Bunny AlphaxhighClaude Fable 5.1lowvsDeepSeek V4 Flash 0731noneTrinity Large ThinkinglowvsQwen3.5 Plus 2026-02-15noneTrinity Large ThinkinglowvsSolar Pro 4highTrinity Large ThinkinglowvsSpace Bunny AlphaxhighDeepSeek V4 Flash 0731nonevsGrok 4.20mediumTrinity Large ThinkinglowvsQwen3.6 27Bnone