- Rang
- #167
- Gesamte Ausgabe-Token
- 24,343
- Antwortzeit (Durchschnitt)
- 7.54s
- Gesamtkosten
- $2.334
Claude Opus 4.8 vs Gemini 3.1 Flash Lite Preview (medium)
Gemini 3.1 Flash Lite Preview (medium) führt beim Durchschnittsscore mit 7.0 vs 6.9. Gemini 3.1 Flash Lite Preview (medium) hat die niedrigeren Benchmark-Kosten mit $0.158 vs $2.334. Gemini 3.1 Flash Lite Preview (medium) ist schneller mit 6.78s vs 7.54s, mit Erfolgsraten von 60.9% vs 60.9%.
Verglichene Modelle
- Rang
- #155
- Gesamte Ausgabe-Token
- 59,534
- Antwortzeit (Durchschnitt)
- 6.78s
- Gesamtkosten
- $0.158
Empfohlenes Modell
Gemini 3.1 Flash Lite Preview (medium)
Es hat hier die beste Punktzahl (7.0) und kostet etwa 14.8x weniger als Claude Opus 4.8.
Detaillierter Vergleich
| Metrik | Claude Opus 4.8 Claude Opus 4.8 none | Gemini 3.1 Flash Lite Preview Gemini 3.1 Flash Lite Preview medium |
|---|---|---|
| Punktzahl | 6.9 | 7.0 |
| Rang | #167 | #155 |
| Zuverlässigkeit | 10.0 | 10.0 |
| Konsistenz | 9.3 | 9.9 |
| Versuche | 69/69 | 69/69 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 60.9% | 60.9% |
| Instabile Tests | 2 | 0 |
| Gesamtläufe | 69 | 69 |
| Kosten pro Ergebnis | 17.953 | 1.124 |
| Gesamtkosten | $2.334 | $0.158 |
| Eingabepreis | $5.000 / 1M | $0.250 / 1M |
| Ausgabepreis | $25.000 / 1M | $1.500 / 1M |
| Gesamte Eingabe-Token | 345,059 | 272,221 |
| Ausgabe-Token | 24,343 | 12,345 |
| Denk-Token | 0 | 47,189 |
| Antwortzeit (Durchschnitt) | 7.54s | 6.78s |
| Antwortzeit (Maximum) | 65.07s | 54.91s |
| Antwortzeit (Gesamt) | 173.31s | 155.96s |
| Parameter | ~5T insgesamt (~500B aktiv) | ~150B insgesamt (~10B aktiv) |
| Verfügbarkeit | Geschlossen | Geschlossen |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#167 Claude Opus 4.8
none- Kosten
- $0.053
- Zeit
- 22.0s
- Token
- 2,253 tok
#155 Gemini 3.1 Flash Lite Preview
medium- Kosten
- $0.003
- Zeit
- 5.2s
- Token
- 1,944 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Agentenaufgaben | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 5.0 | 10.0 | 0.0% | 0 | 65.07s | 195,856 | 7,546 | 0 | |
| Gemini 3.1 Flash Lite Preview | 5.0 | 10.0 | 0.0% | 0 | 54.91s | 154,728 | 1,756 | 0 |
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 6.5 | 10.0 | 50.0% | 0 | 3.40s | 834 | 1,472 | 0 | |
| Gemini 3.1 Flash Lite Preview | 9.1 | 10.0 | 75.0% | 0 | 2.33s | 512 | 570 | 4,305 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 5.5 | 10.0 | 33.3% | 0 | 3.29s | 10,590 | 1,332 | 0 | |
| Gemini 3.1 Flash Lite Preview | 5.5 | 10.0 | 33.3% | 0 | 4.09s | 8,126 | 461 | 8,597 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 9.8 | 10.0 | 100.0% | 0 | 26.38s | 111,760 | 11,949 | 0 | |
| Gemini 3.1 Flash Lite Preview | 7.2 | 9.1 | 50.0% | 0 | 16.63s | 93,097 | 8,706 | 16,997 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 7.3 | 5.8 | 83.3% | 1 | 1.77s | 10,503 | 308 | 0 | |
| Gemini 3.1 Flash Lite Preview | 10.0 | 10.0 | 100.0% | 0 | 2.29s | 7,362 | 279 | 2,952 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 5.3 | 7.2 | 44.4% | 1 | 1.76s | 972 | 61 | 0 | |
| Gemini 3.1 Flash Lite Preview | 5.3 | 10.0 | 33.3% | 0 | 4.09s | 652 | 18 | 6,120 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.48s | 708 | 230 | 0 | |
| Gemini 3.1 Flash Lite Preview | 10.0 | 10.0 | 100.0% | 0 | 3.16s | 488 | 96 | 1,488 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 9.9 | 10.0 | 100.0% | 0 | 1.37s | 909 | 95 | 0 | |
| Gemini 3.1 Flash Lite Preview | 10.0 | 10.0 | 100.0% | 0 | 1.91s | 621 | 72 | 2,121 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 7.7 | 10.0 | 66.7% | 0 | 2.74s | 894 | 783 | 0 | |
| Gemini 3.1 Flash Lite Preview | 7.7 | 10.0 | 66.7% | 0 | 5.30s | 566 | 141 | 1,896 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 5.35s | 11,775 | 355 | 0 | |
| Gemini 3.1 Flash Lite Preview | 10.0 | 10.0 | 100.0% | 0 | 3.80s | 5,909 | 234 | 912 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 3.0 | 10.0 | 0.0% | 0 | 3.41s | 258 | 212 | 0 | |
| Gemini 3.1 Flash Lite Preview | 3.0 | 10.0 | 0.0% | 0 | 2.68s | 160 | 12 | 1,801 |
Schnellvergleich
Vergleichspaar wechseln
Claude Opus 4.8nonevsGPT-5.6 LunalowClaude Opus 4.8nonevsGemma 4 31BmediumKostenlos verfügbarGemini 3.1 Flash Lite PreviewmediumvsGPT-5.2 ChatnoneClaude Opus 4.8nonevsEmber-1highEmber-1lowvsGemini 3.1 Flash Lite PreviewmediumClaude Opus 4.8nonevsKimi K2.6mediumClaude Opus 4.8nonevsGemini 3.1 Flash LitemediumClaude Opus 4.8nonevsQwen3.5-FlashmediumClaude Opus 4.8nonevsInklinglowKostenlos verfügbarClaude Opus 4.8nonevsMercury 2.5 PreviewmediumGemini 3.1 Flash Lite PreviewmediumvsGrok 4.6lowGemini 3.1 Flash Lite PreviewmediumvsMuse Glimmer 30Blow