- Rang
- #80
- Gesamte Ausgabe-Token
- 67,842
- Antwortzeit (Durchschnitt)
- 16.72s
- Gesamtkosten
- $3.490
Claude Opus 4.8 (medium) vs Muse Spark 1.1 (high)
Muse Spark 1.1 (high) führt beim Durchschnittsscore mit 8.4 vs 8.3. Muse Spark 1.1 (high) hat die niedrigeren Benchmark-Kosten mit $2.570 vs $3.490. Claude Opus 4.8 (medium) ist schneller mit 16.72s vs 37.41s, mit Erfolgsraten von 82.6% vs 69.6%.
Verglichene Modelle
- Rang
- #73
- Gesamte Ausgabe-Token
- 505,566
- Antwortzeit (Durchschnitt)
- 37.41s
- Gesamtkosten
- $2.570
Empfohlenes Modell
Claude Opus 4.8 (medium)
Die Punktzahl bleibt nah an der besten hier (8.3 vs 8.4) und es antwortet etwa 2.2x schneller als Muse Spark 1.1 (high).
Detaillierter Vergleich
| Metrik | Claude Opus 4.8 Claude Opus 4.8 medium | Muse Spark 1.1 Muse Spark 1.1 high |
|---|---|---|
| Punktzahl | 8.3 | 8.4 |
| Rang | #80 | #73 |
| Zuverlässigkeit | 10.0 | 10.0 |
| Konsistenz | 9.0 | 8.0 |
| Versuche | 69/69 | 69/69 |
| Korrekte Tests | ||
| Erfolgsquote pro Versuch | 82.6% | 69.6% |
| Instabile Tests | 3 | 6 |
| Gesamtläufe | 69 | 69 |
| Kosten pro Ergebnis | 20.527 | 19.762 |
| Gesamtkosten | $3.490 | $2.570 |
| Eingabepreis | $5.000 / 1M | $1.250 / 1M |
| Ausgabepreis | $25.000 / 1M | $4.250 / 1M |
| Gesamte Eingabe-Token | 360,294 | 336,310 |
| Ausgabe-Token | 43,441 | 10,838 |
| Denk-Token | 24,401 | 494,728 |
| Antwortzeit (Durchschnitt) | 16.72s | 37.41s |
| Antwortzeit (Maximum) | 99.37s | 196.03s |
| Antwortzeit (Gesamt) | 384.66s | 860.39s |
| Parameter | ~5T insgesamt (~500B aktiv) | ~1T insgesamt (~50B aktiv) |
| Verfügbarkeit | Geschlossen | Geschlossen |
Modell-Generierungs-Showcase
Hamster playing table tennis
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
#80 Claude Opus 4.8
medium- Kosten
- $0.057
- Zeit
- 23.1s
- Token
- 2,412 tok
#73 Muse Spark 1.1
high- Kosten
- $0.039
- Zeit
- 50.1s
- Token
- 9,423 tok
Top-Modelle nach Score
Score vs. Gesamtkosten
Antwortzeit (Durchschnitt)
Punktzahl vs Antwortzeit (Durchschnitt)
Gesamte Ausgabe-Token
Punktzahl vs Gesamte Ausgabe-Token
Kategorieaufschlüsselung
| Agentenaufgaben | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 6.1 | 3.1 | 66.7% | 1 | 99.37s | 221,846 | 2,676 | 13,239 | |
| Muse Spark 1.1 | 10.0 | 10.0 | 100.0% | 0 | 49.67s | 207,097 | 2,482 | 11,168 |
| Anti-KI-Tricks | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.95s | 834 | 1,179 | 478 | |
| Muse Spark 1.1 | 7.5 | 8.4 | 66.7% | 1 | 8.60s | 2,334 | 516 | 13,023 |
| Programmierung | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 15.33s | 10,590 | 9,945 | 1,381 | |
| Muse Spark 1.1 | 10.0 | 10.0 | 100.0% | 0 | 22.92s | 8,562 | 349 | 36,039 |
| Kombiniert | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 9.9 | 10.0 | 100.0% | 0 | 54.29s | 101,005 | 19,531 | 4,762 | |
| Muse Spark 1.1 | 5.9 | 2.9 | 66.7% | 2 | 70.25s | 90,082 | 5,535 | 68,439 |
| Datenanalyse und -extraktion | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 7.1 | 5.6 | 83.3% | 1 | 12.29s | 10,503 | 481 | 312 | |
| Muse Spark 1.1 | 10.0 | 10.0 | 100.0% | 0 | 8.40s | 7,827 | 240 | 5,907 |
| Domänenspezifisch | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 3.6 | 7.2 | 22.2% | 1 | 18.11s | 972 | 7,476 | 2,987 | |
| Muse Spark 1.1 | 2.9 | 4.4 | 22.2% | 2 | 94.74s | 1,062 | 345 | 195,595 |
| Allgemeine Intelligenz | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 2.46s | 708 | 237 | 0 | |
| Muse Spark 1.1 | 10.0 | 10.0 | 100.0% | 0 | 7.73s | 906 | 116 | 3,390 |
| Befolgung von Anweisungen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.32s | 909 | 373 | 320 | |
| Muse Spark 1.1 | 6.4 | 6.0 | 66.7% | 1 | 7.81s | 1,527 | 193 | 7,158 |
| Rätsellösen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 3.95s | 894 | 791 | 483 | |
| Muse Spark 1.1 | 7.8 | 9.9 | 66.7% | 0 | 69.96s | 1,938 | 225 | 140,780 |
| Werkzeugaufrufe | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 10.0 | 10.0 | 100.0% | 0 | 8.96s | 11,775 | 301 | 225 | |
| Muse Spark 1.1 | 9.6 | 10.0 | 100.0% | 0 | 9.88s | 14,363 | 795 | 2,938 |
| Allgemeinwissen | Punktzahl | Konsistenz | Erfolgsquote pro Versuch | Instabile Tests | Korrekte Tests | Antwortzeit (Durchschnitt) | Eingabe-Token | Ausgabe-Token | Denk-Token |
|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 3.0 | 10.0 | 0.0% | 0 | 6.14s | 258 | 451 | 214 | |
| Muse Spark 1.1 | 3.0 | 10.0 | 0.0% | 0 | 22.93s | 612 | 42 | 10,291 |
Schnellvergleich
Vergleichspaar wechseln
Gemini 3.1 Pro PreviewmediumvsMuse Spark 1.1highClaude Opus 4.8mediumvsGrok 4.5highClaude Opus 4.8mediumvsKimi K3maxMuse Spark 1.1highvsGPT-5 MinimediumMuse Spark 1.1highvsQwen3.8 2.4T A95BlowClaude Opus 4.8mediumvsGemini 3.5 FlashhighClaude Opus 4.8mediumvsGPT-5.6 TerrahighClaude Opus 4.8mediumvsGLM 5.2highMuse Spark 1.1highvsKimi K3maxClaude Opus 4.8mediumvsDeepSeek V4 Flash 0731highMuse Spark 1.1highvsQwen3.7 MaxmediumClaude Sonnet 5mediumvsMuse Spark 1.1high