Navigation
AI BENCHY
Advertise here

AI BENCHY Compare

Anthropic: Claude Opus 4.8 vs OpenAI: GPT-5.5

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-05-28

Metrik Claude Opus 4.8 Claude Opus 4.8 medium Veröffentlichung: 2026-05-28 GPT-5.5 GPT-5.5 low Veröffentlichung: 2026-04-24
Punktzahl 8.7 8.9
Rang #12 #8
Zuverlässigkeit 10.0 10.0
Konsistenz 9.6 10.0
Korrekte Tests
Erfolgsquote pro Versuch 83.3% 85.0%
Instabile Tests 1 0
Gesamtläufe 60 60
Kosten pro Ergebnis 6.285 4.833
Gesamtkosten $1.006 $0.822
Eingabepreis $5.000 / 1M $5.000 / 1M
Ausgabepreis $25.000 / 1M $30.000 / 1M
Ausgabe-Token 23,201 2,025
Denk-Token 5,901 20,092
Antwortzeit (Durchschnitt) 9.34s 9.43s
Antwortzeit (Maximum) 38.03s 56.19s
Antwortzeit (Gesamt) 186.84s 188.66s

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Anti-KI-Tricks Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Claude Opus 4.8 10.0 10.0 100.0% 0 3.95s 1,179 478
GPT-5.5 10.0 10.0 100.0% 0 4.41s 238 1,020
Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Claude Opus 4.8 10.0 10.0 100.0% 0 14.97s 6,651 1,381
GPT-5.5 10.0 10.0 100.0% 0 14.42s 402 4,034
Kombiniert Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Claude Opus 4.8 9.8 10.0 100.0% 0 38.03s 5,260 1,588
GPT-5.5 10.0 10.0 100.0% 0 9.56s 303 717
Datenanalyse und -extraktion Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Claude Opus 4.8 7.1 5.6 83.3% 1 12.29s 481 312
GPT-5.5 10.0 10.0 100.0% 0 3.28s 228 157
Domänenspezifisch Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Claude Opus 4.8 5.3 10.0 33.3% 0 14.15s 7,477 900
GPT-5.5 5.3 10.0 33.3% 0 28.05s 69 11,609
Allgemeine Intelligenz Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Claude Opus 4.8 10.0 10.0 100.0% 0 2.46s 237 0
GPT-5.5 10.0 10.0 100.0% 0 5.17s 133 245
Befolgung von Anweisungen Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Claude Opus 4.8 10.0 10.0 100.0% 0 3.32s 373 320
GPT-5.5 9.9 10.0 100.0% 0 3.74s 93 415
Rätsellösen Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Claude Opus 4.8 10.0 10.0 100.0% 0 3.95s 791 483
GPT-5.5 10.0 10.0 100.0% 0 4.74s 279 954
Werkzeugaufrufe Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Claude Opus 4.8 10.0 10.0 100.0% 0 8.96s 301 225
GPT-5.5 10.0 10.0 100.0% 0 4.96s 250 101
Allgemeinwissen Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Ausgabe-Token Denk-Token
Claude Opus 4.8 3.0 10.0 0.0% 0 6.14s 451 214
GPT-5.5 3.0 10.0 0.0% 0 10.06s 30 840

Schnellvergleich

Vergleichspaar wechseln