Navigation
AI BENCHY
Advertise here

Verglichene Modelle

Benchmark-Vergleich Claude Opus 5 (high) vs GPT-5.6 Sol (high) vs Kimi K3 (max) vs Gemini 3.6 Flash (medium)Gemini 3.6 Flash (medium) führt bei Punktzahl mit 9.9. Claude Opus 5 (high) führt bei Zuverlässigkeit mit 10.0. Gemini 3.6 Flash (medium) hat den niedrigsten Gesamtkosten mit $0.831. Gemini 3.6 Flash (medium) ist mit 10.11s am schnellsten.

Empfohlenes ModellGemini 3.6 Flash (medium)Es hat hier die beste Punktzahl (9.9) und kostet etwa 2.9x weniger als die anderen Modelle in diesem Vergleich.

Benchmarks aus AI BENCHY-Test-Suites generiert am: 2026-07-25

Metrik Claude Opus 5 Claude Opus 5 high Veröffentlichung: 2026-07-25 GPT-5.6 Sol GPT-5.6 Sol high Veröffentlichung: 2026-07-09 Kimi K3 Kimi K3 max Veröffentlichung: 2026-07-16 Gemini 3.6 Flash Gemini 3.6 Flash medium Veröffentlichung: 2026-07-21
Punktzahl 9.2 9.4 8.0 9.9
Rang #11 #8 #40 #1
Zuverlässigkeit 10.0 10.0 9.1 10.0
Konsistenz 9.6 8.9 9.5 9.6
Korrekte Tests
Erfolgsquote pro Versuch 84.9% 89.4% 75.8% 98.5%
Instabile Tests 1 3 1 1
Gesamtläufe 66 66 66 66
Kosten pro Ergebnis 15.747 6.852 19.446 3.955
Gesamtkosten $2.835 $1.234 $3.112 $0.831
Eingabepreis $5.000 / 1M $5.000 / 1M $3.000 / 1M $1.500 / 1M
Ausgabepreis $25.000 / 1M $30.000 / 1M $15.000 / 1M $7.500 / 1M
Gesamte Eingabe-Token 135,959 79,249 34,916 66,293
Ausgabe-Token 67,066 4,855 2,910 2,000
Denk-Token 19,114 23,044 197,529 95,464
Antwortzeit (Durchschnitt) 20.44s 11.73s 122.48s 10.11s
Antwortzeit (Maximum) 159.01s 54.79s 766.58s 68.03s
Antwortzeit (Gesamt) 449.68s 257.99s 2327.06s 222.33s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#11 Claude Opus 5

high
Kosten
$0.265
Zeit
144.5s
Token
10,741 tok

#8 GPT-5.6 Sol

high
Kosten
$0.151
Zeit
201.9s
Token
5,100 tok

#40 MoonshotAI: Kimi K3

max
Kosten
$0.281
Zeit
506.9s
Token
18,863 tok

#1 Gemini 3.6 Flash

medium
Kosten
$0.079
Zeit
47.9s
Token
10,532 tok

Top-Modelle nach Score

Score vs. Gesamtkosten

Antwortzeit (Durchschnitt)

Punktzahl vs Antwortzeit (Durchschnitt)

Gesamte Ausgabe-Token

Punktzahl vs Gesamte Ausgabe-Token

Kategorieaufschlüsselung

Programmierung Punktzahl Konsistenz Erfolgsquote pro Versuch Instabile Tests Korrekte Tests Antwortzeit (Durchschnitt) Eingabe-Token Ausgabe-Token Denk-Token
Claude Opus 5 10.0 10.0 100.0% 0 12.73s 10,590 7,547 1,721
GPT-5.6 Sol 10.0 10.0 100.0% 0 12.52s 7,302 404 5,656
Kimi K3 10.0 10.0 100.0% 0 325.79s 8,061 460 84,012
Gemini 3.6 Flash 10.0 10.0 100.0% 0 17.49s 8,136 474 40,157

Schnellvergleich

Vergleichspaar wechseln