नेविगेशन
AI BENCHY
Advertise here

Anthropic: Claude Opus 4.8 vs Qwen: Qwen3.5 Plus 2026-04-20

Claude Opus 4.8 average score में आगे है: 7.3 vs 7.2. Qwen3.5 Plus 2026-04-20 (medium) की benchmark लागत कम है: $0.317 vs $1.166. Claude Opus 4.8 तेज है: 4.91s vs 46.36s, pass rates 63.6% vs 63.6%.

अनुशंसित मॉडलClaude Opus 4.8It has the best score here (7.3), while responding about 9.4x faster than Qwen3.5 Plus 2026-04-20 (medium).

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-20

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 none रिलीज़: 2026-05-28 Qwen3.5 Plus 2026-04-20 Qwen3.5 Plus 2026-04-20 medium रिलीज़: 2026-04-20
स्कोर 7.3 7.2
रैंक #66 #70
विश्वसनीयता 10.0 9.6
संगति 9.2 9.0
सही परीक्षण
प्रति प्रयास पास दर 63.6% 63.6%
अस्थिर टेस्ट 2 2
कुल रन 66 66
प्रति परिणाम लागत 8.969 3.023
कुल लागत $1.166 $0.317
इनपुट कीमत $5.000 / 1M $0.300 / 1M
आउटपुट कीमत $25.000 / 1M $1.800 / 1M
कुल इनपुट टोकन 149,206 42,097
आउटपुट टोकन 16,797 2,280
रीजनिंग टोकन 0 166,613
प्रतिक्रिया समय (औसत) 4.91s 46.36s
प्रतिक्रिया समय (अधिकतम) 35.03s 189.38s
प्रतिक्रिया समय (कुल) 108.03s 973.57s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#66 Claude Opus 4.8

none
लागत
$0.053
समय
22.0s
टोकन
2,253 tok

#70 Qwen3.5 Plus 2026-04-20

medium
लागत
$0.008
समय
76.7s
टोकन
4,355 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 5.5 10.0 33.3% 0 3.29s 10,590 1,332 0
Qwen3.5 Plus 2026-04-20 6.2 8.7 33.3% 0 125.25s 7,630 308 58,682

त्वरित तुलना

तुलना जोड़ी बदलें