नेविगेशन
Advertise here

Claude Opus 4.8 (low) vs Qwen3.5-27B

average score लगभग बराबर है: 7.2 vs 7.2. Qwen3.5-27B की benchmark लागत कम है: $0.116 vs $3.787. Qwen3.5-27B तेज है: 9.98s vs 17.13s, pass rates 78.3% vs 47.8%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-10-01

तुलना किए गए मॉडल

रैंक
#143
कुल आउटपुट टोकन
69,489
प्रतिक्रिया समय (औसत)
17.13s
कुल लागत
$3.787
रैंक
#139
कुल आउटपुट टोकन
36,422
प्रतिक्रिया समय (औसत)
9.98s
कुल लागत
$0.116
अनुशंसित मॉडल Claude Opus 4.8 (low)

It has the strongest score in this comparison (7.2) and the best overall balance of cost and response time across all 2 models.

विस्तृत तुलना

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 low रिलीज़: 2026-05-28 Qwen3.5-27B Qwen3.5-27B none रिलीज़: 2026-02-24
स्कोर 7.2 7.2
रैंक #143 #139
विश्वसनीयता 10.0 10.0
संगति 8.6 9.4
प्रयास 69/69 69/69
सही परीक्षण
प्रति प्रयास पास दर 78.3% 47.8%
अस्थिर टेस्ट 4 2
कुल रन 69 69
प्रति परिणाम लागत 23.669 1.153
कुल लागत $3.787 $0.116
इनपुट कीमत $5.000 / 1M $0.195 / 1M
आउटपुट कीमत $25.000 / 1M $1.560 / 1M
कुल इनपुट टोकन 409,947 283,977
आउटपुट टोकन 46,060 36,422
रीजनिंग टोकन 23,429 0
प्रतिक्रिया समय (औसत) 17.13s 9.98s
प्रतिक्रिया समय (अधिकतम) 127.97s 124.53s
प्रतिक्रिया समय (कुल) 394.01s 229.52s
पैरामीटर ~5T कुल (~500B सक्रिय) 27B
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#143 Claude Opus 4.8

low
लागत
$0.031
समय
14.1s
टोकन
1,345 tok

#139 Qwen3.5-27B

none
लागत
$0.007
समय
42.9s
टोकन
4,273 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 6.6 4.6 77.8% 2 7.58s 10,590 3,637 809
Qwen3.5-27B 5.8 10.0 33.3% 0 1.80s 7,913 415 0

त्वरित तुलना

तुलना जोड़ी बदलें