नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

AI BENCHY तुलना

Anthropic: Claude Opus 4.8 vs Qwen: Qwen3.5-27B

सारांश

Claude Opus 4.8 vs Qwen3.5-27B benchmark तुलना: Qwen3.5-27B average score में आगे है: 7.9 vs 7.7. Qwen3.5-27B की benchmark लागत कम है: $0.536 vs $1.270. Claude Opus 4.8 तेज है: 10.83s vs 68.39s, pass rates 79.4% vs 73.0%.

अनुशंसित मॉडल: Claude Opus 4.8 - Its score stays close to the best score here (7.7 vs 7.9), while responding about 6.3x faster than Qwen3.5-27B.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-06-30

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 low रिलीज़: 2026-05-28 Qwen3.5-27B Qwen3.5-27B medium रिलीज़: 2026-02-24
स्कोर 7.7 7.9
रैंक #38 #29
विश्वसनीयता 10.0 10.0
संगति 8.8 8.5
सही परीक्षण
प्रति प्रयास पास दर 79.4% 73.0%
अस्थिर टेस्ट 3 4
कुल रन 63 63
प्रति परिणाम लागत 8.466 4.901
कुल लागत $1.270 $0.536
इनपुट कीमत $5.000 / 1M $0.195 / 1M
आउटपुट कीमत $25.000 / 1M $1.560 / 1M
कुल इनपुट टोकन 60,946 42,164
आउटपुट टोकन 31,771 8,534
रीजनिंग टोकन 6,831 329,289
प्रतिक्रिया समय (औसत) 10.83s 68.39s
प्रतिक्रिया समय (अधिकतम) 127.97s 234.36s
प्रतिक्रिया समय (कुल) 227.39s 1436.24s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#38 Claude Opus 4.8

low
लागत
$0.031
समय
14.1s
टोकन
1,345 tok

#29 Qwen3.5-27B

medium
लागत
$0.008
समय
62.0s
टोकन
3,099 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 10.0 10.0 100.0% 0 3.30s 834 793 371
Qwen3.5-27B 8.7 7.9 91.7% 1 19.75s 672 569 31,505
कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 6.6 4.6 77.8% 2 7.58s 10,590 3,637 809
Qwen3.5-27B 6.2 7.1 55.6% 1 160.69s 7,895 6,381 89,388
संयुक्त स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 9.8 10.0 100.0% 0 20.84s 23,500 2,216 1,081
Qwen3.5-27B 10.0 10.0 100.0% 0 163.96s 14,946 483 9,991
डेटा पार्सिंग और निष्कर्षण स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 6.3 5.8 66.7% 1 2.27s 10,503 310 0
Qwen3.5-27B 10.0 10.0 100.0% 0 30.26s 7,782 270 16,150
डोमेन-विशिष्ट स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 5.3 10.0 33.3% 0 45.53s 975 23,311 3,908
Qwen3.5-27B 5.3 10.0 33.3% 0 79.53s 553 43 52,368
Samanya Buddhimatta स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 10.0 10.0 100.0% 0 2.55s 708 231 0
Qwen3.5-27B 6.1 3.1 66.7% 1 101.41s 524 70 23,147
निर्देश पालन स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 9.8 10.0 100.0% 0 2.78s 909 111 221
Qwen3.5-27B 10.0 10.0 100.0% 0 19.66s 699 97 11,638
पहेली समाधान स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 10.0 10.0 100.0% 0 3.01s 894 592 184
Qwen3.5-27B 8.2 7.7 77.8% 1 59.60s 696 242 70,096
टूल कॉलिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 10.0 10.0 100.0% 0 6.85s 11,775 370 35
Qwen3.5-27B 10.0 10.0 100.0% 0 7.45s 8,193 348 1,323
सामान्य ज्ञान स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 3.0 10.0 0.0% 0 5.48s 258 200 222
Qwen3.5-27B 3.0 10.0 0.0% 0 85.11s 204 31 23,683

त्वरित तुलना

तुलना जोड़ी बदलें