नेविगेशन
AI BENCHY
Advertise here

AI BENCHY तुलना

Anthropic: Claude Sonnet 4.6 vs Qwen: Qwen3.5-27B

सारांश

Claude Sonnet 4.6 vs Qwen3.5-27B benchmark तुलना: Qwen3.5-27B average score में आगे है: 7.9 vs 7.8. Qwen3.5-27B की benchmark लागत कम है: $0.536 vs $1.418. Claude Sonnet 4.6 तेज है: 17.06s vs 68.39s, pass rates 65.1% vs 73.0%.

अनुशंसित मॉडल: Qwen3.5-27B - It has the best score here (7.9), while costing about 2.6x less than Claude Sonnet 4.6.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-06-18

मेट्रिक Claude Sonnet 4.6 Claude Sonnet 4.6 medium रिलीज़: 2026-02-17 Qwen3.5-27B Qwen3.5-27B medium रिलीज़: 2026-02-24
स्कोर 7.8 7.9
रैंक #31 #29
विश्वसनीयता 10.0 10.0
संगति 9.1 8.5
सही परीक्षण
प्रति प्रयास पास दर 65.1% 73.0%
अस्थिर टेस्ट 2 4
कुल रन 63 63
प्रति परिणाम लागत 10.904 4.901
कुल लागत $1.418 $0.536
इनपुट कीमत $3.000 / 1M $0.195 / 1M
आउटपुट कीमत $15.000 / 1M $1.560 / 1M
कुल इनपुट टोकन 49,112 42,164
आउटपुट टोकन 54,703 8,534
रीजनिंग टोकन 29,970 329,289
प्रतिक्रिया समय (औसत) 17.06s 68.39s
प्रतिक्रिया समय (अधिकतम) 46.35s 234.36s
प्रतिक्रिया समय (कुल) 221.83s 1436.24s

जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#31 Claude Sonnet 4.6

medium
अमान्य SVG
लागत
$0.000
समय
300.0s
टोकन
0 tok

#29 Qwen3.5-27B

medium
लागत
$0.008
समय
62.0s
टोकन
3,099 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

एंटी-एआई ट्रिक्स स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 6.5 10.0 50.0% 0 2.98s 789 1,046 1,093
Qwen3.5-27B 8.7 7.9 91.7% 1 19.75s 672 569 31,505
कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 5.7 6.6 44.4% 1 33.29s 6,995 16,089 3,686
Qwen3.5-27B 6.2 7.1 55.6% 1 160.69s 7,895 6,381 89,388
संयुक्त स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 10.0 10.0 100.0% 0 46.35s 18,351 5,871 3,962
Qwen3.5-27B 10.0 10.0 100.0% 0 163.96s 14,946 483 9,991
डेटा पार्सिंग और निष्कर्षण स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 10.0 10.0 100.0% 0 13.90s 8,676 649 742
Qwen3.5-27B 10.0 10.0 100.0% 0 30.26s 7,782 270 16,150
डोमेन-विशिष्ट स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 2.9 7.2 11.1% 1 0ms 471 25,790 16,919
Qwen3.5-27B 5.3 10.0 33.3% 0 79.53s 553 43 52,368
Samanya Buddhimatta स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 10.0 10.0 100.0% 0 4.94s 564 256 433
Qwen3.5-27B 6.1 3.1 66.7% 1 101.41s 524 70 23,147
निर्देश पालन स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 10.0 10.0 100.0% 0 2.61s 792 318 552
Qwen3.5-27B 10.0 10.0 100.0% 0 19.66s 699 97 11,638
पहेली समाधान स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 10.0 10.0 100.0% 0 5.31s 816 592 646
Qwen3.5-27B 8.2 7.7 77.8% 1 59.60s 696 242 70,096
टूल कॉलिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 10.0 10.0 100.0% 0 7.48s 11,454 655 351
Qwen3.5-27B 10.0 10.0 100.0% 0 7.45s 8,193 348 1,323
सामान्य ज्ञान स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 4.6 3.0 10.0 0.0% 0 30.09s 204 3,437 1,586
Qwen3.5-27B 3.0 10.0 0.0% 0 85.11s 204 31 23,683

त्वरित तुलना

तुलना जोड़ी बदलें