नेविगेशन
Advertise here

Claude Opus 4.8 vs Qwen3.5-122B-A10B (medium)

Claude Opus 4.8 average score में आगे है: 7.3 vs 7.1. Qwen3.5-122B-A10B (medium) की benchmark लागत कम है: $1.047 vs $1.166. Claude Opus 4.8 तेज है: 4.92s vs 65.67s, pass rates 63.6% vs 71.2%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-18

तुलना किए गए मॉडल

रैंक
#128
कुल आउटपुट टोकन
16,797
प्रतिक्रिया समय (औसत)
4.92s
कुल लागत
$1.166
रैंक
#135
कुल आउटपुट टोकन
487,519
प्रतिक्रिया समय (औसत)
65.67s
कुल लागत
$1.047
अनुशंसित मॉडल Claude Opus 4.8

It has the best score here (7.3), while responding about 13.3x faster than Qwen3.5-122B-A10B (medium).

विस्तृत तुलना

मेट्रिक Claude Opus 4.8 Claude Opus 4.8 none रिलीज़: 2026-05-28 Qwen3.5-122B-A10B Qwen3.5-122B-A10B medium रिलीज़: 2026-02-24
स्कोर 7.3 7.1
रैंक #128 #135
विश्वसनीयता 10.0 10.0
संगति 9.2 8.5
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 63.6% 71.2%
अस्थिर टेस्ट 2 4
कुल रन 66 66
प्रति परिणाम लागत 8.969 8.446
कुल लागत $1.166 $1.047
इनपुट कीमत $5.000 / 1M $0.260 / 1M
आउटपुट कीमत $25.000 / 1M $2.080 / 1M
कुल इनपुट टोकन 149,203 124,780
आउटपुट टोकन 16,797 47,694
रीजनिंग टोकन 0 439,825
प्रतिक्रिया समय (औसत) 4.92s 65.67s
प्रतिक्रिया समय (अधिकतम) 35.03s 519.30s
प्रतिक्रिया समय (कुल) 108.24s 1444.68s
पैरामीटर ~5T कुल (~500B सक्रिय) 122B कुल (10B सक्रिय)
उपलब्धता बंद स्रोत मुक्त स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#128 Claude Opus 4.8

none
लागत
$0.053
समय
22.0s
टोकन
2,253 tok

#135 Qwen3.5-122B-A10B

medium
लागत
$0.019
समय
48.7s
टोकन
6,034 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 4.8 5.5 10.0 33.3% 0 3.29s 10,590 1,332 0
Qwen3.5-122B-A10B 6.0 7.2 55.6% 1 114.48s 7,630 8,057 82,578

त्वरित तुलना

तुलना जोड़ी बदलें