नेविगेशन
Advertise here

Claude Opus 5.5 (medium) vs Pareto

Claude Opus 5.5 (medium) average score में आगे है: 9.0 vs 8.9. Claude Opus 5.5 (medium) की benchmark लागत कम है: $1.080 vs $1.172. Claude Opus 5.5 (medium) तेज है: 24.18s vs 31.51s, pass rates 89.4% vs 86.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-23

तुलना किए गए मॉडल

रैंक
#30
कुल आउटपुट टोकन
27,194
प्रतिक्रिया समय (औसत)
24.18s
कुल लागत
$1.080
रैंक
#39
कुल आउटपुट टोकन
119,230
प्रतिक्रिया समय (औसत)
31.51s
कुल लागत
$1.172
अनुशंसित मॉडल Claude Opus 5.5 (medium)

It has the strongest score in this comparison (9.0) and the best overall balance of cost and response time across all 2 models.

विस्तृत तुलना

मेट्रिक Claude Opus 5.5 Claude Opus 5.5 medium रिलीज़: 2026-09-23 Pareto Pareto none रिलीज़: 2026-09-18
स्कोर 9.0 8.9
रैंक #30 #39
विश्वसनीयता 10.0 10.0
संगति 9.6 9.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 89.4% 86.4%
अस्थिर टेस्ट 1 2
कुल रन 66 66
प्रति परिणाम लागत 5.683 6.506
कुल लागत $1.080 $1.172
इनपुट कीमत $4.000 / 1M $2.500 / 1M
आउटपुट कीमत $20.000 / 1M $7.500 / 1M
कुल इनपुट टोकन 133,954 110,734
आउटपुट टोकन 7,292 119,230
रीजनिंग टोकन 19,902 0
प्रतिक्रिया समय (औसत) 24.18s 31.51s
प्रतिक्रिया समय (अधिकतम) 90.20s 143.33s
प्रतिक्रिया समय (कुल) 532.04s 693.29s
पैरामीटर ~5T कुल (~500B सक्रिय) -
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#30 Claude Opus 5.5

medium
लागत
$0.053
समय
25.6s
टोकन
2,781 tok

#39 Pareto

none
लागत
$0.034
समय
170.7s
टोकन
4,581 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Opus 5.5 8.4 7.4 88.9% 1 13.50s 10,608 636 4,341
Pareto 10.0 10.0 100.0% 0 50.12s 7,471 1,949 0

त्वरित तुलना

तुलना जोड़ी बदलें