नेविगेशन
Advertise here

Claude Sonnet 5.5 (max) vs Pareto

Claude Sonnet 5.5 (max) average score में आगे है: 9.0 vs 8.9. Pareto की benchmark लागत कम है: $1.172 vs $7.545. Pareto तेज है: 31.51s vs 83.04s, pass rates 81.8% vs 86.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-29

तुलना किए गए मॉडल

रैंक
#39
कुल आउटपुट टोकन
727,349
प्रतिक्रिया समय (औसत)
83.04s
कुल लागत
$7.545
रैंक
#45
कुल आउटपुट टोकन
119,230
प्रतिक्रिया समय (औसत)
31.51s
कुल लागत
$1.172
अनुशंसित मॉडल Pareto

Its score stays close to the best score here (8.9 vs 9.0), while costing about 6.4x less than Claude Sonnet 5.5 (max).

विस्तृत तुलना

मेट्रिक Claude Sonnet 5.5 Claude Sonnet 5.5 max रिलीज़: 2026-09-29 Pareto Pareto none रिलीज़: 2026-09-18
स्कोर 9.0 8.9
रैंक #39 #45
विश्वसनीयता 10.0 10.0
संगति 9.4 9.2
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 81.8% 86.4%
अस्थिर टेस्ट 2 2
कुल रन 66 66
प्रति परिणाम लागत 44.380 6.506
कुल लागत $7.545 $1.172
इनपुट कीमत $2.000 / 1M $2.500 / 1M
आउटपुट कीमत $10.000 / 1M $7.500 / 1M
कुल इनपुट टोकन 135,496 110,734
आउटपुट टोकन 8,153 119,230
रीजनिंग टोकन 719,196 0
प्रतिक्रिया समय (औसत) 83.04s 31.51s
प्रतिक्रिया समय (अधिकतम) 488.39s 143.33s
प्रतिक्रिया समय (कुल) 1826.84s 693.29s
पैरामीटर ~1T कुल (~100B सक्रिय) -
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#39 Claude Sonnet 5.5

max
OpenRouter returned no showcase content (finish_reason: length).
लागत
$0.000
समय
571.7s
टोकन
0 tok

#45 Pareto

none
लागत
$0.034
समय
170.7s
टोकन
4,581 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Claude Sonnet 5.5 10.0 10.0 100.0% 0 55.26s 10,608 580 70,730
Pareto 10.0 10.0 100.0% 0 50.12s 7,471 1,949 0

त्वरित तुलना

तुलना जोड़ी बदलें