नेविगेशन
Advertise here

Pareto vs Grok 4.5 (high)

Grok 4.5 (high) average score में आगे है: 9.0 vs 8.9. Pareto की benchmark लागत कम है: $1.172 vs $2.252. Pareto तेज है: 31.51s vs 72.30s, pass rates 86.4% vs 86.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-09-18

तुलना किए गए मॉडल

रैंक
#34
कुल आउटपुट टोकन
119,230
प्रतिक्रिया समय (औसत)
31.51s
कुल लागत
$1.172
रैंक
#30
कुल आउटपुट टोकन
324,462
प्रतिक्रिया समय (औसत)
72.30s
कुल लागत
$2.252
अनुशंसित मॉडल Pareto

Its score stays close to the best score here (8.9 vs 9.0), while costing about 1.9x less than Grok 4.5 (high).

विस्तृत तुलना

मेट्रिक Pareto Pareto none रिलीज़: 2026-09-18 Grok 4.5 Grok 4.5 high रिलीज़: 2026-07-08
स्कोर 8.9 9.0
रैंक #34 #30
विश्वसनीयता 10.0 10.0
संगति 9.2 8.9
प्रयास 66/66 66/66
सही परीक्षण
प्रति प्रयास पास दर 86.4% 86.4%
अस्थिर टेस्ट 2 3
कुल रन 66 66
प्रति परिणाम लागत 6.506 12.565
कुल लागत $1.172 $2.252
इनपुट कीमत $2.500 / 1M $2.000 / 1M
आउटपुट कीमत $7.500 / 1M $6.000 / 1M
कुल इनपुट टोकन 110,734 152,175
आउटपुट टोकन 119,230 5,655
रीजनिंग टोकन 0 318,807
प्रतिक्रिया समय (औसत) 31.51s 72.30s
प्रतिक्रिया समय (अधिकतम) 143.33s 676.83s
प्रतिक्रिया समय (कुल) 693.29s 1590.56s
पैरामीटर - ~1.7T कुल (~170B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#34 Pareto

none
लागत
$0.034
समय
170.7s
टोकन
4,581 tok

#30 SpaceXAI: Grok 4.5

high
लागत
$0.015
समय
29.7s
टोकन
2,737 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Pareto 10.0 10.0 100.0% 0 50.12s 7,471 1,949 0
Grok 4.5 10.0 10.0 100.0% 0 155.16s 9,579 357 100,752

त्वरित तुलना

तुलना जोड़ी बदलें