नेव्हिगेशन
Advertise here

Pareto vs Grok 4.5 (high)

Grok 4.5 (high) average score मध्ये पुढे आहे: 9.0 vs 8.9. Pareto चा benchmark खर्च कमी आहे: $1.172 vs $2.252. Pareto वेगवान आहे: 31.51s vs 72.30s, pass rates 86.4% vs 86.4%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-09-18

तुलना केलेली मॉडेल्स

क्रमांक
#34
एकूण आउटपुट टोकन्स
119,230
प्रतिसाद वेळ (सरासरी)
31.51s
एकूण खर्च
$1.172
क्रमांक
#30
एकूण आउटपुट टोकन्स
324,462
प्रतिसाद वेळ (सरासरी)
72.30s
एकूण खर्च
$2.252
शिफारस केलेले मॉडेल Pareto

Its score stays close to the best score here (8.9 vs 9.0), while costing about 1.9x less than Grok 4.5 (high).

तपशीलवार तुलना

मेट्रिक Pareto Pareto none प्रकाशन: 2026-09-18 Grok 4.5 Grok 4.5 high प्रकाशन: 2026-07-08
स्कोअर 8.9 9.0
क्रमांक #34 #30
विश्वसनीयता 10.0 10.0
सुसंगतता 9.2 8.9
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 86.4% 86.4%
अस्थिर चाचण्या 2 3
एकूण रन 66 66
प्रति निकाल खर्च 6.506 12.565
एकूण खर्च $1.172 $2.252
इनपुट किंमत $2.500 / 1M $2.000 / 1M
आउटपुट किंमत $7.500 / 1M $6.000 / 1M
एकूण इनपुट टोकन्स 110,734 152,175
आउटपुट टोकन्स 119,230 5,655
रिझनिंग टोकन्स 0 318,807
प्रतिसाद वेळ (सरासरी) 31.51s 72.30s
प्रतिसाद वेळ (कमाल) 143.33s 676.83s
प्रतिसाद वेळ (एकूण) 693.29s 1590.56s
पॅरामीटर्स - ~1.7T एकूण (~170B सक्रिय)
उपलब्धता बंद स्रोत बंद स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#34 Pareto

none
खर्च
$0.034
वेळ
170.7s
टोकन्स
4,581 tok

#30 SpaceXAI: Grok 4.5

high
खर्च
$0.015
वेळ
29.7s
टोकन्स
2,737 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Pareto 10.0 10.0 100.0% 0 50.12s 7,471 1,949 0
Grok 4.5 10.0 10.0 100.0% 0 155.16s 9,579 357 100,752

झटपट तुलना

तुलना जोडी बदला