नेव्हिगेशन
AI BENCHY
Advertise here

AI BENCHY Compare

StepFun: Step 3.7 Flash vs xAI: Grok 4.20

सारांश

Step 3.7 Flash vs Grok 4.20 benchmark तुलना: Step 3.7 Flash average score मध्ये पुढे आहे: 7.3 vs 7.1. Step 3.7 Flash चा benchmark खर्च कमी आहे: $0.341 vs $0.609. Step 3.7 Flash वेगवान आहे: 15.74s vs 27.68s, pass rates 68.3% vs 63.5%.

शिफारस केलेले मॉडेल: Step 3.7 Flash - It has the best score here (7.3), while costing about 1.8x less than Grok 4.20.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-06-04

मेट्रिक Step 3.7 Flash Step 3.7 Flash low प्रकाशन: 2026-05-29 Grok 4.20 Grok 4.20 medium प्रकाशन: 2026-03-31
स्कोअर 7.3 7.1
क्रमांक #57 #65
विश्वसनीयता 10.0 10.0
सुसंगतता 8.4 8.8
बरोबर चाचण्या
प्रति प्रयत्न पास दर 68.3% 63.5%
अस्थिर चाचण्या 4 3
एकूण रन 63 63
प्रति निकाल खर्च 2.840 8.309
एकूण खर्च $0.341 $0.609
इनपुट किंमत $0.200 / 1M $1.250 / 1M
आउटपुट किंमत $1.150 / 1M $2.500 / 1M
एकूण इनपुट टोकन्स 40,101 44,433
आउटपुट टोकन्स 289,325 1,819
रिझनिंग टोकन्स 0 219,524
प्रतिसाद वेळ (सरासरी) 15.74s 27.68s
प्रतिसाद वेळ (कमाल) 124.75s 199.66s
प्रतिसाद वेळ (एकूण) 330.63s 581.26s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#57 Step 3.7 Flash

low
Invalid SVG
Cost
$0.004
Time
25.3s
Tokens
3,072 tok

#65 xAI: Grok 4.20

medium
Cost
$0.041
Time
110.3s
Tokens
16,336 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

अँटी-एआय युक्त्या स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Step 3.7 Flash 8.7 7.9 91.7% 1 4.02s 756 10,896 0
Grok 4.20 8.2 7.9 83.3% 1 3.95s 2,010 287 8,312
कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Step 3.7 Flash 8.2 7.2 88.9% 1 9.46s 7,437 18,685 0
Grok 4.20 6.3 6.6 55.6% 1 109.93s 8,307 268 103,150
संयुक्त स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Step 3.7 Flash 10.0 10.0 100.0% 0 7.98s 13,683 6,426 0
Grok 4.20 10.0 10.0 100.0% 0 17.40s 12,909 232 9,556
डेटा पार्सिंग आणि निष्कर्षण स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Step 3.7 Flash 7.3 5.8 83.3% 1 2.29s 7,398 2,667 0
Grok 4.20 10.0 10.0 100.0% 0 4.17s 7,761 180 5,333
डोमेन-विशिष्ट स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Step 3.7 Flash 5.3 7.2 44.4% 1 43.31s 828 104,487 0
Grok 4.20 5.3 10.0 33.3% 0 27.03s 1,764 375 49,339
Samanya Buddhimatta स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Step 3.7 Flash 3.4 9.3 0.0% 0 7.00s 525 4,604 0
Grok 4.20 3.9 2.6 33.3% 1 24.48s 825 65 6,440
सूचनांचे पालन स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Step 3.7 Flash 9.8 10.0 100.0% 0 1.58s 735 1,857 0
Grok 4.20 9.8 10.0 100.0% 0 4.26s 1,362 57 6,419
कोडी सोडवणे स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Step 3.7 Flash 5.5 9.9 33.3% 0 1.84s 756 3,564 0
Grok 4.20 7.7 10.0 66.7% 0 6.22s 1,689 149 7,913
टूल कॉलिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Step 3.7 Flash 10.0 10.0 100.0% 0 3.25s 7,746 1,360 0
Grok 4.20 3.0 10.0 0.0% 0 13.68s 7,275 197 6,620
सामान्य ज्ञान स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Step 3.7 Flash 3.0 10.0 0.0% 0 124.75s 237 134,779 0
Grok 4.20 3.0 10.0 0.0% 0 63.48s 531 9 16,442

झटपट तुलना

तुलना जोडी बदला