AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#42

Step 3.7 Flash

Stepfun प्रकाशन: 2026-05-29 चाचणी तारीख: 2026-06-04 13:49 stepfun/step-3.7-flash::low

सारांश

Step 3.7 Flash AI BENCHY वर 7.7 स्कोर करते आणि #42 वर आहे. याची reliability 10.0, pass rate 68.3%, एकूण खर्च $0.341, आणि सरासरी response time 15.74s आहे.

Step 3.7 Flash खास का आहे: हे कोडिंग मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #1 आहे; तर डेटा पार्सिंग आणि निष्कर्षण हा सर्वात कमकुवत भाग आहे, rank #17.

सुसंगतता

8.4

एकूण आउटपुट टोकन्स

289,325

एकूण इनपुट टोकन्स

40,101

इनपुट किंमत

$0.200 / 1M

आउटपुट किंमत

$1.150 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 9

प्रति प्रयत्न पास दर: 68.3%

अस्थिर चाचण्या

4

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

15.74s

प्रतिसाद वेळ (कमाल): 124.75s

प्रतिसाद वेळ (एकूण): 330.63s

Generation showcase

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#42 Step 3.7 Flash

low
Invalid SVG
Cost
$0.004
Time
25.3s
Tokens
3,072 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-06-04 13:49 नवीन चाचणी जोडली 7.3 10.0 $0.341 सध्याची रन
2026-05-29 11:49 पहिला रन 7.4 10.0 $0.336 तुलना करा

या रनमध्ये वेगळा बेंचमार्क सूट वापरला गेला. ऐतिहासिक बदल वाचताना सूटमधील बदल लक्षात घ्या.

किंमत इतिहास

OpenRouter मधील या मॉडेलचा ऐतिहासिक किंमत डेटा.

तारीख इनपुट किंमत आउटपुट किंमत
2026-06-04 15:40 $0.200 / 1M $1.150 / 1M

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 8.7 7.9
कोडिंग 8.2 7.2
संयुक्त 10.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 7.3 5.8
डोमेन-विशिष्ट 5.3 7.2
Samanya Buddhimatta 3.4 9.3
सूचनांचे पालन 9.8 10.0
कोडी सोडवणे 5.5 9.9
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स