AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com
#32

Step 3.7 Flash

Stepfun प्रकाशन: 2026-05-29 चाचणी तारीख: 2026-05-29 11:49 stepfun/step-3.7-flash::medium
198B एकूण (11B सक्रिय)MoEमुक्त स्रोत
(high) (medium) (low)

सारांश

Step 3.7 Flash AI BENCHY वर 7.9 स्कोर करते आणि #32 वर आहे. याची reliability 9.9, pass rate 71.7%, एकूण खर्च $0.404, आणि सरासरी response time 20.29s आहे.

Step 3.7 Flash खास का आहे: हे डोमेन-विशिष्ट मध्ये सर्वाधिक उठून दिसते, जिथे त्याचा rank #1 आहे; तर Samanya Buddhimatta हा सर्वात कमकुवत भाग आहे, rank #18. या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे.

मॉडेलची माहिती

संशोधन दिनांक: 2026-08-12

जाहीर केलेले
पॅरामीटर्स
198B एकूण (11B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
मुक्त स्रोत
परवाना
Apache-2.0

सुसंगतता

9.2

एकूण आउटपुट टोकन्स

344,492

एकूण इनपुट टोकन्स

0

इनपुट किंमत

$0.200 / 1M

आउटपुट किंमत

$1.150 / 1M

बरोबर चाचण्या

चुकीच्या चाचण्या: 7

प्रति प्रयत्न पास दर: 71.7%

अस्थिर चाचण्या

2

अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).

प्रतिसाद वेळ (सरासरी)

20.29s

प्रतिसाद वेळ (कमाल): 136.44s

प्रतिसाद वेळ (एकूण): 405.79s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#32 Step 3.7 Flash

medium
खर्च
$0.006
वेळ
46.2s
टोकन्स
4,466 tok

रन इतिहास

चाचणी तारीख स्कोअर विश्वसनीयता बरोबर चाचण्या एकूण खर्च तुलना करा
2026-08-14 02:31 पुन्हा चाचणी 7.9 10.0 $0.495 तुलना करा
2026-07-16 22:50 नवीन चाचणी जोडली 8.0 9.9 $0.515 तुलना करा
2026-06-04 13:52 नवीन चाचणी जोडली 8.0 9.9 $0.376 तुलना करा
2026-05-29 11:49 पहिला रन 7.9 9.9 $0.404 सध्याची रन

रन तुलना

रनबेंचमार्क कव्हरेजस्कोअरसुसंगतताविश्वसनीयताबरोबर चाचण्याअस्थिर चाचण्याएकूण आउटपुट टोकन्सएकूण इनपुट टोकन्सएकूण खर्चप्रतिसाद वेळ (सरासरी)
2026-05-29 11:49 · पहिला रन60/60 प्रयत्न7.99.29.913/202344,4920$0.40420.29s
2026-08-14 02:31 · पुन्हा चाचणी66/66 प्रयत्न7.98.910.013/223409,709114,191$0.49523.51s
फरक0.0+0.3-0.10-1-65217-114191-$0.091-3220ms

बेंचमार्क कव्हरेज वेगळे आहे: 60/60 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 66/66 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.

या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.

चार्ट्स

पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

झटपट तुलना

श्रेणीवार तपशील

श्रेणी स्कोअर सुसंगतता बरोबर चाचण्या
अँटी-एआय युक्त्या 8.7 7.9
कोडिंग 8.2 6.7
संयुक्त 10.0 10.0
डेटा पार्सिंग आणि निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 7.7 10.0
Samanya Buddhimatta 4.0 10.0
सूचनांचे पालन 9.8 10.0
कोडी सोडवणे 5.7 9.9
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना केलेली मॉडेल्स