#15 Gemma 4 31B
medium- खर्च
- $0.002
- वेळ
- 45.7s
- टोकन्स
- 2,696 tok
सारांश
Gemma 4 31B AI BENCHY वर 8.3 स्कोर करते आणि #15 वर आहे. याची reliability लागू नाही, pass rate 79.6%, एकूण खर्च $0.018, आणि सरासरी response time 24.88s आहे.
Gemma 4 31B खास का आहे: या score range साठी एकूण benchmark खर्च असामान्यपणे कमी आहे.
संशोधन दिनांक: 2026-08-12
8.3
सुसंगतता
9.2
लागू नाही
$0.018
एकूण आउटपुट टोकन्स
40,684
एकूण इनपुट टोकन्स
0
इनपुट किंमत
$0.130 / 1M
आउटपुट किंमत
$0.380 / 1M
कॅश वाचण्याची किंमत
लागू नाही
कॅश लिहिण्याची किंमत
लागू नाही
कॅशच्या किमती इनपुट टोकनला लागू होतात. वाचताना साठवलेले प्रॉम्प्ट पुन्हा वापरले जातात; लिहिताना ते साठवले जातात आणि अधिक खर्च होऊ शकतो. आउटपुट टोकनला आउटपुट किंमत लागू होते.
अस्थिर चाचण्या
2
अस्थिर चाचण्यांत रन्समध्ये मिश्र निकाल असतात (किमान एक पास आणि एक फेल).
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
रन इतिहास
| चाचणी तारीख | स्कोअर | विश्वसनीयता | बरोबर चाचण्या | एकूण खर्च | तुलना करा |
|---|---|---|---|---|---|
| 2026-08-14 02:55 पुन्हा चाचणी | 6.2 | 10.0 | $0.101 ↓ | तुलना करा | |
| 2026-07-16 23:24 नवीन चाचणी जोडली | 6.3 | 10.0 | $0.163 ↑ | तुलना करा | |
| 2026-06-04 14:27 नवीन चाचणी जोडली | 7.9 | 8.9 | $0.035 ↓ | तुलना करा | |
| 2026-05-22 00:35 सूट बदलला | 8.0 | 6.7 | $0.029 | तुलना करा | |
| 2026-04-14 00:56 पहिली नोंदलेली रन | 8.3 | लागू नाही | $0.018 | सध्याची रन |
रन तुलना
| रन | बेंचमार्क कव्हरेज | स्कोअर | सुसंगतता | विश्वसनीयता | बरोबर चाचण्या | अस्थिर चाचण्या | एकूण आउटपुट टोकन्स | एकूण इनपुट टोकन्स | एकूण खर्च | प्रतिसाद वेळ (सरासरी) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-04-14 00:56 · पहिली नोंदलेली रन | 54/54 प्रयत्न | 8.3 | 9.2 | लागू नाही | 13/18 | 2 | 40,684 | 0 | $0.018 | 24.88s |
| 2026-06-04 14:27 · नवीन चाचणी जोडली | 63/63 प्रयत्न | 7.9 | 9.1 | 8.9 | 14/21 | 2 | 88,082 | 17,957 | $0.035 | 56.55s |
| फरक | — | +0.5 | +0.1 | -1 | 0 | -47398 | -17957 | -$0.017 | -31664ms |
बेंचमार्क कव्हरेज वेगळे आहे: 54/54 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती) विरुद्ध 63/63 प्रयत्न (लक्ष्य: प्रत्येक चाचणीसाठी 3 पुनरावृत्ती). एकूण मूल्ये आणि पुनरावृत्तीवर अवलंबून मेट्रिक्स थेट तुलना करता येत नाहीत.
या दोन रनमध्ये वेगवेगळे बेंचमार्क सूट वापरले गेले, त्यामुळे फरकांमध्ये मॉडेलमधील आणि सूटमधील दोन्ही बदल दिसतात.
पहिले मॉडेल निवडा, नंतर दुसरे मॉडेल क्लिक करून बाजू-बाजूची तुलना पेज उघडा.
| श्रेणी | स्कोअर | सुसंगतता | बरोबर चाचण्या |
|---|---|---|---|
| अँटी-एआय युक्त्या | 10.0 | 10.0 | |
| कोडिंग | 4.7 | 1.6 | |
| संयुक्त | 3.0 | 10.0 | |
| डेटा पार्सिंग आणि निष्कर्षण | 10.0 | 10.0 | |
| डोमेन-विशिष्ट | 7.7 | 10.0 | |
| Samanya Buddhimatta | 10.0 | 10.0 | |
| सूचनांचे पालन | 10.0 | 10.0 | |
| कोडी सोडवणे | 8.8 | 7.9 | |
| टूल कॉलिंग | 3.0 | 10.0 |