#8 Qwen3.5 Plus 2026-02-15
medium- लागत
- $0.011
- समय
- 125.5s
- टोकन
- 7,040 tok
सारांश
Qwen3.5 Plus 2026-02-15 AI BENCHY पर 8.5 स्कोर करता है और #8 पर है। इसकी reliability लागू नहीं, pass rate 83.3%, कुल लागत $0.220, और औसत response time 46.56s है।
Qwen3.5 Plus 2026-02-15 को अलग क्या बनाता है: इस score range के लिए इसकी कुल benchmark लागत असामान्य रूप से कम है।
शोध की तारीख: 2026-08-12
सार्वजनिक साक्ष्यों पर आधारित सर्वोत्तम अनुमान; प्रदाता ने सभी मान जारी नहीं किए हैं।
8.5
संगति
9.1
लागू नहीं
$0.220
कुल आउटपुट टोकन
114,010
कुल इनपुट टोकन
0
इनपुट कीमत
$0.260 / 1M
आउटपुट कीमत
$1.560 / 1M
कैश पढ़ने की कीमत
लागू नहीं
कैश लिखने की कीमत
लागू नहीं
कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।
अस्थिर टेस्ट
2
अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।
Prompt: Create a detailed SVG illustration of a hamster playing table tennis.
रन इतिहास
| परीक्षण किया गया | स्कोर | विश्वसनीयता | सही परीक्षण | कुल लागत | तुलना करें |
|---|---|---|---|---|---|
| 2026-08-14 01:42 दोबारा परीक्षण | 7.5 | 10.0 | $0.459 ↓ | तुलना करें | |
| 2026-07-16 21:32 नया टेस्ट जोड़ा गया | 7.5 | 10.0 | $0.437 ↓ | तुलना करें | |
| 2026-06-04 13:17 नया टेस्ट जोड़ा गया | 7.9 | 8.9 | $0.310 ↓ | तुलना करें | |
| 2026-05-21 23:53 सूट बदला गया | 8.1 | 10.0 | $0.317 | तुलना करें | |
| 2026-04-11 01:44 पहला दर्ज रन | 8.5 | लागू नहीं | $0.220 | वर्तमान रन |
रन तुलना
| रन | बेंचमार्क कवरेज | स्कोर | संगति | विश्वसनीयता | सही परीक्षण | अस्थिर टेस्ट | कुल आउटपुट टोकन | कुल इनपुट टोकन | कुल लागत | प्रतिक्रिया समय (औसत) |
|---|---|---|---|---|---|---|---|---|---|---|
| 2026-04-11 01:44 · पहला दर्ज रन | 54/54 प्रयास | 8.5 | 9.1 | लागू नहीं | 14/18 | 2 | 114,010 | 0 | $0.220 | 46.56s |
| 2026-08-14 01:42 · दोबारा परीक्षण | 66/66 प्रयास | 7.5 | 8.1 | 10.0 | 14/22 | 5 | 274,709 | 113,569 | $0.459 | 91.76s |
| अंतर | — | +1.0 | +1.0 | 0 | -3 | -160699 | -113569 | -$0.239 | -45197ms |
बेंचमार्क कवरेज अलग है: 54/54 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 66/66 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।
इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।
पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।
| श्रेणी | स्कोर | संगति | सही परीक्षण |
|---|---|---|---|
| एंटी-एआई ट्रिक्स | 8.2 | 7.9 | |
| कोडिंग | 10.0 | 10.0 | |
| संयुक्त | 10.0 | 10.0 | |
| डेटा पार्सिंग और निष्कर्षण | 10.0 | 10.0 | |
| डोमेन-विशिष्ट | 5.3 | 10.0 | |
| Samanya Buddhimatta | 4.7 | 1.6 | |
| निर्देश पालन | 10.0 | 10.0 | |
| पहेली समाधान | 10.0 | 10.0 | |
| टूल कॉलिंग | 10.0 | 10.0 |