Advertise here
#142

Qwen3.5 Plus 2026-02-15

Qwen रिलीज़: 2026-02-15 परीक्षण किया गया: 2026-10-01 00:30 qwen/qwen3.5-plus-02-15::medium
~397B कुल (~17B सक्रिय)MoEबंद स्रोतअनुमानित
(medium) (none)

सारांश

Qwen3.5 Plus 2026-02-15 AI BENCHY पर 7.2 स्कोर करता है और #142 पर है। इसकी reliability 10.0, pass rate 72.5%, कुल लागत $0.567, और औसत response time 97.68s है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

अनुमानित
पैरामीटर
~397B कुल (~17B सक्रिय)
आर्किटेक्चर
MoE
उपलब्धता
बंद स्रोत
लाइसेंस
-

सार्वजनिक साक्ष्यों पर आधारित सर्वोत्तम अनुमान; प्रदाता ने सभी मान जारी नहीं किए हैं।

संगति

7.9

कुल आउटपुट टोकन

302,730

कुल इनपुट टोकन

249,486

इनपुट कीमत

$0.260 / 1M

आउटपुट कीमत

$1.560 / 1M

कैश पढ़ने की कीमत

लागू नहीं

कैश लिखने की कीमत

लागू नहीं

कैश की कीमतें इनपुट टोकन पर लागू होती हैं। पढ़ने पर कैश किए गए प्रॉम्प्ट का दोबारा उपयोग होता है; लिखने पर वे सहेजे जाते हैं और अतिरिक्त लागत हो सकती है। आउटपुट टोकन पर आउटपुट की कीमत लागू होती है।

सही परीक्षण

गलत टेस्ट: 9

प्रति प्रयास पास दर: 72.5%

अस्थिर टेस्ट

6

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

97.68s

प्रतिक्रिया समय (अधिकतम): 304.85s

प्रतिक्रिया समय (कुल): 1562.81s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#142 Qwen3.5 Plus 2026-02-15

medium
लागत
$0.011
समय
125.5s
टोकन
7,040 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-10-01 00:30 दोबारा परीक्षण 7.2 10.0 $0.567 वर्तमान रन
2026-07-16 21:32 नया टेस्ट जोड़ा गया 7.5 10.0 $0.437 ↓ तुलना करें
2026-06-04 13:17 नया टेस्ट जोड़ा गया 7.9 8.9 $0.310 ↓ तुलना करें
2026-05-21 23:53 सूट बदला गया 8.1 10.0 $0.317 तुलना करें
2026-04-11 01:44 पहला दर्ज रन 8.5 लागू नहीं $0.220 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-10-01 00:30 · वर्तमान रन69/69 प्रयास7.27.910.014/236302,730249,486$0.56797.68s
2026-04-11 01:44 · पहला दर्ज रन54/54 प्रयास8.59.1लागू नहीं14/182114,0100$0.22046.56s
अंतर—-1.3-1.20+4+188720+249486+$0.348+51112ms

बेंचमार्क कवरेज अलग है: 69/69 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 54/54 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
स्वायत्त एजेंट कार्य 6.1 3.1
एंटी-एआई ट्रिक्स 8.2 7.9
कोडिंग 6.6 7.1
संयुक्त 6.9 5.9
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 5.3 7.2
Samanya Buddhimatta 4.7 1.6
निर्देश पालन 10.0 10.0
पहेली समाधान 10.0 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल