Advertise here
#142

Qwen3.5-9B

Qwen रिलीज़: 2026-03-02 परीक्षण किया गया: 2026-05-22 00:02 qwen/qwen3.5-9b::none
9Bसघनमुक्त स्रोत
(medium) (none)

सारांश

Qwen3.5-9B AI BENCHY पर 4.6 स्कोर करता है और #142 पर है। इसकी reliability 10.0, pass rate 21.7%, कुल लागत $0.005, और औसत response time 1.69s है।

Qwen3.5-9B को अलग क्या बनाता है: इस score range के लिए इसकी कुल benchmark लागत असामान्य रूप से कम है। यह समान मॉडलों की तुलना में काफ़ी तेज है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
9B
आर्किटेक्चर
सघन
उपलब्धता
मुक्त स्रोत
लाइसेंस
Apache-2.0

संगति

9.7

कुल आउटपुट टोकन

3,984

कुल इनपुट टोकन

0

इनपुट कीमत

$0.040 / 1M

आउटपुट कीमत

$0.150 / 1M

सही परीक्षण

गलत टेस्ट: 16

प्रति प्रयास पास दर: 21.7%

अस्थिर टेस्ट

1

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

1.69s

प्रतिक्रिया समय (अधिकतम): 5.91s

प्रतिक्रिया समय (कुल): 33.84s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#142 Qwen3.5-9B

none
Reached the allocated time limit (300 seconds) without receiving showcase output.
लागत
$0.000
समय
300.0s
टोकन
0 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 01:54 दोबारा परीक्षण 5.1 10.0 $0.021 तुलना करें
2026-07-16 22:25 नया टेस्ट जोड़ा गया 5.1 10.0 $0.021 तुलना करें
2026-06-04 13:30 नया टेस्ट जोड़ा गया 4.6 10.0 $0.003 तुलना करें
2026-05-22 00:02 सूट बदला गया 4.6 10.0 $0.005 वर्तमान रन
2026-05-08 13:28 सूट बदला गया 4.7 10.0 $0.005 तुलना करें
2026-05-08 13:28 सूट बदला गया 4.7 10.0 $0.005 तुलना करें
2026-04-20 17:48 पहला दर्ज रन 4.8 लागू नहीं $0.005 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

रन तुलना

रनबेंचमार्क कवरेजस्कोरसंगतिविश्वसनीयतासही परीक्षणअस्थिर टेस्टकुल आउटपुट टोकनकुल इनपुट टोकनकुल लागतप्रतिक्रिया समय (औसत)
2026-05-22 00:02 · सूट बदला गया60/60 प्रयास4.69.710.04/2013,9840$0.0051.69s
2026-07-16 22:25 · नया टेस्ट जोड़ा गया66/66 प्रयास5.19.710.04/22137,484144,407$0.02119.17s
अंतर-0.50.00.000-33500-144407-$0.016-17478ms

बेंचमार्क कवरेज अलग है: 60/60 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव) बनाम 66/66 प्रयास (लक्ष्य: प्रति टेस्ट 3 दोहराव)। कुल और दोहराव-संवेदनशील मेट्रिक सीधे तुलना योग्य नहीं हैं।

इन दो रन में अलग-अलग बेंचमार्क सूट इस्तेमाल हुए थे, इसलिए अंतर मॉडल बदलाव और सूट बदलाव दोनों को दर्शाते हैं।

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 3.1 9.9
कोडिंग 4.4 6.7
संयुक्त 3.0 10.0
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 3.0 10.0
Samanya Buddhimatta 4.4 9.9
निर्देश पालन 6.5 10.0
पहेली समाधान 3.1 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल