Advertise here
#151

Qwen3.5-9B

Qwen रिलीज़: 2026-03-02 परीक्षण किया गया: 2026-05-22 00:18 qwen/qwen3.5-9b::medium
9Bसघनमुक्त स्रोत
(medium) (none)

सारांश

Qwen3.5-9B AI BENCHY पर 4.2 स्कोर करता है और #151 पर है। इसकी reliability 1.7, pass rate 31.7%, कुल लागत $0.035, और औसत response time 80.10s है।

Qwen3.5-9B को अलग क्या बनाता है: इस score range के लिए इसकी कुल benchmark लागत असामान्य रूप से कम है।

मॉडल विवरण

शोध की तारीख: 2026-08-12

घोषित
पैरामीटर
9B
आर्किटेक्चर
सघन
उपलब्धता
मुक्त स्रोत
लाइसेंस
Apache-2.0

संगति

7.0

कुल आउटपुट टोकन

229,656

कुल इनपुट टोकन

0

इनपुट कीमत

$0.040 / 1M

आउटपुट कीमत

$0.150 / 1M

सही परीक्षण

गलत टेस्ट: 17

प्रति प्रयास पास दर: 31.7%

अस्थिर टेस्ट

7

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

80.10s

प्रतिक्रिया समय (अधिकतम): 226.38s

प्रतिक्रिया समय (कुल): 1281.62s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#151 Qwen3.5-9B

medium
लागत
$0.001
समय
35.9s
टोकन
3,030 tok

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-08-14 02:23 दोबारा परीक्षण 3.8 6.0 $0.062 तुलना करें
2026-07-16 23:12 नया टेस्ट जोड़ा गया 3.8 5.0 $0.036 तुलना करें
2026-06-04 13:41 नया टेस्ट जोड़ा गया 4.2 5.6 $0.035 तुलना करें
2026-05-22 00:18 सूट बदला गया 4.2 1.7 $0.035 वर्तमान रन
2026-05-08 14:44 सूट बदला गया 4.3 3.3 $0.035 तुलना करें
2026-05-08 14:44 सूट बदला गया 4.3 3.3 $0.035 तुलना करें
2026-04-20 17:48 पहला दर्ज रन 4.4 लागू नहीं $0.030 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 5.1 5.8
कोडिंग 2.8 10.0
संयुक्त 3.0 10.0
डेटा पार्सिंग और निष्कर्षण 3.6 5.6
डोमेन-विशिष्ट 3.6 7.2
Samanya Buddhimatta 2.8 1.6
निर्देश पालन 6.4 5.8
पहेली समाधान 2.9 7.2
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल