AI BENCHY
Advertise here

#104

Qwen3.5-Flash

Qwen रिलीज़: 2026-02-24 परीक्षण किया गया: 2026-05-21 23:55 qwen/qwen3.5-flash-02-23::none
(medium) (none)

संगति

9.7

कुल आउटपुट टोकन

4,270

इनपुट कीमत

$0.065 / 1M

आउटपुट कीमत

$0.260 / 1M

सही परीक्षण

गलत टेस्ट: 12

प्रति प्रयास पास दर: 41.7%

अस्थिर टेस्ट

1

अस्थिर टेस्ट में रनों के बीच मिले-जुले परिणाम रहे (कम से कम एक पास और एक फेल)।

प्रतिक्रिया समय (औसत)

3.74s

प्रतिक्रिया समय (अधिकतम): 27.18s

प्रतिक्रिया समय (कुल): 74.71s

रन इतिहास

परीक्षण किया गया स्कोर विश्वसनीयता सही परीक्षण कुल लागत तुलना करें
2026-05-21 23:55 सूट बदला गया 5.9 10.0 $0.006 वर्तमान रन
2026-04-11 01:19 पहला दर्ज रन 6.2 लागू नहीं $0.006 तुलना करें

इस रन में अलग बेंचमार्क सूट इस्तेमाल हुआ था। ऐतिहासिक बदलाव पढ़ते समय सूट बदलाव को ध्यान में रखें।

चार्ट

पहले मॉडल चुनें, फिर दूसरा मॉडल क्लिक करके साइड-बाय-साइड पेज खोलें।

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

त्वरित तुलना

श्रेणी विवरण

श्रेणी स्कोर संगति सही परीक्षण
एंटी-एआई ट्रिक्स 3.5 8.3
कोडिंग 6.8 10.0
संयुक्त 3.0 10.0
डेटा पार्सिंग और निष्कर्षण 10.0 10.0
डोमेन-विशिष्ट 7.7 10.0
Samanya Buddhimatta 10.0 10.0
निर्देश पालन 6.3 10.0
पहेली समाधान 3.1 10.0
टूल कॉलिंग 10.0 10.0
सामान्य ज्ञान 3.0 10.0

तुलना किए गए मॉडल