नेविगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (low) vs Qwen3.5-Flash

average score लगभग बराबर है: 6.0 vs 6.1. Qwen3.5-Flash की benchmark लागत कम है: $0.073 vs $0.656. Qwen3.5-Flash तेज है: 25.28s vs 96.78s, pass rates 48.5% vs 39.4%.

बेंचमार्क AI BENCHY टेस्ट सूट्स से इस समय जनरेट किए गए:: 2026-07-28

रैंक
#145
कुल आउटपुट टोकन
815,220
प्रतिक्रिया समय (औसत)
96.78s
कुल लागत
$0.656
रैंक
#140
कुल आउटपुट टोकन
209,201
प्रतिक्रिया समय (औसत)
25.28s
कुल लागत
$0.073
अनुशंसित मॉडल Qwen3.5-Flash

It has the best score here (6.1), while costing about 9.0x less than Trinity Large Thinking (low).

विस्तृत तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking low रिलीज़: 2026-07-28 Qwen3.5-Flash Qwen3.5-Flash none रिलीज़: 2026-02-24
स्कोर 6.0 6.1
रैंक #145 #140
विश्वसनीयता 9.7 10.0
संगति 7.9 9.3
सही परीक्षण
प्रति प्रयास पास दर 48.5% 39.4%
अस्थिर टेस्ट 6 2
कुल रन 66 66
प्रति परिणाम लागत 8.199 0.933
कुल लागत $0.656 $0.073
इनपुट कीमत $0.220 / 1M $0.065 / 1M
आउटपुट कीमत $0.850 / 1M $0.260 / 1M
कुल इनपुट टोकन 122,845 282,347
आउटपुट टोकन 117,704 209,201
रीजनिंग टोकन 697,516 0
प्रतिक्रिया समय (औसत) 96.78s 25.28s
प्रतिक्रिया समय (अधिकतम) 540.96s 480.96s
प्रतिक्रिया समय (कुल) 2129.13s 556.24s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#145 Trinity Large Thinking

low
लागत
$0.021
समय
173.2s
टोकन
24,586 tok

#140 Qwen3.5-Flash

none
लागत
$0.003
समय
47.4s
टोकन
7,799 tok

स्कोर के अनुसार शीर्ष मॉडल

स्कोर बनाम कुल लागत

प्रतिक्रिया समय (औसत)

स्कोर vs प्रतिक्रिया समय (औसत)

कुल आउटपुट टोकन

स्कोर vs कुल आउटपुट टोकन

श्रेणी विवरण

कोडिंग स्कोर संगति प्रति प्रयास पास दर अस्थिर टेस्ट सही परीक्षण प्रतिक्रिया समय (औसत) इनपुट टोकन आउटपुट टोकन रीजनिंग टोकन
Trinity Large Thinking 5.3 10.0 33.3% 0 344.45s 5,441 27,039 217,241
Qwen3.5-Flash 5.5 10.0 33.3% 0 850ms 7,913 519 0

त्वरित तुलना

तुलना जोड़ी बदलें