नेव्हिगेशन
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

Trinity Large Thinking (medium) vs Qwen3.5-Flash (medium)

average score जवळपास समान आहे: 6.1 vs 6.1. Qwen3.5-Flash (medium) चा benchmark खर्च कमी आहे: $0.142 vs $0.798. Qwen3.5-Flash (medium) वेगवान आहे: 84.44s vs 85.44s, pass rates 48.5% vs 65.2%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-08-26

क्रमांक
#178
एकूण आउटपुट टोकन्स
1,016,785
प्रतिसाद वेळ (सरासरी)
85.44s
एकूण खर्च
$0.798
क्रमांक
#176
एकूण आउटपुट टोकन्स
512,846
प्रतिसाद वेळ (सरासरी)
84.44s
एकूण खर्च
$0.142
शिफारस केलेले मॉडेल Qwen3.5-Flash (medium)

It has the best score here (6.1), while costing about 5.7x less than Trinity Large Thinking (medium).

तपशीलवार तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking medium प्रकाशन: 2026-07-28 Qwen3.5-Flash Qwen3.5-Flash medium प्रकाशन: 2026-02-24
स्कोअर 6.1 6.1
क्रमांक #178 #176
विश्वसनीयता 10.0 10.0
सुसंगतता 7.9 7.8
प्रयत्न 66/66 66/66
बरोबर चाचण्या
प्रति प्रयत्न पास दर 48.5% 65.2%
अस्थिर चाचण्या 6 6
एकूण रन 66 66
प्रति निकाल खर्च 9.972 1.491
एकूण खर्च $0.798 $0.142
इनपुट किंमत $0.220 / 1M $0.065 / 1M
आउटपुट किंमत $0.850 / 1M $0.260 / 1M
एकूण इनपुट टोकन्स 118,486 118,508
आउटपुट टोकन्स 156,166 35,457
रिझनिंग टोकन्स 860,619 477,389
प्रतिसाद वेळ (सरासरी) 85.44s 84.44s
प्रतिसाद वेळ (कमाल) 525.14s 515.38s
प्रतिसाद वेळ (एकूण) 1879.75s 1773.20s
पॅरामीटर्स 398B एकूण (13B सक्रिय) ~35B एकूण (~3B सक्रिय)
उपलब्धता वेट्स उपलब्ध बंद स्रोत

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#178 Trinity Large Thinking

medium
खर्च
$0.016
वेळ
75.9s
टोकन्स
19,401 tok

#176 Qwen3.5-Flash

medium
खर्च
$0.002
वेळ
25.8s
टोकन्स
4,294 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Trinity Large Thinking 7.5 10.0 66.7% 0 179.02s 7,248 7,413 351,155
Qwen3.5-Flash 3.7 7.2 22.2% 1 58.87s 6,685 302 90,081

झटपट तुलना

तुलना जोडी बदला