नेव्हिगेशन
AI BENCHY
Advertise here

Trinity Large Thinking (medium) vs Kimi K2.6

Trinity Large Thinking (medium) average score मध्ये पुढे आहे: 6.0 vs 5.8. Kimi K2.6 चा benchmark खर्च कमी आहे: $0.158 vs $0.792. Kimi K2.6 वेगवान आहे: 19.58s vs 84.96s, pass rates 45.5% vs 34.9%.

AI BENCHY टेस्ट सूटमधून बेंचमार्क या वेळी तयार झाले: 2026-07-28

क्रमांक
#150
एकूण आउटपुट टोकन्स
1,002,646
प्रतिसाद वेळ (सरासरी)
84.96s
एकूण खर्च
$0.792
क्रमांक
#155
एकूण आउटपुट टोकन्स
30,253
प्रतिसाद वेळ (सरासरी)
19.58s
एकूण खर्च
$0.158
शिफारस केलेले मॉडेल Kimi K2.6

Its score stays close to the best score here (5.8 vs 6.0), while costing about 5.0x less than Trinity Large Thinking (medium).

तपशीलवार तुलना

मेट्रिक Trinity Large Thinking Trinity Large Thinking medium प्रकाशन: 2026-07-28 Kimi K2.6 Kimi K2.6 none प्रकाशन: 2026-04-20
स्कोअर 6.0 5.8
क्रमांक #150 #155
विश्वसनीयता 10.0 10.0
सुसंगतता 7.6 9.3
बरोबर चाचण्या
प्रति प्रयत्न पास दर 45.5% 34.9%
अस्थिर चाचण्या 7 2
एकूण रन 66 66
प्रति निकाल खर्च 11.308 3.199
एकूण खर्च $0.792 $0.158
इनपुट किंमत $0.220 / 1M $0.646 / 1M
आउटपुट किंमत $0.850 / 1M $2.720 / 1M
एकूण इनपुट टोकन्स 118,477 116,970
आउटपुट टोकन्स 148,823 30,253
रिझनिंग टोकन्स 853,823 0
प्रतिसाद वेळ (सरासरी) 84.96s 19.58s
प्रतिसाद वेळ (कमाल) 525.14s 238.89s
प्रतिसाद वेळ (एकूण) 1869.16s 430.85s

मॉडेल जनरेशन शोकेस

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#150 Trinity Large Thinking

medium
खर्च
$0.016
वेळ
75.9s
टोकन्स
19,401 tok

#155 MoonshotAI: Kimi K2.6

none
खर्च
$0.020
वेळ
127.4s
टोकन्स
4,429 tok

स्कोअरनुसार शीर्ष मॉडेल्स

स्कोअर विरुद्ध एकूण खर्च

प्रतिसाद वेळ (सरासरी)

स्कोअर vs प्रतिसाद वेळ (सरासरी)

एकूण आउटपुट टोकन्स

स्कोअर vs एकूण आउटपुट टोकन्स

श्रेणीवार तपशील

कोडिंग स्कोअर सुसंगतता प्रति प्रयत्न पास दर अस्थिर चाचण्या बरोबर चाचण्या प्रतिसाद वेळ (सरासरी) इनपुट टोकन्स आउटपुट टोकन्स रिझनिंग टोकन्स
Trinity Large Thinking 7.5 10.0 66.7% 0 179.02s 7,248 7,413 351,155
Kimi K2.6 5.5 9.8 33.3% 0 82.57s 5,986 14,754 0

झटपट तुलना

तुलना जोडी बदला