التنقل
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

النماذج المقارنة

مقارنة benchmark بين Nemotron 3 Super (medium) vs Qwen3.5-122B-A10B (medium) vs Elephant Alpha (medium) vs gpt-oss-120b (medium): يتصدر Qwen3.5-122B-A10B (medium) في النتيجة بقيمة 7.1. يتصدر Qwen3.5-122B-A10B (medium) في الموثوقية بقيمة 10.0. يمتلك Elephant Alpha (medium) أقل إجمالي التكلفة عند $0.000. Elephant Alpha (medium) هو الأسرع عند 1.27s.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-09-04

الترتيب
#217
إجمالي رموز الإخراج
115,574
زمن الاستجابة (المتوسط)
52.31s
إجمالي التكلفة
$0.050
الترتيب
#127
إجمالي رموز الإخراج
487,519
زمن الاستجابة (المتوسط)
65.67s
إجمالي التكلفة
$1.207
الترتيب
#295
إجمالي رموز الإخراج
2,596
زمن الاستجابة (المتوسط)
1.27s
إجمالي التكلفة
$0.000
الترتيب
#189
إجمالي رموز الإخراج
98,282
زمن الاستجابة (المتوسط)
20.81s
إجمالي التكلفة
$0.020
النموذج الموصى به gpt-oss-120b (medium)

It offers the best overall trade-off: a competitive score (6.1), lower cost than النماذج الأخرى في هذه المقارنة, and balanced response time.

مقارنة تفصيلية

المقياس Nemotron 3 Super Nemotron 3 Super medium الإصدار: 2026-03-11 متاح مجانًا Qwen3.5-122B-A10B Qwen3.5-122B-A10B medium الإصدار: 2026-02-24 Elephant Alpha Elephant Alpha medium الإصدار: 2026-04-14 gpt-oss-120b gpt-oss-120b medium الإصدار: 2025-08-05
النتيجة 5.7 7.1 4.3 6.1
الترتيب #217 #127 #295 #189
الموثوقية 9.1 10.0 غير متاح 10.0
الاتساق 8.9 8.5 9.2 8.0
محاولات 66/66 66/66 63/66 66/66
اختبارات صحيحة
معدل النجاح لكل محاولة 40.9% 71.2% 28.8% 50.0%
اختبارات غير مستقرة 3 4 1 5
إجمالي مرات التشغيل 66 66 63 66
التكلفة لكل نتيجة 0.004 8.446 0.000 0.224
إجمالي التكلفة $0.050 $1.207 $0.000 $0.020
سعر الإدخال $0.085 / 1M $0.290 / 1M $0.000 / 1M $0.037 / 1M
سعر الإخراج $0.400 / 1M $2.400 / 1M $0.000 / 1M $0.170 / 1M
إجمالي رموز الإدخال 81,438 124,780 33,744 108,767
رموز الإخراج 17,674 47,694 2,596 29,378
رموز الاستدلال 97,900 439,825 0 68,904
زمن الاستجابة (المتوسط) 52.31s 65.67s 1.27s 20.81s
زمن الاستجابة (الحد الأقصى) 431.98s 519.30s 3.70s 68.16s
زمن الاستجابة (الإجمالي) 1046.21s 1444.68s 22.82s 332.88s
المعلمات 120B الإجمالي (12B النشطة) 122B الإجمالي (10B النشطة) 104B الإجمالي (7.4B النشطة) 117B الإجمالي (5.1B النشطة)
الإتاحة الأوزان متاحة مفتوح المصدر مفتوح المصدر مفتوح المصدر

عرض إنشاء النماذج

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#217 Nemotron 3 Super

medium
التكلفة
$0.000
الوقت
272.6s
الرموز
5,296 tok

#127 Qwen3.5-122B-A10B

medium
التكلفة
$0.019
الوقت
48.7s
الرموز
6,034 tok

#295 Elephant Alpha

medium
Elephant Alpha was a stealth model revealed on April 21st as Ling-2.6-flash. Find it here: https://openrouter.ai/inclusionai/ling-2.6-flash:free
التكلفة
$0.000
الوقت
0.1s
الرموز
0 tok

#189 gpt-oss-120b

medium
التكلفة
$0.001
الوقت
26.7s
الرموز
555 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Nemotron 3 Super 3.1 10.0 0.0% 0 147.32s 2,275 797 4,424
Qwen3.5-122B-A10B 6.0 7.2 55.6% 1 114.48s 7,630 8,057 82,578
Elephant Alpha 3.7 7.8 11.1% 1 1.30s 813 365 0
gpt-oss-120b 5.9 7.0 55.6% 1 38.37s 7,782 3,365 11,973

مقارنة سريعة

تبديل زوج المقارنة