التنقل
AI BENCHY
AD
Track all your projects in one dashboard. Get 📊stats, 🔥heatmaps and 👀recordings in one self-hosted dashboard.
uxwizz.com

النماذج المقارنة

مقارنة benchmark بين Claude Opus 5 (high) vs GPT-5.6 Sol (high) vs Kimi K3 (max) vs Gemini 3.6 Flash (medium)يتصدر Gemini 3.6 Flash (medium) في النتيجة بقيمة 9.9. يتصدر Claude Opus 5 (high) في الموثوقية بقيمة 10.0. يمتلك Gemini 3.6 Flash (medium) أقل إجمالي التكلفة عند $0.831. Gemini 3.6 Flash (medium) هو الأسرع عند 10.11s.

النموذج الموصى بهGemini 3.6 Flash (medium)It has the best score here (9.9), while costing about 2.9x less than النماذج الأخرى في هذه المقارنة.

تم إنشاء نتائج المعايير من مجموعات اختبارات AI BENCHY في: 2026-07-25

المقياس Claude Opus 5 Claude Opus 5 high الإصدار: 2026-07-25 GPT-5.6 Sol GPT-5.6 Sol high الإصدار: 2026-07-09 Kimi K3 Kimi K3 max الإصدار: 2026-07-16 Gemini 3.6 Flash Gemini 3.6 Flash medium الإصدار: 2026-07-21
النتيجة 9.2 9.4 8.0 9.9
الترتيب #11 #8 #40 #1
الموثوقية 10.0 10.0 9.1 10.0
الاتساق 9.6 8.9 9.5 9.6
اختبارات صحيحة
معدل النجاح لكل محاولة 84.9% 89.4% 75.8% 98.5%
اختبارات غير مستقرة 1 3 1 1
إجمالي مرات التشغيل 66 66 66 66
التكلفة لكل نتيجة 15.747 6.852 19.446 3.955
إجمالي التكلفة $2.835 $1.234 $3.112 $0.831
سعر الإدخال $5.000 / 1M $5.000 / 1M $3.000 / 1M $1.500 / 1M
سعر الإخراج $25.000 / 1M $30.000 / 1M $15.000 / 1M $7.500 / 1M
إجمالي رموز الإدخال 135,959 79,249 34,916 66,293
رموز الإخراج 67,066 4,855 2,910 2,000
رموز الاستدلال 19,114 23,044 197,529 95,464
زمن الاستجابة (المتوسط) 20.44s 11.73s 122.48s 10.11s
زمن الاستجابة (الحد الأقصى) 159.01s 54.79s 766.58s 68.03s
زمن الاستجابة (الإجمالي) 449.68s 257.99s 2327.06s 222.33s

Hamster playing table tennis

Prompt: Create a detailed SVG illustration of a hamster playing table tennis.

#11 Claude Opus 5

high
التكلفة
$0.265
الوقت
144.5s
الرموز
10,741 tok

#8 GPT-5.6 Sol

high
التكلفة
$0.151
الوقت
201.9s
الرموز
5,100 tok

#40 MoonshotAI: Kimi K3

max
التكلفة
$0.281
الوقت
506.9s
الرموز
18,863 tok

#1 Gemini 3.6 Flash

medium
التكلفة
$0.079
الوقت
47.9s
الرموز
10,532 tok

أفضل النماذج حسب الدرجة

الدرجة مقابل التكلفة الإجمالية

زمن الاستجابة (المتوسط)

النتيجة vs زمن الاستجابة (المتوسط)

إجمالي رموز الإخراج

النتيجة vs إجمالي رموز الإخراج

تفصيل الفئات

البرمجة النتيجة الاتساق معدل النجاح لكل محاولة اختبارات غير مستقرة اختبارات صحيحة زمن الاستجابة (المتوسط) رموز الإدخال رموز الإخراج رموز الاستدلال
Claude Opus 5 10.0 10.0 100.0% 0 12.73s 10,590 7,547 1,721
GPT-5.6 Sol 10.0 10.0 100.0% 0 12.52s 7,302 404 5,656
Kimi K3 10.0 10.0 100.0% 0 325.79s 8,061 460 84,012
Gemini 3.6 Flash 10.0 10.0 100.0% 0 17.49s 8,136 474 40,157

مقارنة سريعة

تبديل زوج المقارنة