AI BENCHY
排行榜
比较
图表
展示
AI World Cup
Ctrl K
语言:
🇸🇦 Arabic
🇧🇩 Bangla
🇩🇪 German
🇺🇸 English
🇪🇸 Spanish
🇫🇷 French
🇮🇳 Hindi
🇮🇩 Indonesian
🇯🇵 Japanese
🇮🇳 Marathi
🇳🇱 Dutch
🇵🇹 Portuguese
🇷🇴 Romanian
🇷🇺 Russian
🇰🇪 Swahili
🇵🇰 Urdu
🇨🇳 Chinese
主题
❤️ Made by XCS
导航
排行榜
比较
图表
展示
AI World Cup
语言
🇸🇦 Arabic
🇧🇩 Bangla
🇩🇪 German
🇺🇸 English
🇪🇸 Spanish
🇫🇷 French
🇮🇳 Hindi
🇮🇩 Indonesian
🇯🇵 Japanese
🇮🇳 Marathi
🇳🇱 Dutch
🇵🇹 Portuguese
🇷🇴 Romanian
🇷🇺 Russian
🇰🇪 Swahili
🇵🇰 Urdu
🇨🇳 Chinese
主题
❤️ Made by XCS
搜索 AI BENCHY
搜索 AI BENCHY
Advertise here
AD
Track all your projects in one dashboard.
UXWizz - self-hosted web analytics!
Get 📊
stats
, 🔥
heatmaps
and 👀
recordings
in one self-hosted dashboard.
Improve your websites without sharing any of your data. Get 📊
stats
, 🔥
heatmaps
and 🎥
session recordings
in your own, self-hosted dashboard!
uxwizz.com
排行榜
→
综合
综合
反AI技巧
通用智能
指令遵循
编程
数据解析与提取
谜题求解
领域专项
工具调用
常识问答
综合 排名
综合 排名
看看哪些 AI 模型在 综合 上表现最好,哪些更稳定,以及差距主要出现在哪里。
显示的模型数
1
综合 得分 平均值
5.9
最佳模型
Gemini 3.6 Flash
10.0
失败原因
失败原因为 无效工具调用
147
失败原因为 答案错误
95
失败原因为 无答案
43
失败原因为 API 错误
37
失败原因为 超时
9
失败原因为 未遵循指令
1
失败原因为 额外格式
1
筛选
0
316/316
筛选模型
重置筛选
总成本
×
$0.000-$5.600
$0.000
$5.600
分数范围
×
1-10
1
10
响应时间(平均) (ms)
×
<
测试正确
×
0-2
0
2
总参数规模
(?)
请输入以十亿参数为单位的模型规模。例如,7B 模型请输入 7。
×
–
开放状态
开源
权重可用
闭源
架构
稠密
MoE
其他
没有模型匹配当前搜索和筛选条件。
排名
模型
公司
综合 得分
↓
分数
↕
总成本
↕
测试正确
↕
响应时间(平均)
↕
#316
LFM2-24B-A2B
none
Liquid
1.5
2.2
$0.001
0/1
0ms
总测试数
1
错误测试数
1
总成本
$0.001
响应时间(平均)
0ms
←
1
...
21
22
→
按 综合 得分 排名的顶级模型
综合 得分 vs 总成本
按 响应时间(平均) 排名的顶级模型