AI Benchy 排行榜

基准结果生成自 AI BENCHY 测试套件，时间：: 2026-07-18 已评估模型: 206

206/206

排名	模型	分数	公司	总成本	响应时间（平均）	测试正确
#204#204	Nemotron 3 Nano Omni 30b A3b Reasoningnone	3.2	NVIDIA	$0.000	728ms
查看模型卡片总测试数 19 错误测试数 17 可靠性 10.0 尝试通过率 15.2% 不稳定测试 2 输入令牌 11,661 输出令牌 1,302 推理令牌 0 响应时间（平均） 728ms 响应时间（总计） 9.47s 响应时间（最大） 2.21s 答案错误: 9 API 错误: 6 未遵循指令: 2 反AI技巧 : 4.8 编程 : 3.3 综合 : 1.5 数据解析与提取 : 3.8 领域专项 : 3.6 通用智能 : 3.0 指令遵循 : 4.8 谜题求解 : 3.0 工具调用 : 3.0 常识问答 : 3.0
#206#206	LFM2-24B-A2Bnone	2.2	Liquid	$0.001	782ms
查看模型卡片总测试数 16 错误测试数 14 可靠性不适用尝试通过率 12.1% 不稳定测试 1 输入令牌 10,771 输出令牌 1,173 推理令牌 0 响应时间（平均） 782ms 响应时间（总计） 10.94s 响应时间（最大） 3.15s 答案错误: 9 API 错误: 4 未遵循指令: 1 反AI技巧 : 2.5 编程 : 0.0 综合 : 1.5 数据解析与提取 : 3.0 领域专项 : 5.9 通用智能 : 4.0 指令遵循 : 6.3 谜题求解 : 3.8 工具调用 : 3.0 常识问答 : 0.0
#201#201	Laguna Xs.2none	3.8	Poolside	$0.004 ↕	806ms
查看模型卡片总测试数 19 错误测试数 14 可靠性 10.0 尝试通过率 22.7% 不稳定测试 0 输入令牌 33,675 输出令牌 2,826 推理令牌 0 响应时间（平均） 806ms 响应时间（总计） 12.09s 响应时间（最大） 2.01s 答案错误: 8 API 错误: 4 未遵循指令: 1 无效工具调用: 1 反AI技巧 : 3.0 编程 : 8.3 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 3.0 指令遵循 : 6.5 谜题求解 : 5.3 工具调用 : 3.0 常识问答 : 3.0
#185#185	Mercury 2none	4.6	Inception	$0.030	829ms
查看模型卡片总测试数 22 错误测试数 18 可靠性 10.0 尝试通过率 22.7% 不稳定测试 2 输入令牌 88,704 输出令牌 9,564 推理令牌 0 响应时间（平均） 829ms 响应时间（总计） 18.24s 响应时间（最大） 4.52s 答案错误: 17 未遵循指令: 1 反AI技巧 : 3.0 编程 : 3.4 综合 : 3.0 数据解析与提取 : 7.3 领域专项 : 5.3 通用智能 : 4.8 指令遵循 : 6.5 谜题求解 : 3.1 工具调用 : 10.0 常识问答 : 3.0
#193#193	Grok 4.20none	4.1	X AI	$0.057 ↓	1.11s
查看模型卡片总测试数 18 错误测试数 12 可靠性不适用尝试通过率 27.3% 不稳定测试 0 输入令牌 41,313 输出令牌 1,923 推理令牌 0 响应时间（平均） 1.11s 响应时间（总计） 19.96s 响应时间（最大） 6.04s 答案错误: 10 额外格式: 1 无效工具调用: 1 反AI技巧 : 4.8 编程 : 1.1 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 3.0 通用智能 : 4.8 指令遵循 : 6.3 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 0.0
#187#187	Grok 4.20 Betanone	4.4	X AI	$0.087 ↓	1.19s
查看模型卡片总测试数 18 错误测试数 12 可靠性不适用尝试通过率 30.3% 不稳定测试 1 输入令牌 40,597 输出令牌 1,657 推理令牌 0 响应时间（平均） 1.19s 响应时间（总计） 21.43s 响应时间（最大） 6.48s 答案错误: 10 未遵循指令: 1 无效工具调用: 1 反AI技巧 : 4.0 编程 : 1.8 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 3.0 通用智能 : 5.0 指令遵循 : 6.3 谜题求解 : 7.7 工具调用 : 10.0 常识问答 : 0.0
#161#161	Mistral Small 4none	5.1	Mistral	$0.022	1.20s
查看模型卡片总测试数 22 错误测试数 17 可靠性 10.0 尝试通过率 25.8% 不稳定测试 1 输入令牌 104,708 输出令牌 9,812 推理令牌 0 响应时间（平均） 1.20s 响应时间（总计） 26.38s 响应时间（最大） 13.16s 答案错误: 16 未遵循指令: 1 反AI技巧 : 3.4 编程 : 3.7 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.0 指令遵循 : 6.5 谜题求解 : 3.1 工具调用 : 10.0 常识问答 : 3.0
#189#189	Elephant Alphanone	4.3	Openrouter	$0.000	1.22s
查看模型卡片总测试数 21 错误测试数 16 可靠性不适用尝试通过率 25.8% 不稳定测试 1 输入令牌 33,743 输出令牌 2,573 推理令牌 0 响应时间（平均） 1.22s 响应时间（总计） 22.03s 响应时间（最大） 3.81s 答案错误: 9 API 错误: 3 未遵循指令: 3 无效工具调用: 1 反AI技巧 : 6.6 编程 : 4.2 综合 : 1.5 数据解析与提取 : 6.5 领域专项 : 3.0 通用智能 : 4.0 指令遵循 : 9.8 谜题求解 : 4.2 工具调用 : 3.0 常识问答 : 3.0
#191#191	Elephant Alphamedium	4.3	Openrouter	$0.000	1.27s
查看模型卡片总测试数 21 错误测试数 15 可靠性不适用尝试通过率 28.8% 不稳定测试 1 输入令牌 33,744 输出令牌 2,596 推理令牌 0 响应时间（平均） 1.27s 响应时间（总计） 22.82s 响应时间（最大） 3.70s 答案错误: 9 API 错误: 3 未遵循指令: 2 无效工具调用: 1 反AI技巧 : 6.6 编程 : 3.7 综合 : 1.5 数据解析与提取 : 6.5 领域专项 : 3.0 通用智能 : 4.3 指令遵循 : 9.8 谜题求解 : 5.3 工具调用 : 3.0 常识问答 : 3.0
#197#197	Granite 4.1 8Bnone	4.0	IBM Granite	$0.007	1.45s
查看模型卡片总测试数 22 错误测试数 20 可靠性 10.0 尝试通过率 9.1% 不稳定测试 0 输入令牌 113,827 输出令牌 5,996 推理令牌 0 响应时间（平均） 1.45s 响应时间（总计） 31.96s 响应时间（最大） 16.67s 答案错误: 13 未遵循指令: 4 无效工具调用: 2 额外格式: 1 反AI技巧 : 4.9 编程 : 4.5 综合 : 3.0 数据解析与提取 : 3.0 领域专项 : 3.0 通用智能 : 4.0 指令遵循 : 3.6 谜题求解 : 3.2 工具调用 : 10.0 常识问答 : 3.0
#155#155	GPT-5.6 Lunanone	5.4	OpenAI	$0.142	1.50s
查看模型卡片总测试数 22 错误测试数 16 可靠性 10.0 尝试通过率 34.9% 不稳定测试 3 输入令牌 101,323 输出令牌 6,709 推理令牌 0 响应时间（平均） 1.50s 响应时间（总计） 32.91s 响应时间（最大） 10.57s 答案错误: 14 额外格式: 1 无效工具调用: 1 反AI技巧 : 4.8 编程 : 3.8 综合 : 3.2 数据解析与提取 : 10.0 领域专项 : 2.9 通用智能 : 5.0 指令遵循 : 7.1 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#132#132	GPT-5.4 Mininone	5.9	OpenAI	$0.095	1.53s
查看模型卡片总测试数 22 错误测试数 16 可靠性 10.0 尝试通过率 33.3% 不稳定测试 3 输入令牌 79,067 输出令牌 7,880 推理令牌 0 响应时间（平均） 1.53s 响应时间（总计） 33.74s 响应时间（最大） 9.92s 答案错误: 13 未遵循指令: 3 反AI技巧 : 3.1 编程 : 5.5 综合 : 6.5 数据解析与提取 : 10.0 领域专项 : 3.5 通用智能 : 4.8 指令遵循 : 6.3 谜题求解 : 5.4 工具调用 : 3.0 常识问答 : 3.0
#156#156	Laguna XS 2.1none	5.3	Poolside	$0.008	1.55s
查看模型卡片总测试数 22 错误测试数 17 可靠性 10.0 尝试通过率 30.3% 不稳定测试 3 输入令牌 91,598 输出令牌 13,377 推理令牌 0 响应时间（平均） 1.55s 响应时间（总计） 34.19s 响应时间（最大） 19.02s 答案错误: 14 未遵循指令: 1 无效工具调用: 1 超时: 1 反AI技巧 : 5.3 编程 : 4.3 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 5.0 指令遵循 : 3.8 谜题求解 : 3.0 工具调用 : 10.0 常识问答 : 3.0
#103#103	Gemini 3.1 Flash Lite Previewnone	6.4	Google	$0.052	1.58s
查看模型卡片总测试数 22 错误测试数 10 可靠性 10.0 尝试通过率 57.6% 不稳定测试 1 输入令牌 120,942 输出令牌 14,292 推理令牌 0 响应时间（平均） 1.58s 响应时间（总计） 34.72s 响应时间（最大） 9.27s 答案错误: 7 未遵循指令: 2 无答案: 1 反AI技巧 : 7.5 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.0 指令遵循 : 10.0 谜题求解 : 10.0 工具调用 : 10.0 常识问答 : 3.0
#199#199	Grok 4.1 Fastnone	3.8	X AI	$0.008 ↓	1.62s
查看模型卡片总测试数 19 错误测试数 16 可靠性 10.0 尝试通过率 19.7% 不稳定测试 3 输入令牌 36,608 输出令牌 1,723 推理令牌 0 响应时间（平均） 1.62s 响应时间（总计） 19.48s 响应时间（最大） 5.51s 答案错误: 13 未遵循指令: 3 反AI技巧 : 3.2 编程 : 1.8 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 5.9 通用智能 : 4.4 指令遵循 : 3.0 谜题求解 : 3.0 工具调用 : 2.8 常识问答 : 3.0
#128#128	GPT-5.6 Terranone	6.0	OpenAI	$0.349	1.65s
查看模型卡片总测试数 22 错误测试数 14 可靠性 10.0 尝试通过率 42.4% 不稳定测试 3 输入令牌 102,259 输出令牌 6,203 推理令牌 0 响应时间（平均） 1.65s 响应时间（总计） 36.28s 响应时间（最大） 10.07s 答案错误: 11 未遵循指令: 1 无效工具调用: 1 无答案: 1 反AI技巧 : 4.8 编程 : 5.5 综合 : 2.9 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 5.0 指令遵循 : 8.5 谜题求解 : 5.3 工具调用 : 9.6 常识问答 : 3.0
#118#118	Gemini 3.1 Flash Litenone	6.1	Google	$0.046	1.75s
查看模型卡片总测试数 22 错误测试数 13 可靠性 10.0 尝试通过率 50.0% 不稳定测试 4 输入令牌 118,050 输出令牌 10,723 推理令牌 0 响应时间（平均） 1.75s 响应时间（总计） 38.60s 响应时间（最大） 16.25s 答案错误: 11 未遵循指令: 1 无答案: 1 反AI技巧 : 7.5 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 2.9 通用智能 : 4.0 指令遵循 : 10.0 谜题求解 : 6.3 工具调用 : 10.0 常识问答 : 3.0
#116#116	Gemini 3.1 Flash Liteminimal	6.1	Google	$0.047	1.86s
查看模型卡片总测试数 22 错误测试数 12 可靠性 10.0 尝试通过率 51.5% 不稳定测试 3 输入令牌 119,065 输出令牌 11,118 推理令牌 0 响应时间（平均） 1.86s 响应时间（总计） 40.88s 响应时间（最大） 12.97s 答案错误: 8 未遵循指令: 3 无答案: 1 反AI技巧 : 8.3 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 2.9 通用智能 : 4.0 指令遵循 : 10.0 谜题求解 : 6.0 工具调用 : 10.0 常识问答 : 3.0
#170#170	GPT-4o-mininone	5.0	OpenAI	$0.010	1.99s
查看模型卡片总测试数 22 错误测试数 17 可靠性 10.0 尝试通过率 22.7% 不稳定测试 0 输入令牌 53,136 输出令牌 2,911 推理令牌 0 响应时间（平均） 1.99s 响应时间（总计） 29.86s 响应时间（最大） 7.58s 答案错误: 15 未遵循指令: 1 无答案: 1 反AI技巧 : 4.8 编程 : 3.2 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 3.0 通用智能 : 4.0 指令遵循 : 6.3 谜题求解 : 3.5 工具调用 : 10.0 常识问答 : 3.0
#135#135	GPT-5.4none	5.8	OpenAI	$0.397	2.07s
查看模型卡片总测试数 22 错误测试数 15 可靠性 10.0 尝试通过率 34.9% 不稳定测试 2 输入令牌 108,632 输出令牌 8,321 推理令牌 0 响应时间（平均） 2.07s 响应时间（总计） 45.51s 响应时间（最大） 15.63s 答案错误: 14 未遵循指令: 1 反AI技巧 : 3.2 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.4 指令遵循 : 6.5 谜题求解 : 5.6 工具调用 : 10.0 常识问答 : 3.0
#82#82	GPT-5.6 Solnone	6.9	OpenAI	$0.524	2.16s
查看模型卡片总测试数 22 错误测试数 11 可靠性 10.0 尝试通过率 59.1% 不稳定测试 3 输入令牌 78,593 输出令牌 4,357 推理令牌 0 响应时间（平均） 2.16s 响应时间（总计） 47.62s 响应时间（最大） 12.81s 答案错误: 10 未遵循指令: 1 反AI技巧 : 8.3 编程 : 5.5 综合 : 6.5 数据解析与提取 : 10.0 领域专项 : 3.6 通用智能 : 6.5 指令遵循 : 8.5 谜题求解 : 7.7 工具调用 : 10.0 常识问答 : 3.0
#143#143	Mimo V2 PROnone	5.6	Xiaomi	$0.045 ↓	2.27s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 39.4% 不稳定测试 3 输入令牌 39,344 输出令牌 2,352 推理令牌 0 响应时间（平均） 2.27s 响应时间（总计） 45.50s 响应时间（最大） 6.58s 答案错误: 11 未遵循指令: 2 API 错误: 1 反AI技巧 : 3.5 编程 : 5.5 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.3 指令遵循 : 6.5 谜题求解 : 6.0 工具调用 : 10.0 常识问答 : 3.0
#86#86	GPT-5.5none	6.9	OpenAI	$0.544	2.36s
查看模型卡片总测试数 22 错误测试数 11 可靠性 10.0 尝试通过率 56.1% 不稳定测试 3 输入令牌 79,285 输出令牌 4,915 推理令牌 0 响应时间（平均） 2.36s 响应时间（总计） 51.88s 响应时间（最大） 12.24s 答案错误: 11 反AI技巧 : 6.9 编程 : 5.5 综合 : 6.5 数据解析与提取 : 10.0 领域专项 : 2.9 通用智能 : 10.0 指令遵循 : 6.2 谜题求解 : 7.7 工具调用 : 10.0 常识问答 : 3.0
#153#153	Mimo V2 Omninone	5.5	Xiaomi	$0.021 ↓	2.44s
查看模型卡片总测试数 21 错误测试数 13 可靠性 10.0 尝试通过率 37.9% 不稳定测试 1 输入令牌 40,852 输出令牌 3,314 推理令牌 0 响应时间（平均） 2.44s 响应时间（总计） 48.81s 响应时间（最大） 6.81s 答案错误: 10 API 错误: 1 额外格式: 1 未遵循指令: 1 反AI技巧 : 3.6 编程 : 4.4 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.1 指令遵循 : 6.5 谜题求解 : 10.0 工具调用 : 10.0 常识问答 : 3.0
#176#176	GPT-5.4 Nanonone	4.8	OpenAI	$0.041	2.57s
查看模型卡片总测试数 22 错误测试数 18 可靠性 10.0 尝试通过率 28.8% 不稳定测试 5 输入令牌 115,924 输出令牌 13,794 推理令牌 0 响应时间（平均） 2.57s 响应时间（总计） 56.51s 响应时间（最大） 25.50s 答案错误: 15 未遵循指令: 2 无答案: 1 反AI技巧 : 3.5 编程 : 4.6 综合 : 3.0 数据解析与提取 : 6.5 领域专项 : 2.9 通用智能 : 3.8 指令遵循 : 6.3 谜题求解 : 5.4 工具调用 : 10.0 常识问答 : 3.0
#87#87	Gemini 3.5 Flashminimal	6.8	Google	$0.300	2.65s
查看模型卡片总测试数 22 错误测试数 8 可靠性 10.0 尝试通过率 65.2% 不稳定测试 1 输入令牌 100,753 输出令牌 16,454 推理令牌 0 响应时间（平均） 2.65s 响应时间（总计） 58.27s 响应时间（最大） 25.26s 答案错误: 5 无效工具调用: 2 未遵循指令: 1 反AI技巧 : 6.5 编程 : 5.6 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 10.0 通用智能 : 10.0 指令遵循 : 6.4 谜题求解 : 10.0 工具调用 : 10.0 常识问答 : 3.0
#77#77	Mercury 2medium	7.0	Inception	$0.093	2.72s
查看模型卡片总测试数 22 错误测试数 12 可靠性 10.0 尝试通过率 51.5% 不稳定测试 3 输入令牌 109,572 输出令牌 10,313 推理令牌 76,806 响应时间（平均） 2.72s 响应时间（总计） 57.12s 响应时间（最大） 14.63s 答案错误: 8 未遵循指令: 3 无效工具调用: 1 反AI技巧 : 6.9 编程 : 8.2 综合 : 6.7 数据解析与提取 : 7.3 领域专项 : 2.9 通用智能 : 4.8 指令遵循 : 10.0 谜题求解 : 5.4 工具调用 : 10.0 常识问答 : 3.0
#196#196	MiMo-V2-Flashnone	4.0	Xiaomi	$0.025 ↑	2.76s
查看模型卡片总测试数 21 错误测试数 17 可靠性 6.7 尝试通过率 24.2% 不稳定测试 4 输入令牌 36,851 输出令牌 68,882 推理令牌 0 响应时间（平均） 2.76s 响应时间（总计） 46.99s 响应时间（最大） 19.68s 答案错误: 13 未遵循指令: 2 API 错误: 1 额外格式: 1 反AI技巧 : 3.2 编程 : 4.3 综合 : 1.5 数据解析与提取 : 2.9 领域专项 : 5.3 通用智能 : 4.6 指令遵循 : 6.5 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#166#166	GLM 5 Turbonone	5.1	Z.ai	$0.047 ↑	2.82s
查看模型卡片总测试数 21 错误测试数 15 可靠性 10.0 尝试通过率 30.3% 不稳定测试 2 输入令牌 32,525 输出令牌 1,815 推理令牌 0 响应时间（平均） 2.82s 响应时间（总计） 59.29s 响应时间（最大） 8.21s 答案错误: 13 未遵循指令: 2 反AI技巧 : 3.0 编程 : 3.9 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.2 指令遵循 : 6.5 谜题求解 : 5.5 工具调用 : 10.0 常识问答 : 3.0
#188#188	Laguna M.1none	4.4	Poolside	$0.009 ↕	2.89s
查看模型卡片总测试数 19 错误测试数 15 可靠性 9.8 尝试通过率 27.3% 不稳定测试 3 输入令牌 38,147 输出令牌 2,054 推理令牌 0 响应时间（平均） 2.89s 响应时间（总计） 43.28s 响应时间（最大） 15.42s 答案错误: 10 API 错误: 4 无效工具调用: 1 反AI技巧 : 3.4 编程 : 2.5 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 3.6 通用智能 : 3.0 指令遵循 : 6.3 谜题求解 : 3.0 工具调用 : 10.0 常识问答 : 3.0

1 2 3 4 5 6 7

→

快速对比

Gemini 3 Flash PreviewmediumvsGemini 3.5 Flashhigh Gemini 3 Flash PreviewmediumvsGPT-5.6 Sollow Gemini 3 Flash PreviewmediumvsGPT-5.6 Solmedium Gemini 3 Flash PreviewmediumvsGPT-5.6 Solhigh Gemini 3 Flash PreviewmediumvsGPT-5.5low Gemini 3 Flash PreviewmediumvsGemini 3.1 Pro Previewmedium Gemini 3 Flash PreviewmediumvsNemotron 3 Ultramedium免费可用 Gemini 3 Flash PreviewmediumvsNorth Mini Codemedium免费可用 Gemini 3.5 FlashhighvsGPT-5.6 Sollow GPT-5.6 SollowvsGPT-5.6 Solmedium GPT-5.6 SolmediumvsGPT-5.6 Solhigh GPT-5.6 SolhighvsGPT-5.5low