AI Benchy 排行榜

Name: AI BENCHY 模型基准结果
Creator: AI BENCHY
License: https://aibenchy.com/methodology/

基准结果生成自 AI BENCHY 测试套件，时间：: 2026-07-24 已评估模型: 222

222/222

排名	模型	分数	公司	总成本	响应时间（平均）
#189#189	Ling-2.6-flashnone	4.9	Inclusionai	$0.002 ↑	10.68s
查看模型卡片总测试数 22 错误测试数 16 可靠性 10.0 尝试通过率 30.3% 不稳定测试 2 输入令牌 114,375 输出令牌 14,903 推理令牌 0 响应时间（平均） 10.68s 响应时间（总计） 213.51s 响应时间（最大） 36.03s 答案错误: 9 无效工具调用: 3 API 错误: 2 未遵循指令: 2 反AI技巧 : 6.8 编程 : 5.3 综合 : 3.0 数据解析与提取 : 6.5 领域专项 : 3.0 通用智能 : 4.0 指令遵循 : 9.8 谜题求解 : 2.9 工具调用 : 3.0 常识问答 : 3.0
#190#190	Ring-2.6-1Tnone	4.8	Inclusionai	$0.026 ↕	55.10s
查看模型卡片总测试数 22 错误测试数 13 可靠性 10.0 尝试通过率 45.5% 不稳定测试 2 输入令牌 7,599 输出令牌 39,954 推理令牌 0 响应时间（平均） 55.10s 响应时间（总计） 881.55s 响应时间（最大） 143.82s API 错误: 6 答案错误: 5 未遵循指令: 2 反AI技巧 : 9.2 编程 : 5.3 综合 : 3.0 数据解析与提取 : 3.0 领域专项 : 5.3 通用智能 : 4.3 指令遵循 : 9.8 谜题求解 : 7.7 工具调用 : 3.0 常识问答 : 3.0
#191#191	GPT-5.4 Nanonone	4.8	OpenAI	$0.041	2.57s
查看模型卡片总测试数 22 错误测试数 18 可靠性 10.0 尝试通过率 28.8% 不稳定测试 5 输入令牌 115,924 输出令牌 13,794 推理令牌 0 响应时间（平均） 2.57s 响应时间（总计） 56.51s 响应时间（最大） 25.50s 答案错误: 15 未遵循指令: 2 无答案: 1 反AI技巧 : 3.5 编程 : 4.6 综合 : 3.0 数据解析与提取 : 6.5 领域专项 : 2.9 通用智能 : 3.8 指令遵循 : 6.3 谜题求解 : 5.4 工具调用 : 10.0 常识问答 : 3.0
#193#193	KAT-Coder-Air V2.5none	4.8	Kwaipilot	$0.067	12.17s
查看模型卡片总测试数 22 错误测试数 17 可靠性 10.0 尝试通过率 37.9% 不稳定测试 8 输入令牌 69,367 输出令牌 93,913 推理令牌 0 响应时间（平均） 12.17s 响应时间（总计） 267.83s 响应时间（最大） 121.05s 答案错误: 13 额外格式: 3 API 错误: 1 反AI技巧 : 5.3 编程 : 3.3 综合 : 3.8 数据解析与提取 : 6.3 领域专项 : 2.9 通用智能 : 5.0 指令遵循 : 9.9 谜题求解 : 2.9 工具调用 : 10.0 常识问答 : 3.0
#194#194	Trinity Large Previewnone	4.8	Arcee AI	$0.008 ↑	2.98s
查看模型卡片总测试数 21 错误测试数 17 可靠性 10.0 尝试通过率 21.2% 不稳定测试 2 输入令牌 29,828 输出令牌 2,169 推理令牌 0 响应时间（平均） 2.98s 响应时间（总计） 56.57s 响应时间（最大） 14.34s 答案错误: 12 未遵循指令: 3 API 错误: 2 反AI技巧 : 3.1 编程 : 3.7 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.5 指令遵循 : 3.5 谜题求解 : 3.6 工具调用 : 10.0 常识问答 : 3.0
#196#196	Grok 4.1 Fastmedium	4.7	X AI	$0.069 ↑	23.85s
查看模型卡片总测试数 19 错误测试数 10 可靠性 10.0 尝试通过率 53.0% 不稳定测试 6 输入令牌 42,845 输出令牌 2,006 推理令牌 96,334 响应时间（平均） 23.85s 响应时间（总计） 286.16s 响应时间（最大） 121.79s 未遵循指令: 4 答案错误: 4 无答案: 1 超时: 1 反AI技巧 : 8.7 编程 : 7.8 综合 : 5.0 数据解析与提取 : 10.0 领域专项 : 5.8 通用智能 : 4.2 指令遵循 : 6.5 谜题求解 : 5.3 工具调用 : 2.8 常识问答 : 3.0
#197#197	Laguna M.1medium	4.7	Poolside	$0.033 ↕	14.73s
查看模型卡片总测试数 19 错误测试数 10 可靠性 10.0 尝试通过率 45.5% 不稳定测试 2 输入令牌 44,969 输出令牌 58,087 推理令牌 0 响应时间（平均） 14.73s 响应时间（总计） 220.93s 响应时间（最大） 53.14s API 错误: 4 答案错误: 4 未遵循指令: 1 无答案: 1 反AI技巧 : 6.5 编程 : 1.5 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 3.0 指令遵循 : 10.0 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#198#198	Qwen3 Coder Nextmedium	4.7	Qwen	$0.032 ↓	9.61s
查看模型卡片总测试数 22 错误测试数 18 可靠性 10.0 尝试通过率 27.3% 不稳定测试 3 输入令牌 148,194 输出令牌 19,069 推理令牌 0 响应时间（平均） 9.61s 响应时间（总计） 153.69s 响应时间（最大） 81.80s 答案错误: 13 未遵循指令: 3 无答案: 1 超时: 1 反AI技巧 : 3.5 编程 : 3.7 综合 : 3.0 数据解析与提取 : 6.5 领域专项 : 5.3 通用智能 : 6.3 指令遵循 : 6.3 谜题求解 : 3.0 工具调用 : 10.0 常识问答 : 3.0
#199#199	Cobuddymedium	4.7	Baidu	$0.000	39.90s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 45.5% 不稳定测试 6 输入令牌 37,449 输出令牌 1,677 推理令牌 116,703 响应时间（平均） 39.90s 响应时间（总计） 797.98s 响应时间（最大） 309.02s 答案错误: 9 未遵循指令: 3 API 错误: 1 无效工具调用: 1 反AI技巧 : 8.7 编程 : 3.7 综合 : 1.5 数据解析与提取 : 6.3 领域专项 : 2.9 通用智能 : 4.2 指令遵循 : 9.8 谜题求解 : 3.6 工具调用 : 10.0 常识问答 : 3.0
#200#200	Mercury 2none	4.6	Inception	$0.030	829ms
查看模型卡片总测试数 22 错误测试数 18 可靠性 10.0 尝试通过率 22.7% 不稳定测试 2 输入令牌 88,704 输出令牌 9,564 推理令牌 0 响应时间（平均） 829ms 响应时间（总计） 18.24s 响应时间（最大） 4.52s 答案错误: 17 未遵循指令: 1 反AI技巧 : 3.0 编程 : 3.4 综合 : 3.0 数据解析与提取 : 7.3 领域专项 : 5.3 通用智能 : 4.8 指令遵循 : 6.5 谜题求解 : 3.1 工具调用 : 10.0 常识问答 : 3.0
#201#201	MiniMax M2.5medium	4.6	Minimax	$0.340 ↓	68.27s
查看模型卡片总测试数 22 错误测试数 17 可靠性 10.0 尝试通过率 45.5% 不稳定测试 10 输入令牌 142,561 输出令牌 125,442 推理令牌 339,935 响应时间（平均） 68.27s 响应时间（总计） 955.75s 响应时间（最大） 251.36s 答案错误: 7 超时: 4 未遵循指令: 3 无答案: 2 无效工具调用: 1 反AI技巧 : 7.9 编程 : 3.4 综合 : 3.7 数据解析与提取 : 4.6 领域专项 : 2.9 通用智能 : 3.8 指令遵循 : 7.5 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#202#202	Laguna S 2.1none	4.5	Poolside	$0.025	11.67s
查看模型卡片总测试数 22 错误测试数 20 可靠性 10.0 尝试通过率 15.2% 不稳定测试 3 输入令牌 125,598 输出令牌 57,634 推理令牌 0 响应时间（平均） 11.67s 响应时间（总计） 256.80s 响应时间（最大） 200.52s 答案错误: 18 未遵循指令: 1 无答案: 1 反AI技巧 : 3.1 编程 : 3.4 综合 : 2.9 数据解析与提取 : 10.0 领域专项 : 3.0 通用智能 : 5.0 指令遵循 : 4.3 谜题求解 : 3.1 工具调用 : 4.7 常识问答 : 3.0
#210#210	Laguna Xs.2medium	4.1	Poolside	$0.015 ↕	6.73s
查看模型卡片总测试数 19 错误测试数 13 可靠性 10.0 尝试通过率 43.9% 不稳定测试 6 输入令牌 39,481 输出令牌 54,218 推理令牌 0 响应时间（平均） 6.73s 响应时间（总计） 100.98s 响应时间（最大） 29.11s 答案错误: 6 API 错误: 4 无答案: 2 无效工具调用: 1 反AI技巧 : 6.9 编程 : 2.1 综合 : 1.5 数据解析与提取 : 7.1 领域专项 : 4.1 通用智能 : 3.0 指令遵循 : 10.0 谜题求解 : 5.3 工具调用 : 4.7 常识问答 : 3.0
#211#211	Hy3 previewnone	4.0	Tencent	$0.003 ↕	12.92s
查看模型卡片总测试数 21 错误测试数 17 可靠性 10.0 尝试通过率 22.7% 不稳定测试 2 输入令牌 27,172 输出令牌 2,661 推理令牌 0 响应时间（平均） 12.92s 响应时间（总计） 232.64s 响应时间（最大） 35.84s 答案错误: 8 API 错误: 4 未遵循指令: 4 额外格式: 1 反AI技巧 : 4.8 编程 : 2.7 综合 : 1.5 数据解析与提取 : 6.5 领域专项 : 3.6 通用智能 : 4.1 指令遵循 : 6.3 谜题求解 : 3.1 工具调用 : 10.0 常识问答 : 3.0
#213#213	Granite 4.1 8Bnone	4.0	IBM Granite	$0.007	1.45s
查看模型卡片总测试数 22 错误测试数 20 可靠性 10.0 尝试通过率 9.1% 不稳定测试 0 输入令牌 113,827 输出令牌 5,996 推理令牌 0 响应时间（平均） 1.45s 响应时间（总计） 31.96s 响应时间（最大） 16.67s 答案错误: 13 未遵循指令: 4 无效工具调用: 2 额外格式: 1 反AI技巧 : 4.9 编程 : 4.5 综合 : 3.0 数据解析与提取 : 3.0 领域专项 : 3.0 通用智能 : 4.0 指令遵循 : 3.6 谜题求解 : 3.2 工具调用 : 10.0 常识问答 : 3.0
#214#214	Grok Build 0.1none	4.0	X AI	$0.547	28.69s
查看模型卡片总测试数 19 错误测试数 12 可靠性 10.0 尝试通过率 43.9% 不稳定测试 4 输入令牌 11,793 输出令牌 267,275 推理令牌 0 响应时间（平均） 28.69s 响应时间（总计） 459.00s 响应时间（最大） 138.35s 答案错误: 7 API 错误: 3 未遵循指令: 2 反AI技巧 : 8.7 编程 : 3.3 综合 : 1.5 数据解析与提取 : 3.8 领域专项 : 3.6 通用智能 : 4.3 指令遵循 : 9.8 谜题求解 : 6.4 工具调用 : 3.0 常识问答 : 3.0
#215#215	Grok 4.1 Fastnone	3.8	X AI	$0.008 ↓	1.62s
查看模型卡片总测试数 19 错误测试数 16 可靠性 10.0 尝试通过率 19.7% 不稳定测试 3 输入令牌 36,608 输出令牌 1,723 推理令牌 0 响应时间（平均） 1.62s 响应时间（总计） 19.48s 响应时间（最大） 5.51s 答案错误: 13 未遵循指令: 3 反AI技巧 : 3.2 编程 : 1.8 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 5.9 通用智能 : 4.4 指令遵循 : 3.0 谜题求解 : 3.0 工具调用 : 2.8 常识问答 : 3.0
#217#217	Laguna Xs.2none	3.8	Poolside	$0.004 ↕	806ms
查看模型卡片总测试数 19 错误测试数 14 可靠性 10.0 尝试通过率 22.7% 不稳定测试 0 输入令牌 33,675 输出令牌 2,826 推理令牌 0 响应时间（平均） 806ms 响应时间（总计） 12.09s 响应时间（最大） 2.01s 答案错误: 8 API 错误: 4 未遵循指令: 1 无效工具调用: 1 反AI技巧 : 3.0 编程 : 8.3 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 3.0 指令遵循 : 6.5 谜题求解 : 5.3 工具调用 : 3.0 常识问答 : 3.0
#218#218	gpt-oss-120bnone	3.7	OpenAI	$0.010 ↓	21.61s
查看模型卡片总测试数 19 错误测试数 13 可靠性 10.0 尝试通过率 33.3% 不稳定测试 2 输入令牌 9,081 输出令牌 51,664 推理令牌 0 响应时间（平均） 21.61s 响应时间（总计） 345.79s 响应时间（最大） 113.71s 答案错误: 8 API 错误: 3 未遵循指令: 2 反AI技巧 : 6.5 编程 : 1.5 综合 : 1.5 数据解析与提取 : 6.5 领域专项 : 3.0 通用智能 : 4.8 指令遵循 : 9.8 谜题求解 : 6.0 工具调用 : 3.0 常识问答 : 3.0
#219#219	Nemotron 3 Nano Omni 30b A3b Reasoningmedium	3.4	NVIDIA	$0.000	17.13s
查看模型卡片总测试数 19 错误测试数 15 可靠性 10.0 尝试通过率 27.3% 不稳定测试 5 输入令牌 11,661 输出令牌 48,491 推理令牌 180,695 响应时间（平均） 17.13s 响应时间（总计） 222.66s 响应时间（最大） 147.45s 答案错误: 7 API 错误: 6 未遵循指令: 1 无答案: 1 反AI技巧 : 6.4 编程 : 1.1 综合 : 1.5 数据解析与提取 : 7.3 领域专项 : 2.9 通用智能 : 3.0 指令遵循 : 7.3 谜题求解 : 2.9 工具调用 : 3.0 常识问答 : 3.0
#220#220	Nemotron 3 Nano Omni 30b A3b Reasoningnone	3.2	NVIDIA	$0.000	728ms
查看模型卡片总测试数 19 错误测试数 17 可靠性 10.0 尝试通过率 15.2% 不稳定测试 2 输入令牌 11,661 输出令牌 1,302 推理令牌 0 响应时间（平均） 728ms 响应时间（总计） 9.47s 响应时间（最大） 2.21s 答案错误: 9 API 错误: 6 未遵循指令: 2 反AI技巧 : 4.8 编程 : 3.3 综合 : 1.5 数据解析与提取 : 3.8 领域专项 : 3.6 通用智能 : 3.0 指令遵循 : 4.8 谜题求解 : 3.0 工具调用 : 3.0 常识问答 : 3.0
#221#221	Step 3.5 Flashnone	2.3	Stepfun	$0.020	39.03s
查看模型卡片总测试数 12 错误测试数 6 可靠性 10.0 尝试通过率 27.3% 不稳定测试 0 输入令牌 1,971 输出令牌 64,795 推理令牌 0 响应时间（平均） 39.03s 响应时间（总计） 312.26s 响应时间（最大） 114.12s API 错误: 4 未遵循指令: 1 答案错误: 1 反AI技巧 : 10.0 编程 : 9.8 综合 : 1.5 数据解析与提取 : 1.5 领域专项 : 3.3 通用智能 : 4.0 指令遵循 : 5.0 谜题求解 : 0.0 工具调用 : 3.0 常识问答 : 3.0
#22#22	Qwen3.6 Max Previewmedium	8.4	Qwen	$1.143 ↓	67.53s
查看模型卡片总测试数 22 错误测试数 6 可靠性 9.9 尝试通过率 80.3% 不稳定测试 3 输入令牌 79,240 输出令牌 5,098 推理令牌 164,842 响应时间（平均） 67.53s 响应时间（总计） 1485.64s 响应时间（最大） 238.07s 答案错误: 5 超时: 1 反AI技巧 : 10.0 编程 : 8.8 综合 : 7.3 数据解析与提取 : 10.0 领域专项 : 2.9 通用智能 : 10.0 指令遵循 : 10.0 谜题求解 : 10.0 工具调用 : 10.0 常识问答 : 3.0
#33#33	Step 3.7 Flashmedium	8.0	Stepfun	$0.515	26.37s
查看模型卡片总测试数 22 错误测试数 8 可靠性 9.9 尝试通过率 72.7% 不稳定测试 3 输入令牌 114,062 输出令牌 427,572 推理令牌 0 响应时间（平均） 26.37s 响应时间（总计） 580.25s 响应时间（最大） 152.83s 答案错误: 5 未遵循指令: 1 无效工具调用: 1 无答案: 1 反AI技巧 : 8.7 编程 : 8.8 综合 : 7.3 数据解析与提取 : 10.0 领域专项 : 7.7 通用智能 : 4.0 指令遵循 : 9.8 谜题求解 : 5.7 工具调用 : 10.0 常识问答 : 3.0
#63#63	Qwen3.7 Maxnone	7.4	Qwen	$0.197 ↓	4.52s
查看模型卡片总测试数 22 错误测试数 7 可靠性 9.9 尝试通过率 68.2% 不稳定测试 0 输入令牌 95,983 输出令牌 12,446 推理令牌 0 响应时间（平均） 4.52s 响应时间（总计） 99.52s 响应时间（最大） 72.30s 答案错误: 7 反AI技巧 : 6.5 编程 : 5.5 综合 : 6.5 数据解析与提取 : 10.0 领域专项 : 7.7 通用智能 : 10.0 指令遵循 : 10.0 谜题求解 : 10.0 工具调用 : 10.0 常识问答 : 3.0
#103#103	Qwen3.6 Max Previewnone	6.6	Qwen	$0.231 ↓	7.82s
查看模型卡片总测试数 22 错误测试数 10 可靠性 9.9 尝试通过率 60.6% 不稳定测试 2 输入令牌 106,339 输出令牌 19,257 推理令牌 0 响应时间（平均） 7.82s 响应时间（总计） 172.01s 响应时间（最大） 102.62s 答案错误: 10 反AI技巧 : 5.2 编程 : 3.8 综合 : 6.5 数据解析与提取 : 10.0 领域专项 : 7.7 通用智能 : 4.3 指令遵循 : 9.8 谜题求解 : 10.0 工具调用 : 10.0 常识问答 : 3.0
#130#130	Inklinglow	6.1	Thinkingmachines	$0.187	5.15s
查看模型卡片总测试数 22 错误测试数 12 可靠性 9.9 尝试通过率 54.6% 不稳定测试 4 输入令牌 109,884 输出令牌 8,579 推理令牌 10,343 响应时间（平均） 5.15s 响应时间（总计） 113.39s 响应时间（最大） 41.58s 答案错误: 8 未遵循指令: 2 无效工具调用: 2 反AI技巧 : 8.3 编程 : 5.1 综合 : 2.9 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 10.0 指令遵循 : 9.8 谜题求解 : 6.4 工具调用 : 3.0 常识问答 : 3.0
#149#149	Ling 3.0 Flashnone	5.7	Inclusionai	$0.000	3.46s
查看模型卡片总测试数 22 错误测试数 16 可靠性 9.9 尝试通过率 27.3% 不稳定测试 0 输入令牌 124,176 输出令牌 12,783 推理令牌 0 响应时间（平均） 3.46s 响应时间（总计） 76.06s 响应时间（最大） 17.51s 答案错误: 14 未遵循指令: 1 无效工具调用: 1 反AI技巧 : 4.8 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 3.0 通用智能 : 5.0 指令遵循 : 4.8 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#152#152	KAT-Coder-Air V2.5high	5.6	Kwaipilot	$0.077	15.90s
查看模型卡片总测试数 22 错误测试数 15 可靠性 9.9 尝试通过率 43.9% 不稳定测试 6 输入令牌 50,470 输出令牌 3,957 推理令牌 111,374 响应时间（平均） 15.90s 响应时间（总计） 349.71s 响应时间（最大） 118.35s 答案错误: 9 API 错误: 3 额外格式: 3 反AI技巧 : 6.9 编程 : 4.3 综合 : 6.5 数据解析与提取 : 6.5 领域专项 : 2.9 通用智能 : 5.1 指令遵循 : 9.8 谜题求解 : 3.5 工具调用 : 10.0 常识问答 : 3.0
#157#157	KAT-Coder-Air V2.5medium	5.6	Kwaipilot	$0.048	8.42s
查看模型卡片总测试数 22 错误测试数 14 可靠性 9.9 尝试通过率 45.5% 不稳定测试 3 输入令牌 51,472 输出令牌 7,822 推理令牌 58,352 响应时间（平均） 8.42s 响应时间（总计） 185.24s 响应时间（最大） 48.19s 答案错误: 11 API 错误: 1 额外格式: 1 未遵循指令: 1 反AI技巧 : 8.7 编程 : 3.6 综合 : 6.5 数据解析与提取 : 6.5 领域专项 : 3.0 通用智能 : 5.0 指令遵循 : 10.0 谜题求解 : 3.6 工具调用 : 10.0 常识问答 : 3.0

←

1 5 6 7 8

→

快速对比

Gemini 3.6 FlashmediumvsGemini 3.6 Flashhigh Gemini 3.6 FlashhighvsGemini 3 Flash Previewmedium Gemini 3 Flash PreviewmediumvsGemini 3.5 Flashhigh Gemini 3.5 FlashhighvsGPT-5.6 Sollow GPT-5.6 SollowvsGemini 3.6 Flashlow Gemini 3.6 FlashlowvsGPT-5.6 Solmedium GPT-5.6 SolmediumvsGPT-5.6 Solhigh GPT-5.6 SolhighvsGPT-5.5low GPT-5.5lowvsGemini 3.1 Pro Previewmedium Gemini 3.1 Pro PreviewmediumvsQwen3.7 Maxmedium Qwen3.7 MaxmediumvsGemini 3.5 Flashmedium Gemini 3.5 FlashmediumvsGPT-5.5medium

AI Benchy 排行榜

筛选模型

快速对比