AI Benchy 排行榜

Name: AI BENCHY 模型基准结果
Creator: AI BENCHY
License: https://aibenchy.com/methodology/

基准结果生成自 AI BENCHY 测试套件，时间：: 2026-07-18 已评估模型: 206

206/206

排名	模型	分数	公司	总成本	响应时间（平均）
#184#184	Cobuddymedium	4.7	Baidu	$0.000	39.90s
查看模型卡片总测试数 21 错误测试数 14 可靠性 10.0 尝试通过率 45.5% 不稳定测试 6 输入令牌 37,449 输出令牌 1,677 推理令牌 116,703 响应时间（平均） 39.90s 响应时间（总计） 797.98s 响应时间（最大） 309.02s 答案错误: 9 未遵循指令: 3 API 错误: 1 无效工具调用: 1 反AI技巧 : 8.7 编程 : 3.7 综合 : 1.5 数据解析与提取 : 6.3 领域专项 : 2.9 通用智能 : 4.2 指令遵循 : 9.8 谜题求解 : 3.6 工具调用 : 10.0 常识问答 : 3.0
#187#187	Grok 4.20 Betanone	4.4	X AI	$0.087 ↓	1.19s
查看模型卡片总测试数 18 错误测试数 12 可靠性不适用尝试通过率 30.3% 不稳定测试 1 输入令牌 40,597 输出令牌 1,657 推理令牌 0 响应时间（平均） 1.19s 响应时间（总计） 21.43s 响应时间（最大） 6.48s 答案错误: 10 未遵循指令: 1 无效工具调用: 1 反AI技巧 : 4.0 编程 : 1.8 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 3.0 通用智能 : 5.0 指令遵循 : 6.3 谜题求解 : 7.7 工具调用 : 10.0 常识问答 : 0.0
#192#192	Hunter Alphanone	4.2	OpenRouter	$0.000	4.70s
查看模型卡片总测试数 18 错误测试数 12 可靠性不适用尝试通过率 37.9% 不稳定测试 4 输入令牌 34,329 输出令牌 2,264 推理令牌 0 响应时间（平均） 4.70s 响应时间（总计） 79.86s 响应时间（最大） 15.17s 答案错误: 9 未遵循指令: 2 API 错误: 1 反AI技巧 : 3.5 编程 : 9.8 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 6.1 指令遵循 : 6.4 谜题求解 : 5.8 工具调用 : 10.0 常识问答 : 0.0
#193#193	Grok 4.20none	4.1	X AI	$0.057 ↓	1.11s
查看模型卡片总测试数 18 错误测试数 12 可靠性不适用尝试通过率 27.3% 不稳定测试 0 输入令牌 41,313 输出令牌 1,923 推理令牌 0 响应时间（平均） 1.11s 响应时间（总计） 19.96s 响应时间（最大） 6.04s 答案错误: 10 额外格式: 1 无效工具调用: 1 反AI技巧 : 4.8 编程 : 1.1 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 3.0 通用智能 : 4.8 指令遵循 : 6.3 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 0.0
#120#120	Qwen3.6 Flashnone	6.1	Qwen	$0.062 ↓	3.74s
查看模型卡片总测试数 22 错误测试数 15 可靠性 10.0 尝试通过率 34.9% 不稳定测试 1 输入令牌 139,788 输出令牌 30,947 推理令牌 0 响应时间（平均） 3.74s 响应时间（总计） 82.38s 响应时间（最大） 48.79s 答案错误: 12 无效工具调用: 2 未遵循指令: 1 反AI技巧 : 3.1 编程 : 5.4 综合 : 3.8 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 10.0 指令遵循 : 6.3 谜题求解 : 3.5 工具调用 : 10.0 常识问答 : 3.0
#123#123	Qwen3.5-35B-A3Bnone	6.1	Qwen	$0.106 ↓	12.72s
查看模型卡片总测试数 22 错误测试数 15 可靠性 10.0 尝试通过率 43.9% 不稳定测试 4 输入令牌 134,521 输出令牌 86,614 推理令牌 0 响应时间（平均） 12.72s 响应时间（总计） 279.90s 响应时间（最大） 209.15s 答案错误: 12 未遵循指令: 2 无效工具调用: 1 反AI技巧 : 3.4 编程 : 5.5 综合 : 3.8 数据解析与提取 : 10.0 领域专项 : 7.7 通用智能 : 6.5 指令遵循 : 6.3 谜题求解 : 3.7 工具调用 : 10.0 常识问答 : 3.0
#134#134	Kimi K2.6none	5.8	Moonshot AI	$0.233 ↑	19.58s
查看模型卡片总测试数 22 错误测试数 15 可靠性 10.0 尝试通过率 34.9% 不稳定测试 2 输入令牌 116,970 输出令牌 30,253 推理令牌 0 响应时间（平均） 19.58s 响应时间（总计） 430.85s 响应时间（最大） 238.89s 答案错误: 11 未遵循指令: 3 无答案: 1 反AI技巧 : 4.6 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 5.4 指令遵循 : 6.5 谜题求解 : 3.1 工具调用 : 10.0 常识问答 : 3.0
#135#135	GPT-5.4none	5.8	OpenAI	$0.397	2.07s
查看模型卡片总测试数 22 错误测试数 15 可靠性 10.0 尝试通过率 34.9% 不稳定测试 2 输入令牌 108,632 输出令牌 8,321 推理令牌 0 响应时间（平均） 2.07s 响应时间（总计） 45.51s 响应时间（最大） 15.63s 答案错误: 14 未遵循指令: 1 反AI技巧 : 3.2 编程 : 5.5 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.4 指令遵循 : 6.5 谜题求解 : 5.6 工具调用 : 10.0 常识问答 : 3.0
#140#140	KAT-Coder-Air V2.5high	5.6	Kwaipilot	$0.077	15.90s
查看模型卡片总测试数 22 错误测试数 15 可靠性 9.9 尝试通过率 43.9% 不稳定测试 6 输入令牌 50,470 输出令牌 3,957 推理令牌 111,374 响应时间（平均） 15.90s 响应时间（总计） 349.71s 响应时间（最大） 118.35s 答案错误: 9 API 错误: 3 额外格式: 3 反AI技巧 : 6.9 编程 : 4.3 综合 : 6.5 数据解析与提取 : 6.5 领域专项 : 2.9 通用智能 : 5.1 指令遵循 : 9.8 谜题求解 : 3.5 工具调用 : 10.0 常识问答 : 3.0
#147#147	GLM 5.1none	5.5	Z.ai	$0.164 ↓	6.70s
查看模型卡片总测试数 22 错误测试数 15 可靠性 10.0 尝试通过率 40.9% 不稳定测试 5 输入令牌 124,209 输出令牌 14,393 推理令牌 0 响应时间（平均） 6.70s 响应时间（总计） 147.38s 响应时间（最大） 61.20s 答案错误: 13 无效工具调用: 1 无答案: 1 反AI技巧 : 4.0 编程 : 3.9 综合 : 2.8 数据解析与提取 : 10.0 领域专项 : 2.9 通用智能 : 5.0 指令遵循 : 9.8 谜题求解 : 7.7 工具调用 : 10.0 常识问答 : 3.0
#148#148	Qwen3.6 27Bnone	5.5	Qwen	$0.087 ↑	10.65s
查看模型卡片总测试数 22 错误测试数 15 可靠性 10.0 尝试通过率 45.5% 不稳定测试 6 输入令牌 95,796 输出令牌 16,155 推理令牌 0 响应时间（平均） 10.65s 响应时间（总计） 234.39s 响应时间（最大） 156.31s 答案错误: 11 未遵循指令: 2 无效工具调用: 2 反AI技巧 : 3.8 编程 : 5.5 综合 : 3.2 数据解析与提取 : 7.3 领域专项 : 7.7 通用智能 : 5.2 指令遵循 : 6.2 谜题求解 : 5.3 工具调用 : 9.5 常识问答 : 3.0
#154#154	KAT-Coder-Air V2.5low	5.4	Kwaipilot	$0.041	10.09s
查看模型卡片总测试数 22 错误测试数 15 可靠性 9.9 尝试通过率 45.5% 不稳定测试 7 输入令牌 61,085 输出令牌 5,905 推理令牌 46,990 响应时间（平均） 10.09s 响应时间（总计） 222.03s 响应时间（最大） 86.23s 答案错误: 7 额外格式: 4 API 错误: 2 未遵循指令: 2 反AI技巧 : 7.3 编程 : 3.5 综合 : 6.4 数据解析与提取 : 6.5 领域专项 : 2.9 通用智能 : 5.0 指令遵循 : 9.8 谜题求解 : 3.1 工具调用 : 10.0 常识问答 : 3.0
#194#194	Laguna Xs.2medium	4.1	Poolside	$0.015 ↕	6.73s
查看模型卡片总测试数 19 错误测试数 13 可靠性 10.0 尝试通过率 43.9% 不稳定测试 6 输入令牌 39,481 输出令牌 54,218 推理令牌 0 响应时间（平均） 6.73s 响应时间（总计） 100.98s 响应时间（最大） 29.11s 答案错误: 6 API 错误: 4 无答案: 2 无效工具调用: 1 反AI技巧 : 6.9 编程 : 2.1 综合 : 1.5 数据解析与提取 : 7.1 领域专项 : 4.1 通用智能 : 3.0 指令遵循 : 10.0 谜题求解 : 5.3 工具调用 : 4.7 常识问答 : 3.0
#202#202	gpt-oss-120bnone	3.7	OpenAI	$0.010 ↓	21.61s
查看模型卡片总测试数 19 错误测试数 13 可靠性 10.0 尝试通过率 33.3% 不稳定测试 2 输入令牌 9,081 输出令牌 51,664 推理令牌 0 响应时间（平均） 21.61s 响应时间（总计） 345.79s 响应时间（最大） 113.71s 答案错误: 8 API 错误: 3 未遵循指令: 2 反AI技巧 : 6.5 编程 : 1.5 综合 : 1.5 数据解析与提取 : 6.5 领域专项 : 3.0 通用智能 : 4.8 指令遵循 : 9.8 谜题求解 : 6.0 工具调用 : 3.0 常识问答 : 3.0
#166#166	GLM 5 Turbonone	5.1	Z.ai	$0.047 ↑	2.82s
查看模型卡片总测试数 21 错误测试数 15 可靠性 10.0 尝试通过率 30.3% 不稳定测试 2 输入令牌 32,525 输出令牌 1,815 推理令牌 0 响应时间（平均） 2.82s 响应时间（总计） 59.29s 响应时间（最大） 8.21s 答案错误: 13 未遵循指令: 2 反AI技巧 : 3.0 编程 : 3.9 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.2 指令遵循 : 6.5 谜题求解 : 5.5 工具调用 : 10.0 常识问答 : 3.0
#191#191	Elephant Alphamedium	4.3	Openrouter	$0.000	1.27s
查看模型卡片总测试数 21 错误测试数 15 可靠性不适用尝试通过率 28.8% 不稳定测试 1 输入令牌 33,744 输出令牌 2,596 推理令牌 0 响应时间（平均） 1.27s 响应时间（总计） 22.82s 响应时间（最大） 3.70s 答案错误: 9 API 错误: 3 未遵循指令: 2 无效工具调用: 1 反AI技巧 : 6.6 编程 : 3.7 综合 : 1.5 数据解析与提取 : 6.5 领域专项 : 3.0 通用智能 : 4.3 指令遵循 : 9.8 谜题求解 : 5.3 工具调用 : 3.0 常识问答 : 3.0
#132#132	GPT-5.4 Mininone	5.9	OpenAI	$0.095	1.53s
查看模型卡片总测试数 22 错误测试数 16 可靠性 10.0 尝试通过率 33.3% 不稳定测试 3 输入令牌 79,067 输出令牌 7,880 推理令牌 0 响应时间（平均） 1.53s 响应时间（总计） 33.74s 响应时间（最大） 9.92s 答案错误: 13 未遵循指令: 3 反AI技巧 : 3.1 编程 : 5.5 综合 : 6.5 数据解析与提取 : 10.0 领域专项 : 3.5 通用智能 : 4.8 指令遵循 : 6.3 谜题求解 : 5.4 工具调用 : 3.0 常识问答 : 3.0
#138#138	Qwen3.5-122B-A10Bnone	5.7	Qwen	$0.247 ↓	12.92s
查看模型卡片总测试数 22 错误测试数 16 可靠性 10.0 尝试通过率 33.3% 不稳定测试 2 输入令牌 241,566 输出令牌 88,458 推理令牌 0 响应时间（平均） 12.92s 响应时间（总计） 284.21s 响应时间（最大） 212.63s 答案错误: 13 未遵循指令: 2 无效工具调用: 1 反AI技巧 : 4.8 编程 : 3.7 综合 : 5.2 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 5.0 指令遵循 : 6.3 谜题求解 : 3.8 工具调用 : 10.0 常识问答 : 3.0
#150#150	MiMo-V2.5-Pronone	5.5	Xiaomi	$0.068 ↓	4.12s
查看模型卡片总测试数 22 错误测试数 16 可靠性 10.0 尝试通过率 37.9% 不稳定测试 4 输入令牌 124,799 输出令牌 15,362 推理令牌 0 响应时间（平均） 4.12s 响应时间（总计） 90.55s 响应时间（最大） 53.13s 答案错误: 11 未遵循指令: 4 无答案: 1 反AI技巧 : 3.3 编程 : 4.3 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.0 指令遵循 : 6.4 谜题求解 : 6.7 工具调用 : 10.0 常识问答 : 3.0
#151#151	Kimi K2.5none	5.5	Moonshot AI	$0.127 ↑	19.15s
查看模型卡片总测试数 22 错误测试数 16 可靠性 10.0 尝试通过率 34.9% 不稳定测试 4 输入令牌 89,322 输出令牌 26,638 推理令牌 0 响应时间（平均） 19.15s 响应时间（总计） 287.30s 响应时间（最大） 102.83s 答案错误: 15 无答案: 1 反AI技巧 : 3.6 编程 : 5.5 综合 : 2.8 数据解析与提取 : 7.3 领域专项 : 5.3 通用智能 : 10.0 指令遵循 : 6.5 谜题求解 : 3.0 工具调用 : 10.0 常识问答 : 3.0
#155#155	GPT-5.6 Lunanone	5.4	OpenAI	$0.142	1.50s
查看模型卡片总测试数 22 错误测试数 16 可靠性 10.0 尝试通过率 34.9% 不稳定测试 3 输入令牌 101,323 输出令牌 6,709 推理令牌 0 响应时间（平均） 1.50s 响应时间（总计） 32.91s 响应时间（最大） 10.57s 答案错误: 14 额外格式: 1 无效工具调用: 1 反AI技巧 : 4.8 编程 : 3.8 综合 : 3.2 数据解析与提取 : 10.0 领域专项 : 2.9 通用智能 : 5.0 指令遵循 : 7.1 谜题求解 : 5.3 工具调用 : 10.0 常识问答 : 3.0
#160#160	Inklingnone	5.2	Thinkingmachines	$0.147	3.50s
查看模型卡片总测试数 22 错误测试数 16 可靠性 9.9 尝试通过率 28.8% 不稳定测试 1 输入令牌 104,111 输出令牌 10,551 推理令牌 0 响应时间（平均） 3.50s 响应时间（总计） 77.09s 响应时间（最大） 48.02s 答案错误: 13 额外格式: 1 未遵循指令: 1 无效工具调用: 1 反AI技巧 : 4.8 编程 : 4.5 综合 : 2.9 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 5.0 指令遵循 : 6.3 谜题求解 : 5.6 工具调用 : 3.0 常识问答 : 3.0
#169#169	DeepSeek V3.2none	5.0	DeepSeek	$0.054 ↑	18.25s
查看模型卡片总测试数 22 错误测试数 16 可靠性 10.0 尝试通过率 37.9% 不稳定测试 6 输入令牌 135,780 输出令牌 42,097 推理令牌 0 响应时间（平均） 18.25s 响应时间（总计） 401.60s 响应时间（最大） 115.89s 答案错误: 7 API 错误: 4 额外格式: 2 无效工具调用: 2 未遵循指令: 1 反AI技巧 : 3.2 编程 : 3.1 综合 : 4.8 数据解析与提取 : 6.3 领域专项 : 2.9 通用智能 : 4.7 指令遵循 : 10.0 谜题求解 : 7.6 工具调用 : 10.0 常识问答 : 3.0
#172#172	GLM 4.7 Flashnone	4.9	Z.ai	$0.016	9.15s
查看模型卡片总测试数 22 错误测试数 16 可靠性 10.0 尝试通过率 34.9% 不稳定测试 3 输入令牌 101,504 输出令牌 22,992 推理令牌 0 响应时间（平均） 9.15s 响应时间（总计） 137.18s 响应时间（最大） 97.15s 答案错误: 13 无效工具调用: 2 未遵循指令: 1 反AI技巧 : 5.2 编程 : 4.3 综合 : 3.0 数据解析与提取 : 7.3 领域专项 : 7.7 通用智能 : 4.0 指令遵循 : 6.5 谜题求解 : 6.4 工具调用 : 2.8 常识问答 : 3.0
#174#174	Ling-2.6-flashnone	4.9	Inclusionai	$0.002 ↑	10.68s
查看模型卡片总测试数 22 错误测试数 16 可靠性 10.0 尝试通过率 30.3% 不稳定测试 2 输入令牌 114,375 输出令牌 14,903 推理令牌 0 响应时间（平均） 10.68s 响应时间（总计） 213.51s 响应时间（最大） 36.03s 答案错误: 9 无效工具调用: 3 API 错误: 2 未遵循指令: 2 反AI技巧 : 6.8 编程 : 5.3 综合 : 3.0 数据解析与提取 : 6.5 领域专项 : 3.0 通用智能 : 4.0 指令遵循 : 9.8 谜题求解 : 2.9 工具调用 : 3.0 常识问答 : 3.0
#201#201	Laguna Xs.2none	3.8	Poolside	$0.004 ↕	806ms
查看模型卡片总测试数 19 错误测试数 14 可靠性 10.0 尝试通过率 22.7% 不稳定测试 0 输入令牌 33,675 输出令牌 2,826 推理令牌 0 响应时间（平均） 806ms 响应时间（总计） 12.09s 响应时间（最大） 2.01s 答案错误: 8 API 错误: 4 未遵循指令: 1 无效工具调用: 1 反AI技巧 : 3.0 编程 : 8.3 综合 : 1.5 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 3.0 指令遵循 : 6.5 谜题求解 : 5.3 工具调用 : 3.0 常识问答 : 3.0
#189#189	Elephant Alphanone	4.3	Openrouter	$0.000	1.22s
查看模型卡片总测试数 21 错误测试数 16 可靠性不适用尝试通过率 25.8% 不稳定测试 1 输入令牌 33,743 输出令牌 2,573 推理令牌 0 响应时间（平均） 1.22s 响应时间（总计） 22.03s 响应时间（最大） 3.81s 答案错误: 9 API 错误: 3 未遵循指令: 3 无效工具调用: 1 反AI技巧 : 6.6 编程 : 4.2 综合 : 1.5 数据解析与提取 : 6.5 领域专项 : 3.0 通用智能 : 4.0 指令遵循 : 9.8 谜题求解 : 4.2 工具调用 : 3.0 常识问答 : 3.0
#146#146	DeepSeek V4 Flashnone	5.6	DeepSeek	$0.044 ↓	36.78s
查看模型卡片总测试数 22 错误测试数 17 可靠性 10.0 尝试通过率 31.8% 不稳定测试 4 输入令牌 240,221 输出令牌 100,727 推理令牌 0 响应时间（平均） 36.78s 响应时间（总计） 809.09s 响应时间（最大） 247.27s 答案错误: 12 额外格式: 2 无效工具调用: 2 未遵循指令: 1 反AI技巧 : 3.0 编程 : 4.2 综合 : 4.6 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.2 指令遵循 : 6.5 谜题求解 : 3.1 工具调用 : 10.0 常识问答 : 3.0
#156#156	Laguna XS 2.1none	5.3	Poolside	$0.008	1.55s
查看模型卡片总测试数 22 错误测试数 17 可靠性 10.0 尝试通过率 30.3% 不稳定测试 3 输入令牌 91,598 输出令牌 13,377 推理令牌 0 响应时间（平均） 1.55s 响应时间（总计） 34.19s 响应时间（最大） 19.02s 答案错误: 14 未遵循指令: 1 无效工具调用: 1 超时: 1 反AI技巧 : 5.3 编程 : 4.3 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 5.0 指令遵循 : 3.8 谜题求解 : 3.0 工具调用 : 10.0 常识问答 : 3.0
#161#161	Mistral Small 4none	5.1	Mistral	$0.022	1.20s
查看模型卡片总测试数 22 错误测试数 17 可靠性 10.0 尝试通过率 25.8% 不稳定测试 1 输入令牌 104,708 输出令牌 9,812 推理令牌 0 响应时间（平均） 1.20s 响应时间（总计） 26.38s 响应时间（最大） 13.16s 答案错误: 16 未遵循指令: 1 反AI技巧 : 3.4 编程 : 3.7 综合 : 3.0 数据解析与提取 : 10.0 领域专项 : 5.3 通用智能 : 4.0 指令遵循 : 6.5 谜题求解 : 3.1 工具调用 : 10.0 常识问答 : 3.0

←

1 2 3 4 5 6 7

→

快速对比

AI Benchy 排行榜

筛选模型

快速对比