SQBench

大模型实战能力评测基准

沙丘社区是中国领先的AI研究与评测机构。SQBench聚焦大模型在真实业务场景中的实战表现,围绕任务交付、风险边界与成本效率等维度,为模型选型、能力对比和部署决策提供参考依据。

更新日志

模型评测 · 9月22日Grok 4.7 (Xhigh)评测结果上线模型评测 · 9月22日MiMo-V2.6-Pro评测结果上线社区洞察 · 9月21日“上桌?Step 5 Preview实战能力评测”发布模型评测 · 9月20日Step 5 Preview (High)评测结果上线社区洞察 · 9月20日“GLM-5.3-FlashX,新晋性价比之王”发布社区洞察 · 9月19日“让豆包新模型干了24小时,效果却不如旧模型?”发布模型评测 · 9月19日GLM-5.3-FlashX (Max)评测结果上线模型评测 · 9月19日GLM-5.3-Flash (Max)评测结果上线模型评测 · 9月19日GLM-5.3 (Max)评测结果上线社区洞察 · 9月18日“追踪2142项AI技术动态后,我们发现最值得关注的不是新模型”发布模型评测 · 9月18日Doubao-Seed-2.1-pro-260915 (High)评测结果上线社区洞察 · 9月17日“DeepSeek真能“斩杀”千问和豆包吗?”发布模型评测 · 9月16日Qwen3.8-Max (Xhigh)评测结果上线模型评测 · 9月16日Qwen3.8-Flash (Xhigh)评测结果上线社区洞察 · 9月16日“DeepSeek V4.1 Flash真的超越V4 Pro了吗?”发布社区洞察 · 9月15日“本周AI技术跟踪:失效信息将影响Agent记忆可靠性(W37)”发布模型评测 · 9月15日DeepSeek-V4-Pro-0813 (Max)评测结果上线社区洞察 · 9月14日“研究精选:13份报告,聚焦企业AI的成本、落地与组织能力”发布模型评测 · 9月14日DeepSeek-V4.1-Flash (Max)评测结果上线社区洞察 · 9月11日“英伟达给AI加上长期记忆,Agent要拼的不只是智商了”发布更多日志
SQBENCH RESEARCH · NEW

SQBench 评测基准论文

面向真实业务场景的大模型实战评测框架

Leaderboard

实战能力排行榜

基于 SQBench 实战任务结果排序,展示模型在真实业务场景中的综合表现。

排名模型按实战能力原始分排序,同分时按最终表现原始分排序;两项均同分则并列。未触发风险扣分的任务比例,越高越好触发幻觉相关风险的任务比例,越低越好完成本次评测的模型 API 成本
1GPT-6 Astra (Max)OpenAI64.390.0%3.3%$168.962Claude Fable 5.1 (Max)Anthropic63.187.1%3.3%$376.303Kimi K3月之暗面60.588.1%6.2%$42.174Claude Opus 4.8 (Max)Anthropic57.683.3%4.7%$201.225GLM-5.3 (Max)智谱56.179.9%7.2%$29.586MiMo-V2.6-Pro小米54.882.9%5.9%$4.457GPT-5.6 Sol (Max)OpenAI54.685.7%4.3%$103.148GLM-5.3-FlashX (Max)智谱54.680.4%6.8%$5.689GLM-5.2 (Max)智谱52.788.3%6.2%$27.0410Gemini 3.6 Flash (High)Google51.882.6%4.2%$81.77

Models

模型表现

展示模型在 SQBench 实战任务中的总体表现、完成质量与风险影响。

实战能力

基于任务通过情况衡量模型在真实业务任务中的稳定交付表现,越高表示可稳定完成的任务比例越高。

推理模型以此图标标识

实战能力

实战能力采用任务通过口径计算,强调模型在标准评测条件下稳定达标的能力;最终表现分和任务完成分保留连续得分,用于辅助分析任务完成质量与风险影响。

Capability

实战能力分析

从基础执行、复合工作流和业务场景三个层面,比较模型在不同类型实战任务中的表现。

L1 原子能力

评估模型在基础认知、指令执行、长上下文推理、代码逻辑和边界处理中的稳定性。

指令遵循

越高越好

长文本推理

越高越好

动态代码逻辑

越高越好

鲁棒性与边界

越高越好

推理模型以此图标标识

Safety & Reliability

安全与合规

对比模型在任务执行中的可靠性、风险控制和幻觉相关表现。

Cost Efficiency

成本效率

展示模型完成 SQBench 实战任务所需的评测成本、完成耗时和 Token 消耗,用于辅助判断规模化使用成本。

评测成本

完成本次评测产生的模型 API 成本,越低表示调用成本越低。

输入推理回答

推理模型以此图标标识

Value

性价比

对比模型实战能力与可靠度、评测成本、完成耗时和 Token 消耗,辅助判断不同模型的部署价值。

实战能力 vs 可靠度

对比模型的任务交付表现与风险稳定性,右上区域更优。

OpenAIAnthropic月之暗面智谱小米GoogleDeepSeek字节跳动阿里巴巴xAI阶跃星辰
理想区域实战能力可靠度50.055.060.065.075.0%80.0%85.0%90.0%GPT-6 Astra (Max)GPT-6 Astra (Max)可靠度90.0%实战能力64.3%Click for more infoClaude Fable 5.1 (Max)Claude Fable 5.1 (Max)可靠度87.1%实战能力63.1%Click for more infoKimi K3Kimi K3可靠度88.1%实战能力60.5%Click for more infoClaude Opus 4.8 (Max)Claude Opus 4.8 (Max)可靠度83.3%实战能力57.6%Click for more infoGLM-5.3 (Max)GLM-5.3 (Max)可靠度79.9%实战能力56.1%Click for more infoMiMo-V2.6-ProMiMo-V2.6-Pro可靠度82.9%实战能力54.8%Click for more infoGPT-5.6 Sol (Max)GPT-5.6 Sol (Max)可靠度85.7%实战能力54.6%Click for more infoGLM-5.3-FlashX (Max)GLM-5.3-FlashX (Max)可靠度80.4%实战能力54.6%Click for more infoGLM-5.2 (Max)GLM-5.2 (Max)可靠度88.3%实战能力52.7%Click for more infoGemini 3.6 Flash (High)Gemini 3.6 Flash (High)可靠度82.6%实战能力51.8%Click for more infoDeepSeek-V4-Pro-0813 (Max)DeepSeek-V4-Pro-0813 (Max)可靠度83.7%实战能力51.4%Click for more infoDoubao-Seed-2.1-turbo (High)Doubao-Seed-2.1-turbo (High)可靠度85.8%实战能力51.3%Click for more infoQwen3.8-Max (Xhigh)Qwen3.8-Max (Xhigh)可靠度75.8%实战能力51.3%Click for more infoQwen3.7-MaxQwen3.7-Max可靠度86.3%实战能力51.1%Click for more infoGrok 4.7 (Xhigh)Grok 4.7 (Xhigh)可靠度81.0%实战能力50.6%Click for more infoKimi K2.7 CodeKimi K2.7 Code可靠度84.2%实战能力50.4%Click for more infoStep 5 Preview (High)Step 5 Preview (High)可靠度75.7%实战能力50.0%Click for more infoGLM-5.3-Flash (Max)GLM-5.3-Flash (Max)可靠度78.3%实战能力49.7%Click for more infoDeepSeek-V4-Pro (Max)DeepSeek-V4-Pro (Max)可靠度79.9%实战能力49.5%Click for more infoMiMo-V2.5MiMo-V2.5可靠度79.0%实战能力48.5%Click for more infoDeepSeek-V4-Pro (High)DeepSeek-V4-Pro (High)可靠度82.2%实战能力48.3%Click for more infoDoubao-Seed-2.1-pro (High)Doubao-Seed-2.1-pro (High)可靠度84.9%实战能力48.1%Click for more infoDeepSeek-V4.1-Flash (Max)DeepSeek-V4.1-Flash (Max)可靠度77.1%实战能力48.0%Click for more infoKimi K2.6Kimi K2.6可靠度87.5%实战能力47.3%Click for more infoDeepSeek-V4-Flash (High)DeepSeek-V4-Flash (High)可靠度83.2%实战能力47.1%Click for more info

推理模型以此图标标识

Price

价格

展示模型公开调用单价,用于理解不同模型的基础计费差异;实际评测成本以成本效率部分为准。

分项价格

展示每百万 Token 的输入、输出和缓存单价,越低越好。

缓存输入输出
MiMo-V2.5缓存$0.0028输入$0.14输出$0.28MiMo-V2.5
DeepSeek-V4-Flash (High)缓存$0.0028输入$0.14输出$0.28DeepSeek-V4-Flash (High)
GLM-5.3-Flash (Max)缓存$0.03输入$0.12输出$0.41GLM-5.3-Flash (Max)
DeepSeek-V4.1-Flash (Max)缓存$0.0030输入$0.15输出$0.60DeepSeek-V4.1-Flash (Max)
MiMo-V2.6-Pro缓存$0.0036输入$0.44输出$0.87MiMo-V2.6-Pro
DeepSeek-V4-Pro (Max)缓存$0.0036输入$0.44输出$0.87DeepSeek-V4-Pro (Max)
DeepSeek-V4-Pro (High)缓存$0.0036输入$0.44输出$0.87DeepSeek-V4-Pro (High)
GLM-5.3-FlashX (Max)缓存$0.08输入$0.29输出$1.03GLM-5.3-FlashX (Max)
DeepSeek-V4-Pro-0813 (Max)缓存$0.02输入$0.66输出$1.98DeepSeek-V4-Pro-0813 (Max)
Doubao-Seed-2.1-turbo (High)缓存$0.09输入$0.44输出$2.21Doubao-Seed-2.1-turbo (High)
Step 5 Preview (High)缓存$0.05输入$1.03输出$2.94Step 5 Preview (High)
Kimi K2.7 Code缓存$0.19输入$0.96输出$3.97Kimi K2.7 Code
Kimi K2.6缓存$0.16输入$0.96输出$3.97Kimi K2.6
GLM-5.3 (Max)缓存$0.29输入$1.18输出$4.12GLM-5.3 (Max)
GLM-5.2 (Max)缓存$0.29输入$1.18输出$4.12GLM-5.2 (Max)
Doubao-Seed-2.1-pro (High)缓存$0.18输入$0.88输出$4.41Doubao-Seed-2.1-pro (High)
Grok 4.7 (Xhigh)缓存$0.40输入$1.60输出$4.80Grok 4.7 (Xhigh)
Qwen3.8-Max (Xhigh)缓存$0.22输入$1.77输出$5.29Qwen3.8-Max (Xhigh)
Qwen3.7-Max缓存$0.35输入$1.77输出$5.29Qwen3.7-Max
Gemini 3.6 Flash (High)缓存$0.15输入$1.50输出$7.50Gemini 3.6 Flash (High)
Kimi K3缓存$0.29输入$2.94输出$14.71Kimi K3
Claude Opus 4.8 (Max)缓存$0.50输入$5.00输出$25.00Claude Opus 4.8 (Max)
GPT-5.6 Sol (Max)缓存$0.50输入$5.00输出$30.00GPT-5.6 Sol (Max)
GPT-6 Astra (Max)缓存$1.00输入$10.00输出$50.00GPT-6 Astra (Max)
Claude Fable 5.1 (Max)缓存$0.25输入$10.00输出$50.00Claude Fable 5.1 (Max)

推理模型以此图标标识