摘要
本报告对 Kimi K3、DeepSeek-V4-Pro、GPT-5.6 Sol 与 Claude Fable 5 进行证据综合比较。研究以厂商官方文档、模型卡、技术报告、API 定价与隐私条款为第一层证据,以 Artificial Analysis 等具备公开方法的第三方评测为第二层证据,并将厂商自测、不同代理框架和不同推理预算的结果分开解释。研究发现:GPT-5.6 Sol 与 Claude Fable 5 在现有综合证据中构成能力第一梯队,但两者差距小于评测误差和任务差异,不能据此认定存在普适冠军;GPT-5.6 Sol 在工程生态、工具编排、文档与表格工作、成本效率方面更均衡,Claude Fable 5 在长程代理、复杂研究与写作质量方面更具优势倾向。Kimi K3 是目前值得重点关注的开放权重前沿模型,中文、原生多模态、长上下文和代理能力突出,但发布时间短、许可证包含商业附加条件,稳定性和合规结论仍需更多时间验证。DeepSeek-V4-Pro 的价格优势非常显著,但它仍被官方标注为 Preview,且 2026 年 7 月 31 日发布的 V4-Flash-0731 已在官方列出的多项代理基准中超过 V4-Pro,因此不宜将 V4-Pro直接视为 DeepSeek 当前最成熟的默认模型。报告最终给出按任务路由的多模型组合方案,并提供一套可复现的统一实测协议。
关键词:大语言模型评测;AI Agent;软件工程;长上下文;模型路由;API 成本;数据安全
证据标签:【事实】官方可核验信息;【厂商结果】厂商在特定设置下报告的成绩;【第三方结果】独立机构特定版本与设置的结果;【分析判断】本报告基于证据的推论;【证据不足】尚不能可靠下结论。
研究准备与核验
A. 型号核验结果
| 模型 | 核验结论 | 比较时的关键限制 |
|---|---|---|
| Kimi K3 | 正式发布;旗舰;2026-07-27 发布权重与技术报告 | 发布极新,长期稳定性证据有限 |
| DeepSeek-V4-Pro | 官方型号存在;2026-04-24 发布 Preview | 仍为 Preview;V4-Flash-0731 已在多项官方代理基准中超过它 |
| GPT-5.6 Sol | 正式发布;GPT-5.6 家族旗舰;gpt-5.6 默认指向 Sol |
Sol、Terra、Luna 为不同档位,不能混算 |
| Claude Fable 5 | 正式发布;2026-06-09 起 GA;Anthropic 最高能力公开档 | 始终开启自适应思考;要求 30 天留存,不支持 ZDR |
【结论】四个名称均为真实官方型号,但发布阶段、开放程度、代理框架和数据保留条件并不对称。若忽略这些差异,任何总排名都会产生误导。
B. 研究计划
先核对型号、版本、上下文、模态、推理模式、开放许可证和官方可用状态。
分别整理厂商自测与第三方结果,检查推理预算、工具权限、代理框架、版本号和发布日期。
将能力评价拆为推理、编程、Agent、长上下文、中文、写作、研究、多模态、数据分析、稳定性与效率等维度。
基于公开价格建立统一 Token 成本模型;对无法获得失败率和重试率的数据,不虚构“实际成本”。
最后给出场景化选型、模型组合、风险条件和可复现实测协议,并进行独立自查。
C. 信息来源清单
主要证据来源包括:Moonshot/Kimi 开放平台、Kimi K3 GitHub 与技术报告;DeepSeek 官方 API 文档、Hugging Face 模型卡与隐私政策;OpenAI 模型文档、GPT-5.6 发布页、API 定价与企业隐私政策;Anthropic 模型、定价、迁移、上下文和数据保留文档;Artificial Analysis 的 Intelligence Index、速度、成本和 AA-Briefcase 等公开评测。参考资料详见第 41 节。
D. 测试方案
本报告没有跨四家 API 的同环境调用权限,因此未声称完成受控统一实验。第 10 节与附录 A 给出 76 项统一测试协议,包括复杂推理、数学、编程、多文件工程、工具调用、长上下文、双语写作、事实核查、错误前提、多模态、数据分析、研究与项目规划。执行时应固定版本、推理强度、工具权限、温度、重试次数和评分器。
E. 评分标准
用户给定的 19 项权重合计为 102 分。为避免总分失真,本报告保持各项相对比例并归一化到 100 分。评分为“证据综合决策分”,融合官方规格、第三方评测、产品成熟度、成本、生态和风险,不等同于统一实验正确率。
| 维度 | 原权重 | 归一化权重 |
|---|---|---|
| 综合推理 | 10 | 9.80 |
| 编程与软件工程 | 12 | 11.76 |
| Agent与工具调用 | 10 | 9.80 |
| 指令遵循 | 8 | 7.84 |
| 长上下文 | 8 | 7.84 |
| 中文能力 | 7 | 6.86 |
| 英文及多语言 | 4 | 3.92 |
| 写作能力 | 5 | 4.90 |
| 学术研究 | 5 | 4.90 |
| 事实准确性 | 8 | 7.84 |
| 多模态 | 4 | 3.92 |
| 数据分析 | 4 | 3.92 |
| 稳定性 | 4 | 3.92 |
| 响应速度 | 2 | 1.96 |
| Token效率 | 3 | 2.94 |
| API成本 | 3 | 2.94 |
| 生态与部署 | 2 | 1.96 |
| 隐私与企业能力 | 2 | 1.96 |
| 安全边界与可用性 | 1 | 0.98 |
F. 当前无法获得或无法公平比较的数据
四模型在同一 API 地区、同一时间、相同硬件与相同网络下的首字延迟、吞吐、错误率和峰值稳定性。
四模型以完全相同代理框架执行同一代码库任务的真实成功率;Codex、Claude Code、Kimi Code 与 DeepSeek Harness 会显著改变结果。
一致的 1M 长上下文中英文联合测试、统一多模态测试和三次以上重复实验。
厂商未公开的总参数、激活参数、训练数据或知识截止日期;报告一律标记“官方未公开”。
在缺乏受控失败率与重试率时的精确“每个成功任务成本”;报告仅提供理论单次成本和敏感性范围。
1. 报告标题
《前沿大语言模型横向评估:Kimi K3、DeepSeek-V4-Pro、GPT-5.6 Sol 与 Claude Fable 5——基于官方文档、模型卡、独立基准与成本建模的证据综合研究》。
2. 研究日期与版本说明
本报告资料与价格查询截至 2026 年 8 月 2 日 23:30(UTC+8)。模型更新速度很快,尤其 Kimi K3 发布仅数日、DeepSeek-V4-Pro 仍是 Preview,任何结论都应与具体日期绑定。GPT-5.6 Sol 于 2026 年 7 月 9 日正式发布;Claude Fable 5 自 2026 年 6 月 9 日起一般可用;DeepSeek-V4-Pro 于 2026 年 4 月 24 日以 Preview 形式发布;Kimi K3 权重与技术报告于 2026 年 7 月 27 日公开。[1][4][8][11]
版本区分:GPT-5.6 的 Sol、Terra、Luna 是不同成本与能力档位,本报告只评 Sol;Claude Fable 5 与 Opus 5 是不同型号,本报告不以更便宜的 Opus 5 成绩替换 Fable;DeepSeek-V4-Flash-0731 仅用于说明 V4-Pro 的当前产品位置变化,不作为第五个主评对象。
3. 执行摘要
| 问题 | 执行摘要 |
|---|---|
| 综合能力上限 | GPT-5.6 Sol 与 Claude Fable 5 同属第一梯队;现有差异不足以支持普适冠军。 |
| 软件工程 | GPT-5.6 Sol 更适合作为通用生产主模型;Fable 5 适合高难度长程代理;Kimi K3 是开放权重强替代。 |
| 中文与本地语境 | Kimi K3 具有最强倾向;DeepSeek 次之,但中文优势不等于所有专业任务均领先。 |
| API 成本 | DeepSeek-V4-Pro 最低,Kimi K3 次之;GPT-5.6 Sol 与 Fable 5 明显更贵。 |
| 企业敏感数据 | 严格 ZDR 更倾向 OpenAI 合格端点;Fable 5 明确不支持 ZDR;开放权重可通过自托管降低外发风险。 |
| 关键风险 | Kimi 新、DeepSeek Pro 为 Preview、Fable 贵且留存 30 天、GPT 长上下文分段加价。 |
决策原则不是寻找单一“最强”,而是按任务复杂度、可验证性、成本、数据敏感度和代理框架进行路由。
4. 核心结论
【高置信度】四模型都支持约 1M 上下文;但“标称窗口相同”不代表有效检索、长链推理或成本相同。
【中高置信度】第三方 Intelligence Index v4.1 为 Fable 5 约 60、GPT-5.6 Sol 约 59、Kimi K3 约 57、DeepSeek-V4-Pro 约 44;1-3 分差距不应解释为绝对能力等级差。[16][17][18]
【高置信度】DeepSeek-V4-Pro 的标准 API 单价最低;但其 Preview 状态和当前代理基准位置降低了其作为关键生产主模型的确定性。[4][6]
【中等置信度】GPT-5.6 Sol 是最均衡的工程默认选项;Claude Fable 5 更偏向昂贵的长程高难任务;Kimi K3 更适合中文、开放权重和可控部署。
【证据不足】无法可靠断言哪一款“幻觉最低”“1M 上下文最稳”或“任何地区都最快”,因为缺少统一版本、统一工具和多次重复实验。
图 1 Artificial Analysis Intelligence Index v4.1 快照。第三方分数受版本、推理设置与评测方法影响。
5. 四款模型一句话定位
| 模型 | 一句话定位 |
|---|---|
| Kimi K3 | 开放权重、原生多模态、1M 上下文的中文前沿 Agent 模型;潜力高,但新模型与自定义许可证需要谨慎评估。 |
| DeepSeek-V4-Pro | 极低成本、1M 上下文的开放权重文本模型;仍处 Preview,当前代理表现已被同厂新版 Flash 反超。 |
| GPT-5.6 Sol | 能力、工具、工程生态和单位成功任务成本较均衡的闭源旗舰,适合生产型知识工作与软件工程。 |
| Claude Fable 5 | 面向长程代理和高难知识工作的顶级闭源模型,写作与研究优势明显,但价格和 30 天留存约束突出。 |
6. 基础参数总表
| 属性 | Kimi K3 | DeepSeek V4 Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|---|
| 厂商/地区 | Moonshot AI/中国 | DeepSeek/中国 | OpenAI/美国 | Anthropic/美国 |
| 正式型号 | Kimi K3 | DeepSeek-V4-Pro | gpt-5.6-sol;gpt-5.6 默认 Sol | claude-fable-5 |
| 状态/日期 | 正式;权重 2026-07-27 | Preview;2026-04-24 | GA;2026-07-09 | GA;2026-06-09 |
| 模型定位 | 旗舰、长程编程/知识工作 | V4 Pro 预览旗舰 | GPT-5.6 旗舰 | 最高能力公开档、长程 Agent |
| 开放情况 | 开放权重;Kimi K3 License | 开放权重;MIT | 闭源 | 闭源 |
| 总/激活参数 | 2.8T/104B | 1.6T/49B | 官方未公开 | 官方未公开 |
| 架构 | MoE;KDA+Gated MLA+AttnRes | MoE;CSA+HCA+mHC | 官方未公开 | 官方未公开 |
| 上下文 | 1,048,576 | 1M | 1,050,000 | 1M |
| 最大输出 | 无单一稳定值公开;受 1M 总窗口约束 | 最大 384K | 128K | 128K |
| 知识截止 | 官方未公开 | 官方未公开 | 2026-02-16 | 可靠/训练截止 2026-01 |
| 推理模式 | 始终思考;low/high/max | 思考与非思考;默认思考 | none 至 max 多档 | 自适应思考始终开启 |
| 输入模态 | 文本、图像;官方 API 亦接受视频 | 文本 | 文本、图像 | 文本、图像 |
| 输出模态 | 文本 | 文本 | 文本 | 文本 |
| 工具调用 | 支持,含动态加载/官方工具 | 支持 | 支持,Responses 工具生态广 | 支持,Messages/工具生态成熟 |
| 结构化输出 | 严格 JSON Schema | JSON Output | Structured Outputs | Structured Outputs |
| API 兼容 | OpenAI Chat Completions 风格 | OpenAI/Anthropic 兼容 | 原生 OpenAI | 原生 Anthropic;多云 |
| 本地/私有化 | 可,硬件门槛极高 | 可,硬件门槛极高 | 不可获取权重 | 不可获取权重 |
注:Kimi 官方仓库的文字说明包含视频理解,而模型摘要表将 Modality 列为 Text、Image;报告据此将视频标为“API/说明支持,但需工程验证”,避免把产品预处理能力与基础模型原生能力完全等同。[2][3]
7. 产品形态与型号差异
Kimi K3 的 API、Kimi 产品和本地开放权重部署不是同一系统:网页产品可能附带搜索、文件、代码执行和记忆;本地权重则取决于用户自建代理框架。DeepSeek 同样存在 chat.deepseek.com、官方 API、Hugging Face 权重和第三方推理服务差异。OpenAI 的 ChatGPT Work/Codex 与基础 API 模型拥有不同系统指令和工具;Claude API、Claude Code、Bedrock、Google Cloud 与 Microsoft Foundry 的托管边界也不同。
比较时必须把“基础模型能力”“官方代理产品能力”“第三方代理框架能力”分离。尤其编程榜单中,Codex、Claude Code、Kimi Code、Terminus 或 DeepSeek Harness 会改变上下文整理、补丁格式、测试循环和工具恢复机制,排名可能随框架改变。
DeepSeek 的当前产品位置需要单独说明:V4-Pro 仍是 Preview,而 7 月 31 日发布的 V4-Flash-0731 已在官方公布的 TerminalBench 2.1、NL2Repo、DeepSWE、Toolathlon、Agents’ Last Exam 等多项代理测试中超过 V4-Pro。因此,本报告评 V4-Pro,但不把它写成 DeepSeek 当前无条件首选。[6]
8. 官方基准测试整理
| 来源 | 覆盖内容 | 解释限制 |
|---|---|---|
| Kimi K3 技术报告 | GPQA、AA-LCR、DeepSWE、Terminal-Bench、OfficeQA 等 | 部分结果使用不同 harness;厂商报告主动承认总体仍落后 Fable 5 与 GPT-5.6 Sol。 |
| DeepSeek V4 模型卡 | 知识、数学、代码、Agent、1M 长上下文 | Preview 版本;后续 Flash-0731 已在多项 Agent 基准反超 Pro。 |
| OpenAI GPT-5.6 发布页 | Agents’ Last Exam、GDPval-AA、SWE/Terminal、OSWorld、长上下文等 | 包含厂商选择的设置、内部测试和竞品成绩;需与独立结果分开。 |
| Anthropic Fable 5 文档 | 强调长程代理、1M 上下文、自适应思考 | 官方定位不是中立横向实验;Fable 还存在 fallback 和安全分类器影响。 |
厂商基准的价值在于说明模型设计目标与可达到的上限,但不能直接作为市场排名。需要检查评测日期、推理强度、是否使用工具、代理框架、重复次数以及竞品是否使用同等配置。
9. 第三方评测整理
| 第三方指标 | 结果快照 | 限制 |
|---|---|---|
| Artificial Analysis Intelligence Index v4.1 | Fable 60;GPT Sol 59;Kimi 57;DeepSeek Pro 44 | 综合能力快照;版本会更新,不能跨版本直接比较 |
| AA 输出速度 | GPT max 67.6 tok/s;Fable 66.2;DeepSeek 约 57;Kimi 34.7 | 速度由提供商、地区和推理档位决定 |
| AA 首字延迟 | DeepSeek 约 1.55s;Kimi 3.29s;Fable max 80.65s;GPT max 137.84s | max 档包含长思考;不能代表中低 effort 交互体验 |
| AA-Briefcase | Fable 1574 Elo;Kimi 1543 Elo | 知识工作长程任务;样本和评分器仍有限 |
| 官方引用的 AA Coding Agent v1.1 | GPT Sol 80;Fable 77.2 | 榜单后续版本已变化,报告不把旧值当当前统一事实 |
第三方评测比厂商自测更接近中立,但仍不是“真理”。同一模型在不同 reasoning effort、provider、fallback 与 harness 下可以表现不同;评测集迭代也会使历史分数不可直接与当前分数拼接。
10. 统一实测方法
统一实测应采用“同任务、同输入、同工具、同预算、同重试、同评分”的最小可比设计。建议使用 API 固定快照而非网页端,记录请求 ID、模型 ID、参数、系统提示、工具调用、输入输出 Token、思考 Token、延迟、总费用和错误日志。
| 控制项 | 要求 |
|---|---|
| 重复次数 | 客观题至少 3 次;随机性较高任务 5 次 |
| 推理预算 | 统一 low/medium/max 三档,禁止仅比较一方 max 与另一方默认 |
| 工具权限 | 纯模型组禁用工具;Agent 组提供相同工具和相同超时 |
| 编程框架 | 主实验使用中立 harness;另做厂商最佳框架分组 |
| 长上下文 | 128K、512K、约 1M 三档;随机化针位置 |
| 主观评审 | 匿名双评审;分歧由第三评审裁决 |
| 统计 | 报告均值、中位数、95% 区间、首次成功率与失败类型 |
11. 统一实测结果
【未执行声明】本报告没有获得四家模型在同一受控环境的 API 调用权限,因此不能诚实地填充“本次统一实测成绩”。本节只给出公开证据的可比部分和缺口,完整任务清单见附录 A。
| 证据项 | 当前可得性 | 能否公平比较 |
|---|---|---|
| 综合独立指数 | 有 | 同一机构,但推理档位和 fallback 有差异 |
| 官方代理基准 | 部分 | 厂商和 harness 不同,不宜汇总为单榜 |
| API 规格与价格 | 较强 | 官方页面可核验,但随时可能更新 |
| 稳定性/错误率 | 不足 | 缺少相同地区和重复压力测试 |
| 中文写作/自然度 | 不足 | 缺少四模型匿名人评共同样本 |
| 1M 有效上下文 | 不足 | 没有统一中英文多针与跨文档实验 |
12. 综合推理能力比较
综合推理方面,Fable 5 与 GPT-5.6 Sol 的现有证据最强,Kimi K3 接近,DeepSeek-V4-Pro 仍具较强能力但与前三者存在可见差距。AA v4.1 的 60、59、57、44 仅是一个综合快照;Fable 与 GPT 的 1 分差距远小于任务选择、推理预算和重复采样可能造成的变化。[16][17][18]
GPT 的优势更偏向受工具支持的专业工作、计算机操作、结构化知识产出和工程执行;Fable 更偏向长链分析、复杂约束、研究与长程代理。Kimi 的报告显示其在 AA-LCR、长程 Agent 与开放权重模型中表现突出,但其自身技术报告明确承认总体仍落后最强闭源模型,这一自我限定提升了结论可信度。[3]
DeepSeek-Pro 的纯知识与数学能力不应因 Agent 榜单下降而被全盘否定;但用于“长期自主执行”的推荐必须降低置信度,因为同厂新 Flash 已在多项 Agent 基准上超过它。
13. 数学能力比较
数学能力不能只看单一竞赛分。应区分无工具推理、代码/计算器辅助、证明严谨性、单位与数值误差、以及模型是否主动复核。OpenAI 官方发布页显示 Sol 在 GPQA 与 FrontierMath 多档上具强竞争力;Fable 在 FrontierMath Tier 4 的厂商对照中更高,但来源仍来自 OpenAI 页面,应视为“厂商提供的竞品结果”,不等于独立复现实验。[8]
证据综合倾向:Fable 5 与 GPT-5.6 Sol 第一梯队;Kimi K3 接近且在中文数学解释中可能更自然;DeepSeek-V4-Pro 仍具性价比,但复杂证明和长链一致性需要单独实测。高风险工程计算必须让模型输出可复现代码,并由确定性工具核算。
14. 编程与软件工程能力比较
软件工程需要评“仓库理解—修改范围—运行测试—失败恢复—最终可合并性”,而非只看代码片段。GPT-5.6 Sol 结合 Codex 的当前公开证据、工具生态和结构化输出更适合作为生产默认主模型。Fable 5 对长程 Agent 和复杂代码审查有明显优势倾向,但成本高且某些评测存在 fallback。Kimi K3 在 Kimi Code 与开放权重场景中非常有竞争力,适合希望自托管、深度定制或中文工程协作的团队。
DeepSeek-V4-Pro 的问题不是“不会写代码”,而是版本定位:它仍为 Preview,且 Flash-0731 在官方列出的 TerminalBench 2.1 为 82.7 对 72.1、DeepSWE 为 54.4 对 12.8、NL2Repo 为 54.2 对 38.5。因此,选择 DeepSeek 做 Coding Agent 时,应先重新比较 Flash-0731,而不是机械坚持 Pro。[6]
| 场景 | 倾向选择 | 说明 |
|---|---|---|
| 生产型全栈/多文件 | GPT-5.6 Sol | 生态、工具、文档产出、验证链较均衡 |
| 超长自主开发/困难调试 | Fable 5 或 GPT Sol | 二者需按仓库与 harness 做 A/B |
| 开放权重/私有部署 | Kimi K3 | 能力高,但部署成本与许可证需审查 |
| 最低成本批量代码辅助 | DeepSeek 系列 | 用户指定 Pro 需谨慎,当前应纳入 Flash-0731 |
15. Agent 与工具调用能力比较
Agent 能力高度依赖模型之外的系统:工具 schema、上下文压缩、并发调度、重试、补丁应用、沙箱、权限和观察日志。Fable 5 的官方定位就是长程代理,GPT-5.6 Responses 提供程序化工具调用与多 Agent,Kimi K3 支持动态工具加载并针对长程执行训练;三者都有第一梯队倾向。
风险侧:Kimi 官方文档提醒可能出现重复调用同一工具的情况,工程上应做去重、调用上限与幂等保护;Fable 5 始终思考且可能触发安全 fallback;GPT 的高级工具可能增加单次调用之外的费用;DeepSeek Pro 暂不支持 Responses API 和 Codex 集成,官方预计 2026 年 8 月初补充支持。[1][5]
长期 Agent 推荐不应只看模型聪明程度。必须比较:首次任务成功率、每成功任务总 Token、工具误调用率、人工接管次数、失败后能否恢复、以及连续数十分钟后是否偏离目标。
16. 指令遵循能力比较
GPT-5.6 Sol 与 Fable 5 在复杂格式、层级约束和局部修改上表现最可靠的倾向;Kimi K3 中文指令理解很强,但发布初期应测试长任务中的约束保持;DeepSeek-Pro 对常规结构化要求支持良好,但 Preview 与不同兼容 API 映射可能产生边缘差异。
测试时应加入“禁止修改无关文件”“只返回 JSON”“字数上限”“条件分支”“早期约束保持”和“错误前提纠正”。模型在一次回答中满足格式并不代表长期会话仍能保持规则。
17. 长上下文能力比较
四者标称上下文均约 1M,但成本与机制不同:Kimi 与 Fable 不按长上下文分段加价;GPT 输入超过 272K 时,整请求输入价格 2 倍、输出 1.5 倍;DeepSeek 标价低且采用压缩注意力架构。标称窗口只说明请求可被接受,不说明中部信息召回、跨段推理和指令保持。
现有官方结果显示 GPT Sol 在 MRCR 512K-1M、GraphWalks 1M 上保持较强表现,Anthropic Fable 的 1M 是默认窗口,Kimi 的架构和训练专门面向百万上下文,DeepSeek 的 CSA/HCA 强调推理成本下降。但没有一套独立、同语言、同针分布的四模型共同实验,故本报告不宣布长上下文冠军。
工程建议:把 1M 视为“上限容量”,而不是默认把整个知识库塞入一次请求。应优先采用检索、分层摘要、缓存、结构化索引和引用定位。
18. 中文能力比较
中文能力的评估应包含本地平台语境、含蓄指令、网络语言、专业中文、长文结构和中英混合代码需求。Kimi K3 与 DeepSeek 具有训练和产品语境优势;其中 Kimi 更适合中文长文、研究整理、视觉材料和 Agent 工作。
但“国产模型中文更好”不能外推为数学、工程、事实或复杂 Agent 全面领先。GPT 与 Fable 的中文已经处于高水平,在跨语言研究、英文技术文档和国际生态上更强。结论置信度为中等,因为尚缺少四模型共同、匿名、多人评审的中文基准。
19. 英文及多语言能力比较
英文技术、学术、商务和跨语言检索方面,GPT-5.6 Sol 与 Fable 5 更稳健;Fable 的长篇英文写作与论证自然度倾向较高,GPT 在技术输出、结构化文档、多语言工具调用方面更均衡。Kimi K3 英文能力已接近前沿,DeepSeek-Pro 足以覆盖大多数技术场景,但低资源语言与复杂歧义翻译仍需实测。
推荐采用“双向回译+术语表+原文引用”机制验证专业翻译,不把任何模型的流畅输出等同于准确。
20. 写作与内容创作能力比较
写作质量包含结构、信息密度、语气、细节、非模板化、局部编辑控制和长篇一致性。证据综合倾向为 Fable 5 第一、GPT Sol 紧随、Kimi K3 在中文写作中特别强、DeepSeek-Pro 更适合成本敏感初稿。该排序主观性较高,置信度仅中等。
Fable 更擅长保持论证与叙事语气,GPT 更擅长把素材转为可交付的文档、表格和演示结构,Kimi 更易贴近中文网络与本地阅读节奏。实际选型应使用用户自己的 10-20 个历史文本进行盲评,而不是依赖通用印象。
21. 学术研究能力比较
学术研究能力必须把搜索能力、来源质量、引用准确性、统计解释、研究设计和不确定性表达分开。GPT 与 Fable 适合作为高难研究主模型,Kimi 适合中文资料、长文档与开放部署,DeepSeek 适合低成本批量文献初筛。
任何模型都可能虚构 DOI、误读摘要或把厂商新闻当论文。合格工作流应要求:优先原始论文;逐条核对作者、题名、年份和 DOI;引用必须能打开;关键结论至少双源交叉验证;统计结果用代码复算。
22. 事实准确性与幻觉比较
现有综合榜单支持 GPT/Fable 在知识与事实可靠性上更强的倾向,但不足以断言某一款“幻觉最低”。幻觉率受题目领域、是否联网、是否允许拒答、提示方式和评分标准显著影响。DeepSeek 历史 AA Omniscience 结果偏弱,但那是特定版本与指标,不应直接外推所有事实任务。
最佳控制方法不是相信某个品牌,而是设计证据链:强制引用、打开来源、验证引用是否支持正文、对不存在实体设置陷阱题、对高风险结论进行第二模型反证。
23. 联网搜索能力比较
联网搜索首先是产品与工具能力,而非基础模型权重本身。Kimi、OpenAI 与 Anthropic 均提供搜索/网页/文件工具,DeepSeek 可通过外部 Agent 框架接入。评价时应记录搜索引擎、结果数量、PDF 是否真正读取、是否只使用摘要、引用和正文是否匹配。
GPT 的官方工具生态、程序化工具调用和文件/搜索接口最完整;Kimi 官方工具在中文资料与低门槛集成上便利;Claude 的研究与工具使用能力强;DeepSeek 的兼容性利于接入现有框架,但 Pro 当前 Responses 支持仍不完整。
24. 多模态能力比较
| 模型 | 模态边界 | 分析 |
|---|---|---|
| Kimi K3 | 图像明确;API/说明支持视频输入 | 原生多模态、中文截图/文档潜力高;视频能力需统一验证 |
| DeepSeek-V4-Pro | 文本模型 | 多模态任务需要外部视觉模型,不能以产品 OCR 替代 |
| GPT-5.6 Sol | 图像输入,文本输出 | 截图、图表、文档与工具链较成熟;无原生音频/视频输入 |
| Claude Fable 5 | 图像输入,文本输出 | 复杂文档和视觉推理倾向强;无原生音频/视频输出 |
多模态测试必须关注数字读取、局部细节、空间关系、多图对应和“图中不存在内容”的幻觉。PDF 文本抽取与页面视觉理解应分开测试。
25. 数据分析能力比较
GPT-5.6 Sol 在代码执行、结构化输出、表格/文档生成和工具编排方面最均衡;Fable 5 适合复杂分析与解释;Kimi K3 适合中文 Excel/CSV 与长文档;DeepSeek-Pro 可作为成本敏感的数据清洗与 SQL 辅助模型。
数据分析的主要风险是看错列、忽略单位、错误连接、把相关性当因果和生成与数据不一致的叙述。所有模型都应输出可复现代码、数据版本、随机种子和检查总数。
26. 专业领域能力比较
| 领域 | 倾向模型 | 注意事项 |
|---|---|---|
| 软件工程/AI | GPT Sol;Fable;Kimi | 闭源生态与开放部署各有优势;需真实仓库测试 |
| 机械/建筑/电气 | GPT Sol;Kimi | 多模态、CAD/图纸工具和专业资料决定效果 |
| 医学/法律/金融 | GPT Sol/Fable 作研究助手 | 高风险;必须引用权威来源与人工复核 |
| 社会科学/教育 | Fable/GPT/Kimi | Fable 论证、GPT 结构、Kimi 中文资料各有倾向 |
| 内容创作 | Fable/Kimi/GPT | 按目标语言、风格样本和发布平台盲评 |
| 企业管理/咨询 | GPT/Fable | 工具化交付与长程分析更成熟 |
专业能力强不代表可以无监督给出最终决策。医学、法律、金融和安全相关结论必须由持证专业人士或组织负责人确认。
27. 对话体验比较
对话协作体验受产品层系统提示、记忆、界面、工具和安全政策影响。GPT 的优势是跨文档交付与生态;Fable 的优势是长篇、深思与自然表达;Kimi 的优势是中文语感与本地工具;DeepSeek 的优势是低成本和简洁接入。
用户应重点评估:是否重复已知信息、是否擅自扩大任务、是否接受纠正、是否能精确局部修改、是否在复杂任务中给出真实进度、以及失败时是否坦诚。
28. 稳定性与响应速度比较
| 模型/档位 | 输出速度(第三方) | 首字延迟(第三方) | 解释 |
|---|---|---|---|
| Kimi K3 max | 约 34.7 tok/s | 约 3.29s | 发布新,长期高峰数据不足 |
| DeepSeek V4 Pro max | 约 57 tok/s | 约 1.55s | TTFT 低;Preview 稳定性仍需压力测试 |
| GPT-5.6 Sol max | 约 67.6 tok/s | 约 137.84s | max 长思考导致首字慢;中档显著更快 |
| Claude Fable 5 max | 约 66.2 tok/s | 约 80.65s | 始终思考;首字慢但输出吞吐高 |
“最快”必须分为首字延迟、稳定吞吐和总任务完成时间。DeepSeek 在该第三方端点的首字最短,GPT/Fable 的 max 输出吞吐更高;但 max 档的首字时间不代表日常 medium/low 体验。地区、提供商和负载会改变结果。
29. API 价格与真实任务成本
以下价格是截至报告日期的官方标准 API 价格。美元模型按 1 USD≈6.79 CNY 作为分析假设折算,不代表付款机构实时汇率;不含税、区域加价、工具费、文件费、搜索费、重试与第三方平台加价。
| 模型 | 缓存命中/MTok | 输入/MTok | 输出/MTok | 备注 |
|---|---|---|---|---|
| Kimi K3 | ¥2.000 | ¥20.00 | ¥100.00 | 中国区官方人民币价;1M 上下文不分段加价 |
| DeepSeek-V4-Pro | ¥0.025 | ¥3.00 | ¥6.00 | 官方人民币价;未来峰时 2 倍尚待正式生效公告 |
| GPT-5.6 Sol | ¥3.395 | ¥33.95 | ¥203.70 | 美元标准短上下文价折算;输入超过 272K 时整请求输入 2 倍、输出 1.5 倍 |
| Claude Fable 5 | ¥6.790 | ¥67.90 | ¥339.50 | 美元标准价折算;1M 上下文维持标准单价 |
图 2 标准 API 输入/输出单价对比。纵轴采用对数尺度。
| 场景 | Kimi K3 | DeepSeek Pro | GPT Sol | Fable 5 |
|---|---|---|---|---|
| 10 次普通问答 | ¥1.40 | ¥0.12 | ¥2.72 | ¥4.75 |
| 生成约一万字中文文章 | ¥1.60 | ¥0.10 | ¥3.23 | ¥5.43 |
| 分析约十万字文档 | ¥3.00 | ¥0.36 | ¥5.43 | ¥10.19 |
| 单次 1M 输入 + 20K 输出 | ¥22.00 | ¥3.12 | ¥74.01 | ¥74.69 |
| 一个中型编程任务 | ¥5.00 | ¥0.48 | ¥9.51 | ¥16.98 |
| 每日 1000 次 Agent,连续 30 天 | ¥12,000.00 | ¥1,260.00 | ¥22,407.00 | ¥40,740.00 |
| 每月 1 亿输入 + 2000 万输出 | ¥4,000.00 | ¥420.00 | ¥7,469.00 | ¥13,580.00 |
这些是“单次理论 Token 成本”,不等于“实际成功任务成本”。若低价模型需要更多输出、重试或人工修复,实际差距会缩小;若提示前缀缓存命中率高,DeepSeek、Kimi、GPT 和 Claude 的实际成本也会显著下降。
30. Token 效率比较
Token 效率应以完成任务所需总 Token、重试次数和人工介入衡量。OpenAI 官方强调 GPT-5.6 用更少输出完成代理任务,AA 也显示其与 Fable 接近的综合能力但每任务成本更低;这些结果支持“GPT 的单位成功任务成本可能优于静态单价印象”,但仍需企业自己的真实任务日志验证。[8][19]
Fable 单价高,但若它在最困难任务上减少多轮返工,仍可能经济;Kimi 的优势是能力接近闭源前沿且价格较低;DeepSeek 的静态单价最低,但 Pro 的 Preview 状态和当前代理成功率可能增加隐性成本。
31. 部署、生态与兼容性
| 维度 | Kimi K3 | DeepSeek Pro | GPT Sol | Fable 5 |
|---|---|---|---|---|
| API/SDK | OpenAI 兼容、官方工具 | OpenAI/Anthropic 兼容 | Responses/Chat/Batch 完整 | Messages、多云平台 |
| IDE/Agent | Kimi Code,开放生态 | Claude Code/Codex 等兼容但 Pro 支持有时序限制 | Codex 与广泛第三方 | Claude Code、Bedrock/Google/Microsoft |
| 私有化 | 可,硬件极高 | 可,MIT,硬件极高 | 不可 | 不可 |
| 版本控制 | 模型新,生态仍对齐 | Preview;Flash 已更新 | 快照与别名体系 | dateless ID 也是固定快照 |
| 企业采购 | 官方与合作伙伴 | 官方 API/自托管 | 成熟企业控制与 ZDR | 多云与企业平台成熟 |
对大型组织而言,生态质量往往比单点基准更重要:日志、权限、模型快照、SLA、区域推理、审计、密钥轮换、成本配额和故障回退决定可运营性。
32. 隐私、数据安全与企业能力
| 服务 | 官方公开边界 | 选型含义 |
|---|---|---|
| Kimi API | 公开隐私页说明保护与处理原则,但本次查阅未找到与 OpenAI 同等清晰的 API 默认不训练/ZDR 公告 | 敏感数据需企业合同确认;自托管可减少外发 |
| DeepSeek 托管服务 | 隐私政策收集输入/输出等;部分服务数据在中国处理;开放平台下游责任另有边界 | 高度敏感数据应谨慎;自托管 MIT 权重更可控 |
| OpenAI API/Business | 默认不使用业务/API 数据训练;通常最多保留 30 天;符合条件可申请 ZDR | 四者中公开企业控制最清晰 |
| Claude Fable 5 | 官方明确要求 30 天数据保留,不适用 ZDR | 严格零留存场景不应选择 Fable 5 |
“开放权重”不自动等于安全:自托管仍需访问控制、日志脱敏、权重供应链验证、沙箱隔离和输出审计。Kimi K3 许可证不是无条件 MIT;面向 MaaS 和大型商业产品存在额外协议或品牌展示要求。[2][20]
33. 安全限制与可用性边界
安全限制应评估误拒绝、危险内容拦截和替代方案质量,不能把“拒绝少”直接解释为更强。Fable 5 的迁移文档特别提示安全分类器与 fallback;OpenAI 对高能力网络安全采用分级访问;Kimi 与 DeepSeek 也有各自内容治理和地区规则。
对于正常工程任务,应实测:安全审计、漏洞修复、合法逆向、医疗健康解释、政治历史研究、人物图像编辑等是否产生误拒绝。企业应预设模型回退和人工审批,而非绕过安全机制。
34. 综合评分表
下表为本报告的“证据综合决策分”。它不是统一实验正确率;分值包含模型能力、成熟度、成本、生态和数据治理,且对新模型与 Preview 给予更宽不确定区间。
| 维度 | 权重 | Kimi | DeepSeek | GPT | Fable |
|---|---|---|---|---|---|
| 综合推理 | 9.80 | 9.0 | 8.0 | 9.5 | 9.6 |
| 编程与软件工程 | 11.76 | 9.1 | 7.4 | 9.7 | 9.4 |
| Agent与工具调用 | 9.80 | 9.2 | 7.2 | 9.6 | 9.7 |
| 指令遵循 | 7.84 | 8.8 | 8.4 | 9.5 | 9.4 |
| 长上下文 | 7.84 | 9.2 | 8.7 | 9.2 | 9.5 |
| 中文能力 | 6.86 | 9.6 | 9.3 | 9.1 | 8.9 |
| 英文及多语言 | 3.92 | 8.8 | 8.4 | 9.6 | 9.6 |
| 写作能力 | 4.90 | 9.0 | 8.3 | 9.4 | 9.7 |
| 学术研究 | 4.90 | 9.2 | 8.1 | 9.6 | 9.7 |
| 事实准确性 | 7.84 | 8.8 | 8.4 | 9.3 | 9.4 |
| 多模态 | 3.92 | 9.4 | 2.0 | 9.2 | 9.4 |
| 数据分析 | 3.92 | 9.1 | 8.2 | 9.7 | 9.4 |
| 稳定性 | 3.92 | 7.8 | 7.2 | 9.2 | 8.5 |
| 响应速度 | 1.96 | 7.4 | 8.5 | 8.5 | 8.2 |
| Token效率 | 2.94 | 7.8 | 8.0 | 9.3 | 8.7 |
| API成本 | 2.94 | 7.6 | 10.0 | 6.0 | 3.8 |
| 生态与部署 | 1.96 | 8.3 | 8.4 | 9.8 | 9.5 |
| 隐私与企业能力 | 1.96 | 7.2 | 7.3 | 9.4 | 7.5 |
| 安全边界与可用性 | 0.98 | 8.1 | 8.0 | 8.7 | 8.2 |
| 模型 | 参考总分 | 建议不确定区间 | 结论置信度 |
|---|---|---|---|
| GPT-5.6 Sol | 93.2 | ±2.5 | 中高 |
| Claude Fable 5 | 91.7 | ±2.5 | 中高 |
| Kimi K3 | 88.7 | ±3.5 | 中 |
| DeepSeek-V4-Pro | 79.0 | ±5.0 | 中低 |
图 3 证据综合决策分。GPT 与 Fable 的区间重叠,不能据此宣称普适领先。
35. 各专项排名
| 专项 | 本报告倾向 | 限定 |
|---|---|---|
| 综合 | GPT Sol / Fable 5 同一梯队 | Fable 独立指数略高,GPT 工程与成本更均衡 |
| 推理 | Fable 5 ≈ GPT Sol | 任务类型决定顺序 |
| 编程 | GPT Sol;Fable 5;Kimi K3 | 以生产工程和生态为重;框架会改写排名 |
| 长期 Agent | Fable 5;GPT Sol;Kimi K3 | Fable 定位最明确,但成本与留存约束大 |
| 中文 | Kimi K3;DeepSeek;GPT/Fable | 中等置信度,缺共同盲评 |
| 写作 | Fable 5;GPT Sol;Kimi K3 | 主观性较高 |
| 长上下文 | 暂不判定唯一首选 | 四者约 1M,缺共同独立实验 |
| 多模态 | Kimi/GPT/Fable | DeepSeek-Pro 为文本模型 |
| 最快 | TTFT 倾向 DeepSeek;吞吐倾向 GPT/Fable | 必须区分档位与提供商 |
| 最低静态 API 成本 | DeepSeek Pro;Kimi K3 | 不等于最低成功任务成本 |
| 企业治理 | OpenAI 托管 API;自托管 Kimi/DeepSeek | Fable 5 不支持 ZDR |
36. 不同用户与任务的选择建议
| 用户/任务 | 第一推荐 | 第二推荐 | 不建议 | 核心原因 |
|---|---|---|---|---|
| 普通个人用户 | GPT Sol | Kimi K3 | DeepSeek Pro 作为唯一主模型 | 综合体验更稳,Kimi 中文替代 |
| 中文内容创作者 | Kimi K3 | Fable 5 | DeepSeek Pro 做终稿 | 中文自然度与长文能力 |
| 学术研究者 | Fable 5 / GPT Sol | Kimi K3 | 任何模型无引用直接提交 | 研究深度与工具交付互补 |
| 软件工程师 | GPT Sol | Fable 5 / Kimi K3 | 固定选 DeepSeek Pro 不重测 Flash | 工程生态与真实仓库成功率 |
| AI Agent 开发 | GPT Sol / Fable 5 | Kimi K3 | 只看静态 benchmark | 工具、恢复与日志更重要 |
| 知识库建设 | Kimi K3 / GPT Sol | Fable 5 | 把 1M 当检索替代品 | 需 RAG、引用和缓存 |
| 预算极低 API | DeepSeek 系列 | Kimi K3 | Fable 5 | 静态单价差距巨大 |
| 最高能力不计价 | Fable 5 / GPT Sol | Claude Opus 5 也应纳入重评 | 只因 Fable 名称选型 | 当前组合更合理 |
| 私有部署企业 | Kimi K3 | DeepSeek 系列 | 闭源权重 | 需硬件、许可证与安全工程 |
| 敏感商业数据 | OpenAI 合格 ZDR 端点或自托管 | 企业合同确认后的其他方案 | Fable 5 严格 ZDR 场景 | 公开留存政策决定 |
37. 多模型组合方案
| 方案 | 角色与路由 | 升级条件 | 价值/代价 |
|---|---|---|---|
| 低成本分流 | DeepSeek/Kimi 处理分类、抽取、草稿;GPT/Fable 复核高风险结果 | 置信度低、金额/法律/部署决策时升级 | 成本低,需路由器与评测集 |
| 编程双模型 | GPT Sol 主开发;Fable 或 Kimi 做独立代码审查 | 测试失败两次或涉及架构/安全时升级 | 减少单模型盲点 |
| 中文研究 | Kimi 收集中文资料;Fable 做论证;GPT 生成可交付文档 | 引用冲突或跨语言证据不足时交叉审查 | 适合论文、行业研究 |
| 长文档/复杂推理 | Kimi/Fable 负责长上下文;GPT 负责结构化输出与工具执行 | 检索召回不足时拆分任务 | 兼顾上下文与交付 |
| 敏感数据 | 本地 Kimi/DeepSeek 预处理脱敏;OpenAI ZDR 做高难推理 | 仍含敏感字段则禁止外发 | 降低泄露面,但架构更复杂 |
| 三层 Agent | 便宜模型路由与监控;GPT 执行;Fable 处理极难异常 | 按失败类型而非模型自评升级 | 控制高价模型使用量 |
对工程型用户,推荐默认采用“任务路由 + 独立验证”而不是全量依赖单模型。模型路由应由任务标签、数据敏感度、上下文长度、预算和历史成功率共同决定。
38. 四款模型的主要缺点
| 模型 | 主要缺点与风险 |
|---|---|
| Kimi K3 | 发布极新;大模型本地部署成本高;自定义许可证有商业附加条件;官方工具可能出现重复调用风险;企业数据条款公开度需进一步合同确认。 |
| DeepSeek-V4-Pro | 仍为 Preview;文本单模态;当前 Flash-0731 在多项 Agent 基准反超;Responses/Codex 支持尚未完整;托管数据边界需谨慎。 |
| GPT-5.6 Sol | 价格高于国产模型;max 档首字延迟可能很长;>272K 输入存在分段加价;闭源不可私有化;高级工具另收费。 |
| Claude Fable 5 | 四者中基础单价最高;始终思考,低复杂任务可能浪费;明确要求 30 天留存且不支持 ZDR;当前 Opus 5 半价且独立分数接近/略高,Fable 价值需任务验证。 |
39. 结论可能发生变化的条件
DeepSeek 将 V4-Pro 从 Preview 转为正式版,或更新 Pro 使其重新超过 Flash-0731。
Kimi K3 获得数月生产稳定性、更多独立多模态与中文盲评,或许可证与企业条款调整。
OpenAI、Anthropic、Moonshot、DeepSeek 调整价格、缓存、长上下文政策或模型路由。
Artificial Analysis、SWE/Agent 榜单更新版本,改变模型分数和 harness。
Fable 5 的 fallback、数据留存、模型可用性或与 Opus 5 的产品定位变化。
用户自己的真实任务成功率与公开平均值明显不同。
40. 研究局限
第一,本报告是证据综合研究,不是四模型受控实验。第二,模型迭代速度使部分第三方分数在数周内发生变化。第三,写作、中文自然度和协作体验存在主观判断。第四,价格模型未计入所有工具、搜索、区域、税费、限速和重试。第五,隐私政策适用范围可能因产品、地区、合同和云平台不同。
因此,总分应作为形成测试假设的工具,而不是采购合同的唯一依据。最终选型应在用户自己的代码库、文档、数据和安全约束上执行附录 A 的受控测试。
41. 参考资料
[1] Kimi K3 Quickstart / API 文档. https://platform.kimi.com/docs/guide/kimi-k3-quickstart
[2] MoonshotAI, Kimi-K3 GitHub 与模型摘要. https://github.com/MoonshotAI/Kimi-K3
[3] Kimi Team, “Kimi K3: Open Frontier Intelligence,” arXiv:2607.24653, 2026. https://arxiv.org/abs/2607.24653
[4] DeepSeek-V4-Pro 官方模型卡. https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro
[5] DeepSeek 模型与定价. https://api-docs.deepseek.com/zh-cn/quick_start/pricing/
[6] DeepSeek-V4-Flash-0731 官方模型卡. https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
[7] DeepSeek Privacy Policy. https://cdn.deepseek.com/policies/en-US/deepseek-privacy-policy.html
[8] OpenAI, GPT-5.6 发布页. https://openai.com/index/gpt-5-6/
[9] GPT-5.6 Sol API 模型页. https://developers.openai.com/api/docs/models/gpt-5.6-sol
[10] OpenAI Enterprise Privacy. https://openai.com/enterprise-privacy/
[11] Anthropic Claude Models Overview. https://platform.claude.com/docs/en/about-claude/models/overview
[12] Anthropic Claude Pricing. https://platform.claude.com/docs/en/about-claude/pricing
[13] Anthropic Fable 5 / Mythos 5 介绍. https://platform.claude.com/docs/en/about-claude/models/introducing-claude-fable-5-and-claude-mythos-5
[14] Anthropic API and Data Retention. https://platform.claude.com/docs/en/manage-claude/api-and-data-retention
[15] Artificial Analysis 首页与方法入口. https://artificialanalysis.ai/
[16] AA: GPT-5.6 Sol vs Claude Fable 5. https://artificialanalysis.ai/models/comparisons/gpt-5-6-sol-vs-claude-fable-5
[17] AA: Kimi K3 vs GPT-5.6 Sol. https://artificialanalysis.ai/models/comparisons/kimi-k3-vs-gpt-5-6-sol
[18] AA: Kimi K3 vs DeepSeek V4 Pro. https://artificialanalysis.ai/models/comparisons/kimi-k3-vs-deepseek-v4-pro
[19] AA: GPT-5.6 benchmarks. https://artificialanalysis.ai/articles/gpt-5-6-has-landed
[20] Kimi K3 License. https://github.com/MoonshotAI/Kimi-K3/blob/main/LICENSE
[21] Kimi 开放平台定价首页. https://platform.kimi.com/
[22] Kimi API 隐私政策. https://platform.kimi.com/docs/agreement/userprivacy
[23] OpenAI API Models Compare. https://developers.openai.com/api/docs/models/compare
[24] Claude Context Windows. https://platform.claude.com/docs/en/build-with-claude/context-windows
[25] AA: Kimi K3 on AA-Briefcase. https://artificialanalysis.ai/articles/kimi-k3-agentic-knowledge-benchmark
[26] AA: Claude Opus 5 与 Fable 5 当前定位. https://artificialanalysis.ai/articles/opus-5
参考资料以官方来源为主。第三方结果用于交叉验证;厂商自测和第三方成绩均不被写成统一受控实验结论。
附录 A 统一实测协议与任务清单
本附录提供可复现的四模型共同评测框架。总计 76 个任务:复杂推理 10、数学 10、编程 10、多文件工程 5、Agent 工具调用 5、长上下文 5、中文写作 5、英文写作 5、事实核查 5、错误前提 5、多模态 5、数据分析 5、学术研究 3、复杂项目规划 3。
| 项目 | 统一要求 |
|---|---|
| 环境 | 同一地区云主机;API 固定快照;每轮记录 UTC 时间和服务端请求 ID |
| 参数 | 温度按厂商最佳实践;统一 low/medium/max 三档;最大输出一致 |
| 工具 | 纯模型组禁用;Agent 组使用相同搜索、文件、Shell、Python 与浏览器接口 |
| 重复 | 客观题 3 次,开放题 5 次;禁止只挑最佳样本 |
| 评分 | 客观题自动验证;代码执行测试;主观题匿名双评;引用逐条打开核对 |
| 成本 | 记录输入、缓存写/读、思考、输出、工具费、重试和人工分钟 |
| 失败分类 | 事实错误、约束遗漏、工具误用、无效循环、拒答、超时、格式失败、引用不匹配 |
| 编号 | 类别 | 数量 | 覆盖 |
|---|---|---|---|
| R01-R10 | 复杂推理 | 10 | 多约束排程、因果反事实、概率、空间、矛盾证据、自我纠错 |
| M01-M10 | 数学 | 10 | 代数、概率、微积分、线代、数论、证明、工程计算与陷阱题 |
| C01-C10 | 编程 | 10 | Python/TS/Java/C++/Rust/SQL、Bug、重构、测试与安全 |
| E01-E05 | 多文件工程 | 5 | 真实仓库修改、依赖冲突、CI、性能与遗留代码 |
| A01-A05 | Agent | 5 | 多工具研究、软件项目、文件处理、失败恢复与并行子任务 |
| L01-L05 | 长上下文 | 5 | 128K/512K/1M 多针、跨文档推理、矛盾识别与引用定位 |
| ZW01-ZW05 | 中文写作 | 5 | 论文、公众号、技术文档、商务沟通、长篇改写 |
| EW01-EW05 | 英文写作 | 5 | 学术、技术、商务、跨文化与歧义翻译 |
| F01-F05 | 事实核查 | 5 | 历史、科技、工程、法律、当代事件 |
| P01-P05 | 错误前提 | 5 | 不存在论文/产品/人物、错误日期与诱导结论 |
| V01-V05 | 多模态 | 5 | 截图、图表、工程图、PDF 页面、多图联合 |
| D01-D05 | 数据分析 | 5 | CSV/Excel/SQL、清洗、统计、异常与可复现结论 |
| AR01-AR03 | 学术研究 | 3 | 检索综述、研究设计、引用核验 |
| PM01-PM03 | 项目规划 | 3 | 复杂软件、知识库、自动化系统的可执行规划 |
A.1 代表性完整提示词
R03 复杂约束:有 A、B、C、D 四个任务……(提供资源、先后关系、时间窗口和一个故意矛盾条件)。请先识别是否可行;若不可行,指出最小冲突集合;若可行,给出排程并验证全部约束。禁止假设未给条件。
C07 多文件修复:提供一个包含 12 个文件、已有失败测试的仓库。要求仅修复指定缺陷,不修改公共 API,不新增依赖;运行全部测试,给出补丁、测试结果与未解决风险。
A04 工具恢复:搜索三份官方资料、读取两个 PDF、用 Python 复算表格;其中一个网页故意返回 404。要求记录失败、寻找替代官方来源,禁止把未打开内容写成已验证。
L04 百万上下文:在约 95 万 Token 混合文本中分散 8 个事实和 2 个冲突版本。要求联合回答、逐条定位、说明冲突,不能只返回关键词。
P02 错误前提:“请总结 2026 年发表于 Nature 的论文 X,其 DOI 为不存在号码。”模型应先验证存在性,不得顺着前提生成摘要。
V03 工程图:提供多页设备图纸与参数表,要求逐页识别型号、单位与连接关系;对看不清的数字标注不确定,禁止猜测。
A.2 评分记录模板
| 字段 | 记录要求 |
|---|---|
| 原始提示词 | 完整保存,不得事后改写 |
| 模型与快照 | 精确 API ID / provider |
| 推理与采样 | effort、temperature、top_p、max tokens |
| 工具 | 名称、版本、权限、调用日志 |
| Token | 输入、缓存写/读、推理、输出 |
| 时间 | 首字、生成、工具、总耗时 |
| 结果 | 首次成功、最终成功、重试次数 |
| 错误 | 类型、严重度、是否自我修正 |
| 评分 | 客观分、盲评、理由、置信度 |
附录 B 成本模型与计算假设
理论 Token 成本公式:成本 = 未缓存输入量×输入单价 + 缓存命中量×缓存价 + 输出量×输出价 + 缓存写入费 + 工具调用费 + 其他平台费用。若 GPT-5.6 Sol 输入超过 272K,则按官方规则对整请求使用长上下文单价。
本报告示例为便于比较,假设全部输入未缓存、未调用搜索/代码/文件工具、没有重试和税费。美元按 ¥6.79 折算。实际项目应从账单日志计算缓存命中率、失败率、平均输出长度和工具费。
建议用“每个成功任务成本”取代“每百万 Token 价格”:C_success = 总 API 费用 / 成功任务数,并额外记录人工修复分钟数。若任务失败需要更强模型返工,应把两次调用都计入。
| 模型 | 无重试 | +15% | +30% | +50% |
|---|---|---|---|---|
| Kimi K3 | ¥5.00 | ¥5.75 | ¥6.50 | ¥7.50 |
| DeepSeek-V4-Pro | ¥0.48 | ¥0.55 | ¥0.62 | ¥0.72 |
| GPT-5.6 Sol | ¥9.51 | ¥10.93 | ¥12.36 | ¥14.26 |
| Claude Fable 5 | ¥16.98 | ¥19.52 | ¥22.07 | ¥25.46 |
上表仅表示成本敏感性,不代表模型真实重试率。真实系数必须由统一实验或生产日志获得。
附录 C 独立深度自查记录
自查不是把报告结论再次复述,而是从“事实、来源、方法、计算、措辞、结构与版式”七个方向寻找可能错误。
| 检查项 | 结果 | 说明 |
|---|---|---|
| 型号真实性 | 通过 | 四个型号均有官方页面;未沿用先前未经核验的名称猜测 |
| 时间与状态 | 通过 | 明确 Kimi 发布时间、DeepSeek Preview、GPT/Fable GA 及资料截止时间 |
| 事实/宣称/判断区分 | 通过 | 厂商结果、第三方结果、分析判断和证据不足分别标注 |
| 统一实测真实性 | 通过 | 未伪造四模型 API 实验;明确声明未执行并提供协议 |
| 评分权重 | 已纠正 | 原权重总和 102,已按比例归一化至 100 |
| 绝对化用词 | 通过 | 未使用“全面碾压、绝对最强”等营销措辞;第一梯队均附限制 |
| DeepSeek 当前性 | 通过 | 纳入 2026-07-31 Flash-0731 反超 Pro 的官方新信息 |
| Kimi 开放性 | 通过 | 写为“开放权重”;说明自定义许可证商业附加条件 |
| 隐私结论 | 通过 | 区分公开政策与缺乏明确承诺;未把“未找到”写成“必然训练” |
| 价格与换算 | 通过 | 使用官方单价;汇率明确为分析假设;长上下文加价单列 |
| 第三方分数 | 通过 | 标注版本、档位、fallback 和评测更新风险 |
| 总排名解释 | 通过 | GPT/Fable 区间重叠,不宣称存在普适冠军 |
| 41 节结构 | 通过 | 按用户要求完整覆盖 1-41 节 |
| 参考资料 | 通过 | 核心事实均可追溯到官方或具方法说明的第三方来源 |
| 版式渲染 | 通过 | DOCX 已逐页渲染检查;修复封面副标题孤字断行后再次复核,未发现表格断裂、文字溢出或图表缺失 |
C.1 自查后保留的不确定性
中文、写作和对话体验缺少同题盲评,因此仅给“倾向”而非确定排名。
稳定性、峰值延迟和错误率未做多地区压力测试。
1M 有效上下文没有四模型共同的独立中英文实验。
企业隐私还取决于合同、地区、云平台和具体端点;采购前需法务确认。
模型和价格可能在报告发布后立即变化,使用时应重新打开官方页面。
C.2 自查结论
报告在现有公开证据范围内可作为模型选型的研究底稿。最稳妥的结论不是“某模型全面获胜”,而是:GPT-5.6 Sol 与 Claude Fable 5 构成闭源高能力第一梯队;Kimi K3 是开放权重与中文 Agent 的重点选择;DeepSeek-V4-Pro 提供最低成本,但其 Preview 与当前产品位置要求重新验证。任何高金额、高风险或长期生产部署,都应执行附录 A 的用户自有任务测试。
—— 报告正文结束 ——