文章货架 返回书架

前沿大语言模型横向评估

Kimi K3、DeepSeek-V4-Pro、GPT-5.6 Sol 与 Claude Fable 5

文章目录 56

摘要

本报告对 Kimi K3、DeepSeek-V4-Pro、GPT-5.6 Sol 与 Claude Fable 5 进行证据综合比较。研究以厂商官方文档、模型卡、技术报告、API 定价与隐私条款为第一层证据,以 Artificial Analysis 等具备公开方法的第三方评测为第二层证据,并将厂商自测、不同代理框架和不同推理预算的结果分开解释。研究发现:GPT-5.6 Sol 与 Claude Fable 5 在现有综合证据中构成能力第一梯队,但两者差距小于评测误差和任务差异,不能据此认定存在普适冠军;GPT-5.6 Sol 在工程生态、工具编排、文档与表格工作、成本效率方面更均衡,Claude Fable 5 在长程代理、复杂研究与写作质量方面更具优势倾向。Kimi K3 是目前值得重点关注的开放权重前沿模型,中文、原生多模态、长上下文和代理能力突出,但发布时间短、许可证包含商业附加条件,稳定性和合规结论仍需更多时间验证。DeepSeek-V4-Pro 的价格优势非常显著,但它仍被官方标注为 Preview,且 2026 年 7 月 31 日发布的 V4-Flash-0731 已在官方列出的多项代理基准中超过 V4-Pro,因此不宜将 V4-Pro直接视为 DeepSeek 当前最成熟的默认模型。报告最终给出按任务路由的多模型组合方案,并提供一套可复现的统一实测协议。

关键词:大语言模型评测;AI Agent;软件工程;长上下文;模型路由;API 成本;数据安全

证据标签:【事实】官方可核验信息;【厂商结果】厂商在特定设置下报告的成绩;【第三方结果】独立机构特定版本与设置的结果;【分析判断】本报告基于证据的推论;【证据不足】尚不能可靠下结论。

研究准备与核验

A. 型号核验结果

模型 核验结论 比较时的关键限制
Kimi K3 正式发布;旗舰;2026-07-27 发布权重与技术报告 发布极新,长期稳定性证据有限
DeepSeek-V4-Pro 官方型号存在;2026-04-24 发布 Preview 仍为 Preview;V4-Flash-0731 已在多项官方代理基准中超过它
GPT-5.6 Sol 正式发布;GPT-5.6 家族旗舰;gpt-5.6 默认指向 Sol Sol、Terra、Luna 为不同档位,不能混算
Claude Fable 5 正式发布;2026-06-09 起 GA;Anthropic 最高能力公开档 始终开启自适应思考;要求 30 天留存,不支持 ZDR

【结论】四个名称均为真实官方型号,但发布阶段、开放程度、代理框架和数据保留条件并不对称。若忽略这些差异,任何总排名都会产生误导。

B. 研究计划

  1. 先核对型号、版本、上下文、模态、推理模式、开放许可证和官方可用状态。

  2. 分别整理厂商自测与第三方结果,检查推理预算、工具权限、代理框架、版本号和发布日期。

  3. 将能力评价拆为推理、编程、Agent、长上下文、中文、写作、研究、多模态、数据分析、稳定性与效率等维度。

  4. 基于公开价格建立统一 Token 成本模型;对无法获得失败率和重试率的数据,不虚构“实际成本”。

  5. 最后给出场景化选型、模型组合、风险条件和可复现实测协议,并进行独立自查。

C. 信息来源清单

主要证据来源包括:Moonshot/Kimi 开放平台、Kimi K3 GitHub 与技术报告;DeepSeek 官方 API 文档、Hugging Face 模型卡与隐私政策;OpenAI 模型文档、GPT-5.6 发布页、API 定价与企业隐私政策;Anthropic 模型、定价、迁移、上下文和数据保留文档;Artificial Analysis 的 Intelligence Index、速度、成本和 AA-Briefcase 等公开评测。参考资料详见第 41 节。

D. 测试方案

本报告没有跨四家 API 的同环境调用权限,因此未声称完成受控统一实验。第 10 节与附录 A 给出 76 项统一测试协议,包括复杂推理、数学、编程、多文件工程、工具调用、长上下文、双语写作、事实核查、错误前提、多模态、数据分析、研究与项目规划。执行时应固定版本、推理强度、工具权限、温度、重试次数和评分器。

E. 评分标准

用户给定的 19 项权重合计为 102 分。为避免总分失真,本报告保持各项相对比例并归一化到 100 分。评分为“证据综合决策分”,融合官方规格、第三方评测、产品成熟度、成本、生态和风险,不等同于统一实验正确率。

维度 原权重 归一化权重
综合推理 10 9.80
编程与软件工程 12 11.76
Agent与工具调用 10 9.80
指令遵循 8 7.84
长上下文 8 7.84
中文能力 7 6.86
英文及多语言 4 3.92
写作能力 5 4.90
学术研究 5 4.90
事实准确性 8 7.84
多模态 4 3.92
数据分析 4 3.92
稳定性 4 3.92
响应速度 2 1.96
Token效率 3 2.94
API成本 3 2.94
生态与部署 2 1.96
隐私与企业能力 2 1.96
安全边界与可用性 1 0.98

F. 当前无法获得或无法公平比较的数据

  • 四模型在同一 API 地区、同一时间、相同硬件与相同网络下的首字延迟、吞吐、错误率和峰值稳定性。

  • 四模型以完全相同代理框架执行同一代码库任务的真实成功率;Codex、Claude Code、Kimi Code 与 DeepSeek Harness 会显著改变结果。

  • 一致的 1M 长上下文中英文联合测试、统一多模态测试和三次以上重复实验。

  • 厂商未公开的总参数、激活参数、训练数据或知识截止日期;报告一律标记“官方未公开”。

  • 在缺乏受控失败率与重试率时的精确“每个成功任务成本”;报告仅提供理论单次成本和敏感性范围。

1. 报告标题

《前沿大语言模型横向评估:Kimi K3、DeepSeek-V4-Pro、GPT-5.6 Sol 与 Claude Fable 5——基于官方文档、模型卡、独立基准与成本建模的证据综合研究》。

2. 研究日期与版本说明

本报告资料与价格查询截至 2026 年 8 月 2 日 23:30(UTC+8)。模型更新速度很快,尤其 Kimi K3 发布仅数日、DeepSeek-V4-Pro 仍是 Preview,任何结论都应与具体日期绑定。GPT-5.6 Sol 于 2026 年 7 月 9 日正式发布;Claude Fable 5 自 2026 年 6 月 9 日起一般可用;DeepSeek-V4-Pro 于 2026 年 4 月 24 日以 Preview 形式发布;Kimi K3 权重与技术报告于 2026 年 7 月 27 日公开。[1][4][8][11]

版本区分:GPT-5.6 的 Sol、Terra、Luna 是不同成本与能力档位,本报告只评 Sol;Claude Fable 5 与 Opus 5 是不同型号,本报告不以更便宜的 Opus 5 成绩替换 Fable;DeepSeek-V4-Flash-0731 仅用于说明 V4-Pro 的当前产品位置变化,不作为第五个主评对象。

3. 执行摘要

问题 执行摘要
综合能力上限 GPT-5.6 Sol 与 Claude Fable 5 同属第一梯队;现有差异不足以支持普适冠军。
软件工程 GPT-5.6 Sol 更适合作为通用生产主模型;Fable 5 适合高难度长程代理;Kimi K3 是开放权重强替代。
中文与本地语境 Kimi K3 具有最强倾向;DeepSeek 次之,但中文优势不等于所有专业任务均领先。
API 成本 DeepSeek-V4-Pro 最低,Kimi K3 次之;GPT-5.6 Sol 与 Fable 5 明显更贵。
企业敏感数据 严格 ZDR 更倾向 OpenAI 合格端点;Fable 5 明确不支持 ZDR;开放权重可通过自托管降低外发风险。
关键风险 Kimi 新、DeepSeek Pro 为 Preview、Fable 贵且留存 30 天、GPT 长上下文分段加价。

决策原则不是寻找单一“最强”,而是按任务复杂度、可验证性、成本、数据敏感度和代理框架进行路由。

4. 核心结论

  • 【高置信度】四模型都支持约 1M 上下文;但“标称窗口相同”不代表有效检索、长链推理或成本相同。

  • 【中高置信度】第三方 Intelligence Index v4.1 为 Fable 5 约 60、GPT-5.6 Sol 约 59、Kimi K3 约 57、DeepSeek-V4-Pro 约 44;1-3 分差距不应解释为绝对能力等级差。[16][17][18]

  • 【高置信度】DeepSeek-V4-Pro 的标准 API 单价最低;但其 Preview 状态和当前代理基准位置降低了其作为关键生产主模型的确定性。[4][6]

  • 【中等置信度】GPT-5.6 Sol 是最均衡的工程默认选项;Claude Fable 5 更偏向昂贵的长程高难任务;Kimi K3 更适合中文、开放权重和可控部署。

  • 【证据不足】无法可靠断言哪一款“幻觉最低”“1M 上下文最稳”或“任何地区都最快”,因为缺少统一版本、统一工具和多次重复实验。

四款模型的 Artificial Analysis Intelligence Index v4.1 横向条形图

图 1 Artificial Analysis Intelligence Index v4.1 快照。第三方分数受版本、推理设置与评测方法影响。

5. 四款模型一句话定位

模型 一句话定位
Kimi K3 开放权重、原生多模态、1M 上下文的中文前沿 Agent 模型;潜力高,但新模型与自定义许可证需要谨慎评估。
DeepSeek-V4-Pro 极低成本、1M 上下文的开放权重文本模型;仍处 Preview,当前代理表现已被同厂新版 Flash 反超。
GPT-5.6 Sol 能力、工具、工程生态和单位成功任务成本较均衡的闭源旗舰,适合生产型知识工作与软件工程。
Claude Fable 5 面向长程代理和高难知识工作的顶级闭源模型,写作与研究优势明显,但价格和 30 天留存约束突出。

6. 基础参数总表

属性 Kimi K3 DeepSeek V4 Pro GPT-5.6 Sol Claude Fable 5
厂商/地区 Moonshot AI/中国 DeepSeek/中国 OpenAI/美国 Anthropic/美国
正式型号 Kimi K3 DeepSeek-V4-Pro gpt-5.6-sol;gpt-5.6 默认 Sol claude-fable-5
状态/日期 正式;权重 2026-07-27 Preview;2026-04-24 GA;2026-07-09 GA;2026-06-09
模型定位 旗舰、长程编程/知识工作 V4 Pro 预览旗舰 GPT-5.6 旗舰 最高能力公开档、长程 Agent
开放情况 开放权重;Kimi K3 License 开放权重;MIT 闭源 闭源
总/激活参数 2.8T/104B 1.6T/49B 官方未公开 官方未公开
架构 MoE;KDA+Gated MLA+AttnRes MoE;CSA+HCA+mHC 官方未公开 官方未公开
上下文 1,048,576 1M 1,050,000 1M
最大输出 无单一稳定值公开;受 1M 总窗口约束 最大 384K 128K 128K
知识截止 官方未公开 官方未公开 2026-02-16 可靠/训练截止 2026-01
推理模式 始终思考;low/high/max 思考与非思考;默认思考 none 至 max 多档 自适应思考始终开启
输入模态 文本、图像;官方 API 亦接受视频 文本 文本、图像 文本、图像
输出模态 文本 文本 文本 文本
工具调用 支持,含动态加载/官方工具 支持 支持,Responses 工具生态广 支持,Messages/工具生态成熟
结构化输出 严格 JSON Schema JSON Output Structured Outputs Structured Outputs
API 兼容 OpenAI Chat Completions 风格 OpenAI/Anthropic 兼容 原生 OpenAI 原生 Anthropic;多云
本地/私有化 可,硬件门槛极高 可,硬件门槛极高 不可获取权重 不可获取权重

注:Kimi 官方仓库的文字说明包含视频理解,而模型摘要表将 Modality 列为 Text、Image;报告据此将视频标为“API/说明支持,但需工程验证”,避免把产品预处理能力与基础模型原生能力完全等同。[2][3]

7. 产品形态与型号差异

Kimi K3 的 API、Kimi 产品和本地开放权重部署不是同一系统:网页产品可能附带搜索、文件、代码执行和记忆;本地权重则取决于用户自建代理框架。DeepSeek 同样存在 chat.deepseek.com、官方 API、Hugging Face 权重和第三方推理服务差异。OpenAI 的 ChatGPT Work/Codex 与基础 API 模型拥有不同系统指令和工具;Claude API、Claude Code、Bedrock、Google Cloud 与 Microsoft Foundry 的托管边界也不同。

比较时必须把“基础模型能力”“官方代理产品能力”“第三方代理框架能力”分离。尤其编程榜单中,Codex、Claude Code、Kimi Code、Terminus 或 DeepSeek Harness 会改变上下文整理、补丁格式、测试循环和工具恢复机制,排名可能随框架改变。

DeepSeek 的当前产品位置需要单独说明:V4-Pro 仍是 Preview,而 7 月 31 日发布的 V4-Flash-0731 已在官方公布的 TerminalBench 2.1、NL2Repo、DeepSWE、Toolathlon、Agents’ Last Exam 等多项代理测试中超过 V4-Pro。因此,本报告评 V4-Pro,但不把它写成 DeepSeek 当前无条件首选。[6]

8. 官方基准测试整理

来源 覆盖内容 解释限制
Kimi K3 技术报告 GPQA、AA-LCR、DeepSWE、Terminal-Bench、OfficeQA 等 部分结果使用不同 harness;厂商报告主动承认总体仍落后 Fable 5 与 GPT-5.6 Sol。
DeepSeek V4 模型卡 知识、数学、代码、Agent、1M 长上下文 Preview 版本;后续 Flash-0731 已在多项 Agent 基准反超 Pro。
OpenAI GPT-5.6 发布页 Agents’ Last Exam、GDPval-AA、SWE/Terminal、OSWorld、长上下文等 包含厂商选择的设置、内部测试和竞品成绩;需与独立结果分开。
Anthropic Fable 5 文档 强调长程代理、1M 上下文、自适应思考 官方定位不是中立横向实验;Fable 还存在 fallback 和安全分类器影响。

厂商基准的价值在于说明模型设计目标与可达到的上限,但不能直接作为市场排名。需要检查评测日期、推理强度、是否使用工具、代理框架、重复次数以及竞品是否使用同等配置。

9. 第三方评测整理

第三方指标 结果快照 限制
Artificial Analysis Intelligence Index v4.1 Fable 60;GPT Sol 59;Kimi 57;DeepSeek Pro 44 综合能力快照;版本会更新,不能跨版本直接比较
AA 输出速度 GPT max 67.6 tok/s;Fable 66.2;DeepSeek 约 57;Kimi 34.7 速度由提供商、地区和推理档位决定
AA 首字延迟 DeepSeek 约 1.55s;Kimi 3.29s;Fable max 80.65s;GPT max 137.84s max 档包含长思考;不能代表中低 effort 交互体验
AA-Briefcase Fable 1574 Elo;Kimi 1543 Elo 知识工作长程任务;样本和评分器仍有限
官方引用的 AA Coding Agent v1.1 GPT Sol 80;Fable 77.2 榜单后续版本已变化,报告不把旧值当当前统一事实

第三方评测比厂商自测更接近中立,但仍不是“真理”。同一模型在不同 reasoning effort、provider、fallback 与 harness 下可以表现不同;评测集迭代也会使历史分数不可直接与当前分数拼接。

10. 统一实测方法

统一实测应采用“同任务、同输入、同工具、同预算、同重试、同评分”的最小可比设计。建议使用 API 固定快照而非网页端,记录请求 ID、模型 ID、参数、系统提示、工具调用、输入输出 Token、思考 Token、延迟、总费用和错误日志。

控制项 要求
重复次数 客观题至少 3 次;随机性较高任务 5 次
推理预算 统一 low/medium/max 三档,禁止仅比较一方 max 与另一方默认
工具权限 纯模型组禁用工具;Agent 组提供相同工具和相同超时
编程框架 主实验使用中立 harness;另做厂商最佳框架分组
长上下文 128K、512K、约 1M 三档;随机化针位置
主观评审 匿名双评审;分歧由第三评审裁决
统计 报告均值、中位数、95% 区间、首次成功率与失败类型

11. 统一实测结果

【未执行声明】本报告没有获得四家模型在同一受控环境的 API 调用权限,因此不能诚实地填充“本次统一实测成绩”。本节只给出公开证据的可比部分和缺口,完整任务清单见附录 A。

证据项 当前可得性 能否公平比较
综合独立指数 同一机构,但推理档位和 fallback 有差异
官方代理基准 部分 厂商和 harness 不同,不宜汇总为单榜
API 规格与价格 较强 官方页面可核验,但随时可能更新
稳定性/错误率 不足 缺少相同地区和重复压力测试
中文写作/自然度 不足 缺少四模型匿名人评共同样本
1M 有效上下文 不足 没有统一中英文多针与跨文档实验

12. 综合推理能力比较

综合推理方面,Fable 5 与 GPT-5.6 Sol 的现有证据最强,Kimi K3 接近,DeepSeek-V4-Pro 仍具较强能力但与前三者存在可见差距。AA v4.1 的 60、59、57、44 仅是一个综合快照;Fable 与 GPT 的 1 分差距远小于任务选择、推理预算和重复采样可能造成的变化。[16][17][18]

GPT 的优势更偏向受工具支持的专业工作、计算机操作、结构化知识产出和工程执行;Fable 更偏向长链分析、复杂约束、研究与长程代理。Kimi 的报告显示其在 AA-LCR、长程 Agent 与开放权重模型中表现突出,但其自身技术报告明确承认总体仍落后最强闭源模型,这一自我限定提升了结论可信度。[3]

DeepSeek-Pro 的纯知识与数学能力不应因 Agent 榜单下降而被全盘否定;但用于“长期自主执行”的推荐必须降低置信度,因为同厂新 Flash 已在多项 Agent 基准上超过它。

13. 数学能力比较

数学能力不能只看单一竞赛分。应区分无工具推理、代码/计算器辅助、证明严谨性、单位与数值误差、以及模型是否主动复核。OpenAI 官方发布页显示 Sol 在 GPQA 与 FrontierMath 多档上具强竞争力;Fable 在 FrontierMath Tier 4 的厂商对照中更高,但来源仍来自 OpenAI 页面,应视为“厂商提供的竞品结果”,不等于独立复现实验。[8]

证据综合倾向:Fable 5 与 GPT-5.6 Sol 第一梯队;Kimi K3 接近且在中文数学解释中可能更自然;DeepSeek-V4-Pro 仍具性价比,但复杂证明和长链一致性需要单独实测。高风险工程计算必须让模型输出可复现代码,并由确定性工具核算。

14. 编程与软件工程能力比较

软件工程需要评“仓库理解—修改范围—运行测试—失败恢复—最终可合并性”,而非只看代码片段。GPT-5.6 Sol 结合 Codex 的当前公开证据、工具生态和结构化输出更适合作为生产默认主模型。Fable 5 对长程 Agent 和复杂代码审查有明显优势倾向,但成本高且某些评测存在 fallback。Kimi K3 在 Kimi Code 与开放权重场景中非常有竞争力,适合希望自托管、深度定制或中文工程协作的团队。

DeepSeek-V4-Pro 的问题不是“不会写代码”,而是版本定位:它仍为 Preview,且 Flash-0731 在官方列出的 TerminalBench 2.1 为 82.7 对 72.1、DeepSWE 为 54.4 对 12.8、NL2Repo 为 54.2 对 38.5。因此,选择 DeepSeek 做 Coding Agent 时,应先重新比较 Flash-0731,而不是机械坚持 Pro。[6]

场景 倾向选择 说明
生产型全栈/多文件 GPT-5.6 Sol 生态、工具、文档产出、验证链较均衡
超长自主开发/困难调试 Fable 5 或 GPT Sol 二者需按仓库与 harness 做 A/B
开放权重/私有部署 Kimi K3 能力高,但部署成本与许可证需审查
最低成本批量代码辅助 DeepSeek 系列 用户指定 Pro 需谨慎,当前应纳入 Flash-0731

15. Agent 与工具调用能力比较

Agent 能力高度依赖模型之外的系统:工具 schema、上下文压缩、并发调度、重试、补丁应用、沙箱、权限和观察日志。Fable 5 的官方定位就是长程代理,GPT-5.6 Responses 提供程序化工具调用与多 Agent,Kimi K3 支持动态工具加载并针对长程执行训练;三者都有第一梯队倾向。

风险侧:Kimi 官方文档提醒可能出现重复调用同一工具的情况,工程上应做去重、调用上限与幂等保护;Fable 5 始终思考且可能触发安全 fallback;GPT 的高级工具可能增加单次调用之外的费用;DeepSeek Pro 暂不支持 Responses API 和 Codex 集成,官方预计 2026 年 8 月初补充支持。[1][5]

长期 Agent 推荐不应只看模型聪明程度。必须比较:首次任务成功率、每成功任务总 Token、工具误调用率、人工接管次数、失败后能否恢复、以及连续数十分钟后是否偏离目标。

16. 指令遵循能力比较

GPT-5.6 Sol 与 Fable 5 在复杂格式、层级约束和局部修改上表现最可靠的倾向;Kimi K3 中文指令理解很强,但发布初期应测试长任务中的约束保持;DeepSeek-Pro 对常规结构化要求支持良好,但 Preview 与不同兼容 API 映射可能产生边缘差异。

测试时应加入“禁止修改无关文件”“只返回 JSON”“字数上限”“条件分支”“早期约束保持”和“错误前提纠正”。模型在一次回答中满足格式并不代表长期会话仍能保持规则。

17. 长上下文能力比较

四者标称上下文均约 1M,但成本与机制不同:Kimi 与 Fable 不按长上下文分段加价;GPT 输入超过 272K 时,整请求输入价格 2 倍、输出 1.5 倍;DeepSeek 标价低且采用压缩注意力架构。标称窗口只说明请求可被接受,不说明中部信息召回、跨段推理和指令保持。

现有官方结果显示 GPT Sol 在 MRCR 512K-1M、GraphWalks 1M 上保持较强表现,Anthropic Fable 的 1M 是默认窗口,Kimi 的架构和训练专门面向百万上下文,DeepSeek 的 CSA/HCA 强调推理成本下降。但没有一套独立、同语言、同针分布的四模型共同实验,故本报告不宣布长上下文冠军。

工程建议:把 1M 视为“上限容量”,而不是默认把整个知识库塞入一次请求。应优先采用检索、分层摘要、缓存、结构化索引和引用定位。

18. 中文能力比较

中文能力的评估应包含本地平台语境、含蓄指令、网络语言、专业中文、长文结构和中英混合代码需求。Kimi K3 与 DeepSeek 具有训练和产品语境优势;其中 Kimi 更适合中文长文、研究整理、视觉材料和 Agent 工作。

但“国产模型中文更好”不能外推为数学、工程、事实或复杂 Agent 全面领先。GPT 与 Fable 的中文已经处于高水平,在跨语言研究、英文技术文档和国际生态上更强。结论置信度为中等,因为尚缺少四模型共同、匿名、多人评审的中文基准。

19. 英文及多语言能力比较

英文技术、学术、商务和跨语言检索方面,GPT-5.6 Sol 与 Fable 5 更稳健;Fable 的长篇英文写作与论证自然度倾向较高,GPT 在技术输出、结构化文档、多语言工具调用方面更均衡。Kimi K3 英文能力已接近前沿,DeepSeek-Pro 足以覆盖大多数技术场景,但低资源语言与复杂歧义翻译仍需实测。

推荐采用“双向回译+术语表+原文引用”机制验证专业翻译,不把任何模型的流畅输出等同于准确。

20. 写作与内容创作能力比较

写作质量包含结构、信息密度、语气、细节、非模板化、局部编辑控制和长篇一致性。证据综合倾向为 Fable 5 第一、GPT Sol 紧随、Kimi K3 在中文写作中特别强、DeepSeek-Pro 更适合成本敏感初稿。该排序主观性较高,置信度仅中等。

Fable 更擅长保持论证与叙事语气,GPT 更擅长把素材转为可交付的文档、表格和演示结构,Kimi 更易贴近中文网络与本地阅读节奏。实际选型应使用用户自己的 10-20 个历史文本进行盲评,而不是依赖通用印象。

21. 学术研究能力比较

学术研究能力必须把搜索能力、来源质量、引用准确性、统计解释、研究设计和不确定性表达分开。GPT 与 Fable 适合作为高难研究主模型,Kimi 适合中文资料、长文档与开放部署,DeepSeek 适合低成本批量文献初筛。

任何模型都可能虚构 DOI、误读摘要或把厂商新闻当论文。合格工作流应要求:优先原始论文;逐条核对作者、题名、年份和 DOI;引用必须能打开;关键结论至少双源交叉验证;统计结果用代码复算。

22. 事实准确性与幻觉比较

现有综合榜单支持 GPT/Fable 在知识与事实可靠性上更强的倾向,但不足以断言某一款“幻觉最低”。幻觉率受题目领域、是否联网、是否允许拒答、提示方式和评分标准显著影响。DeepSeek 历史 AA Omniscience 结果偏弱,但那是特定版本与指标,不应直接外推所有事实任务。

最佳控制方法不是相信某个品牌,而是设计证据链:强制引用、打开来源、验证引用是否支持正文、对不存在实体设置陷阱题、对高风险结论进行第二模型反证。

23. 联网搜索能力比较

联网搜索首先是产品与工具能力,而非基础模型权重本身。Kimi、OpenAI 与 Anthropic 均提供搜索/网页/文件工具,DeepSeek 可通过外部 Agent 框架接入。评价时应记录搜索引擎、结果数量、PDF 是否真正读取、是否只使用摘要、引用和正文是否匹配。

GPT 的官方工具生态、程序化工具调用和文件/搜索接口最完整;Kimi 官方工具在中文资料与低门槛集成上便利;Claude 的研究与工具使用能力强;DeepSeek 的兼容性利于接入现有框架,但 Pro 当前 Responses 支持仍不完整。

24. 多模态能力比较

模型 模态边界 分析
Kimi K3 图像明确;API/说明支持视频输入 原生多模态、中文截图/文档潜力高;视频能力需统一验证
DeepSeek-V4-Pro 文本模型 多模态任务需要外部视觉模型,不能以产品 OCR 替代
GPT-5.6 Sol 图像输入,文本输出 截图、图表、文档与工具链较成熟;无原生音频/视频输入
Claude Fable 5 图像输入,文本输出 复杂文档和视觉推理倾向强;无原生音频/视频输出

多模态测试必须关注数字读取、局部细节、空间关系、多图对应和“图中不存在内容”的幻觉。PDF 文本抽取与页面视觉理解应分开测试。

25. 数据分析能力比较

GPT-5.6 Sol 在代码执行、结构化输出、表格/文档生成和工具编排方面最均衡;Fable 5 适合复杂分析与解释;Kimi K3 适合中文 Excel/CSV 与长文档;DeepSeek-Pro 可作为成本敏感的数据清洗与 SQL 辅助模型。

数据分析的主要风险是看错列、忽略单位、错误连接、把相关性当因果和生成与数据不一致的叙述。所有模型都应输出可复现代码、数据版本、随机种子和检查总数。

26. 专业领域能力比较

领域 倾向模型 注意事项
软件工程/AI GPT Sol;Fable;Kimi 闭源生态与开放部署各有优势;需真实仓库测试
机械/建筑/电气 GPT Sol;Kimi 多模态、CAD/图纸工具和专业资料决定效果
医学/法律/金融 GPT Sol/Fable 作研究助手 高风险;必须引用权威来源与人工复核
社会科学/教育 Fable/GPT/Kimi Fable 论证、GPT 结构、Kimi 中文资料各有倾向
内容创作 Fable/Kimi/GPT 按目标语言、风格样本和发布平台盲评
企业管理/咨询 GPT/Fable 工具化交付与长程分析更成熟

专业能力强不代表可以无监督给出最终决策。医学、法律、金融和安全相关结论必须由持证专业人士或组织负责人确认。

27. 对话体验比较

对话协作体验受产品层系统提示、记忆、界面、工具和安全政策影响。GPT 的优势是跨文档交付与生态;Fable 的优势是长篇、深思与自然表达;Kimi 的优势是中文语感与本地工具;DeepSeek 的优势是低成本和简洁接入。

用户应重点评估:是否重复已知信息、是否擅自扩大任务、是否接受纠正、是否能精确局部修改、是否在复杂任务中给出真实进度、以及失败时是否坦诚。

28. 稳定性与响应速度比较

模型/档位 输出速度(第三方) 首字延迟(第三方) 解释
Kimi K3 max 约 34.7 tok/s 约 3.29s 发布新,长期高峰数据不足
DeepSeek V4 Pro max 约 57 tok/s 约 1.55s TTFT 低;Preview 稳定性仍需压力测试
GPT-5.6 Sol max 约 67.6 tok/s 约 137.84s max 长思考导致首字慢;中档显著更快
Claude Fable 5 max 约 66.2 tok/s 约 80.65s 始终思考;首字慢但输出吞吐高

“最快”必须分为首字延迟、稳定吞吐和总任务完成时间。DeepSeek 在该第三方端点的首字最短,GPT/Fable 的 max 输出吞吐更高;但 max 档的首字时间不代表日常 medium/low 体验。地区、提供商和负载会改变结果。

29. API 价格与真实任务成本

以下价格是截至报告日期的官方标准 API 价格。美元模型按 1 USD≈6.79 CNY 作为分析假设折算,不代表付款机构实时汇率;不含税、区域加价、工具费、文件费、搜索费、重试与第三方平台加价。

模型 缓存命中/MTok 输入/MTok 输出/MTok 备注
Kimi K3 ¥2.000 ¥20.00 ¥100.00 中国区官方人民币价;1M 上下文不分段加价
DeepSeek-V4-Pro ¥0.025 ¥3.00 ¥6.00 官方人民币价;未来峰时 2 倍尚待正式生效公告
GPT-5.6 Sol ¥3.395 ¥33.95 ¥203.70 美元标准短上下文价折算;输入超过 272K 时整请求输入 2 倍、输出 1.5 倍
Claude Fable 5 ¥6.790 ¥67.90 ¥339.50 美元标准价折算;1M 上下文维持标准单价
四款模型标准 API 输入与输出单价的对数尺度柱状图

图 2 标准 API 输入/输出单价对比。纵轴采用对数尺度。

场景 Kimi K3 DeepSeek Pro GPT Sol Fable 5
10 次普通问答 ¥1.40 ¥0.12 ¥2.72 ¥4.75
生成约一万字中文文章 ¥1.60 ¥0.10 ¥3.23 ¥5.43
分析约十万字文档 ¥3.00 ¥0.36 ¥5.43 ¥10.19
单次 1M 输入 + 20K 输出 ¥22.00 ¥3.12 ¥74.01 ¥74.69
一个中型编程任务 ¥5.00 ¥0.48 ¥9.51 ¥16.98
每日 1000 次 Agent,连续 30 天 ¥12,000.00 ¥1,260.00 ¥22,407.00 ¥40,740.00
每月 1 亿输入 + 2000 万输出 ¥4,000.00 ¥420.00 ¥7,469.00 ¥13,580.00

这些是“单次理论 Token 成本”,不等于“实际成功任务成本”。若低价模型需要更多输出、重试或人工修复,实际差距会缩小;若提示前缀缓存命中率高,DeepSeek、Kimi、GPT 和 Claude 的实际成本也会显著下降。

30. Token 效率比较

Token 效率应以完成任务所需总 Token、重试次数和人工介入衡量。OpenAI 官方强调 GPT-5.6 用更少输出完成代理任务,AA 也显示其与 Fable 接近的综合能力但每任务成本更低;这些结果支持“GPT 的单位成功任务成本可能优于静态单价印象”,但仍需企业自己的真实任务日志验证。[8][19]

Fable 单价高,但若它在最困难任务上减少多轮返工,仍可能经济;Kimi 的优势是能力接近闭源前沿且价格较低;DeepSeek 的静态单价最低,但 Pro 的 Preview 状态和当前代理成功率可能增加隐性成本。

31. 部署、生态与兼容性

维度 Kimi K3 DeepSeek Pro GPT Sol Fable 5
API/SDK OpenAI 兼容、官方工具 OpenAI/Anthropic 兼容 Responses/Chat/Batch 完整 Messages、多云平台
IDE/Agent Kimi Code,开放生态 Claude Code/Codex 等兼容但 Pro 支持有时序限制 Codex 与广泛第三方 Claude Code、Bedrock/Google/Microsoft
私有化 可,硬件极高 可,MIT,硬件极高 不可 不可
版本控制 模型新,生态仍对齐 Preview;Flash 已更新 快照与别名体系 dateless ID 也是固定快照
企业采购 官方与合作伙伴 官方 API/自托管 成熟企业控制与 ZDR 多云与企业平台成熟

对大型组织而言,生态质量往往比单点基准更重要:日志、权限、模型快照、SLA、区域推理、审计、密钥轮换、成本配额和故障回退决定可运营性。

32. 隐私、数据安全与企业能力

服务 官方公开边界 选型含义
Kimi API 公开隐私页说明保护与处理原则,但本次查阅未找到与 OpenAI 同等清晰的 API 默认不训练/ZDR 公告 敏感数据需企业合同确认;自托管可减少外发
DeepSeek 托管服务 隐私政策收集输入/输出等;部分服务数据在中国处理;开放平台下游责任另有边界 高度敏感数据应谨慎;自托管 MIT 权重更可控
OpenAI API/Business 默认不使用业务/API 数据训练;通常最多保留 30 天;符合条件可申请 ZDR 四者中公开企业控制最清晰
Claude Fable 5 官方明确要求 30 天数据保留,不适用 ZDR 严格零留存场景不应选择 Fable 5

“开放权重”不自动等于安全:自托管仍需访问控制、日志脱敏、权重供应链验证、沙箱隔离和输出审计。Kimi K3 许可证不是无条件 MIT;面向 MaaS 和大型商业产品存在额外协议或品牌展示要求。[2][20]

33. 安全限制与可用性边界

安全限制应评估误拒绝、危险内容拦截和替代方案质量,不能把“拒绝少”直接解释为更强。Fable 5 的迁移文档特别提示安全分类器与 fallback;OpenAI 对高能力网络安全采用分级访问;Kimi 与 DeepSeek 也有各自内容治理和地区规则。

对于正常工程任务,应实测:安全审计、漏洞修复、合法逆向、医疗健康解释、政治历史研究、人物图像编辑等是否产生误拒绝。企业应预设模型回退和人工审批,而非绕过安全机制。

34. 综合评分表

下表为本报告的“证据综合决策分”。它不是统一实验正确率;分值包含模型能力、成熟度、成本、生态和数据治理,且对新模型与 Preview 给予更宽不确定区间。

维度 权重 Kimi DeepSeek GPT Fable
综合推理 9.80 9.0 8.0 9.5 9.6
编程与软件工程 11.76 9.1 7.4 9.7 9.4
Agent与工具调用 9.80 9.2 7.2 9.6 9.7
指令遵循 7.84 8.8 8.4 9.5 9.4
长上下文 7.84 9.2 8.7 9.2 9.5
中文能力 6.86 9.6 9.3 9.1 8.9
英文及多语言 3.92 8.8 8.4 9.6 9.6
写作能力 4.90 9.0 8.3 9.4 9.7
学术研究 4.90 9.2 8.1 9.6 9.7
事实准确性 7.84 8.8 8.4 9.3 9.4
多模态 3.92 9.4 2.0 9.2 9.4
数据分析 3.92 9.1 8.2 9.7 9.4
稳定性 3.92 7.8 7.2 9.2 8.5
响应速度 1.96 7.4 8.5 8.5 8.2
Token效率 2.94 7.8 8.0 9.3 8.7
API成本 2.94 7.6 10.0 6.0 3.8
生态与部署 1.96 8.3 8.4 9.8 9.5
隐私与企业能力 1.96 7.2 7.3 9.4 7.5
安全边界与可用性 0.98 8.1 8.0 8.7 8.2
模型 参考总分 建议不确定区间 结论置信度
GPT-5.6 Sol 93.2 ±2.5 中高
Claude Fable 5 91.7 ±2.5 中高
Kimi K3 88.7 ±3.5
DeepSeek-V4-Pro 79.0 ±5.0 中低
四款模型证据综合决策分横向条形图及不确定性说明

图 3 证据综合决策分。GPT 与 Fable 的区间重叠,不能据此宣称普适领先。

35. 各专项排名

专项 本报告倾向 限定
综合 GPT Sol / Fable 5 同一梯队 Fable 独立指数略高,GPT 工程与成本更均衡
推理 Fable 5 ≈ GPT Sol 任务类型决定顺序
编程 GPT Sol;Fable 5;Kimi K3 以生产工程和生态为重;框架会改写排名
长期 Agent Fable 5;GPT Sol;Kimi K3 Fable 定位最明确,但成本与留存约束大
中文 Kimi K3;DeepSeek;GPT/Fable 中等置信度,缺共同盲评
写作 Fable 5;GPT Sol;Kimi K3 主观性较高
长上下文 暂不判定唯一首选 四者约 1M,缺共同独立实验
多模态 Kimi/GPT/Fable DeepSeek-Pro 为文本模型
最快 TTFT 倾向 DeepSeek;吞吐倾向 GPT/Fable 必须区分档位与提供商
最低静态 API 成本 DeepSeek Pro;Kimi K3 不等于最低成功任务成本
企业治理 OpenAI 托管 API;自托管 Kimi/DeepSeek Fable 5 不支持 ZDR

36. 不同用户与任务的选择建议

用户/任务 第一推荐 第二推荐 不建议 核心原因
普通个人用户 GPT Sol Kimi K3 DeepSeek Pro 作为唯一主模型 综合体验更稳,Kimi 中文替代
中文内容创作者 Kimi K3 Fable 5 DeepSeek Pro 做终稿 中文自然度与长文能力
学术研究者 Fable 5 / GPT Sol Kimi K3 任何模型无引用直接提交 研究深度与工具交付互补
软件工程师 GPT Sol Fable 5 / Kimi K3 固定选 DeepSeek Pro 不重测 Flash 工程生态与真实仓库成功率
AI Agent 开发 GPT Sol / Fable 5 Kimi K3 只看静态 benchmark 工具、恢复与日志更重要
知识库建设 Kimi K3 / GPT Sol Fable 5 把 1M 当检索替代品 需 RAG、引用和缓存
预算极低 API DeepSeek 系列 Kimi K3 Fable 5 静态单价差距巨大
最高能力不计价 Fable 5 / GPT Sol Claude Opus 5 也应纳入重评 只因 Fable 名称选型 当前组合更合理
私有部署企业 Kimi K3 DeepSeek 系列 闭源权重 需硬件、许可证与安全工程
敏感商业数据 OpenAI 合格 ZDR 端点或自托管 企业合同确认后的其他方案 Fable 5 严格 ZDR 场景 公开留存政策决定

37. 多模型组合方案

方案 角色与路由 升级条件 价值/代价
低成本分流 DeepSeek/Kimi 处理分类、抽取、草稿;GPT/Fable 复核高风险结果 置信度低、金额/法律/部署决策时升级 成本低,需路由器与评测集
编程双模型 GPT Sol 主开发;Fable 或 Kimi 做独立代码审查 测试失败两次或涉及架构/安全时升级 减少单模型盲点
中文研究 Kimi 收集中文资料;Fable 做论证;GPT 生成可交付文档 引用冲突或跨语言证据不足时交叉审查 适合论文、行业研究
长文档/复杂推理 Kimi/Fable 负责长上下文;GPT 负责结构化输出与工具执行 检索召回不足时拆分任务 兼顾上下文与交付
敏感数据 本地 Kimi/DeepSeek 预处理脱敏;OpenAI ZDR 做高难推理 仍含敏感字段则禁止外发 降低泄露面,但架构更复杂
三层 Agent 便宜模型路由与监控;GPT 执行;Fable 处理极难异常 按失败类型而非模型自评升级 控制高价模型使用量

对工程型用户,推荐默认采用“任务路由 + 独立验证”而不是全量依赖单模型。模型路由应由任务标签、数据敏感度、上下文长度、预算和历史成功率共同决定。

38. 四款模型的主要缺点

模型 主要缺点与风险
Kimi K3 发布极新;大模型本地部署成本高;自定义许可证有商业附加条件;官方工具可能出现重复调用风险;企业数据条款公开度需进一步合同确认。
DeepSeek-V4-Pro 仍为 Preview;文本单模态;当前 Flash-0731 在多项 Agent 基准反超;Responses/Codex 支持尚未完整;托管数据边界需谨慎。
GPT-5.6 Sol 价格高于国产模型;max 档首字延迟可能很长;>272K 输入存在分段加价;闭源不可私有化;高级工具另收费。
Claude Fable 5 四者中基础单价最高;始终思考,低复杂任务可能浪费;明确要求 30 天留存且不支持 ZDR;当前 Opus 5 半价且独立分数接近/略高,Fable 价值需任务验证。

39. 结论可能发生变化的条件

  • DeepSeek 将 V4-Pro 从 Preview 转为正式版,或更新 Pro 使其重新超过 Flash-0731。

  • Kimi K3 获得数月生产稳定性、更多独立多模态与中文盲评,或许可证与企业条款调整。

  • OpenAI、Anthropic、Moonshot、DeepSeek 调整价格、缓存、长上下文政策或模型路由。

  • Artificial Analysis、SWE/Agent 榜单更新版本,改变模型分数和 harness。

  • Fable 5 的 fallback、数据留存、模型可用性或与 Opus 5 的产品定位变化。

  • 用户自己的真实任务成功率与公开平均值明显不同。

40. 研究局限

第一,本报告是证据综合研究,不是四模型受控实验。第二,模型迭代速度使部分第三方分数在数周内发生变化。第三,写作、中文自然度和协作体验存在主观判断。第四,价格模型未计入所有工具、搜索、区域、税费、限速和重试。第五,隐私政策适用范围可能因产品、地区、合同和云平台不同。

因此,总分应作为形成测试假设的工具,而不是采购合同的唯一依据。最终选型应在用户自己的代码库、文档、数据和安全约束上执行附录 A 的受控测试。

41. 参考资料

[1] Kimi K3 Quickstart / API 文档. https://platform.kimi.com/docs/guide/kimi-k3-quickstart

[2] MoonshotAI, Kimi-K3 GitHub 与模型摘要. https://github.com/MoonshotAI/Kimi-K3

[3] Kimi Team, “Kimi K3: Open Frontier Intelligence,” arXiv:2607.24653, 2026. https://arxiv.org/abs/2607.24653

[4] DeepSeek-V4-Pro 官方模型卡. https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro

[5] DeepSeek 模型与定价. https://api-docs.deepseek.com/zh-cn/quick_start/pricing/

[6] DeepSeek-V4-Flash-0731 官方模型卡. https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

[7] DeepSeek Privacy Policy. https://cdn.deepseek.com/policies/en-US/deepseek-privacy-policy.html

[8] OpenAI, GPT-5.6 发布页. https://openai.com/index/gpt-5-6/

[9] GPT-5.6 Sol API 模型页. https://developers.openai.com/api/docs/models/gpt-5.6-sol

[10] OpenAI Enterprise Privacy. https://openai.com/enterprise-privacy/

[11] Anthropic Claude Models Overview. https://platform.claude.com/docs/en/about-claude/models/overview

[12] Anthropic Claude Pricing. https://platform.claude.com/docs/en/about-claude/pricing

[13] Anthropic Fable 5 / Mythos 5 介绍. https://platform.claude.com/docs/en/about-claude/models/introducing-claude-fable-5-and-claude-mythos-5

[14] Anthropic API and Data Retention. https://platform.claude.com/docs/en/manage-claude/api-and-data-retention

[15] Artificial Analysis 首页与方法入口. https://artificialanalysis.ai/

[16] AA: GPT-5.6 Sol vs Claude Fable 5. https://artificialanalysis.ai/models/comparisons/gpt-5-6-sol-vs-claude-fable-5

[17] AA: Kimi K3 vs GPT-5.6 Sol. https://artificialanalysis.ai/models/comparisons/kimi-k3-vs-gpt-5-6-sol

[18] AA: Kimi K3 vs DeepSeek V4 Pro. https://artificialanalysis.ai/models/comparisons/kimi-k3-vs-deepseek-v4-pro

[19] AA: GPT-5.6 benchmarks. https://artificialanalysis.ai/articles/gpt-5-6-has-landed

[20] Kimi K3 License. https://github.com/MoonshotAI/Kimi-K3/blob/main/LICENSE

[21] Kimi 开放平台定价首页. https://platform.kimi.com/

[22] Kimi API 隐私政策. https://platform.kimi.com/docs/agreement/userprivacy

[23] OpenAI API Models Compare. https://developers.openai.com/api/docs/models/compare

[24] Claude Context Windows. https://platform.claude.com/docs/en/build-with-claude/context-windows

[25] AA: Kimi K3 on AA-Briefcase. https://artificialanalysis.ai/articles/kimi-k3-agentic-knowledge-benchmark

[26] AA: Claude Opus 5 与 Fable 5 当前定位. https://artificialanalysis.ai/articles/opus-5

参考资料以官方来源为主。第三方结果用于交叉验证;厂商自测和第三方成绩均不被写成统一受控实验结论。

附录 A 统一实测协议与任务清单

本附录提供可复现的四模型共同评测框架。总计 76 个任务:复杂推理 10、数学 10、编程 10、多文件工程 5、Agent 工具调用 5、长上下文 5、中文写作 5、英文写作 5、事实核查 5、错误前提 5、多模态 5、数据分析 5、学术研究 3、复杂项目规划 3。

项目 统一要求
环境 同一地区云主机;API 固定快照;每轮记录 UTC 时间和服务端请求 ID
参数 温度按厂商最佳实践;统一 low/medium/max 三档;最大输出一致
工具 纯模型组禁用;Agent 组使用相同搜索、文件、Shell、Python 与浏览器接口
重复 客观题 3 次,开放题 5 次;禁止只挑最佳样本
评分 客观题自动验证;代码执行测试;主观题匿名双评;引用逐条打开核对
成本 记录输入、缓存写/读、思考、输出、工具费、重试和人工分钟
失败分类 事实错误、约束遗漏、工具误用、无效循环、拒答、超时、格式失败、引用不匹配
编号 类别 数量 覆盖
R01-R10 复杂推理 10 多约束排程、因果反事实、概率、空间、矛盾证据、自我纠错
M01-M10 数学 10 代数、概率、微积分、线代、数论、证明、工程计算与陷阱题
C01-C10 编程 10 Python/TS/Java/C++/Rust/SQL、Bug、重构、测试与安全
E01-E05 多文件工程 5 真实仓库修改、依赖冲突、CI、性能与遗留代码
A01-A05 Agent 5 多工具研究、软件项目、文件处理、失败恢复与并行子任务
L01-L05 长上下文 5 128K/512K/1M 多针、跨文档推理、矛盾识别与引用定位
ZW01-ZW05 中文写作 5 论文、公众号、技术文档、商务沟通、长篇改写
EW01-EW05 英文写作 5 学术、技术、商务、跨文化与歧义翻译
F01-F05 事实核查 5 历史、科技、工程、法律、当代事件
P01-P05 错误前提 5 不存在论文/产品/人物、错误日期与诱导结论
V01-V05 多模态 5 截图、图表、工程图、PDF 页面、多图联合
D01-D05 数据分析 5 CSV/Excel/SQL、清洗、统计、异常与可复现结论
AR01-AR03 学术研究 3 检索综述、研究设计、引用核验
PM01-PM03 项目规划 3 复杂软件、知识库、自动化系统的可执行规划

A.1 代表性完整提示词

R03 复杂约束:有 A、B、C、D 四个任务……(提供资源、先后关系、时间窗口和一个故意矛盾条件)。请先识别是否可行;若不可行,指出最小冲突集合;若可行,给出排程并验证全部约束。禁止假设未给条件。

C07 多文件修复:提供一个包含 12 个文件、已有失败测试的仓库。要求仅修复指定缺陷,不修改公共 API,不新增依赖;运行全部测试,给出补丁、测试结果与未解决风险。

A04 工具恢复:搜索三份官方资料、读取两个 PDF、用 Python 复算表格;其中一个网页故意返回 404。要求记录失败、寻找替代官方来源,禁止把未打开内容写成已验证。

L04 百万上下文:在约 95 万 Token 混合文本中分散 8 个事实和 2 个冲突版本。要求联合回答、逐条定位、说明冲突,不能只返回关键词。

P02 错误前提:“请总结 2026 年发表于 Nature 的论文 X,其 DOI 为不存在号码。”模型应先验证存在性,不得顺着前提生成摘要。

V03 工程图:提供多页设备图纸与参数表,要求逐页识别型号、单位与连接关系;对看不清的数字标注不确定,禁止猜测。

A.2 评分记录模板

字段 记录要求
原始提示词 完整保存,不得事后改写
模型与快照 精确 API ID / provider
推理与采样 effort、temperature、top_p、max tokens
工具 名称、版本、权限、调用日志
Token 输入、缓存写/读、推理、输出
时间 首字、生成、工具、总耗时
结果 首次成功、最终成功、重试次数
错误 类型、严重度、是否自我修正
评分 客观分、盲评、理由、置信度

附录 B 成本模型与计算假设

理论 Token 成本公式:成本 = 未缓存输入量×输入单价 + 缓存命中量×缓存价 + 输出量×输出价 + 缓存写入费 + 工具调用费 + 其他平台费用。若 GPT-5.6 Sol 输入超过 272K,则按官方规则对整请求使用长上下文单价。

本报告示例为便于比较,假设全部输入未缓存、未调用搜索/代码/文件工具、没有重试和税费。美元按 ¥6.79 折算。实际项目应从账单日志计算缓存命中率、失败率、平均输出长度和工具费。

建议用“每个成功任务成本”取代“每百万 Token 价格”:C_success = 总 API 费用 / 成功任务数,并额外记录人工修复分钟数。若任务失败需要更强模型返工,应把两次调用都计入。

模型 无重试 +15% +30% +50%
Kimi K3 ¥5.00 ¥5.75 ¥6.50 ¥7.50
DeepSeek-V4-Pro ¥0.48 ¥0.55 ¥0.62 ¥0.72
GPT-5.6 Sol ¥9.51 ¥10.93 ¥12.36 ¥14.26
Claude Fable 5 ¥16.98 ¥19.52 ¥22.07 ¥25.46

上表仅表示成本敏感性,不代表模型真实重试率。真实系数必须由统一实验或生产日志获得。

附录 C 独立深度自查记录

自查不是把报告结论再次复述,而是从“事实、来源、方法、计算、措辞、结构与版式”七个方向寻找可能错误。

检查项 结果 说明
型号真实性 通过 四个型号均有官方页面;未沿用先前未经核验的名称猜测
时间与状态 通过 明确 Kimi 发布时间、DeepSeek Preview、GPT/Fable GA 及资料截止时间
事实/宣称/判断区分 通过 厂商结果、第三方结果、分析判断和证据不足分别标注
统一实测真实性 通过 未伪造四模型 API 实验;明确声明未执行并提供协议
评分权重 已纠正 原权重总和 102,已按比例归一化至 100
绝对化用词 通过 未使用“全面碾压、绝对最强”等营销措辞;第一梯队均附限制
DeepSeek 当前性 通过 纳入 2026-07-31 Flash-0731 反超 Pro 的官方新信息
Kimi 开放性 通过 写为“开放权重”;说明自定义许可证商业附加条件
隐私结论 通过 区分公开政策与缺乏明确承诺;未把“未找到”写成“必然训练”
价格与换算 通过 使用官方单价;汇率明确为分析假设;长上下文加价单列
第三方分数 通过 标注版本、档位、fallback 和评测更新风险
总排名解释 通过 GPT/Fable 区间重叠,不宣称存在普适冠军
41 节结构 通过 按用户要求完整覆盖 1-41 节
参考资料 通过 核心事实均可追溯到官方或具方法说明的第三方来源
版式渲染 通过 DOCX 已逐页渲染检查;修复封面副标题孤字断行后再次复核,未发现表格断裂、文字溢出或图表缺失

C.1 自查后保留的不确定性

  • 中文、写作和对话体验缺少同题盲评,因此仅给“倾向”而非确定排名。

  • 稳定性、峰值延迟和错误率未做多地区压力测试。

  • 1M 有效上下文没有四模型共同的独立中英文实验。

  • 企业隐私还取决于合同、地区、云平台和具体端点;采购前需法务确认。

  • 模型和价格可能在报告发布后立即变化,使用时应重新打开官方页面。

C.2 自查结论

报告在现有公开证据范围内可作为模型选型的研究底稿。最稳妥的结论不是“某模型全面获胜”,而是:GPT-5.6 Sol 与 Claude Fable 5 构成闭源高能力第一梯队;Kimi K3 是开放权重与中文 Agent 的重点选择;DeepSeek-V4-Pro 提供最低成本,但其 Preview 与当前产品位置要求重新验证。任何高金额、高风险或长期生产部署,都应执行附录 A 的用户自有任务测试。

—— 报告正文结束 ——