2026 AI 哪个好用?ChatGPT、Kimi、DeepSeek 等 6 款实测

发布于 更新于 3.6w 查看AI模型实测ChatGPTClaudeDeepSeekGeminiKimiGLMAI Agent2026 AI测评AI工具选型

2026 年主流 AI 聊天产品实测:同一套 9 类任务跑完 ChatGPT、Claude、DeepSeek、Gemini、Kimi 与 GLM,Kimi 答案质量最高,ChatGPT 的速度、质量与稳定性最均衡。

更新说明(2026-07-30):本次更新使用统一的九类任务重新测试六款广受关注的主流 AI 助手,并重做评分、速度观察、适用场景与最终结论。

测试范围:本文测的是聊天产品的网页版,六款统一用免费账号访问,所以结论覆盖的是「打开产品直接用」这一层,不是付费档位、也不是 API 或底层模型跑分。想看模型层的推理、长上下文与成本对比,见面向工程师的 LLM 模型选型横评;只关心国内产品的读者可看国内 AI 工具横评

结论先说:同一套 9 类任务跑完后,内容质量分依次是 Kimi 93ChatGPT 82Claude 75Gemini 73DeepSeek 69GLM-5.2 69。但这不等于“Kimi 无条件第一”:它多道题等待 1–3 分钟,联网题经历长时间搜索,页面还在高峰期自动降级到 K2.6 快速。ChatGPT 不是最高分,却是本轮质量、速度和稳定性最均衡的通用选择。

六款产品各有明确短板。Gemini 的图表、代码和多轮改写不错,PDF 却漏掉关键限定,免费额度用尽后还自动回落到 Flash-Lite;Claude 表达和调试稳定,但两次没有守住字数;DeepSeek 的并发代码满分,图表题却虚构 Team C;GLM-5.2 的文本与代码几乎全对,上传 PDF 后却回答了完全无关的项目。Kimi 最终答案质量最高,但不能把“答得对”与“高峰期能按时交付”混为一谈。

这不是底层模型排行榜。它回答的是一个更实际的问题:普通用户打开这些聊天产品后,面对写作、文件、图表、联网和代码任务,哪一个更可靠?

30 秒选型:先按任务选,不要只看总分

你的主要需求优先考虑本轮需要注意
默认日常使用,速度与稳定性优先ChatGPT联网研究仍要逐条核对来源
最终答案质量优先,可以等待Kimi多题等待 1–3 分钟,高峰时会降级
快速文本、抽取与独立代码生成DeepSeek图表和限定来源的联网题风险较高
图表、代码与严格多轮改写Gemini免费额度用尽后可能回落到轻量模型
表达、解释与 React 调试Claude容易超过指定字数
纯文本与代码,且愿意核验文件上下文GLM-5.2(Z.ai)本轮 PDF 串档、Agent 高峰失败

如果正在两款之间犹豫,可继续看站内的 ChatGPT vs ClaudeChatGPT vs GeminiClaude vs GeminiDeepSeek vs Kimi 一对一对比。

测试环境准备

六款产品统一使用同一台 MacBook、macOS 26.5.1、Chrome 150 和同一个洛杉矶网络出口访问,均为免费账号。每题使用新会话,只有多轮修改题回到写作题的原会话。

产品本次实际界面状态联网题其他题
ChatGPTFree;界面未披露底层模型手动开启网页搜索关闭搜索,按默认模式
ClaudeFree;界面显示 Sonnet 5 Medium开启 Web search关闭 Web search;Memory 暂停
DeepSeek网页免费版;快速模式,未披露底层模型开启智能搜索关闭智能搜索与深度思考
Gemini无 AI 付费计划;01–03 复测时仅 3.5 Flash-Lite 可用;04–09 开始时为 3.1 Pro使用产品内联网能力3.1 Pro 与 3.6 Flash 达到免费上限后自动回落到 Flash-Lite
Z.ai已登录网页;常规题显示 GLM-5.2、深度思考“最高”GLM-5.2 Agent 高峰失败;改用 GLM-5-Turbo 后工具调用超时Chat 模式完成其余八题
Kimi已登录网页;高峰时自动切到 K2.6 快速常规联网模式最终完成;深度研究曾排队失败快速模式完成其余八题

这里特意记录“产品界面显示什么”,而没有擅自把 ChatGPT、Claude、DeepSeek 的产品名等同于某个 API 模型。聊天产品可能动态路由模型,也可能随账号、地区、容量和发布时间变化。官方页面也明确提示免费额度和模型可用性会调整:ChatGPT 套餐说明Claude Pro 地区价格说明Gemini Apps 限额说明

评分方法:能力分与速度分开

总分 100,九类任务权重如下:中文写作 12、JSON 抽取 10、约束规划 10、联网研究 14、TypeScript 代码 16、React Debug 14、PDF 阅读 12、图表理解 7、多轮修改 5。

数字、JSON、约束与图表按答案键核验;代码检查并发上限、错误传播、取消、竞态和 HTTP 错误;写作与研究题检查事实边界、结构和来源纪律。速度、订阅价格、额度与地区可用性单独展示,不折算成能力分。

为便于第三方复核,我们已将九道完整提示词、两份测试附件、固定题答案键、归档版评分细则、逐题得分、54 个“产品 × Case”证据状态和脱敏截图公开在 GitHub 复核资料包。资料包同时明确记录限制:目前没有保存六款产品 54 次回答的完整可复制原文,评分细则也是测试后整理而非预注册。因此,公开材料提高了可追溯性,但不能把这次实测描述成完全可复现的实验。

Case权重ChatGPTClaudeDeepSeekGeminiGLM-5.2Kimi
01 中文写作1288781212
02 JSON 抽取10101010101010
03 约束规划10109941010
04 联网研究14421407
05 TypeScript 代码16131216161616
06 React Debug1414149121414
07 PDF 阅读121210127012
08 图表理解7772747
09 多轮修改5433535
总分100827569736993

分数不是“智商值”,也不包含速度和高峰可用性。例如 Kimi 的答案分最高,却是本轮等待最久的产品之一;DeepSeek 在代码生成题满分,却因联网和图表两道高风险任务失分;GLM-5.2 与 DeepSeek 同为 69 分,失分原因却完全不同。

写作、JSON 抽取与约束规划:基础题差距不大

中文写作

六款产品都理解了“不要只看排行榜”的核心事实,也没有使用禁词或编造价格。真正拉开差距的是严格格式:

  • ChatGPT 的有效回答出现了 4 个小标题,而题目要求正好 3 个,总长度也未落入 320–380 个汉字。
  • Claude 的原始回答结构清楚、类比自然,但长度不足;为恢复隐私窗口中无法保留的上下文,后续多轮题重新跑了一组连续会话,重跑首轮又超出字数。
  • DeepSeek 的内容最丰富,但明显超长,而且实际用了 4 个小标题。
  • Gemini 有 3 个小标题,但篇幅不足。
  • GLM-5.2 与 Kimi 都满足字数、标题、三个小标题、类比和两条建议;Kimi 虽然拿到满分,但完成前进行了数分钟的反复改写。

这道题给出的第一条选型提醒是:“写得好”与“按要求交付”不是一回事。用于 CMS、广告位或固定字数摘要时,后者往往更重要。

JSON 抽取

六款产品全部输出合法 JSON,日期、布尔值、预算拆分、负责人和 null 截止日期均正确,没有夹带解释文字。这是本轮最没有争议的一题。

约束规划

ChatGPT、Claude、DeepSeek、GLM-5.2 与 Kimi 都给出了可执行日程;ChatGPT、GLM-5.2 与 Kimi 得到满分。Claude 重复了一次开场句;DeepSeek 自行给会议加了名称和日期。Gemini Flash-Lite 则出现实质性错误:表格把必须连续的 A、B 拆开,给 A 重复安排时长,还在验证段提出另一套修正时间却没有更新表格,因此只有 4/10。

Gemini Flash-Lite 规划表与验证段互相矛盾

Gemini Flash-Lite 规划表与验证段互相矛盾

图 1:Gemini 在验证段发现 B 不应跨午休,却没有修正前面的表格;A、C 和空闲时间也出现前后不一致。

联网研究:六款 AI 都没有完全通过

联网题要求只使用 OpenAI、Google、Anthropic、DeepSeek 官方域名,并为每一行提供直接支持结论的来源。这是本轮最难的一题,也是最能暴露“看起来像研究”与“真正可核验”差别的一题。

ChatGPT 免费版联网研究回答截图

ChatGPT 免费版联网研究回答截图

图 2:ChatGPT 能给 OpenAI 行提供直接链接,但其余公司缺少逐行官方引用,部分信息也已落后于测试日期。

  • ChatGPT:4/14。 OpenAI 行给出了可点击官方链接,但 Google、Anthropic、DeepSeek 行没有满足“每行至少一个官方来源”,而且把旧型号当成截至测试日的最新型号。
  • Claude:2/14。 表面上给了大量链接,但 Google 行直接采用了非官方媒体,且出现无法由所列官方页面支持的产品名称与事件。
  • DeepSeek:1/14。 搜索了 15 个页面,但来源包含 Yahoo、AI Wiki、云服务商博客、聚合站等,直接违反“只用官方域名”;回答还把预测和非官方消息写进了结论。
  • Gemini:4/14。 每行都给了官方链接,但核心型号明显落后于测试日期,仍把 GPT-4o、Gemini 1.5 Pro、Claude 3.5 Sonnet 和 DeepSeek-V3/R1 当成最新结果。
  • GLM-5.2:0/14。 Agent 两次因高峰负载无法启动;切到界面推荐的 GLM-5-Turbo 后,代理生成了与任务无关的代码,web_search 工具在 30 秒后超时,最终没有交付表格。
  • Kimi:7/14。 常规联网模式最终生成了四行表格,也限定在官方域名,但耗时约 3 分钟;多处 URL 只是文本而非可点击引用,Anthropic 的团队页不能直接支撑模型和价格结论,部分价格还用了“约”或 “from”,所以只拿到一半分数。

Kimi 最终生成的官方来源对比表

Kimi 最终生成的官方来源对比表

图 3:Kimi 是六款中联网题完成度最高的,但来源与具体结论仍不能逐项闭环。

所以,联网回答里最重要的不是引用图标数量,而是逐条检查:来源是不是允许的域名、链接是否真的支持这句话、发布日期是否是事件发生日、产品名与底层模型名是否混淆。

代码能力:写 TypeScript 和改 React 各有胜负

TypeScript 题要求实现带并发上限的 mapLimit。DeepSeek、Gemini、GLM-5.2 与 Kimi 的实现都保持结果顺序、同步校验 limit,首次失败后停止启动新任务,并正确处理已启动 Promise 的拒绝,因此均拿到 16/16。

ChatGPT 与 Claude 的实现主体正确,但都倾向于等已经运行的任务结束后再拒绝外层 Promise,没有严格做到“第一个错误一经观察即拒绝”;Claude 的状态计数写法还更绕,因此分别得到 13/16 和 12/16。

React Hook 调试题则反过来:

  • ChatGPT、Claude、GLM-5.2 与 Kimi 都正确加入 [query] 依赖、空字符串短路、encodeURIComponentAbortControllerresponse.ok 检查,并阻止旧请求覆盖新结果,均为 14/14。
  • Gemini 覆盖了依赖、编码、取消、非 2xx 与 AbortError,但只依赖 AbortController,没有额外的旧请求结果忽略标记;在响应与清理竞态下仍有小风险,得到 12/14。
  • DeepSeek 在新请求开始时会取消旧请求,但当新 query 变为空字符串时先返回,旧控制器没有被及时取消;旧请求仍可能回写状态,因此为 9/14。

如果主要用途是一次性生成独立算法,DeepSeek、Gemini、GLM-5.2 与 Kimi 这轮都很强;如果是修改已有 React 状态逻辑,ChatGPT、Claude、GLM-5.2 与 Kimi 更完整。

PDF 阅读:Kimi、ChatGPT 与 DeepSeek 完整通过,GLM 串档

PDF 题使用一份 8 页的虚构项目报告,要求逐题标页码,并跨页核对指标、成本、口径变更、P0 事故与停止扩量条件。ChatGPT、DeepSeek 与 Kimi 准确找到了:

  • 6 月 Web 自动解决率 74.2%、引用覆盖率 95.0%(第 3 页);
  • 最大一次性成本为“模型推理与压测”18.6 万元,占 39.1%(第 4 页);
  • 事故根因是缓存键遗漏 tenant_id,可能影响 43 条回答,暂停 2 小时 15 分(第 6 页);
  • 21.12 万元毛节省减去 8.32 万元运营成本,得到每月 12.8 万元净节省;该数字未计一次性投入及摊销。

ChatGPT 免费版 PDF 回答截图

ChatGPT 免费版 PDF 回答截图

图 4:ChatGPT 正确给出数字、计算过程和 PDF 页码。

ChatGPT、DeepSeek 与 Kimi 完整满足题目;Claude 的事实和页码正确,但最后要求 120–160 个汉字的总结明显超长,因此扣 2 分。

Gemini 能找出 74.2%、95.0%、18.6 万、39.1% 和 12.8 万元等数字,却把成本项名称写成“文档中未找到”,把 2 小时 15 分缩成“15”,也没说明净节省未包含一次性投入及摊销,因此只有 7/12。GLM-5.2 更严重:上传框显示了正确文件名,回答却变成完全无关的“Safe Train 6724”项目,记 0/12。

Gemini PDF 回答遗漏关键限定

Gemini PDF 回答遗漏关键限定

图 5:Gemini 能读到多数数字,但缺少成本名称、事故单位和排除项,不能当作完整的项目结论。

图表理解:DeepSeek 出现本轮最严重幻觉

图表包含 Team A、Team B 的 1–6 月完成率,并明确标出 4 月起切换到 evaluation set v2。正确答案包括:3 月 A=71%、B=67%;6 月 A=82%、B=79%;方法变化前最大环比为 A 在 1→2 月提升 6 个百分点;6 月 A 比 B 高 3 个百分点,相对提升约 3.8%。

ChatGPT、Claude、Gemini 与 Kimi 全部识别正确,也能把“图中直接可见事实”和“计算或推断”分开。

Gemini 正确读取图表数据与方法变化

Gemini 正确读取图表数据与方法变化

图 6:Gemini 正确读出四个关键值、最大单月提升和 3.8% 相对提升,并识别评估集切换。

DeepSeek 免费网页版图表回答截图

DeepSeek 免费网页版图表回答截图

图 7:DeepSeek 正确抄录了题目点名的四个数值,却声称图中存在 Team C,并漏掉清晰可见的 v2 方法变更标记。

DeepSeek 不仅说“图中未标明方法变化”,还凭空列出 Team C 的六个月数据。这类错误比普通计算失误更危险:答案很完整、语气很确定,但依据并不存在。处理财务图、实验图或运营看板时,应该把“是否出现图中没有的系列、标签或注释”列为人工复核项。

Claude 免费版图表回答截图

Claude 免费版图表回答截图

图 8:Claude 正确识别 4 月评测集变化,并解释为什么 3→4 月不可直接比较。

GLM-5.2 正确读出 6 月 A=82%、B=79%,也算对 3 个百分点和约 3.8%,但把 3 月数据误读为 A=68%、B=63%,又把累计提升当成单月环比,只得 4/7。Kimi 七个检查点全部通过。

多轮修改:只有 Kimi 与 Gemini 完整通过

第二轮把读者从普通用户改成企业 AI 采购负责人,要求删除生活化类比、保留三个小标题、加入测试公平性或版本变化提示,并把总长度压到 180–220 个汉字。

六款都保留了原素材事实,删除了类比,没有添加具体排名、价格或市场份额,也加入了版本风险提示。但按“标题、小标题与正文整体计数”:

  • ChatGPT 为约 244 字,最接近上限;
  • Claude 约 301 字;
  • DeepSeek 约 308 字。
  • Gemini 为 199 字,Kimi 为 211 字,均保留三个小标题并完整通过。
  • GLM-5.2 的内容和风险提示正确,但三个小标题结构不够明确,得到 3/5。

因此只有 Gemini 与 Kimi 完整通过。多轮会话能记住主题,不代表能自动消解新旧约束;对字数、字段、模板这类硬限制,最好在输出后增加程序校验。

Kimi、GLM-5.2 与 Agent 模式:能力和可用性一起看

对 Kimi 与 GLM-5.2 的评测采用相同题目和评分口径,同时检查两个层面:常规聊天能力是否可靠,以及产品宣传的 Agent/深度研究在免费账号、高峰时段能否真正启动。

GLM-5.2:文本与代码很强,文件题出现不可接受的串档

Z.ai 的常规 Chat 模式在写作、JSON、排程、TypeScript 和 React Debug 五题全部拿到满分。写作题符合 320–380 字、三个小标题、类比和两条建议;JSON 与规划没有事实或约束错误;两道代码题也正确处理了并发、拒绝、取消、竞态和非 2xx 状态。多轮题保留了事实、读者变化和版本风险提示,但没有明确保留三个小标题,得到 3/5。

真正的问题出在文件理解。上传测试 PDF 后,界面正确显示文件名 case07_northstar_report.pdf,但 GLM-5.2 随后输出了一个完全无关的“Safe Train 6724:三只羊”项目完成报告,包含 82 篇知识库文档、四个角色等 PDF 中不存在的信息。这不是页码或数字抄错,而是整份上下文串到无关内容,因此 PDF 题为 0/12。

GLM-5.2 上传正确 PDF 后回答了无关项目

GLM-5.2 上传正确 PDF 后回答了无关项目

图 9:上传文件名正确,但回答内容与测试 PDF 完全无关;这类串档错误不应通过“部分正确”弱化。

图表题表现好一些:GLM-5.2 正确读出 6 月 A=82%、B=79%,也算对 3 个百分点和约 3.8% 的相对提升,并识别了 4 月切换 evaluation set v2。但它把清晰标注的 3 月数据误读为 A=68%、B=63%,还把“1 月到 3 月累计提升”当成“最大单月环比”,所以只得 4/7。

GLM-5.2 图表题回答截图

GLM-5.2 图表题回答截图

图 10:GLM-5.2 算对了 6 月差值和相对提升,却把 3 月的 A=71%、B=67% 读成 A=68%、B=63%。

Kimi:内容质量第一,交付速度却是最大短板

Kimi 九题全部完成,写作、JSON、规划、两道代码、PDF、图表和多轮修改都拿到满分。它不仅能从 PDF 跨页找齐数字、页码和成本排除项,图表题也完整区分了可见事实与计算结论。唯一明显失分是联网研究:最终表格结构完整,但引用并非都可点击,部分来源不能直接支持同一行的模型、日期与价格。

问题在等待体验。写作题经过超过 3 分钟的反复计算才交付最终成稿;TypeScript、React、PDF、图表和多轮改写也多次等待约 1–3 分钟。页面还明确提示“高峰时段算力不足,已切换至 K2.6 快速”。所以 93/100 代表答案质量最高,不代表它是最适合有截止时间任务的产品

Kimi 写作题长时间停留在思考过程

Kimi 写作题长时间停留在思考过程

图 11:Kimi 已形成可用草稿后仍继续计算字数和替换术语,最终答案正确,但等待成本很高。

Agent 模式:功能入口很多,不等于当下可执行

两家都把 Agent 做成独立产品入口。Z.ai 的 Agent 模式提供聊天应用、全栈开发、智能写作、数据洞察,并可连接飞书或微信;Kimi 则提供集群、深度研究、文档、网站、表格、Kimi Work、Kimi Code 与 Kimi Claw。

实际用同一份官方来源研究题启动时,Z.ai Agent 返回“当前模型使用人数较多”,要求稍后再试或切到 GLM-5-Turbo;切换后,代理的 web_search 工具仍然超时。Kimi 深度研究曾提示聊天人数过多,会员可进入优先队列;改用常规联网聊天后才完成表格。因此 Agent 入口本身不单独加分,联网题只按实际交付结果评分。

GLM-5.2 Agent 高峰时无法执行任务

GLM-5.2 Agent 高峰时无法执行任务

图 12:Z.ai Agent 提示“当前模型使用人数较多”,研究任务两次没有启动。

Kimi 深度研究高峰时进入排队提示

Kimi 深度研究高峰时进入排队提示

图 13:Kimi 深度研究提示聊天人数过多,会员可进入优先队列;免费账号只能退回常规联网聊天。

GLM-5-Turbo Agent 的搜索工具超时

GLM-5-Turbo Agent 的搜索工具超时

图 14:切到 GLM-5-Turbo 后,代理的 `web_search` 工具在 30 秒后超时,最终没有交付表格。

Agent 测试给出的结论很直接:Agent 的价值不只看能调用多少工具,还要看任务能否启动、排队是否可接受、上传文件是否真的进入正确上下文,以及失败时是否能明确恢复。免费版高峰时,Kimi 需要退回常规聊天,GLM 则没有完成研究。

速度观察:同设备下的近似耗时

前四题由用户手动计时,后续桌面题由浏览器操作记录近似完成时间。网络波动、平台排队、上传和页面渲染都会影响结果,所以这里只比较体验量级,不给六款产品硬排精确速度名次。

产品本轮可比较的计时记录额外观察
ChatGPT写作 8 秒;JSON 3 秒;规划 14 秒;联网约 14 秒整轮没有出现分钟级等待
Claude写作 35 秒;JSON 7 秒;规划 18 秒;联网未可靠计时前三道纯文本题中整体慢于 ChatGPT 与 DeepSeek
DeepSeek写作 6 秒;JSON 2 秒;规划 5 秒;联网 10 秒前三道纯文本题最快
Gemini写作约 15 秒;JSON 约 12 秒;规划约 15 秒;联网未可靠计时后续桌面题多为 30–60 秒,PDF 约 80 秒
GLM-5.2多数纯文本题约十几到二十多秒;联网没有有效交付Agent 高峰无法启动,改用 GLM-5-Turbo 后工具仍超时
KimiJSON 约 30 秒;规划约 1 分钟;联网约 3 分钟;写作超过 3 分钟代码、PDF、图表和多轮修改也多次等待约 1–3 分钟

DeepSeek 在短文本任务上最快,ChatGPT 的速度与稳定性最均衡,Kimi 则以明显更长的等待换来最高答案分。Gemini 完成多轮题后从 Pro 自动回落到 Flash-Lite,也说明免费额度本身就是体验变量。对于 Agent,最重要的速度指标不只是“生成用了几秒”,还包括任务能否开始并最终交付

六款 AI 分别适合谁

优先选 ChatGPT 的情况

你经常需要在同一个产品里处理文件、图表、代码调试和多轮修改,希望少踩明显错误。它在本轮综合最稳,但联网研究仍需人工核对来源,免费版还会受容量与功能限制。想先看它和另外两家的逐项差异,可以看 ChatGPT vs ClaudeChatGPT vs Gemini,产品档位与访问方式见 ChatGPT 工具页

优先选 Claude 的情况

你重视中文表达、解释清晰度和 React/TypeScript 代码阅读。Claude 的 PDF 与图表事实准确,缺点是容易写得超过指定长度;需要固定版式时,最好加字数和结构检查。延伸阅读:Claude 工具页Claude vs Gemini

优先选 DeepSeek 的情况

你主要做中文问答、结构化抽取、排程和独立代码生成,而且看重响应速度。遇到图表、外部事实或必须限定来源的任务,不应单独依赖这次测试中的快速模式结果。延伸阅读:DeepSeek 工具页DeepSeek vs KimiDeepSeek vs 通义千问

优先选 Gemini 的情况

你需要图表理解、代码生成和严格的多轮改写,也能接受免费额度触发后模型自动回落。它的 73 分主要被 Flash-Lite 的规划错误和 PDF 题拉低;上传长文档后要逐项核对名称、单位、条件和排除项,复杂排程也应检查表格与验证段是否一致。延伸阅读:Gemini 工具页Claude vs Gemini

优先选 Kimi 的情况

你更看重最终答案质量,任务没有很紧的截止时间,并愿意等待较长思考。Kimi 本轮以 93 分最高,PDF、图表、代码和多轮修改都很完整;但高峰自动降级、深度研究排队和分钟级等待,意味着它不适合作为唯一的即时交付工具。延伸阅读:Kimi 工具页DeepSeek vs KimiKimi vs 豆包

优先选 GLM-5.2 的情况

你主要做纯文本、结构化抽取和代码题。GLM-5.2 所在的 Z.ai 产品页显示了它在网页聊天、Agent、文件和代码场景中的定位;本轮文本与代码几乎没有失手,但 PDF 串档意味着上传文件后应先确认内容是否读对,Agent 高峰期也可能无法完成任务。

怎么自己复测:五个步骤和三个常见坑

如果你要照着做,建议遵循这五步:

  1. 先固定账号档位、设备、网络出口、模型选项、思考模式和搜索开关。
  2. 每题开新会话;多轮题除外,必须回到指定原会话。
  3. 上传文件后确认文件名和上传完成状态,再开始计时。
  4. 原样保存回答,不要在评分前替模型修正格式或事实。
  5. 把价格、额度、速度和能力分拆开;API 与聊天网页也分开评价。

本文公开了测试环境、九题权重、逐题得分、关键答案点和 14 张失败或通过截图;GitHub 资料包进一步提供完整提示词、附件、答案键、评分细则、机器可读分数、18 张现存证据图和缺口清单。截图用于证明本文实际观察到的产品状态,但不是六家全部对话的完整归档;因此分数应理解为 2026 年 7 月 30 日、指定免费账号与界面状态下的一次可解释实测,而不是可以外推到所有账号、地区和后续版本的永久排名。复测时应优先复用相同约束与答案键,不要只复用题目主题。

最常见的坑有三个:把产品名当成底层模型名;看到很多引用就默认研究可靠;用不同设备、网络与思考模式的耗时硬排速度。本文保留这些限制,是为了让结论可复核,而不是制造一个看似精确的“全能冠军”。

最终结论:2026 年该选哪个 AI

这次六款产品的统一能力排名是:Kimi 93、ChatGPT 82、Claude 75、Gemini 73、DeepSeek 69、GLM-5.2 69。Kimi 赢在答案完整度,ChatGPT 赢在综合均衡,Claude 适合表达和调试,Gemini 的图表、代码与多轮能力突出但免费回落后的规划稳定性不足,DeepSeek 适合速度与独立代码,GLM-5.2 适合文本和代码但必须警惕文件串档。

这组结果会受到网络出口与波动、账号权限、产品分配的底层模型、模型版本、使用额度和高峰负载等因素影响。同一问题在不同地区、时间、账号或模型路由下可能得到不同结果。因此,本文排名只代表 2026 年 7 月 30 日当前测试环境下的一次对比,适合作为选型和复测参考,不应理解为长期有效或适用于所有用户的固定结论。

如果只能给普通用户一个默认建议,我仍会选 ChatGPT:它不是能力分冠军,却在本轮没有出现 GLM 的文件串档、DeepSeek 的图表幻觉,也没有 Kimi 那样频繁的分钟级等待。若任务允许等待,并且会人工核对联网来源,Kimi 的最终答案质量更高。真正稳妥的做法不是押注一个冠军,而是让主力工具负责高频任务,再用第二款产品复核联网、文件和图表中的高风险结论。

常见问题(FAQ)

Q:2026 年 AI 哪个最好用?

按本轮 9 类任务的能力总分,Kimi 93 分最高,其后是 ChatGPT 82、Claude 75、Gemini 73、DeepSeek 69、GLM-5.2 69。但「分数最高」和「最好用」不是一回事:Kimi 多道题等待 1–3 分钟,高峰时还会自动降级到 K2.6 快速。如果你要的是一个默认打开就用的产品,ChatGPT 在本轮质量、速度和稳定性上最均衡,也没有出现文件串档或图表幻觉这类高风险错误。

Q:为什么只测网页版,不测 API?

因为这篇回答的是「普通用户打开聊天产品网页版后哪个更可靠」,而不是「哪个底层模型更强」。聊天产品会动态路由模型,还会随账号、地区、容量和发布时间变化——本轮 Gemini 就在免费额度用尽后自动回落到 Flash-Lite,Kimi 在高峰时切到了 K2.6 快速。这些都是网页版真实体验的一部分,却不会出现在 API 评测里。因此文中只记录「产品界面显示什么」,不把产品名等同于某个 API 模型,API 与聊天网页也分开评价。

Q:Kimi 分数最高,为什么最后推荐 ChatGPT?

因为能力分不包含速度和高峰可用性。Kimi 的 93 分代表最终答案质量最高,但它写作题反复改写超过 3 分钟,TypeScript、React、PDF、图表和多轮改写也多次等待 1–3 分钟,深度研究还曾排队失败。ChatGPT 的 82 分虽然更低,却在本轮没有出现 GLM 的 PDF 串档、DeepSeek 的图表幻觉,也没有分钟级等待。任务有截止时间就选 ChatGPT,允许等待且会人工核对来源就选 Kimi。

Q:处理 PDF 和图表,哪一款最可靠?

PDF 题(12 分)满分的是 ChatGPT、DeepSeek 和 Kimi,三者都跨页找齐了数字、页码和「未计一次性投入」这类排除项;Claude 事实正确但总结超长得 10 分,Gemini 漏掉成本名称和事故单位得 7 分,GLM-5.2 因为回答了完全无关的项目记 0 分。图表题(7 分)满分的是 ChatGPT、Claude、Gemini 和 Kimi;DeepSeek 凭空虚构了图中不存在的 Team C,只得 2 分。综合两项,Kimi 和 ChatGPT 最稳。