更新说明(2026-07-30):本次更新使用统一的九类任务重新测试六款广受关注的主流 AI 助手,并重做评分、速度观察、适用场景与最终结论。
测试范围:本文测的是聊天产品的网页版,六款统一用免费账号访问,所以结论覆盖的是「打开产品直接用」这一层,不是付费档位、也不是 API 或底层模型跑分。想看模型层的推理、长上下文与成本对比,见面向工程师的 LLM 模型选型横评;只关心国内产品的读者可看国内 AI 工具横评。
结论先说:同一套 9 类任务跑完后,内容质量分依次是 Kimi 93、ChatGPT 82、Claude 75、Gemini 73、DeepSeek 69、GLM-5.2 69。但这不等于“Kimi 无条件第一”:它多道题等待 1–3 分钟,联网题经历长时间搜索,页面还在高峰期自动降级到 K2.6 快速。ChatGPT 不是最高分,却是本轮质量、速度和稳定性最均衡的通用选择。
六款产品各有明确短板。Gemini 的图表、代码和多轮改写不错,PDF 却漏掉关键限定,免费额度用尽后还自动回落到 Flash-Lite;Claude 表达和调试稳定,但两次没有守住字数;DeepSeek 的并发代码满分,图表题却虚构 Team C;GLM-5.2 的文本与代码几乎全对,上传 PDF 后却回答了完全无关的项目。Kimi 最终答案质量最高,但不能把“答得对”与“高峰期能按时交付”混为一谈。
这不是底层模型排行榜。它回答的是一个更实际的问题:普通用户打开这些聊天产品后,面对写作、文件、图表、联网和代码任务,哪一个更可靠?
30 秒选型:先按任务选,不要只看总分
| 你的主要需求 | 优先考虑 | 本轮需要注意 |
|---|---|---|
| 默认日常使用,速度与稳定性优先 | ChatGPT | 联网研究仍要逐条核对来源 |
| 最终答案质量优先,可以等待 | Kimi | 多题等待 1–3 分钟,高峰时会降级 |
| 快速文本、抽取与独立代码生成 | DeepSeek | 图表和限定来源的联网题风险较高 |
| 图表、代码与严格多轮改写 | Gemini | 免费额度用尽后可能回落到轻量模型 |
| 表达、解释与 React 调试 | Claude | 容易超过指定字数 |
| 纯文本与代码,且愿意核验文件上下文 | GLM-5.2(Z.ai) | 本轮 PDF 串档、Agent 高峰失败 |
如果正在两款之间犹豫,可继续看站内的 ChatGPT vs Claude、ChatGPT vs Gemini、Claude vs Gemini 和 DeepSeek vs Kimi 一对一对比。
测试环境准备
六款产品统一使用同一台 MacBook、macOS 26.5.1、Chrome 150 和同一个洛杉矶网络出口访问,均为免费账号。每题使用新会话,只有多轮修改题回到写作题的原会话。
| 产品 | 本次实际界面状态 | 联网题 | 其他题 |
|---|---|---|---|
| ChatGPT | Free;界面未披露底层模型 | 手动开启网页搜索 | 关闭搜索,按默认模式 |
| Claude | Free;界面显示 Sonnet 5 Medium | 开启 Web search | 关闭 Web search;Memory 暂停 |
| DeepSeek | 网页免费版;快速模式,未披露底层模型 | 开启智能搜索 | 关闭智能搜索与深度思考 |
| Gemini | 无 AI 付费计划;01–03 复测时仅 3.5 Flash-Lite 可用;04–09 开始时为 3.1 Pro | 使用产品内联网能力 | 3.1 Pro 与 3.6 Flash 达到免费上限后自动回落到 Flash-Lite |
| Z.ai | 已登录网页;常规题显示 GLM-5.2、深度思考“最高” | GLM-5.2 Agent 高峰失败;改用 GLM-5-Turbo 后工具调用超时 | Chat 模式完成其余八题 |
| Kimi | 已登录网页;高峰时自动切到 K2.6 快速 | 常规联网模式最终完成;深度研究曾排队失败 | 快速模式完成其余八题 |
这里特意记录“产品界面显示什么”,而没有擅自把 ChatGPT、Claude、DeepSeek 的产品名等同于某个 API 模型。聊天产品可能动态路由模型,也可能随账号、地区、容量和发布时间变化。官方页面也明确提示免费额度和模型可用性会调整:ChatGPT 套餐说明、Claude Pro 地区价格说明、Gemini Apps 限额说明。
评分方法:能力分与速度分开
总分 100,九类任务权重如下:中文写作 12、JSON 抽取 10、约束规划 10、联网研究 14、TypeScript 代码 16、React Debug 14、PDF 阅读 12、图表理解 7、多轮修改 5。
数字、JSON、约束与图表按答案键核验;代码检查并发上限、错误传播、取消、竞态和 HTTP 错误;写作与研究题检查事实边界、结构和来源纪律。速度、订阅价格、额度与地区可用性单独展示,不折算成能力分。
为便于第三方复核,我们已将九道完整提示词、两份测试附件、固定题答案键、归档版评分细则、逐题得分、54 个“产品 × Case”证据状态和脱敏截图公开在 GitHub 复核资料包。资料包同时明确记录限制:目前没有保存六款产品 54 次回答的完整可复制原文,评分细则也是测试后整理而非预注册。因此,公开材料提高了可追溯性,但不能把这次实测描述成完全可复现的实验。
| Case | 权重 | ChatGPT | Claude | DeepSeek | Gemini | GLM-5.2 | Kimi |
|---|---|---|---|---|---|---|---|
| 01 中文写作 | 12 | 8 | 8 | 7 | 8 | 12 | 12 |
| 02 JSON 抽取 | 10 | 10 | 10 | 10 | 10 | 10 | 10 |
| 03 约束规划 | 10 | 10 | 9 | 9 | 4 | 10 | 10 |
| 04 联网研究 | 14 | 4 | 2 | 1 | 4 | 0 | 7 |
| 05 TypeScript 代码 | 16 | 13 | 12 | 16 | 16 | 16 | 16 |
| 06 React Debug | 14 | 14 | 14 | 9 | 12 | 14 | 14 |
| 07 PDF 阅读 | 12 | 12 | 10 | 12 | 7 | 0 | 12 |
| 08 图表理解 | 7 | 7 | 7 | 2 | 7 | 4 | 7 |
| 09 多轮修改 | 5 | 4 | 3 | 3 | 5 | 3 | 5 |
| 总分 | 100 | 82 | 75 | 69 | 73 | 69 | 93 |
分数不是“智商值”,也不包含速度和高峰可用性。例如 Kimi 的答案分最高,却是本轮等待最久的产品之一;DeepSeek 在代码生成题满分,却因联网和图表两道高风险任务失分;GLM-5.2 与 DeepSeek 同为 69 分,失分原因却完全不同。
写作、JSON 抽取与约束规划:基础题差距不大
中文写作
六款产品都理解了“不要只看排行榜”的核心事实,也没有使用禁词或编造价格。真正拉开差距的是严格格式:
- ChatGPT 的有效回答出现了 4 个小标题,而题目要求正好 3 个,总长度也未落入 320–380 个汉字。
- Claude 的原始回答结构清楚、类比自然,但长度不足;为恢复隐私窗口中无法保留的上下文,后续多轮题重新跑了一组连续会话,重跑首轮又超出字数。
- DeepSeek 的内容最丰富,但明显超长,而且实际用了 4 个小标题。
- Gemini 有 3 个小标题,但篇幅不足。
- GLM-5.2 与 Kimi 都满足字数、标题、三个小标题、类比和两条建议;Kimi 虽然拿到满分,但完成前进行了数分钟的反复改写。
这道题给出的第一条选型提醒是:“写得好”与“按要求交付”不是一回事。用于 CMS、广告位或固定字数摘要时,后者往往更重要。
JSON 抽取
六款产品全部输出合法 JSON,日期、布尔值、预算拆分、负责人和 null 截止日期均正确,没有夹带解释文字。这是本轮最没有争议的一题。
约束规划
ChatGPT、Claude、DeepSeek、GLM-5.2 与 Kimi 都给出了可执行日程;ChatGPT、GLM-5.2 与 Kimi 得到满分。Claude 重复了一次开场句;DeepSeek 自行给会议加了名称和日期。Gemini Flash-Lite 则出现实质性错误:表格把必须连续的 A、B 拆开,给 A 重复安排时长,还在验证段提出另一套修正时间却没有更新表格,因此只有 4/10。
图 1:Gemini 在验证段发现 B 不应跨午休,却没有修正前面的表格;A、C 和空闲时间也出现前后不一致。
联网研究:六款 AI 都没有完全通过
联网题要求只使用 OpenAI、Google、Anthropic、DeepSeek 官方域名,并为每一行提供直接支持结论的来源。这是本轮最难的一题,也是最能暴露“看起来像研究”与“真正可核验”差别的一题。
图 2:ChatGPT 能给 OpenAI 行提供直接链接,但其余公司缺少逐行官方引用,部分信息也已落后于测试日期。
- ChatGPT:4/14。 OpenAI 行给出了可点击官方链接,但 Google、Anthropic、DeepSeek 行没有满足“每行至少一个官方来源”,而且把旧型号当成截至测试日的最新型号。
- Claude:2/14。 表面上给了大量链接,但 Google 行直接采用了非官方媒体,且出现无法由所列官方页面支持的产品名称与事件。
- DeepSeek:1/14。 搜索了 15 个页面,但来源包含 Yahoo、AI Wiki、云服务商博客、聚合站等,直接违反“只用官方域名”;回答还把预测和非官方消息写进了结论。
- Gemini:4/14。 每行都给了官方链接,但核心型号明显落后于测试日期,仍把 GPT-4o、Gemini 1.5 Pro、Claude 3.5 Sonnet 和 DeepSeek-V3/R1 当成最新结果。
- GLM-5.2:0/14。 Agent 两次因高峰负载无法启动;切到界面推荐的 GLM-5-Turbo 后,代理生成了与任务无关的代码,
web_search工具在 30 秒后超时,最终没有交付表格。 - Kimi:7/14。 常规联网模式最终生成了四行表格,也限定在官方域名,但耗时约 3 分钟;多处 URL 只是文本而非可点击引用,Anthropic 的团队页不能直接支撑模型和价格结论,部分价格还用了“约”或 “from”,所以只拿到一半分数。
图 3:Kimi 是六款中联网题完成度最高的,但来源与具体结论仍不能逐项闭环。
所以,联网回答里最重要的不是引用图标数量,而是逐条检查:来源是不是允许的域名、链接是否真的支持这句话、发布日期是否是事件发生日、产品名与底层模型名是否混淆。
代码能力:写 TypeScript 和改 React 各有胜负
TypeScript 题要求实现带并发上限的 mapLimit。DeepSeek、Gemini、GLM-5.2 与 Kimi 的实现都保持结果顺序、同步校验 limit,首次失败后停止启动新任务,并正确处理已启动 Promise 的拒绝,因此均拿到 16/16。
ChatGPT 与 Claude 的实现主体正确,但都倾向于等已经运行的任务结束后再拒绝外层 Promise,没有严格做到“第一个错误一经观察即拒绝”;Claude 的状态计数写法还更绕,因此分别得到 13/16 和 12/16。
React Hook 调试题则反过来:
- ChatGPT、Claude、GLM-5.2 与 Kimi 都正确加入
[query]依赖、空字符串短路、encodeURIComponent、AbortController、response.ok检查,并阻止旧请求覆盖新结果,均为 14/14。 - Gemini 覆盖了依赖、编码、取消、非 2xx 与
AbortError,但只依赖AbortController,没有额外的旧请求结果忽略标记;在响应与清理竞态下仍有小风险,得到 12/14。 - DeepSeek 在新请求开始时会取消旧请求,但当新
query变为空字符串时先返回,旧控制器没有被及时取消;旧请求仍可能回写状态,因此为 9/14。
如果主要用途是一次性生成独立算法,DeepSeek、Gemini、GLM-5.2 与 Kimi 这轮都很强;如果是修改已有 React 状态逻辑,ChatGPT、Claude、GLM-5.2 与 Kimi 更完整。
PDF 阅读:Kimi、ChatGPT 与 DeepSeek 完整通过,GLM 串档
PDF 题使用一份 8 页的虚构项目报告,要求逐题标页码,并跨页核对指标、成本、口径变更、P0 事故与停止扩量条件。ChatGPT、DeepSeek 与 Kimi 准确找到了:
- 6 月 Web 自动解决率 74.2%、引用覆盖率 95.0%(第 3 页);
- 最大一次性成本为“模型推理与压测”18.6 万元,占 39.1%(第 4 页);
- 事故根因是缓存键遗漏
tenant_id,可能影响 43 条回答,暂停 2 小时 15 分(第 6 页); - 21.12 万元毛节省减去 8.32 万元运营成本,得到每月 12.8 万元净节省;该数字未计一次性投入及摊销。
图 4:ChatGPT 正确给出数字、计算过程和 PDF 页码。
ChatGPT、DeepSeek 与 Kimi 完整满足题目;Claude 的事实和页码正确,但最后要求 120–160 个汉字的总结明显超长,因此扣 2 分。
Gemini 能找出 74.2%、95.0%、18.6 万、39.1% 和 12.8 万元等数字,却把成本项名称写成“文档中未找到”,把 2 小时 15 分缩成“15”,也没说明净节省未包含一次性投入及摊销,因此只有 7/12。GLM-5.2 更严重:上传框显示了正确文件名,回答却变成完全无关的“Safe Train 6724”项目,记 0/12。
图 5:Gemini 能读到多数数字,但缺少成本名称、事故单位和排除项,不能当作完整的项目结论。
图表理解:DeepSeek 出现本轮最严重幻觉
图表包含 Team A、Team B 的 1–6 月完成率,并明确标出 4 月起切换到 evaluation set v2。正确答案包括:3 月 A=71%、B=67%;6 月 A=82%、B=79%;方法变化前最大环比为 A 在 1→2 月提升 6 个百分点;6 月 A 比 B 高 3 个百分点,相对提升约 3.8%。
ChatGPT、Claude、Gemini 与 Kimi 全部识别正确,也能把“图中直接可见事实”和“计算或推断”分开。
图 6:Gemini 正确读出四个关键值、最大单月提升和 3.8% 相对提升,并识别评估集切换。
图 7:DeepSeek 正确抄录了题目点名的四个数值,却声称图中存在 Team C,并漏掉清晰可见的 v2 方法变更标记。
DeepSeek 不仅说“图中未标明方法变化”,还凭空列出 Team C 的六个月数据。这类错误比普通计算失误更危险:答案很完整、语气很确定,但依据并不存在。处理财务图、实验图或运营看板时,应该把“是否出现图中没有的系列、标签或注释”列为人工复核项。
图 8:Claude 正确识别 4 月评测集变化,并解释为什么 3→4 月不可直接比较。
GLM-5.2 正确读出 6 月 A=82%、B=79%,也算对 3 个百分点和约 3.8%,但把 3 月数据误读为 A=68%、B=63%,又把累计提升当成单月环比,只得 4/7。Kimi 七个检查点全部通过。
多轮修改:只有 Kimi 与 Gemini 完整通过
第二轮把读者从普通用户改成企业 AI 采购负责人,要求删除生活化类比、保留三个小标题、加入测试公平性或版本变化提示,并把总长度压到 180–220 个汉字。
六款都保留了原素材事实,删除了类比,没有添加具体排名、价格或市场份额,也加入了版本风险提示。但按“标题、小标题与正文整体计数”:
- ChatGPT 为约 244 字,最接近上限;
- Claude 约 301 字;
- DeepSeek 约 308 字。
- Gemini 为 199 字,Kimi 为 211 字,均保留三个小标题并完整通过。
- GLM-5.2 的内容和风险提示正确,但三个小标题结构不够明确,得到 3/5。
因此只有 Gemini 与 Kimi 完整通过。多轮会话能记住主题,不代表能自动消解新旧约束;对字数、字段、模板这类硬限制,最好在输出后增加程序校验。
Kimi、GLM-5.2 与 Agent 模式:能力和可用性一起看
对 Kimi 与 GLM-5.2 的评测采用相同题目和评分口径,同时检查两个层面:常规聊天能力是否可靠,以及产品宣传的 Agent/深度研究在免费账号、高峰时段能否真正启动。
GLM-5.2:文本与代码很强,文件题出现不可接受的串档
Z.ai 的常规 Chat 模式在写作、JSON、排程、TypeScript 和 React Debug 五题全部拿到满分。写作题符合 320–380 字、三个小标题、类比和两条建议;JSON 与规划没有事实或约束错误;两道代码题也正确处理了并发、拒绝、取消、竞态和非 2xx 状态。多轮题保留了事实、读者变化和版本风险提示,但没有明确保留三个小标题,得到 3/5。
真正的问题出在文件理解。上传测试 PDF 后,界面正确显示文件名 case07_northstar_report.pdf,但 GLM-5.2 随后输出了一个完全无关的“Safe Train 6724:三只羊”项目完成报告,包含 82 篇知识库文档、四个角色等 PDF 中不存在的信息。这不是页码或数字抄错,而是整份上下文串到无关内容,因此 PDF 题为 0/12。
图 9:上传文件名正确,但回答内容与测试 PDF 完全无关;这类串档错误不应通过“部分正确”弱化。
图表题表现好一些:GLM-5.2 正确读出 6 月 A=82%、B=79%,也算对 3 个百分点和约 3.8% 的相对提升,并识别了 4 月切换 evaluation set v2。但它把清晰标注的 3 月数据误读为 A=68%、B=63%,还把“1 月到 3 月累计提升”当成“最大单月环比”,所以只得 4/7。
图 10:GLM-5.2 算对了 6 月差值和相对提升,却把 3 月的 A=71%、B=67% 读成 A=68%、B=63%。
Kimi:内容质量第一,交付速度却是最大短板
Kimi 九题全部完成,写作、JSON、规划、两道代码、PDF、图表和多轮修改都拿到满分。它不仅能从 PDF 跨页找齐数字、页码和成本排除项,图表题也完整区分了可见事实与计算结论。唯一明显失分是联网研究:最终表格结构完整,但引用并非都可点击,部分来源不能直接支持同一行的模型、日期与价格。
问题在等待体验。写作题经过超过 3 分钟的反复计算才交付最终成稿;TypeScript、React、PDF、图表和多轮改写也多次等待约 1–3 分钟。页面还明确提示“高峰时段算力不足,已切换至 K2.6 快速”。所以 93/100 代表答案质量最高,不代表它是最适合有截止时间任务的产品。
图 11:Kimi 已形成可用草稿后仍继续计算字数和替换术语,最终答案正确,但等待成本很高。
Agent 模式:功能入口很多,不等于当下可执行
两家都把 Agent 做成独立产品入口。Z.ai 的 Agent 模式提供聊天应用、全栈开发、智能写作、数据洞察,并可连接飞书或微信;Kimi 则提供集群、深度研究、文档、网站、表格、Kimi Work、Kimi Code 与 Kimi Claw。
实际用同一份官方来源研究题启动时,Z.ai Agent 返回“当前模型使用人数较多”,要求稍后再试或切到 GLM-5-Turbo;切换后,代理的 web_search 工具仍然超时。Kimi 深度研究曾提示聊天人数过多,会员可进入优先队列;改用常规联网聊天后才完成表格。因此 Agent 入口本身不单独加分,联网题只按实际交付结果评分。
图 12:Z.ai Agent 提示“当前模型使用人数较多”,研究任务两次没有启动。
图 13:Kimi 深度研究提示聊天人数过多,会员可进入优先队列;免费账号只能退回常规联网聊天。
图 14:切到 GLM-5-Turbo 后,代理的 `web_search` 工具在 30 秒后超时,最终没有交付表格。
Agent 测试给出的结论很直接:Agent 的价值不只看能调用多少工具,还要看任务能否启动、排队是否可接受、上传文件是否真的进入正确上下文,以及失败时是否能明确恢复。免费版高峰时,Kimi 需要退回常规聊天,GLM 则没有完成研究。
速度观察:同设备下的近似耗时
前四题由用户手动计时,后续桌面题由浏览器操作记录近似完成时间。网络波动、平台排队、上传和页面渲染都会影响结果,所以这里只比较体验量级,不给六款产品硬排精确速度名次。
| 产品 | 本轮可比较的计时记录 | 额外观察 |
|---|---|---|
| ChatGPT | 写作 8 秒;JSON 3 秒;规划 14 秒;联网约 14 秒 | 整轮没有出现分钟级等待 |
| Claude | 写作 35 秒;JSON 7 秒;规划 18 秒;联网未可靠计时 | 前三道纯文本题中整体慢于 ChatGPT 与 DeepSeek |
| DeepSeek | 写作 6 秒;JSON 2 秒;规划 5 秒;联网 10 秒 | 前三道纯文本题最快 |
| Gemini | 写作约 15 秒;JSON 约 12 秒;规划约 15 秒;联网未可靠计时 | 后续桌面题多为 30–60 秒,PDF 约 80 秒 |
| GLM-5.2 | 多数纯文本题约十几到二十多秒;联网没有有效交付 | Agent 高峰无法启动,改用 GLM-5-Turbo 后工具仍超时 |
| Kimi | JSON 约 30 秒;规划约 1 分钟;联网约 3 分钟;写作超过 3 分钟 | 代码、PDF、图表和多轮修改也多次等待约 1–3 分钟 |
DeepSeek 在短文本任务上最快,ChatGPT 的速度与稳定性最均衡,Kimi 则以明显更长的等待换来最高答案分。Gemini 完成多轮题后从 Pro 自动回落到 Flash-Lite,也说明免费额度本身就是体验变量。对于 Agent,最重要的速度指标不只是“生成用了几秒”,还包括任务能否开始并最终交付。
六款 AI 分别适合谁
优先选 ChatGPT 的情况
你经常需要在同一个产品里处理文件、图表、代码调试和多轮修改,希望少踩明显错误。它在本轮综合最稳,但联网研究仍需人工核对来源,免费版还会受容量与功能限制。想先看它和另外两家的逐项差异,可以看 ChatGPT vs Claude 与 ChatGPT vs Gemini,产品档位与访问方式见 ChatGPT 工具页。
优先选 Claude 的情况
你重视中文表达、解释清晰度和 React/TypeScript 代码阅读。Claude 的 PDF 与图表事实准确,缺点是容易写得超过指定长度;需要固定版式时,最好加字数和结构检查。延伸阅读:Claude 工具页、Claude vs Gemini。
优先选 DeepSeek 的情况
你主要做中文问答、结构化抽取、排程和独立代码生成,而且看重响应速度。遇到图表、外部事实或必须限定来源的任务,不应单独依赖这次测试中的快速模式结果。延伸阅读:DeepSeek 工具页、DeepSeek vs Kimi、DeepSeek vs 通义千问。
优先选 Gemini 的情况
你需要图表理解、代码生成和严格的多轮改写,也能接受免费额度触发后模型自动回落。它的 73 分主要被 Flash-Lite 的规划错误和 PDF 题拉低;上传长文档后要逐项核对名称、单位、条件和排除项,复杂排程也应检查表格与验证段是否一致。延伸阅读:Gemini 工具页、Claude vs Gemini。
优先选 Kimi 的情况
你更看重最终答案质量,任务没有很紧的截止时间,并愿意等待较长思考。Kimi 本轮以 93 分最高,PDF、图表、代码和多轮修改都很完整;但高峰自动降级、深度研究排队和分钟级等待,意味着它不适合作为唯一的即时交付工具。延伸阅读:Kimi 工具页、DeepSeek vs Kimi、Kimi vs 豆包。
优先选 GLM-5.2 的情况
你主要做纯文本、结构化抽取和代码题。GLM-5.2 所在的 Z.ai 产品页显示了它在网页聊天、Agent、文件和代码场景中的定位;本轮文本与代码几乎没有失手,但 PDF 串档意味着上传文件后应先确认内容是否读对,Agent 高峰期也可能无法完成任务。
怎么自己复测:五个步骤和三个常见坑
如果你要照着做,建议遵循这五步:
- 先固定账号档位、设备、网络出口、模型选项、思考模式和搜索开关。
- 每题开新会话;多轮题除外,必须回到指定原会话。
- 上传文件后确认文件名和上传完成状态,再开始计时。
- 原样保存回答,不要在评分前替模型修正格式或事实。
- 把价格、额度、速度和能力分拆开;API 与聊天网页也分开评价。
本文公开了测试环境、九题权重、逐题得分、关键答案点和 14 张失败或通过截图;GitHub 资料包进一步提供完整提示词、附件、答案键、评分细则、机器可读分数、18 张现存证据图和缺口清单。截图用于证明本文实际观察到的产品状态,但不是六家全部对话的完整归档;因此分数应理解为 2026 年 7 月 30 日、指定免费账号与界面状态下的一次可解释实测,而不是可以外推到所有账号、地区和后续版本的永久排名。复测时应优先复用相同约束与答案键,不要只复用题目主题。
最常见的坑有三个:把产品名当成底层模型名;看到很多引用就默认研究可靠;用不同设备、网络与思考模式的耗时硬排速度。本文保留这些限制,是为了让结论可复核,而不是制造一个看似精确的“全能冠军”。
最终结论:2026 年该选哪个 AI
这次六款产品的统一能力排名是:Kimi 93、ChatGPT 82、Claude 75、Gemini 73、DeepSeek 69、GLM-5.2 69。Kimi 赢在答案完整度,ChatGPT 赢在综合均衡,Claude 适合表达和调试,Gemini 的图表、代码与多轮能力突出但免费回落后的规划稳定性不足,DeepSeek 适合速度与独立代码,GLM-5.2 适合文本和代码但必须警惕文件串档。
这组结果会受到网络出口与波动、账号权限、产品分配的底层模型、模型版本、使用额度和高峰负载等因素影响。同一问题在不同地区、时间、账号或模型路由下可能得到不同结果。因此,本文排名只代表 2026 年 7 月 30 日当前测试环境下的一次对比,适合作为选型和复测参考,不应理解为长期有效或适用于所有用户的固定结论。
如果只能给普通用户一个默认建议,我仍会选 ChatGPT:它不是能力分冠军,却在本轮没有出现 GLM 的文件串档、DeepSeek 的图表幻觉,也没有 Kimi 那样频繁的分钟级等待。若任务允许等待,并且会人工核对联网来源,Kimi 的最终答案质量更高。真正稳妥的做法不是押注一个冠军,而是让主力工具负责高频任务,再用第二款产品复核联网、文件和图表中的高风险结论。
常见问题(FAQ)
Q:2026 年 AI 哪个最好用?
按本轮 9 类任务的能力总分,Kimi 93 分最高,其后是 ChatGPT 82、Claude 75、Gemini 73、DeepSeek 69、GLM-5.2 69。但「分数最高」和「最好用」不是一回事:Kimi 多道题等待 1–3 分钟,高峰时还会自动降级到 K2.6 快速。如果你要的是一个默认打开就用的产品,ChatGPT 在本轮质量、速度和稳定性上最均衡,也没有出现文件串档或图表幻觉这类高风险错误。
Q:为什么只测网页版,不测 API?
因为这篇回答的是「普通用户打开聊天产品网页版后哪个更可靠」,而不是「哪个底层模型更强」。聊天产品会动态路由模型,还会随账号、地区、容量和发布时间变化——本轮 Gemini 就在免费额度用尽后自动回落到 Flash-Lite,Kimi 在高峰时切到了 K2.6 快速。这些都是网页版真实体验的一部分,却不会出现在 API 评测里。因此文中只记录「产品界面显示什么」,不把产品名等同于某个 API 模型,API 与聊天网页也分开评价。
Q:Kimi 分数最高,为什么最后推荐 ChatGPT?
因为能力分不包含速度和高峰可用性。Kimi 的 93 分代表最终答案质量最高,但它写作题反复改写超过 3 分钟,TypeScript、React、PDF、图表和多轮改写也多次等待 1–3 分钟,深度研究还曾排队失败。ChatGPT 的 82 分虽然更低,却在本轮没有出现 GLM 的 PDF 串档、DeepSeek 的图表幻觉,也没有分钟级等待。任务有截止时间就选 ChatGPT,允许等待且会人工核对来源就选 Kimi。
Q:处理 PDF 和图表,哪一款最可靠?
PDF 题(12 分)满分的是 ChatGPT、DeepSeek 和 Kimi,三者都跨页找齐了数字、页码和「未计一次性投入」这类排除项;Claude 事实正确但总结超长得 10 分,Gemini 漏掉成本名称和事故单位得 7 分,GLM-5.2 因为回答了完全无关的项目记 0 分。图表题(7 分)满分的是 ChatGPT、Claude、Gemini 和 Kimi;DeepSeek 凭空虚构了图中不存在的 Team C,只得 2 分。综合两项,Kimi 和 ChatGPT 最稳。