AGI 是 Artificial General Intelligence 的缩写,中文一般叫「通用人工智能」。它指的是这样一类系统:不是只在某一件事上很强,而是能在广泛的认知任务上达到人类水平,并且能把在一个领域学到的东西迁移到没见过的新领域。
和它对照的是「窄 AI」(Narrow AI)——下棋很强但不会订机票,识别肿瘤很准但看不懂合同。今天你用到的所有 AI 产品,严格说都还在窄 AI 到通用之间的过渡地带:能力面比十年前宽得多,但离「像人一样什么都能上手」还有明确差距。
先用一句话抓住它
AGI 是「什么活都能接」的智能,而不是「某一项特别强」的智能。
打个职场上的比方。窄 AI 像一台专业设备:数控机床精度极高,但你不能让它去写周报。AGI 更像一个刚入职的聪明同事——他哪一项都不是世界第一,但你交代一件全新的事,他能自己查资料、问清楚、试几次,最后把它做成。能接住没被预设过的任务,才是「通用」的关键。
为什么定义一直定不下来
AGI 没有权威定义,这不是疏忽,而是问题本身很难。不同机构给的门槛差别很大:
- 有的定义偏经济口径,比如 OpenAI 在公司章程里把 AGI 描述为「在大多数有经济价值的工作上超过人类」的高度自主系统。
- 有的定义偏能力分级。Google DeepMind 的研究者提出过一套分层框架,按「能力水平」和「通用程度」两个维度打格子,从「涌现级」到「超人级」分成若干档,主张不该把 AGI 当成一个开关,而应当成一条连续的坡。
- 有的定义偏过程要求,强调必须能自主学习新技能、能长期保持目标,而不只是被训练过的任务做得好。
口径不同,结论就完全不同。同一个模型,按「多数基准测试超过人类平均分」算已经达标,按「能独立完成一个真实岗位的全部职责并对结果负责」算则远远没有。所以看到「AGI 还有几年」这类判断时,先问对方用的是哪个定义,往往比争论年份更有意义。
今天的模型离它差在哪
从能力面看,大语言模型已经覆盖了写作、编程、翻译、分析、图像理解等一大片任务,这在十年前是难以想象的。但几个结构性差距仍然明显。
可靠性:模型在同类任务上的表现波动很大,会在简单问题上翻车,也会自信地编造事实。人类专家的下限比模型稳定得多。
长期自主:把任务的时间跨度拉长——连续工作几小时、几天,中间要保持目标、纠正自己的错误、管理状态——失败率会显著上升。这正是智能体、上下文工程和智能体记忆这些方向在处理的问题。
和 ASI、涌现、奇点的关系
ASI(Artificial Superintelligence,超级智能)指在几乎所有领域全面超过最强人类的系统,是 AGI 之后的假设阶段,目前没有任何实证基础。
涌现能力指模型规模跨过某个门槛后突然具备的新能力。它常被当作通往 AGI 的证据,但后续研究指出,很多所谓「突现」其实是评测指标选择造成的错觉——换成连续指标看,能力是平滑增长的。
缩放定律是「继续加算力就能到 AGI」这一派观点的主要依据。反对意见认为,缩放定律能持续改善的是预测下一个 Token 的能力,而这未必等于持续改善推理、规划和真实世界可靠性。
容易误解的地方
「AGI 是个具体产品,某天会发布」——更可能的是一段模糊的过渡期:某些岗位的某些环节先被完全接管,另一些环节长期接管不了,事后回看才知道界线在哪。把它想成开关,容易高估短期、低估长期。
「通过某个测试就算 AGI」——图灵测试早已不再被当作有效标准,现代模型在很多设计上的评测里也已经超过人类平均水平,但这更多说明评测在失效。评测饱和是评估领域现在的主要难题之一。
「AGI 和 AI 安全是同一个话题」——对齐、护栏、提示词注入这些问题在今天的窄能力系统上已经是真实风险,不需要等到 AGI 才成立。把安全讨论全部推给未来的 AGI,反而会忽略眼前的问题。
普通人需要关心它吗
作为使用者,AGI 的时间表基本不影响你的日常决策。更有用的问题是具体的:这个模型在我这类任务上的成功率是多少、失败时的代价有多大、我需要在哪些环节保留人工确认。这些问题不管 AGI 什么时候到都成立。
作为从业者,值得关注的是定义之争背后的实际含义。当一家公司说「我们接近 AGI」时,它通常是在描述某个特定基准上的进展;把这句话直接翻译成「可以无人值守地交付业务结果」,是绝大多数落地事故的起点。