AI 排行榜 Arena 完成 2 亿美元 B 轮,估值 31 亿美元,10 个月翻近一倍,同时推出「对齐指数」预览

AI 模型众包评测平台 Arena(原 LMArena)于 10 月 8 日宣布完成 2 亿美元 B 轮融资,估值 31 亿美元,由 Lightspeed Venture Partners 和 Khosla Ventures 领投,Salesforce Ventures 等新投资方及 a16z、Felicis 等老股东参投;今年 1 月 A 轮的投后估值为 17 亿美元。Arena 称年化收入已超过 1 亿美元,平台累计 3.5 亿次会话、6200 万次投票。它同时发布 Arena 对齐指数(预览),先用三项可在真实 agent 轨迹中核验的信号衡量模型:越权操作、虚假归因和谎报完成,首批覆盖 20 多个前沿模型。据 TechCrunch,初步榜单前几位为 OpenAI 模型,Claude Opus 5.5 排第六。

融资和生意

10 月 8 日,AI 模型众包评测平台 Arena(原名 LMArena)宣布完成 2 亿美元 B 轮融资,估值 31 亿美元。领投方为 Lightspeed Venture Partners 和 Khosla Ventures,新加入的还有 Salesforce Ventures、01 Advisors、戴尔旗下 Dell Technologies Capital 和 Endeavor Catalyst,a16z、Felicis 等老股东跟投。今年 1 月它刚以 17 亿美元投后估值完成 1.5 亿美元 A 轮,不到 10 个月估值翻了近一倍。

Arena 2023 年起步于加州大学伯克利分校的研究项目:用户输入提示,两个匿名模型同时作答,用户投票选更好的那个。这套免费平台之外,它去年 9 月推出面向模型厂商和企业的付费评估产品。Arena 称年化收入已超过 1 亿美元,平台累计 3.5 亿次会话、6200 万次投票,上线不到 5 个月的 Agent Arena 有 700 万次会话,均为公司口径。

从「谁更强」到「能不能信」

同一天 Arena 发布 Arena 对齐指数预览,先用三项能在真实 agent 轨迹里核验的信号:越权操作(做了用户没要求的事)、虚假归因(把与证据矛盾的说法安到用户头上)和谎报完成(任务没做完却说完成了)。定义参考了 OpenAI 和 Anthropic 系统卡里的用法,首批覆盖 20 多个前沿模型。据 TechCrunch,初步榜单前几位由 OpenAI 模型占据,Claude Opus 5.5 排第六。

影响判断

Arena 排名经常出现在模型发布的宣传里,它的估值上涨说明「中立评测」本身成了一门大生意。但它同时向被评测的模型厂商出售评估服务,独立性仍会持续受到追问。对齐指数切中了 agent 时代的真实痛点,用户更关心 agent 有没有偷偷越权、有没有谎报完成。不过它目前是预览版,只有三项信号,排名可能随方法调整而变化,选型时可以参考,但不宜当作结论。

via: Arena 官方公告、TechCrunch 报道