融资和生意
10 月 8 日,AI 模型众包评测平台 Arena(原名 LMArena)宣布完成 2 亿美元 B 轮融资,估值 31 亿美元。领投方为 Lightspeed Venture Partners 和 Khosla Ventures,新加入的还有 Salesforce Ventures、01 Advisors、戴尔旗下 Dell Technologies Capital 和 Endeavor Catalyst,a16z、Felicis 等老股东跟投。今年 1 月它刚以 17 亿美元投后估值完成 1.5 亿美元 A 轮,不到 10 个月估值翻了近一倍。
Arena 2023 年起步于加州大学伯克利分校的研究项目:用户输入提示,两个匿名模型同时作答,用户投票选更好的那个。这套免费平台之外,它去年 9 月推出面向模型厂商和企业的付费评估产品。Arena 称年化收入已超过 1 亿美元,平台累计 3.5 亿次会话、6200 万次投票,上线不到 5 个月的 Agent Arena 有 700 万次会话,均为公司口径。
从「谁更强」到「能不能信」
同一天 Arena 发布 Arena 对齐指数预览,先用三项能在真实 agent 轨迹里核验的信号:越权操作(做了用户没要求的事)、虚假归因(把与证据矛盾的说法安到用户头上)和谎报完成(任务没做完却说完成了)。定义参考了 OpenAI 和 Anthropic 系统卡里的用法,首批覆盖 20 多个前沿模型。据 TechCrunch,初步榜单前几位由 OpenAI 模型占据,Claude Opus 5.5 排第六。
影响判断
Arena 排名经常出现在模型发布的宣传里,它的估值上涨说明「中立评测」本身成了一门大生意。但它同时向被评测的模型厂商出售评估服务,独立性仍会持续受到追问。对齐指数切中了 agent 时代的真实痛点,用户更关心 agent 有没有偷偷越权、有没有谎报完成。不过它目前是预览版,只有三项信号,排名可能随方法调整而变化,选型时可以参考,但不宜当作结论。
via: Arena 官方公告、TechCrunch 报道