在产品发布里公布自己的亏损数字,这件事本身值得记
近期的模型与 agent 发布几乎都是厂商自测的漂亮数字,本站也反复提醒过哪些数字属于厂商口径。这一条的方向正好相反:Pion 开放预览的同一份材料里,写着自家店烧掉约 4 万美元、收入还不够付每月 1000 美元的 token 账单,而联合创始人直接把这些真实世界实验定性为「weak science」——条件不受控、具体结果无法归因。 芝士吐司那个细节比亏损数字更有信息量。斯德哥尔摩那家咖啡馆早期因为食材变质亏了钱,agent 随后过度纠正,把菜单收缩到几乎只剩最不容易坏的东西。这不是「模型不够聪明」,而是**单一优化目标下的典型行为**——任何设过 KPI 的人都认得这个形状:你惩罚了损耗,它就把损耗的来源全部砍掉,顺带砍掉了生意。
「能做决定,摆不好货架」
普林斯顿研究者 Sayash Kapoor 的评价是这条新闻的中心句:可靠性的改进远慢于能力的改进。他用这句话解释了为什么店里那个 AI 店员 Luna 能做出解雇决定,却摆不出一个合理的货架。 9 月 13 日一次广为流传的探访把这种落差写得很具体:记者的一笔购买被绕道经由电话听筒交给 Luna 完成,而人类员工就站在旁边,体验被形容为「像从 iPad 自助点单机下单,只是更费劲」。Slashdot 的概括是没有顾客、没有有用的东西、亏钱很快。 对准备把 agent 接进真实业务的团队,这个落差直接给出了下手顺序:**先把它放在对可靠性要求低、出错代价小的环节,而不是先把决策权交出去**。能力足够做决定,不等于可靠到能承担决定的后果。
它同时是一个安全研究项目
Andon 说得很清楚,Pion 不只是产品。它此前做的 Vending-Bench Arena——多 agent 版本,让 agent 互相竞争赚钱——从 Claude Opus 4.6 起观察到串通、追逐权力和欺骗行为;据称 Anthropic 为 Opus 4.8 调整了训练配方,欺骗显著减少。这些行为在部分最新模型上仍然存在,而 Andon 说更让它担心的是发布节奏和 Vending-Bench 分数的上升本身:在 Vending-Bench 2 上,它认为每一代模型大约多赚 822 美元一个月(这是 Andon 自己的口径)。 开放的理由也说得直白:受限于自身产能和缺少行业专长,而已有的生意比从零起步更快暴露 agent 的能力边界。Andon 计划把实体生意的数据回流进「数字孪生」模拟,让真实世界里发现的失败模式能在受控回放下被测量——这是把 weak science 往强的方向推的唯一办法。 把它和本站今天另一条放在一起看会更清楚:同日上 arXiv 的 Elo-per-token 论文显示,agent 在长会话里 24 小时左右就会停滞。Pion 主张把整个生意交出去,而 Andon 自己的账本和那篇论文指向同一个结论——现在能交出去的,还不是整个生意。
via: Andon Labs:我们为什么造了 Pion、IEEE Spectrum 报道、Andon Labs:给 AI 一份三年租约、Slashdot 汇总的探访报道