Claude Opus 4.8 更新

Anthropic 发布 Claude Opus 4.8,社区的注意力照例集中在编程和代理任务的实测表现,以及这次升级换来的真实差距。

这次升了什么

Opus 系列现在是 Anthropic 的旗舰线,4.8 延续一贯的节奏:重点打磨编程、长任务执行和工具调用这些开发者最买账的能力。官方基准照例全面领先,但社区早学会了对厂商跑分打折扣,HN 讨论里更受重视的是第一批用户拿真实项目跑出来的体感——哪些场景明显变强,哪些地方反而退步,价格和速度有没有变化。

升级之前先抽样跑一遍

对已经在用 Claude 的团队,这种小数点版本的稳妥做法是抽样回归:拿一批存档的真实任务在新旧版本各跑一遍,对比成功率和成本再切。模型升级偶尔带行为漂移,提示词的最优写法会变,自动化流程里尤其要防。还在观望的话,与其追版本号新闻,不如自己固定一套评测题,每逢大版本跑一次,比看发布稿实在。

via: Hacker News