这次升了什么
Opus 系列现在是 Anthropic 的旗舰线,4.8 延续一贯的节奏:重点打磨编程、长任务执行和工具调用这些开发者最买账的能力。官方基准照例全面领先,但社区早学会了对厂商跑分打折扣,HN 讨论里更受重视的是第一批用户拿真实项目跑出来的体感——哪些场景明显变强,哪些地方反而退步,价格和速度有没有变化。
升级之前先抽样跑一遍
对已经在用 Claude 的团队,这种小数点版本的稳妥做法是抽样回归:拿一批存档的真实任务在新旧版本各跑一遍,对比成功率和成本再切。模型升级偶尔带行为漂移,提示词的最优写法会变,自动化流程里尤其要防。还在观望的话,与其追版本号新闻,不如自己固定一套评测题,每逢大版本跑一次,比看发布稿实在。
via: Hacker News