宕机和它的涟漪
中断发生后,刷状态页、刷 HN、刷社交媒体的三连确认成了标准流程,讨论串里既有依赖 API 的服务商焦急算损失,也有开发者自嘲「突然不会写代码了」。玩笑背后是真实的结构变化:AI 服务在很多团队里已经从锦上添花变成了关键路径,编程助手一停,交付节奏真的会慢下来。这种依赖形成的速度,比大多数公司更新风险评估的速度快得多。
依赖管理的功课
从工程角度,AI 服务该被当成和数据库、支付网关同级的外部依赖来管:有降级方案(换备用模型或回退人工)、有熔断、有对账单和 SLA 的核对。现实是大部分集成都是裸连一家 API,连超时重试都没配好。每次大厂宕机后,多模型路由工具的搜索量都涨一波,热度退去,大家继续裸奔。这次真正该记住的是:有单点依赖不可怕,没意识到自己有,才可怕。
via: Hacker News