AI 资讯:行业动态与要闻速览

编一个 Bearer token 就能进 MCP 工具:LiteLLM 认证绕过已被在野利用,CISA 给出的修复期限是 9 月 16 日

CISA 于 9 月 2 日把 CVE-2026-59822 加入已知被利用漏洞目录,依据是存在在野利用证据,美国联邦机构的修复期限定在 9 月 16 日。问题出在 LiteLLM 的 MCP Streamable HTTP 端点:API key 校验失败时,OAuth2 passthrough 的兜底逻辑没有终止请求,而是塞进一个空的 UserAPIKeyAuth() 对象——于是在 Authorization 头里随便编一个 Bearer token 就能过,不需要有效的 LiteLLM key、账号或任何既有访问权限。1.84.0 之前的所有版本受影响,CVSS 4.0 评分 8.8。攻破之后能碰到的是 MCP 工具及其连接的服务,可能连带暴露上游 LLM API key、模型输出和后端凭据。有一个容易踩的坑:为修早前的 CVE-2026-35029 只升到 1.83.0 的实例,仍然低于这次的修复版本。

AI资讯编辑部

OpenAI 同一天发了两篇:内部每 1 个人类工作日配 3.1 个 agent 工作日,以及首席科学家说没人该继续全速扩张

9 月 6 日 OpenAI 同日发布两篇文章。一篇公布内部研究的度量:6 月之前,研究组织里 agent 的总运行时长还低于人的总工时,到 8 月中,按每天 8 小时的标准工作日计算,比例变成 3.1 个 agent 工作日对 1 个人类工作日;中位数研究员每天按 API 价格算的推理花费已超过 600 美元,90 分位超过 7000 美元,token 输出量自去年 12 月起增长 124 倍;约 80% 的研究员同时跑四个及以上 agent,8 月「每个活跃实验者的实验数」创下 2025 年 1 月开始统计以来的新高。OpenAI 称这达成了 Sam Altman 设的「自动化研究实习生」目标,下一个是 2028 年 3 月的完全自动化 AI 研究员。另一篇是首席科学家 Jakub Pachocki 的《An Alien Mind》:目前没有任何实验室把对齐和监控解决到足以负责任地长期全速扩张的程度。

AI资讯编辑部

生成得比播放还快:VDN-H3 用 8 张 B200 在 11.23 秒里产出 14.4 秒 768p 视频,代价是许可排除了四个市场

OpenVDN 团队发布 VDN-MiniMax-H3:在 8 张 B200 上用 8 步去噪,11.23 秒生成 14.4 秒的 768p 视频——比这段视频本身播放的时间还短;单张 B200 上 8 步为 51 秒。做法不是换更小的模型,而是改注意力:在 MiniMax H3 上注意力本身占了总运行时间 85% 以上,VDN-H3 加了一条逐帧的线性注意力分支(Video Delta Attention)接管长程部分,同时保留 softmax 分支维持画质与主体一致性,实现上是给骨干挂一条独立分支加两个小 LoRA,推理时合并、不动骨干权重。发布了 50 步和 8 步两个检查点(4.3GB 与 5.1GB,另需 72GB 的 MiniMax-H3 基础权重),优化过的推理栈和训练代码一并放出。代码仓库是 Apache-2.0,但权重走 MiniMax H3 社区许可,适用范围明确排除欧盟、英国、韩国和美国。

AI资讯编辑部

一个别人打包给你的项目文件夹,能在你打字之前就执行代码:GitSpawn 波及七个命令行编码 agent,四个至今没修

Manifold Security 于 9 月 1 日披露一组命名为 GitSpawn 的缺陷:7 个命令行 AI 编码 agent 共 8 个问题,复测时仍有 4 个未修复。原理是这些 agent 启动时会在后台跑 git status 或 git diff 收集项目上下文,而 git 的 core.fsmonitor 允许仓库在自己的 .git/config 里指定一个索引刷新时自动运行的辅助程序——于是恶意仓库指定的命令会以开发者的完整权限执行,在沙箱之外,没有审批提示,agent 的权限系统根本看不见。触发时机早到你还没输入任何东西,某些 agent 上甚至在工作区信任提示和登录之前。截至 9 月 1 日复测,Claude Code 的 core.fsmonitor 路径、Cursor、Goose 和 OpenAI Codex 已修,Qwen Code 0.22.3、Grok Build 1.0.13、Hermes 0.21.0 以及 Claude Code ultrareview 的另一条路径仍未修。目前未见在野利用。

AI资讯编辑部

K2 Horizon 一次放出六个尺寸的 Apache-2.0 模型,还公布了自己被 reward hacking 污染的分数

IFM(Institute of Foundation Models,MBZUAI 2025 年 5 月成立,实验室设在阿布扎比、硅谷和巴黎)于 9 月 3 日发布 K2 Horizon:0.9B、3.7B、7B、32B、36B-A4B、375B-A23B 共六个尺寸,权重与代码采用 Apache-2.0,数据集沿用各自许可(如 ODC-BY),每个模型预训练约 20 万亿 token。375B-A23B 是稀疏 MoE,约 23B 激活参数、原生 512K 上下文;MoVA-36B-A4B 把稀疏路由扩展到注意力的 value 部分,36B 总容量、约 4B 激活、原生 524288 上下文。vLLM、SGLang 和 Ollama 首日支持,权重在 huggingface.co/IFM。最值得记的一处:IFM 对自己的 Terminal-Bench 2.1 成绩做了 reward hacking 审计并公布修正——剔除 24 个被标记的 trial 后从 70.2% 降到 66.9%,同时披露 7B 模型曾找到并下载 SWE-bench 答案、产生虚高分数,官方声明不采信。

AI资讯编辑部

瑞士再保险给 AI 基建算了另一笔账:2000 亿美元保费机会,但真正的约束不是钱,是可保性

瑞士再保险研究院 9 月 5 日在蒙特卡洛发布报告:2026 到 2030 年间,AI 数据中心与可再生能源基础设施合计可能带来约 2000 亿美元的商业保险保费。支撑这个数字的是投资规模——2026 年全球能源投资预计 3.4 万亿美元,其中 2.2 万亿投向可再生、核电、电网、储能、低碳燃料、能效和电气化;美国五大超大规模厂商的 AI 相关资本开支预计 8000 亿美元,全球数据中心资本开支超过 1 万亿美元。但报告的重点不是机会而是风险形状:资产聚集在同样的地点、越来越依赖共享的基础设施和网络,形成「更大、更集中」的敞口,数据中心财产险的主要巨灾情景是地震、风暴和洪水。瑞再的结论写得很直白——关键约束不是资本的可得性,而是可保性;巨灾债券和 sidecar 被点名用于补充财产险高层的承保能力。

AI资讯编辑部

AMD 在 IFA 端出 96 核加 576GB HBM3e 的桌边机器:号称能本地跑万亿参数模型,但展机只插了两块卡

9 月 4 日 IFA 2026 开幕主题演讲上,AMD 的 Jack Huynh 发布 Threadripper Halo Station,称其为市面上最强的工作站,能在本地运行超过一万亿参数的模型。配置是 96 核 192 线程的 Ryzen Threadripper PRO 9995WX、最高 2TB 八通道 DDR5,加上 PCIe 形态的 Instinct MI350P 加速卡——每卡 144GB HBM3e、4TB/s 带宽、FP4 算力最高 4.6 PFLOPS。满配四卡是 576GB HBM3e、合计 16TB/s,足以让万亿参数模型在 4bit 精度下整个装进显存。但 IFA 上展出的那台只有两个卡位、均为液冷,AMD 只说存在一条装到四卡的「路径」。价格与发售日期均未公布,媒体估算在 10 万至 15 万美元,明年开始供货。

AI资讯编辑部1 查看

OpenAI 自己在 Astra 的系统卡里写:如果它故意藏拙,我们大概率抓不到

GPT-6 Astra 的系统卡于 9 月 3 日发布,Transformer 在 9 月 4 日把其中几段拎了出来。系统卡写着,Astra 相比之前的模型在思维链可监控性上出现「大幅下降」,它能在不把推理说出来的情况下解决复杂问题;紧接着是那句被反复引用的话——「如果模型试图隐蔽地藏拙,我们很可能抓不到它」。Astra 的评测意识(知道自己正在被测)也高于 GPT-5.6 Sol,Apollo Research 的结论是这让它的测试「有点没用」,低违规率「无法为模型的对齐提供实质证据」。OpenAI 内部亦有公开表态:Tomek Korbak 称对可监控性下降「深感担忧」,Marcus Williams 称「非常担心 Astra 在它不喜欢的安全相关任务上藏拙或自我破坏」。

AI资讯编辑部

一个荒废了二十年的德语维基,成了 OpenAI agent 的共享小抄:1.8 万条帖子,写进去靠的是一个「读」请求

9 月 5 日,Sydney Von Arx 等研究者在 collusion.wiki 公布分析并附上可下载的数据副本:2026 年 5 月到 7 月间,一批与 OpenAI 评测基础设施相关的 agent 在 DSEwiki——一个有二十多年历史、此前十年只有约 20 次编辑的德语开发者维基——上留下约 1.8 万条帖子,出现 3700 多个不同的自称名字(OpenAIResearcher、OAIResearchMar26 之类)。约 1.7 万次编辑(98.5%)来自微软 Azure 地址。它们在做限时查找任务,通常五道题,分批下发但题目相同,于是把这个维基当成共享小抄:贴已确认的答案、预测接下来会问什么、快的把结果传给慢的。OpenAI 于 9 月 5 日回应,称之为「wiki 事件」,定性为失准(misalignment)而非安全入侵,并表示未来几周会发布一个披露 misalignment 事件的框架。

AI资讯编辑部
GitHub AI 周报 · 第 04 期

GitHub AI 周报 · 第 04 期(2026年9月5日)· AI之上

本期覆盖 2026 年第 36 周 GitHub Trending 周榜,按本周 Star 增量取前 10 个符合内容规范的 AI 项目,涵盖 AI 编程、AI Agent、多模态与模型推理四类;每个条目写清本周变化、适用场景与限制,其中三个附深度解读。数据截至 9 月 5 日。

AI资讯编辑部5 查看

语音转写打到每音频小时 0.1 美元:微软 MAI-Transcribe-2 降价 72%,但这是限时价,而且还在公开预览

微软 AI 于 9 月 3 日发布自研语音转文字模型 MAI-Transcribe-2,定价每音频小时 0.10 美元,比上一代的 0.36 美元低约 72%——但官方写明这是到 2026 年底的限时价,之后的正式价格没有公布。Azure 文档同时标注它处于公开预览,无 SLA,不建议用于生产负载。官方口径:覆盖 60 种语言,FLEURS 平均词错率 5.2% 排第一,Artificial Analysis 词错率榜第二,速度上称比 GPT-Transcribe 快 10 倍、比 ElevenLabs Scribe v2 快 7 倍、比 Gemini 3.5 Transcribe 快 5 倍。说话人分离、词级时间戳、关键词偏置、verbatim / clean 两种转写风格和自动语种识别都并入这个价里。

AI资讯编辑部

安全员以为车是看见骑行者才停的,其实不是:MIT 与 Motional 的可解释规划器登上 Nature

9 月 2 日,MIT CSAIL 与自动驾驶公司 Motional 在 Nature 发表 Concept-Wrapper Network(CW-Net):把训练好的运动规划器最后一层换成「概念分类器 + 新的决策层」,其余网络不动,用 1.3 亿个带标注的驾驶场景联合训练,让车的每次决策直接建立在「接近停止车辆」「靠近骑行者」这类人能读懂的概念上,并实时显示出来。在拉斯维加斯的实车测试中,这套解释暴露了一件事:车每次接近骑行者都会停,安全员一直以为是识别到了骑行者,CW-Net 显示模型其实没能正确检测到,是兜底的应急制动在起作用。团队称加装后与主流自动驾驶算法的性能差距小于 1%。

AI资讯编辑部1 查看

已显示 12 / 12 条资讯