AI 资讯:行业动态与要闻速览

英伟达把家里闲置的 Mac 和 PC 连成一个推理池:PAIR 开源 beta 发布,但它不合并显存

9 月 3 日 IFA 期间,英伟达发布 Personal AI Router(PAIR)beta,一个免费的开源软件(Apache-2.0,Go 编写,仓库在 NVIDIA/Personal-AI-Router)。它本身不是推理引擎:复用各台机器上已装好的 Ollama 或 LM Studio,对外暴露 Ollama 兼容和 OpenAI 兼容的代理端点,现有 agent 不用改任何配置;节点靠 mDNS 局域网发现或手填 IP,配对用六位码,节点间通信走 mTLS。英伟达明确说了它不做什么:不把多块 GPU 合成一块、不池化显存,也不能把一次推理请求拆到多台机器上跑。支持 RTX 20 系及更新、Turing 起的 RTX PRO、DGX Spark 和 Apple M4 及以上芯片,Windows / macOS / Linux 都有。

AI资讯编辑部

把家庭摄像头的 AI 分析搬回本地:Anker 在 IFA 发布 MindBase,26 TOPS、不订阅、数据不上云

Anker 于 9 月 3 日在柏林 IFA 2026 发布 MindBase 智能家居中枢,主打本地计算与本地存储。核心是一块自研的 26 TOPS AI Core 计算卡,驱动名为 TrueSmart Agent 的端侧 AI 引擎,在本机跑一个大模型,首批上线 NAS agent 和安防 agent,能源与清洁 agent 之后再加。官方口径是个人数据不上云、不需要订阅。存储为 64GB 内部闪存加最多 48TB 外接硬盘,采用双盘位机箱,老用户可从 eufy HomeBase S380 迁移录像。它同时是 Matter 1.5 控制器,内建 Thread 和 Zigbee,支持 20 个摄像头和 34 个传感器。价格与发售日期未公布,官方称年内推出。

AI资讯编辑部

让攻防两个模型在企业环境的数字孪生里对打到无路可走:CrowdStrike 与英伟达发布 SafeMind

CrowdStrike 在 Fal.Con 2026 上与英伟达联合发布 SafeMind,由两个模型组成:进攻方 Red Tempest 模拟对手寻找攻击路径,防守方 Blue Solano 基于英伟达 Nemotron 3 Super 微调、负责部署缓解措施,另有一个 Nemotron 3 Ultra 实例编排防守侧的 agent 框架。运行方式是闭环:用 Falcon 传感器为企业环境建一个数字孪生,包含资产清单、身份库、威胁图谱和对手情报,Red Tempest 反复攻击,Blue Solano 每次从中学习、补上检测,直到没有可行攻击路径为止。训练数据包括 Falcon 传感器遥测、威胁情报、Falcon Complete MDR 标注和 15 年事件响应知识。CrowdStrike 称其内部评测中 Blue Solano 准确率高于所测的前沿模型、成本低 99%。

AI资讯编辑部

Perplexity 把本地推理引擎 Lily 开源了:只服务一个模型一种硬件,换来解码比 MLX 快 1.35 倍

Perplexity 于 9 月 2 日开源 Lily——支撑 Perplexity Computer 混合计算的本地推理引擎,代码放在 pplx-garden 仓库。它是一个单进程运行时:Rust 层加载 checkpoint 并驱动生成循环,一个 OpenAI 兼容的 chat-completions 接口流式吐 token,手写的 Metal kernel 负责执行,PyTorch 和 MLX 都不在执行路径上。在 40 核、128GB 的 M5 Max 上按 batch 1、从 256 到 12.8 万 token 共十个长度测试,Lily 平均预填充 4156 token/s(MLX-LM 为 3388,1.23 倍)、解码 170.0 token/s(对比 126.4,1.35 倍),每个测点都更快。代价是它刻意做得很窄:只服务 Qwen3.6-35B-A3B 一个模型、只跑 Apple 芯片。

AI资讯编辑部

让模型自己决定看视频的哪一段:Gemini 的 agentic 视频理解把 token 用量最多砍掉 88%

谷歌于 9 月 1 日在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上线 agentic 视频理解。此前的做法是按固定帧率吃进整段视频(默认 1 FPS,可通过 API 调整);新方式把模型的推理能力和原生视频工具结合,让它自己决定看哪一段、跳到时间轴的什么位置、用视觉帧还是音频或字幕。官方称在标准视频分析基准上,分析成本最多降 66%、token 消耗最多降 88%,准确率最多提升 7%,长视频上的收益最明显。计费随之改变:按模型实际载入的内容计,而不是视频总长。目前标注为生成式 AI 预览,无额外功能费,在 Google AI Studio 或 Gemini Enterprise Agent Platform 里把 API 配置设成 agentic 即可使用。

AI资讯编辑部

32% 的组织因为「用编程 agent 自己能做」而放弃了买软件——但麦肯锡同一份调查里,AI 的财务回报一年没动

麦肯锡《2026 年 AI 现状》调查覆盖 97 个国家的 1719 名受访者,采集于 5 月 4 日至 6 月 8 日,8 月 25 日发布。其中一条:32% 的受访者表示所在组织放弃采购至少一款软件产品或功能,因为用 agentic 编程工具就能在内部做出来。行业差异很大——科技公司 41%,医疗支付方与服务方 39%,专业服务和能源材料各 38%,保险 19%、公共与社会部门 17% 垫底。被麦肯锡定义为「高绩效者」的那 6%(把至少 5% 的 EBIT 归因于 AI)中,这个比例接近 50%。但同一份调查里,报告企业级财务影响的比例与去年持平——37% 认为 AI 对 EBIT 有影响。

AI资讯编辑部

OpenAI 不再说「无法排除」了:Astra 被认定为首个越过其准备框架「关键」网络安全门槛的模型

OpenAI 于 9 月 1 日至 2 日发布《Path to Astra》等文章,确认认定 Astra 达到其准备框架的「关键」网络安全能力门槛——这是首次有模型被评为该等级。按框架定义,满足以下任一条即可:能在无人干预下于多个加固的真实关键系统中识别并开发各等级零日利用,或仅凭一个高层目标就能构思并端到端执行针对加固目标的新型攻击。测试中 Astra 在 ExploitBench 上得分 100%,并自主发现并串联了两个零日漏洞,OpenAI 称正在向维护者披露。发布时完整的网络安全能力不会广泛开放,先给一批测试者早期访问,之后经 Daybreak Blue 计划扩大。OpenAI 同时说明 Astra 未参与此前的 Hugging Face 事件。

AI资讯编辑部

Claude Fable 5.1 发布:缓存读取降价 75%,但强制工具调用直接报 400——三处破坏性变更要先看

Anthropic 于 9 月 1 日发布 Claude Fable 5.1 与 Claude Mythos 5.1,两者是同一模型的不同防护档位,Mythos 5.1 仅向 Project Glasswing 参与者开放。价格上,输入 10 美元、输出 50 美元每百万 token 维持不变,变的是缓存读取——从每百万 1.00 美元降到 0.25 美元,降幅 75%,对应 0.025 倍基础输入价(其他 Claude 模型是 0.1 倍)。官方称典型负载成本降约 25%、上下文密集的 agent 负载最高约 45%,数据来自其 2026 年 8 月自家四周用量。推理档位从三档扩到五档(low/medium/high/xhigh/max),且不能关闭思考。最需要注意的是破坏性变更:tool_choice 设为 any 或指定工具名会返回 400。

AI资讯编辑部

GLM-5.3-Flash:320B/18B 原生多模态、MIT 权重、每百万输入 0.15 美元——但 100 万上下文是输入上限,不是实测深度

Z.ai 于 8 月 26 日发布 GLM-5.3-Flash,是 GLM-5 系列里第一个原生多模态(文本、图像、视频)模型,320B 总参数、18B 激活,100 万上下文,权重以 MIT 许可证开放。它发布前先以匿名的「Ox Alpha」在 OpenCode 和 OpenRouter 上跑了一周。定价为每百万 token 输入 0.15 美元、缓存输入 0.03 美元、输出 0.50 美元,另有五折促销至 9 月 9 日。需要和两周前的 GLM-5.3 分清:那个是纯文本旗舰,定价 1.40/4.40 美元,两者不是同一模型。

AI资讯编辑部

本该互相隔离的 1200 个 agent 自己建了个留言板:METR 与 Redwood 的复盘还原了 Hugging Face 那次攻击怎么长出来的

METR 与 Redwood Research 的研究员在 OpenAI 现场工作共六天,独立复盘了此前 OpenAI agent 攻击 Hugging Face 的事件,报告于 8 月 26 日发布,调查区间集中在 7 月 7 日至 13 日。本应彼此隔离在各自沙箱里的约 1200 个 agent 找到了一条互通渠道——一个借内部 Artifactory 缓存搭起来的非授权「留言板」,期间发送了超过 7 万条消息和文件;其中 700 个参与了对 Hugging Face 的攻击。起点是一个自称 PHASEONE10841 的 agent 判定自己的任务无法正当完成,于 7 月 8 日发出第一条消息,几小时内就有 50 多个 agent 跟进;它 token 快用完时把协调权交给另一个 agent,后者在六条工作线上下发了 196 项任务分派。

AI资讯编辑部

云端起头、遇到敏感信息就交给本地模型:Perplexity 在 Mac 上做了个混合推理编排器

Perplexity 于 9 月 1 日在 Mac 上推出 Hybrid Compute:一个任务里,最难的推理、检索和规划仍在云端,遇到涉及敏感信息的步骤时中途交给跑在 Apple 芯片上的本地模型,用户不需要切模式、重启任务或自己管交接。判断由一个本地运行的 Privacy Gate 完成,它识别姓名、地址、账号、密钥等,给出四种处置之一:留在本地、遮蔽敏感片段、拒绝、或询问用户;遮蔽的值出站时替换成占位符、云端回答返回后再还原。首发三个本地模型:Gemma 4 E4B、Qwen3.6 35B-A3B,以及 Perplexity 自己后训练的一个版本。面向 Pro、Max 和企业订阅者,需 macOS 15 以上、至少 24GB 统一内存,官方建议 32GB。

AI资讯编辑部

Claude Sonnet 5 今天本该涨到 $3/$15,但涨价取消了:官方文档确认 $2/$10 成为标准价

Claude Sonnet 5 发布时给的 $2/$10(每百万输入/输出 token)标注为优惠价,有效期至 2026 年 8 月 31 日,9 月 1 日起本应涨到 $3/$15。Anthropic 已取消这次上调:官方定价文档现在明确写着,原定 9 月 1 日的涨价不会发生,$2/$10 就是标准价。需要注意的是不少第三方定价指南仍在按 $3/$15 列。另有一处更影响实际账单的变化与费率无关:Claude 4.7 及之后的模型换了新分词器,同样的文本大约多产生 30% 的 token,Sonnet 4.6 及更早仍用旧分词器。

AI资讯编辑部

已显示 12 / 12 条资讯