AI 资讯:行业动态与要闻速览

只给论文发表前的参考文献,前沿模型复原出原创想法的比例是 3–15%

新基准 Reconstruction(arXiv:2608.16645)只给模型一篇论文发表之前就已存在的参考文献,并抹掉作者与元数据,要求它反推这篇论文提出了什么。在六个学科、643 篇论文上,七个前沿模型的匹配率只有约 3–15%;一套不联网的多智能体流程能把这个数字推到约 42%。作者指出,很多「AI 科学家」类评测让模型看到全文、作者或发表后的信号,那种条件下的高分不能当作真实推理能力。

AI资讯编辑部3 查看

Claude 自主设计的蛋白结合体,15 个靶点命中 14 个:两家 CRO 盲测,命中率是行业常规的两倍多

Anthropic 于 8 月 18 日公布湿实验验证结果:Claude 针对 15 个靶点各生成 30 个候选结合体,共 1320 个设计,经 Adaptyv Bio 与 Twist Bioscience 独立表达测试,354 个确认结合,覆盖 15 个靶点中的 14 个。多靶点同时设计时 Mythos Preview 命中率 26.7%、Opus 4.8 为 22.6%,单靶点独立处理时 Mythos Preview 达 35.1%,Anthropic 称行业常规为 10–15%。这类双用途生物能力目前在 Claude Fable 5 中仍不对外开放。

AI资讯编辑部16 查看

OpenAI 把最大的前沿 RL 训练按住了:新监控吃掉约 20% 算力,30 分钟内排不掉告警就停跑

OpenAI 于 8 月 18 日发文说明,因内部评估无法排除未发布模型 Astra 达到「关键」网络安全等级,其规模最大的前沿强化学习训练仍处于暂停状态,此前已停跑两周。新规要求对 Sol 级及以上模型的全部带工具 RL 训练与评测做监控,Astra 则连带工具的推理也全覆盖;公司估算监控开销约为被监控推理算力的 20%。疑似触碰关键安全边界时 30 分钟内告警,再过 30 分钟排除不掉误报就要暂停。

AI资讯编辑部12 查看

Warp 推出 Factories:把「一堆编程 agent」变成版本受控的流水线,模型和 harness 自己挑

Warp 于 8 月 18 日以封闭测试形式推出 Factories,把分诊、写规格、实现、评审、验证五个环节做成可编排的 agent 流水线。模型和 harness 由用户自选,官方称接 Codex 和 Claude Code 都可以,同时对接 Linear、Jira、Slack 和 Teams。每条流水线用版本受控的配置文件定义,改流程和改代码走同一套评审。CEO Zach Lloyd 说自家团队每周自动化比例约 30–35%,并强调这套东西不是用来替掉工程师的。

AI资讯编辑部9 查看

1000 万美元买下一家破产航司的内部聊天记录:谷歌拿它训练 AI,竞价对手是 Mercor

破产法院文件显示,谷歌以 1000 万美元竞得已停运的 Spirit Airlines 内部业务数据用于训练 AI 与改进产品,规模约 1 亿封邮件、5 亿条 Microsoft Teams 聊天,另含表格、日历、HR 与财务文档。竞价从 500 万起,Mercor 出到 750 万,谷歌加到 1000 万;Mercor 被列为备选买家。谷歌称数据交付前由第三方剔除个人身份信息,不包含乘客档案与常旅客记录。交易尚待 8 月 19 日聆讯批准。

AI资讯编辑部10 查看

OpenAI 上线 ChatGPT for Teens:13–17 岁自动进未成年模式,年龄拿不准就按更严的来

OpenAI 于 8 月 18 日全球推出面向 13–17 岁的 ChatGPT for Teens,免费版和个人付费版的合资格账号一并覆盖,澳大利亚 9 月 8 日全量。自称未成年、以及被年龄预测系统判断为 18 岁以下的用户会被自动放进该模式:禁止暧昧措辞、不许暗示自己有情感或意识,学习场景默认走 Study Mode,约每 90 分钟提醒休息。家长可设置 Quiet Hours,但看不到孩子的聊天内容。

AI资讯编辑部11 查看

一个 issue 标题就能在 CI 里执行命令:Wiz 的 AI agent 挖出 Snowflake 仓库漏洞,Copilot Autofix 是否放行成罗生门

Wiz 披露其自动化 Red Agent 在 Snowflake 的 snowflake-connector-net 仓库发现工作流注入漏洞:未认证用户构造一个 GitHub issue 标题,即可在 Actions runner 里执行任意命令,并拿到一枚 Jira API token。漏洞 6 月 18 日随 PR 合入、6 月 23 日被发现并当天修复。争议在归因——Wiz 称 Copilot Autofix 检查过合并后的 PR 并判定无问题,GitHub 则否认 Copilot 参与或审查过这段代码。

AI资讯编辑部5 查看

AI 视频公司 Higgsfield 融资 4 亿美元,估值 54 亿:一年把年化收入从 2000 万做到 7 亿

8 月 17 日,AI 视频与图像生成平台 Higgsfield 官宣 4 亿美元 B 轮融资,估值 54 亿美元,由 DST Global 领投,高盛另类投资、英特尔投资、Accel、Menlo Ventures 等跟投。公司披露年化收入已达 7 亿美元,一年前是 2000 万美元;全球用户超 3000 万,覆盖 238 个国家和地区,财富 500 强中有 390 家在用。

AI资讯编辑部6 查看

英伟达为 OpenAI 俄亥俄数据中心兜底最高 1050 亿美元租金,自己不出建设资金

8 月 17 日的证券文件披露,英伟达同意为 OpenAI 在俄亥俄州 PORTS-Pike 园区的租赁与电力付款提供最高 1050 亿美元的有条件担保,先覆盖 4.25GW 算力、可再扩 3.75GW。园区由软银系的 SB Energy 建设并持有,租给 OpenAI 20 年,首批约 800MW 计划 2028 年上线。英伟达另投资 SB Energy 15 亿美元,并强调「租金由 OpenAI 付」。

AI资讯编辑部10 查看

OpenAI 解散 Preparedness 团队:灾难性风险评估被拆进各产品组

《金融时报》8 月 17 日报道,OpenAI 已在 7 月底解散负责评估前沿模型灾难性风险的 Preparedness 团队,职责按生物、网络等方向拆进现有团队,没有裁员。这是两年内第三个被撤销的安全导向团队,公司称 Preparedness Framework 本身仍然有效。OpenAI 未就报道发布正式公告。

AI资讯编辑部10 查看

Anthropic 8 月 17 日停用旧版 Workbench:三个实验性提示词 API 同步下线

Anthropic 于 8 月 17 日停止所有用户访问 Claude Console 旧版 Workbench,并同步退役生成、改进和模板化提示词的三个实验性 API。旧版中保存的提示词、版本、补全结果和评测在停用后不再可访问,新版 Workbench 也不能导入这些数据。仍依赖旧界面或相关接口的开发者需要确认已完成导出并移除 API 调用。

AI资讯编辑部25 查看

Anthropic 第二份风险报告:用来判断「模型能否顶替自家研究员」的内部基准已经饱和

Anthropic 于 8 月 14 日发布第二份公司级风险报告,186 页,首次把未发布的内部模型一并纳入评估。报告把「高风险场景下失准造成灾难性伤害」的评级从「极低」上调到「低」,并直言用来盯 AI 研发自动化门槛的内部基准 CoBench 已经饱和——最具体的任务型评测不再能反映能力增量。报告同时披露了一个不打算发布的内部模型 Model 2。

AI资讯编辑部24 查看

已显示 12 / 12 条资讯