GitHub 本周 AI 精选(2026年8月16日)· AI之上

6 查看

本周 GitHub Trending 周榜上的 8 个 AI 项目:没有一个是新模型,热度全挤在给 agent 装记忆、装技能、装路由的中间层。逐个说说它们替你省了什么事,以及哪些现在还别碰。

1. cathrynlavery/diagram-design — 让编码 agent 画出能见人的图

cathrynlavery/diagram-design 项目预览

cathrynlavery/diagram-design 项目预览

github.com/cathrynlavery/diagram-design · MIT · HTML + SVG · 本周约 +1.47 万 Star,周榜第一

让模型画张架构图,回来的多半是一堆圆角方框,跟自己文章的调性半点不搭。不将就,就得开 Figma 手搓半小时;将就了,图就白画。作者说她每次写文章都卡在这一步,干脆把「怎么算一张好图」写成了规则:版式、配色、信息密度全都定死,强调色只留给最该先看的那一两处,目标密度 4/10——多一个节点都得先证明自己有用。

装上以后它是 Claude Code、Codex、Pi 的一个技能,架构图、流程图、金字塔各有专门模板(README 写 27 种,仓库简介写 29 种,取用时以实际目录为准),产出是自包含的 HTML + SVG,没有构建步骤,也不依赖外部图片,扔进网站就能用。手上已经有 draw.io 或 Mermaid 的旧图,也可以让它按指定尺寸和详略程度重画一遍。

写技术博客、产品文档、内部方案的人值得装,前提是你已经在用这几个 agent;如果你的图最终还要回 Figma 精修,它插不进那条流水线。

2. semantica-agi/semantica — 让企业 AI 说得清「凭什么」

semantica-agi/semantica 项目预览

semantica-agi/semantica 项目预览

github.com/semantica-agi/semantica · MIT · Python · 本周约 +5,300 Star

在企业里,模型给出答案往往不是最难的一关,事后解释这个答案基于哪些数据、经过哪几步才是。向量检索给不出这条链路——它只能告诉你「这几段最像」。Semantica 换了条路:把企业数据摄入后抽成上下文图和知识图谱,在图上跑分析和因果推理,每个结论都挂着可查询的决策溯源。项目自称「AI Agent 的开源版 Palantir」,同时支持 RDF 和 LPG 两种图模型,走 W3C 标准,本体可以自己管,也可以整套自托管。

金融、医疗、公共服务这类要向合规部门交代模型依据的场景,是它明摆着的主场。代价是团队得真懂知识建模和本体设计——只想搭个内部问答机器人的,用它属于杀鸡用牛刀,还得养一套图。

3. PrimeIntellect-ai/prime-agent — 会自己攒经验的编码 agent

PrimeIntellect-ai/prime-agent 项目预览

PrimeIntellect-ai/prime-agent 项目预览

github.com/PrimeIntellect-ai/prime-agent · MIT · TypeScript · 本周约 +8,500 Star

大部分 agent 把一切都塞在对话上下文里,窗口一满就失忆,昨天调顺的工作方式今天得从头教。Prime Intellect 这个项目换了两个抽象来治这件事。一个叫 RLM(递归语言模型),把上下文当变量、把子 agent 当函数,全部丢进一个常驻的 Python REPL 里用代码调度:读写文件、执行命令、管理上下文都是代码,rlm(...) 一调就派生出真实的子 agent 去并行干活。另一个叫 Continual Harness(论文在这),把补充提示词、记忆、技能描述、可复用的子 agent 规格存成持久状态,靠一次次有证据支撑的小修改慢慢磨,默认只在本地会话生效。

说白了,就是让「有用的上下文」和「好使的干活套路」活得比一个聊天窗口更久。要跑几小时甚至几天的重构、迁移、调研任务,它值得一试,但你得接受 agent 用代码而不是自然语言来编排一切;只想要个补全式助手的,装编辑器插件更省事。

4. NVIDIA-NeMo/Switchyard — 把编码 agent 接到任意模型上

NVIDIA-NeMo/Switchyard 项目预览

NVIDIA-NeMo/Switchyard 项目预览

github.com/NVIDIA-NeMo/Switchyard · Apache-2.0 · Rust · 本周约 +1,300 Star

Claude Code、Codex 这类工具只会说自家那套 API,想让它们后面接开源模型或自建推理服务,第一步就卡死。NVIDIA NeMo 团队用 Rust 写了个代理站在中间做翻译:OpenAI Chat、Anthropic Messages、OpenAI Responses 三种格式互转,agent 照旧说母语,真正干活的换成 vLLM、NVIDIA NIM、Ollama 或任何 OpenAI 兼容端点。顺手还能把流量按算法分给几个模型做 A/B 对比,Prometheus 指标覆盖延迟、token 和路由开销。

想拿自建模型驱动现成 agent,或者正在做模型选型和成本优化的平台工程师,可以先跑起来玩。但仓库自己在 README 里挂了警告:pre-alpha 实验软件,别上生产,v1.0 之前 API 和算法还会大改。现在把它放进关键链路,等于给自己埋雷。

5. vitali87/code-graph-rag — 把整个 monorepo 变成一张图

vitali87/code-graph-rag 项目预览

vitali87/code-graph-rag 项目预览

github.com/vitali87/code-graph-rag · MIT · Python · 本周约 +1,800 Star

把代码切片丢进向量库,检索回来的是「看起来像」的片段,答不了「这函数谁在调」「删了会炸哪」。这个项目用 Tree-sitter 把多语言代码库解析成函数、类、方法、模块和它们之间的关系,存进 Memgraph,然后你就能用大白话查、改、优化:按名字或意图取真实源码,基于 AST 做外科手术式改写并先给你看 diff,从入口点沿调用边揪出死代码。

比较妙的是最近加的运行时追踪——跑一遍测试套件,把真正发生过的调用并回图里,接口分发、虚方法、反射、框架路由这些静态分析看不见的边就补齐了,还会标出来哪些是静态分析漏掉的。在多语言 monorepo 里做重构、补文档、清死代码的团队最划算;门槛是得自己养一套 Memgraph,仓库不大的话,编辑器全局搜索比它快得多。

6. cactus-compute/needle — 14MB,能塞进手表的工具调用模型

cactus-compute/needle 项目预览

cactus-compute/needle 项目预览

github.com/cactus-compute/needle · MIT · Python · 本周约 +2,500 Star

手机、手表、智能音箱、机器人上,很多时候只需要「听懂一句话,然后调对一个接口」。为这么点事跑一趟云端,延迟、隐私、断网可用性三头都不划算。Needle 2 就是奔着这个场景去的:4,500 万参数,官方自述整个模型是一个 14MB 二进制,跑完整会话大约占 28MB 内存,用自研的 CQ2 量化压到 2 bit(权重在 Hugging Face,架构见 arXiv:2607.18363)。

工程上的几处设计比参数量更值得看:输出被你自己 schema 编译出来的字节级语法约束住,保证吐出来的是结构化 JSON;每条响应带一个校准过的置信度分数,超过阈值就执行、低于阈值就上交给大模型;工具目录很长时有检索头兜着,每轮只渲染最相关的五个。做端侧、可穿戴、机器人和离线场景的工程师可以认真看看,但别指望它写文案或推理复杂问题——它不是通用对话模型。另外它对比的 FunctionGemma 270M、LFM2.5 230M 都是自家跑的基准,落地前最好自己复测一遍。

7. macro-inc/macro — 人和 agent 共用一份记忆的工作区

macro-inc/macro 项目预览

macro-inc/macro 项目预览

github.com/macro-inc/macro · AGPL-3.0 · Rust + SolidJS · 本周约 +2,400 Star

Slack、Linear、Notion、HubSpot 各自都不差,问题是拼在一起靠 MCP 和 Zapier,公司状态散在几个 SaaS 里,人来回切换,agent 更是哪边都看不全。Macro 的做法是干脆做成一个:邮件、聊天、文档、任务、通话、CRM 和 agent 装进同一个工作区,所有东西用 @ 互相引用,文档和任务、频道消息和邮件之间的交叉引用原生存成双向图,人和 agent 查的是同一份上下文。团队在纽约和多伦多,15 个人自己用了两年才开源。

几人到几十人、愿意整体换掉现有工具的初创团队才谈得上迁移;已经在老工具链上沉淀很深的,代价自己掂量。还有一点必须先看清楚:许可证是 AGPL-3.0,打算做闭源二次开发或者拿它对外做 SaaS 的公司,这条是硬约束。

8. TencentCloud/TencentDB-Agent-Memory — 团队级的 agent 记忆中枢

TencentCloud/TencentDB-Agent-Memory 项目预览

TencentCloud/TencentDB-Agent-Memory 项目预览

github.com/TencentCloud/TencentDB-Agent-Memory · 许可证以 LICENSE 文件为准(README 挂 MIT 徽章)· TypeScript · 本周约 +4,000 Star

同一个团队里,每个人的 agent 各记各的:同事上周踩过的坑、大家定好的代码规范,换个人换个工具就得重讲一遍。腾讯云这个项目把记忆从 agent 里抽出来做成独立服务,对话、文档、代码沉淀成四类可复用的资产——Chat Memory、Skill、LLM-Wiki、Code-Graph,多个 agent 和框架接同一个记忆服务器,共享的内容还能治理。

部署是 memory-core、memory-hub、proxy 三件套,一条命令拉起,带本地面板。想把「团队知识」而不是「个人聊天记录」沉淀下来的多人团队适合,个人用户嫌重——光是 Node 22.16 以上加自建三个服务就够折腾。许可证有个小坑:README 挂的是 MIT 徽章,GitHub 却没把它识别成标准协议,商用前自己翻一遍 LICENSE 文件。

本周小结

八个项目里没有一个是新的基础模型,这件事本身就是本周最大的信号。热度整体挪到了中间层:给 agent 装记忆(semantica、TencentDB Agent Memory、macro 的共享记忆),装技能(diagram-design 那套画图规则),装路由(Switchyard),装代码理解(code-graph-rag)。周榜前三尤其像一件事的两种解法——diagram-design 是人把经验写成规则喂给 agent,prime-agent 是让 agent 自己把有效套路沉淀下来,两边都在承认同一个前提:模型已经够聪明了,难的是让它每次都稳定发挥。

另一条线在往小里走。Needle 2 把工具调用压进 14MB,意味着「小到能塞进手表」的模型不再是玩具级的演示,而是端侧 agent 可以认真考虑的选项。

所以如果你已经在用编码 agent,这周更值得花的时间是给它配技能和记忆,而不是又换一个模型;如果你在企业侧做落地,semantica 和 TencentDB Agent Memory 代表的这层「能治理、能追溯的记忆」,今年大概率绕不过去。最后提醒一句:上榜不等于能用,Switchyard 自己都写了别上生产,macro 是 AGPL-3.0,动手前先看许可证和成熟度。

via: GitHub Trending 周榜、各项目 GitHub 仓库主页与 README;Star 数与本周增量截至 2026-08-16,核实于 2026-08-16