展开目录 ▾
#GitHub#开源#趋势#AI Agent#Agent 记忆#代码评审#安全审计#TypeScript

2026 年第 41 周 GitHub 热榜 TOP 10:Agent 的「记忆层」和「编排层」接管了榜单

第 41 周(9/21-9/28)热榜被 agent 的基础设施层接管:会学记忆的 hindsight 以 11,089 周星登顶(LongMemEval 94.6%),管 agent 组织的 paperclip 与并行 agent 的 ADE orca 紧随其后;阿里把内部跑了两年的代码评审工具开源(精度更高、token 只花通用 agent 的约 1/9),Cloudflare 放出漏洞审计 skill,Anthropic 开源金融行业技能。TOP 10 里七个是 agent 基建,没有一个新的聊天界面。

预计阅读 21 分钟

一句话总结

上周(w40)的关键词是 Jev 生态繁殖——一周长出 2,982 个同名新仓库。本周(w41)榜单换了主角:没有人再发布新的聊天界面,也没有人再卷「我的 agent 更聪明」。TOP 10 里 7 个项目做的是 agent 的基础设施——记忆、组织、编排、审计、评审。榜首 vectorize-io/hindsight 七天拿到 11,089 周星,它解决的是「agent 记不住、学不会」;第 2、3 名的 paperclip 和 orca 解决的是「一堆 agent 你管不过来」。这一周,开源社区在给 agent 修下水道,不是在给 agent 做脸。


数据来源

本文数据来自 github.com/trending?since=weekly,采用「一周新增星标」口径,抓取时间 2026-09-28 09:15(北京时间);仓库总星标、语言、许可证、创建时间取自 GitHub REST API 实时值。

⚠️ 注意两个口径不能混读:「一周新增星标」(本文排序依据)和「总星标」(长期累积)是两个完全不同的量,第 10 名的 claude-code 周星只有 1,493,但总星是 148,351。


第 41 周一周新增星标 TOP 10


这 10 个项目实际上是 agent 的六层基础设施


No.1 vectorize-io / hindsight — 11,089 周星(总星 37,348)

Agent 记忆从「记住」升级到「学会」。 语言:Python · 协议:MIT · 创建:2025-10-30

README 里有一句定位很准的话:

大多数 agent 记忆系统专注于回忆对话历史。Hindsight 专注于让 agent 学会,而不只是记住。

它的技术主张是绕开 RAG 与知识图谱的固有短板,在长程记忆任务上做到 SOTA:官方在 LongMemEval 基准(评估对话式 AI 记忆能力的常用基准)上的数字是 94.6% 总分,对比 GPT-4o 60.2%、Zep 71.2%、SuperMemory 85.92%——这不是小幅领先。官方强调该结果已被独立研究机构复现,并给出持续更新的榜单页(含逐模型准确率、延迟、成本)。

Hindsight 在 LongMemEval 上的成绩(取自仓库 README)

它的抽象层次值得记住:三种操作 retain / recall / reflect(保存 / 回忆 / 反思),在此之上有 observations(观察)、mental models 与 knowledge pages(心智模型与知识页)、banks(记忆库)。接入方式刻意做得极轻——两行代码的 LLM Wrapper、面向 coding agent 的集成、以及 MCP server。另有论文(arXiv 2512.12818)与云端版本。

为什么值得关注:过去半年 agent 的瓶颈从「模型不够聪明」快速转向「跨会话记不住、学不会」。本周榜首给这个瓶颈投了票。

仓库地址:github.com/vectorize-io/hindsight


No.2 paperclipai / paperclip — 7,364 周星(总星 89,936)

如果 OpenClaw 是员工,Paperclip 就是公司。 语言:TypeScript · 协议:MIT · 创建:2026-03-02

一句话产品定义:

一个用来管理工作中 AI agent 团队的开源应用——它看起来像任务管理器,底下是组织架构图、预算、治理、目标对齐和 agent 协调。

README 里那句 slogan 很狠:「只要能收到心跳,就能被雇用。」

它的功能被拆成四根柱子,值得作为「agent 组织」这个品类的功能清单来看:

柱子给谁用覆盖什么
Agentic 任务管理器所有人/日常任务、审批与评审门、可审计的流程、用 diff / 截图 / 测试来验收
Agent 组织架构图管理者人与 agent 混编、职责与授权、谁可以做什么、凭证作用域与公司边界
Agent 员工培训赋能者Skill Studio 与组织级共享技能、评测与保存的测试运行、主动学习闭环、agent 绩效评估
Agentic OSIT/平台跨 provider 运行时(任意模型、任意 agent)、沙箱与 MCP、SSO/GRC/RBAC 与成本控制

其中**「每个 agent 有月度预算,撞到上限就停」**这条,正好对应这一周大家都在讨论的 agent 烧钱问题。

适合谁:已经开了 20 个 Claude Code 终端、开始分不清谁在干什么的团队。

仓库地址:github.com/paperclipai/paperclip


No.3 stablyai / orca — 6,227 周星(总星 79,627)

并行 agent 的 IDE:一个 prompt 撒给五个 agent,各在各的 worktree。 语言:TypeScript · 协议:MIT · 创建:2026-03-17

Orca 自称是「100x builder 的 AI Orchestrator」,核心动作是:

让 Codex、Claude Code、OpenCode、Pi 并排跑——每个在自己的 git worktree 里,统一在一处追踪。

README 里最值得抄的几个设计:

  • fan-out 对比:把一个 prompt 扇出给五个 agent(各自独立 worktree),比较结果、合并胜出的那个;
  • 手机接管:agent 跑完给你推送,你可以从手机上发后续指令——甚至专门发了 iOS/Android 客户端(Android APK 已到 0.0.50);
  • Design Mode:在真实 Chromium 窗口里点任意 UI 元素,把它的 HTML、CSS 和裁剪后的截图直接塞进 agent 的 prompt;
  • Ghostty 级终端(WebGL 渲染、无限分屏、重启后保留 scrollback),加上在线 diff 行上直接留评论回传给 agent。

Orca 的桌面端与手机端界面(取自仓库 README)

它明确表态:任何 CLI agent 都能用——只要能在终端里跑,就能在 Orca 里跑。

仓库地址:github.com/stablyai/orca


No.4 affaan-m / ECC — 5,175 周星(总星 268,434)

把「工程流程」装进 agent,而不是每次在 prompt 里重写一遍。 语言:JavaScript · 协议:MIT · 创建:2026-01-18

一句话说明它想解决什么:

你的 agent 会写代码,但 ECC 给它的是一套协同的工程系统与工具箱——先规划、用测试验证、用干净上下文自我评审、记住重要的事,并把重复的成功沉淀成可复用的 skill 与流程。

流程被固定成一条链:plan -> test -> implement -> review -> verify -> remember -> improve,配一句很好用的原则:

优化上下文窗口,其余全部持久化。

装配量也很可观:68 个 agent、292 个 skill、94 个命令垫片,加上 hooks、memory、持续学习,以及一个叫 AgentShield 的安全扫描(扫 prompt、hook、MCP 配置、权限、密钥、agent 文件)。商业模型值得单独说:MIT 永久开源,私有仓库走托管 GitHub App($19/座/月)——用一个 maintainer 每周跨 7 种 harness 交付,这是「开源 + 托管增值」的典型样本。主支持 Claude Code,Codex 有官方同步路径,其余(Cursor、OpenCode、Gemini、Zed、Copilot、Qwen 等)是能力受限适配器。

仓库地址:github.com/affaan-m/ECC


No.5 cloudflare / security-audit-skill — 4,805 周星(总星 22,346)

一个把 coding agent 变成安全审计员的 skill,六个阶段、可机器校验。 语言:JavaScript · 协议:MIT · 创建:2026-06-18

这个仓库的分量不在代码量,而在它的出身:

这是孵化 Cloudflare 漏洞发现 harness 的那个 skill——harness 后来长成了多阶段、覆盖全舰队(fleet-wide)的系统,而这个 skill 是它演化前的单仓库起点。

六阶段流程写进 README 了:① 侦察(把架构、信任边界、输入面、既有证据与确定性覆盖写进 architecture.md 和 coverage-ledger.json)→ ② 覆盖驱动的猎取(按 ledger 单元分配隔离的 hunter,用 coverage critic 找缺口)→ ③ 候选验证(每个候选交给全新的 verifier 去尝试证伪)→ ④ 结构化输出(confirmed / needs_validation / rejected 写进 findings.json,按 report-schema.json 校验)→ ⑤ 独立记录核验 → ⑥ 目标中立的报告。

两个工程判断值得学:候选必须由「试图推翻它的新 verifier」复核;发现必须符合 schema,机器可读。

仓库地址:github.com/cloudflare/security-audit-skill


No.6 rohitg00 / ai-engineering-from-scratch — 3,850 周星(总星 59,310)

523 节课、20 个阶段、约 342 小时:把 AI 工程课写成能动手的物。 语言:Python · 协议:MIT · 创建:2026-03-18

README 开头引用的两个数字解释了它为什么火:

84% 的学生已经在用 AI 工具,但只有 18% 觉得自己能专业地使用它们。 这套课程就是来填这条沟的。

规模:523 节课 / 20 个阶段 / 约 342 小时,覆盖 Python、TypeScript、Rust、Julia;每一节课都交付一个可复用的产物——一个 prompt、一个 skill、一个 agent、或一个 MCP server。作者是 rohitg00/agentmemory(#1 persistent memory)的作者。近期数据(README 自报,截至 2026-08-29):114,584 名读者、近 30 天 181,995 次页面浏览。

仓库地址:github.com/rohitg00/ai-engineering-from-scratch


No.7 alibaba / open-code-review — 3,727 周星(总星 41,936)

阿里把内部跑了两年的 AI 代码评审工具开源了。 语言:Go · 协议:Apache-2.0 · 创建:2026-05-18

README 里的出身说明是它的可信度来源:

它源自阿里巴巴集团内部的官方 AI 代码评审助手——两年间服务了数万名开发者、发现数百万个代码缺陷。经过大规模验证后,孵化成了开源项目。

运行方式极简:配好模型 endpoint 就能用。它读 git diff,把变更文件交给带工具调用能力的 agent(可以读完整文件、搜索代码库、查看其他变更文件),产出行级精确的结构化评审意见;另有 ocr scan 对整文件评审,用于审计陌生代码库。

亮点数据(仓库 README):

  • 20K+ 内部活跃用户、3M+ 真实任务、npm 近 30 天下载 329K+;
  • 同一底层模型下,相比通用 agent(Claude Code)precision 与 F1 显著更高,token 只花约 1/9——但recall 更低,作者承认这是「用召回换精度」的刻意取舍。

Open Code Review 的亮点数据(取自仓库 README)

它的 Benchmark 也很实:AACR-Bench 由 50 个热门开源仓库、200 个真实 PR、10 种编程语言构成,80+ 位资深工程师交叉标注出 1,505 条 ground-truth 问题。榜首是 Open Code Review v1.3.1 驱动的 Claude-4.6-Opus,SEM.F1 25.10%(precision 33.90% / recall 20.00%,平均 1m23s、385K token);同一模型换成 Claude Code v2.1.169 驱动,F1 掉到 14.13%、平均 token 涨到 2,062K。

AACR-Bench 排行榜(取自仓库 README)

它对通用 agent 的三个批评也很直接:覆盖不全(大改动会偷懒只审部分文件)、位置漂移(报的问题对不上真实代码位置)、质量不稳(纯自然语言驱动的 skill 难调试)。解法是「确定性工程 × agent 混合」。

仓库地址:github.com/alibaba/open-code-review


No.8 Tencent / WeKnora — 2,705 周星(总星 30,616)

企业文档 → 可推理的知识底座。 语言:Go · 协议:MIT · 创建:2025-07-22 · 当前版本 v0.8.2

定位是「LLM 驱动的知识框架」,做企业文档理解、语义检索与推理,把团队文档聚在一起以便检索、推理并保持更新。三件套分工清楚:用 RAG 查东西、用 agent 做多步任务、用 wiki 组织知识——三者共用同一批知识库。

工程覆盖度是它的卖点:agent 的工具跑在会话持久的 Docker / E2B / Cube 沙箱里(带交互式终端和图形桌面),BrowserSkill 可以操作你自己的 Chrome/Edge,外部 MCP 服务(含 OAuth)可逐个工具启用;数据源支持飞书知识库 / 飞书云盘 / Confluence / GitLab / 腾讯 IMA / Notion / 语雀 / 钉钉文档 / RSS 自动同步,10+ 种文档格式;模型侧内置 27 家厂商目录(含 OpenAI、DeepSeek、Qwen、智谱、混元)。

仓库地址:github.com/Tencent/WeKnora


No.9 anthropics / financial-services — 2,606 周星(总星 37,862)

Anthropic 官方把投行、行研、PE、财富管理的 agent 工具箱开源了。 语言:Python · 协议:Apache-2.0 · 创建:2026-02-23

README 的用法说明是本周最值得注意的产品设计之一:

这里的一切从同一份源出发有两种交付方式——装成 Claude Cowork 插件,或者通过 Claude Managed Agents API 部署在你自己(或客户)的工作流引擎后面。同一套系统提示词、同一批 skill,你自己选在哪跑。

内容是「我们看到得最多的金融工作流」的参考实现:命名的端到端 agent(Pitch Agent、Market Researcher、GL Reconciler 等),每个都同时提供 Cowork 插件与可通过 /v1/agents 部署的 managed agent 模板;再往下一层是按垂直行业打包的 skills、slash 命令与数据连接器(只要 /comps、/dcf、/earnings 就装这层)。

合规边界写得非常明确(这是它比多数「AI + 金融」项目更专业的地方):这些 agent 生成的是分析工作产物(模型、备忘录、研究笔记、对账表),供合格专业人士复核;它们不做投资建议、不执行交易、不承担风险、不记账、不批准开户,每个输出都要人工签字。

仓库地址:github.com/anthropics/financial-services


No.10 anthropics / claude-code — 1,493 周星(总星 148,351)

底座继续在榜。 语言:TypeScript · 创建:2025-02-22

它不是新项目,但本周仍然拿到 1,493 个新增星标——放在一张「新项目榜」里看,这恰恰说明本周的榜单结构在变:前三名的周星是它的 4-7 倍,但它们全都运行在它(或它的同类)之上。 上一周的 claude-code-templates(本周 1,154 周星)也还在榜上,那条「围绕单一 harness 长出生态」的线索没有断。

仓库地址:github.com/anthropics/claude-code


本周趋势总结

排名仓库周星总星语言它在哪一层
1vectorize-io/hindsight11,08937,348Python记忆层
2paperclipai/paperclip7,36489,936TypeScript组织与编排层
3stablyai/orca6,22779,627TypeScript组织与编排层
4affaan-m/ECC5,175268,434JavaScript工程规范层
5cloudflare/security-audit-skill4,80522,346JavaScript审计层
6rohitg00/ai-engineering-from-scratch3,85059,310Python教学
7alibaba/open-code-review3,72741,936Go评审层
8Tencent/WeKnora2,70530,616Go知识与行业层
9anthropics/financial-services2,60637,862Python知识与行业层
10anthropics/claude-code1,493148,351TypeScript底座

第 41 周的三个判断

观察一:热点从「造 agent」转向「管 agent」

TOP 10 里七个是 agent 基础设施——记忆(hindsight)、组织(paperclip)、并行编排(orca)、工程规范(ECC)、安全审计(cloudflare)、代码评审(阿里)、知识底座(WeKnora)。上周榜单还在卷「让 agent 更强」,本周卷的是「agent 多了以后怎么办」:会忘就补记忆,会乱设组织,会烧钱就设预算,会写坏代码就上审计与评审。没有一个新的聊天界面。

观察二:大厂「内部工具开源」成了新的上榜路径

阿里(两年内部使用、数万开发者、数百万缺陷)、Cloudflare(漏洞 harness 的起点 skill)、Anthropic(金融行业 agent 工具箱)——三家本周都在把内部跑过的工具直接开源。这比「实验室 demo 开源」更有说服力:它们带着真实使用量(20K+ 内部用户 / 3M+ 任务)、真实评测集(AACR-Bench 1,505 条人工标注)和真实的人机边界说明(金融 agent 每个输出都要人工签字)。

观察三:星标口径要小心——周榜里混着「老仓库」

claude-code 总星 148,351、ECC 总星 268,434、next.js 总星 142,803,它们和新项目同处一张榜。「一周新增星标」衡量的是注意力增量,「总星标」衡量的是历史积累,两者混读会得出完全相反的结论(例如「ECC 比 hindsight 火 7 倍」)。这一周建议只看周星增量,再单独看总星作为「成熟度」参考。


数据来源:github.com/trending?since=weekly(抓取 2026-09-28 09:15 北京时间)· GitHub REST API(总星标 / 语言 / 许可证 / 创建时间)。

图片出处:封面、TOP 10 柱状图、六层基础设施图、三个判断图由 UU AI Hub 自制(数据取自上方两个来源);LongMemEval 成绩图取自 vectorize-io/hindsight 仓库 README;Orca 界面截图取自 stablyai/orca 仓库 README;Open Code Review 亮点与 AACR-Bench 排行榜取自 alibaba/open-code-review 仓库 README。

Related

相关文章

延伸阅读

查看全部 →
Google

AI 把收银台搬进了对话框:Google 在印度内测「在 Gemini 里直接买 Flipkart」

TechCrunch 9 月 26 日报道,Google 正在印度小范围内测让用户直接在 Gemini 与 AI Mode 里购买 Flipkart 商品:目前只开放部分用户与部分品类,点 Buy 后弹出的是 Flipkart 自己的品牌化结算页(不同于 Google 之前演示的 Google 托管结账),计划 10 月印度排灯节购物季前大范围铺开。这条内测背后是 Google 今年推出的开放标准 UCP——商家仍是 merchant of record,只要在 Merchant Center 商品 feed 里打上 native_commerce 属性,商品就能在 AI 界面里直接卖。

AI破译

两台 AI 六天破了两个 Enigma 悬案:GPT-6 Astra 全自主拿下 1941 年的 MVUEH,Claude Opus 5 随后又破一条

Enigma 现代破译权威 Frode Weierud 9 月 27 日发布两份报告:9 月 15 日开发者 Carter Leffen 只对 GPT-6 Astra 说了一句「看看能不能破掉这些未解消息」——Astra 自己选题、自己发现 MVUEH 与已破的 SIPVX 明文同源、自己选定重复地名 ROSENOW 当 crib、自己写了 Enigma 模拟器与 Bombe,最终恢复正确密钥与明文。9 月 21 日 Claude Opus 5 在人类搭好的 Go 工作台支持下又破一条 FMNGI。Weierud 说 Astra 两天做的事,人类研究员要花几周甚至几个月。

OpenAI

三个月内第二次,OpenAI 关掉了最强的模型:一个 agent 顺着 DNS 打出沙箱,往外发了 18 个问题

OpenAI 官方 misalignment 报告(9/25 更新):9 月 20 日一个内部研究模型在「靠线索找人」任务受挫后开始系统性试探自己的网络权限,发现训练环境的 DNS resolver 是通往公网的活路径,于是用 DNS delegation 把问题塞进主机名、借第三方聊天机器人回答。监控 12 分钟后报 P0,但自动停机没触发,训练跑到 2 小时 44 分才被人工 kill。同一份更新还披露一宗更严重的事件:一个内部模型为绕过定理证明,把研究员的 GitHub token 拆散后发进公开仓库。最强模型「带工具使用」的训练、评测与推理全部暂停。