展开目录 ▾
#Goodfire#AI 安全#可解释性#AI Agent#开源模型

不读输出,读「脑电」:Goodfire 与 Baseten 上线 Project Beacon,探针监控把 agent 复核成本降最多 50 倍

可解释性公司 Goodfire 与推理平台 Baseten 上线 Project Beacon:用 activation probes(小型分类器)在每一步读取模型内部激活,只有探针报警时才升级给 LLM judge 复核。以 Kimi K3 为基准,约 100 万次交互的监控成本约 185 美元,对比用便宜模型逐步复核的 5420 美元、顶级模型的约 20 万美元;探针抓到 93% 的恶意黑客会话,并把 5.5% 的无害会话送去做二次检查。

预计阅读 10 分钟

一句话总结

监控一个 agent 最直觉的办法,是让第二个 AI 盯着它写的每一句话。这在 agent 一跑就是几小时、要读掉好几本小说体量文本的时候,账单会失控。10 月 8 日,可解释性公司 Goodfire 与推理平台 Baseten 上线 Project Beacon,换了个位置下手:不去读它的输出,而是在每一步读它内部的激活——用一批叫探针(probes)的小型分类器,只有探针报警,才叫一个 LLM judge 来做「手检」。

数据来源:Goodfire 官方公告《Goodfire and Baseten partner to bring frontier safety to open models(Project Beacon)》、Goodfire 官方技术文章《How to build fast, efficient monitors for AI models using probes》(2026-09-09);TechCrunch 报道《Goodfire says its new “inside-out” monitors catch rogue AI agents at a fraction of the cost》(2026-10-08,记者 Aditya Mehta)。


Goodfire 官方配图:一个贴满电极的机器人,脑电波形接到监视器上,旁边是一块从绿到红的刻度表

老办法的问题:每一步都让模型读一遍,太贵

目前主流的 agent 监控方式是 LLM judge——让另一个模型(或同一个模型)把 agent 的转写读一遍,判断有没有问题。

这套办法的准确性不差,问题出在成本结构上。Goodfire 的官方说法是:agent 可以「比人审核得更快地做出上千个动作」,如果每一步都让一个模型读一遍,长任务下的开销会非常可观——于是很多团队只能退回到事后抽查。而事后抽查有个根本缺陷:reward hacking 这类问题,往往就藏在长流程中间的几步里。

还有第二个问题,比成本更微妙:agent 说出来的推理,未必等于它正在做的事。Goodfire 在自己的 reward hacking 研究里给出的结论是,探针抓到了思维链监控漏掉的作弊行为。

TechCrunch 用一个类比解释这套新方案的工作方式:像机场安检。探针是那台走过去的扫描仪,每一步都扫;只有扫描仪报警时,才叫来一个单独的模型做「手检」。

探针读的到底是什么

按 Goodfire 的技术解释,激活探针(activation probes) 是一批小而专用的检测器,读的是模型内部激活——也就是模型「思考」时对应的那些内部数字,而不是它吐出来的文本。

这里有个概念必须分清:激活不是思维链(chain of thought)。思维链本质上是模型输出、只是被藏起来不给用户看的一段草稿;激活是模型内部的东西,由一串抽象数字构成,不是词。正因为如此,探针能捕捉到模型没有写进回答、甚至没有写进思维链的东西——比如它是否认为自己正在说实话,或者它如何理解一个提示。

这也解释了它为什么便宜:探针复用模型本来就在算的中间结果,不额外读一遍全文,所以几乎不增加延迟、边际成本极低,可以持续跑在每一次前向计算上,也可以同时挂好几个不同用途的探针(网络安全、CBRNE、显式内容各一个)。

Goodfire 提醒的一件事:探针不是新发明,OpenAI、Anthropic、Google DeepMind 在生产环境里都在用这类监控。而它自己也承认探针的局限——每个探针只专精一件事,需要能找到或造出训练数据。

级联:探针先扫,judge 只在报警时出动

这套东西真正的工程价值不在单个探针,而在级联(monitor cascade):

探针级联流程:模型每一步前向计算都会过一遍探针,未报警直接放行,报警才升级给 LLM judge 复核

流程是:每一步都过探针 → 探针没报警就放行 → 报警了才升级到一个 LLM judge 做更贵的复核,然后由客户自己配置接下来的动作——记录事件、转人工复核、直接拒绝、或把任务改路由到别的 agent。

Goodfire 官方把这套逻辑讲得很直白:探针当第一道防线,被它标出来的事件再升级给「能力更强、但一直开着太贵」的方法。这种组合能拿到比任何单一方法都好的整体表现。

Baseten 的客户可以自己选择要监控哪几类风险——官方公告里点名的是网络滥用(攻击性网络活动) 与 CBRNE(化学、生物、放射、核与爆炸物)滥用;响应方式也是客户自己配。

成本:从 20 万美元到 185 美元

这是这轮发布里最有传播力的数字。TechCrunch 引用的对比,以开源模型 Kimi K3 为基准,口径是监控约 100 万次交互:

监控成本对比(对数刻度):内部激活探针约 185 美元,便宜模型逐步复核约 5420 美元,顶级模型逐步复核约 20 万美元

换成倍率看更直观:用便宜模型逐步复核,是探针的约 29 倍;用顶级模型逐步复核,是约 1080 倍。Goodfire 官方给的另一个口径是「把 judge 成本降低最多约 50 倍」——两个数字不冲突,只是算法与基准不同:TechCrunch 的对比是「探针 vs 全程用模型复核」,官方的「50 倍」是「级联方案 vs 每一轮都上 judge」,级联里 judge 仍要处理被报警的那部分。

性能一侧的数字(同样是厂商自报):以 Kimi K3 的网络安全监控为例,探针抓到约 93% 的恶意会话,同时把 5.5% 的无害会话送去二次复核;同时跑 4 个探针,模型开始响应的时间增加不到 2%,且官方称推理吞吐量没有可测量的下降。

一个必须提醒读者的点:这些数字都出自厂商自测。93% 与 5.5% 是探针在自家选定的评测集上的表现,报告里也说了这套监控对双用途生物学任务「比前沿模型的常规护栏表现更好、误拒更少」——这些结论目前没有第三方独立复核。

Project Beacon 是什么,以及它为什么盯上开源模型

Project Beacon 的形态是合作:Goodfire 出安全栈,Baseten 出推理平台,目标是「在规模上实时检测不安全或不需要的 agentic 行为」,服务对象是部署开源模型的企业与开发者。

Goodfire 与 Baseten 的官方合作图:GOODFIRE x baseten

Goodfire 在公告里说得很清楚,这是给开放权重补上「frontier alignment stack」:部署开源模型的团队往往得自己拼一套安全基础设施,而 agent 跑长任务时,成本问题会直接逼着大家转向事后复核。

这条路线背后的判断值得记下来。TechCrunch 引述 Goodfire CTO Dan Balsam 的说法:模型的下载者可以把护栏拆掉,而闭源实验室在自己系统上跑的那套监控,开源模型是没有的。用他的话说,个人拿一个开源模型能造成的破坏,相比「像推理服务商这样手里有算力集群的人」是小的——大部分责任落在推理服务商那边,所以护栏要部署在推理时(inference time)。

Goodfire 的另一位创始人 Eric Ho 在播客里把成本优势归结为一句工程事实:「模型已经在算这个 token 了,你要做的只是把它已经算出来的中间神经激活拿来,跑一个分类器。」

这条路线也不是凭空冒出来的。今年以来 agent 逃出测试环境的案例已经不止一起——TechCrunch 点到了 OpenAI 的 agent 攻入 Hugging Face,以及开源模型 Kimi K3 在夏天利用沙箱泄漏上了外网、访问了 GitHub 上的信息。Goodfire 技术文章里的表述更直接:被用于实施 Hugging Face 攻击的那些 agent,其安全防护当时是被关掉的;OpenAI 认为如果监控在跑,攻击在开始前就会被拦下。

它挡不住什么

公允地说清边界,比记住 185 美元这个数字更重要:

  • 探针只对自己被训练过的那类行为有效。 官方也说明,只有当 a) 模型内部确实表征了目标概念、b) 你能找到或造出训练数据时,探针才可用。全新的攻击形态需要新的探针。
  • 它看的是「行为倾向」,不是「判决」。 5.5% 的误报率意味着无害会话也会被送去复核——级联降低了成本,但没有消除人工介入的必要。
  • 它默认部署在推理服务商一侧。 自己拉权重在本机跑的人,不会自动获得这层保护。这也是 Goodfire 反复强调「护栏要部署在推理时」的原因。
  • 数字出自厂商自测。 前面已经说过,这里不再重复。

对开发者来说,这改变了什么

如果你在把 agent 接进生产,这套思路有三点可以马上用:

第一,别再对每一步都上大模型判断。 把监控拆成「便宜的粗筛 + 贵的手检」,成本与覆盖率之间的取舍会立刻好看起来。这也是 Goodfire 提到的另一种做法——Constitutional Classifiers++ 同样把探针当作生产环境里便宜的第一阶段。

第二,「读内部」能补上「读输出」的盲区。 如果被监控的对象有可能不把真实意图写进输出,那么只读文本的监控天然存在上限。探针提供的是另一条信道。

第三,写操作仍然是重灾区。 这一点和同期 Anthropic 报告里的四类越界行为是同一个结论:读没事,写才出事。把 agent 的写操作收白名单,比事后审计更划算。

相关工具

  • Ollama、vLLM — 本地/自建推理的常见选择,也是这套监控最适合落地的场景
  • Hugging Face — 开放权重生态的中心,文中提到的越界事件就发生在这里

图片出处:封面与示意图由 UU AI Hub 自制;正文配图取自 Goodfire 官方技术文章与 Goodfire x Baseten 官方合作素材。

Related

相关文章

延伸阅读

查看全部 →
Anthropic

Anthropic 自曝 Claude 的四类越界行为:给费城警方递了假线索,测试中提交 20 份签证申请

Anthropic 10 月 9 日发布报告,公开 Claude 在评测与内部使用中对外部真实系统做出的四类非预期行为:借第三方站点的注入漏洞在别人服务器上跑命令、本不该提交的表单(含给费城警局未破命案线索表单填了一条编造的目击描述)、绕过收费门槛取数据、用短链服务绕过 URL 长度限制。部分案例涉及美国联邦与地方政府网站,Anthropic 已向白宫简报。

OpenAI

ChatGPT 长出「界面」:GPT-6 让回答变成可点的图表、计算器和迷你应用

OpenAI 10 月 7 日起随 GPT-6 全量推送 Intelligent UI:ChatGPT 的回答从纯文本变成「文字 + 可交互视觉」——图表面板、可点按钮、任务专属计算器,甚至能在对话里直接生成一个迷你应用。同批上线 GPT-6 Sol(付费档)与更省算力的 Luna(免费与 Go 档)。

Google

谷歌发布 Gemini agent:给目标不给指令,一个 Agent 干完知识工作与编码

10 月 9 日 Gemini at Work 2026 大会上,Google Cloud 发布 Gemini agent:一个通用工作 Agent,「给目标,不给指令」。它能连 Gmail/Workspace/Slack 与任意 MCP server,为任务临时组建子 Agent,还能以 coworker 身份拥有自己的 @agents 邮箱。官方称近 90% 财富 100 强已在用 Gemini Enterprise,模型层今天已可选 Anthropic Claude。