一句话总结
个人 AI 知识库不依赖某款特定软件——一个开放的文本文件夹、一个能操控文件的 Agent 工具、一份清楚的工作规则,再加上一个真实任务场景,就能搭建一套数据完全掌握在自己手里的 AI 知识体系。本文基于金尘马的实战经验,带你从 0 到 1 完整跑通。
为什么你需要一个 AI 知识库?
相信你手机里已经装了至少一个 AI 工具——豆包、DeepSeek、ChatGPT。但用了一段时间后,很多人都会有同样的感受:AI 还是不够好用。
问题不在 AI 本身,而在于你的资料散落在各处:
- 📑 好文章躺在收藏夹里吃灰
- 📁 文件分散在网盘、本地不同目录
- 💬 闪过的想法留在聊天记录里
- 📝 笔记散落在不同的软件里
每次需要 AI 帮忙,都要重新上传资料、重新解释背景。好不容易聊出一个不错的结果,它又只能留在对话框里。下次遇到相似的问题,一切从头开始。
这时候,你需要的是一个数据掌握在自己手里的 AI 知识库——让 AI 真正”理解”你的世界,而不是每一次都像陌生人一样重新认识你。
金尘马(金尘马),前大厂程序员,30 天 X 平台破万粉,专注于小白用得上的 AI 教程。本文核心思路来源于他的实战分享。
AI 知识库,搭的到底是什么?
很多人以为 AI 知识库就是”把文档扔给 AI”,但这个理解太窄了。
AI 知识库是一套由四个要素组成的工作方式:
| 要素 | 作用 | 举例 |
|---|---|---|
| 📄 文本文件 | 保存资料和知识 | Markdown、TXT 文件 |
| 👁️ 阅读软件 | 让人阅读、检查、修改 | Obsidian、VS Code |
| 🤖 Agent 工具 | 读取、整理、查询、更新内容 | WorkBuddy、Codex、Claude Code |
| 📋 工作规则 | 告诉 Agent 怎么干活 | 规则文件(只读约束、来源标注等) |
这套思路可以追溯到 Andrej Karpathy(前 OpenAI 联合创始人、前 Tesla AI 总监)分享的 LLM Wiki。他把个人知识库分为三类内容:
- 原始资料(保留不动)——事实依据,只读不写
- 知识页面(AI 整理维护)——摘要、主题对比、阶段性结论
- 规则文件(告诉 Agent 怎么工作)——工作边界、权限、格式规范
最值得借鉴的是:每次提问和回答都可以继续更新知识库。长期积累下来的不只是一次聊天结果,而是一套能持续使用的知识体系。
搭建知识库,只需要准备四样东西
第一,一个开放的文本文件夹
“开放”是指资料以普通文件的形式存放——人能直接打开,Agent 也能读取,内容不依赖某一款软件。
格式上,强烈推荐 Markdown。它本身是纯文本,但能:
- 用
#标题区分层级 - 用
-列表整理要点 - 用
[链接]连接不同页面
更关键的是,Markdown 不绑定任何软件——今天用 Obsidian 打开,以后换成其他工具,底层文件还在。
Markdown 不会自动把资料变成知识,但它是一个足够稳定、足够开放的载体。
第二,一个真实任务 + 一小批相关资料
不要一开始就把所有资料无脑灌进来。 知识库要先服务一个明确的任务,再放入与之直接相关的资料。
- 做写作知识库?先放旧文章、选题笔记、研究材料
- 做项目复盘库?先放项目文档、会议记录、复盘总结
⚠️ 安全提醒:资料先从非敏感内容开始。身份证件、私人聊天、客户机密等高风险材料,先不要导入。
第三,一个能操控文件的 Agent 工具
有了文件,还要让 AI 真正”进入”文件夹工作。
选择 Agent 工具时,看三个关键能力:
- ✅ 能否读取指定文件夹
- ✅ 能否按规则整理和更新文件
- ✅ 修改之前能否让人检查和确认
推荐工具:WorkBuddy、Codex CLI、Claude Code、Cursor 等。
Obsidian 在这里的角色是阅读和检查——Agent 负责干活,阅读软件负责让人看见结果。
第四,一份清楚的工作规则
Agent 能看到文件,不代表它就知道怎么维护知识库。你需要用一份规则文件告诉它边界:
# AI 知识库工作规则
1. 原始资料只读取,不覆盖
2. 整理出的知识页面保存到指定位置
3. 回答问题时标明使用了哪些来源
4. 找不到或资料不足时明确说明,不自行补全
5. 遇到删除、覆盖和拿不准的内容,先询问再处理
规则的作用,是把一个通用的 AI 工具,变成知道边界的知识库助手。
从 0 到 1,五步跑通你的第一个 AI 知识库
第一步:选择一个真实任务
先回答一个问题:这套知识库最近准备拿来做什么?
写作、学习、项目复盘——选一个就够了。真实任务会反过来决定:
- 资料应该放什么
- Agent 需要怎样整理
- 最终要输出什么
没有任务,分类越做越多,最后却不知道怎么用。
第二步:建立最小文件结构
在知识库文件夹里,只需要三个核心目录:
my-knowledge-base/
├── raw/ # 原始资料(只读)
│ ├── articles/ # 收藏的文章
│ └── notes/ # 原始笔记
├── knowledge/ # AI 整理的知识页面
│ ├── topics/ # 主题总结
│ └── insights/ # 阶段性结论
├── rules.md # 工作规则
└── README.md # 知识库说明
名字不需要照搬模板,只要自己和 Agent 都能看懂就行。
📋 附:可直接复制使用的提示词模板
如果不想自己从头设计目录和规则,把下面这段提示词交给你的 Agent 工具(把方括号里的内容换成自己的实际情况):
我想搭建一个个人 AI 知识库,请根据下面的信息,帮我设计第一版的知识库架构规范。
使用场景:[写作 / 学习 / 项目复盘 / 其他]
现有资料:[简单说明资料类型和大致数量]
常见任务:[希望 AI 帮我完成的事情]
请按下面的要求设计:
1. 架构只保留第一版真正需要的内容,至少区分原始资料、知识页面和规则文件,不要一开始加入复杂分类。
2. 说明每个目录和文件分别放什么、由谁维护,以及 Agent 是否可以修改。
3. 原始资料默认只读,不删除、不覆盖。AI 整理出的内容保存为新的 Markdown 文件。
4. 知识页面需要保留来源。资料不足或存在冲突时,明确标注,不自行补全。
5. 修改、移动或删除文件以前,先列出计划,等我确认以后再执行。
最后请输出:
1. 推荐的最小目录结构
2. 每个目录和文件的用途
3. 一份可以直接保存为规则文件的内容
4. 第一个适合用来测试知识库的任务
先只输出方案,不要直接创建或修改文件。
拿到方案后,先看看目录是否符合自己的使用习惯,再让 Agent 创建文件。
第三步:让 Agent 读取知识库
把这个文件夹交给你的 Agent 工具。关键安全原则:
- 🔒 刚开始只开放当前知识库目录,不要直接给整个电脑的权限
- 🔍 第一次先让它查看目录和文件,说明有哪些资料、可能分成哪些主题
- ⏸️ 这一步的目标只是确认 Agent 能正确读取,不急着改文件
如果读取失败,先检查文件夹位置和授权范围,不需要马上研究复杂的技术方案。
第四步:给它第一项具体工作
不要只说「帮我整理一下」。 把任务说具体:
❌ “帮我整理写作资料”
✅ “读取
raw/articles/下的三篇文章,围绕「AI Agent 的未来趋势」这个主题,整理每篇文章的核心观点,对比它们的异同,找出还可以继续深入写的角度。结果保存到knowledge/topics/ai-agent-trends.md,在结论旁标注每一条的来源。”
要求它:先读取指定资料(不修改原文件),围绕明确问题整理,保留来源,涉及删除和覆盖时先征求确认。
第五步:把有价值的结果写回去
这是最关键的一步,也是大多数人没有做到的。
很多人使用 AI 的结果没有积累下来,就是因为「聊完即止」。一份有价值的回答,应该保存回知识库。
下次再提出相关问题时,Agent 就能:
- 先查已有页面
- 再结合新资料更新
- 而不是重新生成一份彼此无关的新答案
做到这里,第一版就算初步跑通了 ✅——Agent 能根据已有资料回答真实问题、返回来源、结果可以随时再打开使用。
第一版之后,知识库怎么慢慢迭代?
答案很简单:让它持续参与真实工作。
- 资料进来 → Agent 整理
- 遇到问题 → 先查知识库
- 有价值的结论 → 写回知识库
用得多了,问题自然会出现,规则自然需要完善:
| 遇到的问题 | 对应的规则升级 |
|---|---|
| 文件变多不好找 | 统一文件名规范 + 增加索引页 |
| 页面间缺乏关联 | 增加 Wiki 链接,连接相关主题 |
| Agent 反复创建相似内容 | 规则中加入查重要求 |
| 重要结论找不到出处 | 要求每次整理都保留来源链接 |
| 需要跨主题语义搜索 | 可以了解 RAG、向量检索等进阶方案 |
⚠️ 金尘马的建议:第一版先把目录和规则理清,用 Agent 跑一个真实任务。以后遇到具体问题,再增加对应的规则和能力。 不要一开始就追求完美——过度设计是最大的坑。
总结
回过头看,个人 AI 知识库的第一版核心就是:把最小流程跑通。
- 🎯 选一个真实场景
- 📦 挑一小批非敏感资料
- 📂 建立一个开放的文本文件夹(优先 Markdown)
- 🤖 用 Agent 工具完成一次「读取 → 整理 → 查询 → 写回」
- 🔄 持续迭代,让规则跟随实际需求生长
工具以后可能会换,但那些能直接打开的文件、逐步完善的规则、不断积累下来的知识——仍然属于你自己。