我是如何用AI管理1400+篇文章库的 · 知识工程
老谭用AI管理1400+篇文章库的实战指南,从下载到标签体系全流程拆解,内容创作者的知识工程干货。 核心内容: 1. 文章库管理的背景与差异化需求 2. 批量下载与本地化处理的工具及优化方法 3. 7维标签体系设计逻辑
我是如何用AI管理1400+篇文章库的· 知识工程
从下载到标签,一个人的知识工程
DOODLE从信息囤积到知识资产,只差一套系统
AI工作流知识管理大家好,我是老谭。
今天想和你们聊一个很"实在"的话题——我是如何用AI管理我这1400多篇公众号文章的。
这不是一篇空泛的方法论,而是一个真实的案例:从文章下载、到标签体系设计、再到索引系统搭建,我把整个过程拆给你看。
如果你也在做内容创作,也有几百上千篇文章躺在云端不知道怎么用,这篇文章或许能给你一些启发。
01
PART
为什么要折腾这件事?
FROM HOARDING TO ASSET
三年公众号日更,我写下了1400多篇文章。
以前我也像大多数人一样,文章发完就完了,偶尔想找点素材,要么凭记忆翻半天,要么就放弃了。
去年12月,我做了一个决定:把公众号「老生常谭」改名为「AI Rollup」,聚焦AI方向。
同时新起了「老谭备忘录」,继承原来的泛话题风格。
两个号要形成差异化,就得清楚知道:
- 哪些素材更适合AI Rollup(AI-Rollup、组织AI化、RaaS等核心概念)
- 哪些更适合老谭备忘录(创业心法、认知成长、投资思考)
02
PART
第一步:批量下载,100%本地化
EXPORT EVERYTHING
要管理文章,第一步是把它们从微信后台"搬出来"。
我找到了一个开源项目:wechat-article-exporter(微信公众号文章批量下载工具)。
这个项目的原理很巧妙——利用公众号后台的"搜索其他公众号文章"功能,反向爬取自己公众号的所有文章。
它支持多种导出格式:
- HTML:100%还原排版和样式
- Markdown:方便后续编辑和索引
- JSON:结构化数据,便于程序处理
- Excel/Word:传统格式
我选择了Markdown格式,因为它既保留了文章结构,又便于后续的标签化处理。
但原版工具有个问题:下载速度慢,而且没法批量处理元数据。
于是我用Claude Code优化了这个项目:
- 增加了并发下载能力(用p-queue管理并发)
- 优化了HTML到Markdown的转换逻辑(基于Cheerio和Turndown)
- 添加了自动提取元数据的功能(标题、日期、URL等)
- 本地用IndexedDB缓存,避免重复下载
最终效果:1400+篇文章,全部下载到本地,耗时不到2小时。
这一步很关键——数据在自己手里,才能做后续的深度加工。
03
PART
第二步:设计标签体系,让AI能"读懂"文章
7-DIMENSIONAL TAGGING
文章下载下来了,但还是一堆散乱的文本文件。
真正的知识管理,需要结构化。
我花了一天时间,设计了一套「7维标签体系」:
维度1:主题域(讲什么)
一篇文章可以打1-3个标签,比如:
- AI基础认知 — 大模型、AGI、AI能力边界
- AI-Agent智能体 — Agent、智能体、AI员工
- 组织AI化 — 组织形态被AI重构
- 流量方法论 — 流量的底层逻辑
- 创业心法 — 创业、创始人、方向选择
- 认知思维 — 认知、思维方式、心智模型
维度2:招牌概念(我的话语指纹)
这些是我自创或强绑定的术语:
- AI-Rollup — 核心投资/创业框架
- 组织AI化 — 存量组织被AI改造
- 结果即服务RaaS — 商业模式主张
- 首席流量官 — 个人标签
- 十年战略 — 长期主义
- 共创 — 投资+赋能关系
维度3:体裁(什么形式)
- 观点评论 — 就某事表达判断
- 方法论干货 — 含步骤、指南,可复用
- 案例拆解 — 围绕具体公司/产品分析
- 个人随笔 — 心境、节奏类短文
- 深度长文 — 结构完整的重头文章
维度4:立场(论点倾向)
- 看多/乐观 — 对某趋势持积极判断
- 看空/警示 — 泼冷水、拆穿、揭遮羞布
- 行动号召 — 呼吁读者/企业赶紧行动
- 反思自省 — 对自己过往判断的修正
维度5:可复用分(素材质量分档)
- 高 — 有深度论证 + 含招牌概念 + 观点长青
- 中 — 有一定价值但不突出
- 低 — 纯日常随笔、过期热点、篇幅极短
维度6:实体(涉及谁)
自动抽取的动态词表:
- 公司/产品:DeepSeek、OpenClaw、Claude、微信、视频号...
- 人物:巴菲特、芒格、Sam Altman、马斯克...
维度7:写作用途(能当什么用)
- 观点素材 — 可作为论点/金句来源
- 案例素材 — 可作为论据/例子调用
- 框架模板 — 结构清晰,可作为新文章范本
- 概念定义源 — 招牌概念的权威阐述
为什么是7维,而不是传统的文件夹分类?
因为一篇文章可能同时讲AI应用、组织转型和投资逻辑,单一分类放不下。多维标签可以做组合查询,比如:
主题=组织AI化 ∩ 体裁=方法论 ∩ 可复用分=高
这样就能精准找到"关于组织AI化的、可复用的方法论文章"。
这套标签体系,就是我的知识图谱的"元数据层"。
04
PART
第三步:让Claude批量打标签
AI-POWERED TAGGING
标签体系设计完了,但面对1400多篇文章,总不能一篇篇人工打标签吧?
这时候Claude就派上用场了。
我用Claude Code写了一个自动打标签的流程:
步骤1:读取标签体系
把7维标签的定义、判定标准、样本案例全部喂给Claude,让它理解每个标签的含义。
步骤2:批量分析文章
用Python脚本遍历所有Markdown文件,逐篇让Claude分析:
- 读取文章内容
- 根据标签体系给出7维标签
- 生成YAML格式的frontmatter
步骤3:写入元数据
把标签写到每篇文章的开头,用YAML frontmatter格式:
---
title: AI时代的生存法则:做减法,是最高级的护城河
date: 2026-02-18
url: https://mp.weixin.qq.com/s/xxx
主题域: [认知与个人成长]
招牌概念: [AI-Rollup]
体裁: 方法论干货
实体: [巴菲特]
立场: 行动号召
写作用途: [观点素材, 框架模板]
可复用分: 高
---
步骤4:人工校验
Claude打完标签后,我会抽查一部分,发现问题就调整标签体系的判定标准,然后重新跑一遍。
最关键的是:我不只是让AI打标签,而是和AI一起"训练"这套标签体系。
比如我发现有些文章被打了"AI基础认知"标签,但其实只是在AI时代背景下讲其他话题。于是我就明确了标准:
"AI基础认知"应该是大模型、AGI、AI能力边界的科普与判断,而不是"在AI时代下讲其他话题"。
这样反复迭代几轮,标签准确度就上去了。
今天(7月25日)我刚用这套流程处理了19篇新文章,从读取、打标签、写入元数据、更新索引,全程自动化,耗时不到10分钟。
一个人,用AI,就能完成过去需要一个团队的工作。
05
PART
第四步:建立6维索引系统
6-DIMENSIONAL INDEX
标签打完了,但还有一个问题:如何快速检索?
我不想每次都去文件夹里翻文件,也不想靠全文搜索碰运气。
我要的是:按任意维度组合查询,瞬间定位到想要的文章。
于是我建立了6个索引文件:
索引1:按年度
索引_by_年度.md
- 2026年(47篇)
- 2025年(xxx篇)
- 2024年(xxx篇)
- ...
索引2:按体裁
索引_by_体裁.md
- 观点评论(xxx篇)
- 方法论干货(xxx篇)
- 案例拆解(xxx篇)
- 个人随笔(xxx篇)
- 深度长文(xxx篇)
索引3:按立场
索引_by_立场.md
- 看多/乐观(xxx篇)
- 看空/警示(xxx篇)
- 行动号召(xxx篇)
- 反思自省(xxx篇)
索引4:按可复用分
索引_by_可复用分.md
- 高(xxx篇)— 写作系统优先调用
- 中(xxx篇)— 按需调用
- 低(xxx篇)— 仅保留检索
索引5:按主题域
索引_by_主题域.md
- AI-Agent智能体(xxx篇)
- AI基础认知(xxx篇)
- 组织AI化(xxx篇)
- 流量方法论(xxx篇)
- 创业心法(xxx篇)
- 投资逻辑(xxx篇)
- 认知思维(xxx篇)
- ...
索引6:按招牌概念
索引_by_招牌概念.md
- AI-Rollup(42篇)
- 组织AI化(24篇)
- 结果即服务RaaS(22篇)
- 共创(14篇)
- 首席流量官(4篇)
- 十年战略(5篇)
- ...
每个索引都是一个Markdown文件,按倒序时间排列,格式统一:
## AI-Rollup (42)
| 日期 | 标题 |
|---|---|
| 2026-07-24 | [从四次失败到确定性:我的创业成长史](2026/创业与商业/xxx.md) |
| 2026-07-23 | [十年投资路:从财务投资人到AI产业投资人](2026/投资与资本/xxx.md) |
| ...
这6个索引文件,就像6个不同视角的"目录",让我能从任意角度切入知识库。
比如:
- 想写AI-Rollup相关的文章 → 打开索引_by_招牌概念.md,看看过去42篇都怎么写的
- 想找高质量的方法论素材 → 打开索引_by_可复用分.md,筛选"高"+"方法论干货"
- 想了解自己在某个时期的思考 → 打开索引_by_年度.md,按时间线回顾
而且这些索引文件会自动更新——每次新增文章、修改标签,Python脚本会自动重新生成索引。
06
PART
实战效果:从"信息坟场"到"知识金矿"
WHAT CHANGED
整理完这1400多篇文章后,我真切感受到:从信息囤积到知识资产,只差一套系统。
改变1:写作效率提升10倍
以前写文章,想引用自己之前的观点,要么凭记忆搜,要么就放弃。
现在只需要打开索引,按主题域+招牌概念筛选,瞬间找到所有相关文章。
甚至可以直接看哪些是"高可复用分"的,优先调用那些深度论证过的观点,避免重复造轮子。
写作从"从零开始"变成了"组装素材"。
改变2:双号定位更清晰
有了标签体系,我可以一眼看出:
- 哪些文章更适合AI Rollup(AI-Rollup、组织AI化、RaaS等核心概念)
- 哪些更适合老谭备忘录(个人随笔、创业心法、认知成长)
内容策略从"拍脑袋"变成了"数据驱动"。
改变3:知识复利开始显现
过去写过的文章,发完就沉底了。
现在它们变成了"可调用的模块"——一个观点、一个案例、一个框架,都可以在新文章中复用、改写、升级。
1400多篇文章不是历史包袱,而是我的"知识复利"。
改变4:AI写作系统的基础设施
这套标签化、索引化的内容库,未来可以直接接入AI写作系统:
- 让AI根据主题自动调取相关素材
- 让AI学习我的写作风格(体裁、立场、招牌概念)
- 让AI自动生成文章初稿,我只需要润色
从"人工写作"到"AI辅助写作",基础设施已经就位。
07
PART
几个关键认知
KEY INSIGHTS
认知1:知识管理的本质是"减法"
1400多篇文章,如果全都平等对待,那就等于没有管理。
真正的知识管理,是给每篇文章打上"可复用分"——高、中、低。
高质量的文章(含招牌概念、深度论证、观点长青)才是核心资产,其他的都是"历史记录"。
认知2:标签体系比AI工具更重要
很多人迷信AI工具,觉得有了ChatGPT就能自动管理知识。
错了。
AI只是执行者,标签体系才是"元规则"。
你得先定义"什么是好文章""什么是招牌概念""什么叫可复用",AI才能按你的规则分类和检索。
工具会过时,但标签体系是你的知识资产的"操作系统"。
认知3:一个人+AI,胜过一个小团队
这套系统,如果放在两年前,至少需要:
- 1个产品经理设计标签体系
- 2个工程师写爬虫和索引脚本
- 3个编辑逐篇打标签
成本至少几十万。
但现在,我一个人+Claude Code,1天搞定。
这就是AI时代的生产力革命——不是替代人,而是让一个人拥有团队的能力。
认知4:躬身入局才能真正理解AI
我可以写100篇文章讲AI Rollup、讲组织AI化、讲RaaS。
但如果我自己不用AI管理知识、不用AI优化工具、不用AI写代码,那些都是纸上谈兵。
只有躬身入局,才能真正理解AI的威力和边界。
这套知识管理系统,就是我的"AI实验室"。
∞
CODA
写在最后:个人IP的"第二大脑"
FROM INFORMATION OVERLOAD TO KNOWLEDGE ASSET
很多人问我:老谭,你为什么要花这么多时间整理这些文章?
我的答案是:因为这是我的"第二大脑"。
人脑的记忆力有限,但AI+标签系统可以做到:
- 精准回忆:任意组合查询,瞬间定位
- 跨时间连接:把不同时期的思考串联起来
- 知识复利:过去的积累,成为未来的杠杆
在AI时代,个人IP的竞争力不只是"能生产内容",更是"能管理知识"。
如果你也有几百上千篇文章,我的建议是:
- 别让它们躺在云端吃灰,下载下来,本地化
- 设计一套适合你的标签体系,让AI能读懂你的文章
- 建立索引系统,让知识"可检索、可复用、可迭代"
从信息囤积到知识资产,只差一套系统。
而这套系统,在AI时代,一个人就能搞定。
本文由 JOTO AI 智库从已授权的 53AI 知识库同步。
原始来源:53AI FDE 知识库


