问题背景
昨天加完班回家我开始研究搭一套内容创作 Agent 团队。链路已经能跑起来了:先做信息采集和竞品账号调研,再生成内容,最后自动发布到小红书。

在这套流程中,我在 Hermes 里创建了 16 个 Agent 组成 Agent Team,并且做了很多分层(见上面的框架图),搭了两条定时任务流水线:分别在凌晨 4 点进行素材收集,在凌晨 7 点开始生产内容、发布小红书。
从工程角度看,这当然是一个进展。过去需要人来回切工具、截图、整理素材、写文案、排版、上传,现在可以让一组 Agent 接力完成。它们会找素材,会拆竞品,会生成标题和正文,也会把发布包准备好。
但真正让我停下来的不是技术问题。
我看着那条自动生成的小红书笔记,第一反应不是“太棒了,可以规模化了”,而是有点不踏实。

它能发出去。
然后呢?
用户凭什么看它?它的爆点在哪里?它解决了谁的真实问题?如果只是把网上已有的信息重新整理一遍,再套一个“爆款标题”,那它和垃圾内容之间的距离其实很近。更尴尬的是,它还可能看上去挺完整:有标题,有正文,有封面,有标签,有发布记录。
完整,不等于有价值。
这件事戳到了我对很多 AI 内容工具的怀疑。市面上太多产品都在讲“一句话生成爆款视频”“一键生成爆款笔记”。这句话很诱人,但也很危险。生成出来和有人愿意看,是两回事。能自动发布和能带来增长,也是两回事。
如果我们只追求“从 0 到发布”的自动化,最后可能只是把低质量内容生产得更快。
今天又刷到张咋啦 Zara 的一条视频,标题是“为什么我做内容特别快?因为功夫在诗外”,文案里还有一句“内核 > 外表”。
这句话一下把我前面那点不踏实说清楚了。
很多人以为做内容快,是因为剪得快、写得快、发得快。其实不是。真正快的人,往往不是临到发布时才开始想。她平时就在工作、观察、聊天、记录,脑子里有素材,有判断,有一套自己的问题库和表达方式。
等到要做一条内容时,她不是从空白页开始,而是在调用一套已经养过很久的东西。
视频里有个说法我很认同:实际拍视频、写文章,只是内容创作的一小部分。更大的一部分发生在日常生活里,发生在工作中的问题、和别人聊过的三遍、自己反复想过的几天里。
AI 内容系统如果想变得有用,也应该承认这一点。它不能只盯着最后那一步“生成”。它要帮人把诗外的功夫攒起来。
想法思考
我现在越来越觉得,“AI 自动生成爆款内容”本身可能是个伪命题。
不是说 AI 不能参与爆款内容生产。恰恰相反,AI 很适合参与。它可以帮人找资料、拆结构、扩展角度、生成备选标题、做平台化改写、检查事实、复盘数据。这些都很有价值。
问题在于,爆款不是一个可以直接生成的文件格式。
爆款更像一次命中:命中一个人群正在忍受的问题,命中一个平台当下的表达习惯,命中账号所处阶段的增长目标,也命中一个足够具体的情绪。这里面有判断,有取舍,也有一点运气。
AI 可以提高命中率,但它不能替我们假装已经命中了。
换个说法,内容生产里最值钱的部分不是“把字写出来”,而是写之前那堆看起来不产出的工作。
你有没有长期看一个人群的真实抱怨?有没有知道他们用什么词形容自己的痛?有没有攒过足够多的案例?有没有拆过同类账号为什么能让人停下来?有没有形成自己的立场,而不是每次都临时问模型“帮我生成 10 个爆款选题”?
这些东西不在成品里显眼出现,但它们决定成品有没有底气。
这里我很喜欢“内核”和“外表”这两个词。
内核是你在不在做有意思的事,有没有真实体验,有没有自己的判断。外表是封面、标题、剪辑、排版、节奏。外表当然重要,没人愿意故意把内容做难看。但如果一个系统只会优化外表,问题就来了。
很多 AI 内容的空洞感,恰恰来自外表大于内核。标题很会抓,句子很顺,结构也完整,但读完之后像喝了一杯兑了太多水的饮料。它说了很多,又好像什么都没留下。
这也是我现在对“AI 生成爆款”这个说法最警惕的地方:它默认爆款主要是包装问题。好像只要标题更刺激、开头更抓人、金句更密,内容就会自动有价值。
可真实情况经常反过来。一个人如果内核足够强,表达上朴素一点,反而会让人觉得真诚。一个内容如果内核很弱,外表越精致,落差越明显。
我以前会更自然地把这套系统想成一条流水线:
采集素材 -> 生成内容 -> 审核 -> 发布 -> 复盘
现在我更愿意把它看成一个内容实验工作台。它的核心不是替你按下生成按钮,而是把诗外的功夫变成可积累、可调用、可复盘的资产。
同样是生成一篇小红书笔记,工作台的关注点会变:
这次要验证什么目标?
哪些素材真的有用?
这个选题为什么值得做?
标题和封面抓的是哪个具体痛点?
正文有没有提供可保存、可转发、可评论的东西?
发布后数据说明我们学到了什么?
这套系统真正应该交付的,也不该只有最终成品。
素材包本身要有用。一个人打开它,应该能快速知道这件事有哪些事实、案例、截图、真实问题和可引用的观点。
灵感池本身要有用。即便今天不发,里面也应该沉淀出一些值得以后继续做的选题,以及这些选题背后的真实体验。
选题评分要有用。它不能只给一个分数,而要说清楚为什么做、为什么不做、差在哪里:是内核薄,还是外表弱。
脚本草稿要有用。哪怕最后没有发布,它也应该让人看到一个角度、一种表达方式,或者一个还可以继续加工的骨架。
质量门禁也要有用。它不应该只是“通过/不通过”,而要指出这篇内容最弱的地方:是痛点不够具体,还是证据太薄,还是看起来像泛泛而谈。
我还想加一层:样品墙也要有用。
同一个素材和选题,不要急着赌一个版本。可以先做几种标题、几种封面、几种开头、几种叙事角度,放在一起比较。这样我们看到的差异才更干净:到底是选题不行,还是标题没抓住人?是封面太弱,还是正文没有给到保存价值?
这比直接生成一篇“看起来完整”的笔记更慢一点,但慢在前面,后面才会快。
这样一来,即便整条流水线跑出来的成品不理想,用户也不是空手而归。他至少拿到了一批素材、一组判断、几个可继续打磨的方向,以及一次可以复盘的实验记录。
这和“一句话生成爆款”是两种产品观。
后者卖的是魔法按钮。前者承认内容增长很难,但把难的过程拆开,让每一步都更可见、更可控。
我更相信后者。
后续计划
接下来我想把现在的系统往实用性和可用性上推,而不是急着再堆更多自动化能力。
第一件事是让目标先出现。
每次生产内容之前,系统都要问清楚:这篇内容是为了涨粉、转化、测试选题,还是为了沉淀账号定位?目标不同,判断标准就不同。一篇适合“测试话题”的笔记,未必适合“引导转化”。把它们混在一起评估,只会让结果越来越糊。
第二件事是把每一步拆成可以单独运行的模块。
比如素材采集可以单独跑,竞品拆解可以单独跑,选题工坊可以单独跑,小红书改写也可以单独跑。每一步都要有清晰输入、清晰输出、清晰的验收方式。用户不应该只能按下一个总按钮,然后等一个不知道好坏的最终结果。
第三件事是把“生成之前”的工作产品化。
这部分过去很容易被忽略,因为它不像成品那样有截图、有链接、有发布记录。但真正的内容能力恰恰藏在这里:素材怎么来,案例怎么分组,观点怎么形成,账号语气怎么沉淀,平台反馈怎么回到下一次选题。
如果这些都散在聊天记录、浏览器收藏夹和脑子里,AI 再强也只能临场发挥。我要做的是把它们变成系统能看见、能调用的东西。
第四件事是把内核和外表分开评估。
现在很多工具会把“标题更爆”“封面更抓”“文案更顺”当作主要优化方向。这些属于外表层,当然可以优化,但不能替代内核层。以后每个选题都应该先回答几个更笨的问题:这个观点从哪里来?它对应了谁的真实处境?有没有一手经验或案例?用户看完会多知道什么,还是只觉得被包装了一下?
如果内核不够,就先回到素材和洞察,不要急着包装。
第五件事是让中间产物变得可读。
现在很多 AI 工作流的问题是,中间状态只对机器有意义,对人没什么帮助。以后每个产物都应该像一个能被人接着使用的小文档:素材库、选题卡、标题候选、封面方向、脚本结构、风险清单、复盘结论。它们不一定都要发布,但都应该能帮人往前走一步。
第六件事是把数据回流做扎实。
发布之后,系统要知道哪些东西有效,哪些东西只是看上去漂亮。点击、收藏、评论、完播、转粉,这些数据要回到选题和创作记忆里。否则今天的自动化和明天的自动化没有区别,只是在重复同一种试错。
最后是产品形态。
我不想把它做成一个“输入一句话,输出一篇爆款笔记”的玩具。更合理的形态可能是一张工作台:左边是目标和素材,中间是选题与内容版本,右边是门禁和数据反馈。用户可以跑完整流程,也可以只用其中一个步骤。
这听起来没那么性感。
但它更像一个真的能长期使用的东西。
总结
今天这个思考对我挺重要。
因为它把问题从“能不能自动生成内容”,拉回到了“内容为什么值得被看见”。
AI 当然能提效。它可以把很多琐碎工作做得更快,也可以把创作者从重复劳动里解放出来。但如果我们不处理选题、洞察、素材、表达和复盘这些更难的部分,提效只会让平庸传播得更快。
我现在更愿意承认一件事:爆款不是按钮生成的。快也不是按钮生成的。
能做的,是搭一套更好的实验系统。它帮助人更快看见素材,更快形成判断,更快试错,也更快知道自己错在哪里。更重要的是,它应该帮人把自己的内核看清楚,而不是只帮人把外表抹亮。
这不如“一句话生成爆款”好卖。
但它更接近我想要的产品。
说到底,AI 应该帮人补功夫,而不是帮人假装有功夫。