3小时Vibe Coding打造自媒体对标雷达:自动拆解爆款视频

在自媒体和AI学习这两条赛道上,「盯同行、抄爆款」几乎是每个人都绕不开的日常动作。但手动追踪十几个博主、逐条看视频、总结规律,既费时又难坚持。B站UP主林克用大约3小时的 vibe coding 搭建出了一套「自媒体对标雷达」,把这整套流程完全自动化。
什么是 Vibe Coding? Vibe coding 是2025年初由OpenAI联合创始人Andrej Karpathy提出并命名的一种新型编程范式。其核心理念是:开发者不再逐行编写代码,而是用自然语言描述想要实现的功能,由AI(如Claude、GPT-4o等)实时生成代码,开发者只需审查、调试和迭代。这种「边聊边写」的方式大幅降低了编程门槛,让没有系统编程训练的人也能在数小时内搭建出可运行的工具,尤其适合功能明确但实现路径不固定的自动化脚本类项目。
这套工具不只服务于内容创作者。对想跟着视频学AI的人来说,它同样是效率利器——刷到谁用AI做了个什么项目,直接把转录文案丢给AI,让它照着复刻一个。作者称这是「眼下最高效的学习AI的方法」。下面拆解它的完整实现思路。
第一步:建清单,自动收集与去重
整套系统的起点非常朴素——先列一份「关注清单」。作者在AI领域挑出十几个长期跟踪的优质博主,把他们全部写进清单。

有了清单,工具会照着名单自动抓取这些博主的新发视频,完成收集、去重和整理。这一步看似简单,却决定了后续分析的信息源质量。与其让AI漫无目的地在全网搜索,不如先由人圈定一个高信噪比的「情报网」——这也是整套系统能持续产出有效结论的前提。
第二步:本地转录,把视频变成文字
最初作者想让AI直接「看视频」,但很快发现这条路又慢又贵——AI处理视频时会把它拆成一帧帧图片,成本极高。于是思路转向:先把音频转成文字,因为 AI读文字的速度和成本远优于读图。
语音识别技术路线的演进背景
从在线API到本地部署的语音识别技术选型,折射出整个AI工具链的成熟轨迹。早期语音识别服务几乎清一色依赖云端API,开发者将音频上传至服务商服务器,按分钟计费。2022年OpenAI开源Whisper模型后,本地部署语音识别的可行性门槛大幅下降,推动了包括FunASR在内的一批高质量开源方案涌现。这一趋势与大模型本地化浪潮高度吻合:当推理成本持续下降、硬件算力持续提升,越来越多原本只能在云端运行的AI能力开始迁移到个人设备,重构了「成本-隐私-性能」的三角取舍。正是在这一背景下,本地部署成为个人开发者的优先选项。
技术选型:FunASR本地部署
作者选用阿里开源的语音识别模型 FunASR,直接在本地电脑上运行,既不花钱,也无需把数据传到外部服务器,兼顾了成本与隐私。
FunASR 是什么? FunASR(Fundamental Speech Recognition)是阿里巴巴达摩院开源的语音识别框架,于2022年发布,支持中英文及多语言的高精度转录,其核心模型 Paraformer 在学术基准上达到了商用级别的识别准确率。相比调用 OpenAI Whisper API 或讯飞云等在线服务,本地部署 FunASR 的最大优势是零边际成本——无论处理多少音频,都不产生 API 费用——同时数据不离本地,符合内容创作者对账号信息和竞品分析数据的隐私保护需求。
几百条视频就此被批量转成文字稿。

但这里踩了个坑:FunASR 直接输出的是一堆没有标点、没有分段的文本,人看着头晕,AI理解起来也吃力。为此作者叠加了两个同样来自阿里、与 FunASR 配套的开源模型:
- FSMN-VAD(Voice Activity Detection,语音活动检测):负责识别语音的起止边界,完成断句分段
- CT-Transformer(City Transformer):基于上下文语义为裸文本自动补充标点符号
VAD与标点恢复模型的技术定位
FSMN-VAD 和 CT-Transformer 在 ASR 流水线中承担的是「后处理」角色,解决的是识别模型本身不擅长的两个问题:边界检测和书面化重构。语音活动检测(VAD)的核心挑战在于区分真实语音与环境噪声、语音停顿,FSMN(Feedforward Sequential Memory Network)是一种专为序列建模设计的轻量网络结构,计算效率高,适合实时流式场景。标点恢复则属于自然语言处理中的序列标注任务,CT-Transformer 利用双向上下文理解来判断逗号、句号、问号等标点的插入位置。这两个模型与 Paraformer 的组合,代表了工业级 ASR 系统「识别-分割-规范化」的完整三段式架构,是原始语音变为真正可读文稿的关键一跃。
三者构成完整的「音频→可读文稿」流水线,转出来的稿子清爽可读,为后续分析打下了干净的数据基础。
第三步:结构化提示框架,让AI"填格子"而非"自由发挥"
这是整套系统里作者认为最值钱的一环。最初他把所有文案一股脑丢给AI,让它总结「为什么能火」,结果得到的全是「内容优质」「引起共鸣」这类正确的废话,等于没说。
关键顿悟是:别让AI自由发挥,先定一个框架,让它照着填。
为什么结构化提示有效? 这一做法背后有坚实的理论依据。大语言模型(LLM)在面对开放性问题时,倾向于输出训练数据中频率最高的「安全表达」——即那些听起来正确但信息密度极低的通用结论。通过预先定义输出的格式框架和维度,提示词实际上在缩小模型的「搜索空间」,迫使它在每个格子里生成具体的、可被验证的内容,而非在高层抽象上徘徊。这一原则也是「Chain-of-Thought(思维链)」提示法的底层逻辑——先让AI按步骤填充中间推理过程,再得出结论。在提示词工程(Prompt Engineering)领域,这被称为结构化提示(Structured Prompting),是商业分析、竞品研究、内容策划等场景下公认的最佳实践。
作者设计了五个固定维度:
- 选题角度
- 开头钩子
- 内容结构
- 制造爆点
- 互动引导

让AI对着每条文案,按这五个格子逐一填写。以一条10万赞的《从小白到AI万粉》视频为例,拆解结果清晰可见:选题是「普通小白如何学习AI的可复制路径」,钩子是「敢想比敢做更重要」这句反常识的话,结构是「先亮成果、再抛观点、最后复盘」,爆点则压在「普通人也能赶上」的那股希望感上。
这个方法论的价值远超工具本身。先制定框架、再让AI填充,比多掌握几个工具都重要。无论要做什么类型的分析,「结构化提示」这一原理都通用。
第四步:飞书多维表格搭建可视化看板
最后一步,是把所有转录和拆解数据同步进飞书多维表格,并搭建可视化看板——「谁最近火了、火在哪了」,打开一眼即见。

为什么选飞书多维表格? 飞书多维表格是字节跳动推出的类 Airtable 产品,兼具关系型数据库的结构化存储能力和电子表格的易用性,并原生支持看板视图、图表视图等多种可视化形式。在自动化工作流场景中,它提供了开放 API,可以通过 HTTP 请求直接写入、查询和更新数据,因此成为许多国内 AI 自动化项目的「数据终点站」——AI 处理完数据后,结果被推送至表格,团队成员无需了解技术细节即可查阅和协作。这种「后端自动化 + 前端可读化」的分离设计,是现代 No-Code/Low-Code 工作流的标准架构思路。
Token成本控制与选择性处理的工程权衡
为了控制成本,作者给AI立了条规矩:不是每条视频都拆解,只挑真正爆了的视频拆,避免浪费 token。这一决策背后是对「推理成本」与「信息价值」之间的理性权衡。大语言模型的API调用按token计费,一条视频转录文稿通常在1000-5000 token之间,若对几百条视频全量分析,单次运行成本可能达到数十美元。更关键的是,大量平播放视频对「爆款规律」的归纳是负向贡献——将噪声数据纳入分析会稀释信号,反而降低结论质量。这种「先过滤、再精分析」的两阶段处理模式,在数据工程领域被称为「漏斗式流水线」,也是 RAG(检索增强生成)系统中先检索再生成的底层设计哲学之一。于是每天一睁眼,最新的爆款情报就已经整理好在表格上等着他了。
从数据里浮现的爆款规律
当几百条数据批批沉淀下来,规律自然浮现。作者从中归纳出几条颇具参考价值的观察:
- 前三秒定生死 — 他关注的AI博主,爆款几乎都在前三秒甩一个大数字,或抛一句反常识的狠话,先把注意力抓住。
- 越技术越掉播放 — 越往部署、代码这类硬核内容里钻,播放量掉得越狠;带情绪、够宽泛的内容反而动辄几万赞。
- 能被转发的一句话很关键 — 凡是文案里有一句让人想转发的话,数据都差不了。
这些结论不是拍脑袋得出的,而是从几百条真实数据里一条条扒出来的。这正是数据驱动的对标分析相较于经验直觉的优势所在。
总结:工具是表象,方法论才是内核
这套「自媒体对标雷达」的真正启发,不在于它省了多少时间,而在于它示范了一套可迁移的AI工作流思路:用本地开源模型压成本、用结构化框架约束AI输出、用自动化管道把重复劳动交给机器。
作者已将整套工具封装成一个 skill,并鼓励大家用AI带着自己复刻一遍——这本身就是他所倡导「刷到啥就复刻啥」学习法的现场演示。对创作者而言,它是一台永不疲倦的同行雷达;对AI学习者而言,它是一条把「看别人做」转化为「自己动手」的最短路径。
核心要点
相关推荐

提示词工程入门指南:从单次指令到系统化方法论
提示词工程零基础入门教程,详解提示词的四大作用、提示词与提示词工程的核心区别、六步系统化流程,以及必须了解的技术与落地局限性,帮你真正发挥AI的全部潜力。

零基础入门AI Agent:开发者与应用者两条学习路径全解析
零基础如何学习AI Agent?本文梳理两条清晰的学习路线:开发者路线从Python到大模型再到开源框架源码研究,应用者路线通过Claude Code等工具快速上手。找对定位,少走弯路。

传统产品经理转型AI PM必备的三大硬核能力
传统产品经理如何转型AI产品经理?本文解析AI PM与传统PM的本质差异,详解转型必备的三大硬核能力:AI产品认知、高阶Prompt技巧、大模型技术逻辑,帮你避开常见误区,找到高效转型路径。