[控场AI]
· 6 分钟阅读· 3,430 字

YouTube视频A/B测试争议:优化留存率会毁掉创作吗?

YouTube视频A/B测试争议:优化留存率会毁掉创作吗?

YouTube将推出视频A/B测试功能,但创作者担忧其破坏观众共同体验并助长过度优化。

YouTube宣布推出「视频A/B测试」功能,允许创作者上传同一视频的多个剪辑版本,由平台以真实观众测试留存率后选出赢家,预计明年初全面开放。知名科技创作者MKBHD对此提出大量未解问题:观众不知情自己正在参与测试、带时间戳的评论可能在版本间失效、分享链接可能指向不同内容。YouTube工程师透露将用语义分析模型控制版本相似度,但创作者对模型效果持疑。更深层的批评在于:留存率高不等于视频更好,过度优化会修剪掉那些有个性却未必高效的创意元素;而这项功能也被视为YouTube盲目追赶TikTok等竞品、逐渐放弃自身独特性的最新案例。MKBHD的建议是:多做、多发布、从成败中学习,而非在单一视频的细节上反复压榨。

YouTube近期宣布将推出一项名为「视频A/B测试」(Video A-B Testing)的功能,允许创作者上传同一视频的多个剪辑版本,由平台用真实观众进行测试,最终选出观众留存率最高的版本。这项功能在知名科技创作者MKBHD(Marques Brownlee)看来,是YouTube「最疯狂、最冒险、也可能是最糟糕」的一个想法。

从缩略图测试到视频本身测试

YouTube的A/B测试并非新事物。此前平台已支持对缩略图和标题进行A/B测试——系统将不同的缩略图分别展示给部分受众,比较点击表现后让创作者选出赢家。这位创作者坦言自己花了一些时间才接受缩略图测试,并在实践中确实学到了观众的点击偏好。

但把测试范围扩展到视频内容本身,他认为「有点太过了」。按照YouTube的演示,典型场景是:你拍了两个不同的开场钩子(opening hook),不确定哪个表现更好,于是上传两个剪辑版本,YouTube用真实观众测试,最后展示不同版本的留存率曲线图,由创作者选出留存最好的那一个。

作为观众是否知道自己正在参与A/B测试

「开场钩子」(opening hook)是YouTube创作中的核心概念,指视频最开始的5至30秒内用来抓住观众注意力、阻止其划走的内容设计。平台的留存率数据显示,大多数视频在前30秒内流失的观众比例最高,因此创作者普遍将开场钩子视为影响整体表现的关键变量。常见手法包括:直接抛出悬念或结论、展示冲突画面、提问或反常识陈述等。A/B测试开场钩子,正是创作者最有动机、也最直觉上合理的测试场景——但同时也是最容易引发版本间体验割裂的地方,因为视频其余部分完全相同,而观众在评论时的感受却可能因开场不同而产生细微差异。

一连串没有答案的问题

看到这项功能后,这位创作者立刻提出了大量演示中未回答的疑问,核心都指向观众体验的割裂:

  • 作为观众,我在看视频时,是否知道自己正在参与A/B测试?(很可能不知道)
  • 评论区里,我怎么知道别人看的是哪个版本?
  • 如果评论带了时间戳,我切换到另一个版本时,时间戳会不会失效?
  • 如果我把视频分享给别人,对方看到的会不会是另一个完全不同的版本?
  • 两个测试版本之间,到底允许有多大差异?

他结合自己一年多的缩略图测试经验指出:当两个版本差异很小(比如文字大小、箭头位置的微调)时,统计结果往往差距不足以说明问题,学不到什么;只有当差异足够大(两个完全不同的概念)时,表现差距才真正有参考价值。把这个逻辑套到视频上,开场几个镜头的微小差别恐怕不会带来有统计意义的差异——而YouTube自己的演示案例中,两个版本的时长竟然是17分钟对19分钟,差异相当明显。

Apple曾悄悄替换过含有瑕疵的广告视频

YouTube工程师给出的部分答案

值得肯定的是,这位创作者与YouTube工程师进行了通话,并带回了一些答案。

一个「公开的秘密」是:YouTube其实早已拥有视频替换能力,但使用门槛极高。几乎没人能用,必须有特定且合理的理由,比如一处事实性更正,且替换文件除了那一处改动外必须与原文件几乎完全相同(长度都要一致)——因为「改动视频是很珍贵的」。他举例Apple几年前上传的一则含有画面故障的广告,第二天就被悄然替换掉,正是这种机制。

关于明年初面向所有人推出的视频A/B测试,工程师透露的关键信息是:YouTube计划构建一个语义分析模型,梳理两个上传文件的完整内容并判断相似度,只有相似度足够高的版本才被允许作为测试运行。理论上,两个完全不同的视频无法拿来测试。此外,A/B测试仅限新视频发布时的有限时间窗口,不能对旧视频进行回溯替换。

不过这位创作者对该模型的效果并不乐观:「每次我让Gemini去分析YouTube视频里的内容,它表现都不太好,通常只会退回去看字幕。」

如果两个版本剪辑顺序不同,模型是否能识别

至于其余问题,目前仍无明确答案:带时间戳的评论几乎肯定会出问题,上传者不会知道评论者看的是哪个版本,观众也不会知道自己正处于测试中,甚至可能有人先看了「落败」的版本,之后再回来却看到了另一个视频。

语义分析模型(semantic analysis model)在视频内容理解领域面临独特挑战。与文本不同,视频的「语义相似度」需要跨模态理解画面、语音、字幕乃至剪辑节奏。目前主流做法是将视频转为文字字幕后再做文本相似度比对,或提取视觉帧的嵌入向量(embedding)进行比较——这正是MKBHD担忧Gemini「退回去看字幕」的原因所在。字幕只能捕捉语言信息,对镜头顺序调换、画面替换、配乐变更等剪辑层面的差异几乎无感。若两个版本只是对同一段对话重新剪接,字幕可能高度相似,模型却无法识别结构性差异;反之,若两个版本仅替换了B-roll素材而台词完全相同,模型可能错误判定为「几乎相同」。这使得该模型的鉴别边界颇为模糊。

被打破的共同体验

这位创作者认为,这项功能触及了YouTube一条「不成言说的社区规则」:大家都在看同一个视频,共享同一种体验。正是这种「我们看到了同样的东西」让某些视频成为文化现象。即便外包装(标题、缩略图)略有不同,最终抵达的内容是一致的。而允许同时上线两三个不同版本,从根本上破坏了这一点,「就是感觉不对」。

他进一步把这看作一个更大趋势的一部分:YouTube花了太多时间去追赶竞争对手,而不是加固自身的独特性。比如取消公开的「踩」数计数器,被包装成保护创作者,但现实是Facebook、Instagram、TikTok都不显示——而点赞/点踩比例原本是YouTube独有的实用信号。再比如新的观看数统计方式:现在视频第一帧加载就算一次播放,而过去YouTube有一套更严谨的「真实观看」衡量标准,这让YouTube的观看数更有含金量,如今这种差异也不复存在。

YouTube「踩」数(dislike count)的隐藏政策调整于2021年11月正式生效,官方理由是减少创作者因集中踩击(dislike bombing)受到的骚扰。但批评者指出,公开的点赞/点踩比是YouTube有别于其他平台的独特信任机制——用户可以在点开视频前就获得一个关于内容质量的群体信号,尤其在教程、产品评测等实用性内容上价值显著。隐藏踩数后,浏览器扩展「Return YouTube Dislike」一度积累了超过3000万用户,通过众包历史数据估算踩数,从侧面印证了这一功能的实际需求。这与视频A/B测试的争议具有相似的底层逻辑:平台以「优化体验」为由调整规则,却在无意或有意间削弱了YouTube生态中独有的透明度与社区信任基础。

给创作者的建议:对创作保持信念

在视频结尾,这位创作者将话题转向同行,态度明确:大多数创作者既不需要、也不应该使用这项功能。

他的核心观点是:这项功能被包装成「帮你做出更好的视频」,但严格来说,它帮你找到的是留存率最高的版本,而留存率高并不等于视频更好。许多有趣、有创意、有个性的创作决定,恰恰不是最优化留存的选择。

许多创作决策本身就不是为留存率最优化而做的

「YouTube好玩的地方,很多在于那些小众、非大众化的内容——你发现的一个冷门爱好,或者只有少数人在讨论的有趣事物。」他担心如果所有人都去追求留存最大化,这些内容会变得乏味。创作的过程是反复优化,但过度优化会把那些「碰巧不是最高效讲故事方式」的创意元素统统修剪掉。

他给出的建议是:与其把时间花在一个视频的无数标题、缩略图和剪辑草稿上,为了最后几个百分点的平均观看时长去压榨几次额外播放,不如多做、多完成、多发布视频。「坚持你的创作选择。这是你选择要做的视频,把它发出去,然后从中学习——有的成功,有的失败,你从输赢里学到东西,再去做下一个。这就是创作的过程。」

他也自嘲这可能只是「老派YouTuber的固执」,但他相信,很多人都会同意:对视频A/B测试,大家实在提不起兴趣。

分享:

相关推荐