Liso:划词即听,把网页文本变成有声书

一个针对"稍后阅读"痛点的新解法
互联网上值得阅读的内容太多,但真正被读完的却太少。收藏夹里躺满了长文、Newsletter 和博客,却因为没时间坐下来逐字阅读而被遗忘。这正是 Product Hunt 上新晋产品 Liso 想要解决的问题。
"稍后阅读"作为一个产品品类可追溯到2007年Instapaper的诞生,随后Pocket(原Read It Later)和Readwise Reader等工具相继出现。这些工具解决了"收藏"的问题,却未能根本解决"消费"的问题。研究显示,用户保存的文章中超过70%从未被真正阅读——这一现象被戏称为"数字囤积症"(Digital Hoarding)。从行为心理学角度看,数字囤积症与"完成偏误"(Completion Bias)密切相关:人们倾向于完成简单的收藏动作以获得即时满足感,却将真正耗时的阅读行为无限期推迟。Pocket在2015年被Mozilla收购前披露的数据显示,其平均用户每月保存约25篇文章,但阅读完成率不足30%。这一结构性矛盾表明,问题不在于"发现"和"保存",而在于"消费"本身的时间成本过高。
Liso的策略是绕过"何时有空坐下来读"这个瓶颈,直接将消费模态从视觉切换为听觉,从而释放了通勤、运动等"暗时间"的内容消费潜力。所谓"暗时间",是指那些身体被占用但大脑仍有余力的时段——每天通勤、健身、做饭等累计可达2-3小时,这些时间传统上无法用于文字阅读,却是音频内容的天然消费场景。播客的爆发式增长(全球播客听众在2024年已超过5亿)已经证明了这一时间窗口的商业价值,而Liso将同样的逻辑应用于用户自主选择的文字内容。
Liso 的核心理念极其简洁:在任意网页上高亮选中一段文字,它就能立即将其转换为高质量的语音朗读。用官方的话说,这相当于"用你真正想读的内容,构建一本属于你自己的有声书"。产品在 Product Hunt 上获得了 121 个投票、34 条评论,并冲进当日榜单第 12 名,归属于生产力(Productivity)、书籍(Books)和音频(Audio)三个分类。

Liso 的工作原理:划词即转音频
告别复制粘贴,就地转换语音
Liso 的交互逻辑与传统的文本转语音(TTS)工具有着关键区别。大多数 TTS 应用要求你先把内容复制、粘贴到某个专门的界面里,流程割裂且繁琐。而 Liso 主打的是"就地转换"——无论你正在浏览一篇深度长文、一封邮件订阅内容,还是某个博客页面,只需高亮想听的段落,就能立即生成音频。
这种"零搬运"的体验,本质上是把音频能力嵌入到用户既有的阅读动线中,而不是要求用户为了听而额外打开一个新工具。从交互设计的角度看,这遵循了"就近原则"(Principle of Proximity)——将功能尽可能靠近用户产生需求的时刻和位置。每一次"复制-切换应用-粘贴-点击转换"的流程都会造成认知负荷和行为断点,学术研究表明,每增加一个步骤,用户完成任务的概率大约下降20%。Liso将整个流程压缩到"选中文字"这一个原子操作中,极大降低了使用门槛,也更符合真实的碎片化阅读场景。
"个人有声书"的产品定位
Liso 特别强调音频的"beautiful"(优质自然),这背后依赖的是近年来快速成熟的神经网络语音合成技术。现代TTS技术经历了从拼接合成(Concatenative Synthesis)、参数合成(Parametric Synthesis)到神经网络合成(Neural TTS)的三次范式跃迁。
在拼接合成时代(1990s-2010s),系统需要预先录制大量语音片段并拼接组合,音质受限于录音库的覆盖范围。参数合成使用统计模型生成语音参数,灵活性提高但音质"机械感"明显。2016年DeepMind发布WaveNet后,语音合成质量实现了质的飞跃——该模型直接在波形层面逐采样点生成音频,MOS评分(平均意见得分)首次接近真人水平。此后,Google的Tacotron系列实现了端到端的文本到语音映射,VITS将文本分析、声学建模和波形生成统一到单一模型中,Tortoise-TTS则展示了少样本语音克隆的可能性。
2023年以来,这一领域进入了"超自然度"竞赛阶段。ElevenLabs凭借其多语言、多情感的语音克隆能力获得超过10亿美元估值;OpenAI的TTS API以极低延迟和高自然度成为开发者首选;Fish Speech、Bark等开源模型也在快速追赶。这些模型已能生成几乎无法与真人区分的语音,且支持情感表达、语速调节、呼吸音模拟和多语种切换。这些技术进步使得"阅读转语音"类产品从"能用"进化到"好用",为Liso这类产品提供了坚实的技术底座。相比过去机械生硬的合成音,现代 TTS 已经能够输出接近真人朗读的语调和节奏,这也是这类产品在当下重新具备吸引力的技术前提。
更值得注意的是它的定位——"你自己的有声书"。市面上的有声书平台(如Audible、喜马拉雅)内容是被预先制作和挑选的,用户只能在平台提供的目录中选择,且制作一本有声书通常需要专业播音员数十小时的录制和后期处理,成本高昂。而 Liso 把选择权完全交给用户:你想听什么、读到哪一段想转成音频,全由自己决定。这实际上把"内容消费"从被动接受转向了主动构建,实现了有声内容的"去中心化"——每个人都成为自己有声内容库的策展人。
为什么 Liso 值得关注
契合通勤、健身等多任务场景
通勤、健身、做家务——这些场景下人们无法"看",却完全可以"听"。认知心理学中的"双通道理论"(Dual-Channel Theory)指出,人类的视觉通道和听觉通道可以并行处理信息而不产生严重干扰。这意味着当双手和眼睛被体力活动占用时,听觉通道仍然处于空闲状态,可以高效接收语言信息。美国人口普查局数据显示,美国人日均通勤时间约为55分钟,加上健身和家务时间,每天有大量"耳朵空闲"的时段可供内容消费。
Liso 的价值恰恰在于把原本只能"用眼睛读"的文本内容,解放到"用耳朵听"的时间段里。这让大量本会被跳过的长内容重新获得了被消费的机会。
对于信息工作者、研究者和重度阅读者而言,这种"眼睛休息、耳朵工作"的模式能显著提升单位时间的信息摄取效率。研究表明,听觉学习在特定场景下的信息保留率可达到视觉阅读的75-90%,尤其是在叙事性和论述性文本中表现更好。它填补的是收藏与真正读完之间那道巨大的鸿沟。
YC 背书与赛道竞争格局
从链接信息可以看到,Liso 带有 Y Combinator 的痕迹,这为这个早期产品增添了一定的可信度。Y Combinator(简称YC)是全球最具影响力的创业加速器,由Paul Graham于2005年创立,总部位于旧金山。YC曾孵化出Airbnb、Stripe、Dropbox、Reddit、Coinbase等改变世界的公司,其投资组合公司的总估值已超过6000亿美元。YC每年收到超过30,000份申请,录取率通常低于2%,获得其背书意味着团队的执行力、市场洞察和技术能力经过了严格验证。在语音AI领域,YC近年来投资了ElevenLabs(早期)、Cartesia、Deepgram等多家相关公司,反映出对AI音频赛道的系统性看好。不过YC背景并非成功保证——加速器项目的长期存活率约为10-20%,早期产品仍需通过市场验证来证明可持续性。
需要客观指出的是,网页划词朗读并非全新概念——从浏览器自带的朗读功能、各类 Read-Aloud 插件,到 Speechify、ElevenLabs Reader 等成熟产品,赛道竞争其实相当激烈。
Speechify 成立于2017年,由Cliff Weitzman在布朗大学期间创立(他本人患有阅读障碍),目前估值超过10亿美元,提供全平台(iOS、Android、Chrome、Safari等)文本转语音服务,拥有超过2000万用户和50+种自然语音选择,其商业模式以订阅制为主(月费约$11.99起)。
ElevenLabs 于2022年由前Google和Palantir工程师创立,以超高质量的AI语音克隆和合成著称。其核心技术能仅凭几秒钟的音频样本即可克隆任何人的声音,2024年初获得8000万美元B轮融资,估值超过11亿美元。其Reader应用可将任何文本转为逼真音频,并支持29种语言。
此外,Apple 自iOS 17起内置了更自然的"个人语音"(Personal Voice)功能,用户甚至可以用自己的声音生成TTS;Chrome 浏览器也通过"Read Aloud"功能和第三方扩展提供原生朗读能力;Microsoft Edge 的"大声朗读"功能同样在持续优化,支持自然语音和阅读进度追踪。
在这样的竞争格局下,Liso选择"划词即转"这一极简交互作为差异化切入点,试图在用户体验的颗粒度上找到自己的生态位。与Speechify强调全文档转换和平台覆盖不同,Liso更侧重于"精准片段"的即时转换——这种设计更适合那些不需要听完整篇文章、只想把关键段落变成音频的用户。
Liso 若想脱颖而出,关键在于两点:一是语音质量能否真正做到自然悦耳,二是"划词即转"的交互能否足够顺滑无缝。产品目前的评论和投票热度说明它切中了痛点,但能否形成长期壁垒仍有待观察。在工具类产品中,用户转换成本通常较低,除非产品能建立起内容积累(如个人音频库)、社交网络效应或独特的AI能力护城河。
使用 Liso 前的理性观察
作为一款早期产品,Liso 的信息披露还比较有限。几个值得后续关注的问题包括:它的定价模式如何?是浏览器插件还是独立应用?音频语言和音色是否支持自定义?以及最核心的——它使用的语音引擎在长文本朗读时的稳定性和自然度到底如何。
从技术角度看,长文本朗读对TTS系统提出了额外挑战:模型需要维持跨段落的韵律一致性、正确处理专有名词和缩写的发音、合理分配停顿和语气变化。当前即便是最先进的TTS模型,在超过3000字的连续朗读中也偶尔会出现语调漂移或重复卡顿的问题。此外,不同语言的支持质量差异显著——英语TTS已接近完美,但中文、日语等声调语言的自然度仍有提升空间。
这类"轻量工具型"产品的成败,往往不在于功能有多复杂,而在于把一件小事做到极致顺手。从产品史来看,许多成功的工具产品都遵循了"单一功能做到极致"的路径——Shazam只做音乐识别,Grammarly早期只做语法检查,它们都是先在一个狭窄场景中建立不可替代性,再逐步扩展功能边界。Liso 选择的切入点足够精准:不是要重新发明有声书,而是把"随手划一下就能听"这件事做到无摩擦。如果执行到位,它有机会成为许多人日常阅读工具箱里的一个高频小工具。
小结
Liso 用一个极简的交互——高亮文字即转音频——回应了当代人"内容太多、时间太少"的普遍焦虑。它把内容消费的主动权还给用户,让每个人都能用自己真正想读的东西拼出一本专属有声书。在 TTS 技术日趋成熟的今天,这类产品的体验天花板正在被不断抬高,而 Liso 的市场表现也印证了这一需求的真实存在。
从更宏观的视角看,Liso代表的是一个更大趋势:AI正在重新定义内容消费的形态。从文字到语音、从语音到视频摘要、从长内容到个性化精华——内容的"原始形态"和"消费形态"正在解耦。未来,用户可能不再需要以内容的原始格式来消费它,而是选择最适合当前场景的模态。Liso在这一趋势中占据了一个小而精准的位置,其成败将为整个"模态转换"赛道提供有价值的参考。
核心要点
核心要点
相关推荐

李飞飞谈AI:视觉智能、创造力边界与人类主体性
斯坦福教授李飞飞在Huberman Lab播客深度解析AI与视觉科学的关系,探讨ImageNet如何引爆现代AI,阐述AI的能力边界、医疗应用前景,以及为何人类主体性是AI发展的核心命题。

DeepSeek Harness实测:插件化Agent框架的核心优势解析
深入实测DeepSeek Harness开源Agent框架,解析其插件化架构设计、编码能力、安装部署方式及与Claude Code的对比,帮助开发者了解这款可扩展Agent开发底座的真正价值。

10美元搭建50万域名搜索引擎:独立开发者的周末项目启示
一位独立开发者仅用一个周末和10美元成本,搭建了覆盖50万域名的垂直搜索引擎。本文深入分析低成本搜索引擎背后的技术栈、垂直搜索的差异化机会,以及独立开发者快速验证想法的方法论。