ListenHub:把声音创作门槛降到无限低的 AI 嘴替
8 月 19 日晚,WaytoAGI 社区「鹿演」路演第三期邀请到橘子老师,分享了他创办的 AI 音频工具 ListenHub。橘子老师是公众号「橘子汽水铺」主理人,在 X、即刻、小红书等平台以 Orange AI 身份活跃,拥有十余万粉丝。这场分享围绕 ListenHub 的产品功能、用户案例、创业历程与未来规划展开,适合自媒体创作者、对 AI 音频工具感兴趣的产品经理,以及关注 AI 创业的读者。
产品定位:创作者的 AI 嘴替
橘子老师用一句话概括 ListenHub:「创作者的 AI 嘴替」。产品面向自媒体创作者或想成为自媒体创作者的人群,核心特点是「会把创作的门槛降到无限低,真的是无限低,它可能是你用过的最简单的 AI 产品」。只要创作中需要用到 AI 音频,用 ListenHub「大概率就不会错」。
产品于 5 月 19 日上线,到分享当天正好三个月。8 月推出的新功能 Flow Speech 被橘子老师称为「全球首个能把书面语转成口语的 TTS」,上线后大受欢迎。
网站通过谷歌、百度或 Bing 搜索 ListenHub 即可打开,主要有两个 Tab:AI 播客和 Flow Speech。AI 播客可以把创意转为播客,支持双人或单人模式,还能定制音色。橘子老师现场展示了自己定制的两个音色——orange 和 orange 感冒版(他上周感冒时录的),试听效果逼真,差别明显。
AI 播客有两种模式:速听精华约 5 分钟讲完一个话题,深度探索模式则让两个人深入讨论,最长 15 分钟。橘子老师特别提到,把财报放进去让 AI 讲解是很好的用法,「我们这个产品用户反馈最大的一个反馈是说他的幻觉非常非常低,就我们做了很多优化,这个产品如果是基于你的自己的材料来做的话,几乎没有幻觉,非常的可信」。据他透露,有大型基金在用 ListenHub 给客户做每日早报。
Flow Speech:从书面语到口语的关键一跃
Flow Speech 的诞生源于一个真实需求。ListenHub 上线后,美国有一位 80 多岁的用户,因肺纤维化无法说话。他在美国建了一个 4000 多人的病友社区,LinkedIn 上有 3 万人关注,一直用 ListenHub 做双人播客给社区讲这个病的知识。橘子老师说:「他其实就在用这个 AI 作为他的嘴替,在帮助他去表达,因为他已经失声了。」团队由此想到,播客并不适合所有场景,应该做一个能把任何内容转成口语表达的产品。
Flow Speech 解决的痛点是:AI 生成的脚本直接用 TTS 念出来没有「播客感」,因为「它少了一层从书面语到口语的转换,没有这个转换的话它就是在朗读」。橘子老师现场演示了对比效果——用传统 TTS 读一段 AI 大纲,是逐字逐句的机械朗读;用 Flow Speech 则变成了自然流畅的口语表达,还会补充「我们先来看看它想解决什么问题」这类过渡语。
这个能力不仅适用于中文,读英文论文、日文内容同样流畅。橘子老师对比了百度搜索排名第一的阿里云 TTS 与 Flow Speech 读 DeepSeek 论文的效果,前者生硬难懂,后者「是不是觉得这个读这个论文变得非常轻松?」读小说也是如此,Flow Speech 会把「熟睡中的周明瑞只觉脑袋抽痛异常」润色成「熟睡中的周明瑞只觉得脑袋抽痛异常,就好像被人用棒子狠狠地抡了一下」,更有沉浸感。
橘子老师认为,配音行业不会因此失业,因为「配音是一个非常累人的活,我一般录一小时的干音,录之前要采集大概三倍的声音」。目前很多书没有配音,番茄小说上的内容全部由 AI 朗读但效果不佳,如果换成更好的 TTS,听书体验会好很多。
用户案例:从广播台到带货变现
分享中展示了大量真实用户案例,覆盖多种场景。
温州交通广播用 ListenHub 制作节目,讲述温州古代传闻,已做几百期。广播节目要求严格,「不能有幻觉,不能有错误」,每期节目做完后会有多位老师审核。他们找了主播录了 5 个声音放进账户,效果很好。
归藏老师用 ListenHub 做小宇宙播客,刚做一周就接近 500 订阅。橘子老师评价归藏的声音还原度「真的拉满了,就是那种下午睡觉刚睡醒那种声音」,特别适合睡前陪伴。
最让橘子老师震惊的是用户用它赚钱的案例。有用户把视频配音换成 ListenHub 后,「引流商品点击人数就提高了 10 倍」,一周净赚 3000 元。另一个做母婴带货的用户更夸张,一周收入 46 万,而且「他们有 100 个号」。橘子老师分析,以前的机械音让用户打开就关掉,而 ListenHub 的「活人感」让用户能听完,带货数据随之提升。
数字人公司禅静也在用 ListenHub 的 TTS,橘子老师现场播放了他们的数字人视频,配音效果自然。此外还有用户结合 Google Notebook LM 的故事书功能,克隆自己孩子的声音做成故事视频,孩子听完后「到处跟人说,你看这个是我的声音录的一个视频,就很骄傲」。
分享最后还首播了一部短剧《特朗普爱上白宫保洁》的第一集,这部短剧「火爆全网但从来没有人看过」,由创意影动团队用 AI 工具制作,其中使用了 ListenHub 的音色。橘子老师强调,剧中特朗普年轻了 50 岁,是为了规避版权风险。
创业历程:从产品经理到 AI 创业者
橘子老师 2022 年 10 月接触 AI,当时 36 岁,刚结束在 Boss 直聘的产品经理生涯,加入 MiniMax 负责 AGI 方向产品。他回忆:「那时候 MiniMax 只有 80 多个人」,公司想做的是「训一个大模型来做 AGI」。在 MiniMax 的 500 天里,「周六周末都不休息,游戏也戒掉了,美剧也不看了,生活中就所有都是 AI 了」。
他通过费曼学习法在 Twitter 分享 AI 知识,「一年涨了六万粉,两年涨了十多万粉」。离开 MiniMax 后有半年竞业期,他开始做公众号和小红书,逐渐实现商业化闭环,「做着做着就发现自媒体收入就超过了我的薪资」。
竞业期结束后,他把六小虎和大厂都面了一遍,最终选择创业。原因包括:六小虎已经锁了 headcount,且「在大模型公司,大家的 focus 其实更注重还是在模型产品上,他们不太会去说贴近用户的场景」;大厂方面,豆包团队有 100 个产品经理,「这都不是螺丝钉的问题了,这是好像在那抢需求」。他观察到智能穿戴设备和 AI 硬件爆发,「这两个形态都需要一个东西叫语音交互」,于是决定做声音方向。
公司去年 12 月成立,今年 4 月团队才组建完成,8 个人时上线了 ListenHub,现在团队 15 人,月收入刚破 10 万美金。橘子老师坦言创业初期的痛苦在于搭建公司架构,「你以为创业就成立一家公司,其实你要成立 6 家公司」,从开曼群岛到香港再到新加坡,各种文件、银行开户都是卡点。有次办手续做到一半,银行说政策改了要等一年,只好换银行。
快乐则来自团队和用户。「我们团队每一个人之前都是大家都没有工作一起工作过,这是一个完全 fresh 的状态」,他和联创去年 12 月「各种吵架」,但一个月后逐渐认可对方。产品上线后用户自发转发支持,付费率「国内一般是在千分之几,我们是在百分之几」,收入再增长几倍就能盈亏平衡。
关于硅谷与国内创业的区别,橘子老师认为出海创业先在国内拿基础资金更合理,因为硅谷投资人看重信任和 story,「你如果没有一个长期的信任感,你的 story 其实也没有人信」。同时 PMF 是分国家的,「你在这个地方 PMF 在别的地方不一定」,会影响公司架构和战略。
与大厂竞争:使命感的差异
ListenHub 发布时正好碰上豆包发布播客功能。橘子老师透露,他们特意比谷歌发布新版 Notebook LM 早一天上线,「我们加班也要早发一天」。一个月后他发现大厂的产品「就没有人在负责这件事情了,就是 PR 一波流」,还引用直建强老师的吐槽说豆包播客「一半内容都在胡扯」。
他总结了 ListenHub 与豆包、Notebook LM 的四个区别:第一,可以编辑脚本,生成后不满意能改,还能在前面加个人化内容;第二,可以定制声音,「你只有用你的声音,你才是个人品牌,用豆包那个声音,大家都用豆包声音,你怎么可能构建你的个人品牌呢?」第三,不仅能做播客,还有 Flow Speech 和单人播客,「我们的用户用它去跟数字人结合赚到钱了,这个就是非常强的信号」;第四,Flow Speech 的未来空间很大,可以把创作者的提示词放进来作为模式,「每一个创作者都要有他的一个模式,然后他就真的变成你的嘴替」。
关于使命、愿景、价值观,橘子老师说他和联创「都很不喜欢刷抖音,我们都是 B 站用户」,想做「科技向善」的产品。选择音频方向是因为「视频其实它的核心的诉求是把你带到另一个世界,然后音频其实是你的生活中的一种陪伴」。他希望做出世界上最好的声音陪伴产品,「不希望你一直沉迷于此」。
现场问答
Flow Speech 后续会支持特定方言吗?
会的。橘子老师认为 TTS 模型现在还非常早期,「如果下限是 100 分的话,现在也就三四十分」,普通话和部分北京话效果可以,但唐山话、客家话等复杂方言效果不好,因为方言数据非常少。如果 TTS 支持方言了,他们会跟进。
Flow Speech 有字数限制吗?
目前限制 1 万字,可生成约 25 分钟音频。橘子老师不建议生成过长内容,「万一出错的话你的积分会消耗掉」,可以拆成 1 万字一段。API 会支持最高 20 万字。
输入内容里有对话,Flow Speech 能区分不同角色的语气吗?
理论上可以做到,需要按特殊语法格式化内容。会员可以使用编辑功能,也可以让 XGPT 帮忙改写,但「严格保留这个格式」。
有没有考虑过和其他工具联动?
API 月底推出后,会与数字人软件、voice driven video 等工具联动,还会在 HTAB 里提供一键转换功能。橘子老师透露,有手机厂商在合作,以后手机助手里的早报或资讯会由 ListenHub 的声音朗读;还与智能眼镜厂商合作,按住眼镜就能用 ListenHub 的声音播报内容;美国有个机器人客户也在合作。
之后会加入个性化功能吗?
会。橘子老师提到自己专门录了感冒版音色,「我们给每个声音打上标签之后,打上场景标记之后,它本质上就是一个 MCP」,会把声音作为 MCP 接入各个 agent,比如智谱的 AutoGLM 可以调用 ListenHub 生成音频内容。
有没有用户用 Flow Speech 做出让你们觉得「哇还能这么用」的场景?
最意外的是用户群体——「有很多用户是 50 岁以上的用户」。这些用户有人生阅历,可能是医疗健康专家、教育专家,很愿意表达但声音条件有限,就用 ListenHub 做私域内容。还有人为农村老人做 AI 播客,「农村老人平时没有什么娱乐,他们会聚在一起听播客」。橘子老师自己也给家里老人做过一期关于吃盐危害的播客,老人听完后「再也不放那么多盐了」。
要点回顾
- ListenHub 定位是「创作者的 AI 嘴替」,把声音创作门槛降到无限低,5 月 19 日上线,8 月推出 Flow Speech 功能。
- Flow Speech 是全球首个把书面语转成口语的 TTS,解决 AI 脚本直接朗读没有「播客感」的问题,支持中英文、小说、论文等多种内容。
- 用户案例覆盖广播节目(温州交通广播)、播客(归藏老师一周近 500 订阅)、带货变现(一周净赚 3000 元、母婴带货一周 46 万)、数字人配音、儿童故事等场景。
- 创业历程:2022 年 10 月接触 AI,在 MiniMax 负责 AGI 产品,通过分享 AI 知识积累十余万粉丝,2024 年 12 月成立公司,8 人时上线 ListenHub,目前团队 15 人,月收入破 10 万美金。
- 与大厂竞争的核心差异:可编辑脚本、可定制声音、功能多样(不止播客)、有使命感和愿景驱动。
- 未来规划:月底推出 API(支持最高 20 万字),与数字人、手机厂商、智能眼镜厂商合作,把声音作为 MCP 接入各个 agent,最终目标是做交互式声音陪伴产品。
直播回放约 131 分钟
播放器来自飞书妙记 · 在新窗口打开