从记忆助手到语音输入 Agent:闪电说创始人的 AI 产品出海实战复盘
2026 年 1 月 17 日,「未来硅世界」直播邀请到 AI 语音输入软件「闪电说」的两位创始人——CEO 余猛和联合创始人龚震,围绕 AI 产品从 0 到 1 的探索、增长策略与出海打法展开了一场近两个半小时的深度对话。余猛是技术出身的产品经理和连续创业者,从移动互联网时代一路做到 AI 应用;龚震曾任 Monica 产品 VP,负责增长和商业化,将其从 0 做到 1000 万美金 ARR。这场分享适合独立开发者、AI 创业者、产品经理以及对出海感兴趣的流量操盘手阅读。
从「完美的想象」到「务实的落地」:闪电说的三次转型
余猛回顾了自己从 2023 年开始探索 AI 应用的完整历程。他最初的想法是做「记忆」——「大模型这一个浪潮里面,计算是通用的……真正的差异化就是数据」。他判断,未来最有价值的事情是做一个「世界上最了解你的 AI」,即个人模型。
第一个尝试是在手机上做对话式记忆助手,把记 Todo、记大姨妈、记生日等所有功能整合进一个 App。但很快遇到两个问题:一是成本太高,「当时我们用 GPT-4 的话,每个月的成本可能单人会达到 10 美金」;二是频次太低,「本质上没有人喜欢记东西,这个是本质的……反人性的事情其实本质上就做不大的」。
第二个尝试是全天候记录声音。团队做了电脑客户端、手机 App,甚至用 3D 打印做了几十台项链分发给朋友测试,后来又转向耳夹式耳机方案。余猛说,他们当时「应该是全球做得最激进的一个团队」。但把门槛降到足够低之后,最严重的问题暴露了:全天候的声音数据「其实是没有办法被今天的 AI 去真正充分利用或创造足够多的价值的」——打呼噜需要医疗级 AI 分析,咳嗽需要懂医学的模型,心情不好需要情感识别,「它其实是一个生态,这个生态没有构建的话,你把你全天候的声音全部记录下来,里面其实它的价值是有限的」。
转机出现在 2025 年初。团队在大量使用 Claude Code 编程时,发现「语音编程这件事情是非常爽的」,于是把过去积累的端侧技术拿出来,做出了闪电说的 demo。余猛总结道:「创新就是不断地试错……收敛到一个大方向,然后在里面做暴力破解。」
从 context 视角切入:龚震为什么选择语音输入
龚震从另一个角度讲述了自己加入团队的过程。他在 Monica 期间获得的一个关键认知是:「AI 干啥都需要 context,如果你只有一个大模型,只有一个 LLM 的话,它其实很蠢的。本质上你给它的 context 越多,它越聪明。」浏览器插件之所以在 AI 时代复活,正是因为能拿到所有 Web 端的 context。
但他认为浏览器插件的天花板很低,于是开始思考如何获取更多 context。他把 context 分为两类:存量的和增量的。存量 context 包括手机相册里的图片、笔记等,但「存量 context 它确实阻碍有点多」;增量 context 则是「还没有被记录下来的,还存在于虚空之中的」——比如全天候的声音记录。
「不管是用一个全天候的 APP 也好,还是用一个项链也好,其实我就能够把所有的我自己的声音的增量 context 都存下来了。」他考察过眼镜,但电池和视觉处理的问题太多;而声音技术「在 2024 年开始看的时候已经成熟了」。
最终让他下定决心的,是 2025 年初高频使用 Cursor 和 Claude Code 编程时的切身体验:「我深刻地感受到了打字对我的限制和瓶颈。」他原本完全不会编程,用上 AI 编程工具后,发现语音输入是「一个频次又高又刚需,而且随着人跟 AI 沟通得越来越多,它渗透率越来越高」的方向。
产品方法论:如何找到方向和挖掘需求
当被问到如何挖掘创业方向时,龚震直言:「在大厂工作是学不会创业的。」他解释,在大厂「你不是在一个挣钱的机器,你只是在做机器里面的一部分」,大厂经验对挣到第一个 100 万「意义不大」。
他给出了几个实操建议。第一,多关注 GitHub 高赞项目——「这个真的有用,这是最简单的方法了」。他举例说,前段时间有两个项目反复登上 GitHub 日榜,一个是做舆情分析的,一个是做信息 tracking 的,背后代表的是股票交易人群筛选精准信息的需求。第二,利用微信指数、Google Trends 等工具查热点关键词的热度,「一个被人反复搜的东西,一定有价值」,如果还能产品化或内容化,就是很好的生意机会。
余猛则分享了自己更「笨」的方法:花足够多的时间把大方向了解清楚,然后选择一个方向深入探索。「我们从 24 年 1 月份开始,截止到今天我们就没有做过和声音无关的事情。」这种专注带来了复利效应——「我做的这些尝试,它每天都在复利」,2025 年团队其实 PMF 了两个产品,都能挣钱,只是最终选择了闪电说。
增长与出海:Monica 验证过的四大件
龚震把 Monica 的增长经验总结为两条。第一条是「想明白究竟什么阶段,什么是最好的渠道」。对于已经被验证过 PMF 的产品,「你就可以直接排除掉社区免费增长,直接看网红营销的渠道」。他跟踪 whisper flow 的投放策略很久,发现对方 6 月之前只投写作人群,9 月之后大量投 Web coding 人群,「那我就很清楚了,我就知道这 Web coding 的增量了」。
网红营销的具体打法上,他建议「尽量地去找 100 个小 KOL,而不是找大网红」——大网红一条不爆就净亏 10 万美金,而小 KOL「跑出来一条爆款,就把可能买 20 条的钱赚回来了」。渠道选择上,PC 端产品首选 YouTube,「如果你在 TikTok 上面去做网红营销,那个人知道 Monica 了,他先想记住这个词,然后可能三四个小时之后跑去电脑上搜,转化率就有点过低了」。
第二条是「设计内生性的增长机制」,产品的酷属性和好玩性很重要。他举例说,Monica 移动端收入从每月 1 万刀涨到 10 万刀,就是因为一个叫「AI 嘲讽」的功能——「我把你的 profile 全部读一遍,然后给你一个很嘲讽的评论」。
至于出海打法,龚震强调「大家都在用的招就是最好用的招,不要想一些奇淫巧技」。海外增长的四大件是:网红营销、社交媒体投放、搜索引擎投放和 SEO。闪电说的策略是「先以免费策略获量」,因为「whisper flow 已经花了几千万美金教育过市场」,直接告诉用户「我们是免费的 whisper flow」就能快速拿量。之后再做差异化——把 AI 输入 agent 的体验做好,同时挖掘有趣性场景,比如有用户反馈「很需要在游戏里面喷人,拿打字喷有点慢,拿闪电说喷可能就快一点」。
技术壁垒、商业化与未来定位
面对「技术壁垒在哪」的提问,余猛坦言:「今天的 AI 应用其实是有消费品的一种属性在里面……核心的东西,比如说你的大模型的技术,其实都基本上都是采购的。」但他认为这不影响创造新体验,「你像奶茶,这么多人做,但是还有那么多的需求」。长期来看,针对特定场景用 RL 训练等方式做体验升级,「它就可能就是一个有壁垒的事情了」。
商业化方面,龚震说得非常直接:「大家都是在建立一个渠道之后做 TOKEN 分销商,TOKEN 分销的本质在于赚有钱人的钱。」他分享了一组数据:闪电说的 AI 纠错开关开启率约 50%,真正用上 API key 的人不到 20%,「这里面最有钱的那可能前 5% 到 3% 的人可能会被转化」。海外 SaaS 的毛利「只要不是特别奇怪的,应该是人均 70% 的毛利」。
不同国家的付费率差异巨大:美国 5%~7%,台湾 3%~5%,中国「你做得很屌,可能也就 2%、3%」。他举例说,一个拍照答题的 AI 教育产品,纯做美国市场月收入可达 10 万美金,做全球市场(含印度)只有 1 万美金。他还观察到「中国人确实更喜欢买内容和买实物」——做活动裂变时送麦克风的效果比送会员卡好无数倍,「你给他 200 块钱,不如给他一个 200 块钱的麦克风」。
关于闪电说的长期定位,余猛认为它会「演变成你的个人模型」——「以后你只要跟闪电说一下我要买鞋子,它就可以基于你的记忆直接生成这一个描述」。团队正在做记忆模块,预计一个月内让用户体验到雏形。他特别强调数据所有权:「我们真的希望去把这个记忆的东西做好……把你的个人数据全部保存下来,形成你独有的记忆,并且把数据的所有权归还给用户自己。」
现场问答
问:用户能不能把在输入法里表达的记忆作为上下文,给其他产品使用?
余猛:已经在做了,一个月内会有雏形。比如长按快捷键呼唤 AI 说「帮我记一下」,数据会存到专门的记忆模块,下次同样的问题可以直接调出来用。「语音转文字只提高了 4 倍的效率,它不可能再提高了,但是有了你的记忆之后,它可能可以提高十倍甚至几十倍。」
问:现在各家都在卷准确率,闪电说怎么看?
龚震:主流语言准确率基本都卡在 90% 上下,大家更多在转降噪上发力。接下来真正的机会在方言模型——「在中文这个体系之下是可以转到 99% 这个准确率的,它在均值上是 99%,但是可能对于江西话来说,可能就是从 30% 一下干到 80% 了」。训练语音模型的成本不高,「可能训一个模型 200 万,里面大部分的成本都在数据上」,创业公司有机会。
问:为什么不做流式实时翻译?
龚震:流式的问题是「每个字不停地出,然后每个字不停地在变」,用户盯着变来变去的字会受干扰,而且 AI 纠错时上下文不足,「拿到一个完整的文本去帮你做翻译和纠错的时候,其实是更容易的」。目前的取舍是分段出字,既解决安全感问题,又不干扰说话。
要点回顾
- 闪电说经历了三次转型:对话式记忆助手(成本高、频次低)→ 全天候声音记录(数据价值密度低、生态未构建)→ PC 端语音输入 Agent(高频刚需)。
- 龚震从 context 视角切入:浏览器插件天花板低,语音输入能获取更多个人增量 context,且声音技术已成熟。
- 挖掘需求的方法:关注 GitHub 高赞项目、用微信指数和 Google Trends 查热度、判断能否产品化或内容化。
- 增长策略:PMF 产品直接上网红营销,找 100 个小 KOL 而非大网红;PC 端产品首选 YouTube;之后用 SEO 和投放做阵地战。
- 商业化本质是「TOKEN 分销」:赚 3%~5% 有钱人的钱,海外 SaaS 毛利约 70%。
- 付费率差异:美国 5%~7%,台湾 3%~5%,中国 1%~2%;中国人更喜欢买实物,送麦克风比送会员卡效果好。
- 闪电说的长期定位是「个人模型」,从记忆模块开始,数据所有权归用户。
- 产品最佳实践:用更聪明的模型、开启异步纠错、优化默认 prompt(长句自动分段、说 123 自动分点)。
直播回放约 132 分钟
播放器来自飞书妙记 · 在新窗口打开