从 AI 眼镜到智能体工作流:一场硬件与应用的深度拆解
AI 眼镜正在成为大厂与创业公司争夺的焦点,但它的核心能力、落地场景以及开发者生态究竟如何?在 WaytoAGI 社区「晚八点共学」直播中,AI 产品经理银海带来了 AI 眼镜的深度拆解,并现场用 Vibe Coding 复刻了 Rocket 眼镜的全息交互界面,打通了从语音输入到智能体回复的完整链路。本文适合对 AI 硬件、Agent 开发以及 Vibe Coding 感兴趣的开发者与产品经理阅读。
AI 眼镜市场:从通话配件到全息终端
银海开场便点明,AI 眼镜已成为「兵家必争之地」。他提到,影视飓风创始人代言的 Rocket 眼镜在 CES 上亮相,主打带显示的 AI 眼镜;夸克眼镜、智能戒指、无弦吉他等 AI 硬件也层出不穷。早期华为推出过带接听电话功能的眼镜,主要做蓝牙通话与 AI 对话;如今 Rocket、雷鸟等品牌则在显示与功能上不断迭代,雷鸟在一段时间内出货量很高。深圳外贸市场还出现了专门做多语言翻译的眼镜,在义乌小商品市场大量出口,银海提到「亲爱的翻译官」这类产品「不是直接从科技圈出去的,而是直接在外贸圈里出来的」。
银海重点拆解了 Rocket 眼镜的核心能力:听与看。听的能力通过镜腿上的扬声器实现,可用于放歌、播报、对话;看的能力依靠摄像头,能录像、拍照、捕获视觉画面,并可唤起名为「乐奇」的 AI 助手进行交互。眼镜端有一块光栅屏幕,新出货的产品已解决漏光问题。通过录屏可以看到绿色的全息触控 AR 显示,能显示当地时间、温度、电量等信息,还可进行语音转写和对话。
应用场景方面,银海列举了 AI 识物、AI 拍照答疑、多语言翻译、快速回复、实时导航、灵感记录等。例如会议内容记录、骑行导航、外贸翻译,还能与支付宝、中国银联合作实现声纹支付。不过他也指出了实际体验中的问题:录像时能耗较高、生命周期短;AR 屏幕需额外配近视镜片,形成双层镜片,对透光率有影响;眼镜听音乐时扬声器声音容易被旁人听见。
眼镜端的智能体生态与三方平台接入
Rocket 眼镜内置了智能体商店,包含 12306 订票、热量识别、查价格、单词收集等通用型智能体。银海现场演示了自己搭建的「食物卡路里识别」智能体——通过摄像头识别眼前物体的卡路里含量。他特别提到,开发者可以构建个性化智能体,甚至可以将眼镜捕获的信息传给 OpenClaw 这类 AI 员工去自动执行,「相当于你这副眼镜就是一个捕获 AI 时代实时信息的能力,所有的处理能力你都可以丢给 OpenClaw」。
在开发者端,Rocket 提供了名为「灵珠平台」的构建平台,界面类似扣子(COZE),但银海认为其插件生态和模型相对有限,「构建的供给这一块还是相对会弱一些」。因此他推荐通过三方平台接入:阿里云百炼设有 AI 硬件方案专区,提供食物卡路里识别、AI 健身教练、合同审查等垂直智能体模板,可一键复制应用并绑定到 Rocket 眼镜上;COZE 同样支持快速接入,但需要注意其个人访问 API key 30 天会过期,需动态更换。
接入流程并不复杂:在三方平台复制应用后,获取 API key 和应用 ID,填入灵珠平台的对应位置即可。银海强调,这种模式极大降低了开发成本,「你就不需要去自己一步一步搭了,直接点击复制这个应用,它就可以去用了」。
用 Vibe Coding 复刻全息交互界面
为了让没有眼镜的观众也能体验开发过程,银海现场用 AI IDE 复刻了 Rocket 眼镜的交互界面。他使用的工具是「code」(即 Cursor 的拼音说法),新用户可直接免费使用。他首先从 Pinterest 或花瓣网搜集 HUD 风格的 AR 交互设计图作为参考,然后创建了一个名为 AI glasses 的项目,将参考图放入项目后,用语音输入法向 AI IDE 下达指令:
「参考我提供的 Images 里面的所有的交互屏信息,然后我现在想构建一款关于眼镜终端的一个交互体验,你需要模拟在手机横屏的方式上显示,然后我的整个 GUI 的显示,它其实是一种这种绿色的极客风格,然后左下角是时间和天气,然后右下角是电量,然后中间它其实是主要去显示我的所有的输入的文本,还有包括我唤起 AI 助手时语音输入转写的这个文本内容。」
AI IDE 随即开始构建,生成了 HUD 组件和绿色极客风格的界面。银海建议,如果只想快速看到交互效果,可以让 AI 使用 HTML 加 CSS 实现,不必使用 React 等技术栈。
接入 ASR 与主 Agent,打通语音交互链路
界面搭建完成后,银海开始接入语音识别(ASR)能力。他将上周分享中提到的实时语音识别 API 文档放入项目的 API 文件夹,并填入自己的 API key,让 AI IDE 自动完成接入。随后,他在阿里云百炼上创建了名为「Rocket 眼镜助理」的主 Agent,选择 Flash 模型(速度快),设定提示词:「你是一个眼镜助理,能够捕获用户提交的所有文本信息和图像理解信息,给予一些陪伴上的反馈,你是一个非常善解人意的角色,所以你的语气回复都像一个管家一样,需要经常称呼作者为老板。」
银海特别提醒,如果 Agent 需要识别图片内容,必须选择视觉模型(如 VO 模型),否则无法理解图像。他还为 Agent 添加了联网搜索工具和高德地图插件(Amap),使其具备路线规划能力,并关联了英语口语搭子、写作指导等智能体组件,实现多能力调用。
最后,他复制了实时语音合成(TTS)的 API 文档,让 AI IDE 接入语音输出能力,并设置了自动语音打断功能。至此,整条链路——语音输入、ASR 转写、Agent 处理、TTS 语音回复——全部打通。银海现场演示了与自建眼镜助手的对话:「哈喽哈喽,可以指导一下我的作业吗?」助手随即以「老板」称呼并给出回复,整个过程流畅迅速。
开发成本与效果评估
银海分享了开发成本的实际数据。他提到用 Mac mini 运行 OpenClaw 的测试经验:使用龙虾网关时,5 分钟内请求 388 次,每次耗费 0.1 美元,总计约 30 美元;切换到国内模型后成本降低,但性能有所下降。不过,大模型平台大多提供免费额度,例如 ASR 每秒成本为 0.00022 元,跑通整条链路的免费额度完全够用。他建议开发者测试后可以删除 API key 并重新创建,以控制成本。
银海认为,这套开发范式的最大优势在于「只需要在 Agent 处进行调整,无需在其他地方调试文本」。发布应用后立即生效,可通过修改角色设定、字数限制等快速调整功能。他总结道:「我们已经把这条链路给大家趟通了,是一条可复制的链路。」
现场问答
Q:开发的眼镜在哪里买?怎么连接?
A:主要介绍的是 Rocket 这副眼镜,生态相对成熟。连接方法可参考直播回放,里面有详细介绍——眼镜有开发者模式,可在其中发布智能体。
Q:智能体搭建复杂吗?
A:基本可以直接复制应用模板,不需要从零搭建。比如 AI 眼镜解决方案、旅行讲解等模板,一键复制即可使用,只需在提示词中修改成自己想要的场景。
Q:龙虾网关如何接入工作流?
A:可以在工作流中添加 API 节点,把龙虾作为请求地址,异步下发任务后查询执行结果。目前网关那层估计还需要一段时间打通,但对飞书、钉钉、Telegram 等 IM 通讯设备的底层通信已基本打通。
Q:API key 会过期吗?
A:百炼的 API key 目前没有永久有效的,COZE 的个人访问 API key 30 天会过期,需要动态更换。测试完可以删除旧 key 并重新创建。
Q:AI 信息处理不准确怎么办?
A:需要在构建 Agent 的过程中调试,可以通过 prompt 约束、知识库文档、联网搜索、实时地图等能力让信息获取更准确,这是智能体架构设计中可以调节的部分。
要点回顾
- AI 眼镜的核心能力是「听」(镜腿扬声器)与「看」(摄像头),可承载 AI 识物、拍照答疑、多语言翻译、实时导航、支付等场景。
- Rocket 眼镜的智能体商店提供通用型智能体,但开发者可通过灵珠平台或三方平台(阿里云百炼、COZE)接入自定义智能体。
- 三方平台接入流程:一键复制应用模板 → 获取 API key 和应用 ID → 填入灵珠平台 → 在眼镜端调试。注意 COZE 的 API key 30 天过期。
- 用 AI IDE 复刻眼镜交互界面时,可参考 Pinterest 或花瓣网的 HUD 设计风格,用语音输入法下达指令,指定绿色极客风格、时间天气电量布局等。
- 主 Agent 建议选择 Flash 模型(速度快),如需识别图片必须选视觉模型;可通过添加联网搜索、Amap 地图插件、口语搭子等组件增强能力。
- 完整链路:语音输入 → ASR 转写 → Agent 处理 → TTS 语音回复,全程可通过 AI IDE 自动接入 API 文档完成。
- 开发成本较低:ASR 每秒 0.00022 元,大模型平台有免费额度;测试后删除 API key 可控制成本。
- 后续可拓展方向:拍照生成风格化内容、视频剪辑、生活场景个性化定制等。
直播回放约 108 分钟
播放器来自飞书妙记 · 在新窗口打开