从realtime到voiceai,语音不是一种新的交互方式,而是agent跨越发展,代表着GUI之后下个时代的全新场景。
一、去年的探索:Realtime放进产品,我们经历了什么
去年我们团队开始尝试将 OpenAI 的Realtime模型接入mobile app。出发点很简单:语音交互比打字更自然,尤其在需要深度沟通、引导决策的场景里,语音能显著降低用户的使用门槛。
我们主要在三个场景里做了尝试,但是真是落地效果却一直无法达到预设的benchmark,归根结底,我们当时探究的是"怎么让语音更好用",而不是"当语音成为主界面,产品应该是什么形态"
- Onboarding:语音 + 表单的混合交互
在新用户引导流程中,我们尝试用voiceai+autofill form的混合交互。理想状态是:用户说一句,系统自动理解并推进流程。
但实际操作中遇到了一个核心问题:transcript和 voice调用的是不同模型。这导致两者经常出现不一致:语音里已经回答过的内容,文本识别结果却是另一回事;用户说完后,前端还需要额外展示识别结果供用户 review 和 edit。结果语音交互没有变轻,反而多了一层确认成本。
这暴露的不是体验优化backlog,而是一个根深蒂固的幻觉:我们仍在把语音当成文本的输入法。
2. 学生项目辅导:用语音 Agent 讲解和调用component
在这个场景里,语音 Agent 的任务是引导学生完成项目选题、难度选择,并生成一份包含多个 Milestone 的 Roadmap。每个 Milestone 下再拆出 Brainstorming、Prototype、调研验证、开发测试、总结评估等不同类型的Task。每种 task,我们都开发了对应的前端交互 component,这样交互性极大丰富。
每个task内提供agenda+resources(根据类型封装到component中),voice agent可以调用resources,按照agenda和学生进行对话并实时调取。
设计时我们还想加入一个 Blackboard的概念:在对话过程中实时沉淀核心内容和关键结论,最后生成报告。
//我看千问app中的【小课堂】功能,就和我们当时设计的voice+blackboard理念是一致的。
但问题在于,Realtime 模型更像一个“单次会话的语音机器人”。没有记忆、没有上下文沉淀,每次对话都像从零开始,做不了真正深度的辅导。这种"request-response”的架构本身的局限性,决定了没法与用户建立长期关系。
3. Mock Interview:一个高匹配场景,但细节劝退
模拟面试是我们认为匹配度最高的场景之一,尤其对国际学生而言:面试流程陌生、文化背景和语言习惯差异大、准备时间短、容易焦虑。
测试下来发现了几个典型问题:
- 回答太结构化,不像真人。AI 会习惯性地“先表扬赞同,再提供依据,最后提问”,真实面试官不会这样每轮对话中都非常结构化的表达。
- 不会主动打断用户。真实面试是双向的,面试官会追问、会打断,但 AI 只能等用户说完后进行被动回应,无法100%模拟真正面试场景。
- 缺乏上下文和突发情况的处理能力。比如学生问“作为面试官,你能否介绍一些社团活动”这类无法靠网络搜索回答的问题,AI 很难给出有价值的信息。
这些问题的根因不是 prompt 写得不好,而是当时的语音交互能力本身就不完整:它只能“听和说”,不能“理解和记住”。
去年的所有坑,都不是工程问题,而是范式问题。 当一项技术颠覆了"人如何与软件建立关系",你还用旧关系的定义去套它,必然处处别扭。我们不是把语音做差了,我们是还不会"用语音思考"。
二、新一代 Voice AI 方案:系统性对比
最近我们又测试了新一代 Voice AI 方案,不得不说在platform方面老美做的还是比国内基模企业领先很多。
- 纯语音交互还是存在对话碎片化,太random,缺乏多模态支持无法加深印象,但可以通过产品化的方案进行进一步挖掘
- 由用户主导同时AI习惯性“拍马屁”的问题,都会导致对话场景仅限于情感陪伴,难以支持高质量的讨论。相比一名人类专家,和voiceai对话有时确实能带来一些新颖或深度的观点,但是非常依赖对话者本身的敏锐和对话题的引导。比如AI提供了10个不错的points,但在真实场景中哪些才能真正发挥价值还需要依赖人的经验。
- 端到端音频模型进一步压缩延迟,对话节奏更自然,音色、语气、一些语气词的停顿更接近真人,情感表达更丰富
- 有了memory,不再是一次性的对话,而是可以持久跨session进行交流,原业务深度有限,现在可以做深度对话
- 平台化后基础设施成本下降,搭建门槛显著降低
- 能做的事情很多。原本我们需要通过另一个agent读transcript,判断需要call tool或frontend component和用户进行交互,现在可以直接交给voiceai完成更seamless bridge到不同的功能模块
- 原来提到voice模型,就是通过实时音量高低的波形图来展示,现在可以更多visualization的展现形态。
三、未来语音 AI 产品会往哪走
- 应用场景会更加广泛,所说即所得
- 语音 AI 真正值钱的场景,不是替代搜索或替代打字,而是那些需要情感共鸣、实时反馈、长期关系的场景,这些方面豆包其实在C端市场已经做的很优秀了。
- 其次是和 Codex等相结合,能够通过语音直接触发调用各类工具,言出法随。
- 多模态结合,创设更真实的体验场景。尤其是这次 WAIC 当中展现出来的更多硬件方面的探索,代表着 AI 可以像电一样,作为一种新的生产力,逐渐交融在日常生活的各种场景中
- 技术演进会围绕“更真实的场景”展开
下一步技术竞争的关键,不是让 AI 说得更快,而是让 AI 说得更像人:
- 自然的打断与停顿:能识别用户是“思考中的停顿”还是“说完了”,适时插话或等待。
- 情绪与韵律感知:根据用户语气调整回应方式,不只是内容匹配,还要情绪匹配。
- 长期记忆与关系建模:记住用户是谁、处在什么阶段、需要什么帮助。不是随机性的发散,而是有聚焦、有记忆点,能够在对话当中不断地提升沟通的质量。
- 多模态融合:语音 + 视觉 + 触觉反馈,让交互更接近真实对话。
- 产品形态会从api变成Agent OS
未来的语音 AI 产品,可能不再是一个个独立的 App,而是一个可以嵌入各种场景的 Voice Agent OS:
- 每个 agent 有独立的 persona、memory、skill;
- 不同 agent 之间可以协作、转接;
- 前端组件可以像乐高一样组合,语音是主线,界面是辅助;
- 用户不需要打开某个特定应用,通过语音在黑盒调用给到最终结果。
历史上每一次交互革命,都伴随一次分发权力的转移:移动互联网让门户失去垄断。语音 AI 会再次重排:用户不再"打开App去做X",而是"说一句X,由Agent将结果交由用户确认Y"。用户根本不知道、也不关心背后是哪个服务商。
这意味着品牌将从"被用户记住"退化为"被 Agent call"。服务商的竞争从"抢用户注意力"转向"成为 Agent 调度时的最优解"。而掌握语音入口的平台,将收取新时代的"过路费"——就像搜索引擎曾经对信息流做的那样。Voice OS 不只是一个技术平台,它是一个尚未被瓜分的操作系统级垄断机会。
五年后,我们回望今天把"语音助手"做成一个 App 里的按钮,会像今天看有人拿智能手机只用来打电话、发短信一样可笑。
当然,现在这个时间点我并不建议做太多产品探索。因为基础模型还在爆发式的发展过程当中,当我们耗费各种想象力去在应用层面做了大量的创新,结果发现一年后,基础模型的迭代已经完全可以轻而易举地实现类似的功能。
现在需要保持耐心,聚焦于当前的问题。