我们会发现一个非常有意思的现象,就是所有的AI产品都在做chatbox,无论是豆包还是其他产品,除非它做得非常垂直。但即使在垂直领域,它本质上也是作为一个ChatGPT的wrap,或者说交互上和传统的app并没有本质区别,可能在某些地方的内容生成,或者原来需要人工、大量廉价劳动力去整理的文本类工作,现在可以通过AI来生成。但这样的体验并没有很aha moment,特别是loading的过程会让人觉得非常无聊且困惑。
chatbox 是「不确定性最高时」的最低成本解法。这其实和早起的互联网是从一个search box,或更早期BIOS的command line类似。通过这样的交互,能够尽可能覆盖用户的所有使用场景,并由用户主导去完成task。但也会陷入到产品的惰性中,就是在此基础上加任何的功能,反而会让用户抵触。类似从一维世界跃迁到二维世界。
这也是我现在遇到的一个非常大的roadblock。那么,我们期望的,或者说我在思考应该做的AI产品应该是什么样子的?我认为它本质上还是一个chatbox,就是你可以在任何页面都有一个输入框,都有上下文,可以进行对话。但它的交互不应该是现在这样,纯文本,或者在部分地方需要人去做非常自由的发散,而是应该让自由、chatbox和一些原生的UX相结合。chat不是入口而是对feature的补充或延伸。今天和team的小伙伴们讨论,我还以教育学的理论举例。文字传输信息的效率其实是很低的,需要主动阅读并激发大脑中深度思考的那部分,需要人主动注意(attention is all you need),有比较大的认知负荷。而图片或视频通过多感官激发注意力,某些细节是通过潜意识来转换为自己的临时记忆或长期记忆,因为有多重记忆锚点,记忆的留存率也会比较高。
比如说,我点击某个页面,它就固定呈现某些对应的内容,然后有相应的数据结构,非常结构化的内容,有有趣的动效,还可以让用户做一些操作。
其次,它可以在底部随时提供一些胶囊建议或快捷回复操作,也就是当前聊天框中通用的功能。与此同时,我们还会增强聊天框的输入框和对话记录功能。
通过这些功能,我们既兼顾了传统应用给用户带来的准确、明确的操作界面——类似于游戏中的技能、任务、NPC和对话;同时,它又可以通过聊天框,让用户能够自由探索。就像除了固定路线,用户还可以在地图中随意走动,探索更多未知领域。
随着AI的广泛应用,它能快速帮我们生成内容和进行搜索。本质上,这是对生产力的巨大提升,也导致人们对内容获取的速度要求越来越高。原来在使用APP的过程中,一些加载动画或等待时间,用户的容忍度会越来越低。哪怕只有10秒的等待,如果他发现自己什么都做不了,就会感到困惑、无聊甚至烦恼。
我认为,这是当前阶段能够明确的一种应用形态。