旧照片背后的那句话,有智能体接住了:具身智能交互体验
手机里存着很多照片,其中一些拍下的时刻,你心里有没说出口的想法。之后很少有人会问起,这些想法就和照片一起放着。
我们做的「念头词典」不是相册或修图工具,它做一件事:你描述一张照片,智能体陪你把当时的想法理清楚,并可以存成一张带标题和备注的卡片。
怎么使用
打开网页,点"推开相馆的门",页面里出现一位智能体(设定是在暗房工作过的相馆老板,叫婉姨)。你可以直接描述照片,比如:“去年在鼓浪屿,刚下过雨,我坐在路边,想起了一些旧事。”
智能体会回应你描述的内容,并帮你把想法概括成标题和一句话备注,比如标题《雨停之后》,备注"想一个人,是不需要按下快门的"。内容会存进页面右侧的卡片架,数据只保存在本地浏览器。之后可以用"翻一页"功能,让智能体帮你重新回顾之前存的卡片。
几个功能点
- 不需要组织好语言再输入,可以随时补充、改口;
- 智能体说话时可以直接打断,它会停下接收新内容;
- 卡片不上传、不分享,可以随时删除。
这些交互依赖多模态感知能力,包括回声消除、VAD、智能打断等,让智能体在连续对话中保持响应。
系统是怎么运行的
这类功能如果用 ASR、LLM、TTS 三个模块依次拼接,在连续对话中容易出现状态不同步、回答与用户当下状态脱节。魔珐星云围绕一次完整交互设计系统,形成持续感知、持续理解、持续决策、持续表达与行动、持续反馈的循环(Continuous Interaction Loop)。
魔珐星云是端到端具身交互智能平台,把多模态感知、专属智脑、多模态表达、AI 端渲、数字行动与物理行动,连同 Real-time Interaction Runtime 组成一套系统,让 AI 通过屏幕和机器人进入真实世界。语音、口型、表情、手势根据内容实时生成并同步;画面在端侧渲染,不依赖云 GPU 和视频流。同一个智能体可以在网页、手机、平板、AI 屏幕乃至人形机器人上运行,身份和记忆持续复用,身体可以不断升级。
结尾
念头词典解决的需求很具体:让一张照片背后没说完的话,有人回应、可以存下来。