Google 首次展示"Beam 视频智能体"
5月19日,Google 在其加州山景城实验室首次向外界展示"Beam 视频智能体"(Beam Video Agents),标志着其将 AI 智能体从文本界面延伸至"有脸有表情"的实体交互形态。 该智能体名为 Sophie,是一位身穿黑色高领衫的女性虚拟形象。她可通过 Google Beam 实时投影技术与用户对话,支持多种语言,能识别手机、纸张或书本上的文字,并调用 Google 生态服务,如查询地图、推荐餐厅、查看天气等。其语音由文本驱动生成,面部做唇形同步,肢体动作为辅助叠加。 然而,当前体验仍存在明显瑕疵。Sophie 每次回应前都有较长的停顿,发言长度高度一致,肢体动作反复雷同,英文口音也在"中性美式"与南部方言之间漂移。Product Manager Pavan Kumar 解释称,本次演示专为 Google I/O 参会者设计,限时五分钟,属于早期实验性质。 Beam 硬件本身是 Google 基于裸眼 3D 的远程会议方案,首款产品为售价 2.5 万美元的 HP Dimension,搭载六台摄像头生成 Volumetric 3D 人体投影。此次还首次开放群体通话功能,支持传统终端入会,并引入定位音频。 Google 目前仍未公布任何发布计划,亦未明确目标用户。高管 Andrew Nartker 透露,VR 端内部演示已在进行中,未来将拓展不同尺寸的"窗口"形态。业内认为,该方向或适用于办公、零售与教育场景,但技术成熟度与用户接受度仍需时间验证。
