首页 > 车圈原创 > 车圈原创 > 人形机器人实现多语言逼真唇形动作

人形机器人实现多语言逼真唇形动作

发布时间:2026-01-21 17:33:47来源: 13041198719

美国哥伦比亚大学科学家设计出一种新型框架,使人形机器人面部能够根据音频生成逼真的唇部动作,实现与人类语音的同步。该技术还展示了较强的泛化能力,可推广至包括法语、汉语和阿拉伯语在内的多种语言,即使这些语言并未出现在训练数据中。研究团队在发表于最新一期《科学·机器人学》上的论文中指出,这一进展是朝着构建不仅能执行功能,还能进行人性化交流的机器人迈出的重要一步。

在对话中,如果机器人的唇部动作与声音不匹配,会显得呆板且不自然。然而,现有机器人普遍缺乏执行精细口部动作的灵活性,能实时将语音转化为自然唇部运动指令的技术也寥寥无几。

研究团队在2024年曾发表研究,描述了一种人形机器人面部可以预测人类的微笑并同时再现该表情。在此基础上,为更加精细化唇部与声音的匹配,团队设计了一套学习流程:首先采集机器人唇部运动的视觉数据,用于训练模型并生成运动参考点;随后通过一个名为“面部动作转换器”的模块产生运动指令,使机器人的唇部能够流畅配合不同词语。他们还专门研制了一种人形机器人面部结构,采用柔软硅胶皮肤,配合磁性连接器,具备10个自由度,可驱动复杂的唇部运动。其唇部结构能形成覆盖24个辅音和16个元音的各种口型。

在验证过程中,团队借助ChatGPT生成测试语句,并合成了具有理想唇部动作的视频作为对比基准。结果表明,该方法在5种比较方案中表现最优,其生成的唇部动作与理想视频差异最小。此外,该框架还能为11种不同语音结构的非英语语言生成自然的唇部同步效果。

研究团队推测,这类人形机器人在教育、老年护理等领域具有应用潜力。但他们也强调,未来的设计工作需格外谨慎,以防止技术被滥用。(科技日报记者 张梦然)

总编辑圈点

现在,AI让虚拟人物动嘴说话已经“不在话下”,然而让机器人做到这点还相当困难。大多数机器人“说话”时并不动嘴,即使动嘴,也只是象征性一张一合。这次,科研人员试图让机器人拥有人类一般细腻、精准的唇部动作,教它们通过合成视频以“照镜子”的方式学习;还开发了硅胶皮肤,设计了面部机械系统。结果表明,机器人可以“学会”多种语言的唇部动作。不过,研究也不禁让人思考,当机器人真的开口说话,“恐怖谷效应”是会加重还是减轻?

 

车圈原创更多>>

别克至境世家插混奢享版:五恒座舱+四驱,适合全家人的新能源MPV 全能型MPV推荐!别克至境世家,空气悬架+C级空间,续航1320km 硬件堆料难救市场表现,魏牌V9X月销始终难破两千台 增程月销量暴跌25%,小米澎程此刻入局算晚吗? 比亚迪海狮08预计将于8月上市 终于有人把这道题做完整了!东风奕派M8体验记 东风奕派M8:华为乾崑全系标配,这台六座SUV在照顾全家人的里子 国内首个湿热车辆出口定型检测基地投用,补齐汽车出海验证短板 宝马高管明确产品定位,全新一代X5不再侧重强化越野能力 启境GX7轴距3070mm,一键成床大五座SUV空间实用性解析 2026款凯迪拉克CT5测试翻车,IIHS四项核心项目获评最差评级 莲花跑车2026下半年产品矩阵首曝光,三大动力路线同步落地 小米澎程N90/N70申报,5/7座增程SUV亮相 华境S,累计销量破万,主打家庭多场景出行需求 享界V8登陆工信部申报目录,纯电增程双动力完善产品矩阵 弱化大屏视觉核心,奥迪下一代座舱重启实体操作部件 切入大空间SUV赛道,小米澎程扩充品牌产品矩阵 7系阵营集体失眠!启境GX7猜想图流出,“湾区大卡宴”未发就赢了 FREELANDER神行者8 首发限定版全球首秀 23.99万起,全尺寸+闪充+智驾:大唐EV的旗舰体验,一步到位 最早“举”起芯片的零跑,给“芯片自研”做减法 千年文明,万里闪充—— 重走马可波罗新丝绸之路 汇聚顶级气场、硬核实力、旗舰体验,大唐EV上市,售价23.99万元起 23.99万起掀翻旗舰桌子!比亚迪大唐EV上市,全尺寸纯电SUV开始“卷”真格了? 李想回击“唱衰增程”:纯电增程满足不同需求,不要搞能源鄙视链 欣旺达动力王勇:2030年国内HEV市占率可达15%-16% 是MPV也是SUV!魏牌高山 7 SUV版上市限时权益价27.08万 6.28万起开上大满配,高颜值、大空间极狐贝塔T1焕新上市 颜值舒享智能全进阶,哈弗H6经典版2026款限8.19万元起 7.89万起,第5代帝豪 i-HEV智擎混动上市,2L级油耗+强动力