近日,阿里巴巴集团旗下的研究团队低调发布了一项引人瞩目的新技术——TaoAvatar。这项创新项目专注于构建照片级逼真的3D 全身可说话虚拟人,旨在为增强现实(AR)应用带来革命性的体验,让数字世界中的互动更加生动自然。TaoAvatar 的出现,预示着我们未来的 AR 体验拥有了能听、能说、有表情、有动作的“虚拟化身”

QQ20250325-092514.png

打破次元壁,AR场景中栩栩如生的“你”

TaoAvatar 最核心的功能在于其能够创建与真人高度相似的3D 全身虚拟形象。更重要的是,这些虚拟形象并非 статичные 模型,而是能够在 AR 的3D 场景中进行实时对话

QQ_1742865979553.png

想象一下,在未来的电商直播中,你看到的不再是平面的主播画面,而是一个立体的、如同真人大小的虚拟形象,在你的房间里热情地介绍商品。在全息通讯中,远方的朋友将以生动的3D 形象出现在你面前,仿佛近在咫尺。

表情丰富,肢体自然:打造有“灵魂”的虚拟人

为了让 AR 体验更加真实,TaoAvatar 在面部表情和身体动作的控制方面下了很大功夫。

通过集成 Audio2BS 模型,虚拟人的面部表情和手势能够根据语音内容动态生成,实现口型、表情和动作的自然同步。这意味着虚拟人在说话时,不仅嘴巴会动,还会伴随着自然的眼神交流和肢体语言,使其看起来更富有情感和生命力

实时渲染,流畅体验:90FPS畅游AR世界

对于 AR 应用而言,流畅的体验至关重要。TaoAvatar 采用了 3D 高斯溅射(3DGS)技术,实现了高质量的实时渲染

即使在像 Apple Vision Pro 这样的高清立体显示设备上,TaoAvatar 也能保持 90帧每秒的流畅运行。这保证了用户在使用 AR 应用时,虚拟人的动作和交互都能够平滑自然,毫无卡顿感,从而带来更佳的沉浸式体验。

轻量高效,多平台兼容:未来AR触手可及

除了高质量的渲染,TaoAvatar 还具备低存储需求和良好的跨平台兼容性。这使得它能够部署在各种移动和 AR 设备上,例如 Apple Vision Pro。

为了实现高性能和低资源占用,TaoAvatar 团队首先构建了一个个性化的服装扩展 SMPLX 网格,并将高斯纹理与之对齐。然后,他们利用教师网络学习复杂的姿态相关的非刚性变形,并通过知识蒸馏技术将其“烘焙”到一个轻量级的 MLP 网络中。

此外,他们还开发了可学习的高斯混合形状来增强外观细节。这些技术的结合,使得 TaoAvatar 在保证渲染质量的同时,也具备了在资源受限的移动设备上运行的能力,为未来的普及奠定了基础。

展望未来:TaoAvatar开启AR沉浸式交互新时代

TaoAvatar 的发布,不仅展示了阿里巴巴在3D 虚拟人技术上的最新进展,更预示着 AR 应用将迎来更加沉浸和自然的交互方式。无论是远程协作、在线教育、虚拟社交还是数字娱乐,TaoAvatar 都有望发挥重要作用,让用户在 AR 世界中拥有一个可沟通、有情感的“数字替身”

项目入口:https://top.aibase.com/tool/taoavatar