十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

手机随手拍一段视频,AI 能还原出一个可以 360° 旋转视角的“数字人“

手机随手拍一段视频,AI 能还原出一个可以 360° 旋转视角的“数字人“ 你有没有想过有一天你拿手机随手拍下一段跳舞的视频上传给AI几分钟后屏幕里出现的不再是那个固定角度的画面——而是一个可以任意旋转、从正面看、从背后看、从侧面看都无比清晰的数字人这不是科幻片。这是浙江大学、蚂蚁集团和港科大的研究团队在2026年8月刚发表的一项成果叫做4DAnyone。代码已经开源任何人都可以去试。01PARTAI → 容易忽略的事情视频只有一个角度我们每天在手机里录了多少视频孩子第一次走路朋友在台上演讲健身房里练了很久终于打出那个动作……这些视频有一个共同的缺点只有一个角度。镜头在哪你就只能看到哪里。身后那片你没拍到的空间永远缺席。这是一个看起来理所当然的限制。毕竟一台手机就一个摄像头你没法同时站在左边、右边和背后。然而4DAnyone做的事情就是打破这个限制。02PART一个视频 → 360° 旋转视角视频360 度无死角旋转视频这项技术的核心想法听起来有点魔幻你只给它一个普通的单目视频比如一段街拍、一段舞蹈、一段运动视频镜头还可以在轻微移动不需要固定三脚架不需要告诉它摄像机的型号、焦距、位置——什么都不用。它先从这段视频里提取出人物的3D骨架——就像X光一样把人的骨骼结构在三维空间中还原出来。然后它用AI脑补出如果有16台摄像机围着这个人拍各个角度分别会拍到什么。最后这16路视频合在一起训练出一个4D高斯泼溅模型——一种可以实时渲染、任意视角观看的数字化人物。结果是那个只有一台手机拍到的人变成了一个可以在数字空间里360°自由旋转的立体影像每一帧都跟得上原始动作每一个角度都是真实还原不是胡编的。03PARTAI 视频→ 这件事情为啥这么难角色一致性你可能会想AI那么厉害这不是早就能做了吗还真没有。难就难在一致性上。以前那些AI如果要生成多角度的画面会出现一个头疼的问题正面看是一件红色上衣侧面AI生成的变成了蓝色从左边看到的手臂和从右边看到的对不上。不同角度之间画面像是来自两个不同的人。为什么因为AI要同时生成十几个角度的视频算力有限它不得不分批处理批次之间信息不互通于是漂移了。04PART4D anyone → 多角度视频2 个关键设计4DAnyone专门解决了这个问题用了两个关键设计第一个叫RCP参考上下文压缩把之前已经生成好的角度压缩成精简的记忆喂给下一批就像你让一个画师同时画多个角度的同一个人给他看前面画的草稿而不是让他凭空发挥——一致性大幅提升而且计算成本不随角度数量暴增。第二个叫TCR目标上下文路由在AI生成的早期阶段让不同批次之间互相对齐全局结构到了细节阶段再各自精修——就像盖房子先把框架搭一致再装修各自的房间。这两个设计组合在一起让生成质量在主流评测上大幅超过此前所有同类方法。05PART4D anyone→ 设计骨架深度视频·骨架4DAnyone还有一个和其他方法不同的地方它的几何引导用的是3D骨架而不是深度图。听起来像技术细节但背后有很实用的考量深度估计很容易翻车。从一段手持手机的随意视频里去精确推算每个像素离摄像头有多远这件事本身就很不可靠。一旦深度估计错了后续生成的所有角度全都跟着歪。骨架更稳。现代的人体姿态估计技术已经相当成熟从单目视频里提取一个人的3D骨架误差很小非常可靠——哪怕人在快速运动、部分遮挡骨架依然能给出一个大体没错的答案。所以4DAnyone选择了宁可稀疏但要准的路线用骨架提供准确的空间结构把衣服纹理、脸部细节这些事留给AI自己从视频里学习。这个思路让它在野外真实视频上的泛化能力比依赖精确深度估计的方法强得多。06PART如何用这项技术与你有什么关系你可能在心里嘀咕听起来很厉害但和我的生活有什么关系想象一下几个场景你的孩子第一次学会独立走路。现在你只有一段手机视频。有了这项技术这个珍贵瞬间将来可以被还原成一个可以从任意角度重温的立体影像——不是照片也不是视频是可以在数字空间里环绕的记忆。你是电商卖家。一件衣服的上身效果现在需要请模特、租摄影棚、多角度拍摄。以后或许只需要一段随手拍的视频AI帮你生成可以360°旋转的试穿展示。你做游戏或影视内容。传统方法想做一个可以任意角度渲染的数字人需要一套48台摄像机的摄影阵列成本极高。4DAnyone让这件事的门槛从专业摄影棚降到了一台手机。更远的方向元宇宙、虚拟现实、具身AI。当AI体要认识和理解真实世界里的人的时候4D人体重建是一个基础能力。4DAnyone让这个能力的获取方式从昂贵的专业设备变成了一段普通视频。07PART它的边界在哪里4D anyone 的局限性有意思的是这篇论文在最后诚实地列出了失败案例。如果一个人穿着一件布料松散飘动的大裙子骨架只能追踪到身体结构但飘动的裙摆在不同角度之间很难保持一致——还原质量会明显下降。还有如果人做了一个非常罕见的动作比如芭蕾舞者踮起脚尖人体姿态估计模型可能会把这个动作认错后续生成的所有角度都会跟着把姿势搞错。这是技术现阶段真实的边界研究团队没有回避它。另外论文也特别提到了伦理问题这项技术能生成高度逼真的人体视频存在被用于深度伪造、侵犯隐私的风险。研究团队明确反对任何未经本人同意的恶意使用。08PARTAI 4D 数字人值得关注过去几年AI让图像生成爆炸让文字生成爆炸让语音生成爆炸。但把真实世界里的人变成数字空间里可以任意操控的存在这件事一直有一道很高的门槛——它需要昂贵的专业设备需要严格控制的拍摄条件需要大量的标定和校准工作。4DAnyone做的事是把这道门槛大幅压低。一段随手拍的视频进去一个可以自由旋转的4D数字人出来。这不是玩具。这是基础设施的变化。当一件原本需要专业团队、专业设备才能做到的事情变成了每个人拿手机就能启动的流程——它能带出什么没有人能完全预见。代码已经在 GitHub 上开源模型也在 HuggingFace 上公开论文发表在SIGGRAPH Asia 2026。感兴趣的同学可以自己去看演示效果那些在舞台上表演、在球场上运动的人被AI还原成可以360°旋转的立体影像在屏幕上跟着你的视角转动——还是挺震撼的。09PART4D anyone 技术实现代码实战附想自己跑一遍的同学看这里以下内容面向有 Python 基础、手边有 GPU 的同学。官方建议至少一张 H2080GB显存用于生成一张 RTX 409024GB显存用于重建没有本地机器的可以用 AutoDL 或者 Vast.ai 租用。第一步拉代码、建环境...Pythongit clone https://github.com/ant-research/4DAnyone.gitcd 4DAnyonegit submodule update --init third_party/GVHMRconda create -n 4danyone python3.11 -yconda activate 4danyonepip install -r requirements.txt第一次运行时模型权重会自动下载包括 HuggingFace 上的 Wan2.2 底座和 4DAnyone 的训练权重。也可以手动提前拉...Pythonpython scripts/download_smplx.py # 人体参数化模型 SMPL-Xpython scripts/download_model.py # 4DAnyone 权重python scripts/download_example.py # 示例视频第二步准备你的输入视频视频有几个硬性要求否则效果会大打折扣竖版比例9:16单人出镜全身或半身均可至少 121 帧30fps 下约 4 秒镜头不要大幅移动轻微手持抖动可以接受人物尽量占画面主体背景干扰越少越好第三步运行推理生成多视角视频最简单的跑法生成围绕人物均匀分布的 4 个视角...Pythonpython inference.py \--video_pathdata/source/pexels/10331522-uhd_2160_4096_25fps.mp4 \--views_per_layer 4想要更完整的环绕效果可以生成 3 个仰角层、每层 16 个视角共 48 路视频这需要约 8 张 GPU 并行...Pythonpython inference.py \--video_path 你的视频路径.mp4 \--views_per_layer 16 \--layer_pitches [-10,15,35]只想看正面到背面的半圆效果可以限定水平范围...Pythonpython inference.py \--video_path 你的视频路径.mp4 \--views_per_layer 8 \--start_yaw-90 \--yaw_span 180推理完成后输出结构大致如下...Pythondata/fdanyone/clip/├── cameras.json # 各摄像机参数├── skeletons/ # 各角度的骨架可视化视频└── videos/├── sparse/ # RCP 参考视角视频中间产物└── dense/ # 最终生成的所有目标视角视频第四步可选重建成可交互的 3DGS 模型如果你想把生成的多视角视频进一步重建成可以实时旋转、渲染的 3D 模型需要先装 Nerfstudio...Pythonpip install nerfstudio然后导出某一帧的多视角数据用 splatfacto 训练一个高斯泼溅模型...Python# 导出第 0 帧的所有视角python scripts/export_nerfstudio.py \--result_dir data/fdanyone/clip \--frame_index 0# 训练 3DGS 模型ns-train splatfacto \--data data/nerfstudio/clip/frame_000 \--pipeline.model.background-color random训练完成后Nerfstudio 提供一个本地 Web 界面可以直接在浏览器里拖动视角实时渲染。显存不够怎么办官方正在开发低显存32GB推理模式还在 TODO 列表里尚未发布。目前折中方案减少 views_per_layer 到 4 或 6单 GPU 显存占用会显著下降生成质量略有影响但可以跑通。更多transformerVITswin tranformer 参考头条号人工智能研究所 v号人工智能研究Suo, 启示AI科技动画详解transformer 在线视频教程
返回列表