从内容生成到物理认知:WAIC揭示AIGC新趋势
2026-07-20 19:05:27未知 作者:徽声在线
徽声在线7月20日讯 (记者 王彦琳)在AIGC(人工智能生成内容)领域,AI生成的图文和视频已经达到了极高的逼真度,那么未来的发展方向是什么?在2026世界人工智能大会(WAIC)的现场,徽声在线记者发现,AI技术正突破“单纯生成画面”的局限,开始深入理解和模拟物理世界的动态逻辑。
在模型研发层面,众多科技企业纷纷涌入这一新兴赛道。昆仑万维(300418.SZ)董事长方汉在接受徽声在线等媒体采访时透露,几乎所有的文生视频厂商都在积极布局世界模型,其背后的逻辑在于,训练视频模型的技术基础可以自然延伸至世界模型领域。
多家AI企业明确释放信号:AI的下一站将是走出虚拟屏幕,与物理世界进行实时交互,在真实场景中解决实际问题,从而推动技术的实用化和商业化进程。
物理AI企业拓展AIGC新领域
徽声在线记者在WAIC现场观察到,多家物理AI企业和AI基础设施公司正将业务触角延伸至AIGC领域,内容场景因其广泛的受众基础,正成为检验模型能力的“试验田”。
极佳视界展示了其全栈世界模型产品矩阵,包括一粟YiSu、DriveDreamer、GigaWorld、GigaWorld-Policy等,这些产品覆盖了内容创作、驾驶仿真到具身智能等多个领域。
极佳视界内容业务负责人陈宏在接受采访时表示,就内容生成而言,世界模型具有几大显著优势:一是对真实物理规律的还原度更高。由于训练数据大量来源于真实物理世界的交互数据,模型更能理解现实世界的运行逻辑。像爆炸、粒子、流体等传统AI视频中容易穿帮的画面元素,用世界模型生成会更加真实自然。
二是支持实时交互式内容生成。常规视频生成工具需要用户输入提示词后等待成片,相当于单次生成、被动接收结果;而世界模型则支持全程实时反馈、实时调整、实时渲染,无需等待成片,大大提升了创作效率。
三是对3D空间的理解能力更强。现有视频模型受架构限制,很难精准还原真实三维空间逻辑,而世界模型依托真实物理数据训练,能有效解决空间透视、物体位置、景深错乱等问题,为3D内容创作提供有力支持。
群核科技(00068.HK)则利用其AI视频创作智能体LuxReal,结合自研的世界模型SpatialGen,实现了从平面图或视频一键生成3D虚拟片场的功能,打造了所谓的“赛博横店”。这一创新解决了以往视频生成中镜头穿帮、空间错乱等问题。
群核科技相关负责人向徽声在线记者介绍,传统2D视频生成模型好比“化妆师”,负责优化画面视觉美感;而3D世界模型则等同于场记+导演,把控空间逻辑、杜绝穿帮,保障画面可控性。视频智能体同时接入两套能力,协同完成创作,大大提升了内容的质量和效率。
底层空间技术的通用性还使其能够向外辐射多个行业场景。群核科技还面向各行业开发者推出了空间智能开放平台AHOLO,提供三维场景生成、实景重建能力,为游戏、文旅等从业者提供专业资产制作能力,进一步推动了技术的跨界融合和应用。
AI基础设施厂商范式智能(06682.HK)则推出了一站式AI影视制作工作流平台PhanthyMovie,展示了AI如何贯穿创意生成、内容制作和后期编辑的全流程,进一步释放了内容生产效率。此外,范式智能还在展台首次对外亮相了搭载跨平台通用具身Agent框架PhanthyMotus的机器人,为参会者提供了实景互动演示,展现了机器类人感知、自主决策与智能执行能力。
世界模型:AI时代的下一个技术基座?
“过去两年AI的核心命题是生成——生成文字、图像、视频、音乐。而从今年开始,AI的核心命题转向理解与交互,让AI真正理解物理世界的运行规律,并能与真实环境进行闭环互动。”方汉在昆仑万维WAIC专场论坛上表示,世界模型是实现这一跨越的关键技术底座。
他预判,未来世界模型将走出屏幕,进入物理世界;游戏行业将率先被重构,未来三到五年,世界模型将成为游戏行业的基础设施,彻底刷新内容生产方式;AI音乐、AI视频等工具将从技术试验变成大众创作工具,促进AIGC的深层发展。
随着视频生成模型能力的接近和技术路线的收敛,竞争维度正在发生迁移。视频模型不再仅仅满足于内容生成,更可以成为理解物理世界的“大脑”,为各种应用场景提供智能支持。
本届WAIC上,昆仑万维宣布升级其核心模型,推出Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型,全面覆盖世界模型、AIGC创作等前沿赛道。其中,Matrix-Game 3.5聚焦可交互世界模型技术,实现了Patch级别的记忆注入与系统级性能优化,5B模型在720p分辨率下可实现单卡20FPS实时生成,具备1分钟记忆能力。
方汉认为,训练视频、游戏生成模型所需的算力集群、海量数据清洗能力,和世界模型高度相通。传统视频生成厂商可依托规模化数据能力快速迭代模型;文本大模型规模化红利已经逐步见顶,但音乐、视频、游戏生成模型仍处在红利期,持续扩大数据规模就能稳定提升效果;单纯做应用层产品风险较高,企业核心竞争力仍要放在底层模型研发上,即便布局应用,也要打造模型无法轻易复刻、难以通过训练覆盖的独有数据与业务流程。
整体来看,昆仑万维此次发布的模型组合拳,意在将以往的模型基础和能力从数字世界拓展到物理世界,实现文字、视频、音乐、游戏以及具身智能领域的全面布局,为AI技术的广泛应用奠定坚实基础。
生数科技在此次WAIC上也展示了三条清晰的产品线,分别是实时交互模型Vidu S1、世界生成模型Vidu以及面向具身智能机器人的世界动作模型Motubrain,形成了从理解到行动的完整布局,为AI技术的落地应用提供了更多可能性。
生数科技创始人、清华大学人工智能研究院副院长朱军表示,视频生成、实时交互与机器人行动并非彼此割裂的技术方向,而是通用世界模型从理解、预测到行动的连续演进。这一观点为AI技术的发展指明了新的方向。
“世界模型有机会成为支撑AI完成更多复杂任务的下一代底层基础设施。”陈宏对记者表示,成熟的世界模型具备通用理解能力,未来世界模型迭代完善后,机器人能够像人类一样观测环境、预判后续动作,无需针对每个物体、每项任务单独训练。机器人将依托世界模型积累的海量世界认知,自主感知环境、规划操作逻辑,实现真正通用智能。
技术走向真实场景:游戏与工业的跨界融合
游戏行业一直是AIGC技术落地和商业化的前沿阵地。有趣的是,相关技术也赋能物理AI进化,让AI走出屏幕,在真实场景中“干活”,推动了技术的实用化和跨界融合。
徽声在线记者在网易旗下具身智能品牌“网易灵动”展台看到,一座颇具游戏感的智能座舱的显示大屏实时播放露天矿山上挖掘机的作业实况。通过脚踏板和移动手柄,就能远程操控千里之外的挖掘机作业。据悉,网易灵动已推出挖掘机、装载机两大主力产品,目前已经落地内蒙古、新疆、四川、甘肃等地的百余个项目中,为工业生产提供了智能支持。
而这两款工业机器人背后,大量运用了网易在游戏领域沉淀的AI技术。例如在《逆水寒》、《永劫无间》等游戏中研发的3D虚拟技术,原本用于捏脸、人机交互,如今落地到工程机械领域,用于搭建矿山、搅拌站的三维虚拟作业场景,在虚拟3D环境中完成挖掘、装载等任务的模型预训练与问题排查,大幅降低了线下真机调试成本。
“早期我们在游戏研发中积累了整套AI能力与仿真环境技术,其中强化学习、仿真系统底层技术框架具备通用性。过去这类技术用于优化画面、提升游戏体验,现在我们直接迁移到工程机械智能化体系搭建中。”该负责人对徽声在线记者表示,这一跨界融合为工业生产带来了革命性的变化。
她进一步透露,该套方案交付企业后,模型、配套算力全部端侧部署,整体算力分层调度:场地侧负责批量预训练与数据调度,车载端独立承担实时环境感知、决策、路径规划、设备控制。这一部署方式大大提高了系统的稳定性和效率。
从技术路线来看,2026年被业界视为端侧AI规模化落地元年。徽声在线记者获悉,在本届WAIC上,北京智源人工智能研究院联合端侧实验室发布了《端侧智能2026——规模化落地元年》报告。报告指出,2026年端侧智能正从概念验证迈向规模落地,产业化拐点已然到来,为AI技术的广泛应用提供了有力支撑。
面壁智能同步发布了两款端侧大模型产品:仅20亿参数的MiniCPM5-2B端侧文本大模型,在综合知识、数学推理、代码、指令遵循和智能体能力上均做到同尺寸领先,已落地手机、汽车、具身智能、航天等多元终端;VLA具身模型则以通用智能为起点,让机器人能够直接处理普适、长程、流水线式任务,为AI技术的落地应用提供了更多可能性。
“人工智能发展到今天,很像早期的移动互联网,技术在快速发展,要跟千行百业去做结合,市场非常广阔。我们希望能够找到真正有价值的产业、场景、落地方式,让整个产业更快受益。”面壁智能CEO李大海在接受徽声在线等媒体采访时表示,他对AI技术的未来充满了信心。
(徽声在线记者 王彦琳)

