通往AGI的十字路口:世界模型赛道的资本博弈与技术分野
2026-07-27 13:06:57未知 作者:徽声在线
徽声在线7月27日讯(记者 林晓晨)在人工智能领域,关于世界模型是否为通往通用人工智能(AGI)的必经之路,至今尚未形成统一意见。
部分专家认为,世界模型与智能发展的上限并无直接关联,更多被视为一种具有商业潜力的技术方向;而另一派观点则坚信,仅依靠大语言模型难以实现AGI,只有让AI真正理解物理世界的运行规律,才能突破现有智能的边界。
尽管存在分歧,但资本市场的动作却异常活跃:截至2026年上半年,全球风险投资对世界模型初创企业的投入已突破30亿美元,智象未来、生数科技、千寻智能等企业相继完成多轮大额融资。
一边是理论争议未平,一边是资本加速布局,世界模型赛道的发展态势愈发复杂。
同一概念,不同技术路径的探索
今年4月,徽声在线记者在合肥科交会上首次报道了智象未来。这家总部位于合肥科大硅谷的AI企业,当时刚完成超5亿元融资,并发布了新一代原生全模态世界模型HiDream-O1。
短短三个月后,智象未来已连续完成三轮融资,累计融资额超过21亿元,公司估值在密集资本注入下突破独角兽门槛。近日,徽声在线再度对话智象未来创始人梅涛,试图通过这家企业的崛起轨迹,解析行业对世界模型的真实判断。
梅涛是世界模型路线的坚定支持者。
他曾在采访中指出,大语言模型难以独立实现AGI,因其无法指导机器与真实世界交互。真正的世界模型需具备对物理世界进行表达、建模、推理和反馈的综合能力。
行业常用“model the world”描述世界模型,而梅涛更倾向于“mold the world”——即塑造世界。他强调,若AI仅停留在复现世界,本质上仍是对人类知识的压缩与复刻,人类文明积累的信息量终将成为模型能力的天花板。
基于这一认知,梅涛认为世界模型至少应具备三种核心能力:表达世界、推演世界和构造世界。这意味着模型不仅要生成逼真的图像或视频,还需理解多模态信息间的关联,以及场景背后的空间关系、时间演变和因果逻辑。
这一理念直接影响了智象未来的技术路线。
当前多数多模态模型采用分立架构:图像、文字等模态先独立编码,再在模型中完成对齐与融合。而智象未来选择原生全模态路线,通过自研的UiT(Unified Transformer)架构,将图像像素、文本Token、视频体素以及音频、动作、空间关系等信号映射至共享的Token空间,实现统一理解、生成与推理。
“原生全模态从某种意义上说,是对人类感知世界方式的还原。”梅涛举例称,人看到台风登陆的新闻时,会同时联想到狂风、雷声乃至温度变化,这种联想源于多种感知系统的协同,而非单一模态的独立处理。
按照规划,智象未来将沿着“以图入视、以视入世”的路径,从图像生成向视频生成延伸,最终探索世界模型的完整能力。在图像生成领域,其技术已获第三方验证:在Artificial Analysis的文生图榜单中,开源模型位列开源类第一,闭源商用模型进入全球前三。
梅涛进一步表示,公司不会在通用语言模型领域与头部厂商正面竞争,而是聚焦视频与原生多模态技术。
这一策略使智象未来成为观察世界模型分歧的典型样本:梁文锋关注世界模型能否提升通用智能上限,而智象未来则试图将世界模型转化为内容生产、视频创作乃至物理世界建模的技术基础。
可以说,双方使用同一概念,却回答着不同的问题。
同一“世界模型”,不同商业模式的选择
事实上,世界模型的概念尚未统一,贴上这一标签的企业在技术路线与商业选择上差异显著。徽声在线记者结合采访案例,将这类企业大致分为三类。
第一类是以图像和视频生成为切入点的企业,如智象未来、生数科技、爱诗科技。这类公司需优先解决画面质量、空间关系、长时序一致性、内容可控性和生成成本等问题。
尽管同属这一类别,各企业的具体路径仍有差异:智象未来强调原生全模态,通过统一架构处理多模态数据;生数科技从视频生成起步,提出MoT统一架构;爱诗科技则聚焦多模态视频大模型与面向消费者的视频生成产品。
第二类企业聚焦具身智能基础模型,试图通过视频、机器人数据或仿真环境,学习物理世界的状态变化,并预测动作结果。例如自变量、逆矩阵等企业,其目标并非生成供人观看的视频,而是为机器人的感知、决策和动作生成提供支持。这类模型的核心挑战包括训练数据稀缺、仿真与现实差异、长时序任务规划,以及模型在不同机器人本体和应用场景中的泛化能力。
第三类企业面向机器人技能生成与动作执行,如逐际动力、跨维智能。这类公司利用世界模型能力,打通机器人从任务理解到真机执行的链路。与训练通用物理规律表征的世界基础模型不同,它们更关注如何将视觉、语言和环境状态等信息转化为具体本体可执行的动作策略。世界模型在这里更像连接理解与执行的“技能层”。
对这类企业而言,世界模型的商业价值不在于单独出售通用基础模型,而在于缩短机器人从理解到执行的链路,最终通过机器人整机、技能方案或场景交付实现收入。
由此可见,当前被冠以“世界模型”概念的企业,底层逻辑并不相同:视频生成公司率先在内容产业寻找收入,具身智能基础模型公司试图成为物理世界的通用能力底座,世界动作模型公司则希望让机器人率先获得可落地的技能。
三条路线共享“理解和推演世界”的技术叙事,但产品形态、目标客户和商业化周期差异显著。
谁在押注世界模型?
智象未来的融资速度,是观察资本热情的一个缩影。
其最新完成的15亿元C轮融资,由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投。这是社保基金首次以LP身份投资多模态大模型领域,工银资本也是首次进入该赛道。
跟投方阵容同样多元:厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视、航源资本、创云海资本、华福投资、余杭金控股份、交银资本、若松基金等参与其中,老股东合肥产投、东方富海、金浦投资、金华金投持续加注。
梅涛对投资者的逻辑有独特观察。他认为,国家级资本的进入意味着对长周期投入的认可——“世界模型的研发不是短跑,需要底层架构的持续原始创新”;影视产业资本指向内容生产方式的重构——上影、华策带来的不仅是资金,更是高质量影像数据和真实内容场景;地方国资的逻辑则落在产业生态上——合肥产投已连续三轮加注,从合肥到厦门、杭州、湖北,多地国资正在构建跨区域的“资本+产业”支撑网络。
智象未来并非孤例,不同路线的公司正以不同节奏吸收资本。从资金分布看,资本青睐程度差异明显。
第一类从图像和视频生成切入的企业(智象未来、生数科技、爱诗科技等)中,智象未来三个月融资超21亿元、爱诗科技完成29.8亿元C轮融资、生数科技B+轮单笔5亿美元,三家融资合计超百亿元,均已触及独角兽门槛。
第二类聚焦具身智能基础模型的企业是当前独角兽密度最高的方向——智元机器人(估值150亿+)、星海图(估值200亿)、智平方(估值百亿+)、银河通用(估值百亿+)均属此列,自变量投后估值亦突破200亿元。
第三类面向机器人技能生成与动作执行的企业(逐际动力、跨维智能等)融资阶段整体偏早期,公开融资信息有限,尚未出现独角兽级别公司。
可见,资本对“离物理世界交互更近”的方向倾斜明显,但对“离内容生成更近”的方向同样保持投入。
“世界模型现在就像2010年的移动互联网,”一位VC内部人士对徽声在线记者表示,“我们也不知道哪个方向最终能跑出来,但我们知道不投一定会错过。”
资本确实已大规模涌入。产业资本中,华为哈勃、小米战投等相继布局;市场化VC里,顺为资本、红杉中国等在多个头部项目中密集落子;国家队方面,社保基金、中网投、中国国新等相继进场;地方国资层面,杭州、厦门、湖北等多地同步跟进。四种不同性质的资本在同一赛道交汇,百亿级资金已注入。
这些资金最终能催生技术突破、商业模式创新,还是仅是一场估值游戏,取决于企业能否将“世界模型”从概念转化为可交付的产品。在此之前,分歧与竞速仍将持续。
(徽声在线记者 林晓晨)

