中国智能体登顶OSWorld,90.2%成功率引领全球AI新潮流
2026-08-04 02:04:12未知 作者:徽声在线
2026年7月27日,中国自主研发的智能体“实在Agent”以惊人的90.2%任务完成率,成功登顶OSWorld全球总榜,并一举夺得智能体分榜的双料冠军。这一壮举标志着Meta、Anthropic、OpenAI等硅谷科技巨头的公开最高纪录被一家中国公司全面超越,彰显了中国在人工智能领域的强劲实力。
据悉,这家创造奇迹的公司是来自浙江的实在智能。其自主研发的“实在Agent”成为OSWorld自2024年发布以来,首个突破90%成功率的Computer-Use Agent。90%这一数字,在业界被视为关键临界点——低于此,智能体尚处于“勉强能运行”的实验阶段;而一旦跨越,便意味着智能体已迈入稳定可用、可靠落地的产业应用新阶段。
这场暗流涌动的科技角力,终于迎来了一个明朗的结果。
01 从“模型堆砌”到“工程精进”:AI竞赛的新赛道
回望2023年,人们热衷于探讨“哪个模型参数最多”;到了2024年,焦点转移至“哪个模型推理能力最强”;而步入2026年,产业界的关注点已变为——“哪个智能体最能胜任实际工作”。OSWorld的诞生,正是为了解答这一核心问题。
该榜单由香港大学、卡内基梅隆大学、滑铁卢大学等顶尖学府于2024年在人工智能顶会NeurIPS上联合发布,已成为全球公认的Computer-Use Agent核心评测基准。
与传统仅支持网页交互或API调用的基准不同,OSWorld在真实Ubuntu虚拟机中部署了众多应用程序,设置了361个实战任务,全面覆盖办公、编程、UI设计、系统运维等高频应用场景。任务完成情况由机器自动判定,确保评判的客观性和公正性。
正因如此,OSWorld成为了全球科技巨头验证智能体能力的“必争之地”。OpenAI在发布GPT-5.4时宣称“首次超越人类”,Google在发布Gemini 3.6 Flash时标注“83%全场最高分”,Anthropic在发布Claude Sonnet 5时则突出“81.2%”的佳绩。
回顾OSWorld的迭代历程,整个行业的进步一目了然:
●2024年,最强智能体成功率仅12.2%
●2025年,成功率先后攀升至22.0%、72.6%,首次超越人类操作基线
●2026年5月,成功率推高至83.6%
●仅两个月后,实在Agent便以90.2%的傲人成绩登顶
两年时间,从12%到90%,这一飞跃不仅令人瞩目。但更值得探究的是“为何能跑得更快”。深入剖析实在Agent的得分构成,答案逐渐清晰:
跨应用协同:该任务模拟真实办公中最繁琐的跨系统流程,要求智能体在多个软件间灵活穿梭。实在Agent在93个任务中成功率高达84.7%,领先第二名近10个百分点。
非标界面图像处理:GIMP界面布满浮动面板和非标准工具栏,堪称视觉识别的“终极挑战”。实在Agent在26个任务中成功完成24个,成功率高达92.3%。
系统底层操作:在24个任务中实现100%满分零失误,全面覆盖进程管理、权限修改、命令行操作等关键领域。
从跨应用到复杂界面,再到底层系统,这些“硬骨头”场景考验的并非模型“思考深度”,而是工程“执行稳定性”。行业将这种工程能力命名为Harness,它决定了AI能否将“设想”转化为“现实”。
这一判断得到了扎实实证的支持。斯坦福大学与清华大学的研究表明,在同一底层模型的前提下,仅因Harness设计差异,智能体的表现差距可达6%至17%。在编码基准测试中,同一模型仅改变Harness设计,解决率便可从约5%大幅提升至30%以上。
02 Harness:AI的“操作系统”,实在智能的先行探索
Harness可通俗理解为AI的“操作系统”——正如电脑需Windows才能稳定运行各类软件,AI也需Harness才能可靠完成一系列复杂操作。任务拆解、工具调用、错误补救等确保AI“不掉链子”的机制,均属于Harness的范畴。
Harness并非新概念,但在2026年成为AI工程领域的核心范式。从Prompt Engineering到Context Engineering,再到Harness Engineering,行业对“如何让模型稳定交付”的认知正经历系统性升级。
中信证券在近期研报中指出,随着Agent走向长任务执行与多智能体协同,状态维护、错误传播与Token成本加速上升。模型单步能力强并不等同于能稳定交付。Harness作为将底层智能转化为稳定交付的中间层,其可触达空间由约2000亿美元扩展至1.5万亿美元。这意味着,过去AI仅能服务有标准接口的企业,而Harness让那些“无API”的老旧系统也能被AI接管,企业场景的可触达范围大幅拓宽。
正如DeepSeek除模型核心技术外,工程化能力是其大幅降低成本的关键,Harness对智能体的意义亦如此——它决定了AI能否稳定、可控、低成本地“把事办成”。
在Harness赛道上,成立于2018年的实在智能是先行者。当行业还在追捧纯API对接时,公司创始人兼CEO孙林君便做出了极具前瞻性的判断。
“我们做智能体,就围绕第一性原理——你不能干的,我能不能干?谁的能力边界更广,谁的成本更低、效率更高?”
这一判断背后是对企业IT环境的深刻洞察。孙林君在今年世界人工智能大会上算过一笔账:像西门子这样的工业系统,开发一个接口费用可能高达20万。更不用说那些运行了几十年的内部系统,外面根本看不到接口。而电商平台的API策略频繁微调,哪怕只是一个3%概率的A/B测试,纯API对接的系统就可能当场瘫痪。
“纯靠API对接的产品,后期维护成本高到无法想象,最后大多只能给客户退款。”
因此,实在智能打造实在Agent的逻辑很简单——不站队,不设限。有现成接口的就走接口,高效顺畅;没有接口的,AI就切换成“人肉模式”——像真人一样看屏幕、动鼠标、敲键盘,把数据拿回来,把事办成。
从用户角度看,这一变化是颠覆性的——过去需要IT部门花数月开发接口才能连通的系统,现在智能体可以直接“看屏幕”操作。一位制造业客户曾对孙林君说:“以前上个新系统要等半年,现在告诉Agent‘把上个月的产线数据整理成报表’,十分钟就回来了。”
Harness的价值在于,AI不再是一个需要你维护的“工具”,而是一个能自己动手干活的“同事”。
03 八年坚守:从GUI到AGI的终极愿景
2025年底至2026年初,Harness完成了从概念到共识的跃迁。但实在智能在这条路上的探索,远早于行业的集体转向。
“技术圈有一种流行看法:只有通过API和MCP对接才是先进的,像人一样看屏幕、点鼠标的GUI路线,只是过渡期的‘妥协方案’。” 孙林君直言。
但实在智能从一开始就将GUI作为核心能力来建设。“这不是技术路线的站队问题,而是对AI终局的判断问题。”
这一判断的核心逻辑是,AGI要实现真正的通用智能,必须在多模态能力上有所突破——因为只有像人一样感知和操作这个世界,AI才能真正理解这个世界。
在孙林君看来,AI的终局不在参数里,而在对真实世界的感知与交互中。“未来要想实现AGI,必须先让AI认识世界、接触世界、操作世界。” 这里的“世界”,首先就是人类每天都在面对的数字世界——操作系统、软件界面、业务流程。
正是基于这一判断,实在Agent在API之外深耕GUI八年。通过自研的ISSUT(智能屏幕语义理解)技术和融合拾取能力,实在Agent让AI能像人一样“看懂”屏幕上的UI界面,在没有数据接口的情况下也能精准获取数据、操作软件。
八年时间,实在Agent沉淀下来的是一整套“会生长的”Harness工程体系——
真实场景的数据飞轮:实在Agent已服务超6000家企业客户,覆盖制造、电商、能源、跨境、医药、物流运输等核心行业。每一次真实场景的运行,都是一次Harness的练兵——异常报错如何处理,流程卡顿如何恢复,边界案例如何兜底。千万级异常场景的迭代优化,让实在Agent具备了实验室模型难以企及的“实战免疫力”。
从自动化到Agent的工程跃迁:实在智能的八年,恰好也是企业自动化向AI Agent演进的关键周期。自动化时代的流程编排、异常处理、系统集成经验,被完整地继承并升级为Agent时代的Harness能力。这种“工程基因”的延续,是纯粹的模型公司短期内难以复制的。
“模型是可插拔的‘大脑’,但光有大脑远远不够。真正决定AI能不能‘动手干活’的,是Harness工程能力——如何拆解复杂任务、如何调度各类软件工具、如何在执行出错时自我纠错、如何组织多个智能体协同作业。”
实在智能的八年坚守,本质上是对一个判断的反复验证:AI的终局不在模型参数里,而在工程落地的细节里。
04 国产智能体:从单点突破到产业基石
实在Agent登顶OSWorld,不仅是单个企业的技术突破,更是国产智能体产业的一个标志性事件。
格局正在悄然变化。近期,阿里将QoderWork、悟空与MuleRun整合至千问办公,腾讯推动WorkBuddy与QClaw团队收敛。上述动作形式各异,但本质上均在强化位于模型与用户场景之间的Harness层。据徽声在线发布的《中国办公智能体平台市场研究报告2026》显示,中国桌面端办公Agent月访问量由2026年3月超2000万次增至6月超6000万次。
国产智能体,正在从“追赶者”转变为“定义者”。
但压力同样存在。在通用大模型基座上,硅谷巨头仍凭借算力与资本优势保持领跑。中国企业要在智能体赛道实现超越,必须在工程化落地、GUI多模态操控与真实工作流打通上建立不可替代的壁垒。
实在智能的突破,恰恰证明了这条路径的可行性。
从2018年成立,到2023年推出行业首个智能体,再到2026年登顶OSWorld。实在智能的每一步,都在回答同一个问题:如何让AI从“能聊天”变成“能干活”。而OSWorld 90.2%的成绩,是对这个问题最有力的回答。
AI智能体的竞争不是一家公司对另一家公司的较量,而是整个产业生态的系统工程。中国在智能体工程化落地上的积累,是参与这场全球竞赛的核心筹码。行业需要形成合力、共建生态,才能在下一代AI基础设施的定义权上占据主动。
一位人工智能领域资深分析人士向作者表示:“实在Agent登顶OSWorld的意义,不只是一次刷榜。它证明了在Harness工程这条路上,中国团队有能力定义标准。当AI智能体网络成为继电网、互联网之后人类历史上的第三张全球网络,成为所有产业之下的新底座时,谁掌握了Harness的工程范式,谁就掌握了下一代企业级软件的定价权。从这个角度看,实在智能的突破,是国产智能体产业的一个起点,而不是终点。”




