明略科技(2718.HK)发布WebRetriever:智能体商业化浪潮下,可靠性成竞争新焦点
2026-07-08 12:04:48未知 作者:徽声在线
AI智能体(AI Agent)领域正迎来一个至关重要的产业转折点。
近期,明略科技自主研发的大规模Web智能体综合评测基准WebRetriever取得重要突破,其相关研究成果被国际计算机视觉顶级会议ECCV 2026正式接收。该评测基准覆盖了800个真实在线网站和1550项复杂任务,专注于评估Web智能体在复杂互联网环境中的任务执行能力,旨在解答一个困扰整个行业的关键问题:当AI从单纯的“聊天助手”转变为“任务执行者”时,我们该如何准确判断其是否真正具备生产力价值。
随着智能体商业化进程的加速,这一问题的重要性愈发凸显。
过去,人工智能能力的评估主要围绕模型本身展开,如知识储备、推理能力和生成质量等。然而,智能体的价值逻辑正在发生深刻变化。它不再仅仅满足于输出信息,而是需要深入理解任务目标、精心规划执行路径、灵活调用各种工具,并在真实环境中高效完成任务。对于企业而言,未来决定AI应用价值的,将不仅仅是模型的聪明程度,更重要的是智能体能否稳定、可靠地完成业务流程。
以一个帮助用户完成线上采购的智能体为例,其真正的价值并非仅仅提供几个商品链接,而是能否准确理解用户需求、智能筛选符合条件的商品、熟练处理网页交互,并最终顺利完成购买。这表明,智能体时代需要一套全新的评价体系,衡量标准不再是“答对多少问题”,而是“完成多少真实、复杂的任务”。
正是在这样的背景下,WebRetriever应运而生。
智能体从演示迈向应用,行业亟需新的评价标准
近年来,全球科技巨头纷纷探索让AI具备计算机操作能力的新路径。OpenAI推出的Operator、ServiceNow AI Research推动的BrowserGym,以及WebArena、WebVoyager等研究项目,都致力于推动AI从文本交互向网页浏览、软件操作和任务执行阶段迈进。
然而,随着技术的不断进步,行业逐渐意识到,智能体距离大规模商业应用仍存在一道难以逾越的鸿沟:展示能力与生产能力之间存在显著差距。
在实验环境中,智能体或许能够完成一些简单任务,但真实互联网环境却复杂多变。网页结构可能随时变化,操作路径并不固定,业务流程往往涉及多个步骤,同时还存在权限、规则和异常情况等限制。许多智能体虽然能够完成信息检索,但却难以真正完成端到端的复杂任务。
这也是当前智能体商业化过程中面临的最关键问题之一:如何准确评估智能体的真实交付能力。
WebRetriever正是针对这一环节而设计的。与传统测试体系主要关注模型单点能力不同,该评测基准将智能体置于更加接近真实互联网的环境中,通过大规模任务测试,全面观察其在网页理解、路径规划、交互执行以及最终任务完成等方面的综合表现。
WebRetriever从数据集规模和多样性、自动化评估的可靠性以及面向部署的评估协议三个方面,解决了先前工作的关键局限性。从产业角度来看,这类评测体系的意义不仅在于为智能体“打分”,更重要的是帮助行业找到技术优化的方向,让企业能够清晰判断不同智能体产品距离实际应用还有多远。
评测基准正成为AI产业竞争的新基石
回顾人工智能的发展历程,我们可以发现,评价标准往往不仅是技术测试的工具,更会深刻影响产业的发展方向。
在计算机视觉时代,ImageNet推动了深度学习模型的飞速发展;在自然语言处理时代,GLUE等评测基准成为衡量语言模型能力的重要参考。对于智能体而言,类似的评价体系同样至关重要。因为企业需要的不仅仅是一个展示效果良好的AI助手,更是一个可以被验证、被管理、被持续优化的数字员工。
随着智能体逐渐渗透到企业场景中,市场对于评价体系的需求将越来越迫切。企业需要了解一个智能体能够承担哪些工作、任务完成率如何、在哪些环节仍需要人工介入,以及不同产品之间的能力差距在哪里。
因此,未来智能体的竞争维度可能不仅局限于模型能力,还包括围绕智能体形成的数据、工具、评测体系和开发生态等多个方面。
谁能够建立更有效的评价标准,谁就可能在一定程度上引领行业对于智能体能力的判断方式。
明略科技布局智能体评测,从应用向基础设施拓展
从产业布局的角度来看,明略科技此次推出WebRetriever,并非仅仅参与一次学术研究,而是深入切入智能体生态中的一个关键环节:能力评价。
目前,全球AI产业正形成不同方向的竞争路径。基础模型企业希望通过不断提升模型能力来增强智能体的表现;企业软件公司则希望结合业务流程打造垂直领域的智能体;而包括明略科技在内的一些企业,则开始探索如何建立连接技术能力和商业应用的基础设施。
这一方向的价值在于,智能体商业化真正面临的问题并非“有无能力”,而是“能力是否足够可靠”。
尤其是在金融、消费、企业管理等复杂业务场景中,智能体面对的不再是简单问答,而是长流程、高要求、高容错成本的任务环境。如何构建贴近真实业务的测试体系,成为决定智能体能否从实验室走向生产环境的关键因素。
长期积累的行业场景经验,为构建这类评测体系提供了坚实的基础。因为只有深入理解真实业务流程,才能设计出更接近企业需求的任务和评价方式。
与此同时,评测基准本身也能够形成技术优化的闭环:通过测试发现智能体的能力短板,进而推动模型、工具调用和任务规划能力的提升。这使得评测体系不仅是衡量工具,更可能成为智能体持续进化的重要基础设施。
AI下一阶段竞争,或将从“创造智能”转向“证明智能”
随着AI智能体逐渐进入商业化阶段,行业竞争正在发生深刻变化。
过去,企业关注的是谁拥有更强的大模型、更大的参数规模;未来,市场可能更加关注谁能够让AI真正融入工作流程,并证明这种智能能够稳定、持续地创造价值。
从这个角度来看,WebRetriever的意义不仅在于一次论文成果的发表,更在于回应了智能体产业发展的一个核心需求:当AI开始承担越来越多工作时,人类需要一套新的标准来判断它是否真正完成了任务。
对于明略科技而言,这意味着其探索方向正在从AI应用建设进一步延伸到智能体生态基础设施建设。在未来智能体商业化竞争中,真正重要的不仅仅是让AI变得更聪明,更重要的是让这种智能能够被验证、被复制,并最终转化为企业可持续使用的生产力。
