WAIC深度对话 | 千问AI硬件总监吴建军:智能体时代,AI硬件如何重塑随身AI助手新体验?
2026-07-20 21:06:15未知 作者:徽声在线
每经特派记者:黄海 编辑:魏文艺
回溯至1986年,人工智能领域的先驱、麻省理工学院知名教授马文·明斯基在其著作《心智社会》中,首次系统性地阐述了“智能体”这一概念。彼时,互联网尚处于萌芽阶段,鲜有人能预料到,四十年后的今天,智能体概念竟会如此深刻地重塑人与机器的协作模式、推动进化进程并促进共生发展。
在7月17日至20日举办的“2026世界人工智能大会(WAIC 2026)”上,上海再次成为全球人工智能领域的焦点。随着智能体在虚拟世界中重塑生产力格局,人们开始深入思考:智能体如何助力人们在现实世界中享受更美好的生活?
关于智能体在现实世界中的具体形态,或许并无统一答案,但某些确定性趋势已逐渐显现——人们梦寐以求的AI硬件,并非简单地将现有硬件进行AI化改造,而是应打造出真正意义上的AI Native(智能原生)产品。
千问AI硬件产品总监吴建军在大会演讲中强调,AI硬件与智能体必须深度融合:“缺乏硬件支撑的智能体,难以触及现实世界;而没有智能体赋能的硬件,则只是冰冷的工具。唯有将两者做到极致,方能成为唯一解。”
在智能体时代,除了关注参数与效率的宏大叙事外,人们更关心:随身AI助手如何能让普通人在日常生活中感受到实实在在的便利与改善?为此,《每日经济新闻》记者在WAIC现场对吴建军进行了专访。
WAIC现场的千问展台 图片来源:受访者提供
从硬件AI化到AI Native的转型之路
仅仅通过添加对话框、集成大模型便自称AI终端的时代,或许即将成为过去。
随着智能体从简单的聊天工具进化为能够感知环境、做出决策并执行任务的生产力最小单元,智能体正加速与下一代终端产品融合,从数字屏幕迈向真实物理世界。
在本次WAIC上,智能体开始批量“拥有实体”。这一抽象比喻背后,揭示了行业从硬件AI化向AI Native转型的大趋势。
例如,千问宣布将AI眼镜升级为智能体眼镜。升级后的眼镜不仅强化了服务与决策能力,还能按需调用第三方Skill(技能)和Agent(智能体)。同时,千问还推出了全双工语音、眼动追踪、体征监测等一系列硬件技术,以提升智能体眼镜对物理世界的感知与交互能力。
吴建军指出,过去绝大多数所谓的AI硬件,本质上并未改变上一代硬件的产品逻辑。从驱动层、中间件到应用架构,均未发生根本性变革。这种做法在行业内被称为“硬件的AI化”,而非真正的“AI Native”。真正的变革始于交互的起点:智能体需要更全面地理解用户与环境。
他举例说,过去眼镜上的摄像头主要用于影像记录,帮助用户捕捉生活瞬间。但在智能体时代,眼镜需要具备感知环境的能力。这就要求摄像头的视觉能力能够为智能体所用,助力其理解真实环境。
千问在行业内首创的Always-on视觉感知系统,构建了一套端到端的低功耗视觉感知链路,使智能体能够与用户共同经历真实场景,在交互中获取更充分的上下文信息,并逐渐形成基于用户个人数据的长期记忆。
对于AI助手而言,这种长期记忆是提升用户体验的关键因素。在讨论如何提升体验之前,智能体眼镜还需回答一个问题:何为适时的主动服务?至少,它不应让人感到冒犯。
智能体如何理解人与环境、实现精准主动服务?
与大模型追求的“加法”不同,承载智能体的端侧设备,在许多场景下更像是在做“减法”。
在真实世界中,图像、音频信号量级巨大,哪些需要理解并回应,哪些可以忽略不计,主动服务的判断不仅依赖于智能体设备与用户的默契,更是硬件与算法不断磨合的结果。
吴建军解释说,现阶段智能体眼镜的主动服务并非盲目,而是建立在精准理解用户原始意图和用户信任同意的基础上。例如,对于某些有明确触发条件的任务,设备才会向用户提供相应的提示或信息。“如果无法充分理解用户,且服务不够个性化,那么主动服务便无从谈起。”
问题再次聚焦于智能体如何理解人与环境。作为智能体终端元年,AI硬件与具身智能赛道面临着相似却又不同的挑战。
吴建军介绍说,首先是硬件维度对用户的理解。千问在轻薄镜框中集成了一套虹膜识别系统,用于确认用户身份;同时,眼镜还加入了体征监测功能,可采集心率、血氧、HRV(心率变异性)、温度等数据,并结合长期佩戴积累的信息,为用户提供健康解读与提醒。
在环境感知方面,除了视觉感知外,千问还试图通过一套全双工语音语言模型架构,利用流式Audio LLM(音频大语言模型)预训练与全双工后训练,增强眼镜持续倾听并准确理解的能力。当然,这还需要一套端侧原生采集系统的配合,以确保眼镜能够听清环境声音。
其次是理解人与环境的关系。与具身智能采用的“触觉”方式不同,眼镜赛道可以利用的一个连接点是眼神。千问在智能体眼镜中搭载了一套高精度眼动追踪系统,使眼神成为最自然的交互方式,替代了物理触控和语音唤醒。
而在软件层面,人与智能体之间共同拥有的长期个人化记忆,则是将物理世界信息转化为“服务能力”的催化剂。
智能体眼镜的独立生态位将愈发明确
在理解人与环境之后,智能体眼镜应提供多少反馈也成为了一个值得探讨的问题。
在手机或PC(个人电脑)端,大模型习惯于给出详尽的解答,用户可以在长文本中自行提取有效信息。然而,如果将这种逻辑直接应用于眼镜上,让随身设备在眼前、耳边长篇大论,用户将会产生强烈的体验不适感。
例如,当用户在路途中询问“最近的洗手间在哪里”时,智能体必须克制住描述周围环境的冲动,用极度精练、克制的语言直接给出有效答案。整个工程链路必须完全为硬件载体和当下语境服务。
这考验着智能体眼镜的算法模型与端云两侧的算力调度能力。然而,目前行业格局仍呈现明显的“云强端弱”态势。
受当前技术条件限制,同时考虑到全天候轻薄佩戴的需求,眼镜在网络带宽、分布式算力以及存量App(应用程序)生态上,仍无法完全脱离手机而独立存在。
“未来的行业趋势一定会走向端云协同或端云平衡。”吴建军认为,那些不需要深度思考、对时延要求极高的即时响应任务,未来将全面由端侧承接;而需要深度思考、在线RAG(检索增强生成)搜索的复杂任务,则将继续依赖云端链路。
这也意味着,眼镜的价值并不在于复制手机体验,而是进入那些手机不便出现、也不适合打断用户的场景。例如,在骑行、攀岩、看展等日常场景中,用户的认知负荷和条件反射可能会逐渐向眼镜转移。
在情感体验层面,吴建军认为,眼镜的独特生态位还在于其能提供手机永远无法给予的原汁原味的存在感。
“比如我要记录一个珍贵瞬间,在单膝下跪求婚的时候,突然掏出手机可能会打破氛围感……我觉得大家对于眼镜的使用习惯,正在逐渐从其他设备上迁移过来,只是时间问题……”吴建军表示,当然,这一切还需要时间,硬件、软件乃至生态层面上,仍有许多问题需要整个行业共同解决。
值得注意的是,除了眼镜外,千问的首款AI智能体耳机也在WAIC现场正式亮相。从某种程度上看,这似乎预示着一个趋势——在行业内部,一个以AI智能体为核心的生态叙事体系正在逐步构建。
“我们的硬件业务是由AI战略驱动的。我们的想法很简单:未来,当我们的AI智能体足够好用、足够易用、足够通用时,它可以运行在各种硬件形态上,在不同的用户场景中,与用户完成最自然、最贴合当下场景的交互。”吴建军说。
免责声明:本文内容与数据仅供参考,不构成投资建议,使用前请核实。据此操作,风险自担。

