DeepSeek与智谱模型更新,市场反应平淡背后的技术博弈
2026-08-15 11:09:36未知 作者:徽声在线
徽声在线记者 | 伍洋宇
徽声在线编辑 | 文姝琪
当前模型市场竞争异常激烈,没有哪家厂商能够高枕无忧。在短短不到48小时的时间里,DeepSeek和智谱先后宣布了自家模型的最新进展,引发了行业内外的广泛关注。
8月12日晚,DeepSeek率先行动,将其API文档更新为DeepSeek-V4-Pro正式版。然而,在13日,公司又对官宣内容进行了回撤并重新发布,尽管如此,调整期间API服务并未中断。紧接着,8月14日,智谱也推出了GLM-5.3版本,为市场带来了新的竞争态势。
抛开DeepSeek回撤事件可能存在的争议不谈(当时有大量评测指出,第三方测试结果与官方声明存在不符,甚至反馈其性能不如同模型的Flash版本),根据官方公告,DeepSeek V4 Pro正式版在Agent(智能体)能力上进行了显著增强,特别是在生产环境任务中展现出了更为突出的性能提升。
在Agent相关的评测集中,DeepSeek V4 Pro的总体成绩与Kimi K3、Opus 4.8和Fable 5等知名模型处于同一水平线,显示出其不俗的实力。
而智谱GLM-5.3则继续深耕编程能力领域。该模型与前代GLM-5.2采用了相同的基座模型,但通过后训练显著提升了性能。具体来说,它利用强化学习技术(基于IndexShare、SAO以及新一代Slime框架)扩展了长程任务环境和训练时长,从而在编程任务上取得了更好的表现。
从评测集的表现来看,GLM-5.3的部分能力已经接近Fable 5和GPT-5.6 Sol等顶尖模型,并在多个榜单中成绩超过了Kimi K3。然而,在聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1评测中,GLM-5.3仍然不及K3,显示出其在某些特定领域仍有提升空间。
除了性能提升外,GLM-5.3还特别强调了安全性这一特性。此前,Anthropic的Mythos 5曾引发了关于模型安全性能的广泛讨论,而GLM-5.3则在这方面做出了积极回应。
据介绍,在CyberGym测试中,GLM-5.3从白盒源代码出发,通过触发程序故障来识别和验证漏洞,取得了84.5%的得分,略高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%。然而,在更考验深度推理能力的ExploitBench测试中,GLM-5.3的得分仅为54.4%,低于Mythos 5的78.0%和GPT-5.6 Sol的76.5%,显示出其在深度推理方面仍有待加强。
在用户层面,由于DeepSeek-V4-Pro正式版初期存在的问题,多名完成测试的受访者向徽声在线记者表示,在编程任务上,GLM-5.3的体验要优于DeepSeek-V4-Pro正式版。
不过,也有开发者明确表示,这两者可能都不会成为他们工作流中的主力模型。他指出,在国产模型中,目前只有K3能够跻身第一梯队,这不仅体现在其能力提升的全面性上,还体现在其性价比上。
这一结论的背后,是DeepSeek对其API定价策略的调整。据悉,DeepSeek的API将首次采用峰谷定价模式,闲时段的使用价格将降至高峰时段的一半。然而,从DeepSeek V4 Pro高峰期的价格来看,其缓存命中输入和缓存未命中输入的单价分别同比增长了1100%及200%,输出价格也同比增长了350%,这无疑增加了用户的使用成本。
进一步对比K3与DeepSeek-V4-Pro正式版的价格,涨价前,K3的缓存命中输入价格是DeepSeek-V4-Pro的约一千倍,而目前则降至十倍左右;缓存未命中输入价格从6倍有余减少到约2倍(高峰期);输出价格也从过去的16倍左右降低到现在的约4倍。这些变化使得不同诉求的开发者在选择模型时需要更加谨慎地考虑性价比因素。
事实上,无论是DeepSeek-V4-Pro正式版还是GLM-5.3,都是在上一代基座模型的基础上进行后训练迭代。而Kimi K3则通过扩大基座模型的规模训练实现了性能突破。这两种选择反映了当前模型技术发展的两种不同路径。
一名AI领域的投资人表示,从模型技术层面来说,这至少说明了两点:一是预训练Scale Up仍然有效,能够显著提升模型的性能;二是现有规模的后训练也有极大的提升空间。他举例说,1.5T的Grok 4.6几乎达到了GPT-5.6、Opus 5的同等水平,这就是一个很好的证明。
对于国产模型厂商而言,这意味着要想实现代际层面的性能跨越,或许仍然绕不开基座模型的Scale Up。然而,在它们实现这一点之前,Kimi K3的潜能显然也还没有被充分挖掘出来,未来仍有很大的发展空间。


