梁文锋、马斯克同日发布新模型:DeepSeek暂未涨价,Grok 4.6成本与Kimi K3相当,中美大模型价差逐步缩小

2026-08-13 18:08:01未知 作者:徽声在线

8月12日,人工智能领域迎来重要时刻,DeepSeek与马斯克旗下的SpaceXAI在同一天发布了全新大模型——DeepSeek-V4-Pro和Grok 4.6,这无疑为新一轮的大模型竞争注入了新的活力。

从最新的评测数据来看,这两款新模型均展现出了强大的实力,进一步逼近了全球顶尖水平。具体而言,DeepSeek-V4-Pro在多项智能体相关的测试中,成功超越了Anthropic的Claude Opus 4.8;而Grok 4.6则在Artificial Analysis智能指数评测中,与OpenAI的旗舰模型GPT-5.6 Sol并驾齐驱。

值得注意的是,随着这两款新模型能力的不断提升,中美两国大模型之间的价格差距也在悄然发生变化。据徽声在线从摩根士丹利获取的最新研报显示,过去一年里,中国大模型的API平均价格呈现出明显的上涨趋势,而与此同时,美国闭源模型的价格却在持续下降,这一趋势使得中美大模型之间的价格差距正在逐步缩小。

摩根士丹利在研报中进一步指出,中国大模型市场的竞争焦点正在从单纯的价格战转向更为激烈的智力战。

DeepSeek-V4-Pro正式版Agent性能飞跃,多项测试超越Claude Opus 4.8,预告的“大幅涨价”未如期而至

8月12日晚间,DeepSeek对其官方API文档进行了更新,正式推出了旗舰模型DeepSeek-V4-Pro-0813,其API及Chat端也同步完成了更新。

这是继7月31日DeepSeek-V4-Flash-0731正式发布后,DeepSeek V4系列迎来的又一次重要更新。

根据DeepSeek公布的评测结果,此次V4-Pro正式版的主要提升集中在Agent能力上。

与今年4月发布的V4-Pro预览版相比,正式版在多项Agent相关测试中的成绩有了显著提升。其中,考察软件工程能力的DeepSWE得分从12.8跃升至62.7;高难度数据科学任务测试DSBench-Hard得分从31.1提升至67.2;终端操作能力测试Terminal Bench 2.1得分从72.1提高到87.9;网络安全测试Cybergym得分从52.7攀升至83.3;HLE带工具测试得分也从48.2提升至60.0。

DeepSeek还将V4-Pro与Anthropic旗下的Claude Opus 4.8和Fable 5进行了对比评测。官方公布的评测数据显示,V4-Pro在多项测试中成功超越了Claude Opus 4.8,与Fable 5则各有胜负。具体而言,在Terminal Bench 2.1测试中,V4-Pro得分87.9,与Fable 5的88.0基本持平;在Cybergym测试中,V4-Pro以83.3略高于Fable 5的83.1;而在DSBench-FullStack测试中,V4-Pro得分71.1,略低于Fable 5的77.2。


8月13日,半导体与AI研究机构SemiAnalysis在社交平台上发文称,DeepSeek-V4-Pro在Agent任务上的表现大幅超越了英伟达的Nemotron 3 Ultra。其引用的Terminal Bench 2.1数据显示,Nemotron 3 Ultra得分53.9,而V4-Pro则高达87.9。

除了性能上的显著提升外,V4-Pro还支持100万Token的上下文窗口和最高38.4万token的输出,并同时提供了思考与非思考两种模式,其中思考模式为默认开启状态。DeepSeek官方API文档显示,新模型还支持工具调用等功能,并兼容OpenAI和Anthropic两套API格式。

然而,在模型性能得到明显提升的同时,DeepSeek此前预告的API“大幅涨价”并未随V4-Pro正式版的上线而一同实施。

截至8月13日,DeepSeek官方API价格页面显示,V4-Pro每百万Token缓存命中输入价格为0.025元,缓存未命中输入为3元,输出为6元,与之前V4-Pro预览版的定价保持一致。而V4-Flash的对应价格则分别为0.02元、1元和2元。


目前,DeepSeek仍在官方价格页面明确提示,计划近期对DeepSeek API服务定价进行整体上调,且“预计涨幅较大”,具体方案将另行通知。也就是说,截至8月13日V4-Pro正式版上线时,DeepSeek此前预告的这轮API调价尚未正式实施。

Grok 4.6性能追平OpenAI旗舰模型,单任务成本与Kimi K3相当

当地时间8月12日,SpaceXAI发布了新一代大模型Grok 4.6,这距离上一代Grok 4.5的发布仅过去了一个多月的时间。Grok 4.6主要面向长时间运行的AI智能体以及更复杂的交互和视觉任务。

根据AI模型评测机构Artificial Analysis的最新评测结果,Grok 4.6的综合得分已经成功追平了OpenAI的旗舰模型。

Artificial Analysis在8月12日公布的数据显示,在最新版本的Artificial Analysis Intelligence Index(智能指数)评测中,Grok 4.6获得了61分的成绩,与OpenAI的GPT-5.6 Sol并列,低于Claude Opus 5的63分和Claude Fable 5的62分,但高于Kimi K3的60分和DeepSeek-V4-Pro的53分。

Artificial Analysis将这一指数用于综合衡量不同模型的能力表现,并明确标注分数越高代表模型能力越强。该指数综合了9项评测,包括用于测试高经济价值职场任务的GDPval-AA v2、终端操作测试Terminal-Bench v2.1以及Humanity's Last Exam、GPQA Diamond等。


在性能得到显著提升的同时,Grok 4.6并未同步进行涨价。SpaceXAI公布的价格显示,新模型每百万Token的输入和输出价格分别为2美元和6美元,与上一代Grok 4.5保持一致。相比之下,Claude Opus 5的每百万Token输入和输出价格分别为5美元和25美元,而GPT-5.6 Sol的价格则分别为5美元和30美元。


Artificial Analysis还从完成一项智能指数测试任务所产生的实际Token消耗出发,对不同模型的单任务成本进行了详细测算。结果显示,Grok 4.6完成一项测试任务的平均成本为0.84美元,与Kimi K3持平。


马斯克也积极为新模型Grok 4.6进行宣传。据媒体8月13日报道,模型上线后约两小时内,马斯克就转发了约10条相关推文,并称赞Grok 4.6“智能、快速且性价比超高”,在同时考虑智能水平、速度和成本的情况下“客观上是第1”。


中美大模型价差逐步缩小,中国市场从“价格战”转向“智力战”

尽管DeepSeek此次暂未实施此前预告的“大幅涨价”,但从更长的时间维度来看,中国大模型的价格正在呈现整体上行的趋势。

摩根士丹利在8月9日发布的研报《告别价格战,打响智力战》(Intelligence War Over Price War)中指出,通过统计字节跳动、阿里巴巴、百度、腾讯、MiniMax、智谱、月之暗面和DeepSeek等厂商的官方报价后发现,到2026年第二季度,中国大模型的平均API输入价格已经升至每百万Token 4.9元,输出价格则升至21.9元,相比2025年第一季度的3.3元和12.2元,分别上涨了约48%和80%。


摩根士丹利认为,中国大模型行业正在逐步建立起更加健康的商业化环境,竞争重点也在从价格转向模型能力。8月8日,DeepSeek曾预告将“大幅”上调API价格。摩根士丹利分析认为,这一变化可能与V4系列需求增强带来的定价能力提升、维持合理毛利以支持前沿模型持续投入以及推理成本等因素有关。随着模型能力和规模的不断继续提升,中国新一代大模型的定价可能会进一步上升,行业竞争也将更多地转向模型能力和算力供给。

研报进一步指出,“模型智能水平,而非价格,才是大模型长期竞争地位的关键决定因素”。原因在于,头部模型厂商可以推出价格更低、能力稍弱的模型进入大众市场,但普通模型厂商要反过来追赶至最前沿水平则困难得多。持续提升前沿模型能力还需要大量的训练和算力投入,单纯依靠低价争夺市场可能会压低毛利,并进一步限制下一代模型研发所需的资金。

在中国模型涨价的另一面,则是美国头部模型价格的下降,中美之间悬殊的模型价格差距正在逐步缩小。

摩根士丹利在8月12日发布的另一份研报中指出,2025年一季度中国大模型输入、输出API均价仅分别占到美国同行的6%、5%,但到2026年二季度,这两个指标的占比已经上涨至19%与14%。随着中国模型价格的上涨以及美国厂商继续下调模型价格,这一差距预计还将进一步缩小。研报认为,中国模型已经“不再像过去那么便宜”,与此同时,美国厂商特别是中低端模型仍存在进一步降价的空间。


从Silicon Data的LLM Token价格指数也可以清晰地看到这一变化。截至2026年8月,闭源模型Token价格指数已经从此前超过4美元的高位快速降至3.07美元;同期,开源模型Token价格指数则约为0.66美元。摩根士丹利指出,开源模型使用比例的上升与闭源模型的降价正在共同推动整体Token价格的下降。


免责声明:文章内容和数据仅供参考,不构成投资建议。投资者据此操作,风险自担。

点击展开全文
你关注的
从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业 活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势活力中国调研行|中国商业航天迈入“快时代”:卫星流水线生产成新趋势 马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求马斯克明确拒绝乌克兰利用“星链”打击俄境内目标请求
相关文章
梁文锋、马斯克同日发布新模型:DeepSeek暂未涨价,Grok 4.6成本与Kimi K3相当,中美大模型价差逐步缩小梁文锋、马斯克同日发布新模型:DeepSeek暂未涨价,Grok 4.6成本与Kimi K3相当,中美大模型价差逐步缩小 巴奴火锅试水打赏功能引热议,自愿机制能否破解服务激励难题?巴奴火锅试水打赏功能引热议,自愿机制能否破解服务激励难题? 胖东来严正声明:未授权任何网络直播带货,将严惩不正当竞争胖东来严正声明:未授权任何网络直播带货,将严惩不正当竞争 AI“循环融资”越来越仰赖一件事:英伟达GPU能保值多久……AI“循环融资”越来越仰赖一件事:英伟达GPU能保值多久…… 医药即时零售迎来增长新机遇,美团医药健康多举措赋能商家精细化运营医药即时零售迎来增长新机遇,美团医药健康多举措赋能商家精细化运营 AI“循环融资”越来越仰赖一件事:英伟达GPU能保值多久……AI“循环融资”越来越仰赖一件事:英伟达GPU能保值多久……