DeepSeek V4 Flash周调用量超7万亿,领跑全球AI大模型市场
2026-08-05 12:18:01未知 作者:徽声在线
徽声在线记者 | 林晓薇
根据多模型聚合平台OpenRouter最新发布的全球AI大模型调用量周榜单(7月27日至8月2日),DeepSeek V4 Flash以惊人的7.22万亿Token调用量荣登榜首,成为全球最热门的AI大模型。
据开源项目团队OpenCode披露,DeepSeek V4 Flash的调用量在近期出现了显著增长。仅在8月1日这一天,该模型就处理了高达8万亿Token的请求,其中5万亿为免费试用额度的消耗,而另外3万亿则来自开发者通过OpenCode平台的付费使用。
OpenRouter的统计数据显示,上周全球AI大模型的总调用量达到了56.8万亿Token,尽管环比下滑了2.07%,但整体规模依然庞大。在上榜的AI大模型中,中国AI大模型的表现尤为抢眼,周调用量高达28.13万亿Token,尽管环比下滑了14.76%,但已连续十四周超越美国,稳居全球榜首。相比之下,美国AI大模型周调用量为4.38万亿Token,环比增长了87.18%,显示出强劲的增长势头。
截至8月5日,徽声在线查询OpenRouter本周榜单发现,DeepSeek V4 Flash 0423依然保持领先地位,调用量为6.92万亿Token。该模型自今年4月推出以来,便以其平衡的推理速度、强大的长上下文能力以及低廉的调用成本,赢得了开发者及商用企业的广泛青睐,主要提供高吞吐的推理服务。
OpenRouter本周调用量榜单(数据截至发稿时)
紧随其后的是小米推出的MiMo-V2.5模型,周调用量为5.1万亿Token,尽管环比前一周下滑了52%,流量出现明显回调,但其市场热度依然不容小觑。小米这款模型于今年4月23日正式公测,并在4月底完成了全系列开源。它采用了混合专家MoE架构,总参数突破万亿级别,激活参数达到42B,标配100万Token超长上下文窗口,同时支持文本、语音、图像全模态交互。低廉的推理成本与稳定的智能体运行能力,成为其吸引海外开发者批量接入的核心竞争力。
值得一提的是,在7月20日至7月26日当周,MiMo-V2.5曾一度登顶OpenRouter周调用量榜单首位,单周调用量高达10.5万亿Token,环比增长12%,展现了其强大的市场潜力。
目前排名第三的是腾讯自研的大模型混元Hy3,调用规模为5.01万亿Token。Hy3作为腾讯自研的通用大模型,本期流量环比持平,增长幅度为0%。然而,在7月26日所在周,Hy3曾是榜单上增长势头最猛的模型,周调用量达到3.94万亿Tokens,环比增幅超过999%。Hy3于7月6日正式开源,总参数295B,单次推理仅激活21B参数。它采用了快慢思考融合架构,最大支持256K上下文,代码生成与智能交互能力得到了大幅迭代。腾讯混元曾发文表示,截至7月15日,Hy3的总调用量较上一代模型Hy2增长已超68倍。
排在第四位的是DeepSeek全新上线的V4 Flash 0731模型,周流量达到3.45万亿Token。而第五名则是OpenAI推出的GPT-5.6 Luna,本周Token调用量为2.99万亿,实现了738%的爆发式增长,成为榜单上的一匹黑马。
在榜单前五席位中,国产大模型包揽了前四位,充分展现了国产AI大模型在市场上的强大竞争力。然而,OpenAI全新迭代模型的强势追赶,也意味着全球头部厂商之间的竞争并未放缓,反而愈加激烈。
从前十名的榜单来看,DeepSeek占据了三个席位,除了两款V4 Flash版本外,DeepSeek V4 Pro也以2.97万亿Token的调用量排在第六位。此外,Anthropic、谷歌、NVIDIA、MiniMax、阶跃星辰、智谱AI等多家企业的模型也纷纷上榜。值得注意的是,免费模型正在占据越来越多的流量份额,NVIDIA Nemotron 3 Ultra、Poolside Laguna S 2.1、Inclusion AI Ling-3.0-flash等免费模型实现了高速增长,不少免费模型的环比涨幅甚至突破了50%。
值得一提的是,此前备受马斯克关注的Kimi K3模型在本周暂时跌出了前十,目前位列第12位。该模型总参数达2.8万亿,配备100万Token超长上下文窗口,是当前全球参数规模最大的开源大模型之一。
与过去依靠低价换取流量的竞争模式不同,当前国产模型更加注重持续迭代的推理性能与稳定的服务能力,以此吸引海外开发者。然而,挑战依然存在。OpenAI、Anthropic等海外巨头持续推出新版本模型,不断缩小与国产模型之间的性能差距;而谷歌Gemini系列多款模型则稳定盘踞在榜单前列,显示出海外巨头依然拥有稳固的基本盘。
赛道内部的分化同样值得警惕。部分国产模型在本期出现了调用量大幅下滑的情况,如小米MiMo-V2.5、MiniMax M3、智谱GLM5.2等均出现了不同程度的流量回落。由于热度轮换速度不断加快,一旦产品迭代节奏放缓,就很容易快速流失开发者流量。
有人工智能行业分析师指出,海外独立开发者市场已经进入了白热化的竞争阶段,仅仅依靠单次版本更新很难守住优势。如何持续迭代、高效控制推理成本,将成为决定各大模型能否长期留住用户的关键因素。
