DeepSeek V4.1 Flash内测开启:速度飙升507 tokens/s,成本直降35%
2026-09-10 08:54:46未知 作者:徽声在线
徽声在线科技频道
撰稿人 林晓
审校 陈明轩
徽声在线9月8日独家报道,人工智能领域迎来重大突破——DeepSeek今日正式宣布启动DeepSeek V4.1 Flash中间版本的内测程序。该模型采用突破性混合架构设计,在保持原生多模态支持的基础上,实现了性能三重跃升:推理速度提升40%、综合成本降低35%、多任务处理能力增强2.8倍。
技术文档显示,开发者可通过保留现有API端点,仅需将模型标识符更新为deepseek-v4.1-flash-exp-0910即可完成无缝迁移。系统沿用动态限流机制,默认设置单账号20并发请求上限,有效防止资源过载。
价格体系延续阶梯式定价策略:非高峰时段(0:00-8:00)每百万tokens输入费用为缓存命中0.05元/未命中1.5元,输出4.5元;高峰时段(8:00-24:00)相应调整为0.1元/3元/9元。值得注意的是,新模型引入智能缓存预热机制,可使频繁调用场景下的缓存命中率提升至92%以上。
根据官方公告,本次内测版本将于北京时间9月10日23:59自动终止服务,期间收集的性能数据将用于最终版本优化。
在海外开发者社区X平台上,首批测试用户已公布实测数据。某全栈工程师使用GTX 3090显卡进行压力测试,在复杂逻辑推理场景下取得507 tokens/s的峰值输出速度,较前代提升27%。
更具代表性的测试案例来自前端开发者李某的实践:他要求模型生成包含SVG动画的HTML代码,内容为鹈鹕骑行自行车的2D动态效果。DeepSeek V4.1 Flash仅耗时75.4秒完成全流程渲染,平均输出速度达328 tokens/s,且生成的动画代码兼容性评分高达9.1/10。
另一组对比测试显示,在相同硬件环境下,新模型处理多模态任务的平均速度突破300 tokens/s阈值。测试者张某表示:"模型对上下文的理解深度明显提升,特别是在需要结合视觉描述生成代码的场景中,错误率较前代降低63%。"
早期采用者王工程师在技术博客中透露:"通过自定义模型微调,我们在金融文本分析场景中实现了912 tokens/s的持续输出,这彻底改变了实时数据处理的游戏规则。"
回顾DeepSeek的产品迭代路线,其技术更新频率呈现明显加速趋势。今年以来已完成:
7月31日:V4 Flash正式版API开启公测,首创动态注意力机制
8月13日:V4 Pro正式版发布,参数规模突破1750亿
同日:Harness开发者预览版(v0.1)开源,支持多框架部署
8月19日:Harness迭代至v0.1.0-rc.8,推理延迟降低至8ms
8月21日:V4 Flash Vision Exp上线,实现文本-图像联合建模
8月31日:Vision Exp模型代码全量开源,获GitHub 4.8k星标
业内人士分析,V4.1 Flash的内测标志着DeepSeek正式进入"周更级"技术迭代周期。结合其近期在多模态融合、动态架构搜索等领域的专利布局,预计第四季度将推出具备实时视频生成能力的下一代模型。

