ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

DeepSeek V4.1 Flash解析:架构革新与成本优化下的高效模型之路

时间:2026-09-12 17:35:46来源:互联网编辑:快讯

DeepSeek近期对旗下产品进行了一次重要更新,网页版与移动应用同步升级,将原有的「快速」、「专家」及「识图」功能整合为统一入口,为用户提供更加便捷的操作体验。此次更新推出的DeepSeek V4.1 Flash模型,不仅整合了此前发布的多个版本特性,还在性能上实现了显著提升。

根据社交媒体反馈,V4.1 Flash最突出的特点是运行速度大幅提升。有用户测试显示,在DeepSeek Harness平台上的对话速度达到每秒217个token,其他测试结果则显示其速度范围在每秒420至507个token之间,甚至超越了Gemini 3.8 Flash的表现。这一速度优势得益于模型架构的重新设计和训练规模的扩大。

尽管V4.1 Flash的参数规模从上一代的2840亿增加至5520亿,接近翻倍,但其处理长输入和保存上下文所需的计算资源却显著减少。每token的全局KV缓存从V4 Flash的3.5KB压缩至890字节,仅为初代DeepSeek-V1的约四百分之一。这种优化使得模型在保持高性能的同时,降低了运行成本。

在技术实现上,V4.1 Flash采用了创新的CED(因果编码器-解码器)架构,将40层网络分为前后两部分。前20层作为编码器处理输入,后20层作为解码器生成输出。解码器所需的全局记忆直接由编码器的输出投影生成,避免了输入内容完整经过后20层的计算,从而大幅减少了预处理计算量。对于长文本输入,这种设计使计算量接近减半,特别适用于需要频繁调用工具的Agent场景。

除了架构创新,V4.1 Flash还引入了升级版的注意力机制CSA2,允许不同网络层共享全局KV缓存,进一步优化了计算效率。同时,主KV缓存采用FP4量化技术,并选用OCP开放标准格式,以支持更多硬件平台。这些技术改进共同推动了模型性能的提升。

在状态管理方面,V4.1 Flash采用了SWA Bounded Replay方案,将编码器的局部状态存储在短期内存池中,过期后仅需重新计算最近128个token即可恢复状态。这一设计使持久KV缓存占用降至上一代的约八分之一,同时确保状态可保留72小时以上,降低了长期存储成本。

V4.1 Flash在成本优化的同时,并未牺牲模型性能。其预训练语料库包含45万亿token的图像和文本数据,使模型从训练阶段就具备多模态处理能力。在Agent任务中,模型可以直接利用截图检查工作,例如验证网页或办公文件的排版和图表是否需要修改,提供了除文字结果外的额外检查依据。

在编程任务测试中,DeepSeek设计了出题、试做和检查的独立AI流程,确保题目质量、环境配置和验收要求的一致性。解题轨迹成为重新审核题目质量的材料,形成训练闭环。随着强化学习规模的扩大,模型在各项代码智能体基准测试中的性能均有所提升。

在性能评估中,V4.1 Flash在多个Agent测试中表现突出。在DeepSWE v1.1软件问题解决测试中,其得分达到74.2%,超越上一代Flash的54.4%和V4-Pro的62.7%,与Opus-5的74.0%和GPT-5.6 Sol的73.0%持平。在Terminal-Bench 2.1和AutomationBench测试中,V4.1 Flash的得分也显著高于同类模型。然而,在高难度任务中,如Terminal-Bench 4.0和高难科学问答GPQA Diamond,V4.1 Flash仍与领先模型存在一定差距。

模型表现还受到Agent框架的影响。同一模型在不同框架下的得分存在差异,系统提示、工具定义和上下文管理等因素均会影响模型能力的发挥。DeepSeek在强化学习中引入了随推理档位变化的长度惩罚机制,使模型能够根据任务需求调整推理长度,平衡性能与成本。

自去年以来,DeepSeek的发布节奏明显加快,从V4 Flash到V4 Pro,再到视觉推理预览模型Vision Exp,直至最新的V4.1 Flash,不断推动模型性能的边界。随着Benchmark分数接近极限,速度和每秒处理token数成为新的竞争焦点,DeepSeek正通过技术创新引领这一趋势。

更多热门内容
AI视频创作工作流搭建指南:零代码与代码化路线深度对比与实操建议
搭工作流先分清自己走哪条路——非技术创作者和小团队优先选零代码的可视化画布,拖拽就能搭、还最懂视频镜头;有开发能力、要把视频生产和业务系统打通的,再考虑代码化编排。 这三个本身不是工作流编排器,而是流水线上…

2026-09-12

英伟达DLSS 5混合精度Mod测试:RTX 50系列显卡性能提升微弱仅1%至2%
根据 X 用户 SwurvGaming 分享的情报,有 Mod 开发者将 FP8 与 NVFP4 混合精度应用于 DLSS 5神经渲染模型,并在 RTX 50 系列显卡上运行。 由于英伟达 Blackwe…

2026-09-12