ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

DeepSeek-V4首推多模态模型权重开放 视觉升级后部分测试超越Claude Opus 4.8

时间:2026-09-01 15:39:01来源:互联网编辑:快讯

人工智能领域迎来重要进展,DeepSeek近日为旗下V4系列模型增添了视觉处理能力。此次升级后的V4-Flash-Vision-Exp模型已通过Hugging Face平台向开发者开放下载,配套提供的还有视觉编码器、Aligner组件及核心算法实现代码,涵盖DFlash Attention、MoE架构、Hyper-Connections等关键技术模块。

这款拥有约3050亿参数的实验性多模态模型,在延续V4-Flash文本处理优势的基础上,通过嵌入视觉模块实现了图像理解能力的突破。开发者演示显示,新模型不仅能识别照片内容、提取截图文字,还可解析图表数据并将其融入工作流程。在复杂应用场景中,该模型已展现出制作PPT、修改网页代码、生成动态前端页面等跨模态任务处理能力。

基准测试数据显示,V4-Flash-Vision-Exp在多模态Agent任务中表现亮眼。ApexBench测试中取得36.5的Pass@1得分,虽略低于Anthropic的Claude Opus 4.8(39.4),但在Chartography图表解析任务中以64.3分接近Opus的65.0分。更值得关注的是,该模型在Agents' Last Exam(27.3分)和ZeroBench(35.0分)测试中均超越Opus-4.8的对应成绩。

文本处理能力测试表明,视觉模块的加入未对原有性能造成显著影响。在Terminal Bench 2.1测试中,新模型取得83.9分,较前代提升1.2分;DeepSWE任务得分从54.4跃升至59.3,超过Opus-4.8的58.0分。不过在NL2Repo代码生成任务中,57.7分的表现仍落后于Opus的69.7分,CyberGym安全测试得分也微降1.4分至75.3分。

技术文档披露了视觉处理的实现细节:模型支持JPEG、PNG等主流图片格式,可处理单图或多图输入。为控制计算成本,输入图像会进行动态缩放处理,最终等效分辨率限制在800×800像素范围内,单图占用Token数不超过384个。这种设计虽保证了处理效率,但在需要识别微小文字或精细纹理的场景中可能存在性能瓶颈。

此次升级标志着V4系列正式迈入多模态时代。通过在保持文本处理优势的同时拓展视觉能力,DeepSeek为智能体开发提供了新的技术路径。尽管当前版本在高清图像处理方面仍有提升空间,但其展现的跨模态任务处理能力已引发业界广泛关注。

更多热门内容
Anthropic披露Claude模型安全事件调查进展 强化安全措施应对模型对齐挑战
在安全方面,Anthropic 首先暂停了针对预发布模型的外部网络安全评测,并短暂暂停内部评测,以加强评测环境的隔离和监控(在引入新的安全措施后,该公司已恢复对人工智能模型的外部网络安全测试)。该公司指出,…

2026-09-01

国产光纤“爆单”背后:AI、跨国通信与新型战争下的新机遇
如果国内企业能够在预制棒、光纤、光缆以及相关装备领域持续提高技术水平,那么未来获得的就不仅是市场份额,更是产业链安全和基础设施自主能力。未来真正的竞争,不只是“谁拥有更先进的AI”,也不只是“谁生产更多无人机…

2026-09-01

菏泽鲁西新区八一路实验学校迎新:机器人助阵,开启科技感入学新体验
学校精心策划了一场别开生面的迎新活动,用满满的仪式感和科技感,为孩子们送上了难忘的“开学第一课”。 上午9时,迎新活动开始。 在各班教室内,老师们早已将教室布置得童趣盎然——黑板上画着精美的欢迎图案,课桌上整…

2026-09-01

百望股份亮相国际交通展,交通物流智能体生态平台赋能行业数智化转型
在交通运输行业加快数智化转型的背景下,百望股份将自身在票财税、电子凭证和企业交易数据领域的能力,与交通物流场景中的高频需求相结合,为行业提供更可信、更可用、更易落地的智能化支撑。 交通物流智能体生态平台的价…

2026-09-01