近期,人工智能领域再掀波澜,DeepSeek的一系列大模型动态引发广泛关注。其最新发布的V4.1 Flash,架构变动极为显著,虽未更换大版本号,但变化程度足以媲美V5版本,展现出DeepSeek在技术探索上的大胆尝试。
与此同时,Pro系列新品也尘埃落定,确定为V4.1 Pro。不过,目前具体升级内容尚未公布。回顾过往,V4到V4.1已有一定提升,若V4.1 Pro延续此提升幅度,性能上限值得期待。但鉴于此前V4 Pro-0813正式版表现未达预期,此次大家对其期待值也趋于理性。
在众多动态中,最受瞩目的当属即将发布的DeepSeek Code 2.0。爆料称其将于9月与大众见面,性能方面有望超越当前最强的两个前沿级大模型Mythos 5.1和GPT-6 Astra,这一消息无疑让行业内外充满期待。
DeepSeek Code 2.0在设计上独具特色,预计会延续开源开放的传统,重点聚焦于Computer Use,即电脑控制领域。这意味着AI将能够替代人类操作电脑完成诸多工作,而Astra目前令人惊叹的诸多应用场景,正是源于这一方向的研究。
参数量是衡量大模型性能的关键指标之一。DeepSeek Code 2.0拥有高达3万亿以上的参数量,这一数据十分惊人。对比国内其他大模型,目前最强的是K3大模型的2.8万亿,千问的Qwen 3.8 Max为2.4万亿,而DeepSeek V4 Pro仅有1.6万亿。从V4.1 Flash换用新结构使参数量翻倍的情况来看,Code 2.0参数量从1.6万亿提升至3万亿具有较高可信度。毕竟,要与Mythos 5.1及Astra等大模型竞争,达到这一参数量级是提升性能上限的必要条件。
不过,对于此次爆料的可信度,外界看法不一。回顾DeepSeek在2023 - 2024年推出的三款名字带Code的大模型,当时表现并不突出。此次若重新推出偏向代码/逻辑的Code大模型,并将其作为旗舰级产品,同时让V4.1 Pro及Flash面向通用Agent任务,或许能为DeepSeek在大模型领域开辟新的发展路径。