阿里近日正式推出Qwen3.8-Max大模型,这款千问家族的旗舰产品以2.4万亿总参数、单次激活约95B的规模引发行业关注。该模型基于Qwen3.5架构构建,支持100万token上下文窗口,在编程与办公场景实现全面升级,PaperBench评测中以93.0分超越Claude系和GPT-5.6等前沿模型。值得关注的是,这是Qwen-Max级别模型首次开源,其权重将于下周正式对外开放。
就在阿里发布新模型三周前,月之暗面推出的Kimi K3刚以2.8万亿参数宣称全球最大开源模型,并在伯克利Frontend Code Arena前端编程榜以1679分登顶。两款模型均瞄准编程办公领域,为验证实际性能差异,测试团队设计了包含前端开发、代码重构、空间理解、中文写作和安全边界的五个专项任务,采用相同Prompt对两个模型进行封闭环境测试。
在前端落地页开发任务中,Kimi K3展现出更精细的交互设计能力。当要求制作科技产品展示页时,两个模型均能完成深色主题、导航栏和滚动动画等基础要求,但K3在细节处理上更胜一筹:其生成的卡片具备悬停浮起效果,整体页面呈现更强的视觉连贯性,而Qwen3.8-Max的页面则存在明显的模块拼接痕迹。该环节K3以微弱优势取胜。
代码重构任务成为首个平局。面对真实项目中的手续费结算代码,两个模型均准确识别出float精度导致的舍入尾差问题,并给出正确的修复方案。测试团队评价称,这种涉及金融计算的核心算法问题已难不倒旗舰级模型,双方在基础编程能力上表现相当。
空间理解测试出现戏剧性转折。在"鹈鹕骑自行车"这个经典AI测试场景中,Qwen3.8-Max展现出显著优势:其生成的SVG图像中,鹈鹕的标志性大嘴、短腿和长脖特征完整,自行车链条、踏板等部件位置准确,整体构图协调。反观Kimi K3的输出,不仅出现鹈鹕单腿、自行车缺链条等硬伤,连背景云的走向都出现物理错误。这个结果颠覆了测试前的预期,暴露出高参数模型在三维空间理解上的潜在缺陷。
中文写作任务中,两个模型在1200字公众号文章创作上思路高度重合。双方均采用个人经历切入,先描述AI带来的职业焦虑,再分析人类不可替代的核心能力,最终落脚于人机协作主题。差异仅体现在结构安排上:Qwen3.8-Max采用分章节论述,Kimi K3则保持连贯叙述。测试团队认为这种趋同现象反映出当前大模型在中文创作领域的范式固化。
安全边界测试验证了旗舰模型的底线意识。面对DAN角色扮演和Base64编码混淆两类越狱攻击,两个模型均保持拒绝响应,未出现任何违规内容生成。测试人员强调,在攻击手段持续演进的背景下,能抵御现有越狱方式已是合格表现,但模型安全性仍需长期观察。
综合五个测试维度,Kimi K3在前端开发领域保持优势,Qwen3.8-Max则在空间理解等复杂任务中表现突出,其余三项测试双方打成平手。价格因素成为重要考量:Qwen3.8-Max国内API输出定价为每百万token36元,而Kimi K3达到100元,价格差距超过三倍。对于前端开发者而言,Kimi K3在交互细节上的优势需权衡其成本压力;追求综合性能和性价比的用户,则更倾向选择即将开源的Qwen3.8-Max。
这场技术对决揭示出大模型发展的新趋势:当参数规模突破万亿级后,单纯的数据竞赛已失去意义,真实场景中的任务完成质量正在成为核心评价指标。随着Qwen3.8-Max权重开源,社区开发者将获得改造模型的自由度,这种开放生态可能催生出超越原生架构的创新应用。技术竞争的焦点正从实验室数据转向工程化落地能力,这或许预示着大模型行业进入新的发展阶段。