ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

Qwen3.5正式开源登场:多模态能力跃升,开启大模型高效实用新篇章

时间:2026-02-17 03:39:44来源:快讯编辑:快讯

大模型领域迎来重磅消息:Qwen3.5正式发布并开源,在多模态理解、复杂推理、编程及Agent智能体等多个关键能力上,不仅领先同级开源模型,多项基准测试成绩更是媲美甚至超越GPT - 5.2、Gemini 3 pro等闭源第一梯队模型,引发行业广泛关注。

Qwen3.5 - Plus展现出强大的性能优势。其总参数达3970亿,然而激活参数仅170亿。这一独特设计使其性能超越拥有万亿参数的Qwen3 - Max模型,部署显存占用大幅降低60%,推理效率显著提升,最大吞吐量可提升至原来的19倍。在价格方面,Qwen3.5 - Plus的API价格最低为每百万Token0.8元,同等性能下,价格仅为Gemini - 3 - pro的1/18,极具性价比。

在实际测试中,Qwen3.5的表现令人眼前一亮。当被问到“我要去洗车,洗车的地方离家就100米,我是开车去呢,还是走着去呢?”这一充满逻辑陷阱的“脑筋急转弯”问题时,国内国外众多大模型鲜有答对,而Qwen3.5不仅精准识别出题目中的陷阱,还以幽默轻松的语气给出正确答案,并贴心提醒“开车慢行,确保安全”。深入探究其思考过程,会发现它遵循分析需求、识别陷阱、制定答案、起草答案、内部比较、打磨答案、思考其他可能、确定答案等一系列严谨步骤,过程中还会像真人一样“自我鼓励”,坚定回答。

Qwen3.5的多模态能力在实际应用场景中得到了充分展现。在多模态理解与代码生成体验中,上传一张礼品购买App前端页面的手绘草图,要求生成红白配色的简约风前端页面并输出可直接使用的HTML代码。Qwen3.5几乎瞬间识别出草图中的基本框架和文字信息,在红白配色的模糊指令下,自主选择饱和度适中的红色,生成的代码简洁可用,页面与草图高度相似。更值得一提的是,上传的草图为英文,Qwen3.5根据问答上下文和提问语言判断用户为中文用户,自动将页面语言调整为中文。

在复杂场景与OCR能力测试中,随手拍摄一张包含多个物体和背景的照片,询问“今天的天气怎么样?这张图片中都有什么?”背光环境下,图片中文字在阴影内模糊不清,但Qwen3.5准确识别出图片中的布洛芬颗粒冲剂、保湿霜以及酸奶的品牌,还详细附上功效。结合外面晴朗的天气,它综合判断用户正在家休息养生,并送上“希望天气好心情也好,早日恢复活力!”的祝福。

艺术理解能力方面,给Qwen3.5展示西班牙画家萨尔瓦多·达利的《记忆的永恒》,它迅速提取出画中“融化的时钟”这一特点元素,准确说出作者为萨尔瓦多·达利,并详细呈现作者的生平信息以及这幅画的画面材质、创作时间、尺寸、收藏地等详细信息。还深入介绍画的主要元素、象征意义以及艺术地位,展现出对美学和抽象概念的较强理解能力。

Qwen3.5在编程与智能体操作领域同样表现出色。它可与OpenClaw集成,驱动编程任务。通过将OpenClaw作为第三方智能体环境集成,Qwen3.5能够进行网页搜索、信息收集和结构化报告生成,结合自身推理与工具调用能力以及OpenClaw的接口,为用户带来流畅的编码和研究体验。作为视觉智能体,它能自主操作手机与电脑完成日常任务,在移动端适配更多主流应用,支持自然语言指令驱动操作;在PC端可处理跨应用的数据整理、多步骤流程自动化等复杂任务,有效减少重复性人工干预,提升工作效率。以Qwen3.5为底层模型的Qwen Code支持“vibe coding”,可将自然语言指令转化为代码、实时迭代开发项目,并支持生成视频等创意任务。

Qwen3.5之所以能在多模态能力上取得如此突破,源于千问团队对模型底层架构的重构,使其从“语言模型”成功进化为“原生多模态大模型”。当前行业中不少所谓的“多模态”方案,本质上是“拼装”,先训练语言模型“学说话”,再外挂视觉或音频模块,模块间靠适配层勉强对齐,甚至只是在统一入口背后通过工程路由将不同任务分发给不同模型,未实现真正的多模态融合,且部分视觉理解模型随视觉能力增强会出现语言能力“降智”问题。而Qwen3.5从预训练第一天起,就在海量文本和视觉混合数据上联合学习,如同人类调用五官综合接收外界信息,让视觉与语言在统一参数空间内深度融合,使模型看到图就能自然理解语义,读到文字便能在脑中构建对应画面,具备跨模态的直觉理解力。

为实现原生融合的高效运行,Qwen3.5在训练架构上进行创新。行业传统做法是让视觉和语言用同一套并行策略,效率损耗严重,而Qwen3.5让两者各走最优路径,再在关键节点高效汇合,即使同时喂入文本、图像、视频三种数据,训练速度也几乎不受影响,与只训练纯文本时相当。同时,通过定制化的FP8/FP32精度策略,使激活内存占用降低约50%,训练速度提升10%,该策略在强化学习训练与推理全流程统一应用,降低多模态模型规模化部署的成本与复杂度。在智能体训练上,千问团队搭建大规模强化学习框架,支持文本、多模态与多轮对话等场景,训练效率提升3至5倍。

过去两年,大模型行业普遍陷入“堆参数、拼算力”的误区,模型规模不断攀升,性能虽有提升,但成本也大幅增加,部署需要专属集群,推理消耗大量算力,中小企业难以负担,终端设备无法运行,离普惠、实用目标越来越远。Qwen3.5另辟蹊径,通过四项核心技术突破实现“以小胜大”。一是混合注意力机制,传统大模型处理长文本时需对每个token与全部上下文进行全量注意力计算,算力开销高,Qwen3.5依据信息重要性动态分配注意力资源,提升效率同时保证精度;二是极致稀疏MoE架构,传统稠密模型每次推理都要调动全部参数运算,Qwen3.5的MoE架构按需激活与输入内容最相关的“专家”网络,总参数397B的情况下激活参数仅需17B,不到5%的算力即可调动全部知识储备;三是原生多Token预测,千问团队让模型在训练阶段学会对后续多个位置进行联合预测,推理速度接近翻倍,在长文本生成、代码补全、多轮对话等高频场景中响应速度接近“秒回”;四是系统级训练稳定性优化,2025年千问团队发表的注意力门控机制论文获NeurIPS 2025最佳论文奖,通过在注意力层输出端加入“智能开关”,智能调控信息“流量”,防止有效信息被淹没和无效信息被过度放大,提升模型输出精度和长上下文泛化能力,类似的深层优化还包括归一化策略和专家路由初始化等,共同确保架构创新在大规模训练中稳定运行。

更多热门内容
《“AI+钢铁”白皮书发布:宝信宝钢携手勾勒钢铁行业智能化转型新蓝图》
会上,由中国钢铁工业协会指导、宝信软件携手宝钢股份联合编制的《“AI+钢铁”白皮书——以AI重新定义钢铁(2026)》(以下简称“白皮书”)正式发布。2025年2月,中国宝武全面启动“2526”工程,将“人工…

2026-07-20

2026世界人工智能大会:首发技术闪耀,创新成果引领AI新未来
正在上海举行的2026世界人工智能大会上,多项重要举措和创新成果公布。《中国智·惠世界(2026)》案例集收录了我国在人工智能领域开展国际合作的10个生动故事。此外,《国际人工智能伦理治理行动计划》《智能体…

2026-07-20

2026世界人工智能大会:具身进阶、兴业赋能、善治护航 共绘AI新蓝图
文章称,千余家企业携3000余项前沿成果集中亮相,超300款新品首发落地……2026世界人工智能大会暨人工智能全球治理高级别会议(WAIC2026)立足前沿技术、产业落地与AI治理多重维度,清晰勾勒出具身、…

2026-07-20

海尔智家承建全国首个家居家电领域AI应用中试基地 推动AI走进千家万户
IT之家 7 月 20 日消息,2026 世界人工智能大会暨人工智能全球治理高级别会议(WAIC)于 7 月 17日在上海启幕。在当日下午举行的“人工智能 + 消费”主题论坛上,海尔集团高级副总裁、海尔智家…

2026-07-20

爱芯元智发布元曦系列新品,A系列AI推理卡超强算力助力企业AI高效落地
IT之家 7 月 20 日消息,爱芯元智 (AXERA) 在 WAIC 2026 上揭晓了其全新元曦系列大算力产品线。爱芯元智还带来了其具身智能大脑控制器。该产品拥有 1500TOPS 算力与约 2 倍行业…

2026-07-20

灵巧智能WAIC展实力:全栈自研打通链路,引领具身智能走向产业新篇
在此背景下,灵巧智能携全链路技术体系与多场景落地成果亮相WAIC,系统展示其在类人灵巧操作领域的全栈能力与产业化路径。 未来,灵巧智能将持续完善全栈技术底座,迭代国产化核心能力,并联动制造、能源等重点行业头部…

2026-07-20