ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

320B参数只激活15B!IQuest-Q1让“每一分算力都点在关键穴位上”

时间:2026-09-29 17:54:14来源:互联网编辑:茹茹

9月29日,至知创新研究院(IQuest Research)发布并开源 IQuest-Q1。模型重点面向代码、软件工程与复杂任务执行,在训练过程中进一步覆盖推理、工具使用、长上下文理解及多步任务处理等能力。

模型权重与Blog已同步发布。

GitHub:https://github.com/IQuestLab/IQuest-Q1

Hugging Face:https://huggingface.co/IQuestLab/IQuest-Q1

Blog:https://iquestlab.github.io/

多场景任务中的能力验证

IQuest-Q1 的训练重点覆盖从代码生成到智能体任务,并延伸至工具调用、信息搜索、长上下文理解和复杂环境中的多步执行。模型可在任务过程中持续理解上下文、调用工具、处理反馈,并完成可验证的最终结果。

在涵盖代码、软件工程、终端操作、工具使用和复杂智能体任务等多个领域的标准评测中,IQuest-Q1 均展现出均衡稳健的性能。

其中,IQuest-Q1 在仓库级代码生成基准 NL2Repo 和网络安全基准 CyberGym 上展现出一定能力;同时,在 Terminal-Bench 2.1、代码长程任务基准 DeepSWE v1.1,以及面向专业办公场景的 JobBench 等复杂任务评测中,也表现出较好的任务执行能力。

具体到实际任务,可以一起看下在几个典型场景中的。

· 复杂交互应用开发

在前端开发中,用户输入自然语言指令后,模型可以直接生成可运行的交互应用。

以 FPS 游戏为例,IQuest-Q1 可以一次完成三维场景、角色移动、生命值、计分、游戏模式切换以及资源和装备购买等功能,同时处理代码生成、多文件组织、交互逻辑和视觉呈现。

再来看一个赛车游戏的例子,构建这类场景,如赛道延展、前景背景之间的切换,通常对场景延伸能力有较高的要求。IQuest-Q1 能够轻松应对这类具有空间关系和连续交互要求的应用生成。

· 训练诊断与代码修复

IQuest-Q1 也可以进入已有代码和训练环境,定位并修复实际问题。

一次强化学习训练出现异常后,模型根据训练曲线进一步读取日志和执行轨迹,分析可能原因,定位代码中的具体问题并完成修改。训练重新启动后,再通过新的指标变化验证修复结果。正如案例中所展示的,发现根因是“训练轨迹中插入了一个空格”,修复后重新训练,指标恢复上升。

· 复杂工作环境任务执行

IQuest-Q1 可以在包含多类信息和工具的工作环境中执行多步骤任务,并根据任务进展持续读取信息、调用工具和调整结果。

在工作场景中,模型可接入聊天、云文档、表格和评论等信息,综合不同上下文完成分析、文档生成和结果修订,最终形成可直接交付的方案。

可持续的模型迭代机制

IQuest-Q1 采用了 decoder-only Transformer 主干与稀疏 MoE 架构,总参数约 320B、激活参数约 15B。模型训练分为预训练、中期训练和后训练三个阶段,逐步建立基础代码能力,并向复杂任务执行延伸。

后训练阶段,团队围绕软件工程、长时程任务和通用推理对模型开展了专项训练,并通过监督微调和强化学习进一步强化相关能力。同时,通过 Multi-Teacher On-Policy Distillation(MOPD)整合不同教师模型在各类任务上的能力。

此外,经过验证的模型更新、训练资产和研究流程会进入下一轮迭代,并被后续版本直接复用。每轮形成的数据流程、训练配置、评估方法和工具也会持续沉淀,形成模型能力优化与研发流程优化并行推进的迭代机制。

无论是中赛车能不能开、游戏能不能玩,还是训练中出现Bug能不能及时找到根因。AI能不能把复杂任务做对、做完,都成为下一次进化的起点。

从此次实践来看,我们观察到至知研究院这个模型赛道新玩家,在代码智能、复杂任务执行和模型自进化等方向上的探索,已经开始呈现出更清晰的技术脉络,这家机构下一步的动态值得持续关注。

更多热门内容
Token运营服务平台推荐,这份模型调用服务的能力清单请收好
企业落地AI模型调用服务时,很多团队都会陷入选型误区:初期只关注单次调用、套餐单价等显性成本,实际落地运营后,才发现模型适配性、调用稳定性、权限管控、计费透明度、数据安全性,才是决定AI业务长期高效运转的核心关键。在众多Token运营服务平台中,天翼云旗下星

2026-09-29

2026年能测尿酸的手表:华为WATCH 6系列、Apple Watch Series 12 等3款横评对比
一、尿酸高平时没感觉,能不能长期盯住才是关键尿酸高这件事麻烦在于它平时没什么感觉,等痛风发作才后知后觉;而专门跑一次医院抽血,成本不低,也很难形成长期观察。所以如果想靠手表盯着尿酸,关键看三点:一是监测方式会不会打扰生活、能不能长期坚持;二是有没有专业

2026-09-29

2026年能独立打电话的手表:华为WATCH 6系列、Apple Watch Series 12 等3款横评对比
一、手机不在身边的时候,通话能不能接得上跑步、健身、下楼取快递、开会间隙接个电话——手机不在身边的时候,最怕漏掉重要来电。支持独立通话的手表因此越来越受关注:不依赖手机,自己就能通话和上网。挑这类手表,建议重点看三点:是否真正支持 eSIM 独立通话、信号

2026-09-29

2026年新款AI手表:华为WATCH 6系列、Apple Watch Series 12 等3款横评对比
一、挑 AI 手表,别只看“有没有语音助手”现在说手表“智能”,很多时候只是多了个语音助手;真用起来才发现,问个稍微绕一点的问题就答非所问,抬腕看到一堆数据也不知道说明什么。挑一块真有 AI 能力的手表,关键看三点:一是语音交互够不够自然,能不能听懂复杂意图

2026-09-29

2026年新款多功能手表:华为WATCH 6系列、Apple Watch Series 12 等3款横评对比
一、功能越多越好?先看会不会互相拖累买表的时候总觉得“功能越多越好”,用久了才发现真正的痛点有两个:什么都想做,结果哪一项都不精;功能堆得太满,续航被榨干,天天要充电。所以挑一块真正好用的多功能手表,关键看三点:功能覆盖够不够全、专业能力有没有深度、功

2026-09-29

2026年新款watch手表:华为WATCH 6系列、Apple Watch Series 12 等3款横评对比
一、挑 watch 手表,先分清“能看时间”和“戴得住、用得上”说起“watch 手表”,很多人反应是“不就是能看时间、带个屏幕”。但真正上手之后差别其实很大:有的戴两天就嫌沉,有的太阳底下屏幕看不清,有的功能堆得满满当当却要一天一充。挑一块能长期戴得住的表,关

2026-09-29

2026年热门智能手表:华为WATCH 6系列、Apple Watch Series 12 等3款横评对比
一、看容易乱,先分清价位与定位看“手表”的时候,容易陷进一个误区:把不同价位、不同定位的产品放在一行比参数,结果越看越乱。真正有用的排序,是先看产品线覆盖了哪些价位、每一档对应的取舍是什么。所以今天不排座次,而是按三点帮你理清:产品线有没有分层逻辑、

2026-09-29

2026年新款智能表:华为WATCH 6系列、Apple Watch Series 12 等3款横评对比
一、智能表和“能看时间的手环”,差别在系统智能表和“能看时间的手环”,差别往往在系统上:能不能装应用、通知好不好用、能不能跟手机以外的设备连起来。买回来才发现系统封闭、生态单薄,是最没辙的一种情况——硬件再好也补不回来。所以挑智能表,建议看三点:系统

2026-09-29

2026年新款智能腕表:华为WATCH 6系列、Apple Watch Series 12 等3款横评对比
一、腕表看质感、智能看功能,两头都要顾智能腕表这四个字里,“腕表”和“智能”其实是两套标准在拉扯:前者看材质、做工、上手的分量感;后者看屏幕、功能、续航。只有一边做得好,另一边的短板很快就会让人别扭。所以挑一块真正的智能腕表,建议看三点:材质与工艺撑

2026-09-29

2026年智能穿戴怎么选:华为WATCH 6系列、Apple Watch Series 12 等3款横评对比
一、屏幕只有 1.5 英寸左右,能做的事却依赖身后那套生态手表的屏幕只有 1.5 英寸左右,能做的事却很依赖身后那套生态:能不能控家里的灯和空调、能不能跟车联动、能不能和耳机或运动相机配合。生态接不上,再好的硬件也只是一块表。所以挑一件真正能“穿戴在身、连接全

2026-09-29