ITBEAR科技资讯
网站首页 科技资讯 财经资讯 分享好友

从“认错人”到精准识别:KBMR如何让AI问答告别“瞎猜”时代

时间:2026-09-14 22:36:51来源:互联网编辑:快讯

在知识型视觉问答领域,一个长期存在的难题正被一项新研究突破。当用户上传一张老照片询问“这栋建筑现在归谁所有”时,传统系统常因无法识别不同年代拍摄的同一建筑而给出错误答案。这类任务需要模型不仅识别图像内容,更要理解其背后的实体身份,而现有技术往往在视觉相似性与语义一致性之间陷入困惑。

核心矛盾在于,视觉上高度相似的图像可能指向完全不同的实体。例如某酒店照片在维基百科图库中检索时,系统可能将博物馆、度假村等外观相似的建筑排在前列,而真正的目标建筑因拍摄年代差异被淹没。这种“以貌取人”的检索方式,导致后续问答系统基于错误资料生成答案,形成“垃圾进、垃圾出”的恶性循环。

研究团队提出的KBMR方法,通过重构检索环节的技术架构破解这一困局。传统CLIP模型采用双塔结构,将图像与文本分别编码后计算相似度,这种设计擅长判断“图中是否有猫”等视觉任务,却难以捕捉“十年前与现在的建筑是否为同一实体”这类语义关联。KBMR则创新性地引入多模态大语言模型(MLLM),直接利用其连续推理能力生成图像的“数字指纹”。

技术实现的关键在于隐藏状态提取。当大模型接收“用一词总结图片”的指令时,研究团队截取其生成最终答案前的内部隐藏状态作为图像表征。这种设计保留了模型推理过程中的丰富上下文信息,相比仅使用最终生成的文字标签,信息密度提升数个量级。实验显示,这种表征方式使系统能区分“视觉相似但实体不同”的边界案例,例如准确识别不同年代的同一建筑照片。

训练数据构建是另一大突破。研究团队设计语义判别器,通过分析模型生成“是/否”答案时的原始概率分布,为图像对生成0-1的连续置信度分数。这种软标签替代传统二元标签,能捕捉“完全不相关-视觉相似但实体不同-部分特征相关”的渐变关系。在1万对正负样本测试中,该判别器的AUC指标达0.91,较CLIP的0.79有显著提升,证明其能更精准识别语义不一致的图像对。

负样本挑选策略体现工程智慧。系统首先用CLIP筛选视觉最相似的前50张候选图,再通过判别器过滤语义高度相关的样本,最后按置信度分数分层抽样,确保训练数据覆盖不同难度级别。这种设计防止模型在简单负样本上过早收敛,同时避免极端案例导致的过拟合。与之配套的软监督训练机制,通过KL散度使检索器的概率分布向判别器输出的标准分布对齐,实现细腻的区分度学习。

实证效果令人瞩目。在E-VQA、InfoSeek、OK-VQA三个权威数据集上,KBMR的检索准确率(Recall@1)分别达24.7%、60.3%和未公开具体数值,较最强CLIP模型提升11-15个百分点。当接入EchoSight、OMGM等现有问答系统时,最终答案准确率普遍提升7-9个百分点,在OK-VQA上更取得12.7分的突破性进展。具体案例显示,对于犀鸟属鸟类照片,CLIP检索结果混入多种视觉相似但分类不同的鸟类,而KBMR能将正确物种排在首位,后续候选也保持分类学连贯性。

这项研究重新定义了检索环节在知识型问答系统中的价值。过去业界普遍认为,只要生成端模型足够强大,就能弥补检索误差。但实验证明,检索准确率每提升1个百分点,下游问答准确率可获得数倍放大效应。研究团队特别指出,语义判别器的性能直接影响整个系统上限,当使用参数量更小的InternVL3-8B模型时,系统效果出现明显下降,这为后续研究指明方向——如何构建更强大的实体识别判别器,将成为突破技术瓶颈的关键。

更多热门内容
贾跃亭携9款机器人与4套方案入场,这次能否在机器人赛道站稳脚跟?
很多机器人公司成立好几年都未必能拿出9款产品,FF这是捅了机器窝了? 可以看出,FF这波不是玩票,9款机器人、4套解决方案、还有租赁平台和供应链布局,一口气甩出这么多东西,在最近的机器人行业里算是相当有看点的…

2026-09-14

AI浪潮奔涌向前 安全防线筑牢在先 护航智能时代稳健发展
如果说过去的网络安全更多是在“堵漏洞、防攻击”,那么进入AI时代,安全逻辑正在发生变化:不能等风险出现后再补救,而要把安全能力提前嵌入技术发展的全过程,为人工智能应用筑牢底座。 这也是智能时代网络安全最大…

2026-09-14