家人们谁懂啊,写文献综述这事儿,简直是研究生的噩梦。
开题要写,中期要写,毕业论文还得写。有人为了一篇综述熬了三个月,头发掉了一半,最后导师一句“逻辑不清、分类混乱”直接打回重写。结果现在浙大和上交的研究团队跳出来说:别熬了,一小时,我给你整出来。
但别高兴太早,他们自己也很坦诚——离真正“能发表”,还差那么0.3分。
这0.3分,懂的都懂,有时候就是“能投”和“再改改”之间的距离,隔着一条银河。
这玩意儿到底叫啥?DAS,听着挺唬人
浙大、上交联合团队搞了个系统叫DAS,目标是让AI一小时内自动生成一篇面向发表的学术综述。
你可能会说,Deep Research那些工具不是早就能搜文献、写报告了吗?是,但问题恰恰出在这儿。
市面上那些工具走的都是“检索—分析—写作”的老套路,产出的东西更像一份研究报告,而不是一篇正经的学术综述。论文怎么分类?哪篇该放哪个章节?某个论点到底该引哪几篇文献?参考文献、交叉引用、图表、最终PDF能不能靠得住?这些问题,不是把上下文拉长、多塞几篇论文就能解决的。
DAS的思路完全不一样。它搞了个“有状态智能体闭环”框架,从全局文献检索到分类体系构建,再到论文分配、段落规划、引用规划,最后经过语义审查和确定性验证,形成一套“生成—审查—修正—再评估”的完整闭环,最后直接给你输出一篇带图表、带参考文献的完整PDF。
翻译一下就是:它不是把搜到的论文硬缝在一起,而是先“吃透”这些论文,再决定怎么组织、怎么论证、怎么引用。这操作,属实是把写综述这事儿给玩明白了。
先啃下200万篇论文,再谈写作
DAS底层有个叫DAS-2M的文献元数据库。团队把2020年1月以来近200万篇论文做了全文解析,用大模型提取出方法、数据集、实验结果、创新点、局限性这些结构化信息。
这有啥用?打个比方,以前写综述就像每次都要重新翻一遍图书馆的所有书,现在相当于提前把所有书都做好了详细读书笔记——一篇论文解析一次,就能被不同的综述主题反复调用。而且这个库是动态更新的,新论文发出来会持续补进去。
用户输入一个主题,系统先从200万篇论文里检索候选文献,再基于这些论文建分类体系,通过反向路由判断每篇论文该支撑哪个章节。后面的规划、写作、引用,全都建立在同一套可复用的文献表示上。
说白了就是:先把地基打牢,再往上盖楼。
4.34分,离最强基线就差0.31
在DAS-Bench评测基准的30个综述主题上,DAS从引用质量、分类体系、论述逻辑和稿件可靠性四个维度接受评测,平均得分4.34分。完整参与全部30个主题的最强基线得分是4.03分。
等会儿,4.34减4.03,不就是0.31吗?对,就差这0.31。对人类作者来说,这0.31分可能就是“改一改能投”和“还得再打磨一轮”的差距。对AI来说,这0.31分是“初稿”和“能发表”之间那道看不见的墙。
专家匿名评测里,DAS相比传统检索增强方法在30个主题中的27个更受偏好,相比另一个自动综述系统在21个共享主题中的19个更受偏好。目前项目网站已经开放了220篇自动生成的热门方向综述供在线查看。
那0.3分到底差在哪?
说实话,DAS已经是目前自动综述生成领域最能打的了。但0.3分的差距,指向的问题很具体。
一篇高质量综述的核心价值在于批判性分析和原创性见解——不只是把文献整理归类,而是指出这个领域哪里研究不够、哪些结论互相矛盾、未来该往哪走。AI擅长的是“整理”,不擅长的是“判断”。它能告诉你某篇论文用了啥方法、得了啥结果,但它很难告诉你“这个方法的根本假设可能有问题”或者“这个领域的主流范式正在被挑战”。
另一个现实问题是引用可靠性。虽然DAS在引用维度下了不少功夫,但AI生成综述的参考文献准确性仍是学术界普遍担心的事。一篇综述里要是有几个引用对不上,那就是学术事故,直接社死。
研究者该慌吗?
不用慌,但该想的确实得想。
0.3分的差距,搁以前可能是“辅助工具”和“替代方案”之间的鸿沟。可现在,工具已经能一小时干完你半个月的活,虽然最后那0.3分还得你自己补——但问题是,你补得过来吗?
未来的学术写作可能变成这样:AI负责海量文献的快速梳理和组织,人类负责注入批判性思考、建立跨领域连接、提出真正有价值的研究问题。综述作者的角色正在从“文献搬运工”变成“知识策展人”。
最关键的是,DAS团队已经把代码、数据、评测基准全部开源了。意味着任何一个研究者、任何一个实验室,都可以在这个基础上继续往前推。今天差0.3分,明天呢?
你觉得AI写综述这事儿靠谱吗?如果有一天AI生成的综述真能直接发表,你会用还是不用?评论区聊聊你的看法,顺手转发给那个还在为文献综述头秃的室友。