首页 游戏 软件 资讯 排行榜 专题
首页
科技数码
引文幻觉下降的AI新模型,准确率逼近人类专家

引文幻觉下降的AI新模型,准确率逼近人类专家

热心网友
83
转载
2026-02-05

来源:科技日报

免费影视、动漫、音乐、游戏、小说资源长期稳定更新! 👉 点此立即查看 👈


科技日报记者 张梦然

《自然》杂志日前报道了一个开源语言模型“OpenScholar”,它在精确进行文献综述方面有望超越商用大语言模型。例如,在该研究开展的实验中,GPT4o在78%到90%的情况下会出现引用幻觉,而“OpenScholar”的引用准确率则已接近人类专家的水准。虽然仍需持续优化,但这个工具有望帮助科学家处理日益繁杂的科研文献综述工作。

科学文献综述对于支撑循证决策、完善科研进程和引导新发现都至关重要。然而,文献发表数量的快速增长让研究人员难以全面掌握领域动态。商用大语言模型虽然能够提供一定辅助,却容易出现错误,例如在归因能力上的局限性以及频繁的引用幻觉。

为了生成准确、全面且表述清晰的科学文献综述,美国华盛顿大学的研究团队推出了“OpenScholar”。该模型是专为科研任务设计的检索增强型语言模型。其他系统也采用过类似框架,但研究团队将其与一个包含4500万篇最新开放获取科研论文的专用数据库以及一套自我评估机制相结合,从而优化了其输出质量。

研究团队还创建了一个名为“ScholarQABench”的基准工具,用以评估文献综述的自动化水平。测试结果显示,“OpenScholar”的准确率比GPT4o和PaperQA2这类现有系统分别高出6.1%和5.5%。此外,“OpenScholar”生成的答案,在50%到70%的情况下比专家注释器提供的答案更为实用。

团队总结道,上述结果以及引用幻觉的大幅减少,证明了“OpenScholar”未来有望支持和推动科研工作。但他们也指出,该系统仍有局限性,并强调基于语言模型的系统无法使科学文献综述实现完全自动化。他们同时向学界开放了“ScholarQABench”和“OpenScholar”,以鼓励进一步的研究与优化。

总编辑圈点

科研人员每天寻找有价值的论文,就好比在信息的“海洋”里捞取“珍珠”。但如今海水暴涨,真正有用之物和虚假错乱之物一同浮上水面。以往大家用的是通用的“万能捞网”,比如GPT。但它网眼太大,捞上来的可能是“塑料珠子”,也就是虚假或错误的引用,需要花费大量时间去甄别筛选,甚至可能被误导。而这个“OpenScholar”,是一张专门为这片科学海洋设计的网。它不求万能,追求可靠,并且所有科学家都能一起改进这个工具,让它更精准。这有望将科研人员从繁琐、易错的文献苦海中部分解放出来,让他们能把宝贵精力用在真正的思考和发现上。这正是科学工具走向可信化的重要一步。

来源:https://www.163.com/dy/article/KL0C6ORG0514R9OJ.html
免责声明: 游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

相关攻略

7月25日外媒科学网站摘要:科学家警告,人类正无意间向宇宙泄露“地球坐标”
科技数码
7月25日外媒科学网站摘要:科学家警告,人类正无意间向宇宙泄露“地球坐标”

《自然》:一桩悬案了结? “砷基生命”论文终遭撤稿,但争议远未结束 科学界一桩持续了15年的公案,最近有了新进展。顶级期刊《科学》(Science)正式撤回了那篇曾引发轰动的争议性论文——该研究当年声称,在美国加州莫诺湖发现的一种细菌,能够用有毒的砷元素替代生命必需的磷来构建DNA,这直接挑战了我们

热心网友
04.17
Sam Altman:超级智能近在眼前!OpenAI官方13页蓝图引爆海外社区
AI
Sam Altman:超级智能近在眼前!OpenAI官方13页蓝图引爆海外社区

OpenAI CEO Sam Altman 表示,「超级人工智能的到来比大多数人预期的要快。 OpenAI 加快了迈向下一 AI 阶段的进程。昨晚,在一场引人注目的Axios采访中,OpenAI C

热心网友
04.07
算力先用后付、科研要素“开箱即用”,让科学家只跑一次的AI4S社区来了
科技数码
算力先用后付、科研要素“开箱即用”,让科学家只跑一次的AI4S社区来了

上海交大义理林团队,以AI赋能激光器,用于芯片测量切割,致力于实现高端制造的自主可控;上海交大李金金团队,将深耕设备一辈子的老师傅们口传心授的实操经验,炼成工业时序控制大模型;上海交大谢伟迪团队研发

热心网友
04.07
东方卫视今晚22:30《两说》展望“低空经济+人工智能”的未来发展蓝图
科技数码
东方卫视今晚22:30《两说》展望“低空经济+人工智能”的未来发展蓝图

两说作为战略性新兴产业,低空经济坐拥万亿级赛道的发展空间,备受瞩目。而人工智能技术正从感知、决策、协同、调度到监管,全链条重构其发展逻辑,成为推动低空经济从试点探索迈向规模化商用的核心引擎。在人工智

热心网友
04.01
今晚播出《天作之合》:低空经济与人工智能深度解析 | 两会特辑
科技数码
今晚播出《天作之合》:低空经济与人工智能深度解析 | 两会特辑

两说 Business Insights当前,低空经济以其战略性新兴产业与万亿级赛道的发展空间而备受关注,人工智能技术正从感知、决策、协同、调度、监管全链条重构低空经济发展逻辑,成为低空经济从试点

热心网友
04.01

最新APP

宝宝过生日
宝宝过生日
应用辅助 04-07
台球世界
台球世界
体育竞技 04-07
解绳子
解绳子
休闲益智 04-07
骑兵冲突
骑兵冲突
棋牌策略 04-07
三国真龙传
三国真龙传
角色扮演 04-07

热门推荐

追觅宣布进军天文领域 构建“空天地一体化”生态
科技数码
追觅宣布进军天文领域 构建“空天地一体化”生态

“我们的代码,终将写入繁星”:追觅科技成立天文BU,构建从地面到太空的生态闭环 “我们的代码,终将写入繁星。”这句来自追觅科技的宣言,不只是一句诗意的口号,更是一份清晰的战略升级路线图。就在9月10日,这家中国科技企业正式宣告成立天文业务单元(BU),由此完成了一次至关重要的战略跃迁。这标志着其“全

热心网友
04.17
Just Learn
AI
Just Learn

Just Learn是什么 提起用AI为教育赋能,Just Learn这款工具是个绕不开的名字。它由Just Learn公司开发,核心目标非常明确:一手帮教师扩展专业能力,一手为学生打造个性化的学习旅程。说到底,它的价值在于通过AI驱动学习和24 7全天候辅导这两大核心,把教育资源重新“盘活”,让老

热心网友
04.17
Vue 渲染机制中的伪代码拆解:三分钟看懂 Patch 函数的核心逻辑
前端开发
Vue 渲染机制中的伪代码拆解:三分钟看懂 Patch 函数的核心逻辑

Vue 渲染机制深度解析:Patch 函数核心逻辑与优化策略 Vue js 的响应式系统实现了数据驱动视图的核心理念。然而,当数据发生变化时,视图是如何被高效且准确地更新的呢?这背后的核心引擎,正是虚拟 DOM 体系中的 Patch 函数。它并非直接操作真实 DOM,而是通过深度比对新旧虚拟节点(V

热心网友
04.17
JRPG神作《空之轨迹 the 2nd》发售日公布!首批特典送前作
游戏评测
JRPG神作《空之轨迹 the 2nd》发售日公布!首批特典送前作

《空之轨迹SC》完全重制版《空之轨迹 the 2nd》正式定档2026年9月17日,登陆多平台 日本Falcom官方正式公布,经典日式角色扮演游戏《空之轨迹SC》的完全重制版——《空之轨迹 the 2nd》,将于2026年9月17日全球同步发售。本作将登陆任天堂Switch 2、Switch、Pla

热心网友
04.17
AI Art Prompt Generator
AI
AI Art Prompt Generator

AI艺术提示生成器是什么 简单来说,你可以把它理解为一个永不枯竭的创意火花塞。这个基于前沿AI技术的工具,专为破解创作瓶颈而生,无论你是专业画师还是灵感偶尔“罢工”的爱好者,它都能派上用场。它的工作原理并不复杂:依托当前顶级的OpenAI模型,将你的初步想法“催化”成一系列具体、新颖且富有启发性的艺

热心网友
04.17