核心观点
- 自主科研 Agent 生成论文时普遍存在「结构性失真」:虚构引用、方法与代码不一致、数据无法复现,实测基线系统最多幻觉出 21% 的参考文献。
- Chain-of-Evidence(CoE)提出可验证科研框架:论文中每个断言都必须携带证据链,且证据链必须真实支撑该断言——完备性与正确性缺一不可。
- Science One Framework 按 CoE 由构造保证可验证:检索引用全部来自 API 实取,实验输出全部落成只读记录,写作前逐条核对断言与证据。
- 在 75 篇论文的 ADRS 基准上,Science One 达到零虚构引用、全部可复现分数,且在 MLE-Bench 等前沿基准上不输甚至超越既有系统。
内容精讲
大模型正从编码助手升级为端到端的自主科研 Agent:搜文献、提假设、跑实验、写论文全流程包办。Sakana 的 AI-Scientist、AutoResearchClaw、DeepScientist、AI-Researcher 等系统已能产出与人类论文可比的手稿。但当论文表面质量逼近人类,一个结构性缺陷浮出水面——**可验证性**。
这类流水线逐字迭代生成文本,任一阶段的误差都会被下游放大:引用一篇根本不存在的论文、方法描述与真实代码对不上、报告的成绩无法用代码复现。作者把问题定位为「断链」:每个断言(引用、数字、方法描述、结论)本应回指一份证据(同行评审论文、实验日志、真实运行的代码、结果表),当这条链断裂,幻觉就产生了。
**Chain-of-Evidence:定义可信,而非规定实现。** CoE 是一套概念框架,类似 ACID 之于数据库事务——不规定你如何构建科研 Agent,只规定产出必须满足的性质。原则只有一条、分两半:每个断言必须携带可追溯的证据链(完备性),且每条链必须真正支撑所附断言(正确性)。虚构引用是指向不存在的论文,不可复现的分数是重跑代码后不出现,方法失真是一篇论文声称算法 A 而代码实现 B——三者的共同点是断言到证据的链条断了。CoE Audit 让这些断裂变得可测量。
**Science One Framework:按构造即可验证。** 与其事后补救(先出论文再回溯链接事实),Science One 从构造上内建证据链,三大模块各管一段。Problem Investigator 负责文献锚定:通过 Semantic Scholar API 构建引用图谱,每个主题读取最多 100 篇全文 PDF 产出结构化研究简报,论文里每个引用都源自这次真实 API 调用,彻底摆脱模型记忆的「虚构空间」。Discovery Engine 负责并行探索-利用:多个隔离分支同时跑,Solver Agent 实现方案、任务专属评估器打分,高分分支迭代精进,所有原始评估输出写入严格的只读记录——实验环节从此不可篡改。Paper Writer 与 Claim Verifier 负责写作与核对:成稿前为每个事实断言构建结构化表示,内联证据标签绑定到具体工作区产物;专用 Claim Verifier 逐条核对,断言超出证据支撑时不是删掉而是保守重述,保证论文始终与事实一致。
**CoE Audit:四项自动化取证检查。** 分数验证(独立重跑提交代码,对照论文报告值)、规格违规检查(确认代码真正解决问题,而非钻评估指标空子或读答案文件)、引用验证(对接学术 API 交叉核对每条书目,抓出幽灵引用)、方法-代码一致性(用 LLM 裁判逐段比对论文方法节与代码,确认文本忠实描述算法)。这套后验协议相当于一个自动化的「法证审稿人」。
**结果:可验证不牺牲性能。** 研究者用 CoE Audit 审查了 ADRS 基准上 5 个系统优化任务(Prism、Cloudcast、EPLB、LLM-SQL、事务调度)生成的 75 篇论文:基线系统虚构引用率最高达 21%、代码与文本频繁错位,而 Science One 零虚构引用、分数完全可复现,同时在前沿基准(MLE-Bench、Parameter-Golf)上取得最优成绩。
这指向一个判断:可验证性与解题能力不是零和博弈。把「证据链」作为第一公民写进科研 Agent 的构造,产出的论文才可能真正进入学术共同体的审查循环。
阅读价值
对科研自动化方向的开发者,CoE 提供了可落地的验证框架与四个检查项,直接可迁移到自己的 Agent 流水线;对使用 AI 论文的读者,CoE Audit 给出了甄别「学术污染」的具体抓手。
内容与图片版权归原作者所有 · 原文: https://research.google/blog/science-one-framework-a-verifiable-autonomous-research-framework-via-chain-of-evidence/