中文精炼导读
核心观点
- 谷歌研究团队提出 Chain-of-Evidence(CoE)框架:一份 AI 生成的科研文档中,每一条声明(引用、数字、方法描述、结论)都必须携带一条可追溯的证据链,且证据链必须真实支撑其声明——这如同 ACID 之于数据库事务,定义了"什么才算可信的研究产物"。
- 针对当前自主科研智能体的通病(生成不存在的引用、方法与代码不一致、报告分数无法复现),他们搭建了 Science One Framework 原型:从构造上内建证据链,而非事后补救。
- 配套发布的 CoE Audit 是一套自动化"法证审查"协议,对论文、代码、引用做四项严格完整性检查:分数复现、规格违规、引用核验、方法-代码一致性。
- 实测中,基线系统最多有 21% 的引用是"幽灵引用",而 Science One Framework 实现零幻影引用、分数完全可复现,四项完整性检查全面领先。
- 关键结论是:严格可验证性并未牺牲科研能力——它在 ADRS 五个任务上持平或超过人类专家,在 MLE-Bench 获得两金两银,在 Parameter-Golf 上取得 SOTA 成绩。

内容精讲
随着 LLM 从"编程助手"演进为能端到端跑科研流程的自主智能体(如 Sakana 的 AI-Scientist、AutoResearchClaw、DeepScientist、AI-Researcher),AI 论文的表面质量越来越高,但一个结构性问题浮出水面:可验证性。由于自主研究流水线是逐字迭代生成的,任何阶段的错误都会被逐级放大:有的系统会引用不存在的论文,有的论文描述的方法与实际代码完全对不上,有的报告的成绩用提供的代码根本复现不出来。这篇论文的出发点正是这个问题。
CoE 框架的核心是一条"一分为二"的原则:完整性——研究产物中的每条声明都必须记录一条证据链;正确性——每条证据链都必须真正支撑它挂靠的声明。声明可以是引用、报告的数字、方法描述或结论,证据则包括经过同行评审的论文、实验日志、真正运行过的代码或结果表格。幽灵引用指向不存在的论文、不可复现的分数在重新运行代码后不再出现、被错误描述的方法在论文里宣称一种算法而代码实现的却是另一种——这些都是"声明到证据的链条断裂",而 CoE Audit 让这种断裂可以被量化测量。
Science One Framework 用"构造式"的方式实例化 CoE,由三个模块构成。第一个是 Problem Investigator(问题调研器),负责文献根基:它通过 Semantic Scholar API 构建引用图谱,每个主题读取最多 100 篇 PDF 全文,产出一份结构化研究简报——论文里的每条引用都源于这次受 API 约束的检索,从根本上消除对模型记忆的依赖,因此不可能凭空造出引用。第二个是 Discovery engine(发现引擎),做并行的"探索-利用":在多个隔离的分支里,Solver agent 实现解决方案,任务专用评估器打分,高分分支被迭代优化,所有评估器原始输出被写入一份严格的只读记录。第三个是论文写作与声明核验模块:在渲染稿件之前,系统先把每条事实性声明构建成结构化表示,并挂上一个内联证据标签,绑定到具体的工作区产物;专门的 Claim Verifier 逐条把声明与声明来源核对,凡是"跑得比证据快"的声明都会回到源头被保守地改写——是"重述收敛"而不是"删除",保证论文始终与工作真正支持的结论对齐。

为了严格评估,团队开发了 CoE Audit,一个事后评估协议,扮演"自动化法证审查员"的角色,对生成的论文、方案、代码和引用运行四项严格检查:分数核验——从论文提取报告分数,与独立重跑提交代码得到的结果对比;规格违规检查——审查方案代码是否真的在解决问题,而非钻评估指标的漏洞或直接读取标准答案文件;引用核验——用学术 API 逐一交叉核对参考文献,揪出幻影引用;方法-代码一致性——用 LLM 评判把论文的方法章节与代码并排对比,确认文字如实描述了实现的算法。

实验在 Automated Design of Research Systems(ADRS)基准上对五个系统优化任务(Prism、Cloudcast、EPLB、LLM-SQL、事务调度)生成的 75 篇论文展开。Science One Framework 在四项完整性检查上全部领先:没有任何一条引用是幻影的(基线最高达 21%),分数核验满分,方法-代码一致性最高——相比之下,基线系统常常在论文里描述"混合神经符号求解器"这种高级算法,提交的代码却只是一个简单的确定性启发式。更重要的是,严格可验证没有折损科研能力:它在全部五个 ADRS 任务上持平或超过人类专家水平,在 Cloudcast 和 EPLB 两个任务上拿下所有系统中的最高分。

为了检验泛化能力,团队把框架部署到六个高难度外部任务上。MLE-Bench 方面,覆盖医学影像、细粒度识别、3D 感知的五个 Kaggle 竞赛中,Science One Framework 拿到两枚金牌(其中 3D 目标检测的获胜成绩是基线完全失败的任务)和两枚银牌。Parameter-Golf 是一场严格的实时 LLM 训练竞赛(有硬件和文件大小限制),基线系统没能提交有效结果,而 Science One Framework 完全遵守所有约束并取得 SOTA 分数——而且它发现的是真正新颖的算法技术,不是调几个表层超参。
阅读价值
适合关注 AI for Science、自主科研智能体以及 LLM 可信度评估的研究者和工程师:这篇文章给出了一套可直接复用的"科研产物可验证性"评估方法论(CoE + CoE Audit),并用扎实的实验证明"可信"与"高性能"可以兼得;对想判断未来 AI 科研系统谁更可靠的人来说,这提供了一个清晰的评估视角。
本文为中文精炼导读,由 AI 基于原文整理,内容与图片版权归原作者所有。原文: https://research.google/blog/science-one-framework-a-verifiable-autonomous-research-framework-via-chain-of-evidence/