Command Palette
Search for a command to run...
AskChem:面向化学文献综合的声明中心化基础设施
AskChem:面向化学文献综合的声明中心化基础设施
Bing Yan Stefano Martiniani
摘要
化学文献综合往往需要将散落在众多出版物中的特定发现汇集起来,然而现有的文献搜索系统主要返回排序后的文档列表。因此,科学家和 AI 智能体不得不手动定位相关信息、验证其出处并拼凑出跨论文的答案。我们提出了 AskChem,一个面向跨论文化学搜索的声明中心化基础设施。AskChem 将检索的基本单元从论文转变为携带出处的声明:每篇论文被转换为原子化、类型化的声明,每条声明均由来源 DOI 和逐字引用或显式证据定位符作为支撑。在这一共享声明存储之上,AskChem 提供了用于搜索和综合的互补结构:一个用于层次化检索和浏览的稳定分面分类体系,一个通过关系连接声明的证据图谱,以及一个将已收录论文置于科学原理之下的探索性动态分类体系。AskChem 目前已从 147K 篇论文中索引了 2.4M 条声明,并提供 Web 界面以及面向 AI 智能体的 REST、SDK 和 MCP 访问方式。在 AskChem-Bench 上,将 GPT-5.5 阅读器接入 AskChem 可获得 100% 可解析的 DOI,而未使用检索时为 88.3%,并且在五个受测系统中取得了最高的引用密度。AskChem 已在 https://askchem.org 上线。
一句话总结
纽约大学的研究人员提出 AskChem,一个以声明为中心的基础设施,将化学论文转化为携带出处的原子化声明,并暴露分面分类法、证据图谱和动态分类体系,支持跨论文综合;该系统索引了来自 147K 篇论文的 2.4M 条声明,将 AI 阅读器的 DOI 可解析率提升至 100%,并在所有测试系统中实现了最高的引用密度。
核心贡献
- 一种携带出处的声明表示,将化学论文分割为原子化、带类型的断言,并以源 DOI 和逐字引用或证据定位符作为基础,部署在来自 147K 篇论文的 2.4M 条声明之上。
- 在共享声明存储之上构建了互补结构,包括用于分层检索和浏览的稳定分面分类法、通过类型化关系链接声明的证据图谱,以及将论文置于科学原理之下的探索性动态分类体系。
- 通过 Web UI、REST API、SDK 和 MCP 服务器提供面向人类和 Agent 的接口,并配套 AskChem-Bench;在该基准中,基于 GPT-5.5 的阅读器实现了 100% 可解析的 DOI,并在五个测试系统中达到最高引用密度,而无检索的基线仅为 88.3%。
引言
化学家经常需要综合分散在多篇论文中的证据,例如比较催化剂性能指标,但现有的文献搜索工具返回的是文档级结果。这迫使研究人员手动提取和验证单个声明,过程缓慢且容易出错。基于 LLM 的助手面临同样的局限:文档检索并不暴露底层声明或其关系,并且模型在依赖参数化记忆时可能会虚构引用。作者提出了 AskChem,一个围绕携带出处的科学声明重新定位搜索的系统。通过从 147K 篇论文中提取原子化、带类型的断言,并附带源 DOI 和逐字引用,AskChem 能够直接检索特定发现、进行跨论文综合,并通过分面分类法、证据图谱和以原理为中心的层次结构实现结构化导航。
数据集
作者围绕三个相互关联的组件构建 AskChem 数据集,这些组件均从科学论文中提取,并用作实时检索和探索索引。
-
声明 240 万条原子化、带类型的科学断言。每条声明均以源 DOI 和逐字引用为基础,并包含结构化字段(反应物、条件、测量值、材料)以及提取置信度分数。每条声明都携带论文级元数据(DOI、期刊/会议、年份、引用次数、通过 OpenAlex 消歧的作者)。
-
稳定分面分类法 307,000 个已填充的分类节点,按 L1/L2/L3 路径组织。五个内容视图捕获声明的主题(反应类型、物质类别、应用、技术、机理主题),另有视图用于声明类型、提取的测量值、时间和来源作者。分类法从论文文本中归纳生成,然后通过规范路由、同义词规范化和近似重复子类别的模糊聚类进行稳定化处理。
-
证据图谱 171,342 条类型化、有向边连接声明。关系类型包括 cites_as_evidence、supports、extends、contradicts 和 derives_from,每条边都带有置信度分数和出处。对 148 条边的手动验证(146 条可判定)显示边类型精确率为 97.9%。
来源与提取 声明来自 147,000 篇论文,时间跨度为 1925–2026 年。两个互补的管道填充存储:高通量提取器大规模处理摘要,而深度提取器读取全文 PDF 以捕获摘要中常缺失的声明类型(假设、局限性、令人惊讶的发现)。所有输出均根据声明模式进行验证,该模式强制执行出处字段、数值范围和化学特定字段,因此 2.4M 条声明 100% 具有源基础。
处理 提取的声明存储在 SQLite 中,配备 FTS5 全文搜索和向量索引。分类路径从论文中反复出现的术语自动归纳,然后为生产检索进行稳定化。关系边由专用的提取层生成,每条边都附带置信度评分和出处。
数据使用方式 该数据集作为 AskChem 平台的操作索引,而非训练集。混合搜索结合了词汇(FTS5)、论文级、分类节点和稠密向量召回,使用倒数排名融合。分类分面允许用户对结果进行分组并浏览类别层次结构。证据图谱充当关系层:API 端点返回声明的入边和出边证据链接,Web 界面在热门搜索结果上构建图谱,使用户能够从一个发现导航到支持、扩展或反驳它的声明。
方法
作者围绕以声明为中心的表示设计 AskChem,用原子化、带类型的科学断言取代完整论文,作为主要检索单元。一条声明以源 DOI 和逐字引用为基础,并包含结构化字段,如反应物、条件、测量值或材料,以及提取置信度分数。这种表示确保单个发现,而非整个文档,成为可被搜索、分组、链接和验证的对象。
如框架图所示:
该平台在相同的声明标识下锚定多个结构。Source 记录论文级元数据,包括 DOI、期刊/会议、年份、引用次数和通过 OpenAlex 消歧的作者。TreeNode 将声明放入一个或多个分面分类路径,而 Edge 记录两个声明之间的类型化关系。将这些结构锚定在共享的声明标识符上,使得搜索、分层浏览和图遍历能够返回相同的携带出处的对象。
为了填充声明存储,作者采用两个互补的提取管道。高通量提取器大规模处理摘要,而深度提取器读取全文 PDF 以捕获摘要中常缺失的声明类型,如假设、局限性和令人惊讶的发现。每次提取调用返回根据声明模式验证的结构化 JSON,确保满足必需的出处字段和化学特定约束。
如语料库统计所示:
这些验证检查建立了可追溯性。在部署的索引中,所有声明都具有源基础,携带声明类型、源 DOI 和逐字引用。界面将这些携带出处的声明直接返回给用户。
如平台界面所示:
为了支持跨论文搜索,作者在声明存储之上添加了一个关系提取层。提取器在声明之间生成类型化、有向边,包括 cites_as_evidence、supports、extends、contradicts 和 derives_from,每条边都带有置信度分数和出处。该图谱充当检索之上的关系层,允许用户从一个发现移动到支持、扩展或反驳它的声明。
作者引入分面分类法,按声明所涉及的内容进行组织。AskChem 并非强加一个完全预定义的化学本体,而是在消化论文和提取声明的过程中归纳分类路径。这些路径揭示了反应、物质、应用、技术和机理中反复出现的术语。归纳出的路径通过规范顶级路由、同义词规范化和近似重复子类别的模糊聚类进行稳定化,从而形成一组适用于生产检索的持久 L1/L2/L3 路径。
分类法在相同的声明存储上定义了多个操作视图。每条声明都可以在已填充的视图中分配一个路径,例如在 by_reaction_type 下的 coupling/cross_coupling/suzuki。五个内容视图捕获声明的主题:反应类型、物质类别、应用、技术和机理主题。其他视图组织声明类型、提取的测量值、时间和来源作者。
如声明在各视图中的分解所示:
这些分面充当同一组携带出处声明的不同导航透镜。稳定分类法用作操作索引。混合搜索结合了 FTS5 声明文本检索、论文级召回、分类节点召回和稠密向量召回,使用倒数排名融合。返回的声明保留其关联的视图路径,允许客户端对结果进行分组或展开相关类别。
作为分面分类法的补充,作者引入了一个以原理为中心的动态分类体系,探究哪一更广泛的科学思想支配着论文的贡献。它将基于论文的叶子组织在原理、理论、模型、机理和现象之下。
如以原理为中心的组织所示:
该树包含一个弃权机制,当没有合适节点时提议新分支。作者将此结构视为索引语料库的探索性概览,而非经过充分验证的科学本体。
实验
评估验证了 AskChem 的源基础、结构可靠性、检索质量和可扩展性。所有声明均可追溯到逐字证据,证据图谱显示出高边类型精确率。以声明为中心的检索消除了 DOI 幻觉,并产生了最佳的引用密度和相关性,优于无检索的阅读器和其他系统,同时在语料库规模上运行。AskChem 与现有数据库和助手的不同之处在于其分面、携带出处的声明存储,可供人类和 Agent 使用。
将 GPT-5.5 阅读器基于 AskChem 可消除 DOI 幻觉,产生 100% 经过验证的引用,并在所有测试系统中达到最高的引用密度、论文相关性和近期高影响力工作的比例。无检索基线经常虚构参考文献,并在相关性和近期性上得分最低。Edison Scientific 的 Agent 系统在基于证据的具体性和切题率上领先,揭示了引用可验证性与定量细节深度之间的权衡。AskChem 实现了完美的 DOI 可解析率,每个引用的参考文献均通过 CrossRef 验证,而未增强的阅读器仅解析 88.3% 的 DOI。基于 AskChem 的阅读器每个答案引用的经过验证的 DOI 数量几乎是仅 LLM 基线的两倍,是 Paperclip 和 NotebookLM 引用密度的两倍以上,同时展示了更大比例的近期高影响力文献。
评估将基于 AskChem 系统的 GPT-5.5 阅读器与无检索基线、Edison Scientific 的 Agent 系统以及其他工具(如 Paperclip 和 NotebookLM)进行了比较。将阅读器基于 AskChem 可消除 DOI 幻觉,产生完全验证的引用、最高的引用密度以及更优的相关性和近期性,而基线经常虚构参考文献。Agent 系统在基于证据的具体性和切题率上表现最佳,揭示了引用可验证性与定量细节深度之间的权衡。总体而言,AskChem 实现了完美的 DOI 可解析率,并引用了比其他所有系统显著更多的经过验证的近期高影响力文献。