Semantic Scholar

义项:人工智能驱动的学术文献搜索网站
Semantic Scholar

Semantic Scholar是艾伦人工智能研究所(Allen Institute for AI)开发的免费学术文献搜索与发现平台,2015年11月公开发布,面向科研人员提供由人工智能驱动的文献检索、摘要与引文分析服务。它不依赖关键词出现频率排序结果,而是使用自然语言处理和机器学习技术理解论文内容,帮助研究者缓解文献信息过载、定位相关研究并判断其学术影响力。平台以网页、开放接口和可下载数据集三种方式向研究社区开放,收录的论文数量超过2亿篇。

目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

Semantic Scholar是由非营利研究机构艾伦人工智能研究所(Allen Institute for AI,简称AI2)开发和运营的免费学术文献搜索平台,于2015年11月首次公开发布[1]。它的定位是学术搜索引擎与文献发现工具的集合,而不只是关键词检索入口。

该平台以人工智能技术对科学文献进行分析,提供论文的语义检索、一句话自动摘要(TLDR)、引文影响力识别和个性化推荐等功能[2]。平台覆盖生物学、医学、计算机科学、地理学、商学、历史学和经济学等学科,论文来自PubMed、Springer Nature、Taylor & Francis、SAGE、Wiley、ACM、IEEE、arXiv、Unpaywall等合作方[2]。

除网页服务外,AI2还向研究社区免费提供Semantic Scholar应用程序接口和Semantic Scholar Academic Graph(S2AG)学术图谱数据集,并为部分功能公开代码与数据[2]。

原理

与传统搜索引擎主要按关键词出现频率排列结果不同,Semantic Scholar使用自然语言处理和机器学习技术对论文文本进行语义层面的分析,从而筛选出与检索意图更相关的结果[2]。系统还结合机器学习、自然语言处理和计算机视觉,在传统引文分析之上叠加语义分析层,并从论文中抽取图表、实体和发表场合等信息。

平台的核心数据基础是Semantic Scholar Academic Graph,它是一个由论文、作者、发表场合和引用关系构成的异构知识图谱,并为每篇论文分配唯一的Semantic Scholar Corpus ID(S2CID)。图谱中的语义特征由多个模型生成,包括用于生成一句话摘要的TLDR、对引用意图进行分类的模型,以及将论文映射为向量的SPECTER嵌入。SPECTER的训练目标是让存在引用关系的论文向量彼此靠近、无引用关系的论文向量彼此远离,其损失函数可写为$L(\theta)=\sum_{(p,p^+,p^-)}\max(0,d(f_\theta(p),f_\theta(p^+))-d(f_\theta(p),f_\theta(p^-))+\alpha)$。平台据此计算论文相似度,支撑推荐和研究推送功能[3]。

S2AG中的数据关系可以用下图表示,论文、作者、发表场合与机构构成节点,作者关系与引用关系构成边。


graph LR

A[论文节点] -->|引用引用边| A

A -->|作者关系| B[作者节点]

B -->|机构归属| C[机构节点]

A -->|发表场合| D[发表场合节点]

引用关系被进一步标注类型与上下文,系统据此识别出对后续研究具有较高影响力的引用,而非只统计被引次数[3]。

发展历程

Semantic Scholar由AI2于2015年11月公开发布,最初索引范围集中在计算机科学领域。AI2本身由微软联合创始人保罗·艾伦于2014年创立,是一家以公益为宗旨开展人工智能研究与工程的非营利机构[4]。据AI2当时的表述,项目最初的目标是在既有学术搜索工具的基础上提高检索质量,而非取代通用搜索引擎。

2016年,平台覆盖范围扩展到神经科学,并引入评价科研人员与研究机构影响力的功能,随后又延伸至生物医学等学科。同年,AI2与Springer Nature启动了针对计算机科学与生物医学领域的试点合作,该合作在2019年扩展至化学、材料科学、地球与环境科学、地理学和公共卫生等方向,Springer Nature向AI2提供超过340万条内容的元数据[5]。

2018年3月,曾负责亚马逊Alexa平台机器学习新项目的道格·雷蒙德加入AI2并领导Semantic Scholar项目[6]。同年1月,在加入生物医学论文和主题摘要的项目之后,语料库规模超过4000万篇。2019年8月,收录的论文元数据数量增长到超过1.73亿篇。

2020年,芝加哥大学出版社期刊部与AI2合作,使其出版的文章进入Semantic Scholar语料库[1]。至2020年底,平台索引论文约1.9亿篇,月活跃用户达到700万。此后论文规模继续扩大,平台与全球500多家学术出版商、大学出版社和学术团体建立了合作关系[1]。

应用

最直接的用途是文献检索与发现。用户可以在网页检索框中输入关键词、论文标题或作者姓名,获得跨学科的检索结果,并按条件过滤[7]。结果页中带有TLDR标签的条目会显示由人工智能生成的一句话摘要,帮助用户快速判断论文内容[7]。

在文献综述与追踪方面,用户可以保存论文到个人图书馆,为作者、论文和主题设置邮件提醒,并通过研究推送功能获取推荐文献;推荐模型会学习文件夹内已保存论文的内容,每日更新推荐结果[7]。平台还提供增强阅读器Semantic Reader,在阅读界面中给出术语的行内解释和引用文献的上下文信息,使读者无需跳转页面即可理解引文含义[7]。

面向开发者和定量研究,平台提供公开接口,允许以编程方式获取论文、作者和引用信息,用于构建第三方学术应用[7]。S2AG同时以月度可下载快照的形式发布,包含论文元数据、摘要、作者、引用关系、SPECTER嵌入和TLDR等数据,适合离线的大规模文献计量分析[3]。第三方文献可视化工具也会以Semantic Scholar的数据为基础,基于共被引和文献耦合两种相似度度量绘制论文关系图[8]。

局限

平台的主要检索对象是论文元数据与摘要,全文并不是查询时的直接返回内容。全文以Semantic Scholar Open Research Corpus(S2ORC)的形式批量发布,其规模约为800多万篇全文论文,使用者需要自行下载并建立索引才能实现全文检索;接口另有面向开放获取论文的片段检索端点,但返回的是短小摘录[9]。此外,接口不提供基于向量的任意相似度检索,用户若需此类功能必须下载嵌入数据集在本地建立索引[3]。

接口访问受到分级限流。未使用密钥的访问额度较低,注册免费密钥后通常为每秒1次请求,更高频率需要另行申请;普通检索端点最多返回1000条结果,超出部分需使用批量检索接口[10][3]。这意味着大规模的自动化调用需要围绕批量接口和数据集下载来设计。

数据覆盖本身也存在边界。平台的资源类型以已发表文章和预印本为主,对书籍和专利的覆盖较为有限[11]。不同文献数据库在引用计数方法上并不一致,将S2AG与其他学术图谱对比时,论文引用量的差异会随引用规模增大而扩大,因此基于引用计数的指标需要谨慎对待[12]。还有研究指出,依赖S2AG语料的下游工具在结果上会受到该语料覆盖范围与准确度的限制[13]。

参见

  • 艾伦人工智能研究所 —— 开发和运营Semantic Scholar的非营利研究机构。

  • Semantic Scholar Academic Graph —— 支撑平台检索与分析的学术知识图谱数据集。

  • SPECTER —— 用于生成论文向量表示的模型,支撑相似度计算与推荐。

  • 文献计量学 —— 以论文与引用数据为对象进行定量分析的学科领域。

  • 预印本 —— 平台收录的重要文献类型之一,与已发表论文一并索引。

  • 引文分析 —— 平台在传统引文分析基础上叠加语义分析层的技术基础。

参考资料

  1. uchicago.edu 上的网页 . uchicago.edu [引用日期2026-10-08]
  2. Semantic Scholar | Librarian Resources . semanticscholar.org [引用日期2026-10-08]
  3. Semantic Scholar API . emergentmind.com [引用日期2026-10-08]
  4. Semantic Scholar | About Us . arquivo.pt [引用日期2026-10-08]
  5. All Press Releases . springernature.com [引用日期2026-10-08]
  6. geekwire.com 上的网页 . geekwire.com [引用日期2026-10-08]
  7. QESS_UserGuideV3(PDF) . hkmu.edu.hk [引用日期2026-10-08]
  8. lmu.edu 上的网页 . lmu.edu [引用日期2026-10-08]
  9. dev.to 上的网页 . dev.to [引用日期2026-10-08]
  10. api_limits . github.com [引用日期2026-10-08]
  11. Semantic scholar学术搜索引擎 . qlu.edu.cn [引用日期2026-10-08]
  12. arxiv.org 上的网页 . arxiv.org [引用日期2026-10-08]
  13. Multi-Disciplinary Dataset Discovery from Citation-Verified . arxivlens.com [引用日期2026-10-08]
词条评价
词条统计

浏览次数:9 次

阅读量:4 次 · 阅读完成量:0 次

最近更新:2026-10-08T12:40:21Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
艾伦人工智能研究所 Semantic Scholar Academic Graph SPECTER 文献计量学 预印本 引文分析
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。