科学边界

数据口径与说明

更新于 2026年8月16日

科学边界展示的是依据公开信息和社区共建内容整理形成的科研诚信相关记录。本页说明这些记录如何被发现、关联、分类和统计,以及平台目前能够做到和不能做到的事情。

科学边界不替代期刊、出版方、作者所在单位、基金管理机构、主管部门或司法机关作出正式调查结论,也不把撤稿、公开质疑或社区观察直接等同于学术不端。平台的目标,是把分散在论文数据库、撤稿通知、公开学术讨论、机构网页和社区提交中的信息,整理成一条尽可能完整、可追溯、可回应、可修正的数据链,帮助科研人员、学生、机构和管理者降低信息差。

截至 2026 年 6 月 30 日,平台当前开放范围包括 38 所 985 高校(不含国防科技大学)及西湖大学,共 39 所机构。不同来源采用不同的同步周期,具体记录以页面所示来源及平台同步结果为准。

一、平台收录什么

科学边界当前展示的不是机构全部论文,而是与撤稿或公开科研诚信讨论相关的论文记录。

一篇论文通常在满足以下条件之一时进入前台展示:

  1. 已被期刊、出版方、撤稿数据库或其他公开来源标记为撤稿;
  2. 在公开学术讨论平台存在具有实质内容的评论,并经 AI 分类识别出具体问题类型;
  3. 存在审核通过、与该论文直接相关的科学边界社区观察。

没有实质内容,或者只能被归为「其他问题」「未分类」的外部评论,不进入「未撤争议」展示和统计。作者是否回复,不影响一条具体质疑是否被计为公开争议。

没有 DOI 的论文目前不进入平台。作者回应属于已有争议记录的一部分,不单独使一篇论文进入统计。

平台区分「完全公开讨论」和「争议记录」。论坛、社交媒体等空间中的完全公开讨论通常缺少稳定审核、DOI 关联和后续维护,不会仅因被提及就自动进入统计。经过学术讨论平台或科学边界社区的内容规则处理,且能够具体指向论文问题的记录,才作为争议收录。

二、一篇论文在平台中如何被描述

科研诚信信息并不是一条从「讨论」必然走向「撤稿」的单向流程。科学边界从几个相互独立的维度描述同一篇论文:

维度主要状态或内容
出版状态当前主要包括已撤稿和未撤稿;后续将扩展编辑关注、期刊勘误、版本更新等状态
争议记录来自学术讨论平台或科学边界社区的具体质疑、观察、补充说明、作者回应和后续进展
关联关系论文与机构、作者、作者角色之间的公开关联
辅助分类从原始记录中提取的问题类型、作者因素、非作者因素和未知等结构化字段,用于筛选与统计,不新增原始来源中不存在的事实

同一篇论文可以同时存在具体质疑、社区观察、补充说明和作者回应,也可能在形成争议记录后被撤稿。这些内容都属于该论文争议记录的一部分,并共同保留在事件时间线上,但不会因此被重复计入「未撤争议」和「撤稿记录」

当前统计主要使用「已撤稿」和「未撤争议」两类状态。编辑关注、期刊勘误、版本更新等出版状态尚未在本期作为独立事件类型统计,后续上线时将同步更新本页口径和页面标签。

三、数据来源与字段级优先规则

平台主要使用以下公开来源:

  • OpenAlex:用于获取和补充 DOI、论文标题、发表时间、期刊、作者列表、机构署名、引用次数等文献元数据;
  • Crossref:用于补充 DOI 注册元数据,以及论文与撤稿通知、勘误、版本更新等出版记录之间的关联;
  • Retraction Watch 相关撤稿数据:用于发现和补充撤稿状态、撤稿时间、撤稿原因及来源;
  • PubPeer 等公开学术讨论平台:用于识别与具体论文相关的公开评论、评论时间、评论数量及作者回应;
  • 期刊、出版方和机构公开页面:用于核对论文信息、撤稿通知、正式说明、机构归属、作者任职状态等;
  • 用户勘误和社区共建内容:包括事实性纠错、社区观察和作者回应,分别进入数据修正或社区内容审核流程。

不同来源承担的功能不同,平台不使用一套全局顺序覆盖所有字段,而是按照字段性质确定优先级:

字段默认数据来源出现缺失、冲突或勘误时
DOI、标题、期刊、发表时间OpenAlex使用 Crossref、论文原文或出版方页面核对和修正
作者列表、署名顺序和作者角色OpenAlex使用 Crossref、论文原文或出版方标注核对;平台不遍历全部论文原文
论文机构署名OpenAlex 原始署名及规范机构信息使用论文原文、出版方页面和平台机构名称库核对
DOI 注册关系和出版记录关联Crossref使用出版方页面或正式通知核对
撤稿状态、撤稿时间和撤稿原因Retraction Watch 相关撤稿数据及其他结构化撤稿来源使用期刊、出版方或机构正式页面核对和修正
学术讨论内容原始学术讨论平台的同步结果根据源站更新、用户勘误或申诉修正
当前任职状态和二级单位机构及二级单位官网使用公开个人主页、简历和新闻资料补充
引用次数OpenAlex随后续同步更新,不进行人工固定

平台以结构化数据库完成大规模采集,不会逐篇遍历论文原文和出版方页面。只有在字段缺失、来源冲突、AI 无法确定或收到勘误时,才进一步查看原文或正式页面。AI 用于提取、关联和识别冲突,不在缺少公开依据的情况下生成新的事实

平台会在条件允许时保留来源链接、原始表述和同步时间,使读者能够回到原始页面核对。聚合来源用于发现和补充记录,不覆盖仍可访问的正式原始通告。

四、整体处理流程

flowchart TD
    A["公开数据源"] --> C["采集与标准化"]
    B["社区提交"] --> D["规则审核"]
    C --> E["证据与记录层"]
    D --> E
    E --> F["论文—机构—作者关联"]
    F --> G["状态与辅助分类"]
    G --> H["页面展示与统计"]
    H --> B

公开数据首先经过 DOI、论文元数据、机构名称、来源和时间等标准化处理。社区勘误、观察和作者回应经过相应审核后,进入数据修正流程或作为补充记录保存。

在此基础上,系统建立论文、机构和作者之间的关联,并对公开讨论的问题类型、撤稿因素等字段进行 AI 辅助分类,最终形成机构页、作者页、事件详情页和统计图表。后续勘误成立或原始来源发生变化时,相关关系、分类和统计会重新计算。

五、AI 在数据处理中的作用

科学边界使用 AI 辅助完成以下工作:

  • 机构中文名、英文名、历史名称和附属单位名称匹配;
  • 作者姓名解析、同名消歧和作者实体合并;
  • 撤稿论文与独立撤稿通知之间的 DOI 关联;
  • 公开评论的问题类型识别和无实质内容过滤;
  • 撤稿原因、作者因素和非作者因素辅助分类;
  • 公开记录的摘要生成。

外部学术讨论平台中的评论会先进入后台数据池。AI 能将评论归入具体问题类型时,该论文可进入「未撤争议」展示和统计;被归为「其他问题」或「未分类」的评论会被过滤。由于数据规模较大,这一过程不逐条进行人工复审。用户发现误分类或遗漏时,可以通过勘误流程反馈。

AI 生成的匹配、分类和摘要均为平台辅助处理结果,不是正式调查结论。页面中的 AI 摘要会明确标识,其作用是帮助快速理解,不替代原始来源。

随着数据源、出版状态和产品功能扩展,平台可能使用 AI 完成其他标准化、关系匹配、分类和一致性检查任务。如果新增处理会实质影响记录的收录、分类或统计,平台将同步更新本页口径,并继续提供勘误与修正入口。AI 的使用范围可以扩展,但不因此获得作出正式学术不端认定的权限。

六、论文事件与去重规则

1. 事件主键

平台以被讨论或被撤稿论文的 DOI 作为整理和去重的主要依据。同一篇论文在同一机构下通常只形成一条事件记录。

部分出版社会为撤稿通知单独分配 DOI。此时,平台将撤稿通知 DOI 作为来源记录关联到原论文,不把撤稿通知重复计算为另一篇撤稿论文。如果出版方只保留撤稿通知页面,平台会结合该通知和其他公开文献元数据保留一条撤稿事件。

2. 跨机构统计

一篇论文可以关联多个机构。在单个机构页面中,同一 DOI 只计算一次;在不同机构页面中则分别计算。

因此,同一 DOI 如果关联三个当前开放机构,会在首页「撤稿记录」或「争议记录」中计算三条。首页展示的是「机构—论文事件关联记录数」,不是全库去重后的唯一论文数量。

3. 撤稿与未撤争议

如果一篇论文存在公开争议但尚未撤稿,计入「未撤争议」。如果该论文后来被撤稿,则转入「撤稿记录」,不再重复计入「未撤争议」,但此前的公开讨论和作者回应仍保留在事件时间线上。

社区观察是公开争议的来源之一,不是与「撤稿」「未撤争议」并列的独立事件类型。作者回应属于争议记录的一部分,也不单独增加事件数量。

七、公开争议的收录口径

1. 外部公开讨论

一条来自外部学术讨论平台的评论,需要同时满足以下条件,才进入「未撤争议」统计:

  • 能够关联到具体 DOI;
  • 评论包含与论文直接相关的实质内容;
  • AI 能够将其归入平台问题类型体系中的至少一个具体类型。

作者是否回复不影响收录。平台未来可能增加「已回应」「已澄清」等状态,以补充展示争议后续进展;在相关功能上线前,作者回应作为争议记录的一部分展示在事件时间线中。

2. 社区观察

社区观察允许用户首发与特定论文直接相关的文字、图片和其他观察材料,不要求相关内容已经在其他平台公开。图片和截图可以作为观察内容本身提交。

除作者回应外,社区观察和补充说明的提交者可以选择前台匿名。选择匿名后,事件页面不显示提交者的用户信息,但不影响平台进行内容审核、处理申诉和记录贡献。

社区观察首先由 AI Agent 审核以下发布条件:

  • 是否与目标论文直接相关;
  • 是否具有实质内容;
  • 是否包含人身攻击、无关个人评价或骚扰性表达;
  • 是否侵犯个人隐私;
  • 是否包含违法内容或其他不适合公开展示的信息。

AI Agent 无法决定时,转交人工复审。平台审核的是内容能否按照社区规则公开,不负责复现实验、验证数据或裁决观察本身的科学合理性。审核通过只表示内容符合发布规则,不代表平台认可其科学结论。

审核通过且能够归入具体问题类型的社区观察,与外部公开讨论采用相同的「未撤争议」统计逻辑;页面会明确标注其来源为科学边界社区观察。社区观察不会自动修改撤稿状态、作者任职状态、机构归属等核心事实字段。

被涉及作者和其他用户可以提交回应、申诉或勘误。勘误成立后,相关内容会被修正或撤回,对应的机构、作者和首页统计自动回退。

作者回应须实名提交。系统会通过注册邮箱与论文公开作者邮箱、通讯邮箱等信息进行辅助比对。身份核验用于确认回应者与论文之间的关系,不代表平台认可回应内容中的科学主张。

八、机构归属与作者消歧

1. 机构归属

论文是否归入某个机构,主要依据论文发表时作者列表中的机构署名。系统会综合识别:

  • 机构中文名和英文名;
  • 常见英文变体和缩写;
  • 历史名称;
  • 附属医院、学院、研究院等公开署名形式;
  • 作者原始署名中的院系、科室、实验室等单位表达。

如果一篇论文同时存在多个机构署名,它可以出现在多个机构页面中。这表示论文与这些机构存在公开署名关联,不代表平台对机构责任作出判断。

论文发表时的机构署名与作者当前任职状态是两个不同字段。作者后来入职、离职或退休,不会反向改变论文发表时的机构关联。机构归属来自公开数据匹配,不等同于机构官方认定。

2. 作者实体与同名消歧

平台不会简单地把所有同名署名视为同一个人。作者消歧会综合参考:

  • 作者姓名及中英文变体;
  • ORCID;
  • 原始机构署名;
  • 院系、科室和公开研究方向;
  • 同一作者在多篇论文中的署名模式;
  • 共同作者关系;
  • 已有作者实体记录;
  • AI 辅助判断结果。

中文姓名重名、英文拼写变化、作者更换机构和原始元数据缺失都可能影响消歧准确性。误合并或误拆分经勘误修正后,作者页面及历史统计会重新计算。

3. 作者角色

平台尽量保留第一作者、通讯作者、署名位置和对应机构署名等信息。共同一作、共同通讯等角色以论文原文或出版方标注为优先来源。不同期刊和数据库的标注方式并不一致,相关角色可能存在遗漏。

作者角色用于说明公开署名关系,不是责任分配。论文被归为「作者因素」,也不代表每一位共同作者均负有相同责任。

九、撤稿因素与问题类型

1. 作者因素

「作者因素撤稿」通常指撤稿原因涉及研究设计、数据、图像、统计、伦理、署名、利益冲突、原创性、同行评审、投稿材料,或者属于作者理论上能够在投稿、核对及校样阶段发现的问题。

这一分类关注问题与作者侧研究、投稿及审核责任之间的关系,不区分故意、过失或诚实错误,也不等同于造假或学术不端认定。

2. 非作者因素

「非作者因素撤稿」通常指公开材料明确表明,撤稿原因完全发生在作者理论上可以接触、核对和审核的流程之外,主要由出版方、编辑系统或其他外部主体造成。

3. 未知

如果公开信息不足以判断问题来源,或者不同来源之间存在无法消除的冲突,平台会保守归为「未知」。

作者因素、非作者因素和未知均属于论文事件层面的辅助分类,不代表平台将责任归于某一位或全部署名作者。

4. 问题类型

平台会从撤稿材料、公开评论和社区观察中提取一个或多个问题类型,常见类型包括:

  • 图像结果问题;
  • 数据可靠性问题;
  • 统计方法问题;
  • 研究伦理问题;
  • 署名或利益冲突问题;
  • 同行评审问题;
  • 抄袭、重复发表或其他原创性问题;
  • 论文工厂相关问题;
  • 出版与流程问题;
  • 其他问题或未分类。

问题类型用于帮助读者理解公开记录主要指向什么,不构成对行为性质、主观意图或个人责任的最终认定。

对于已撤稿论文,即使问题类型为「其他」或「未知」,仍按撤稿记录收录;对于尚未撤稿的外部公开讨论,只有能够归入具体问题类型的记录才进入「未撤争议」统计。

十、时间口径

不同记录分别使用以下时间:

  • 论文发表时间:优先采用完整发表日期;缺少完整日期时展示发表年份;
  • 撤稿时间:优先采用正式撤稿通知记录的日期,并按实际可获得的年月日精度展示;
  • 公开争议时间:采用最早一条符合收录条件的外部公开评论或社区观察时间;
  • 作者回应时间:采用对应回应实际公开或提交审核通过后的时间。

论文发表时间不会代替缺失的撤稿时间或争议时间。事件时间无法确定时,页面显示未知,相关记录不以论文发表年份冒充事件年份。

十一、首页与机构页统计口径

1. 首页数据概览

字段统计口径
收录机构当前已经开放展示并进入平台索引的机构数量
撤稿记录当前开放机构范围内「机构—撤稿论文」的关联记录数;同一 DOI 关联多个机构时按机构分别计算
争议记录当前开放机构范围内「机构—未撤争议论文」的关联记录数;同一 DOI 关联多个机构时按机构分别计算
涉及人员各机构内部去重后的相关作者实体数之和;同一作者关联多个机构时按机构分别计为多个人次

同一作者在同一机构关联五篇论文,「涉及人员」只计算一次;同一作者关联两个机构,则在首页计算两个人次。作者消歧结果改变后,历史人数统计也可能发生变化。

2. 机构页

字段统计口径
撤稿事件该机构关联论文中已撤稿的 DOI 级事件数,同一 DOI 在该机构内只计算一次
未撤争议事件该机构关联论文中尚未撤稿、但存在符合收录条件的公开讨论或社区观察的事件数
总事件现阶段等于撤稿事件与未撤争议事件之和
涉及作者数该机构下与相关事件存在作者—论文关联的作者实体数,机构内部去重
作者因素撤稿该机构下被辅助归为作者因素的撤稿事件数
涉及在职作者依据最近公开资料被辅助判断为在职的相关作者实体数

机构页的主要统计图表围绕「作者因素撤稿+未撤争议」展开,默认排除非作者因素撤稿,避免将明确发生在作者可接触和审核范围之外的事件混入这一观察维度。图表包括年度趋势、问题类型、作者角色和引用次数等维度,具体以页面实际展示为准。

各机构采用统一的收录、分类和统计规则,可以比较撤稿数量、未撤争议数量、问题类型、作者角色和时间趋势等具体维度。平台展示的是公开记录的结构化比较,不把任何单项指标自动转换为机构或个人的学术诚信结论。

平台未来可能增加关注声明、正式调查、更正或其他科研诚信相关事件。相关类别正式纳入统计前,将同步更新本页定义、页面标签和总事件公式。

十二、作者页与事件详情页口径

1. 作者页

作者页展示的是平台内部某个作者实体及其与当前机构、论文事件之间的公开关联,主要包括:

  • 姓名、英文名和姓名变体;
  • 当前任职状态及可识别的院系、科室;
  • 关联撤稿记录和未撤争议记录;
  • 第一作者、通讯作者和其他署名角色;
  • 相关论文列表及 AI 辅助摘要。

作者出现在某篇论文的事件页面,只表示其存在公开署名或机构关联。撤稿、争议、作者因素分类和作者角色均不能单独证明该作者存在学术不端或应承担特定责任。

2. 事件详情页

事件详情页以单篇论文为中心,展示论文元数据、来源链接、撤稿或公开讨论时间线、问题类型、撤稿因素、作者列表、社区观察和作者回应。

「作者是否回应」只表示目前争议记录中存在相关回应。回应属于争议的一部分,但不会自动确认、推翻或删除原始撤稿及质疑记录。后续如果上线「已回应」「已澄清」等状态,平台会同步更新相应口径。

3. 任职状态

任职状态分为在职、离职、退休和未知,主要依据机构官网、二级单位页面、作者主页、公开简历和新闻资料,由 AI 辅助提取和更新。该字段用于理解事件与机构之间的时间和关系背景,不构成劳动关系、聘用关系或官方身份认定。

十三、搜索口径

作者搜索以平台内部作者实体为单位,综合匹配规范名、中文名、英文名、姓名变体、ORCID、机构署名和二级单位等字段。搜索结果中的撤稿数和未撤争议数,来自作者实体与论文事件之间的关联统计。

论文搜索以 DOI 和论文事件为基础,匹配 DOI、标题及相关公开元数据。选择机构后,搜索范围限定在该机构当前已开放的数据中;「仅在职」「仅一作/通讯」等筛选只改变结果范围,不改变事件本身的统计定义。

十四、数据更新、删除与勘误

不同数据源的更新频率不同。页面上的更新时间表示平台最近一次同步、生成或发布的时间,不代表所有原始来源已经同步到同一时点。

外部学术讨论平台上的内容被修改或删除后,科学边界可能因同步周期继续展示一段时间,延迟可能超过一个月。完成后续同步后,相关记录和统计会相应更新。用户也可以通过勘误流程提前反馈。

涉及 DOI 关联、撤稿状态、事件分类、机构归属、作者消歧、任职状态和统计结果等事实性错误,可以通过作者页或事件详情页提交勘误。勘误成立后,相关数据会被修正,受影响的机构、作者和首页统计自动重新计算。

数据变化可能来自原始来源更新、同步任务、AI 分类调整、作者消歧修正或用户勘误,因此同一页面的历史数字可能随数据完善而变化。

十五、重要声明

科学边界展示的撤稿、公开争议、社区观察、作者回应、任职状态和 AI 辅助分类,仅供科研诚信研究、信息核验、人才工作和公共讨论参考。

撤稿不等于定罪,质疑不等于定罪,作者因素不等于故意造假,回应也不自动推翻原始记录。

平台不作出学术不端认定、法律责任判断或官方任职证明,也不替代机构、期刊、出版方和主管部门的正式调查结论。

阅读任何记录时,都应同时查看原始来源、正式通告、事件时间线和后续回应。科学边界会持续同步和修正数据,也欢迎科研共同体成员通过勘误、社区观察和作者回应共同补全公开记录。