Agent Skills
返回列表
论文数据造假检测器

论文数据造假检测器

行业专业 更新于 2026.08.30

将以下提示词粘贴到你的 AI 对话框中:

请根据 https://skillhub.cn/install/skillhub.md,安装 @user_a95aac1d/research-fakedata。

技能介绍

要解决的问题

审计一篇论文时,人工很难只靠肉眼判断表格里的数值是否被复制、缩放或公式化生成。这个技能面向含数值表格的学术论文 PDF,目标不是判断作者动机,也不是给出造假结论,而是从统计规律中找出可量化的红旗:末位数字是否偏好、两列差值是否恒常、单列是否完美等差、跨表数值是否复用等。

工作方式

  • 输入:用户提供的 PDF 绝对路径;当前版本不支持 Excel/CSV。
  • 提取:从 PDF 中抽取数值表格,并尽量从元数据提取 PMID;无 PMID 时使用时间戳命名。
  • 检测:运行 9 种内置统计检测器,包括末位卡方、固定差值、固定倍数、等差/等比、小数位重复、取整异常、本福特、重复列和跨表相同。
  • 输出:生成独立 HTML 报告,例如 outputs/check_<PMID>.html,风险等级从“未发现异常”到“高风险”分级,risk_score >= 80 表示需要人工核实原始数据。

边界与注意点

它只做数据法医,不做判官。纯文字或图片为主的论文可能显示“证据不足”,不能视为通过检测。GRIM 依赖样本量提取,当前推迟到 v2.0;评分高也只说明统计层异常,需要结合实验记录和原始数据复查。

使用场景

  • 编辑部收到投稿后,先检测论文附表是否出现复制列、固定差值或跨表复用等统计红旗。
  • 科研团队内部审核预印本时,用 PDF 数值表格做数据层筛查,生成 HTML 报告供复核。
  • 出版社生产编辑在定稿前,对多份研究 PDF 的表格做异常风险分级,标记需人工核实的条目。
  • 数据核查员复核单篇论文附表,确认末位分布、等差序列和重复列是否触发高风险。

适合人员

  • 学术期刊编辑:需要在审稿或生产前快速标记论文表格里的统计异常红旗。
  • 科研项目负责人:需要在内部预发表核查时筛查附表是否被公式化生成或复制。
  • 出版审校:需要在定稿阶段核对研究表格风险等级,并形成可复核的 HTML 报告。
  • 数据核查专员:需要按末位卡方、固定差值、重复列等指标定位可疑表格。