学术研究中的网页抓取:伦理、来源、可重复性
一个审稿人无法重现的抓取数据集是负担,而非贡献。以下是如何收集网页数据以用于研究,确保其通过伦理审查委员会、同行评审,并在平台更改API时仍然有效。
学术研究中的网页抓取与商业抓取有不同的标准。零售商抓取竞争对手价格需要今天的数据准确无误;而研究人员需要数据在多年后仍然具有可辩护性——可以被审稿人重现,通过伦理委员会审查,并可追溯到来源。由于平台开始关闭曾经使这一过程变得简单的渠道,越来越多的研究人员直接进行抓取,并以悄悄破坏自己研究的方式进行。本指南涵盖了收集网页数据以用于研究的方法,确保其通过伦理审查委员会、同行评审,并在网站更改时仍然有效。这是实用指导,而非法律建议。
为什么研究人员再次进行抓取
多年来,官方API是礼貌的前门。这个门已经变窄。当Twitter/X在2023年结束免费学术访问时,替代方案的价格从每月约100美元的基本计划(约10,000条帖子)到每月数万美元的企业访问——远远超出大多数研究预算。Meta在2024年8月关闭了CrowdTangle,几个月后美国即将举行一场重要选举,研究人员希望对此进行研究。2024年arXiv的论文《研究中的网页抓取:法律、伦理、机构和科学考量》(Brown等)直接描绘了这一转变:当API消失或价格过高时,谨慎的抓取成为可重复研究的最后手段。它定义的方法——传统的HTML解析、从未公开的内部API收集和浏览器插件收集——各自具有不同的法律和伦理权重。
伦理和伦理审查委员会在第一次请求之前
如果您的数据涉及人,请将抓取视为人类受试者研究,直到您的伦理委员会另有说明。许多机构要求在收集之前进行伦理审查委员会咨询和数据管理计划,而不是之后——“它是公开的”并不是一个通用的豁免。实用规则:尽量减少个人数据,不收集您不会分析的数据,安全存储,并记录谁可能被识别以及您将如何保护他们。公共可见性决定您能否获取数据,而不是您是否应该收集和保留数据。我们关于GDPR和抓取的个人数据的说明涵盖了涉及欧盟居民时的隐私法律方面。

礼貌是一种方法,而不是礼节
一个抓取器在运行过程中被速率限制或阻止会产生一个偏差的、不可重复的样本——这是研究中最糟糕的结果。因此,礼貌是一种方法学要求。遵守robots.txt(1994年创建的惯例,并已标准化为IETF RFC 9309),在非高峰时段抓取,积极缓存以确保您不会重复获取同一页面,并保持足够低的并发性以免降低网站性能。稳定、分布良好的请求也能保持您的样本一致性:如果有些页面被阻止而其他页面没有,您的数据集中就会有一个无法解释的漏洞。我们的礼貌抓取指南详细介绍了自适应节奏。
专门针对学术来源——Google Scholar、引用次数、结构化搜索结果——使用带有学者垂直的SERP API返回干净、解析的结果,而无需您维护一个脆弱的抓取器对抗反机器人墙。这保持了您的收集可重复性:相同的查询每次返回相同的结构化形状。
来源和可重复性是可交付成果
将一个可引用的数据集与轶事区分开来的单一习惯:在任何解析之前存档原始响应并加上时间戳。网站会发生变化;您在三月抓取的页面可能在六月消失,而无法看到您所看到的审稿人无法验证您的结果。保留原始HTML或JSON,记录确切的查询参数和工具版本,并发布一个简短的数据集卡,描述数据的收集方式、时间和来源。然后记录出口位置,因为地理位置会改变结果——价格、排名和可用性因国家而异,所以“通过美国住宅出口在2026-03-01收集”是方法的一部分,而不是细节。一个返回markdown或JSON并带有源URL和内容哈希的Scraper API为您免费提供了这种来源追踪。
如果您的研究为模型提供数据而不是论文表格,同样的纪律也适用于训练数据——请参阅我们的从网络构建机器学习数据集指南,了解采样、去重和许可。
研究人员经常忘记的一个来源细节:记录收集失败,而不仅仅是成功。如果您的样本的一部分返回错误、被速率限制或被阻止,那是一个偏差来源,审稿人会理所当然地询问——唯一诚实的答案是一个日志,显示哪些URL失败了、何时失败以及为什么失败。保留一个清单,将每个预期目标与其结果配对,这样您的报告样本大小就是真实的,任何差距都被记录而不是悄悄丢弃。可重复性不仅仅是“有人能重跑这个吗?”——而是“数据集是否代表方法声称的内容?”,而失败日志是您证明它确实如此的方法。
法律框架,简要说明
研究中的抓取涉及多个法律领域:合同(网站的条款)、计算机访问法规如CFAA、动产侵权索赔、版权和隐私/数据保护法。几乎没有定案的案例法,而hiQ诉LinkedIn——为数不多的上诉判决之一——确立了公共数据在CFAA下不是“未经授权的访问”,但合同和隐私问题仍未解决。研究人员的安全姿态:收集公共数据,尊重条款和robots,尽量减少个人数据,并获得机构批准。再次强调,这只是一般信息,而非法律建议——请与您的机构法律顾问和伦理委员会沟通。

常见问题解答
学术研究中的网页抓取合法吗?
在许多司法管辖区,为研究抓取公共网页数据通常是合法的,而hiQ诉LinkedIn认为公共数据在CFAA下不是“未经授权的访问”。但合同条款、版权和隐私法仍然适用,案例法很少。收集公共数据,尊重网站条款和robots,尽量减少个人数据,并通过您的伦理委员会。这是一般信息,而非法律建议。
我需要伦理审查委员会批准才能抓取数据吗?
如果您的数据涉及人,很可能是的——许多机构要求在收集开始之前进行伦理审查委员会或伦理咨询和数据管理计划。公共可用性并不自动豁免人类受试者研究。尽早咨询您的委员会;这比在研究中途发现您的数据集无法使用或发布要便宜得多。
我如何使抓取的数据可重复?
在解析之前存档原始响应并加上时间戳,记录确切的查询、工具版本和出口位置,并发布一个描述收集方法的数据集卡。因为网站会发生变化,原始存档是让审稿人以后验证您的数据的依据。可重复性是收集时的选择,而不是您可以稍后添加的东西。
我应该使用API还是直接抓取?
当API的覆盖范围和成本合适时,使用官方API——这是最稳定、可重复的来源。许多与研究相关的API已经关闭或价格过高,这就是为什么谨慎的抓取又回来了。商业Scraper或SERP API介于两者之间:可重复的结构化输出,无需维护脆弱的抓取器,并且具有您可以引用的来源字段。
研究级抓取不是关于聪明的选择器;而是关于纪律。首先明确伦理,礼貌地收集以保持样本完整,存档带有时间戳和出口地理位置的原始数据,并记录来源,以便其他人可以重建它。做到这一点,您的数据集就会成为审稿人可以信任的贡献——而不是他们必须凭信任接受的黑箱。