Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生运行 Jina 模型。
MCP
terminal
命令行
article
llms.txt
smart_toy
智能体
data_object
Schema
menu_book
文档
登录
login
AI 抓取的危害
抓取到底合法吗?
用抓取的数据训练 AI 合法吗?
贪婪抓取对 AI 意味着什么
AI 生成的数据能否拯救?
模型崩溃及如何避免
如果只有大公司能负担得起数据抓取会怎样?
结论
观点
八月 14, 2024

AI 在网上大肆收集数据,正在毒害自己

当网络数据已被采集殆尽,内容提供商都已关闭大门,几乎没有新数据可供抓取时,这对 LLM 来说意味着什么?
Illustration of a cartoonish robot vacuum cleaner with big eyes and an open mouth, humorously sticking out a tongue to clean,
Alex C-G, Scott Martens • 17 分钟阅读

最近有很多关于 AI 公司在未获"许可"的情况下抓取互联网上所有数据的危害的讨论。我们稍后会讨论"许可"这个问题 - 我们用引号括起这个词是有原因的。但是当开放网络被挖掘殆尽、内容提供商都关上了大门、几乎没有新数据可以抓取时,这对 LLM 意味着什么?

tagAI 抓取的危害

AI 公司把互联网当作随意取用的数据自助餐,完全不顾及餐桌礼仪。看看 Runway 违反 YouTube 服务条款抓取视频来训练模型,Anthropic 每天对 iFixit 发起一百万次请求以及纽约时报因版权作品使用问题起诉 OpenAI 和微软。

试图在 robots.txt 或服务条款中阻止爬虫其实毫无作用。不在意规则的爬虫会继续抓取,而更谨慎的爬虫反而会被阻止。对爬虫来说根本没有遵守规则的动力。我们可以从 Data Provenance Initiative 最近的一篇论文中看到这一点:

Data Provenance Initiative
审计用于训练 AI 模型的数据

这不仅仅是个抽象问题 - iFixit 损失了资金并耗费了 DevOps 资源。ReadTheDocs 仅在一个月内就因为恶意爬虫产生了超过 5000 美元的带宽费用,单日流量达到近 10 TB。如果你运营一个网站,遇到不遵守规则的爬虫?这可能意味着关门大吉。

那么,网站该怎么办?如果 AI 公司不遵守规则,就会导致付费墙增多,免费内容减少。免费的网络已经一去不复返了。剩下的就只有付费访问了。

tag抓取到底合法吗?

💡
我们不是律师,不能提供法律建议。以下内容仅是对现有法律的概述,仅供参考。

抓取有问题吗?是的。它合法吗?也是的。网络抓取在美国、欧盟、日本、韩国和加拿大都是合法的。似乎没有任何国家有专门针对这种做法的法律,但世界各地的法院普遍认为,使用自动化方式访问任何人都可以看到的网站,并制作其内容的私人副本是合法的。

有些人认为通过在网页上或 robots.txt 文件中放置一些书面声明,就可以禁止抓取或其他合法使用网站及其内容的行为。这实际上并不管用。这样的声明没有法律意义,而 robots.txt 只是一个 IETF 约定,没有法律效力。如果没有某种确认行为,至少要点击标有"我接受服务条款"的按钮,你就不能对网站访问者施加条件,即使这样做了,这些条件通常也无法在法律上执行。

Your Website Terms of Service are Unenforceable | Insights | Venable LLP
Venable LLPJoshua J. Kaufman

然而,虽然抓取是合法的,但也有一些限制:

  • 可能降低他人网站可用性的做法,比如爬虫访问频率过高或过快,在极端情况下可能会带来民事甚至刑事后果。
  • 许多国家都有法律将未经授权访问计算机的行为定为犯罪。如果网站的某些部分显然不是面向公众开放的,抓取这些内容可能是违法的。
  • 许多国家都有法律规定,规避反复制技术是违法的。如果网站采取了防止下载某些内容的措施,你强行抓取可能会违法。
  • 有明确服务条款且要求你确认接受的网站可以禁止抓取,如果你这样做,他们可以起诉你,但结果不一定。

在美国,没有明确的抓取相关法律,但试图用 1986 年的计算机欺诈和滥用法案来禁止它的努力都失败了,最近的例子是 2019 年第九巡回法院的hiQ Labs 诉 LinkedIn 案。美国法律很复杂,有许多法院制定的区分标准和州及联邦巡回法院的管辖体系,这意味着除非最高法院做出裁决,否则不一定是最终结论。(有时即使有最高法院裁决也不是最终的。)

欧盟也没有专门针对抓取的法律,但这一直是一种常见且未受质疑的做法。2019 年欧盟版权指令中的文本和数据挖掘条款强烈暗示抓取通常是合法的。

最大的法律问题不在于抓取行为本身,而在于抓取之后的操作。你从网上抓取的数据仍然受版权保护。你可以保留个人副本,但如果没有相关许可,再分发或转售可能会带来法律问题。

大规模的网络抓取几乎总是意味着复制各种数据保护和隐私法律中定义的"个人数据"。欧洲 GDPR(通用数据保护条例)将"个人数据"定义为:

与已识别或可识别的自然人("数据主体")有关的任何信息;可识别的自然人是指可以直接或间接地被识别的人,特别是通过参考诸如姓名、身份证号码、位置数据、在线标识符,或者该自然人的一个或多个特定的身体、生理、遗传、心理、经济、文化或社会身份因素来识别的人;

[GDPR,第 4.1 条]

如果你拥有任何居住在欧盟或在欧盟境内活动的人的个人数据,你就要承担 GDPR 下的法律责任。它的范围如此广泛,以至于你应该假设这适用于任何大型数据收集。无论是你收集的数据还是别人收集的,只要你现在拥有它,你就要对它负责。如果你不履行 GDPR 义务,无论你住在哪个国家或数据存储、处理在哪里,欧盟都可以对你进行处罚。

加拿大的 PIPEDA(个人信息保护和电子文件法案)与 GDPR 类似。日本的 APPI(个人信息保护法)也涵盖了许多相同的领域。英国在离开欧盟时将 GDPR 的大部分内容纳入其国内法律,除非后来修改,这些规定仍然有效。

美国在联邦层面没有类似的数据保护法,但 CCPA(加州消费者隐私法)有类似于 GDPR 的条款,如果你有加利福尼亚州居民或活动的相关数据,就必须遵守。

大多数发达国家都有数据保护法律,至少在某些方面限制你如何使用从网络上收集的海量数据。世界各地大多数涉及抓取的法律诉讼都是关于数据如何使用,而不是如何收集。

因此,网络抓取几乎总是合法的。复杂的是之后的操作。

tag用抓取的数据训练 AI 合法吗?

可能是合法的。

在几乎所有现实情况下,网络抓取都会包含版权内容。真正的问题是:未经所有者许可,你能否使用版权内容来训练 AI?

有许多单独的法律问题尚未完全解决,但是:

  • 在欧洲,2019 年欧盟版权指令第 4 条似乎已经使其合法化,但有一些限制条件。
  • 在日本,2018 年修订的版权法第 30(4) 条被解释为允许在未经许可的情况下使用受版权保护的作品来训练 AI。
  • 在美国,没有法律明确规定这种情况,但多年来人们一直认为对受版权保护材料进行统计分析是合法的,即使其结果是商业产品。尽管 作者协会诉谷歌公司和作者协会诉 HathiTrust 这两个诉讼并未特别针对 AI,但它们大大扩展了美国法律下"合理使用"的范围,很难看出 AI 训练如何会成为非法。美国法律系统并没有给出明确的答案,目前有几个测试这一结论的案例正在法院审理中。

一些较小的司法管辖区也已确定这是合法的,据我所知,迄今为止还没有任何地方认定这是非法的。

欧洲版权法允许受版权保护数据的所有者通过"适当方式"表明来限制其作品用于 AI 训练。目前尚无关于他们应如何做到这一点的指导。

日本版权法限制使用可能"不合理地损害版权所有者利益"的受版权保护材料。这通常表明,版权持有人必须证明特定的 AI 模型如何降低了其作品的经济价值才能提出诉讼。

我们应该注意到,Google、Microsoft、OpenAI、Adobe 和 Shutterstock 都承诺为在版权问题上面临法律挑战的生成式 AI 产品用户提供赔偿保护。这有力地表明他们的律师认为他们所做的事情在美国法律下是合法的。

tag贪婪抓取对 AI 意味着什么

AI 抓取狂潮正在将网络变成数字狂野西部。这些爬虫将 robots.txt 视如无物,用无休止的请求冲击像 iFixit 这样的网站。这不仅令人烦恼 - 它还可能破坏网络,迫使我们重新思考开放互联网如何运作。或者说在不久的将来它可能如何无法运作。仅从经济和社会角度来看,就有许多可能发生变化的事情:

信任崩溃:这场 AI 抓取风潮可能导致网络上的大规模信任崩溃。想象一个未来,每个网站都用怀疑的眼光迎接你,在你甚至还没看内容之前就强迫你证明你是人类。我们说的是更多的验证码、更多的登录墙、更多的"点击所有交通信号灯"测试。这就像试图进入一个地下酒吧,但不是需要一个秘密密码,而是需要说服门卫你不是一个非常聪明的机器。

人工生成内容的限制:内容创作者已经对自己的作品被盗用感到警惕,开始严防死守。我们可能会看到付费墙、仅订阅者可见区域和内容锁定的激增。自由浏览和学习的日子可能成为一段怀旧的记忆,就像拨号调制解调器的声音或 AIM 离开消息一样。如果普通人都无法访问,那就更难让流氓爬虫进入了。

法律案件:可能需要数年甚至数十年才能解决所有与 AI 相关的法律问题。我们已经有了互联网三十年,但其中一些法律问题至今仍悬而未决。无论你是对是错,如果你负担不起在法庭上花费数年时间来弄清楚什么是允许的,什么是不允许的,你就有理由担心。

小鱼破产,大鱼更肥:这种抓取狂潮不仅仅是一种烦恼 - 它给网络基础设施带来了真正的压力。处理 AI 导致的流量堵塞的网站可能需要升级到更强大的服务器,这并不便宜。较小的网站和有趣的个人项目可能会因为成本而被淘汰,留给我们的是一个由那些足够强大以度过风暴或与 AI 公司签订许可协议的大公司主导的网络(和 LLM 训练数据)。这是一个"适者生存"的场景,可能会使互联网(和 LLM 知识)变得不那么多样化和有趣。通过关闭免费获取数据的大门,他们可以向 AI 公司收取入场费,或者仅仅向出价最高的竞标者授权。没有钱?保安会请你离开。

tagAI 生成的数据能否拯救?

这场数据抓取不仅动摇了网站 - 它还为潜在的 AI 知识匮乏铺平了道路。随着开放网络收起它的吊桥,AI 模型将发现自己渴望新鲜、高质量的数据。

这种数据稀缺可能导致 AI 出现严重的视野局限。如果没有持续的新信息流入,AI 模型可能会变成过时知识的回声室。想象一下问 AI 当前事件,却得到听起来像是去年的答案 - 或者更糟,来自事实度假的平行宇宙。

如果人工生成的数据被锁起来,公司仍然需要从某个地方获取他们的训练数据。一个例子是合成数据:由 LLM 创建用来训练其他 LLM 的数据。这包括广泛使用的技术,如模型蒸馏和生成训练数据来补偿偏差。

当 AI 制造 AI:合成数据、模型蒸馏和模型崩溃
AI 创造 AI!这是世界末日吗?还是仅仅是另一个让模型做增值工作的工具?让我们一探究竟!

使用合成数据意味着不必绕过许可人工生成数据的重重障碍,正如我们所见,这变得越来越困难。它还有助于平衡事物 - 互联网上的大量数据并不能代表现实世界的多样性。生成合成数据可以帮助使模型更能代表现实(有时也可能不是)。最后,对于健康和法律用例,合成数据消除了清理数据以删除个人身份信息的需求。

然而,另一方面是,未来的模型也将被你真的不希望用来训练它们的 AI 生成数据所训练,即"劣质内容":低质量的 AI 生成数据,比如一个曾经备受喜爱的科技博客现在用其前员工的名字发布低价值的 AI 生成文章,AI 生成的不太可能的菜谱,如慢炖锅莫吉托和香肠冰淇淋,或者占据 Facebook 的虾子耶稣。

由于这比创作传统的手工内容更便宜和容易,它正在迅速充斥互联网。

根据我们今天看到的情况,AI 生成的内容正在超过可用的人工生成内容。GPT-5 将(部分)用 GPT-4 创建的数据进行训练。同样,GPT-6 将使用 GPT-5 创建的数据进行训练。如此循环往复。

tag模型崩溃及如何避免

将自己的输出用作输入对人类和 LLM 都是有害的。即使你对使用多少合成数据以及使用什么类型的合成数据非常谨慎,你也不能保证你的模型不会变得更糟。

对于生成式 AI 模型整体而言,输出质量和多样性的下降是可以通过实验测量的,而且发生得相当快。图像生成模型在几代之后就会出现异常,而在一篇论文中,一个在维基百科数据上训练的大型语言模型,原本能对提示给出连贯准确的回应,到了第九代用自己的输出训练时,就开始不断重复"tailed jackrabbits"这几个词作为回应。

在递归生成的数据上训练的 AI 模型会崩溃 - Nature
 分析表明,不加选择地对真实内容和生成内容进行人工智能训练(通常通过从互联网抓取数据完成),可能导致模型生成多样化高质量输出的能力崩溃。
NatureIlia Shumailov

这很容易解释:AI 模型是其训练数据的近似。在 AI 模型输出上训练的 AI 模型是近似的近似。在每个训练周期中,近似值与"真实"现实世界数据之间的差异越来越大。

我们称之为"模型崩溃"。

随着 AI 生成的数据变得越来越普遍,从互联网抓取数据训练新模型可能会降低模型性能。我们有理由相信,只要真实的、人类制作的数据量不下降,我们的模型就不会变得更差,但也不会变得更好。然而,如果我们无法将 AI 制作的数据与人类制作的数据分开,训练时间会变得更长。制作新模型的成本会更高,但却没有改进。

模型崩溃是否不可避免?通过积累真实和合成数据打破递归诅咒
生成模型的激增,加上网络规模数据的预训练,提出了一个及时的问题:当这些模型在自己生成的输出上训练时会发生什么?最近对模型-数据反馈循环的研究提出,这样的循环会导致一种称为模型崩溃的现象,在这种现象下,性能会随着每次模型-数据反馈迭代而逐渐降低,直到拟合的模型变得毫无用处。然而,这些研究在很大程度上假设新数据会随时间取代旧数据,而一个可能更现实的假设是数据会随时间积累。在本文中,我们提出问题:数据积累对模型崩溃有什么影响?我们通过在文本语料库上预训练语言模型序列来实证研究这个问题。我们证实,用每一代的合成数据替换原始真实数据确实倾向于模型崩溃,然后证明在原始真实数据的基础上积累连续几代的合成数据可以避免模型崩溃;这些结果在不同的模型大小、架构和超参数中都成立。我们在其他类型的真实数据的深度生成模型中也获得了类似的结果:用于分子构象生成的扩散模型和用于图像生成的变分自编码器。为了理解为什么积累数据可以避免模型崩溃,我们使用了先前工作引入的分析可处理框架,其中一系列线性模型被拟合到先前模型的输出。先前的工作使用这个框架表明,如果数据被替换,测试误差会随着模型拟合迭代次数的增加而增加;我们扩展这个论证以证明,如果数据反而积累,测试误差有一个与迭代次数无关的有限上界,这意味着模型崩溃不再发生。
arXiv.orgMatthias Gerstgrasser

这里的讽刺意味很浓。AI 对数据的贪婪胃口可能导致数据饥荒。模型自噬症就像 AI 的疯牛病:就像用牛肉废料喂养牛导致了一种新的寄生性脑部疾病,用越来越多的 AI 输出训练 AI 会导致毁灭性的精神病理。

自我消耗的生成模型陷入疯狂
图像、文本和其他数据类型的生成式 AI 算法的突破性进展导致了使用合成数据训练下一代模型的诱惑。重复这个过程会创建一个特性尚未完全理解的自噬(自我消耗)循环。我们使用最先进的生成图像模型对三类自噬循环进行了全面的分析和实证研究,这些循环在固定或新鲜的真实训练数据在训练世代中的可用性,以及前代模型的样本是否被偏向以权衡数据质量和多样性方面有所不同。我们在所有场景下的主要结论是,如果在自噬循环的每一代中没有足够的新鲜真实数据,未来生成模型的质量(精确度)或多样性(召回率)必将逐渐降低。我们将这种状况称为模型自噬症(MAD),类比疯牛病。
arXiv.orgSina Alemohammad

好消息是 AI 无法取代人类,因为它需要我们的数据。坏消息是它可能会通过破坏自己的数据源来阻碍自身的成长。

为了避免这种可预见的 AI 知识饥荒,我们需要重新思考如何训练和使用 AI 模型。我们已经看到了像检索增强生成这样的解决方案,它试图避免使用 AI 模型作为事实信息的来源,而是将它们视为评估和重组外部信息源的设备。另一条前进的道路是通过专业化,我们将模型调整为执行特定类别的任务,使用专注于狭窄领域的精选训练数据。我们可以用专门的 AI 替代声称的通用模型如 ChatGPT:LawLLM、MedLLM、MyLittlePonyLLM 等。

还有其他可能性,很难说研究人员会发现什么新技术。也许有更好的方法来生成合成数据,或者有方法从更少的数据中获得更好的模型。但是没有保证更多的研究一定能解决这个问题。

最终,这个挑战可能会迫使 AI 社区变得更有创造力。毕竟,需求是发明之母,数据匮乏的 AI 环境可能会激发一些真正创新的解决方案。谁知道呢?AI 的下一个重大突破可能不是来自更多的数据,而是来自于找出如何用更少的数据做更多的事。

tag如果只有大公司能负担得起数据抓取会怎样?

对于今天的许多人来说,互联网就是 Facebook、Instagram 和 X,通过他们手中握着的一块黑色玻璃矩形来查看。它是同质化的、"安全"的,并由看门人控制,他们(通过政策和算法)决定你看到什么(和谁)以及看不到什么。

事情并非总是如此。就在几十年前,我们还有用户生成的博客、独立网站等等。在八十年代,有数十种操作系统和硬件标准在竞争。但到了 2010 年代,Apple 和 Microsoft 已经胜出,开启了同质化的趋势。

我们在网络浏览器、智能手机和社交媒体网站上看到了同样的情况。我们从多样化和新想法的爆发开始,最后大玩家垄断了局面,使其他人难以参与。

话说回来,虽然这些玩家确实有垄断地位,但一些小玩家还是偷偷溜了进来。(比如 Linux 和 Firefox)。但在 LLM 方面,"弱者崛起"不太可能发生。当小玩家缺乏获取多样化和最新训练数据的财力时,他们就无法创建高质量的模型。没有这些,他们怎么能维持业务?

即使在更广泛的网络收紧限制的情况下,巨头们仍有资源让他们的 AI 模型持续享用新鲜信息。与此同时,较小的玩家和初创公司只能在数据桶底部刮取,努力用陈旧的碎屑喂养他们的算法。这种知识差距可能会雪球效应式增长。随着数据富有者在洞察力和能力上变得更富有,数据贫乏者可能会进一步落后,他们的 AI 一天比一天更过时,竞争力更弱。这不仅仅是关于谁拥有最闪亮的 AI 玩具 - 而是关于谁能够塑造技术、商业甚至我们获取信息的方式的未来。我们正在面临一个未来,在这个未来中,少数科技巨头可能掌握着最先进 AI 王国的钥匙,而其他人则被困在数字黑暗时代中窥视。

考虑到漂浮着大量可授权的内容,不太可能有一家大公司能像早期的 Netflix 那样获得所有授权。还记得吗?你只需订阅一个服务就能获得你梦想中的所有节目。如今,节目分散在 Hulu、Netflix、Disney+ 和不知道现在叫什么名字的 HBO Max 上。有时候你喜欢的节目可能会突然消失在以太中。这可能就是 LLM 的未来:Google 优先访问 Reddit,而 OpenAI 获得 Financial Times 的访问权。iFixit?那些数据就这样消失了,仅仅作为一些尘封的嵌入存储着,永远不会更新。与其说是一个模型统治一切,我们可能会看到随着 AI 供应商之间授权权利的转换,出现分裂和能力的变化。

tag结论

不论我们是否喜欢,网络抓取都将继续存在。内容提供商已经在竖起壁垒限制访问,只向那些有能力获得内容许可的人开放。这严重限制了任何一个 LLM 可以学习的资源,同时,较小的公司也因昂贵的内容竞价战而被淘汰,剩余的资源则被各大科技巨头的 LLM 瓜分。这就像流媒体后网飞时代的重演,只不过这次争夺的是知识。

在可用的人类生成数据不断减少的同时,AI 生成的"劣质内容"却在蓬勃发展。用这些数据训练模型可能导致改进速度放缓,甚至模型崩溃。解决这个问题的唯一方法是跳出常规思维——这正是初创公司以其创新和颠覆文化最擅长的。然而,那些只授权给大公司的数据恰恰是这些初创公司生存所需的命脉。

通过限制对数据的公平访问,大企业不仅在扼杀竞争——它们还在扼杀 AI 本身的未来,扼杀着可能帮助我们摆脱这个潜在数字黑暗时代的创新。

AI 革命不是未来,AI 就是现在。用威廉·吉布森的话说:"未来已经到来,只是分布不均匀。"而且这种分布很可能变得更加不均。

类别:
观点
rss_feed

阅读更多
八月 14, 2024 • 17 分钟阅读
By Hoovering Up the Web, AI Is Poisoning Itself
Alex C-G
Scott Martens
Illustration of a cartoonish robot vacuum cleaner with big eyes and an open mouth, humorously sticking out a tongue to clean,
五月 24, 2024 • 4 分钟阅读
RAG is Dead, Again?
Han Xiao
Cartoon of four characters in a cemetery with graves marked "RAG," mixing somber themes with humorous actions.
五月 07, 2024 • 12 分钟阅读
When AI Makes AI: Synthetic Data, Model Distillation, And Model Collapse
Scott Martens
Abstract depiction of a brain in purple and pink hues with a fluid, futuristic design against a blue and purple background.
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 徽标
open_in_new
下载 Elastic 徽标
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业人士使用。不面向任何消费者,也不鼓励任何消费者使用。