AI爬虫疯狂消耗Linux内核仓库计算资源

AI爬虫疯狂消耗Linux内核仓库计算资源

近几周以来,越来越多开源项目开始划定界限,限制AI在项目流程和代码库中的渗透程度。Debian刚刚投票允许生成式AI参与项目贡献,而Rust则采用分级政策,将AI基本排除在代码之外。这些项目都触及了同一个核心问题。

如今,全球最大的开源项目之一Linux正遭受爬虫的猛烈冲击,其中大部分是AI驱动的,它们不断重复发送请求,耗尽计算能力。值得注意的是,这些活动大多与实际编写代码无关。

AI爬虫疯狂消耗Linux内核仓库计算资源

问题严重性

Linux基金会的Konstantin Ryabitsev长期以来一直在抱怨这一问题,他提供了具体数据。在git.kernel.org的90个CPU核心(分布于5个节点)中,有14-16个核心每天每秒都在将提交转换为HTML页面。

AI爬虫疯狂消耗Linux内核仓库计算资源

从表面看,你可能觉得这没什么问题。Linux历史上的每个提交都是公开的,可以自由克隆,且早于当前AI工具的爬取浪潮。然而,这些特性恰恰使仓库成为“学习数据的金矿”。它包含主线内核树、多年的稳定版本分支、数十个子系统维护者树,甚至BitKeeper时代的pre-git历史。

真正荒谬的是这些爬虫进行爬取的方式。

AI爬虫疯狂消耗Linux内核仓库计算资源

数据对比:克隆vs爬取

Konstantin计算后发现,常规克隆linux.git(遍历整个提交历史)大约需要200 CPU秒的服务器时间。而通过cgit的单独页面爬取相同148万次提交,则消耗280 CPU小时。如果对服务器上所有922个fork执行相同爬取,总消耗将飙升至258,160 CPU小时,相当于单次克隆的460万倍。

更讽刺的是,所有这些消耗仅用于获取本可免费获取的更差版本数据。

这还不包括cgit为每个补丁、diff和纯文本视图提供的独立URL,这使单个fork暴露的页面数量达到数万亿级别。

对抗措施与军备竞赛

封禁IP和Fail2Ban起初有效,但爬虫很快分散到整个子网。ASN封禁也奏效,直到数百万住宅和移动IP取而代之。随后引入Anubis作为“工作量证明”墙,爬虫必须解决挑战才能通过,但这只持续了一段时间,爬虫开始解决更高难度的挑战。

Konstantin总结道:

然而,在5个地理分布节点的90个核心中,总有14-16个核心持续为爬虫渲染提交。平均而言,这占用了我们20%的总容量——但爬虫群以波状形式来袭,实际图表远比20%的平线更陡峭。

他进一步推测,当AI泡沫破裂时,项目将迅速看到试图将git.kernel.org喂给模型的“实体”(他对爬虫的称呼)数量大幅减少。不过他也希望它们“更聪明些”,停止以“最愚蠢的方式”爬取数据。

如果你不认识Konstantin,他是Linux基金会IT基础设施安全总监,也是维护kernel.org运行的系统管理员之一。

AI的内在贪婪性

这种计算浪费并非git.kernel.org独有,它只是迄今为止最清晰的例子。为模型提供数据意味着在可以更快完成的任务上消耗周期,而目前构建这些系统的团队似乎对此并不在意。

这些系统唯一的方法似乎是…


关注微信号:智享开源 ,及时了解更新信息。

原文链接:https://feed.itsfoss.com/link/24361/17435468/linux-kernel-repo-ai-overrun

评论列表

发表评论

你必须 登录 才能发表评论.

为您推荐


请支持IMCN发展!

谁在捐赠

微信捐赠 支付宝捐赠
微信捐赠 支付宝捐赠
ta的个人站点

发表文章4607篇

关注我的头条 不要放弃,百折不挠,坚强、自信。


扫码关注公众号:智享开源

最新科技信息


归档

近期评论