Folia
← 返回头版

AI爬虫持续冲击Linux内核代码库基础设施

git.kernel.org运维团队报告,用于训练大语言模型的AI爬虫对该网站造成了严重的资源压力1。这些爬虫采用低效的HTML渲染方式大量采集提交历史数据,导致基础设施不堪重负1。虽然Anubis挑战机制已阻止66%的爬虫访问,但另外33%的爬虫已经学会破解该防护措施,继续对系统发起请求1。

受爬虫影响,git.kernel.org共享的5个地理分散节点中,14至16个CPU核心(占总容量的20%)正被持续用于渲染爬虫请求1。该网站日均收到约600万次请求,其中合法用户流量仅占约2%,其余均来自爬虫1。运维团队已被迫禁用某些功能以缓解服务压力1。爬虫的对抗手段在不断演进,从最初的简单user-agent识别发展到伪装成浏览器,再到使用数百万个随机住宅和移动IP地址1。即便运维团队将Anubis难度从第4级提升至第5级,爬虫仍继续破解并访问系统1。


来源

  1. Hacker NewsCreepy Crawlies

评论