Folia
← 返回头版

AI爬虫蚕食网络流量 网站启动反制引发信息获取危机

人工智能工具大规模抓取网站内容用于模型训练,正在打破互联网长达30年的内容流通生态。1根据Cloudflare的数据,超过50%的网络流量现已来自AI爬虫。1为了维护自身收益,越来越多网站开始采取措施阻止AI爬虫访问。1Cloudflare表示,从9月15日起,其管理的全球前10,000个网站中超过30%将在包含广告的页面默认屏蔽AI爬虫。1

这一趋势形成了一个恶性循环。随着更多网站部署反爬虫措施,AI模型能获取的训练数据质量持续下降。1最近一项研究发现,某些AI搜索工具所使用的源中,约六分之一本身是由AI生成的网站,进一步加剧了信息污染的风险。1此外,在Google推出AI总结功能后,维基百科英文版本的流量出现明显下降。1


评论