首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

通过滚动行为检测抓取机器人

摘要

Ever since I first read "Burstiness and Memory in Complex Systems" by Kwang-Il Goh, I have been obsessed with the two formulas showcased in the paper. Burstiness (B), and its just-as-important counter...

the and human time which that scroll Goh have based
2026-08-21 1 阅读 约4分钟阅读 theanonymousone
分享:
字号:
自从我第一次阅读吴光一的《复杂系统中的突发性和记忆》以来,我就一直对论文中展示的两个公式着迷。突发性 (B) 及其同等重要的对应记忆 (M),让我们了解基于事件的系统的动态。当仅知道这些事件发生的时间时,我们可以使用它们来分析发送的电子邮件、文本甚至心跳的行为。这使我们能够清楚地确定哪些模式是类似人类的,哪些模式不是基于已分类数据的数据集。我们知道人类以突发的方式回复文本(他们回复所需的时间并不统一),而简单的机器人则尽可能快地回复,因此它们具有不同的 B 和 M 系数。 Goh, K.-I. 和 Barabási, A.-L. (2008),图 4 在之前的个人研究中,我使用这两个值根据请求的时间来区分人类会话和机器人会话,这通常有效,尽管如此,如果会话是从加载 CSS 和 JS 文件的任何浏览器发送的,这种方法会将会话识别为人类会话,从而允许像 ClaudeBot 这样的更高级机器人通过使用无头浏览器来显示人类会话。它本质上区分了精心设计的请求和从真实浏览器发送的请求,而不是机器人和人类发送的请求。滚轮 不久前,我注意到一种明显的人类行为,我认为机器人无法轻易模仿这种行为,即滚动。当我使用滚轮滚动页面查找信息时,我通常不会线性向下滚动,直到找到我要查找的内容,而是以突发模式进行滚动。例如,该模式可能更类似于时间序列 a 或 e,而不是 c。 Goh, K.-I. 和 Barabási, A.-L. (2008),图 1 我认为大多数抓取机器人开发人员仍然没有磨练他们的滚动模式,因此我决定测试应用于滚动事件的事件间时间的突发性和内存是否是在机器学习模型中具有预测能力的变量,以便区分人类和机器人。为此,我使用了 Ethan Wang 等人的论文“FP-Agent:指纹识别 AI 浏览代理”提供的数据集,其中作者解释了他们如何创建机器学习模型的过程,该模型可以在受控环境(专门为此目的制作的网站)中区分不同的 AI 浏览代理。他们记录了不同代理和人类浏览其网站的数据。他们的模型给出了很好的结果,但我认为当应用于不同的网站时,它在现实世界中不会有效,因为这涉及很多变化。尽管如此,他们还是在 OSF.io 上提供了该数据集的下载。我计算了每个页面中每个代理的 JavaScript“滚动”事件的突发性和内存值(每个访问的页面一个突发性和内存值)。结果如下:我们可以观察到人类分布与其他智能体明显不同,呈现出更高的突发系数并且几乎没有记忆;唯一有时类似于人类的代理是 ChatGPT Agent。这些数据看起来很有希望,但为了进一步证明这两个值是否具有预测价值,我训练了 LightGBM(决策树梯度增强)模型来对每个单页交互进行分类。该模型只有两个可用特征,B 和 M,并且必须预测哪个代理执行交互。结果准确率为 73.4%,还不错。正如预期的那样,该模型主要混淆了人类和 ChatGPT Agent,很可能是由于特征数量较少或数据集较小(每个代理约 150 个数据点太小),该模型需要其他特征才能进一步区分它们。结论 滚动行为似乎是区分机器人和人类的相关数据点,而突发性和记忆性已被证明在受控环境中具有预测能力。这种方法对于不需要滚动的网站显然不会有效;另一方面,博客或维基百科等信息网站是最能够利用这种方法的。这篇博文中显示的模型不够准确,但是,如果与从鼠标移动或打字等其他操作中提取的更多特征相结合,我相信可以创建一个能够保护网站免受爬虫机器人侵害的通用模型。我将继续在这个网站上发布我的研究成果。接下来,我将研究鼠标的移动模式。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱