网站流量分析平台Known Agents最近披露了一个细节:有人正在伪造AI机器人的身份,专门扫描Claude Code、Codex等AI编程工具在本地或服务器上留下的凭证与配置文件,包括.claude.json、.codex/config.toml、.aws/credentials这类路径。这份数据来自Known Agents对5000多个网站的Agent Analytics监测,听起来像是又一起"AI机器人被滥用"的案例。但把同一份数据拆开看,故事没那么简单——真正被冒充得最多的机器人,压根不是ClaudeBot,而是Googlebot。
标题和数据对不上
Known Agents的“伪装身份”统计里,Googlebot的被伪装流量占比是0.5%,排第一。紧随其后的是ChatGPT-User、GPTBot、OAI-SearchBot、PerplexityBot,各占0.1%。而ClaudeBot被伪装的流量占比四舍五入之后是0.0%——不是没有,而是小到测不出量级。
这和"伪装成ClaudeBot搞漏洞扫描"这类标题给人的印象明显不一致。ClaudeBot确实是个大目标:它在Known Agents统计的"AI抓取活动"里占比27.0%,是所有AI爬虫里份额最大的一个,整体访问量里也占到3.2%。份额大,自然容易成为冒充对象——但数据摆在那里,真正被仿冒得最凶的,还是老牌的Googlebot。
真正的攻击面,是AI编程工具的本地凭证
比"谁被仿冒得多"更该关心的问题是:攻击者伪装身份之后,到底想干什么。Known Agents披露的扫描路径,指向的都是AI编程工具留下的敏感文件——/.config/anthropic/credentials/default.json、/.claude/settings.json、/.claude.json、/.codex/config.toml、/.aws/credentials。
这些文件大多存放着API密钥、访问令牌之类的凭证,是开发者在用Claude Code、Codex这类AI编程助手时,本地或服务器上顺手留下的配置痕迹。一旦这类文件因为权限设置不当或.gitignore遗漏而暴露在公网,伪装成AI机器人身份的扫描器几乎不需要什么技术门槛,就能把它们当成普通爬虫请求悄悄抓走。
伪造User-Agent字符串本身不是新招数。早年间垂直搜索引擎、恶意扫描器就爱冒充Googlebot,借着搜索引擎的"良民"身份绕过防火墙和WAF的白名单信任。现在轮到ClaudeBot、GPTBot这批新机器人被大量网站加入robots.txt白名单——Known Agents的数据显示,Top 1000网站里已经有21.7%专门屏蔽ClaudeBot,反过来说,剩下近八成网站要么放行、要么没设限——伪装AI机器人身份,就成了绕过检测的新捷径。老套路换了新马甲,风险却叠加在AI工具带来的新攻击面上:凭证文件本身就是这轮攻击真正瞄准的东西,伪装身份只是敲门的手法。
- 风险.开发者本地或服务器上的
.claude.json、.codex/config.toml一旦权限配置错误或被误传到公网,就可能被当作普通网页请求悄悄抓走。
别被"大规模"两个字带偏
体量上还有一层容易被忽略的对照。Known Agents统计里,"安全扫描器"(Security Scanner)这一类agent,在其测得的全部活动量中只占0.8%。相比之下,AI相关bot流量占整体bot流量的比例是28%,ClaudeBot自己在AI抓取活动里就占了27%的份额。把这两组数字放在一起看,"大规模伪装攻击"更像是相对于安全扫描这个细分类别而言的"活跃",而不是相对于整个AI机器人生态而言的"大规模"。
对网站运营者来说,这件事真正提醒的是:靠User-Agent字符串和robots.txt做身份判断,本质上是一种自证式信任——机器人说自己是谁,系统就信是谁。Known Agents统计的robots.txt遵守率高达98.5%,但这个数字只对"愿意报出真实身份"的机器人有意义,对存心伪装的攻击者毫无约束力。更可靠的做法,是转向IP信誉库、请求行为指纹、TLS/JA3指纹这类难以伪造的验证手段,而不是继续把UA白名单当城墙。
User-Agent从来是自报家门,不是身份证。
对普通开发者来说,当务之急比想清楚"谁在冒充谁"更具体:检查一下本地和部署环境里,Claude Code、Codex留下的配置文件权限是不是收紧了,密钥有没有被打进公开仓库或暴露目录。这比追问"是不是有人在假扮ClaudeBot",要实际得多。
Known Agents没有公开具体的扫描次数、受影响网站数量,也没有说明"伪装"判定的具体方法论——作为一家靠Agent Analytics和AI Chat Referral Tracking产品盈利的公司,它有动机把AI机器人生态的复杂性讲得更有紧迫感。这份数据值得参考,但对应急响应团队来说,更该等的是Anthropic、OpenAI是否会就机器人身份认证机制——比如签名请求或可验证IP段——给出正式回应。
