AI代理的网络基础设施:它们真正需要什么
如果网络层给一个能够推理的代理提供的是来自被封锁的数据中心IP的原始HTML转储,那么这个代理毫无用处。网络层决定了代理是否能正常工作。以下是基础设施检查清单。
构建能够浏览网络的AI代理的竞赛——Operator、Manus、Project Mariner、浏览器使用和数十个开放框架——几乎完全专注于模型和工具。然而,如果网络层给一个能够出色推理的代理提供的是来自被封锁的数据中心IP的原始HTML转储,那么这个代理毫无用处。代理下方的基础设施决定了它是否能正常工作。这是该层的检查清单:AI代理从网络中真正需要什么,以及如何提供给它们。
代理读取网络的两种方式——以及为什么其中一种更便宜
总体而言,代理以两种方式感知网络。以视觉为主的代理如WebVoyager会截取屏幕截图,在交互元素上覆盖编号框,通过点击坐标进行操作——这与人类浏览方式相近,但消耗大量token且速度慢。以文本为主的代理将页面作为结构化文本进行消费和推理。研究人员不断重新发现的教训是,向代理提供原始HTML DOM或完整的可访问性树会产生过于冗长的输入,实际上阻碍了其决策。干净、token少的文本胜出。这个单一发现塑造了下面大多数基础设施决策。
1. 可调用的工具,而不是附加的浏览器
代理通过调用工具来行动。为代理提供网络访问的最简洁方式是一个可调用的工具——获取此页面,运行此搜索——而不是定制的浏览器集成。模型上下文协议(MCP)已成为实现这一目标的标准接口,连接一个具备网络功能的工具集只需几行配置:
{
"mcpServers": {
"quantumproxies": {
"command": "npx",
"args": ["-y", "quantumproxies-mcp"],
"env": { "QUANTUMPROXIES_API_KEY": "qp_live_..." }
}
}
}
这为代理提供了它可以自主调用的抓取、搜索和结构化提取工具。我们的MCP服务器实用指南介绍了完整的工具集,您可以从MCP服务器页面中获取。

2. 干净的markdown而非原始HTML
一旦代理可以获取页面,返回的内容与其到达与否一样重要。现代页面可能包含数百千字节的嵌套div、脚本和跟踪标记——将这些内容烧录到代理的上下文中会浪费token并降低其推理能力。解决方法是将页面返回为干净的markdown:标题、列表、表格和链接,去掉样板。一个输出markdown(或结构化JSON)的Scraper API在边缘完成此操作,因此代理接收到的是可以直接推理的内容:
curl "https://api.quantumproxies.io/v1/scrape" \
-H "Authorization: Bearer qp_live_..." \
--data-urlencode "url=https://example.com/pricing" \
-d format=markdown -d render=true -d country=us
同样的原则驱动了检索管道——我们关于LLM驱动的提取和保持新鲜的RAG管道的笔记都从markdown优先的摄取开始,原因相同。
还有一个成本维度。为视觉模型渲染页面截图,或将原始HTML转储到上下文中,会在多步骤任务的每一步消耗token——而代理需要很多步骤。返回精简的markdown减少了每步的token消耗,这在长任务中累积为实际的延迟和成本节省。更便宜的感知也意味着代理可以在决定之前阅读更多页面,这通常会改善最终答案,而不仅仅是加快速度。
3. 每个请求的地理控制
网络在各地并不相同。价格、可用性、搜索结果、语言,甚至存在的产品都因国家而异。进行竞争研究、价格检查或市场分析的代理需要以市场用户的方式查看页面——这意味着控制每个请求的出口国家。覆盖200多个国家的住宅代理让代理可以询问“这在德国看起来如何?”并得到真实的答案,而不是以美国为中心的答案。地理控制将单一代理转变为可以推理任何市场的代理。这是一个正确性问题,而不是一个小问题:向欧洲用户引用美国价格的代理是错误的,除非基础设施让它看到正确的市场,否则它无从得知。

4. 抗封锁,因为代理也会被封锁
反机器人系统不会区分自主代理和抓取器——两者都是非人类流量,都会受到挑战。代理在任务中途遇到CAPTCHA或403,要么停滞,要么围绕缺口产生幻觉。因此,抗封锁是代理的能力,而不仅仅是抓取的关注点:可信的住宅和移动IP、真实的浏览器指纹、JavaScript渲染和IP轮换是确保代理工具返回数据而不是错误页面的关键。网络基础设施承担伪装,使代理可以专注于任务。
5. 新鲜度和搜索
最后,代理的可信度取决于其最新数据。一次抓取的知识库会变陈旧;引用上季度价格的答案是错误的。基础设施需要一种方式来按需拉取实时页面和进行搜索——一个用于发现的SERP层和一个用于检索的抓取层,都是新鲜的。这是一个猜测的代理和一个基于刚刚阅读的页面的代理之间的区别。为了构建持久知识,我们的将网站转变为支持机器人知识库指南涵盖了抓取和刷新循环,而为LLMs提供新鲜网络数据则涵盖了基础经济学。
常见问题解答
AI代理需要什么才能访问网络?
五样东西:可调用的工具(通常通过MCP)、作为干净markdown而非原始HTML的页面内容、每个请求的出口国家控制、抗封锁IP以免被反机器人系统阻止,以及一种按需拉取新鲜数据和搜索的方法。缺少任何一个,代理就会停滞或从陈旧的上下文中回答。
为什么要给代理提供markdown而不是原始HTML?
原始HTML和完整DOM树冗长且嘈杂,浪费上下文token并显著损害代理的决策。干净的markdown保留代理需要推理的标题、列表、表格和链接,去掉样板——对于同一页面来说更便宜、更快、更准确。
AI代理会像抓取器一样被封锁吗?
是的。反机器人系统看到非人类流量并挑战它,无论意图如何,因此自主代理会遇到与抓取器相同的CAPTCHA和403。可信的住宅或移动IP、真实的浏览器指纹和JavaScript渲染确保代理的网络工具返回数据而不是错误页面。
MCP如何帮助代理使用网络?
MCP是为代理公开工具的标准接口。MCP网络服务器为代理提供可调用的工具——抓取页面、运行搜索、提取结构化数据——代理可以自主调用,代理背后的代理、渲染和地理处理都已完成。它用一个干净、可调用的契约取代了定制的浏览器集成。
模型成为头条新闻,但网络层决定了代理是否可靠。为其提供可调用的工具、干净的markdown、每个请求的地理控制、抗封锁IP和新鲜数据,代理就不再与网络抗争,而是开始对其进行推理。