互联网正在转向智能体优先:从阻止机器人到支持 AI 智能体
网络最初是为人类而建,随后被加固以抵御机器,如今又在为代表我们行事的机器而重建。
· Matt Senter

在商业互联网的绝大部分历史里,机器人是要被拦下来的东西。
我们在表单前面放上验证码。我们给浏览器打指纹、给行为打分、限制请求频率、盘问陌生设备、封禁整段 IP 地址。我们围绕一个问题建立起了庞大的安全产业:
这是一个真人吗?
如今,几乎是一夜之间,我们开始问相反的问题。
我们要如何让一台机器去订行程、比较保险方案、买菜、改会议时间、报销费用,并代表一个人操作软件?
互联网不只是变得更自动化了。它正在变成「智能体优先」。机器不再只是在后台抓取网页,它们正在成为用户、客户、谈判者和代理人。
这个变化许诺了一个便利得多的互联网,也迫使我们重新审视自己在防守上一个互联网时所做的几乎全部假设。
网络从来就不是只属于人类的
早期的网络依赖自动化。
搜索爬虫让网页可被发现。RSS 阅读器汇集更新。监控工具检查站点是否在线。无障碍工具把内容转换成人们可用的形式。归档机器人保存了那些否则将会消失的网页。
最初的 机器人排除协议 诞生于 1994 年,是网站所有者与自动爬虫之间一份轻量级的约定。站点可以在 robots.txt 文件里公布自己的偏好,而一个守规矩的机器人可以选择尊重它们。
那是一份社会契约,不是一道安全边界。
商业化的网络改变了激励结构。自动化变成了抓取专有数据、撞库、批量注册假账号、抢购稀缺库存、群发垃圾信息、实施广告欺诈、压垮系统的手段。机器人能做和人一样的事,但更快、更便宜,而且可以重复上百万次。
于是那个工作假设变硬了:
人类是正当的。机器是可疑的。
这个假设从来就不完全准确。行为恶劣的人多得是,有用的机器人也多得是。但它足够简单,可以围绕它构筑防线。
智能体软件打破了这条捷径。
现在,机器人可以就是那个客户
一个 AI 智能体可能通过浏览器抵达某个站点,点击和人一样的按钮,使用同一个账号。流量是自动化的,但意图属于一位真实的客户。
像 ChatGPT agent 这样的产品把这件事变得具体:一个智能体可以浏览网站、使用已连接的数据、填写表单、开展研究,并在做出重要动作前暂停等待批准。类似能力正在浏览器、操作系统、办公工具和电商平台中扩散。
在网站看来,这可能与它封堵了几十年的自动化流量像得让人不安。区别不在于动作是不是由软件完成的,而在于这个软件代表着谁的利益、拥有什么授权,以及站点能否验证这两者中的任何一个。
封禁所有机器,将越来越等同于封禁客户;放行所有机器,则是鲁莽。那套「人还是机器人」的老测试,正在变成一个错误的抽象。
新的问题是:
这是哪个智能体,谁授权了它,它被允许做什么?
智能体优先的技术栈已经在成形
今天的智能体常常使用可视化浏览器,因为那是几乎每个服务都已经暴露出来的界面。这是一层聪明的兼容层,但也很脆弱。按钮会挪位,标签会改动,弹窗会冒出来。一个为人设计的流程,可能要求智能体去解读截图、模拟点击,然后指望状态如预期般发生了变化。
智能体优先的应用会直接暴露能力,而不是逼着机器假装成人。已有若干倡议正在填补这个未来的不同层次。
MCP 把智能体连到工具和数据
Anthropic 推出了 Model Context Protocol,作为 AI 应用连接外部数据与工具的标准方式。开发者不必为每一对「助手—服务」组合各写一套定制集成,而是可以暴露一个多种智能体系统都能理解的一致接口。
MCP 与其说像一个新网站,不如说像网站旁边一个标准化的服务端口。人用的界面可以保留,而智能体获得一条结构化的途径去搜索、读取、创建或更新信息。
A2A 让智能体与其他智能体协作
谷歌推出了开放的 Agent2Agent 协议,让各自独立构建的智能体能够公布自身能力、交换消息、协调任务并返回产物。一个旅行智能体不该需要访问每家航空公司的内部数据库,它可以通过共享协议与航空公司的智能体打交道。
这让互联网从「网页链接网页」,转向「服务把工作委派给其他服务」。
商业正在围绕被委派的意图重新设计
谷歌和多家零售伙伴创建了 通用商业协议(UCP),为智能体与商家提供在商品发现、结账和售后支持上的共同语言。与之相关的 智能体支付协议(AP2) 处理的是一个更难的问题:证明一笔自动支付确实体现了用户已授权的意图,包括本人并不在场时发生的交易。
结账页面是围绕「有个人在场按下按钮」而设计的。而一笔智能体交易可能发生在几个小时之后——当票价跌破某个上限,或某件商品重新有货时。系统需要的是关于用户授权了什么的证据,而不只是对已保存支付方式的访问权。
智能体开始用密码学方式表明身份
user-agent 字符串很容易伪造,而当智能体运行在共享的云基础设施上时,IP 白名单也很难奏效。Cloudflare 的 Web Bot Auth 工作使用 HTTP 消息签名,让自动化客户端能够证明请求究竟是谁发出的。此后 Cloudflare 又为用户指派的系统增加了「已签名智能体」这一类别。
这是一次重要的反转。目标不再是把自动化藏得足够好以冒充人类,而是让正当的自动化变得明确、可验证、可治理。
智能体优先的互联网能解决什么
便利性方面的理由是真实的。
网络上的许多事,其实是伪装成「浏览」的劳动。我们在几十个标签页之间搜索,反复填写同样的信息,比较彼此不兼容的选项,把数据从一个系统抄到另一个,等待某个条件发生变化,重复那些软件多年前就该接手的流程。
智能体可以把这些劳动坍缩成一个结果:
- 找出三个满足我真实约束条件的航班,而不只是标价最低的那个。
- 把这场会议改期,同时尊重每个人已说明的可用时间。
- 用这些收据整理出报销单,提交前先让我过目。
- 盯着这个替换零件,只在价格低于我的上限、且卖家在核准名单内时才买。
- 把这条客户记录迁过去,别逼我去学两套后台界面。
智能体优先的访问方式,也能让软件对那些难以应付复杂视觉界面、陌生术语或跨多个服务的流程的人更可用。智能体可以把一个人的意图,翻译成每个系统所要求的那套僵硬步骤。
对开发者而言,标准化的智能体接口能打开产品的长尾。传统界面必须预判最常见的路径,并把它们塞进一块屏幕里。而智能体可以把底层能力组合成产品团队从未专门设计过的工作流。
这可能会让软件不再像一堆各自独立的目的地,而更像围绕用户彼此协作的基础设施。
身份是必要的,但身份不等于信任
人们很容易把智能体的密码学身份,当成验证码的替代品。
它只是其中一层。
一个有效签名可以证明请求来自某个特定的智能体提供方。它证明不了用户想要的正是这个具体动作,证明不了智能体正确理解了请求,也证明不了智能体自任务开始以来没有被操纵过。
一个智能体优先的系统,至少要回答四个彼此独立的问题:
- 身份:是哪个智能体或服务发出了这个请求?
- 授权:是哪个人或组织把权力委派给了它?
- 范围:那次委派覆盖了哪些数据、哪些动作、多少预算和多长的时间窗口?
- 意图:这个具体动作,是否与用户交代给智能体的事情相符?
这个区分之所以重要,是因为最危险的智能体,可能恰恰是一个权限过大的正当智能体。
2026 年,美国国家标准与技术研究院(NIST)的国家网络安全卓越中心启动了关于 软件智能体身份与授权 的工作。议题包括识别、授权、审计、不可否认性,以及对提示注入的防护。这份清单是一个有用的提醒:「已通过身份验证」和「安全」并不是同义词。
我们不该仅仅因为认得出制服上的标志,就把万能钥匙交给一个智能体。
提示注入把网络本身变成了攻击者
传统软件通常会区分指令与数据。应用执行的是自己的代码,而把商品描述、邮件、文档或评论当作内容。
语言模型则通过语言同时消费这两者。
这就产生了间接提示注入问题。一个在调研某项采购的智能体,可能撞上有人特意放在页面上、用来影响它行为的文字。那条指令可能是可见的,也可能藏在标记里、嵌在文档中,或者伪装成普通内容。它可能叫智能体无视用户的条件、泄露隐私数据、访问一个外泄用的 URL,或者去做一件毫不相干的事。
谷歌 2026 年对 公开网络上发现的提示注入 所做的调查,涵盖了操纵推荐、劝退智能体、窃取数据以及诱发破坏性操作的各种尝试。这已经不再只是实验室里的思想实验。
没有哪个过滤器能在所有情境下完美区分恶意指令与正当内容。OpenAI 关于 抗提示注入智能体 的工作做出了正确的转向:假定总会有一些操纵渗透进来,然后限制智能体能够造成的破坏。
一个正在阅读不可信网页的智能体,不该同时拥有对邮件、云端文件、金融账户的无限制访问权,以及把信息发往任何地方的能力。安全边界不能只存在于模型自身的判断力之中。
「拿着你钥匙的助手」这个难题
互联网上的大多数授权机制,是为行为可预测的应用设计的。我们给日历应用访问日历的权限,因为它的功能是已知的。我们给照片编辑器访问照片的权限,因为它的作用边界相对清晰。
通用型智能体不一样。它的卖点就在于能自行决定需要哪些步骤。给它邮件、文档、浏览器、支付和消息的访问权,它就能以任何一张授权确认页都未曾描述过的方式,把这些权限组合起来。
这是一种带自然语言界面的「环境权限」。
便利性推着我们走向持久访问:保持登录、记住一切、连上每个服务、别再为了批准打断我。安全性则朝相反方向推:缩小任务范围、最小化数据、让凭据过期、隔离不可信内容,并在不可逆的动作之前要求由人确认。
正确的平衡,不会是一个放之四海而皆准的「自主性」开关。它应当取决于后果。
可以让智能体在规定时段内改期一场低风险的内部会议。可以让它准备报税材料,但不能提交。可以让它把购物车填满,但超过预算就要人来批准。可以让它续开同一种处方,但不能选择一种新药。可以让它起草一条消息,但在它以你的名义开口之前,要让发件人清清楚楚地显示出来。
最安全而又有用的智能体,并不是没有权力的。它拥有的,恰好是当前这件事所需的权力,并且只在这件事该持续的时间内拥有。
网络的商业模式也会改变
当下的网络假定:会有一个人到来,看见界面,接收品牌信息,遇上追加销售,看到广告,并成为这个站点客户关系的一部分。
而一个智能体可能把这些统统跳过。
它可以不逛十家店就比完价,可以不读完整篇文章就取出答案,也可以通过协议完成一笔交易,而始终没见过那个被精心优化过的结账页。这对用户是好事,对那些建立在注意力、引荐流量或界面控制权之上的生意,则可能是毁灭性的。
这也正是「AI 流量」这个说法太笼统的原因。Cloudflare 现在已经把 搜索流量、智能体流量和训练流量 区分开来。搜索爬虫可能索引内容并带回一位访客。训练爬虫可能消费内容来改进模型。而用户指派的智能体,可能是为完成一项任务而实时抵达的。这是三种不同的关系,理应对应不同的权限与不同的经济安排。
各家站点将不得不决定:欢迎哪些智能体、开放哪些能力,以及当那个人类根本不会到来时,价值该如何回流。而智能体也将不得不披露:某条推荐何时是赞助的、某个商家何时为优先展示付了钱,以及这个智能体究竟是在为用户优化,还是在为控制它的平台优化。
如果某一个智能体成为一个人购物、阅读、出行、沟通和发现的那一层,那么它对这个人的了解,可能超过历史上任何搜索引擎或社交网络。它知道的将不只是这个人去过哪里、点了什么,它还会知道这个人当时想要达成什么。
我们是在委派工作,还是在交出自主权?
我希望智能体把行政杂务从我的生活里拿走。
我不希望它们悄悄变成这些事的作者。委派一项任务和外包一个决定,是两回事。
「找一班晚饭前落地的航班」委派的是工作。「规划我理想中的假期」开始委派偏好。「帮我处理收件箱」委派的是「哪些人际关系重要」的判断。「把我的财务理顺」则可能让一个系统去在无法化约为收益率的价值之间做选择。
智能体学得越多,就越好用。它能记住我偏爱的座位、我避免安排早会的人、我支持的公益事业、我信任的店铺、我不想再解释一遍的健康问题,以及为省下一小时我愿意付出的价格。
而同样这份记忆,也是一份非同寻常的行为画像。
风险不只在隐私。一个替我过滤掉全部选项的智能体,会把我周围的世界收窄。它可以把意外优化掉,把我推向熟悉的东西,并把它自己的假设变成我未来的行为。如果它的商业模式偏爱某种特定结果,那么便利性掩盖利益冲突的本事,会比任何横幅广告都高明。
我们应当怀疑「自主性越高,用户体验自动越好」这种想法。有时候摩擦是浪费,有时候摩擦恰恰是一个人注意到「接下来要发生什么」的那个瞬间。
智能体优先的应用应该有哪些不同做法
智能体优先,不该意味着撤掉网站、公开一把巨大的 API 密钥,或者放任一个模型对着生产系统即兴发挥。它应当意味着,为「被委派的行动」设计一条明确的路径。
这正是我在 Orgabot:一个 AI 智能体编排平台 上采取的做法。我在构建一支受治理的智能体队伍,用它取代我与驱动我各个应用的那些服务之间的直接交互。我不想再挨个打开控制台、在系统之间搬运数据、亲手点完每一条运维流程,而是希望由专职智能体通过明确且范围受限的连接去完成这些工作。目标不是一个握有全部钥匙的万能助手,而是一群边界清晰的智能体:它们能接手日常工作,同时保住权限、审批、审计轨迹与问责。
我会从这些原则开始:
- 让智能体显形。正当的智能体应当表明身份,而不是把自己的流量伪装成人类活动。
- 授权的是能力,不是账号。给出的应当是「读取这些记录」「起草这项变更」「至多花这么多钱」的权限,而不是用户能做的一切的通行证。
- 把准备与承诺分开。智能体可以先调研、比较、填写、计算和起草,之后再获得发送、购买、发布、删除或签署的授权。
- 把授权绑定到意图上。凭据应当携带这项任务的目的、限度和有效期,而不只是账号的身份。
- 把外部内容当作敌意的。一个网页、一封邮件、一份文档、一次工具调用的结果,或者另一个智能体发来的消息,在可信策略另有规定之前,都只是数据。
- 留好凭证。用户和服务都需要一份持久的记录:智能体看到了什么、决定了什么、尝试了什么、改动了什么,以及是谁批准的。
- 让访问权易于撤销。持久的便利,绝不该变成永久且不可见的授权。
- 保留人类通道。人依然需要一个可理解的界面,用来检查、纠正、申诉,并从智能体手里接管。
最好的智能体接口,可能是一个 API、一个协议服务器、一次经过签名的浏览器会话,或者三者的混合。具体实现远不如围绕它的那套控制模型重要。
下一代互联网需要一个更好的问题
反机器人的互联网,是围绕一个粗糙但有用的挑战建立起来的:
证明你是人类。
智能体优先的互联网,需要一个要求更高的挑战:
证明你代表谁、他们让你做什么,以及这个动作为什么是被允许的。
我们应当欢迎这一转变。一个能代表我们行事的互联网,可以消除掉大量毫无意义的劳动。它能让服务更可及、更易组合,也更贴近人们真正想要的东西。
但我们不该把「点击更少」误认作「掌控更多」。如果我们在建立身份、权限边界、审计轨迹、经济规则和有实质意义的人类否决权之前,就先为智能体重建了网络,那我们不过是在重演一个老套路:先把便利部署出去,再回过头来发现信任模型。
几十年来,网站一直试图把机器挡在门外。而下一个阶段,并不是要把每一扇门都打开。
它关乎的是:把正确的钥匙、出于正确的理由、交给正确的机器,然后再把钥匙收回来。