ERC‑8004 解决了身份,ERC‑8183 解决了托管,然后呢?
撰文:Thejaswini M A
编译:Saoirse,Foresight News
在互联网发展的很长一段时期里,搜索引擎只负责返回结果列表,余下的全部工作都交由用户处理。映入眼帘的,是蓝色标题与超链接。之后我们点击那些看上去和查询需求相匹配的内容。但把这段经历当作往事来讲,感觉有些怪怪的,也不由得让我生出几分岁月感。
作为写作者,我向来反感 SEO 这套东西。关键词会毁掉文章里不少精彩内容;在谷歌的排名逻辑里,外部引用还会被视作投票。本质上,如果更多其他网页指向你的页面,你的页面权重就会更高。不过也无可厚非,聊不上抱怨。某种可信度,总好过完全不被采信。广告养活了互联网的一切。但内容发布方显然十分厌恶这套机制。
如今这套模式正在走向消亡。我想找一本金融经济相关的书籍,或是想知道长时间走路之后脚踝疼痛该如何处理,我会直接打开 Gemini。有人会用 Perplexity,有人用 GPT。对 Token 消耗不敏感的人,则直接选择 Claude。这些工具的效果,一定比读完一整篇文章更好吗?我们并不知道…… 或许并非如此,但它确实让生活变得轻松。你不必去读两篇观点截然相反的文章,AI 已经帮你把问题处理好了。
我认为,至少 30 岁以下的群体,已经不再把搜索引擎当作一个需要主动访问的入口。
随后智能体(Agent)登场,彻底打破旧有格局。非人类流量已经超过人类流量。一个执行研究任务的智能体,可能会读取上千个网页,最终只输出一份备忘录。这和人类完全不同。因此,在智能体驱动的经济体系中,广告可能失去价值。我曾经写过两篇文章,探讨软件是否应当为自己索取的资源付费。我们得出结论:付费这件事本身,反而是最简单的环节。
一个智能体在网络中完成任务、实现价值结算,需要一套相互独立的六层技术栈。
智能体需要找到网页资源、信任返回结果、信任其他机器人、确认任务完成情况、完成支付,还要给内容创作者留下相应报酬。接下来,我们就按这个顺序逐层展开。
真实网络上有什么?
机器和人类都在使用「搜索」,但二者对网页的诉求截然不同。
人类搜索会返回完整网页列表,由用户浏览标题、自主选择跳转。面向 AI 智能体的机器搜索则不一样。智能体受上下文窗口(短期记忆)限制,不会完整浏览网页。它不会返回按权重排序的全部链接,只会提取对任务最有用的少数段落,直接喂给模型,以此避免内存溢出,整个过程仅需毫秒级耗时。
该赛道两大主要厂商为 Parallel 与 Exa,二者都是服务智能体搜索的独立公司。Parallel 由 Parag Agarwal 在离开 Twitter 之后创立,4 月完成 1 亿美元融资,估值 20 亿美元。Parallel 会根据明确目标执行搜索,返回压缩后的内容片段,片段会按照对任务的贡献度排序,并且为每一条事实附上引用来源与置信分数。
再看 Exa,a16z 领投,5 月完成 2.5 亿美元融资,估值 22 亿美元。服务超过 5000 家企业、4 万名开发者,为 Cursor、Cognition、HubSpot、OpenRouter、Monday.com 等产品提供底层能力。Exa 侧重语义理解而非关键词匹配,即便原文没有出现查询词,也能够返回匹配的内容,同时直接返回干净的网页原文。
根据 Parallel 官方文档,两套高速档位千次搜索请求费用为 1 美元,两套低速档位千次请求 5 美元。无论网页篇幅长短,URL 内容提取统一为千条 1 美元。Exa 千次搜索请求收费 7 美元,是 Parallel 的 7 倍;网页内容提取千页 1 美元,带引用的问答接口千次 5 美元。
搜索效果究竟好不好?
谷歌大多在内部完成搜索质量评估:判断用户是否点击首条结果、停留页面还是立刻跳出;同时雇佣人工评分员对结果打分。过去也有 RTEC 这类测试,但不存在对外公开、可供采购的排行榜。Google Analytics、Similarweb 统计的是流量,而非搜索质量。
而在智能体互联网中,已经出现实验室基准测试集,专门衡量搜索工具能否帮助 AI 拿到正确答案。
OpenAI 于 2025 年 4 月发布 BrowseComp,包含 1266 道逆向构造的考题。出题人先确定一个可核验的客观事实,再设计问题,把事实隐藏在多重约束条件之下。如果先出题,就像普通知识问答,模型很可能依靠自身记忆或者一次幸运搜索答对。而先确定事实、再做问题包装,才可以真正检验工具的网页检索能力。
原生 GPT‑4o 得分仅 0.6%;开启网页浏览能力的 GPT‑4o 得分 1.9%;OpenAI 的 Deep Research 拿到 51.5%。

测试目标是验证系统能否在真实互联网中找到一条被隐藏、可核验的事实并输出。1266 道题目都有简短标准答案,模型仅有一次作答机会,匹配即得分,不匹配不得分,最终分数等于答对题目占总题数的百分比。原生 GPT‑4o 0.6% 代表模型几乎无法靠固有记忆获取事实;开启浏览的 GPT‑4o 得到 1.9%,说明基础搜索工具带来的提升微乎其微;Deep Research 拿到 51.5%,代表更长的搜索‑阅读循环,大约一半概率可以找到目标事实。
除 BrowseComp 外还有其他评测集:SimpleQA(OpenAI,4326 个问题),一套易于打分的事实性测试;随着浏览工具提速,SimpleQA 难度被模型轻易突破,因此才有 BrowseComp。GAIA(Meta / Hugging Face,466 道人工任务),面向真实助手场景,可能需要网页浏览、调用工具、读取文件、多步推理,不止单纯搜索。DeepSearchQA 是多轮检索的研究数据集,Artificial Analysis 会基于该数据集做综合评估。FRAMES(Google DeepMind,824 个样本),多跳问题集,需要从多个来源提取事实再做整合。
私人机构 Artificial Analysis 由 George Cameron 与 Micah Hill‑Smith 联合创立,2026 年 8 月 18 日发布搜索指数。这套评测固定作答所用的 AI 模型与评测规则,只更换智能体调用的搜索 API。分数发生变化,就代表差异来自搜索工具本身,而非模型能力。


来源:@artificialanalysis
完全不使用搜索的前提下,同一模型在该指数基线得分 33,BrowseComp 子集基线得分 17。即便各家搜索服务商排名发生变动,基线分数始终没有变化。
截至 8 月 27 日 Artificial Analysis 搜索指数:Perplexity 中端版本以 80 分位居第一;Parallel 高级档位与 Brave 同为 75 分并列;You.com、Exa74 分;Firecrawl、Parallel 基础版、Parallel 高速版均为 73 分。
如果搜索工具得分高于基线,代表搜索确实帮助模型获取新信息。逻辑如下:AI 仅靠记忆作答,得到基线分;接入搜索之后分数上涨,代表搜索找到了模型原本不知道的信息;分数没有提升,则搜索没有起到作用。
但是评测本身存在局限:测试题目、所用模型都并非业务场景专属。服务商可以专门针对已知测试集(例如 DeepSearchQA)做应试优化,就像过去网站针对谷歌做 SEO 一样。
对面的机器人是谁?
当两个 AI 智能体互相委托工作时,仅有钱包地址和简介不足以建立信任。钱包地址仅能证明账户拥有资金,描述文本很容易伪造,无法证明机器人的开发者身份,也无法佐证它过往工作记录是否真实。ERC‑8004这套标准就是为了解决智能体真实身份与声誉验证而设计。
ERC‑8004 由 MetaMask、以太坊基金会、Google、Coinbase 相关人员共同编写,2026 年 1 月 29 日在以太坊主网上线,包含三大注册表。
第一,身份注册表,以 NFT 形式实现。每个智能体对应一个编号代币,代币的统一资源标识符指向注册文件,记录智能体名称、服务端点、是否支持 x402 支付、支持哪些信任模型。代币持有者即为智能体所有者;代币发生所有权转移时,旧支付钱包信息会被清空,新持有者必须重新签名证明控制权。
第二,声誉注册表,接收带签名的反馈,也就是链上公开评价系统。使用完智能体之后,用户可以在链上留下评分,附带任务标签(例如搜索、评分)。智能体所有者无法给自己写评价,评价支持撤回。任何人都可以在评价下方追加备注,退款记录、垃圾警告都可以附加在评分旁边。这是绑定智能体 ID 的公开评论区,不是某一个应用内部的私有星级系统。
第三,验证注册表,对接第三方独立校验。智能体发起验证请求,验证者智能合约返回 0‑100 的分数,同时附带证据链接;证据来源可以是任务复跑结果、零知识证明,或是安全芯片出具的证明。
该规范本身不处理支付逻辑,文档中也明确写明这点。它只记录智能体身份、外界评价、第三方校验结果,支付交由其他协议完成。注册表的数据质量并不理想。根据 8004scan7 月统计,跨 29 条公链一共注册 385998 个智能体,拥有超过 46 万条评价。绝大多数 ID 只是空徽章;89.2% 没有对外公布可调用的标准服务接口;仅有 8631 个智能体拥有可用服务,占比仅 2.24%。

来源:@8004_scan
5 月针对以太坊、BNB Chain、Base 链的爬虫调研发现:链上评分无法在不同智能体之间横向对比。大部分反馈没有绑定任何人都可以核验的任务结果,刷评价成本很低。标记过滤掉可疑评价之后,大量被评分的智能体已经没有可用有效评价。该标准只统一评价数据输出格式,哪些评价真实可信,交由外部系统处理。ENS、EigenLayer、The Graph、Taiko 都表示会接入该标准,但尚未开发评价过滤工具。
智能体真的完成工作了吗?
Agentic Commerce 架构,由以太坊基金会与 Virtuals Protocol 联合设计,目标实现自主 AI 智能体之间互相雇佣、协同工作、链上结算,全程无需人类中介。ERC‑8004 配合 ERC‑8183(托管标准)共同实现这套体系。ERC‑8183 标准化智能体之间任务发布、资金托管、结果核验、结算全流程。
工作流程如下:发起任务的客户端智能体发布任务,写明任务描述、截止时间、预算,指定评估器。客户端将资金存入智能合约,资金被锁定,任何一方都无法单方面动用。
提供服务的智能体在链下完成计算,将最终结果上传 IPFS、Arweave 这类去中心化存储,链上只提交哈希或者资源定位符。评估器(可以是专门裁判智能体、自动化预言机、零知识证明验证器)检查交付成果。
评估器判定任务通过,则扣除手续费之后向服务方付款;判定失败,则把资金退回客户端。如果服务方失联,或是评估器超过截止时间停滞,合约会触发公开退款逻辑,资金退回客户端,避免资产永久锁死。
评估器也可以直接由客户端本身担任,文档把这种模式作为无第三方场景下的常规方案。同时规范写明:本协议不提供纠纷解决与仲裁机制,拒绝结果 / 超时到期即为最终判定。如果你选择的打分机器人恶意坑骗你,没有管理员、客服可以申诉。你求助无门;并且就上一层提到的问题,你也不能依赖链上评价去挑选可靠评估器,大部分评价都是虚假的。
UMA、Kleros、Bittensor 这类系统可以缓解评估器单点作恶风险,但会牺牲速度、抬高成本。纯自动化托管结算可以秒级完成,手续费极低;而通过 UMA、Kleros 升级纠纷流程,需要挑战窗口、质押保证金,还要引入人类参与投票。
资金是否完成转移?
最近行业对这块讨论很多,这里简单说明。
x402 由 Coinbase 推出,是搭建在现有公链之上的一层协议,按请求扣费,使用稳定币完成转账。

来源:@coinbase
另一套是机器支付协议 MPP,2026 年 3 月由 Stripe 与 Tempo 联合发布,发布当天 Tempo 主网正式上线。MPP 是一套 HTTP 标准。服务器返回 402 需要支付响应,附带挑战信息;智能体携带支付凭证重试请求;服务器返回资源与支付回执。
资金实际流转取决于底层通道。Tempo 链上单笔交易链上结算约 0.5 秒。面对一连串小额调用,智能体可以预先锁定一笔资金,过程中持续记账,最后统一上链清算,而不是每一次调用都发起链上交易。支付上限由本次会话锁定额度或者访问密钥控制,不是「一次性授权、永久扣费」模式。
MPP 支持多种底层通道:Visa 发布卡片规范,智能体可以使用代币化卡片支付;Lightspark 基于同一套 402 流程实现闪电网络支付方案,同时配套 Visa 卡片计划。已经接入 Stripe 卡片支付的商户,可以直接接收 MPP 卡片支付,资金进入普通 Stripe 账户;闪电网络是 MPP 规则下另一个可选通道。Stripe 同时支持 x402。x402 与 MPP 都复用 HTTP 402「需要支付」状态码,但二者属于两套不同协议。
内容创作者拿到报酬了吗?
如果创作者拿不到钱,就不会再有新内容可供检索。创作者无法盈利,就会停止发布作品,AI 智能体最终将耗尽新的阅读素材。
Cloudflare、Parallel、OpenLedger 是该领域三个代表性项目。
Cloudflare 最初对爬虫抓取网页统一收取固定费用。这套方案过于粗糙,抓取首页和抓取深度调查报道的扣费完全一样。现在 Cloudflare 转向按价值计费模式:只有当内容真正产生价值时,才向发布方结算报酬。同时,对于广告盈利的站点,如果 AI 服务商拒绝付费,Cloudflare 会拦截 AI 爬虫。
Parallel 于 5 月 19 日推出 Index 产品,借鉴合作博弈论中的沙普利值算法,计算每一条信息源对智能体最终任务结果的贡献占比,据此完成分成。不再按点击统一付费,而是通过数学模型衡量单篇文章对任务的实际贡献。合作合作方包括 The Atlantic、Fortune、PR Newswire、PitchBook、ZoomInfo、Tracxn、RocketReach、Enigma、Fiscal AI。
目前 Index 仅在智能体使用 Parallel 自有搜索工具时才会进行结算。除非其他 AI 平台全部接入,否则它无法成为全网通用标准。
OpenLedger 是另一种方案,使用代币体系。它统计数据集对 AI 模型的影响程度,用自家代币向贡献者发放报酬。这套方案面向 AI 训练数据开发者,并非用来补偿新闻记者的日常稿件。
我尝试去查找这些项目实际付给创作者的真实金额数据。Cloudflare 没有公开兑付数字;Parallel 也未披露;OpenLedger 以 OPEN 代币结算,没有对外公开独立统计总兑付金额。因此,目前我们还没有确凿事实来评判这套机制的实际效果。
人类商业发展历史中,收银机反而是很晚才出现的产物。人类花了很多年建立口头约定、本地声誉体系之后,才发明低摩擦支付。而机器互联网的发展路径完全颠倒:它从诞生起就实现即时、流式全球结算。如今智能体经济却要手忙脚乱地去搭建链上小额纠纷法庭,防止两个机器人因为几美元的任务互相欺诈。
最后引用 Terry Pratchett 的一段话收尾:
「一味空谈纯粹逻辑,说机器只是执行收到的指令,固然说得轻巧。但人们有权期待,机器也该具备一点点常识。」
免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。