- A+
当大多数DePIN项目还在为商业模式发愁时,Grass已经靠卖预训练数据实现盈利,并正在向推理时代的实时检索市场扩张。Multicoin认为市场严重低估了这个方向的规模——如果AI代理每次行动都需要搜索网页,那将是一个比训练数据大几个数量级的市场。

01. 核心判断:市场低估了推理时检索的规模
Multicoin宣布从对冲基金和风险基金中投资Grass——机器智能的读取层。
他们认为,市场将Grass理解为一个通过预训练数据服务AI实验室的代理网络,但尚未计入推理时数据检索这一巨大扩张。
| 阶段 | 业务性质 | 市场特征 |
|---|---|---|
| 预训练数据 | 针对离散运行的一次性交付 | 规模可观,持续增长 |
| 推理时检索 | 每个模型、应用和代理反复消费 | 可能大几个数量级 |
训练采购围绕模型运行发生,但实时信息可以被每个模型、应用和代理消费,只要任务需要了解变化中的世界。
02. 过去:预训练数据——Grass如何解决公共互联网的访问难题
公共互联网的大部分内容,对于传统AI实验室在预训练期间来说,本质上难以访问。
| 障碍 | 说明 |
|---|---|
| 速率限制 | 网站对自动化流量进行限制 |
| 地理差异 | 不同区域呈现不同内容 |
| 渲染要求 | 越来越多页面要求通过普通浏览器渲染 |
Grass的解决方案
Grass通过将请求路由到数百万个住宅连接来解决这个问题,这些连接的所有者选择加入网络并因其贡献获得报酬。
与之前时代的许多代理网络不同:
| 传统代理网络 | Grass |
|---|---|
| 制造硬件 | 不需要 |
| 与ISP批发交易获取住宅连接 | 不需要 |
| 在消费者不知情下渗透设备 | 不需要 |
| — | 用户已在为连接付费,大部分容量未被使用 |
商业验证:通过“阈值规模”的考验
Multicoin在2023年关于DePIN网络设计的文章中,将 “阈值规模” 描述为网络的分布式供应变得具有商业可用性的临界点。
代币在那个临界点之前特别强大,因为它们可以奖励人们为尚未有足够覆盖来吸引客户的基础设施做出贡献。真正的考验在那之后到来:网络能否销售可靠的服务,并最终为其所使用的供应付费。
Grass是少数通过这一考验的网络之一。
关键数据
| 指标 | 数据 |
|---|---|
| 贡献者 | 超过 600万 |
| 奖励性质 | 以美元计价的奖励,完全由贡献直接产生的收入资助 |
| 2025年收入 | 1700万美元 |
| 2026年上半年收入 | 1700万美元 |
| 客户复购 | 几乎每个AI客户都有回头业务 |
| 盈利状态 | 公司称已实现盈利 |
| 2026年训练数据收入预测 | 7500万美元 |
03. 现在:实时上下文检索——为什么这个市场更大?
当前的训练数据业务规模可观,应该会继续增长。然而,这种产品的本质天然是“时间点”式的。
如果你问一个模型某家公司今天早上宣布了什么,或者某航班是否延误,或者某个网站现在显示什么,存储在其权重中的信息将不够用。它必须搜索来源,打开相关页面,并实时读取。一个处理更复杂任务的代理在能够回答之前可能需要多次重复这个过程。
市场规模估算
| 维度 | 说明 |
|---|---|
| 训练采购 | 围绕模型运行发生 |
| 实时信息 | 可以被每个模型、应用和代理消费 |
| 定价参照 | 按历史上公开上市的搜索API价格计算,即使请求量的一小部分也能支撑数十亿美元的年收入 |
互联网本身正在变得更大
更多信息将以传统搜索引擎难以处理的形式发布:
| 形式 | 说明 |
|---|---|
| 视频 | — |
| 图像 | — |
| 电子表格 | — |
| — | |
| 动态页面 | — |
使这一不断扩大的信息体能够被机器发现和解析是一个巨大的机会,而且在技术上绝非易事,因为它需要全球规模的持续爬取、存储、处理、排序和快速交付。
Grass的推进路径
| 产品 | 功能 |
|---|---|
| Contents API | 允许模型通过住宅网络打开和渲染公共页面 |
| Search API | 帮助模型首先确定应该打开哪个页面 |
| 网络索引 | 支撑搜索和检索的基础设施 |
这两个产品都建立在Grass已经为训练客户运营的机制之上:根据地理和声誉将请求路由到住宅节点,测量响应质量,并将收集到的内容转化为足以用于前沿训练运行的数据集。
已有积累:Grass已经收集了超过 10亿个 公共网络视频,其中一部分用于与另一家Multicoin投资组合公司Inference.net训练视频标注模型。
04. 为什么这构成护城河?
建设如此规模的互联网索引,需要大量资本与工程资源的投入。
这向来是构建深护城河、高利润率、定价权型基础设施的代价。
基本面复利效应
| 环节 | 效果 |
|---|---|
| 每一次大规模训练数据交付 | 让Grass有理由改进覆盖范围,更深入理解客户所需的信息 |
| 更好的覆盖 | 改进索引 |
| 更好的索引 | 改进实时检索 |
| 成功的检索 | 让实验室更有理由在Grass上构建 |
假以时日,无论模型架构如何演进,这套基础设施都能为预训练、后训练和推理提供稀缺数据。
05. 未来:充裕的智能
智能体需要读取的互联网,其增长速度将超过搜索引擎当初为索引而构建的那张网。
| 趋势 | 说明 |
|---|---|
| 信息创建 | 智能体会以机器速度创建和修改信息 |
| 答案形式 | 越来越多地存在于视频、文档和动态应用中 |
| 预训练数据集 | 会变得越来越依赖上下文和特定领域的知识 |
构建并服务这些模型所需的输入,要求以精确方式协调数百万个离散资源。
Grass已经解决的难题
| 问题 | 说明 |
|---|---|
| 路由 | 哪个连接能够到达源头 |
| 质量 | 响应是否完整 |
| 频率 | 一个源应该多久重新访问一次 |
| 延迟 | 如何在实时模型的成本或延迟要求内返回结果 |
06. 收入潜力测算(脚注)
以下测算来自Multicoin原文脚注,仅为说明市场规模潜力,不代表实际收入预测。
| 假设 | 数据 |
|---|---|
| ChatGPT日消息量 | 约 35亿条 |
| 调用外部工具比例 | 22% |
| 触发付费搜索比例(假设10%) | 每年约 1280亿次 请求 |
| 按Brave每1000次5美元计算 | 约 6.4亿美元 |
| 智能体放大效应 | Gemini Deep Research任务约运行 80次 搜索 |
| 研究级智能体任务转化(假设1%) | 推至 1万亿次 请求以上,约每年 50亿美元 |
07. 结语
多年来Multicoin一直主张,代币能够帮助基础设施网络达到临界规模。Grass正在展示达到之后会有什么可能。
训练收入为抓取和索引提供了资金,而与实验室的关系现在能够把这项投资导向越来越大的合同。
Grass团队是“在资源聚合加密网络中遇到的最专注的运营者之一,他们的野心没有上限:让不断扩展的多模态互联网,对机器智能实时保持可读。”









