据 Electrek 报道,埃隆·马斯克曾说,特斯拉得攒够 60 亿英里的自动驾驶累计行驶里程,才能实现不用人盯着的无监督自动驾驶;到 2026 年 1 月,他把这个门槛改口成了 100 亿英里。门槛两年内至少调整一次,这只能说明”要跑够多少英里才算数”本身还没有定论,不能反过来直接当成”数据护城河不稳”的证据——真要判断,还得看数据积累速度、专有性,以及这些数据有没有真的变成产品优势。数据护城河,说的是一个公司积累的数据,能不能变成竞争对手短期内照搬不去的产品体验或成本优势,不是看数据库里躺了多少条记录。
数据护城河,说白了就是一家公司攒的数据,能不能变成别人短期内没法复制的产品体验或成本优势,不是单纯比谁库存的条数多。这个词近几年被用得很随便,差不多每家攒了点用户数据的公司都会来一句”我们有数据优势”,但掰开看,大部分讲的其实是另一码事。
数据规模大,不等于护城河深
风投机构 a16z 拆过一个客服聊天机器人的案例:这类产品的意图覆盖率曲线会随数据积累逐渐走平,在这个案例里覆盖到 40% 左右就基本趋平,再往后堆数据,边际提升很小,采集和清洗成本却越来越高(a16z:The Empty Promise of Data Moats)。40% 只是这一个案例的数字,不是所有数据产品都适用的通用门槛,但背后的规律值得记住:过了某个节点,新增数据带来的改善会越来越小,这和”买得越多单位成本越低”的规模经济逻辑是两股道上跑的车。
同一篇文章还提了 Netflix 推荐引擎:看过电影 X 的人通常也爱看剧集 Y,这类相关性数据确实能让推荐更贴合。这算是种学习循环,但学习循环本身就说明不了护城河有多深。对手只要也在攒同类使用数据,这条循环早晚会被追上,快慢只取决于对手拿不拿得到同样规模的用户行为。
大部分人说的”数据优势”其实是规模效应
哈佛商业评论 2020 年一篇文章把这层错觉说破了:不少管理者和投资人觉得,攒了客户数据就能握着对手撼不动的优势,但大多数情况下这个想法站不住(HBR:When Data Creates Competitive Advantage)。人们往往把数据带来的好处想得太大了。作者是波士顿大学的 Andrei Hagiu 和新加坡国立大学的 Julian Wright,他们把”数据带来的学习循环”和”真正的网络效应”拆开看——前者其实平常得很,后者才难得。
这点和规模效应和网络效应有什么区别?讲的东西相通:数据多了,公司自家产品可能更顺手,可如果这让老用户并没额外受益更多,骨子里只是内部规模效应,谈不上数据护城河。
怎么判断数据护城河是真是假?
判断数据护城河真假,把专有性、边际收益方向、产品优势、保鲜成本这四条逐条打分:强、弱,或者证据不够先标待验证。强项越多,护城河越扎实;弱项或待验证项越多,越可能只是数据规模效应换了件外衣——这和切换成本是真护城河吗?里讲的道理一样,护城河判断从来不是有和没有的二选一。
内部两条,看数据本身够不够特殊
专有性和边际收益方向,回答的是”这批数据自己值不值钱”。
| 标准 | 强信号 | 弱信号 |
|---|---|---|
| 专有性 | 数据来源靠牌照、法规或独家渠道保护,对手拿不到同一批数据 | 数据是公开抓来的或买来的,花钱就能搞到水平差不多的数据集 |
| 边际收益方向 | 新增数据仍能让准确率、匹配度或使用效果明显变好 | 覆盖率过头之后,新数据带来的好处几乎可以忽略 |
创投机构 Eniac Ventures 合伙人 Vic Singh 提过一句话:光产生数据不够,公司还得能从数据里拎出能上手的洞察,才谈得上加固自己的竞争位子(Eniac Ventures:Compounding Economic Moats for Technology Companies)。这话点破了专有性之外的另一层事——数据攒得住,不等于数据读得懂。
外部两条,看数据能不能变成搬不走的优势
产品优势和保鲜成本,回答的是”这批数据能不能一直罩得住”。
| 标准 | 强信号 | 弱信号 |
|---|---|---|
| 产品优势 | 数据能持续变成对手不好学的产品升级,比如更准的风控模型、更低的运营成本 | 数据存得挺多,但产品体验对照同行没什么两样 |
| 保鲜成本 | 数据不会很快过期,或者公司有固定的更新办法维持新鲜 | 得老重新训练、重新采集刮一遍才能跟上,维护成本盖过拿到的甜头 |
a16z 那篇文章点过名:征信行业的 Equifax、LexisNexis、Experian 能站稳几十年。原文给出的理由是,这几家公司的数据来源本身就稀缺,且数据提供方大多只愿意跟单一厂商合作,这种行业结构让它们攒下了别人拿不到的专有数据集(a16z:The Empty Promise of Data Moats)。这只能确认专有性这一条站得住;这批数据具体带来多大的风控优势、有没有可核验的数字,a16z 原文没有展开,需要结合三家公司各自的业务资料再判断。
这套标准套在真实公司身上,结果是什么?
拿四条标准逐个套三个例子,能看得出来”数据多”根本不等于”护城河深”。有的只有专有性能确认、其余几条还要看业务数据,有的连及格线在哪都还没讲明白,有的学习循环快但专有性不够硬。
征信数据:专有性站得住,其余几条还要看业务数据
Equifax、LexisNexis、Experian 这类征信和背景调查公司,长期握着普通创业公司拿不到的信用记录,数据积累了几十年。我们按四条标准把这个案例查了一遍,实际操作是这样的:
- 专有性:强。这几家公司的信用记录来自银行、放贷机构等长期合作方,不对公众开放,普通创业公司确实拿不到同一批数据。
- 边际收益方向:待验证。翻了公开的年报和投资者材料,只找到营收和客户数,没查到”新增数据具体带来多少风控模型准确率提升”这类可核验的数字。
- 产品优势:待验证。同样是查年报,公司会讲”数据驱动的风控能力”,但没有披露和同行对照的具体效果差距。
- 保鲜成本:待验证。年报里提”持续更新数据库”,但没披露维护支出占营收的比例。
翻完这些公开材料,说实话有点意外——公司反复强调”数据优势”,真正能核验的数字却只有专有性这一项。只凭专有性一条过关,不能打包票说”整体上护城河是真的”,更准确的说法是专有性扎实,其余三项有待具体业务数据验证。
特斯拉自动驾驶里程:规模巨大,可连及格线在哪都没讲明白
据 Electrek 报道,截至 2026 年 5 月 3 日,特斯拉”有监督”完全自动驾驶(FSD Supervised)车队的总行驶里程超过 100 亿英里(Electrek:Tesla FSD 10 billion miles),这个数字来自车队自己上传的行驶数据,特斯拉官方安全报告页面同步披露了同期的碰撞率统计(特斯拉官方安全报告)。“有监督”是个要划重点的词,就是说司机还得随时准备接手,跟完全无人的自动驾驶里程不是一种统计尺度。这 100 亿英里说的是”车队实际跑了多少”,和马斯克说的”要跑够多少英里才能做无监督”不是同一码事:据 Electrek 转述,马斯克在 2026 年 1 月表示,公司大约需要 100 亿英里真实驾驶数据才做得出安全的无监督自动驾驶,而这个门槛他早先给的说法是 60 亿英里(Electrek:Musk moves goalpost again)。
拿四条标准逐项打分,加上 2026 年一季度以来的最新进展一起看:
- 专有性:强。据 Electrek 2026 年 5 月的报道,特斯拉车队规模”是对手目前复制不了的优势”(Electrek:Tesla FSD 10 billion miles)。
- 边际收益方向:待验证。门槛数字两年内从 60 亿英里改口到 100 亿英里,特斯拉没有公开数据证明”再多攒几亿英里就一定够解决问题”。
- 产品优势:弱/待验证。截至 2026 年一季度财报电话会议,无监督 Robotaxi 只在得州奥斯汀、达拉斯、休斯顿几个城市小范围试运营,2026 年 1 月奥斯汀那次”无监督”标签一周后就被撤回(Electrek:Tesla’s ‘Robotaxi’ expansion looks like another stock pump before earnings);消费者 FSD 仍是”有监督”,据财报电话会议披露,搭载 Hardware 3 的车辆无法达到无监督标准(Not a Tesla App:Tesla Q1 2026 财报电话会议摘要)。数据规模还没兑成对手抄不动的产品。
- 保鲜成本:待验证。路况、法规、车型一贯在变,公开资料没给出特斯拉数据维护成本的具体数字。
四项里目前只有专有性能打”强”,其余三项证据都不够,这个案例更适合归进”数据规模巨大,但护城河牢不牢还没有定论”,不能只凭数据量大就断定护城河更深。
视频推荐数据:学习循环快,专有性容易被追平
Netflix 这类用观看行为数据训练推荐算法的产品,学习循环踏得挺快,用户看得多,推荐就更灵,踩中”边际收益方向”早段说得通。但这类数据多半剩不下好的专有性——对方也在攒同一型的观看与点击数据,推荐效果的差距拉不了太久。这也解释了为什么”越用越聪明”常被包装成护城河来吹,而真正扎实的那一块,更多是靠内容库和独占版权,并不靠推荐数据本身。
数据护城河常见的坑有哪些?
数据护城河容易踩的坑,一是把”数据量大”直接当成护城河,二是忽略数据会过时、维护要花钱这两项隐性成本。
把”数据量大”当成护城河,是一种常见误判
看到一家公司说”我们有海量数据”,先别急着把它算作护城河。按前面四条标准打分:这批数据别人能不能拿到、新增数据还有没有带来提升、数据有没有变成对手复制不了的产品改进、数据是不是很快就会过时。哪一条明显偏弱,这个”数据优势”在那一环就打折扣,弱项越多,越可能只是规模效应的另一种说法。
- 数据来自公开渠道或第三方采购 → 专有性偏弱。
- 覆盖率已经很高,新数据边际提升趋近于零 → 边际收益方向偏弱。
- 数据攒了很多,产品体验和竞品差不多 → 产品优势偏弱。
- 模型需要频繁重训才能不过时,维护成本很高 → 保鲜成本偏弱。
忽略数据保鲜成本,是容易被漏掉的隐性风险
数据不是攒下来就一直有效。用户偏好会变、市场环境会变、监管要求也会变,旧数据不持续更新,价值会随时间衰减。这项成本常被公司的宣传话术盖住——讲”我们有十年数据积累”时,很少讲清楚这十年里有多少数据已经过时,又花了多少钱去维护和重新训练。判断一家公司的数据护城河,与其只问”攒了多少年”,不如多问一句”这些数据现在还准不准”。数据护城河站得住,也不代表公司自己不亏钱——护城河挡的是”对手抢不抢得走客户”,公司自身的成本和现金流是另一件事,具体可以参考护城河强,公司为什么还会亏钱?。
拿这套四条标准给你正在看的公司或项目打分:数据别人能不能拿到,新数据还值不值钱,数据有没有真的变成产品上的差距,维护这批数据要花多少钱。强项越多,护城河才越站得住。
常见问题
Q: 数据护城河和网络效应是一回事吗?
答: 不是。网络效应指新用户加入后,已有用户能免费获得更多价值,机制发生在用户之间;数据护城河指数据积累能不能变成对手复制不了的产品或成本优势,机制发生在公司和它的数据资产之间。两者有时会同时出现,比如平台数据越多、匹配越准,进而吸引更多用户,但判断标准不一样,不能混着讲。
Q: 数据量大的公司是不是护城河一定更深?
答: 不一定。数据量只是起点,真正决定护城河深浅的是专有性、边际收益方向、产品优势和保鲜成本这四条。很多数据量很大的公司,边际收益早就趋平,新增数据带来的提升接近于零,这时候数据量大反而说明护城河可能没那么深,只是攒得多而已。
Q: 创业公司没有海量数据,是不是就没机会靠数据建立优势?
答: 不一定靠数据量取胜。中小公司更现实的路径是先找专有性强的细分数据源,比如某个垂直行业里别人拿不到的一手数据,再把它快速变成产品改进,而不是和大公司比谁的数据库更大。数据护城河的关键从来不是规模,是这四条标准站不站得住。
Q: AI 大模型普及之后,数据护城河是不是变得更重要了?
答: 数据的重要性没变,但获取门槛在下降。通用能力越来越容易从公开模型和公开数据里获得,这会削弱那些依赖”数据量大”但专有性不强的护城河。反过来,专有性强、别人拿不到的细分数据(比如受牌照保护的行业数据、独家一手业务数据)价值可能更突出,因为调用一个通用大模型补不上这块空缺。
Q: 数据护城河会不会随时间自动变强?
答: 不会自动变强,要看数据是不是在持续变成产品优势。数据护城河也会随时间变弱,比如竞争对手追上同等数据规模、数据本身过时、维护成本压过收益。判断一家公司的数据护城河,不能只看某个时间点的数据总量,还要看这批数据是不是仍在带来边际提升,维护它的成本划不划算。
Q: 怎么快速判断一家公司说的”数据优势”是不是在讲故事?
答: 问四个问题:这批数据别人能不能拿到;新增数据还有没有明显提升效果;数据有没有变成对手复制不了的产品改进;这批数据多久之后会过时。如果对方只能回答”我们数据很多”,答不上后面三个问题,这句”数据优势”大概率只是一个听起来不错的说法,还没有变成真护城河。
参考资料
- a16z:The Empty Promise of Data Moats
- Harvard Business Review:When Data Creates Competitive Advantage
- Eniac Ventures:Compounding Economic Moats for Technology Companies
- Electrek:Tesla FSD Crosses 10 Billion Miles
- Electrek:Elon Musk Moves Goalpost Again
- Electrek:Tesla’s ‘Robotaxi’ Expansion Looks Like Another Stock Pump Before Earnings
- Not a Tesla App:Tesla Q1 2026 财报电话会议摘要
- 特斯拉官方安全报告
版本 1.0 · 更新于 2026-08 · 本文帮你判断一家公司说的数据优势是真护城河还是数据规模效应,不构成投资建议;真要据此做经营或投资判断,还要结合公司完整数据和自己的情况。