AI 时代的“数据控制权”之争:Harness 成为新战场
The Harness Is the New Battleground
继 SaaS 之后,企业数据正通过 AI 使用轨迹(trajectories)流向模型厂商,引发数据主权担忧。纳德拉与帕兰提尔 CEO 同时警告数据泄露风险;7 月 13 日,安全研究员逆向 xAI 的 Grok Build 发现,零 AI 调用会话也会上传开发者代码库,xAI 已禁用该行为。未来 CIO 与 CEO 将要求零数据保留,厂商须承诺不访问企业数据。
作者把 Nadella 与 Karp 的同周表态和 Grok Build 上传代码事件串起来,指出 AI 时代企业数据可能经由 harness 变成厂商资产,数据留存条款或成采购核心。
SaaS 时代打破了先例:企业首次将数据存储在供应商的云上,而非自家大楼里的服务器上。这一延续了 20 年的趋势会在 AI 世界里延续下去吗?这个问题引人深思,也正是当下争论的焦点。
Satya Nadella 在周末写道:
“你实际上要为智能付两次费,一次用金钱,另一次则用更宝贵的东西:为了让这份智能发挥作用,你必须交出的专有知识。”1
一周前,Alex Karp 在 CNBC 的 Squawk Box 节目中表示:
“[前沿实验室]正在窃取我业务的权重与 alpha。”2
Karp 和 Nadella 既是前沿实验室的合作伙伴,也是它们的竞争对手。两人在同一周就同一个警告达成一致,反映出企业软件领域正在蔓延的一种更广泛的、对数据流失的恐惧。
7 月 13 日,一位安全研究员对 xAI 的 Grok Build 二进制文件进行了逆向工程,发现一个零 AI 调用的会话将开发者的代码库上传到了 xAI 的云上。3 xAI 此后已禁用了这一行为。
AI 模型需要数据来学习;这并非新鲜事。
Google Analytics 在网页上就是这么做的。用户访问一家蜡烛店的落地页,点击礼品专区,找到一张优惠券并完成结账。推荐系统会为下一位访客变得更好。
就像蜡烛店里的那位顾客一样,每当有人向 AI 发起查询,就会产生信息。这些数据被称为轨迹(trajectory)。
对 AI 而言,数据总是越多越好,而 AI 实验室会为此付费。初创公司通过付费请专家使用 AI 来生成轨迹,从而采集数据。另一些公司则训练新的 AI 来合成轨迹,模仿用户行为。这些公司合计创造了约 $10b 的收入,是有史以来增长最快的初创公司之一。4
与 SaaS 不同——在 SaaS 中,这些数据存放在只有客户才能访问的数据库里——轨迹可以被反馈回模型,用来改进 AI。客户的数据可能成为供应商知识产权的一部分。
内部数据会与轨迹混在一起吗?商业机密呢?你如何回复客户支持工单?你的品牌定位是什么?你的员工薪酬是多少?
所有这些都流经一个 harness。
harness 是用户借以与 AI 协作的软件,比如 Claude Cowork 或 Cursor。
胜出的 harness,是那些通过智能地调度 AI 来最大化用户生产力的 harness。
CIO 和 CEO 将要求零数据留存。数据被完全删除,而非完全匿名化。围绕匿名化的技术还不够强大,无法为此提供保障。
这一趋势需要演进,并做出与软件同等的保证:供应商无法访问企业数据,也不会将其用于自身目的。
过去 20 年,人们一直在论证供应商可以值得信赖地持有数据。未来 20 年将要求同样的保证。
-
“Palantir 的 Karp 抨击基于 token 的 AI 商业模式‘完全错误’”,CNBC Squawk Box,2026 年 7 月 1 日。↩︎
-
@hrkrshnn 在 X 上,2026 年 7 月 13 日。↩︎
-
@deedydas 在 X 上,“所有销售 AI 训练数据的初创公司(2026 年 7 月)”,2026 年 7 月 12 日。↩︎
来源:Tomer Tunguz 博客(VC 分析) · tomtunguz.com