美中经安会把国家数据战略列为头号建议

美国国会下属的美中经济与安全审查委员会发布年度评估,把中国将数据作为战略性国家资产来商业化、货币化的做法,列为可能影响人工智能竞赛走向的因素。委员会副主席迈克·凯肯(Mike Kuiken)在发布会上说,制定国家数据战略是委员会的头号建议。

他的表述是:委员会建议美国国会思考一份国家数据战略,以及美国政府如何把数据当作一项经济资产来对待。同一份报告说得更直接,称北京正在”marshalling data to drive productivity”,同时用于改善情报收集与军事能力。

能爬的和爬不到的

报告里最具体的一条判断,落在数据类型的分野上。

美国主要 AI 公司用于训练语言模型的公开互联网语料,已经接近见底。而中国正在系统性收集的,是另一类东西:企业数据、运营数据和物理世界数据,报告用的措辞是”cannot be scraped”。这些数据服务的对象是面向企业的 AI 工具、自动驾驶车辆和人形机器人。

这条分野决定了竞争形态的变化。文本语料的获取是网络问题,谁爬得快、清洗得好、买得起版权,谁就领先一步;物理世界数据的获取是产业问题,得有产线在转、有车队在跑、有医院在用,数据才会一条条掉出来。报告顺着这条线给出的推论是,中国的先进制造和工业机器人生态提供了大量高质量的场景数据,在机器人软件开发上有可能走到美国前面。

一套讲了六年的政策

报告梳理的中国这边的时间线并不新鲜。2020 年,数据被列为与土地、劳动力、资本、技术并列的生产要素;2023 年,国家数据局设立;此后是数据资产入表、行业标准化和数据交易场所的铺开。报告点名的重点行业包括制造、交通、金融和医疗,也提到中国企业已经开始把自有数据集挂到上海、深圳、北京等地的交易场所,全国范围内的数据交易机构数以千计。

差异出在评估口径上。国内围绕数据要素的讨论,重心长期落在确权、定价、入表这些制度环节上,进展快慢各方看法不一;而这份报告不评价制度细节,只把它当作一套已经运转起来的供给机制来估算后果。同一件事,站在里面看是政策落地的进度条,站在外面看是竞争对手的产能。

标准这一环

除了数据战略,报告还给了一条关于国际标准的提醒:标准一旦被采纳就很难修改,现在参与比事后试图推翻一项既成标准更有效。

这句话指向的是数据格式、互操作接口、行业数据字典这类基础设施性质的规则。它们不上新闻,却决定了将来谁的系统接得进来、谁需要额外做一层转换。工业互联网、车路协同、医疗影像这些领域的标准之争已经打了几年,报告的意思是美方在这些桌子上出席得不够。

对国内从业者,这份报告的用处不在结论,在它反过来提供的一份清单:外部观察者认为中国手里的牌是哪几张。制造场景的数据密度、机器人训练数据的供给、行业标准的先行权,这三样被单独拎了出来。至于牌能不能打好,取决于数据在企业之间流转的实际摩擦有多大,那部分不会写在任何一份外部评估里。

参考来源:美中经济与安全审查委员会报告、路透社、CocoLoop、南华早报;引语与建议排序取自委员会副主席公开表态及报告正文表述,数据要素与国家数据局的政策节点按公开资料核对。