美中經安會首要建議:國家資料戰略

美國國會下轄的美中經濟暨安全審查委員會(USCC)發布年度評估報告,將中國把資料當成戰略性國家資產來商業化、貨幣化的做法,列為可能左右人工智慧競賽走向的因素之一。委員會副主席麥克.凱肯(Mike Kuiken)在發布會上表示,制定國家資料戰略是委員會的首要建議。

他的說法是:委員會建議美國國會思考一套國家資料戰略,以及美國政府該如何把資料當作一項經濟資產來對待。報告本文說得更直白,指北京正在「marshalling data to drive productivity」(動員資料以推動生產力),同時也把資料用於提升情報蒐集與軍事能力。

爬得到的與爬不到的

報告裡最具體的一項判斷,落在資料類型的分野上。

美國主要AI公司用來訓練語言模型的公開網路文字語料,已經接近見底。而中國正在系統性蒐集的,是另一類東西:企業資料、營運資料和實體世界資料,報告用的字眼是「cannot be scraped」(無法被爬取)。這類資料服務的對象是面向企業的AI工具、自動駕駛車輛和人形機器人。

這條分野正在改變競爭的形態。文字語料的取得是網路端的問題,誰爬得快、清理得乾淨、負擔得起授權費用,誰就先馳得點;實體世界資料的取得則是產業端的問題,得有產線在運轉、車隊在跑、醫院在運作,資料才會一筆一筆地產生出來。順著這條邏輯,報告推論中國先進製造業與工業機器人生態系提供了大量高品質的場域資料,在機器人軟體開發上有機會超前美國。

一套講了六年的政策

報告梳理的中國這一側時間軸並不新鮮。2020年,資料被列為與土地、勞動力、資本、技術並列的生產要素;2023年,國家數據局成立;此後陸續是資料資產入帳、產業標準化,以及資料交易所的鋪開。報告點名的重點產業包括製造、運輸、金融與醫療,也提到中國企業已開始把自有資料集掛牌到上海、深圳、北京等地的交易所,全國各地的資料交易機構數以千計。

差異出在評估的角度。中國內部圍繞資料要素的討論,長期聚焦在權屬確認、定價、入帳這些制度層面,各方對進度快慢看法不一;而這份報告不評價制度細節,只把它當成一套已經在運轉的供給機制來估算後果。同一件事,從裡面看是政策落地的進度條,從外面看則是競爭對手的產能。

標準這一環

除了資料戰略之外,報告還就國際標準給出一項提醒:標準一旦被採用就很難修改,現在參與其中,比事後想推翻一項既成標準要有效得多。

這句話指向的是資料格式、互通介面、產業資料字典這類具有基礎設施性質的規則。它們不會上新聞,卻決定了將來誰的系統接得進來、誰又得多做一層轉換。工業互聯網、車路協同、醫療影像這些領域的標準之爭已經打了好幾年,報告的言下之意是美方在這些場合出席得不夠。

對於本地從業者來說,這份報告的用處不在結論本身,而在它反過來提供的一份清單:外部觀察者認為中國手上握有哪幾張牌。製造場域的資料密度、機器人訓練資料的供給、產業標準的先行權,這三樣被單獨點了出來。至於牌能不能打好,取決於資料在企業之間流通時實際的摩擦有多大,而這部分不會寫進任何一份外部評估裡。

參考來源:美中經濟暨安全審查委員會報告、路透社、CocoLoop、南華早報;引語與建議排序取自委員會副主席的公開表態及報告正文,資料要素化與國家數據局的政策節點已按公開資料核對。