多雲 AI 部署中的數據主權,已經不再是法律條款裏的一個腳註——它是一項架構約束,決定你的模型能在哪裏運行、可以用哪些雲、以及你能以多快的速度交付。有三股力量在此交匯。其一是監管:歐盟的 GDPR 框架、中國的《個人信息保護法》與《數據安全法》、印度的 DPDP 法案,以及金融與醫療領域的行業規則,都對數據處理施加了基於地理位置的條件。其二是地緣政治:對高端加速器的出口管制意味着你原本以爲可以隨意調度的 GPU 容量並非通用。其三是 AI 本身:一個在個人數據上訓練或推理的模型,把"處理"可能發生的地點成倍放大,因此也成倍放大了你必須回答的合規問題。本系列第一部分討論過整體格局,這一部分講到底該建什麼。
現實的困境在於,大多數企業發現主權問題的時間太晚。它們先標準化在一家超大規模雲上,出於延遲考慮把工作負載鋪到多個區域,然後纔去問法務這些數據流是否合法。逆轉這一步既昂貴又緩慢。另一種做法是從一開始就把主權當作設計輸入——一套分類體系、一條放置策略,以及一個能自動執行二者的控制平面。做得好,它不是 AI 採納的剎車,而恰恰是你能在受監管市場裏推進 AI、而競爭對手還卡在法律評審裏的原因。
駐留、本地化與主權三者有何區別?
這三個詞在廠商材料裏被混用,在合同裏卻有實質差異。把它們分清,是性價比最高的一項風險消減。
數據駐留(residency)是關於存儲的承諾:字節落在某個具名地域的磁盤上。它是三者中最弱、也是被提供得最多的一種。一家供應商可以把你的數據放在法蘭克福,同時把元數據、備份或支持訪問複製在別處。
數據本地化(locality)同時覆蓋處理與存儲:計算在區域內完成,結果也留在區域內。這是絕大多數 AI 工作負載真正需要的層級,因爲推理是處理,不是存儲。
數據主權(sovereignty)是一個法律聲明:數據始終受某個具名司法轄區的法律管轄,並由此受該轄區權力機關合法調取請求的約束。這是最強的一項主張,也是供應商最難做出的承諾,因爲它取決於公司結構與控制權,而不只是機櫃位置。
你要向供應商提出的關鍵問題是:"誰能夠強制你交出我的數據?"一家在歐洲運營區域的美國母公司供應商,對於它所控制的數據,仍可能落在美國法律程序的範圍之內,無論磁盤在哪裏。主權雲產品——由本地合作方在本地控制下運營——正是爲了給這個問題一個不同的答案,代價則是服務廣度收窄。請按數據類別判斷你究竟需要三者中的哪一個:在本只需駐留的地方爲主權付費是浪費預算,而在確需主權的地方只拿到駐留則是製造責任。
如何爲數據主權目的對數據進行分類?
下游的一切都取決於分類,而大多數項目把它設計得過於複雜。四個層級足夠,每一級對應一條放置規則。
- 第 0 級——公開或合成數據。已發佈材料、合成訓練數據、匿名化聚合結果。任意區域均可。這一級覆蓋的 AI 工作負載通常比團隊預想的更多,正確歸類它能釋放真實的容量。
- 第 1 級——內部非個人數據。產品遙測、設備傳感數據、非個人的運營指標。區域靈活,但受行業規則與底層技術的出口管制約束。
- 第 2 級——個人數據或機密業務數據。客戶記錄、員工數據、定價、合同。綁定於特定司法轄區,出境需經批准的傳輸機制,並要求使用客戶自管密鑰加密。
- 第 3 級——受監管或國家敏感數據。健康記錄、支付卡數據、持牌金融數據,以及任何被列入國家安全或關鍵信息基礎設施清單的內容。僅限境內,通常還要求本地密鑰託管與審計權。
兩條規則讓它可操作。第一,在接入時分類,並把分類標籤寫入隨數據一起流轉的元數據——一份丟失標籤的數據集,就是一份會被放錯位置的數據集。第二,明確定義衍生數據的規則:如果第 2 級數據訓練了一個模型,這個模型屬於哪一級?站得住腳的答案是:在證明相反之前,模型繼承其訓練輸入中的最高層級。這正是許多項目把敏感微調限制在境內算力上、而不是試圖論證"模型是另一件東西"的原因。
哪些架構模式真正可行?
四種模式覆蓋了現實的選擇空間。成熟的資產組合通常同時採用其中兩到三種,按數據層級選擇。
按區域主權化("每個司法轄區一個着陸區"模型)。每個轄區擁有各自隔離的訂閱或賬號、各自的密鑰保管庫、各自的日誌與身份邊界。數據默認不跨界。跨境流動需要顯式、經過評審並被記錄的導出。這是最昂貴、也最易審計的一種,是第 3 級數據的正確默認選項。
全局控制平面、區域數據平面。統一的管理體驗,多個區域數據存儲。部署、監控和模型註冊表放在全局;客戶數據永不離開其所屬區域。這是大多數企業應當追求的模式,因爲它在滿足駐留與本地化要求的同時,把運維開銷維持在可承受範圍。難點在於紀律:控制平面上任何觸及載荷數據(而非元數據)的功能,都是一個潛在泄漏點。
機密計算飛地。基於硬件的可信執行環境讓數據在"使用中"也保持加密,因此連宿主機的運營方都無法讀取。這是對"誰能強制你的供應商交數"這一問題最強的技術答案,而且在合理成本下已可用於推理。它本身並不解決法律問題,但能實質性強化你的論證。
聯邦學習與拆分學習。在本地訓練,只共享模型更新。當法規禁止集中數據時,聯邦方法讓你在不搬動記錄的前提下跨轄區學習。代價是真實的——收斂更慢、調試更難,且存在梯度泄漏的實風險——但對醫療與金融聯盟而言,這常常是唯一合法的路徑。
| 模式 | 適用場景 | 成本 | 可審計性 | 主要取捨 |
|---|---|---|---|---|
| 每轄區主權着陸區 | 第 3 級、公共部門、持牌數據 | 高 | 優秀 | 基礎設施與運維重複建設 |
| 全局控制平面 / 區域數據平面 | 跨國規模下的第 1–2 級 | 中 | 良好 | 需要嚴格的元數據紀律 |
| 機密計算飛地 | 共享基礎設施上的高敏感推理 | 中高 | 良好(基於遠程證明) | 服務廣度受限、證明機制複雜 |
| 聯邦 / 拆分學習 | 醫療、金融聯盟、跨境研究 | 高 | 一般 | 收斂慢、存在梯度泄漏風險 |
跨雲場景下的密鑰與加密該如何處理?
加密是必要但不充分的;真正決定主權答案的是密鑰託管。如果密鑰在供應商手裏,加密只能防住硬盤被盜,別的什麼也防不住。
自帶密鑰(BYOK)指你生成密鑰材料並導入供應商的密鑰管理服務。供應商仍需在內存中使用該密鑰來處理你的數據,但創建、輪換與吊銷由你掌控。這是第 2 級的基線要求。
自持密鑰(HYOK)指密鑰永不脫離你的託管——通常是本地或境內的硬件安全模塊(HSM)。雲側按次請求包裝密鑰。這是最強的模型,也是對運維要求最高的:一旦你的 HSM 不可達,工作負載就會停擺。必須爲這種失敗顯式設計,並配備記錄在案的緊急破窗流程。
外部密鑰存儲是正在興起的中間路線:供應商的 KMS 前面掛一個你控制的密鑰庫,讓你擁有吊銷權,又不必爲每次運算硬依賴自有硬件。
兩條實操規則。按數據層級和司法轄區分離密鑰層級結構,使吊銷某一轄區的訪問不會級聯擴散。並且把每一次密鑰操作記錄到數據所屬轄區的不可變日誌中——當監管方問"誰在什麼時候可能解密了什麼",那份日誌就是你的答案。
主權對 AI 層究竟意味着什麼?
AI 帶來了四個傳統數據體系不具備的主權面,而且每一個都已經讓真實項目喫過虧。
訓練數據來源可追溯性。如果你無法給出從模型回溯到其訓練記錄的血緣,你就無法回應刪除請求,也無法回答"我的數據有沒有被用過"。請爲每個模型版本維護一份訓練數據清單:來源數據集、分類層級、所屬轄區、同意依據。
推理位置。模型在哪裏運行,與數據存放在哪裏同等重要。把一位德國客戶的記錄發到部署在美國託管的推理端點,就是一次傳輸,即使沒有任何存儲過程。請按轄區部署推理端點,或使用按數據分類路由的區域網關。
提示詞與補全日誌。這是最常被遺漏的泄漏點。用戶把客戶數據粘貼進提示詞,提示詞被記錄下來,而日誌又經常被複制到位於另一區域的中央可觀測性棧。請把提示詞日誌按其輸入數據的同一層級處理,在採集時脫敏,並保留在區域內。
供應商的次級處理與模型改進。在合同層面確認你的提示詞與補全不會被用於供應商模型訓練,並確認次級處理方被披露且範圍受限。這通常只是一個配置項加一個合同條款——修復很便宜,發現得太晚則很貴。
這也正是架構與訪問交匯的地方。蜂啓諮詢(Beehive Strategy)通過 MCP 連接器和語義層接入各轄區的系統,按角色執行行級與列級安全,因此在一個國家提出的問題只會解析到該國的數據上。查詢留在轄區之內,只有治理元數據是全局的。由於平台原生嵌入即時通訊——運行在 Teams、Slack 或 WhatsApp 內——用戶無需讓數據離開本區域去填充中央看板即可獲得答案;平台以託管服務方式交付,每個轄區約兩週即可上線。
如何讓跨境傳輸變得合法?
凡是數據必須流動的地方,你都需要一個機制,而機制因轄區而異。實踐中重要的有三類:
- 充分性認定。當目的地已被認定爲提供充分保護時,傳輸無需額外文書。這是最快的路徑,但可能因政治變化被撤銷——務必準備備用方案。
- 標準合同條款(SCC)配合傳輸影響評估。這是歐盟對外傳輸的主力工具。你必須書面記錄目的地國家的法律、你所採取的補充措施,以及這些措施爲何有效。交付物是那份評估,僅籤條款並不足夠。
- 明示同意或約束性公司規則(BCR)。同意適用於範圍狹窄、確屬可選的加工處理,在規模上很脆弱。約束性公司規則適合集團內傳輸,批准耗時較長,但一旦獲批擴展性更好。
在中國,《數據安全法》與《個人信息保護法》對特定出境傳輸增加了安全評估或認證要求,並設有觸發強制申報的數量門檻。在印度,DPDP 框架把傳輸限制在已通知的地域之內。各地的實操含義是一樣的:維護一份傳輸登記表——每條數據流一行,記錄來源、目的地、層級、機制、評估日期與複覈責任人。當規則變化時,登記表會準確告訴你該重新審視哪些流動,而不必啓動一次全公司範圍的考古工程。
如何持續證明合規?
時點式審計在多雲體系裏必然失效,因爲體系每週都在變。三種機制可以把合規從一次事件變成一種屬性。
策略即代碼。用與基礎設施定義相同的語言表達放置規則,並在 CI 與准入控制階段強制執行。任何會把第 3 級數據放到轄區之外的部署,在它存在之前就會在流水線上失敗。這是槓桿率最高的一項控制,因爲它預防違規,而不是報告違規。
持續採集證據。把配置狀態、密鑰操作、授權授予與數據流事件採集到有明確留存期限的不可變日誌中,並把每一項控制映射到能證明它的證據上——這樣一次審計就是一次查詢,而不是一個項目。
帶告警的漂移檢測。按計劃比對實際放置與聲明策略——第 3 級每小時一次,較低層級每日一次——並對偏離發出告警。大多數主權事件並非出於惡意:它是一位善意的工程師啓用了新區域,或某項託管服務在悄悄複製。
然後度量它。有用的指標包括:實現自動化放置強制的工作負載佔比、發現策略違規的平均時間、每季度發現的未登記跨境流動數量,以及持有有效傳輸評估的第 3 級數據集比例。把這些與 AI 交付指標一起彙報給董事會——對管理層不可見的主權建設,就是會被砍掉預算的主權建設。
需要付出哪些成本與取捨?
對賬單要誠實,因爲這裏的意外會摧毀可信度。主權在四個地方花錢。
基礎設施重複建設。按轄區建設着陸區,意味着日誌、監控、身份與網絡各有 N 份。受影響範圍內的雲支出通常上浮 15–30%;如果早期就投入模板化,上浮會更少。
服務廣度收窄。主權區域與主權雲產品落後於全球目錄,有時落後數年。請按更少的託管 AI 服務、更多的自管組件來做規劃。
運維開銷。更多環境、更多密鑰層級、更多訪問複覈。超過兩個轄區之後,自動化就不是可選項了。
延遲與能力取捨。把推理留在境內,可能意味着比全局方案更小的模型或更慢的端點。請按用例量化這一點,而不是憑假設——對於大多數企業問答類工作負載,這個差異難以察覺,而規避掉的合規風險則不然。
團隊反覆犯的錯誤有哪些?
把駐留當作主權。"數據存放在新加坡"並沒有回答誰能強制披露。要問的是公司控制權那個問題。
遺忘非生產環境。合規事故幾乎從不發生在生產環境,而是某位開發者把真實記錄複製到位於另一區域的測試租戶裏。請在所有環境強制策略即代碼,並在低階環境使用合成數據。
忽略日誌、備份與遙測。它們默認就會複製,而且攜帶最多敏感的附帶數據。從第一天起就把它們納入分類。
假設模型不受轄區約束。模型權重可能編碼訓練數據,監管方也日益把它們納入範圍。請把敏感微調限制在境內算力上。
先採購、後分類。在還沒弄清自己的層級之前就鎖定供應商,等於爲所有東西買最受限的那一檔。先分類;省下來的錢通常就夠資助整個項目。
沒有退出計劃。如果某個轄區的規則改變,或某家供應商失去資質,你需要一條記錄在案的退出路徑。容器化工作負載、基礎設施即代碼、以及供應商中立的數據格式,纔是讓這條路真實存在、而非停留在紙面的東西。
90 天計劃應該長什麼樣?
第 1–30 天:分類與登記。清點數據資產與 AI 工作負載,劃定層級,建立傳輸登記表。交付物:一份站得住腳的地圖,說明有什麼、在哪裏、依何種機制流動。
第 31–60 天:強制最高層級。對第 3 級與第 2 級實施策略即代碼,搭建按轄區的密鑰層級,並切換風險最高的工作負載。交付物:自動阻斷最要緊的那幾類違規。
第 61–90 天:擴展與插樁度量。把強制範圍擴展到第 1 級與非生產環境,部署持續證據採集與漂移檢測,並針對一次監管調取開展桌面推演。交付物:可以按需出示、而非事後重建的合規能力。
把這件事做對的組織,會停止把主權視爲強加在 AI 之上的約束,轉而把它視爲自己的 AI 能夠進入競爭對手進不去的市場的理由。那纔是真正的回報。
常見問題
1數據駐留與數據主權的區別是什麼?
數據駐留是一項關於存儲的承諾:字節落在某個具名地域的磁盤上。數據主權則是一項法律聲明:數據始終受某個具名司法轄區的法律管轄,包括該轄區權力機關的合法調取權力。一家供應商可以滿足駐留要求,而其位於另一國家的母公司仍保留法律上的控制權,因此決定性的問題是「誰能夠強制披露」,而不是磁盤在哪裏。
2把數據發送到另一個國家的雲區域,算不算跨境傳輸?
算。當數據在另一個司法轄區變得可被訪問時,傳輸就已經發生,並不只在數據被複制過去時才成立。把一條記錄發到託管在海外的推理端點,即使沒有任何存儲過程,也是一次傳輸;從另一個國家遠程讀取數據用於支持或運維,同樣可能構成傳輸。存儲位置只是判斷標準之一。
3AI 模型會繼承其訓練數據的主權分類嗎?
在證明相反之前,站得住腳的答案是:會。模型權重可能編碼訓練數據,監管方也日益把訓練好的模型納入範圍。實操上的結論是:基於第 2 級或第 3 級數據微調的模型,應當在境內算力上訓練與提供服務;並且每個模型版本都應攜帶一份訓練數據清單,記錄來源、分類層級、所屬轄區與同意依據。
4AI 部署中最常被遺漏的數據主權泄漏點是什麼?
提示詞與補全日誌。用戶把客戶記錄粘貼進提示詞,提示詞被記錄下來,而日誌又經常被複制到位於另一區域的中央可觀測性棧。修復方法是把提示詞日誌按其輸入數據的同一層級處理,在採集時對個人信息脫敏,並把日誌保留在來源轄區之內。
5主權多雲架構通常會讓雲支出增加多少?
在受影響範圍內,預計上浮 15% 到 30%,主要驅動因素是按轄區建設着陸區所帶來的日誌、監控、身份與網絡的重複建設,以及在主權區域更難享用到折扣託管服務。模板化自動化與早期分類都能壓低這個數字;而先做分類,通常能避免爲那些本可在任何地方運行的數據支付主權溢價。
6達到數據主權的審計就緒狀態需要多久?
一個聚焦的 90 天計劃是現實的:30 天用於清點、分類並建立傳輸登記表;30 天用於對最高層級實施放置策略即代碼、搭建按轄區的密鑰層級;再用 30 天把強制範圍擴展到其餘環境、部署持續證據採集,並演練一次監管調取。覆蓋所有轄區的全面成熟需要更長時間,但最高風險暴露會在前 60 天內關閉。