資料主權——即資料受其所在國家法律保護的原則——已經成為人工智慧部署的一級約束。曾經只優化成本與延遲的企業,如今發現其雲戰略被資料本地化法律、跨境傳輸規則與行業監管所主導。本文解釋如何設計既尊重主權又不犧牲效能的多雲人工智慧,並說明為什麼把「位置」當作設計輸入而非合規補丁,已成為能否上線與停滯的分水嶺。
當前的資料主權格局是怎樣的?
監管版圖從未如此密集。中國《個人資訊保護法》自2021年11月施行以來,建立了以安全評估為核心的嚴格跨境傳輸要求;歐盟《一般資料保護規範》(GDPR)累計罰款已超過50億歐元,且執法力度逐年上升;印度《數位個人資料保護法》(2023)、巴西《一般資料保護法》(LGPD)、加拿大《消費者隱私保護法》(CPPA)以及金融與醫療等行業的專門規則,不斷擴展「哪些資料必須留在哪裡」的邊界。與此同時,歐盟《人工智慧法》自2024年起分期適用,對訓練與運作人工智慧系統的資料提出了明確義務,多個司法管轄區已開始將訓練資料的來源視為受監管的投入。
這些風險在採購環節就清晰可見。受監管行業的企業如今理所當然地要求雲與人工智慧供應商作出資料駐留承諾,亞太多個市場的監管機構也已表明:在缺乏合法依據的情況下跨境訓練個人資料將被重點審查。結果就是,主權不再是法務團隊單獨處理的合規尾巴,而是基礎設施、資料與人工智慧團隊從專案伊始就必須據此設計的架構輸入。
技術層面的回應是多雲。Flexera 的《雲狀況報告》顯示,2024年89%的企業採用多雲戰略,且受駐留規則約束的流量佔比逐年上升。但「多雲加主權」不等於「把資料放進正確的區域」這麼簡單。它意味著要在整個人工智慧生命週期——從標註、再訓練到推理與審計——中持續追問:模型在哪裡訓練、推理在哪裡運行、日誌儲存在哪裡、哪些供應商能觸碰哪些資料。
各司法管轄區之間的差異進一步加劇了複雜性。「傳輸」的定義各不相同:歐盟依賴充分性認定與標準契約條款;中國對超過閾值的出境傳輸要求安全評估;部分波斯灣與東南亞地區則期望資料完全留在本土。因此,一款面向三個地區客戶的人工智慧產品可能同時受三套互不相容的規則約束,這也是「一刀切」架構在走出單一市場後必然失效的原因。
| 司法管轄區 | 核心法規 | 約束內容 |
|---|---|---|
| 歐盟 | GDPR + 人工智慧法 | 跨境傳輸、訓練資料來源、合法依據 |
| 中國 | 個人資訊保護法 + 資料出境規則 | 超閾值的出境傳輸、重要資料本地化 |
| 印度 | DPDP 法 2023 | 處理位置、對黑名單地區的傳輸限制 |
| 巴西 / 加拿大 | LGPD / CPPA | 問責制、跨境傳輸保障措施 |
正是這種碎片化,使得主權必須「設計進去」而非「事後補上」。返工的成本不僅是法律層面的,更是架構重寫、流水線複製與發布延期。
多雲主權落地面臨哪些關鍵實施挑戰?
第一個挑戰是主權要求橫跨通常被分別規劃的層級。基礎設施團隊選區域,資料團隊選儲存,人工智慧團隊選模型供應商——然而一次查詢可能同時跨越三者。一個部署在某區域、從另一區域呼叫、訓練資料在第三區域的模型,製造了一個無人負責的合規面。我們在亞太的評估發現,多數企業無法完整描繪每個資料集、模型與日誌的實體位置,這使得任何「我們合規」的聲明都無法驗證。
第二個挑戰是出口流量與複製。主權制度關注的是資料在哪裡被處理,而不只是儲存在哪裡;而雲服務出於韌性考量預設跨區複製資料。企業必須顯式停用受限資料的跨區複製,用私有端點與出口防火牆控制出口流量,並驗證備份與災備副本留在轄區之內——這種配置紀律是預設雲設定無法提供的,且在時間壓力下極易出錯。
第三個挑戰是人工智慧供應鏈。大語言模型可能在包含第三方或開源語料的資料上訓練,而在受限資料上微調模型,可能把該資料嵌入權重,隨後部署到別處。一旦資料進入權重,幾乎無法依需求檢索或刪除——這是傳統以行級刪除為基礎的資料管理無法涵蓋的主權與隱私問題。模型萃取、提示注入與記憶化進一步模糊了「資料留在本地」與「資料洩漏進模型」之間的界線。
第四個挑戰是加密密鑰的司法歸屬。即便資料留在區域內,解鎖它的密鑰也可能由位於轄區之外的全球密鑰服務管理。客戶與監管者越來越關心的不只是位元組在哪裡,還有密鑰由誰控制、境外查封令能否強制揭露。自帶密鑰(BYOK)與持有自有密鑰(HYOK)並以區域內硬體安全模組為錨點的安排,正從高端特性變為基線預期。
第五個挑戰是人因與流程層。主權要求由未必了解法律細節的工程師執行,因此控制必須編碼進工具,而非記在政策裡。成功的組織會配一張簡短、可讀的駐留地圖——哪類資料必須留在哪個區域——再加上讓違規在部署時就不可能發生的護欄,使合規不依賴於每位工程師對最新規則的知曉程度。
你的模型究竟部署在哪裡?
這個問題——對每一個模型而非僅對每一個資料集發問——是多數企業無法自信回答的。一個模型的「家」是複合的:權重儲存的區域、推理運行的區域、訓練與微調資料所在的區域,以及日誌寫入的區域。其中任何一項都可能違反駐留要求,而模型供應商的服務條款也未必符合你對計算發生地或遙測發送地的假設。
回答它的方法很樸素:建立一張登記冊,記錄每個模型、其託管區域、資料來源與處理位置,並在任何變更時複查。在我們的合作中,建立這張登記冊通常會立刻暴露三到五處違規——部署在轄區之外的微調模型、跨境外複製的日誌、處理受限資料的供應商分包商。每處一旦可見便易於修復,若在審計或客戶安全審查中才發現則代價高昂。
推理位置尤其值得關注。一個權重留在區域內的模型,若呼叫了外部推理或重排服務,或其可觀測性棧把提示詞發往區域外的日誌供應商,仍可能違反主權。面向延遲敏感且受監管的工作負載,務實的答案是區域內部署推理端點,並停用或隔離提示詞與補全日誌。因此,模型的「家」與其說是一個地點,不如說是一條供應鏈,而登記冊正是讓這條鏈可審計的方式。
哪些實踐方法真正有效?
把主權在設計階段就內建,而非事後補救。先依據資料的駐留地圖選擇區域與雲供應商,再考慮成本;並把約束編碼為策略即程式碼(policy as code),使工程師無法把工作負載誤部署到被禁區域。雲原生控制——區域鎖定、出口過濾、複製策略、客戶託管加密密鑰——應成為任何觸碰受限資料的工作負載的預設姿態,而非上線後才加的選用加固。
將人工智慧的層級分離。把訓練與微調資料留在模型將部署的區域,使用滿足用戶駐留要求的推理區域,並確保日誌也留在轄區內。當確實需要一個全球模型時,採用讓受限資料完全不進入訓練集的技術——例如僅用獲許可資料訓練的區域變體,或「模型移動、資料不動」的聯邦方法——而非事後給單一全球模型打合規補丁。
演練審計演示。主權專案的價值,在於你能當場回答監管者或客戶的問題:這份資料集在哪裡、在哪裡被處理、誰能存取、發生洩漏會怎樣?按季演練這一演示的企業,會發現那些否則會在正式審查中暴露的缺口——一份未標註的資料集、一份被遺忘的副本、一個區域外的密鑰服務。在我們的經驗中,演練過的演示也是商業資產:企業客戶在採購中越來越要求駐留證明,能夠展示的團隊可顯著縮短銷售週期。
把主權應用到整個人工智慧供應鏈,包括供應商。每個模型供應商、雲服務與分包商都應就其資料處理與儲存位置接受評估,合約應反映你所承擔的駐留義務。一份務實的部署清單如下:
- 把每個資料集、模型與日誌映射到其實體位置與法律 regime
- 將受限工作負載鎖定到獲批區域,並停用跨區複製
- 把駐留約束編碼為策略即程式碼,使部署無法違反
- 在規則要求的範圍內,讓訓練、推理與日誌處於同一轄區
- 使用以區域內硬體安全模組為錨點的客戶託管密鑰
- 評估模型供應商與分包商處理資料的位置
- 維護記錄託管、資料來源與處理位置的模型登記冊
最後,把主權當作營運紀律,而非一次性專案。監管者更新規則,供應商變更基礎設施,併購把新資料納入範圍。保持合規的企業會定期開展駐留複查——在固定節奏下、並在每次重大變更後,重新校驗地圖、登記冊與策略即程式碼。
跨境資料傳輸機制如何運作?
當資料必須跨境流動時,法律提供了一小組被認可的機制,人工智慧團隊需要清楚哪一種適用於自己的流水線。歐盟框架建立在部分國家的充分性認定之上,對其他地區則依賴標準契約條款(SCC)外加一份記錄境外監控風險的傳輸影響評估。中國的個人資訊保護法採用分層路徑:大規模或敏感傳輸需經網信部門安全評估,其他情形可走認證,少量個人資訊出境則有更窄的通道。印度的 DPDP 規則限制向黑名單地區傳輸,並強調任何流動前都須滿足同意與目的限制。
務實的含義是:「我們在傳輸中加密」本身永遠不夠。傳輸機制關乎合法依據與問責,而不只是傳輸安全。一個在歐盟個人資料上微調、再把權重發往非充分性認定國家訓練叢集的人工智慧流水線,本質上就是底層個人資料的跨境傳輸,無論權重是否加密。把每一次流動映射到其合法機制——並記錄在用於駐留的同一張登記冊中——能堵住多數團隊直到客戶隱私團隊直接發問才發現的缺口。
對許多企業而言,最簡可行且可辯護的設計是根本避免傳輸:把受限個人資料留在區域內,在那裡訓練區域變體,只把聚合值、評測或合成資料跨境移動。這把法律問題轉化為工程問題,而工程團隊更擅長可重複地解決它。
主權優先的參考架構長什麼樣?
主權優先的架構把「位置」作為每個元件的一等屬性,而非僅作為儲存層的屬性。具體而言,它將控制平面(全域,用於編排與計費)與鎖定到每個司法管轄區的資料平面(用於訓練、推理與日誌)分離。每個資料平面擁有自己的加密密鑰、自己的模型登記冊與自己的出口策略,使一個區域內的工作負載無法靜默存取另一區域的儲存。
| 層級 | 主權控制 |
|---|---|
| 訓練資料 | 僅在獲批區域儲存與處理;停用複製 |
| 模型權重 | 按區域登記;受限資料使用區域變體 |
| 推理 | 區域內端點;外部呼叫被阻斷或隔離 |
| 日誌與遙測 | 寫入區域內儲存;任何匯出前剔除個人識別資訊 |
| 密鑰 | 客戶託管,以區域內硬體安全模組為錨點 |
在這些按區域劃分的資料平面之上,是一個輕量的全域控制平面,處理非受限事項——計費、實驗追蹤中繼資料,以及模型效能的整合但匿名視圖。邊界由 CI/CD 流水線中的策略即程式碼強制執行,因此違反某區域規則的產品在投產前就會失敗。這正是蜂啟諮詢所落地的架構,它讓企業能夠跨市場擴展人工智慧,而無需為每個新用例重新辯論主權。
有哪些關鍵要點?
- 主權橫跨資料、模型與日誌的位置——三者都要映射,而非僅儲存
- 把駐留約束編碼為策略即程式碼,使違規在部署時被阻斷
- 在規則要求的範圍內,讓訓練、推理與日誌處於同一轄區
- 控制加密密鑰的司法歸屬,而不僅僅是資料位置
- 評估包括供應商分包商在內的整個人工智慧供應鏈的處理位置
- 在固定節奏下、並在每次重大變更後,開展駐留複查
結論
資料主權不是需要繞開的約束,而是盡早應用就能產出既合規又快速的多雲人工智慧的設計原則。把「位置」當作一等架構關切——可映射、可編碼、可持續再校驗——的企業,會把監管壓力轉化為持久優勢,而非反覆救火。
主權也不純粹是監管負擔。對跨國公司而言,駐留感知的設計日益成為贏得銀行、醫療與政府等行業企業合同的必要條件,這些買方堅持其資料永不離開轄區。合規與競爭力正在合流,把位置當作設計原則的組織在兩端都領先。
在蜂啟諮詢,我們設計內建主權的多雲人工智慧部署——駐留地圖、策略即程式碼護欄、模型登記冊,以及讓合規在整個人工智慧生命週期中可見的區域內密鑰管理。對跨地區擴展人工智慧的企業而言,問題不在於你的雲今天是否合規,而在於被問到時你能否證明。那份證明是你在審計前、而非審計中建立的資產。
重點問答
資料主權與資料駐留有什麼區別?
資料駐留是更窄的、實體層面的問題:位元組儲存與處理在哪裡?資料主權是疊加其上的法律問題:哪國法律管轄該資料,且能或不能對它做什麼?一個工作負載可以駐留在某區域,卻仍因管轄法律、密鑰保管方或允許的傳輸違反適用制度而失敗主權。主權是政策,駐留是其執行機制之一。
單一全球人工智慧模型能否服務於多個受監管區域?
有時可以,但前提是模型訓練時不跨境移動受限個人資料,且推理在區域內運行。實務上,企業將全球基礎模型與區域變體分離:基礎模型從獲許可或合成資料學習,每個區域的變體僅在合法留在該轄區的資料上微調。若受限個人資料必須影響模型,留在區域內並避免出境傳輸,通常比單純依賴傳輸機制更簡捷、更可辯護。
企業如何證明自己滿足資料主權要求?
透過維護一份鮮活的駐留地圖、一份按模型的登記冊與策略即程式碼護欄,並按固定節奏演練審計演示。證明不是一張證書,而是對每個資料集與模型可複現地回答四個問題:它在哪裡、在哪裡被處理、誰能存取、發生洩漏會怎樣?能當場用證據而非保證回答的組織,會縮短客戶安全審查並在監管審視中存活。
加密與密鑰管理在主權中扮演什麼角色?
加密保護傳輸中與靜態的資料,但主權關乎控制,而非僅密碼強度。若境外密鑰服務可被強制揭露密鑰,無論資料存於何處都實質暴露。以區域內硬體安全模組為錨點的客戶託管或自有密鑰安排,確保受相關管轄的當事方控制解密——這日益成為監管者與企業買方真正的要求。