回到頂部
AI 資料治理指南:資料四級分類對應雲端 API、地端與禁用三種 AI 用法 — 封面

AI 資料治理指南:哪些資料能進 AI、怎麼分級、責任怎麼歸

別再問『能不能用 AI』。真正的問題是『哪些資料能進哪種 AI』。這篇給你一套資料四級分類,對應雲端 API、地端、禁用三種用法,加上進 AI 前的四道關與責任歸屬。

先講最重要的:不要再開「我們到底能不能用 AI」這種會了。

那是假問題。真正該決定的是——哪些資料,能進哪一種 AI。同一家公司裡,官網文案可以隨便丟雲端,客戶名單連企業版都不該碰,病歷則是碰了就違法。把這三件事混進一句「能不能用」,你只會得到「都不准」或「都隨便」兩種爛答案。

治理的本質是一個配對問題:先幫資料分級,再幫每一級指定能配哪種 AI。這篇給你這套框架。


資料四級分類(公開/內部/敏感/受監理)

分級不用複雜。四級就夠中小企業用,判準是同一句話:這份資料外洩或被誤用,後果有多嚴重?

級別典型例子外洩/誤用後果預設原則
L1 公開官網文案、新聞稿、產品型錄、公開報告幾乎沒有隨便用
L2 內部內部會議紀錄、SOP、一般電子郵件草稿、非機密簡報尷尬,商業損失有限去識別化後可上雲端企業版
L3 敏感客戶名單、報價與成本、未公開財報、併購計畫、原始碼競爭劣勢、客戶流失、可能被告預設不進雲端;要用先遮罩+過法遵
L4 受監理病歷、金融交易與帳戶、生物特徵、特種個資、政府機密違法、裁罰、刑事責任一律先過法遵;多數只能地端或禁用

多數人卡在 L2 和 L3 的界線。判斷法則很簡單:這份資料如果登上新聞,你只是丟臉,還是會被告? 丟臉是 L2,會被告是 L3。這條線畫清楚,八成的糾結就解決了。更細的逐份自評,可搭配把客戶資料丟進 AI 前的風控合規


每一級對應的 AI 用法(雲端 API、地端、禁用)

分完級,配用法。這是整套框架的核心:

資料級別雲端 API/企業版地端/私有部署建議
L1 公開任何工具、任何版本
L2 內部✅ 企業版(合約不訓練)免費版請先去識別化
L3 敏感⚠️ 原則不進,例外走企業版+遮罩+合約✅ 較合適逐案審核,不開放自助
L4 受監理❌ 多數禁止⚠️ 地端也要合規先法遵,再談技術

這裡要破一個常見誤解:「用企業版就等於安全」是錯的。企業版承諾不拿你的資料訓練,解決的是「會不會被學走」,不解決「這份資料本來就不該離開公司」。L3、L4 的問題不在訓練,在外流本身就是風險或違法。閉源雲端 AI 到底把你的資料放到哪一層、經過哪些人手,你其實看不到——這也是 Mistral 警告閉源 AI 的資料分層想提醒的事。


進 AI 前的四道關(遮罩、最小化、稽核、責任)

就算資料級別允許進 AI,也不是直接貼上去。要過四道關:

第一關,遮罩。 把姓名、電話、帳號、金額、日期等可辨識欄位換成假值或通則。但小心:單一欄位遮掉不代表安全,把「地區+職稱+成交金額」湊在一起,往往還是能反推是哪一家客戶。遮罩要看「重組後能不能再識別」,不是「有沒有把名字塗掉」。

第二關,最小化。 只給 AI 完成任務所需的最少資料。要它改一封信,就給那封信,別把整份客戶履歷貼上去。金管會的 AI 指引也把「資料最小化原則」列為核心——資料要「適當、相關且在必要範圍內」。這不只是合規,也是降低風險最省力的一招。

第三關,稽核。 誰、在什麼時候、把什麼資料、丟給哪個模型,要留得下紀錄、查得到。沒有日誌,出事時你連「到底外流了什麼」都說不清楚。

第四關,責任。 白紙黑字寫清楚:哪一級資料由誰核准進 AI、產出由誰審、出事由誰負責。這一關最常被跳過,卻最關鍵。把前三關寫成一份企業 AI 使用規範,責任才有落點,員工才知道界線在哪。


台灣受監理產業的額外要求

如果你在下列產業,前面的框架只是起點,法遵才是關卡:

  • 醫療與健康:病歷、醫療、基因、健康檢查等屬於個資法第 6 條的「特種個人資料」,原則上禁止蒐集、處理、利用,例外要件很嚴格。把病歷丟進任何雲端 AI,預設就是踩線;個資法在 AI 場景還有哪些常踩的線,見AI 與個資法:最常踩的線
  • 金融業:金管會已於 2024 年 6 月發布「金融業運用人工智慧(AI)指引」,訂出治理問責、隱私保護等六大核心原則,並要求對第三方業者以合約明訂責任分工。客戶帳戶與交易資料,不是「小心點就好」的問題。
  • 法律事務所:律師保密義務在先,案件資料未經當事人同意不該進 AI。
  • 政府標案/國安相關:多數合約直接禁止,先看合約再說。

我們的立場很明確:受監理資料,一律先過法遵,不要讓現場人員自己判斷。 一篇文章、一份框架給你的是常識判斷,不是法律意見;這四種產業請找專業,別拿一篇教學決定合規。


我們的觀點:地端不等於治理完成

很多公司一聽到資料風險,第一反應是「那我們上地端/私有部署」。方向沒錯,但地端只解決了「資料不出境」,也就是治理的一半

另一半——安全防護、輸出審核、稽核紀錄、責任歸屬——地端一樣要自己建,沒有雲端廠商幫你扛。搬到自己機房,不代表模型就不會產生錯誤輸出、不會被內部濫用、不會缺日誌。信任邊界該畫在哪、地端之後還有哪些洞要補,我們在台灣企業的 AI 資安信任邊界談得更細。

一句話收尾:分級決定方向,四道關決定落地,法遵決定底線。 三個都做到才叫治理;只搬地端,只是換了一個放資料的地方。


常見問題

小公司也要做到這麼細嗎?四級分類會不會太重?

不會,反而更該做。四級分類本身只是「幫資料貼標籤」,一個下午就能把公司常見的資料類型分完。小公司資源少,一次外洩或一次違法的代價相對更痛。重點不是文件多完整,是「有分過、有寫下來、員工知道 L3、L4 不能亂丟」。

用企業版(ChatGPT Team、Claude for Work)是不是就不用分級了?

不是。企業版合約解決的是「不拿你的資料訓練」,但敏感與受監理資料的風險在於「外流或使用本身」,不是訓練。客戶名單、財報、病歷這類資料,就算企業版也不該直接丟。它讓 L2 內部資料用得更安心,但 L3、L4 仍要走遮罩、法遵或地端。

資料去識別化之後,是不是就百分之百安全可以丟了?

不一定。去識別化能大幅降低風險,但要小心「重組再識別」——把地區、職稱、金額、時間等看似匿名的欄位拼起來,常常還是能反推是誰。判斷標準是「拼湊後能不能認出特定個人或公司」,不是「有沒有把名字塗掉」。特種個資即使去識別化,仍建議先確認法遵要件。

雲端 API 和地端,中小企業一開始該選哪個?

先看資料級別,不是先看技術。如果你日常處理的多是 L1、L2,雲端企業版最省成本也夠用;只有當你固定要處理 L3、L4,地端才值得投入。別為了少數敏感任務就把全公司搬地端,那是成本錯配。工具怎麼配,原則一樣:先看資料級別,再挑對應的版本與部署方式。


參考來源

№ · further reading

延伸閱讀