GDPRとビッグデータは相容れないものではありませんが、多くの組織が先延ばしにしている選択を迫られます。大規模なデータセットを収集または再利用する前に、その法的根拠を明確にし、その処理がその目的に必要であることを証明できなければなりません。実際には、これは一般データ保護規則第6条に基づく根拠を文書化し、アルゴリズムのトレーニングに後で使用することが、データが最初に収集された目的と両立するかどうかをテストし、最初のモデルを構築する前にリスクを評価することを意味します。この記事では、これらの規則がオランダにおける大規模分析とAIトレーニングにどのように適用されるか、そしてオランダデータ保護庁(Autoriteit Persoonsgegevens)がどこに線引きをしているかを説明します。
ビッグデータセットにおいて個人データとみなされるものは何か
GDPRは、特定された、または特定可能な自然人に関する情報に適用されます。ビッグデータの分野では、この基準は組織の予想をはるかに超える頻度で超えられます。なぜなら、識別可能性は、管理者または他の誰かが個人を特定するために合理的に使用される可能性のあるすべての手段を参照して評価されるからです。したがって、デバイス識別子、位置情報、取引記録、クリックストリームなどのデータセットは、たとえ単一の列に名前が含まれていない場合でも、ほぼ常に個人データとみなされます。
この2つの概念はしばしば混同されますが、その違いによって規制が適用されるかどうかが決まります。識別子が置き換えられているものの、鍵がどこかに残っている仮名化データは、個人データであり、GDPRの適用対象となります。一方、再識別が合理的に不可能な匿名化データは、GDPRの対象外となります。真の匿名化のハードルは高く、集計、ハッシュ化、または直接識別子の削除では、特にデータセットが豊富かつ長期間にわたる場合、特定の人物が個人を再識別するのに十分な痕跡が残るのが一般的です。
これは重要な問題です。なぜなら、データセットが匿名であるという主張は、多くの場合、AIプログラム全体の基盤となる前提だからです。この前提が崩れると、トレーニング実行から保持スケジュールに至るまで、すべての下流工程が法的根拠なしに行われたことになります。より安全なアプローチは、文書化された再識別分析でそうでないと示されない限り、データセットを個人データとして扱い、データセットが拡充されたり、他のソースと結合されたりした場合は、その分析を再検討することです。欧州データ保護委員会も、AIモデル自体が匿名であるとみなせる場合について検討しており、その回答は、匿名であると想定することはできないというものです。個人データでトレーニングされたモデルには、抽出可能な形式でそのデータが含まれている可能性があり、ケースバイケースで評価する必要があるからです。
ビッグデータとAIトレーニングの法的根拠の選択
すべての処理操作には、第6条に規定されている6つの根拠のうちいずれか1つが必要であり、その根拠は処理開始前に選択されなければならず、処理開始後に再構築することはできない。大規模な分析においては、現実的な候補となるのは3つだけである。
同意は理論上は最も明確だが、実際には最も脆弱なものである。同意は自由意思に基づき、具体的かつ十分な情報に基づき、曖昧さなく与えられる必要があり、また、同意を撤回することも、同意を与えるのと同じくらい容易でなければならない。一般的な用語でまとめられた同意、データを必要としないサービスの条件として取得された同意、あるいは個人が何に同意しているのかを理解できないほど広範な表現で得られた同意は、有効とはみなされない。同意が撤回された場合、既に学習済みのモデルがどうなるのかという問題に対して、技術的な回答が必要となる。
契約履行における必要性は、見た目ほど単純ではない。判断基準となるのは、個人が実際に依頼したサービスに対する客観的な必要性であり、商業的な有用性ではない。レコメンデーションエンジンの改善のために顧客をプロファイリングすることは、一般的に顧客が購入した製品の提供に必要ではない。欧州司法裁判所は、この範囲を行動ターゲティング広告やパーソナライゼーションにまで拡大しようとする試みを繰り返し却下してきた。
残るは正当な利益であり、これは大規模なデータ処理のほとんどが依拠しなければならない根拠である。正当な利益には、次の3つのステップが必要であり、この順序で文書化される。すなわち、真正かつ合法的な利益を特定すること、それを実現するより侵害の少ない方法がないために処理が必要であることを示すこと、そして、その利益を関係者の権利および合理的な期待と釣り合わせることである。オランダの裁判所が国内テニス協会に関して行った照会において、欧州司法裁判所は2024年に、純粋に商業的な利益は正当な利益として認められる可能性があるが、それは必要性と釣り合いのテストが真に満たされている場合に限られると確認した。したがって、商業的価値は許容される利益であって、ライセンスではない。
特別なカテゴリーと推測される特性
人種または民族的出自、政治的意見、宗教的信条、労働組合への加入状況、健康状態、性生活または性的指向を明らかにするデータ、および識別に使用される遺伝子データや生体認証データは、第9条に規定されている限定的な例外に該当する場合を除き、一切処理してはならない。明示的な同意を得るのが一般的な方法であり、その他の方法は商業データセットにはほとんど適用されない。
ビッグデータの落とし穴は、特別なカテゴリーのデータが意図的に収集される必要がないという点にある。例えば、購入パターン、位置情報履歴、自由記述欄の内容などから、保護対象となる特性が推測できるデータセットが存在する場合、たとえ誰も直接質問していなくても、その処理にはより厳格な規制が適用される。保護対象となる特性の代理指標となるモデル機能は、苦情を受けてからではなく、開発段階で特定されるべきである。
目的制限:データを再利用してモデルをトレーニングできますか?
可能ですが、自動的にはできません。GDPRでは、個人データは特定され、明示的かつ正当な目的のために収集されなければならず、それらの目的と相容れない方法でさらに処理されてはならないと規定されています。注文処理、顧客サポート、または不正防止のために収集されたデータに基づいてアルゴリズムをトレーニングすることは、さらなる処理操作に該当し、規則で定められた適合性テストに合格した場合にのみ合法となります。
このテストは形式的なものではありません。元の目的と新しい目的との関連性、データが収集された状況と、その状況に基づいて個人が合理的に期待できること、データの性質と特別なカテゴリーが関係しているかどうか、新しい処理によって生じる可能性のある結果、そして仮名化や暗号化などの保護措置の有無について問われます。医療記録や財務記録のデータセットはテストに不合格となりますが、匿名化された運用ログのデータセットは合格します。
例外規定は一つありますが、一般的に考えられているよりも狭い範囲に限られます。公共の利益のためのアーカイブ、科学的または歴史的研究、あるいは統計目的のための追加処理は、研究処理のための安全対策が講じられている限り、互換性があるとみなされます。研究を装った商業モデル開発は対象外です。この例外規定は、製品改良ではなく、方法論的および倫理的基準に準拠した真の研究を対象としています。互換性テストに合格しない場合は、新たな法的根拠が必要となり、ほとんどの場合、関係者への新たな情報提供が必要となります。
実際的な結果として、目的制限はデータ収集の時点で対処する必要があります。目的を曖昧な表現で記述したプライバシーポリシーは、後々のテストで問題になることがあります。なぜなら、テストでは、技術的に許容される内容ではなく、個人が合理的に期待できる内容が評価されるからです。オランダにおけるプライバシーポリシー作成ガイドでは、目的を誠実かつ実用的に記述する方法を解説しています。
モデルが全てを要求する場合の最小化、保持、精度
データ最小化の原則では、個人データは適切かつ関連性があり、必要最小限に抑える必要があります。この原則は、データが多いほどモデルが優れているという開発手法とは根本的に矛盾しており、この矛盾を無視することで解決できるものではありません。解決できるのは、文書化された説明です。つまり、明示された目的に必要なフィールドはどれか、それらのフィールドなしで何がテストされたか、そして残りのフィールドがなぜ破棄されたかを明確に示すことです。データセットが大規模であっても、分析結果が正当であることを示すことができる管理者は、正当な立場にあると言えます。一方、ストレージが安価だからといってすべてを保管している管理者は、そうではありません。
ストレージ容量の制限は、時間の経過とともに同じ問題を提起します。トレーニングデータ、特徴量ストア、モデルチェックポイント、推論ログはすべて保存義務の対象となり、それぞれ目的に応じた保存期間が必要です。推論ログは忘れられがちで、トレーニングセットよりも多くの個人データが含まれていることがよくあります。
この文脈において最も見落とされがちな原則は正確性であり、法的な側面も軽視されがちです。個人データは正確でなければならず、必要に応じて最新の状態に維持する必要があり、個人には訂正を求める権利があります。モデルが特定の個人に関する出力を生成する場合、その出力自体が個人データとなります。ある人物が信用リスクが高い、詐欺師である可能性が高い、あるいは不適切な候補者であるという推論は、その人物に関するデータであり、不正確である可能性があり、異議を申し立てることができます。このような出力を修正できないシステムを構築すると、後からどれだけ文書化しても解決できないコンプライアンス上の問題が生じます。
データ保護影響評価が義務付けられている場合
データ保護影響評価は、処理の種類が個人の権利と自由に対して高いリスクをもたらす可能性が高い場合に義務付けられており、規制では特に次の3つのケースが挙げられています。法的または同様に重大な影響を及ぼす決定の根拠となる、プロファイリングを含む自動処理に基づく個人的側面の体系的かつ広範な評価。特別なカテゴリーのデータまたは犯罪歴データの大規模な処理。大規模な公開領域の体系的な監視。ほとんどの深刻なビッグデータプロジェクトは、最初のケースまたは2番目のケースに該当します。
オランダ個人情報保護庁(Autoriteit Persoonsgegevens)は、大規模なプロファイリング、従業員の体系的な評価、健康データプラットフォーム、カメラシステムの使用など、オランダで常に評価が義務付けられている処理業務の一覧も公表している。この一覧は、評価が必要かどうかという議論を解消するため、プロジェクト開始時に最初に参照すべき文書である。
タイミングに関する2つの点が決定的に重要です。評価は処理開始前に実施する必要があり、AIプロジェクトの場合は、展開前ではなく、トレーニングデータの収集前に実施する必要があります。また、評価の結果、軽減できない高い残存リスクが示された場合は、処理を進める前に監督当局に相談しなければなりません。この相談を怠ることは、処理が合法であるかどうかにかかわらず、それ自体が違反行為となります。
アルゴリズムシステムの有用な評価は、標準的なテンプレートにとどまりません。モデルにどのようなデータソースがどのような基準で入力されているか、モデルが独自に判断できる範囲と人間が判断する範囲、影響を受ける人への出力の説明方法、保護対象グループに対する偏りがないかトレーニングデータをどのようにテストしたか、そしてモデルが誤っていた場合にどうなるかなどを記録します。これらは規制当局が最初に尋ねる質問です。
Autoriteit Persoonsgegevens がこれをどのように実施するか
オランダの監督機関は、GDPRとオランダの実施法であるUitvoeringswet AVGを執行するAutoriteit Persoonsgegevensです。その権限は、警告や譴責から、罰金支払いを伴う命令、処理の一時的または恒久的な禁止、行政罰金まで多岐にわたります。この規則では、罰金の上限が定められており、下位レベルの違反の場合は1,000万ユーロまたは全世界の年間総売上高の2%まで、基本原則、法的根拠、データ主体の権利、国際移転に関する規則の違反の場合は2,000万ユーロまたは4%までとなっています(いずれか高い方)。
オランダのデータ保護に関する規制の運用には、ビッグデータに直接関係する2つのテーマが見られます。1つ目は透明性です。最近の規制措置の多くは、どのデータが、どのような目的で、どのくらいの期間使用されるのかを分かりやすい言葉で説明していないプライバシーポリシーに関するものです。曖昧な目的の説明は、単なる文言上の欠陥ではなく、それ自体が違反行為とみなされます。2つ目はアルゴリズムの監視です。当局はアルゴリズムの監視を専門とする部署を設けており、アルゴリズムのリスクに関する定期的な報告書を公表しています。この報告書は、調査の対象となる前に当局が何を期待しているかを示すものとして、一読する価値があります。
執行と並行して、侵害通知義務があります。個人データ侵害は、不当な遅延なく、可能であれば侵害を認識してから72時間以内に当局に報告しなければなりません。ただし、侵害が個人にリスクをもたらす可能性が低い場合は除きます。個人へのリスクが高い場合は、個人にも通知する必要があります。AI環境では、侵害されたトレーニングセットまたは特徴ストアが、それに含まれるデータの所有者全員に影響を与え、その結果がモデルが行ったすべての決定に及ぶため、評価は以前よりも困難になっています。これは、2026年8月15日から適用されているオランダのNIS2実装であるサイバーセキュリティ法に基づくインシデント報告義務とは別の義務であることに注意してください。サイバーセキュリティ法は、その適用範囲内の組織に対して24時間と72時間の独自の通知期限を課しています。NIS2とオランダのサイバーセキュリティ法の概要では、2つの制度がどのように並行しているかを説明しています。
AI法はGDPRに取って代わるものではありません
EU人工知能法は、AIシステムを製品として規制しており、リスクに基づいて分類し、提供者と導入者に義務を課しています。同法は個人データ処理の法的根拠を提供するものではなく、同法への準拠はGDPRへの準拠とは何ら関係がありません。AIシステムが個人データを処理する場合、両方の規制が完全に並行して適用されます。
計画立案においては、スケジュールが重要となる。許容できない行為の禁止、汎用AIモデルに対する義務、および人と対話したり合成コンテンツを生成するシステムに対する透明性義務は既に施行されている。高リスク制度はデジタル包括パッケージによって延期された。附属書IIIに記載されている高リスクシステムに対する義務は2027年12月2日から、附属書Iに基づく規制対象製品の安全コンポーネントであるシステムに対する義務は2028年8月2日から適用される。AI責任指令に関する個別の提案は撤回されたため、AIシステムによって引き起こされた損害に対する責任は、引き続きオランダの通常の契約法および不法行為法、ならびに欧州製品責任制度によって規定される。
データ駆動型組織にとって、実際的な結果として、GDPR分析は依然として拘束力のある制約であり、一方、AI法は、同じシステムが今世紀末までに必要とする文書化、テスト、および人的監視を規定します。これら2つの作業を別々に行うと重複作業が発生しますが、同時に行うと重複作業は発生しません。EU AI法および高リスクAIシステムに関する当社のガイドでは、分類と義務について詳細に説明しています。
集団訴訟と損害賠償:リスクの民事面
規制上の罰金だけがリスク要因ではなく、オランダではそれが最大のリスク要因ではないかもしれません。集団訴訟における集団損害賠償法(WAMCA)は、厳格なガバナンスと資金調達要件を満たす財団または協会が、特定のグループを代表して損害賠償を求める集団訴訟を起こすことを認めており、オランダ在住者にはオプトアウト制度が設けられています。データ駆動型処理は明らかにその標的となります。単一の設計上の決定がすべてのユーザーに同じように影響を与えるため、集団訴訟に必要な均質性にまさに合致するからです。
GDPRは、この点を自ら強化しています。GDPRは、侵害の結果として物的または非物的損害を受けたすべての人に、管理者または処理者からの賠償請求権を与え、データ保護分野で活動する非営利団体が、場合によってはデータ主体からの委任なしに、データ主体に代わって訴訟を起こすことを認めています。欧州司法裁判所は、消費者保護団体がそのような根拠に基づいて行動できることを確認しています。
限界は存在し、それは被告にとって都合の良い限界である。欧州司法裁判所は、GDPR違反それ自体が賠償請求権を生じさせるものではないと判示している。原告は実際の損害と因果関係を立証しなければならないが、非物質的損害については、いったん立証されれば、その深刻度の基準は適用されない。そのため、オランダの実務では個々の賠償額は控えめなものとなっているが、数十万人規模の集団訴訟となれば状況は一変する。集団損害賠償請求に関する当事務所の記事では、こうした訴訟手続きがどのように進められるかを解説している。
データがあらゆる場所から送られてくる場合、誰がコントローラーになるのか?
ビッグデータプロジェクトは、一つの組織内にとどまることは稀です。データはブローカーによって加工され、クラウドプロバイダーによってホストされ、分析会社によってクレンジングされ、ベンダーが提供するモデルに組み込まれます。そして、これらの関係性はそれぞれ正しく定義されなければなりません。なぜなら、役割の割り当てによって、誰がどのような義務を負い、誰が規制当局に責任を負うかが決まるからです。
管理者は処理の目的と手段を決定し、処理者は管理者の文書化された指示にのみ従って行動します。2つ以上の当事者が共同で目的と手段を決定する場合、それらは共同管理者となり、特に情報提供や個人からの要求への対応に関して、それぞれの責任を契約書に明記する必要があります。個人は、いずれの場合も、いずれか一方に対して権利を行使することができます。契約書で使用されている名称は決定的なものではなく、重要なのは、実際に誰がデータの処理の目的と方法を決定しているかです。自社製品の改善のためにデータを使用する権利を留保するサプライヤーは、契約書の名称に関わらず、その範囲において、自社の目的のための管理者となります。
AIの文脈において、サプライヤー契約に含まれる2つの条項は特に注意が必要です。1つ目は、プロバイダーが顧客コンテンツをトレーニングやサービス改善のために使用することを許可する条項です。この条項が存在する場合、個人データを別のデータ管理者へ開示することになり、その開示の根拠と通知が必要となります。2つ目は、サブプロセッサー条項です。モデルプロバイダーは、欧州経済領域外のサプライヤーやインフラストラクチャに依存することが多く、データ移転規則が適用されるためです。必要な事項を網羅していても、データが実際にどのように処理されるかを記述していない処理契約は、調査においてほとんど役に立ちません。
最後に、説明責任の原則では、立証責任は管理者側に課せられることを覚えておいてください。法令遵守しているだけでは不十分です。実際に構築されたシステムと一致する記録、評価、合意書を用いて、法令遵守を証明できなければなりません。
次のプロジェクト開始前に準備しておくべきこと
ビッグデータに関するコンプライアンスは設計段階から組み込まれます。なぜなら、規制では設計段階からデフォルト設定でデータ保護が求められているからです。適切な技術的および組織的な対策をデータ処理自体に組み込む必要があり、各特定の目的に必要な個人データのみがデフォルトで処理されることになります。後付けでの対応は費用がかさみ、通常は不完全なものとなります。
実際に違いを生む5つのポイント。各モデルの背後にあるデータフローを、それを所有する部門ではなく実際に記述した処理活動の記録を保持します。トレーニングに関連するさらなる処理を含め、各処理操作の法的根拠を決定して文書化し、正当な利益の評価をそれとともに保管します。データの収集前に影響評価を実施し、残存リスクが高い場合は監督当局に相談します。モデルやプラットフォームの提供者を含め、データに触れるすべてのサプライヤーとデータ処理契約を締結し、サプライヤーが自社の目的でデータをどのように使用できるかを確認します。要件は、データ処理契約に関するガイドに記載されています。また、データの転送先を確認します。欧州経済領域外への転送には、規則の第V章に基づく転送メカニズムと転送影響評価が必要であり、個々の第三国の立場は変更される可能性があります。
何よりもまず、モデルを構築する人とリスクを評価する人が同じ文書に基づいて作業するようにしてください。規制自体の基盤については、一般データ保護規則の概要で説明しており、個人データをAIシステムに投入することによって生じる具体的な問題、例えば自動意思決定から影響を受ける人々の権利に至るまでについては、オランダにおけるGDPRとAIに関する関連記事で取り上げています。
よくある質問
AIモデルのトレーニングには、どのような法的根拠を用いるべきでしょうか?
ほとんどの商業環境では、正当な利益が根拠となります。正当な利益には、利益、必要性、およびバランス調整を網羅した書面による評価が必要です。データが機密性の高いものである場合や、使用方法が関係者を驚かせる可能性がある場合は、同意を得ることが望ましいですが、同意は真に自由かつ撤回可能でなければなりません。これは、トレーニングセットでは実現が難しい場合があります。契約上の必要性は、トレーニングが顧客の要求するものではないため、モデル開発にはほとんど適用されません。いずれの根拠を選択するにしても、処理を開始する前に記録しておきましょう。事後的に根拠を選択しても、根拠がないものとみなされます。
データを匿名化してから処理した場合でも、GDPRは適用されますか?
匿名化が真に機能する場合に限ります。データは、使用される可能性のあるすべての手段と、それと組み合わせられる可能性のある他のデータセットを考慮に入れた上で、誰にとっても再識別が合理的に不可能になった場合に匿名化されます。名前を削除したり、識別子をハッシュに置き換えたり、小規模なグループに集約したりするだけでは、通常この基準を満たさず、結果として仮名化されたデータとなり、規制の完全な適用対象となります。匿名化がプロジェクトを対象外とみなす根拠となっている場合、その結論は検証および文書化され、データセットが変更されるたびに再検討される必要があります。
顧客データの再利用に関して、研究例外規定を頼りにすることは可能でしょうか?
まれに。科学的または統計的な目的でのさらなる処理は、元の目的と両立するものとみなされますが、例外は、認められた方法論的基準に従って実施され、匿名化やアクセス制限などの保護措置が講じられている研究を対象としています。商業当事者が自社の利益のために実施する製品開発やモデル改良は、データサイエンスを伴うため、研究とはみなされません。適合性テストがそれ自体で満たされない場合は、新たな法的根拠が必要となり、ほとんどの場合、関係者に対して新たな情報を提供する必要があります。
モデルのトレーニング後に誰かが同意を撤回した場合、どうなるのでしょうか?
同意の撤回は将来に効力を持ち、過去の処理を遡及的に違法にするものではありませんが、その根拠に基づいてデータが使用されなくなることを意味します。実際には、トレーニングセット、特徴量ストア、ログから該当者を削除し、モデルが該当者のデータを反映していることが証明できる場合は、再トレーニングを行うか、その他の方法でモデルが該当者のデータを反映しないようにする必要があります。これが、同意をモデルトレーニングの根拠とするのが難しい理由の一つであり、最初の要求が届いた後ではなく、設計段階で検討すべき重要な問題です。
認定条件 Law and More 助けることができる
Law and More オランダ国内外の組織に対し、アナリティクスおよびAIにおけるデータ保護に関するアドバイスを提供します。具体的には、法的根拠の選択と文書化、正当な利益評価および影響評価の実施、審査に耐えうるプライバシーステートメントおよび処理契約書の作成、オランダ個人情報保護庁(Autoriteit Persoonsgegevens)への対応、個人または代表財団による訴訟への対応などです。データ駆動型プロジェクトを計画されている場合、または既に規制当局から連絡を受けている場合は、喜んでご相談に応じます。


