AIデータ主権とは何か——平易な言葉で説明する
この言葉は企業向けの法律用語のように聞こえますが、実はとても個人的なことを指しています。あなたがこれまでに生み出した中でもっとも親密なデータセット——AIとの会話——が、あなた自身のものなのか、それとも一度も会ったことのない会社のものなのか、ということです。ここでは、それが実際に何を意味するのか、そして個人がそれをどう手に入れるのかを説明します。
AIデータ主権とは、あなたのAIがあなたについて蓄積するデータ——会話、記憶、好み、ファイル——が、ベンダーではなく、あなた自身のコントロール下、あなた自身の管轄の中に保存されることを意味します。データがどこにあるか、誰がアクセスできるか、いつ削除されるかを決めるのはあなたです。そして重要なのは、その3つすべてを、ポリシーページを信じるのではなく自分で確認できるということです。
この言葉について書かれたもののほとんどは、企業——コンプライアンス部門、規制対象の業界、政府クラウド——に向けたものです。しかし、この概念がもっとも重要になるのは、誰もそれについて語ってこなかった場所、つまり個人においてです。なぜなら、あなたの仕事、家族、健康の悩み、計画を知っているアシスタントとの進行中の会話ほど個人的なものは、どんな企業のデータベースにも存在しないからです。
主権はプライバシーと同じものではない
この2つはしばしば同じ意味で使われますが、その違いこそが本質です。プライバシーとは約束です。ベンダーがあなたのデータをどう扱うかを教え、あなたはそれを信じます。主権とは、その約束を必要としないことです。データはあなたがコントロールするインフラの上にあるので、ポリシーの変更も、買収も、第三者への召喚状も、プロダクトの判断も、そのデータに何が起こるかを変えることはできません。
優れたプライバシーポリシーを掲げるクラウドチャットボットでも、あなたの会話履歴は依然としてそのサーバー上に保持されます。モデルのトレーニングをオプトアウトすることはできます——それがプライバシーです。しかしデータが物理的にどこにあるかを自分で決めることはできませんし、削除リクエストが本当に何かを削除したのかを確認することもできません——それが、あなたが持っていない主権です。
なぜ賭け金は静かに膨れ上がったのか
10年前、テック企業にとっての「あなたのデータ」とは、メールと写真を意味していました。AIアシスタントが蓄積するものは、まったく性質が異なります。それはあなたがどう考えるかの、長期にわたる記録です。人々は検索エンジンには尋ねないようなことを、完全な文章で、文脈込みでアシスタントに尋ねます——お金のこと、対立、迷い、難しい会話の下書き。
その記録は、個人的であればあるほど価値を持ちます。つまり、それに対するコントロールを失うコストも同じように複利で膨らんでいきます。読まなかったポリシー変更、監査できないベンダーでの情報漏えい、何年分もの蓄積されたコンテキストごと消えてしまうアカウント停止。もしAIとの履歴を印刷して見知らぬ人に手渡すことに抵抗を感じるなら、あなたはすでにデータ主権を気にかけています——ただ、その言葉を使っていなかっただけです。
コントロールの4段階
実際には、AIデータのコントロールはスイッチではなく、はしごです。
レベル0——クラウドアカウント、デフォルト設定のまま。あなたの履歴はベンダー側にあり、モデルのトレーニングに使われることもあり、あなたが交渉していない規約によってすべて支配されています。
レベル1——クラウドアカウント、プライバシーオプションを使う。トレーニングのオプトアウト、一時的なチャット、削除リクエスト。意味のある改善ですが、依然として「約束」に基づくものです。インフラも、確認できないという問題も変わりません。
レベル2——セルフホストのエージェント層。アシスタントそのもの——その記憶データベース、会話のアーカイブ、ファイル、連携機能——が、あなたが所有するサーバー上で動きます。言語モデル自体は依然としてクラウドAPIなので、個々のリクエストはプロバイダーに通過しますが、蓄積——あなたを描写していくデータセット——は、あなたのマシンから一切出ていきません。ここが、個人にとって主権が現実になる段階であり、費用は月にコーヒー2杯分ほどのVPS利用料で済みます。
レベル3——完全ローカルモデル。何ひとつあなたのハードウェアの外に出ません。最大限の主権ですが、現実的なトレードオフもあります。ローカルモデルは依然として最先端のクラウドモデルに後れを取っており、セットアップも気軽にはいきません。ほとんどの人にとって、これは出発点ではなく到達点です。
多くの解説が見落としている正直な洞察はこうです。レベル2が価値のほとんどを捉えているということです。あなたの人生が紐づいていない単発のリクエストは、永続的に蓄積されていくプロフィールに比べればずっと小さな露出です。蓄積に対する主権こそが、この問題全体の8割を占める部分であり、しかも最先端モデルの品質を諦めることなく、今日手に入れられる層でもあります。(このアーキテクチャで実際に何がローカルに留まり、何が通過するのかはこちらで詳しく説明しています。)
レベル2は実生活でどう見えるか
具体的に、Avelina AIを実例として見てみましょう。アシスタントはあなたのVPS上で動き、Telegramであなたと話します。アシスタントがあなたについて知っているすべて——永続的な記憶、会話の完全なアーカイブ、あなたのファイル——は、そのサーバー上のフォルダにある一連のデータベースです。標準的なツールで開くことができ、1つのコマンドでバックアップでき、別のサーバーに移すことも、削除して本当に消えたと確認することもできます。モデルの呼び出しは、あなた自身のAPIキーでリクエストごとに外へ出ていきますが、あなたのプロフィールは家に留まります。
これを実現するのに、開発者である必要はまったくありません。必要なのは、あなたがどう考えるかの記録を、誰か別の会社のデータ倉庫の一項目にしないと決めることだけです。
GDPRはどうなのか
規制は役に立ちます——アクセス、削除、ポータビリティに対する実質的な権利を作り出しました。しかし権利とは、他人のインフラに対してあなたが主張するクレームです。削除をリクエストすることはできても、それが実際に起きるのを見届けることはできません。クライアントの情報をAIツールに入力するフリーランサーや中小企業にとって、この隙間は机上の空論ではありません。あなたのコンプライアンスが、彼らのデータの扱い方に依存してしまうのです。アーキテクチャは、書類仕事が「約束」しかできないことを実際に解決します。あなたのサーバーから一度も出ていないデータには、戻ってくるための法的手段など必要ありません。
FAQ
AIデータ主権とは、簡単に言うと何ですか?
あなたのAIが蓄積したデータ——会話、記憶、ファイル——が、あなたがコントロールするインフラ上にあり、それがどこにあるか、誰が触れるか、削除が本当に削除を意味するのかを自分で確認できる、ということです。
データプライバシーと同じことですか?
いいえ。プライバシーはベンダーが自社のインフラについてする約束です。主権はその依存そのものを取り除きます——データはあなた自身のインフラの上にあるからです。
個人でも実現できますか、それとも企業だけですか?
個人でも実現できます。小さなVPS(月5〜15ドルほど)上のセルフホストアシスタントを使えばよいのです。それが上記のレベル2であり、価値のほとんどを占め、企業向けの仕組みは一切必要ありません。
最高のモデルを諦める必要がありますか?
いいえ。エージェント層をセルフホストしても、蓄積データを家に留めたまま、リクエストごとに最先端モデルを呼び出すことができます。
GDPRがあれば、それだけで十分では?
GDPRは、自分で行使し、相手を信じなければならない権利を与えてくれます。アーキテクチャによる主権は、自分で確認できる事実を与えてくれます。