ビッグデータの登場により、企業がこの広大な可能性を活用する道が数多く開かれました。データ駆動型のAI(人工知能)およびML(機械学習)への取り組みは、企業のより迅速な規模拡大と市場投入までの期間短縮に役立ちます。
しかし、AIモデルのトレーニングには、大量の正確なデータセットへのアクセスが必要です。さらに、現実世界のデータにアクセスする際には、いくつもの制約があります。
こうした制約には、大規模なデータセットの入手が難しいことに加え、データ保護法やプライバシー法が重視されるようになったことも含まれます。コンプライアンスやプライバシーに関する法律に違反し、多額の罰金を科される可能性に直面した企業は、利用可能なデータの活用を避ける傾向にあり、その結果、ビジネスチャンスを逃しています。
プライバシーとコンプライアンスに関する問題を回避するため、組織は合成データを使い始めています。
合成データとは?
合成データとは、元のデータに近いデータセットを作成するために、MLアルゴリズムによって人工的に生成されたデータのことです。研究者はこの安価で費用対効果の高い手法によって、大規模なデータセットを容易に生成できます。
合成データの作成には、特定の機械学習フレームワークがよく使われます。最も一般的なのが生成敵対ネットワーク(GAN)です。
このディープラーニングモデルでは、生成器と識別器という2つのニューラルネットワークを競わせ、合成データを生成します。生成モデルは実際のデータセットから学習し、実データに似た合成データを生成しますが、実際の事実と1対1で対応しているわけではありません。
合成データを生成するその他の方法として、変分オートエンコーダー(VAE)や自己回帰モデルがあります。VAEがエンコードとデコードのパターンを使うのに対し、自己回帰モデルは入力と出力のパターン群を使って合成データを生成します。
関連記事: 2022年にITリーダーが直面するデータ管理の主な課題と機会
なぜ合成データが必要なのか?
合成データを導入する理由は複数あります。第一に、企業は実データの収集と分析に多額の費用をかけています。合成データを使えば、情報取得コストを大幅に削減できます。さらに、合成データはAIモデルのトレーニングでも重要な役割を果たします。特に、実際のデータを入手できないユースケースで有効です。
合成データを利用するもう1つの理由は、データセットに人物の氏名や社会保障番号などの個人情報が含まれている場合です。非個人識別情報(non-PII)などの手法を採用してデータを匿名化すれば回避できますが、再識別のリスクは常に残ります。
これを防ぐには、人工データ生成ツールを使い、現実世界のデータから合成データを作成します。そうすれば実データの特性を維持しながら、個人情報を危険にさらすことなくデータを利用できます。
合成データのメリット
合成データを利用するメリットには、次のようなものがあります。
- コスト:実データの収集には時間がかかり、コストも高くなります。一方、合成データ生成ソフトウェアでデータを作成すれば、はるかに安価かつ迅速で、効率的です。
- システムテスト:本番環境で利用できるデータには、高品質なテストデータが不可欠です。しかし、過度に厳しい規制によって、包括的なデータセットの利用が制限されることがあります。その代替策として、システムのトレーニングに必要な要件をすべて満たす合成データを生成できます。
- スピード:機密性の高いデータセットへのアクセスを申請すると、時間がかかるうえ、多くの障壁に直面する可能性があります。合成データを使えば、実データを取得するための官僚的な手続きを踏む必要はありません。必要なときに、はるかに短時間でデータを作成できます。
- データプライバシーの確保:合成データの最も重要なメリットの1つは、 機密性の高いデータを 一切使わないことです。 個人情報がすべて削除されているため、 データが実在する人物に結び付けられることはありません。
- 容易なアクセス:特定のユースケースでは現実世界のデータを入手できないことがあり、別のケースではモデルを適切にトレーニングするのに十分なデータがないこともあります。そのような状況でデータを得る唯一の方法が、合成によってデータを生成することです。
合成データの課題
合成データには多くのメリットがある一方で、相応の制約もあります。
- 一般的な傾向の利用:合成データは実データを模倣できますが、元のデータを完全に再現することはできません。主に一般的な傾向に焦点を当てるため、元のデータに存在する例外的なケースを取りこぼす可能性があります。
- データのバイアス:合成データの品質は、元になったソースデータの品質に左右されます。ソースデータにバイアスが含まれていれば、合成データからも偏った結果が得られます。
- ユーザーの受容:合成データは新しい分野であるため、多くのユーザーが懸念を抱いています。そのため、合成データに関しては、組織がユーザーの受容という課題に直面することがよくあります。
合成データのユースケース
合成データは、金融、医療、自動車、製造など、複数の業界で活用されています。
自動運転車
自動運転車は、合成データの 代表的な成功事例の1つです。 企業は、自動運転車を正確に設計するため、膨大な量の実データを取得してラベル付けする必要があります。
しかし、実際に走行している車両のライブデータセットを収集するには、 多額の費用と時間がかかります。合成データを使えば、開発者はシミュレーション上の道路で自動運転車を現実的に、しかも安全かつ迅速、効率的にテストできます。
製造
企業が新製品を製造する際には、モデルのトレーニングに利用できる十分なデータセットがない場合があります。 合成トレーニングデータは、この問題に対処する最も迅速かつ効果的な方法です。考えられるすべてのシナリオを網羅した合成データセットでモデルをトレーニングすれば、企業は品質上の問題を早期に発見できます。
金融サービス
金融機関には、より深い洞察を得るために利用できる豊富な顧客データがあります。しかし、厳しいコンプライアンス法やプライバシー要件があるため、利用可能なデータの使用には慎重です。合成データを使えば、顧客のプライバシーを危険にさらすことなく、元のデータセットの統計的特性を再現できます。
医療
合成データは医療分野で広く利用されています。患者の機密性を侵害する法的問題を心配せずに、研究者が記録データを利用できるためです。さらに、実際の臨床データが存在しない領域でも、研究者は合成データを外挿して高度な研究を行えます。
AIのバイアス改善に役立つのか?
バイアスのない世界を望んでいても、現実には AIシステム は 意図しないバイアスを 助長してしまっています。 合成データは、AIアルゴリズムから偏見を根絶し、世界を正確に反映する、より公平なAIへと向かう機会をもたらします。
しかし、問題はAIシステムではなく、システムに入力されるデータにあります。これを解決するには、研究者が既存データに含まれるバイアスを調査する必要があります。そのうえで、前提や偏見が新たに作成する合成データに入り込まないよう、システムを再トレーニングできます。こうして作成された新しいデータセットは、あらかじめ定めた公平なAIの定義に適合します。
合成データの利用拡大
Gartnerの推計では、2024年にはAIプロジェクトで使われるデータの60%が 合成データになるとされています。プライバシーポリシーがより厳格になるにつれ、合成データという新興分野は成長していくでしょう。
合成生成データによって、企業は実行可能な洞察を得て、本番稼働までの期間を短縮し、より俊敏になります。合成データがもたらす多大なメリットを考えれば、AIモデルにおいて実データが合成データに置き換えられるのは時間の問題です。
次に読む: AIとMLでDevOpsを自動化