データは多くの組織にとって最も価値の高いリソースになっている。機械学習(ML)は、一部の先進企業だけが利用するニッチな技術から、現代のビジネスに欠かせない中核技術へと変化し、データを不可欠なツールにしている。しかし、多くのデータおよび機械学習プロジェクトは、その潜在能力を十分に発揮できずにいる。
企業は、不正確な結果を出すMLプロジェクトに苦慮している。その主な原因は、データそのものにある。今日、多くの企業は機械学習を通じてデータを活用する必要性を理解しているが、自社のデータ運用がこうした成果を妨げていることに気付いている企業は少ない。合成データを活用すれば、こうした現在の課題の多くを克服できる。
合成データとは何か?
その名が示すとおり、合成データとは人工的に生成された情報である。現実世界のルールに従い、現実の概念や傾向を反映するが、現実世界の情報源に由来するものではない。元のデータと同様に、さまざまな形態を取り、プレーンテキストから表形式の情報、画像や音声のメディアまで幅広い。
合成データは主に次の3種類に分類される。
- 完全合成データ
- 部分合成データ
- ハイブリッドデータ
完全合成データとは、100%人工的に作られたデータセットを指す。元のデータセットを基にしている場合もあるが、現実世界の情報やコンテキストは一切含まない。部分合成データは、元の情報の一部のフィールドを合成データに置き換えたもので、通常はデータ侵害のリスクを抑えるために使われる。ハイブリッドデータは、予想されるとおり、元のデータと合成データを組み合わせたデータセットを指す。
関連記事:主要なマネージドサービスプロバイダー。
合成データのメリット
GoogleやAmazonなどの大手テクノロジー企業は、MLアプリケーションで合成データを利用しており、その方向に移行する組織も増えている。もちろん、人気があるというだけでトレンドを取り入れる十分な理由にはならない。そこで、合成データを利用するメリットをいくつか紹介する。
バイアスの除去
直感に反するように思えるかもしれないが、現実世界のデータを使うよりも、合成データを使った方が正確な結果が得られる場合がある。これは、MLが抱える最も大きな課題の1つであるバイアスに起因する。
元のデータセットには、人間のバイアスが入り込みやすい。歴史的に形成された根深い無意識のバイアスは、データサイエンティストが気付かないうちに、人々がデータを収集、記録、整理する方法を通じて現実世界の情報に入り込む可能性がある。この問題は非常に広範囲に及んでおり、一般的なAIデータベースのデータの最大38.6%にバイアスが含まれている可能性を示す研究もある。
合成データを使えば、歴史的な不実表示など、バイアスにつながる問題を回避できる。その結果、必ずしも現実世界に由来しない情報であっても、MLモデルに利用することでより正確な結果を得られる可能性がある。また、顧客向けAIアプリケーションの適切性と公平性を高めることにもつながる。
データ量
合成データは、効果的なMLモデルのトレーニングに必要な十分な情報を入手しやすくする効果もある。信頼性の高いMLアルゴリズムは通常、大規模なデータセットを必要とするが、関連性のある十分なデータにすぐアクセスできる企業ばかりではない。合成データなら、長い収集プロセスを経ずに大量のデータを生成できるため、この問題を回避できる。
これには2つの方法がある。1つ目は、完全に合成されたデータセットを使う方法だ。もう1つは、元のデータセットの空白を埋めるために、実際の情報に基づいてダミーデータを生成する合成少数派オーバーサンプリングなどの手法を使う方法である。
こうした戦略は、現実世界のデータを利用できる量が限られている企業やMLアプリケーションにとりわけ有効だ。情報が不足していることが、効果的なML導入の障壁になるとは限らなくなる。
プロジェクトの効率化
同様に、合成データはチームがMLプロジェクトをより短期間で完了するのにも役立つ。2020年の調査によると、企業の3分の1は、MLモデルの導入に1~3カ月かかると回答している。さらに24%の企業はそれ以上の期間を要しており、これらの数字にはトレーニングとデータ収集にかかる時間さえ含まれていない。
平均導入期間がこれほど長い以上、企業はプロジェクトのコストを最小限に抑えるため、データ収集とトレーニングを可能な限り効率化する必要がある。合成データは、わずかな時間で十分な情報を提供できるため、理想的な解決策となる。
合成データを使えば、チームはデータの収集や整理にそれほど多くの費用をかけずに済む。生成方法によっては、あらかじめ標準化された形式で作成することもでき、準備作業も効率化できる。この効率性により、MLプロジェクトはより費用対効果の高い投資になる。
セキュリティ
MLで合成データを使うもう1つのメリットは、データ侵害のリスクを軽減できることだ。MLプロジェクトでは通常、大量のデータを1カ所に保存するため、重大なサイバーセキュリティリスクを抱える可能性がある。合成データは機密情報を置き換えることで、こうした懸念を軽減する。
MLプロジェクトが現実世界のデータ、特に個人を特定できる情報(PII)を利用している場合、侵害が起きれば深刻な事態になりかねない。企業は、復旧費用に加えて、事業の損失や法的な損害賠償に直面する可能性がある。一方、合成データが漏えいしても、現実世界のPIIが明らかになるわけではないため、問題の深刻度はそれほど高くない。
データ侵害のコストが2022年に過去最高の434万ドルに達していることを考えれば、このセキュリティ上のメリットは極めて重要だ。PIIのような機密情報を扱うMLアプリケーションにとっては、特に重要である。
MLで合成データを活用する方法
合成データは、ML開発者に多くのメリットをもたらす。ただし、他のあらゆるリソースと同様、その効果はチームがどのように利用するかに左右される。そこで、合成データを活用するためのベストプラクティスをいくつか紹介する。
合成データを使うべきタイミングを理解する
合成データについて最初に、そしておそらく最も重要に検討すべきことは、いつそれが最適な選択肢になるかを見極めることだ。合成データセットには元のデータに対する多くのメリットがあるが、常にチームが必要としているものとは限らない。
企業はMLの目標を見直し、現実世界の情報が必要かどうかを確認すべきだ。一般的に、合成データは「もしも」のシナリオをテストする場合、現実世界のデータが限られている、または偏っている場合、あるいはプライバシーが大きな懸念となる場合に適している。一方、元のデータは、デジタルツイン、外れ値が特に重要な場合、または現実世界の情報を容易に入手できる場合に適している可能性がある。
場合によっては、ハイブリッドデータセットを使うのが最善かもしれない。チームは目標と制約を明確にし、それぞれのMLプロジェクトに最適な戦略を理解する必要がある。
生成前にデータをクリーンアップして準備する
合成データであっても、データの準備とクレンジングを軽視してはならない。品質の低いデータは企業に年間平均1,500万ドルの損失をもたらすが、企業の60%は不良データによる損失額さえ把握していない。こうしたコストを避けるには、チームは合成データを利用する前に準備しなければならない。
合成データは標準化された形式で生成できるが、それでもエラーが発生する可能性はある。合成データを最大限に活用するため、チームはデータセットを利用する前に確認し、クリーンで整理された状態にしておく必要がある。
高品質な元の情報を基に合成データを作成することも有効だ。情報源の品質が高いほど、生成されるダミー情報の品質も高くなり、クレンジングや準備にかかる時間を短縮できる。
最適な生成方法を見極める
企業は、データ生成方法によって強みと弱みが異なることも理解しておくべきだ。合成データと元のデータのどちらを選ぶかを判断するのと同じくらい、各手法を比較して最適な選択肢を見つけることが重要である。
変分オートエンコーダー(VAE)は、複雑なデータセットを効率的に生成でき、導入も容易だが、複雑な元のデータセットでは、あらゆる種類のデータで一貫した品質を実現するのが難しい。一方、敵対的生成ネットワーク(GAN)は、非構造化または複雑な元のデータセットに適しているが、トレーニングと導入はより難しい。
場合によっては、合成データセットの生成を外部委託するのが最善かもしれない。こうした選択肢は増えており、2021年には70社を超えるベンダーが合成データを提供していた。チームは社内の専門知識、予算、ニーズを検討し、最適な進め方を判断すべきだ。
合成データでMLプロジェクトの可能性を引き出す
MLを最大限に活用するには、大規模で信頼性が高く、安全なデータセットが必要だ。多くの場合、合成データを使えば、元の情報に伴う複雑さを抑えながら、そうしたデータセットを用意できる。
ML開発者は、合成データによって自分たちのプロジェクトをどのように改善できるかを検討すべきだ。このリソースを活用することで、精度、効率、セキュリティ、財務面で大きなメリットが得られる可能性がある。その結果、MLは多くの企業にとって、より取り組む価値のあるものになる。
関連記事:エンタープライズネットワーキングの7つの課題。