世界のデータ生成量は、2025年までに180ゼタバイトに達すると予測されている。このうち約80~90%は、画像、動画、文書、プレーンテキストといった、解読が非常に難しい非構造化データだ。組織が、これまで活用されてこなかった膨大なデータの宝庫を探索すれば大きな恩恵を得られることは間違いない。しかし実際には、従来型のデータベースでは、それらを正確に解釈できないことが多い。
幸い、高度な機械学習(ML)技術を使えば、非構造化データをベクトル埋め込みと呼ばれる、分析しやすい数値形式に変換できる。 ベクトルプラットフォームは、数百万個のベクトルを保存、インデックス化し、クエリを実行して、リアルタイムに正確な順位付けを行うよう特別に構築されている。しかし、こうした高度なデータベースの構築は難しい。非常に労力がかかるうえ、専門的なスキルが求められるからだ。
Relevance AIは、開発者中心の「ベクトル」プラットフォームを構築している。これにより企業は、ほとんどラベリングやアルゴリズムのトレーニングを必要とせず、非構造化データから迅速にインサイトを抽出する人工知能(AI)アプリケーションを開発できる。最近、同社はプラットフォームのさらなる開発に向けて300万米ドルの資金も調達した。
SaaS、eコマース、ゲームなどさまざまな分野で、すでに300万人を超えるエンドユーザーと週1億件のリクエストが同社の製品を利用しており、Relevance AIはベクトルデータベース業界に変革をもたらしている。
私たちはRelevance AIの共同創業者であるJacky Koh氏に、ベクトルベースのテクノロジーが組織による非構造化データからの価値あるインサイトの獲得にどう役立つのかを聞いた。
Koh氏は以前、IAG satelliteで機械学習チームを率い、保険業界へのML導入に注力していた。また、EY初のData Science Challengeで優勝し、アプリストアで1位を獲得したモバイルアプリを数多く開発。合計で750万回インストールされている。
関連記事:2022年の主要データモデリングツール
- Relevance AIを始めた経緯と、その理由を教えてください。
- ベクトルベースのテクノロジーによって、データサイエンスは最近どのように進歩したのでしょうか。
- Clusteringエンジンについて、詳しく教えてください。
- クラスタリングに関して、データサイエンティストや実務担当者が直面する一般的な問題は何でしょうか。
- 御社のプラットフォームにおけるベクトルアプリケーションのユースケースについて、概要を教えてください。
- 一般的な中小企業でも、ベクトルベースのテクノロジーを導入できる状況にあるのでしょうか。
- Relevance AIならではの特徴は何ですか。
- 今後を見据えて、Relevance AIにどのような期待を寄せていますか。
Relevance AIを始めた経緯と、その理由を教えてください。
Jacky Koh:企業や、私が関わってきたさまざまな企業・顧客との仕事を通じて、実際には活用されていない大量の非構造化データを目にしました。顧客からのフィードバック、満足度、不正など、ビジネスKPIを改善するための多くの主要なユースケースでは、大量の非構造化データが生み出されていました。
ディープラーニングの埋め込み(一般にはベクトルとして知られている)は、非構造化データを分析する最も効果的な方法の一つです。ベクトルは、コンピューターのアルゴリズムがデータを適切に比較・分析できる形式でデータを表現します。これは、主要なテクノロジー企業がすべて利用している技術です。しかし、非構造化データを扱った経験のある高度なデータサイエンスチームを運用していない場合、導入はかなり難しいでしょう。
そこで私は、こうした技術へのアクセスを民主化し、データスキルのレベルを問わず、すべての開発者とデータチームが利用できるようにするためRelevance AIを始めました。ステークホルダーとの協働を確保しながら、データの潜在能力をビジネスに生かし、インサイトとアプリケーションを共同で生み出せるようにするためです。
ベクトルベースのテクノロジーによって、データサイエンスは最近どのように進歩したのでしょうか。
JK:一般にデータサイエンスは、人口統計データや数値データといった構造化データの分析を中心としてきました。自由記述欄やimage_attachement、URL欄は無視されることが多かったのです。ベクトルによって、そうしたデータも適切に分析し、構造化データと組み合わせてモデルを改善したり、インサイトの定性的要因をより深く把握したりできるようになりました。
さらに、ベクトルデータベースは、低レイテンシーかつ大容量でベクトルを保存・クエリできるよう設計されています。従来のデータベースにはこうした機能がありません。通常は構造化された表形式のデータを扱うためです。一方で、ほとんどのベクトルデータベースは、従来の構造化データを実際に保存する機能をほとんど備えていません。
私たちが提供するベクトルデータベースの独自性は、従来型のデータベースを念頭に置いて構築した点にあります。非構造化データは、構造化データと組み合わせたときに最も効果的に分析できるからです(例えば、テキストに現れる共通の自然言語トピックを、必要なKPIやユーザーの人口統計情報に結び付けるなど)。
Clusteringエンジンについて、詳しく教えてください。
JK:私たちのクラスタリングエンジンは、非構造化データからトレンドやテーマを見つけるための中核機能です。開発者にツールセットを提供し、非構造化データから最適なクラスターを作成して、ビジネス側がフィードバックを提供したりトレンドを確認したりできるフロントエンドのダッシュボードに展開できます。
クラスタリングでは、ベクトルの類似性に基づいて非構造化データをグループ化します。そのベクトルには、データに関連付けられるあらゆる種類の意味的特徴が含まれています。
例えば、100万語以上を含むテキストのサンプルでは、「サインアップページのポップアップが本当に嫌だった」と「参加しようとしたときに表示されたランダムなウィンドウは気に入らない」という2つの文は、表現こそ異なって見えても、意味的には非常によく似ています。したがって、この2つの文は同じクラスターに属します。この仕組みは文だけでなく、単語、段落、文書のレベルでも機能します。
私たちが提供するベクトルデータベースの独自性は、従来型のデータベースを念頭に置いて構築した点にあります。
私たちのクラスタリングアプリケーションは、このグループ化だけでなく、それらがどのように相関しているかを把握するためのKPIも提供します。
具体例を挙げましょう。自動車のマーケティングメッセージのうち、最も効果的なものを分析したい場合は、私たちのクラスタリングエンジンにかけます。最終的なクラスタリングアプリケーションにはすべてのクラスターが表示され、60個のクラスターのうちCluster-29が最も高いクリック率と最も低いコストを実現しているというインサイトが強調されます。そのクラスターが主に扱っているのは、「その車がどれほどサステナブルか」というテーマです。
私たちのアプリではドリルダウンして、インサイトに基づいてすぐに行動する前に、クラスターが正確であることを検証・確認できます。
クラスタリングに関して、データサイエンティストや実務担当者が直面する一般的な問題は何でしょうか。
JK:評価と解釈の部分です。アルゴリズムとしてクラスタリングを適用することは難しくありませんが、評価には、クラスタリングが定量的に妥当かどうかを判断するための深い統計知識が必要です。
そして、それを行ったら、こうしたクラスターがドメインエキスパートにとって意味を持つかどうかを確認しなければなりません。そのためには、技術に詳しくないドメインエキスパートが適切に閲覧・解釈できるよう、クラスターを可視化する必要があります。
御社のプラットフォームにおけるベクトルアプリケーションのユースケースについて、概要を教えてください。
JK:ユースケースは主に、非構造化されたテキストや画像データの分析に関するものです。具体的には次のとおりです。
セマンティック検索
顧客からのフィードバックや問い合わせに基づいてテキストデータを分析し、一定数のクラスターのトピックを特定します。
ある製品について10万語を超えるテキスト形式のフィードバックサンプルがあり、そこから30個のクラスタートピックを得たとします。Cluster-1には、「充電が止まった」「バッテリーが動作しない」「電力が0のまま」といった文が含まれる可能性があります。このクラスター内の言葉はまったく異なりますが、意味は意味的に似ています。
私たちのベクトルクラスタリングエンジンは、これらをグループ化するだけでなく、共通するテーマも明らかにできます。この場合、クラスターのトピックテーマは「バッテリーの充電が機能しない」となります。
画像検索
非構造化されたマーケティングデータを分析し、どの画像や視覚的特徴が効果を発揮しているかを確認します。例えば、ワインブランドでInstagramインフルエンサーキャンペーンを実施し、60個のビジュアルクラスタートピックを抽出したとします。
- Cluster-6には、夕食のテーブルを囲む家族の前に商品画像が表示されているケースが含まれるかもしれません。投稿15件における平均いいね数は2万件、売上は200万ドル、コストは2万5000ドルです。
- Cluster-7には、ホテルで2人の人物とともに商品画像が表示されているケースが含まれるかもしれません。投稿10件における平均いいね数は5万件、売上は100万ドル、コストは7万5000ドルです。
視覚的特徴を分析すれば、商品を家族の前に表示したときに、売上に最も効果的だと判断できます。
パーソナライズド検索
商品の説明や視覚的特徴に基づく検索やレコメンデーションによって、より優れた、パーソナライズされた発見体験を提供できます。これ以外にも、特にゲーム業界におけるユーザーインタラクションに関する非構造化データでのユースケースがあります。ゲーム内のあらゆる行動をベクトル化し、クラスタリングを使って行動の組み合わせから生まれるさまざまなプレイスタイルを特定できます。例えば、Cluster-1は、プレイヤーが先に攻撃し、休み、その後防御するオールラウンド型のプレイスタイルです。一方、Cluster-2は、プレイヤーが攻撃し、休み、さらに攻撃する非常に攻撃的なプレイスタイルです。こうしたプレイスタイルを把握することで、勝率が最も高いスタイルを特定し、新規プレイヤーをマッチングし、ゲームプレイの改善に向けてよりパーソナライズされた体験を提供できるようになります。
一般的な中小企業でも、ベクトルベースのテクノロジーを導入できる状況にあるのでしょうか。
JK:もちろんです!ベクトルの優れた点の一つは、入力するデータタイプに合わせて標準化でき、複数のドメインでそのままうまく機能することです。したがって、適切なツールで支援すれば、ほとんどの企業は標準化されたプロセスから価値の80%を得られます。残りの20%は、より高度なチームが最適化する部分です。
Relevance AIならではの特徴は何ですか。
JK:私たちは、実験とコラボレーションの段階にエンドツーエンドで強く注力しています。エンドツーエンドというのは、データからデータ実務担当者、ドメインエキスパートを経て、ビジネスが実行に移せるインサイトに至るまでを意味します。
データ実務担当者は、数行のコードで非構造化データをベクトルに変換し、共有可能なダッシュボードに展開できます。共有後、ダッシュボードはドメインエキスパートからフィードバックを収集するため、データ実務担当者はそのフィードバックを取り入れ、ビジネスにとって実際に有益な分析になるよう最適化・調整できます。
実験段階が完了したら、データ実務担当者は単一のアプリ行go_live()で本番環境にプッシュできます。これもすべて私たちのプラットフォーム内で行えます。
今後を見据えて、Relevance AIにどのような期待を寄せていますか。
JK:Relevance AIが「非構造化データ」という言葉と同義になることを願っています。SalesforceがCRM、Slackがチームメッセージングの代名詞であるように、私たちは非構造化データの代名詞になりたいのです。
私たちにとって、それは非構造化データに関してユーザーに可能な限り多くのユーティリティを提供することを意味します。セルフサービス向けのベクトルクラスタリングから始めていますが、すでにロードマップ上で、ベクトルベースのディスカバリーや解釈のためのベクトルベースのモデルレポートカード、異常検知など、さまざまな機能を検討しています。