今日の世界は情報に満ちあふれています。企業や公共部門、さらには個人までもが、日々大量のデータにさらされています。データを迅速かつ効率的に収集し、パターンを見つけ出して解釈できることは、今や企業にとって競争上の優位性です。公共部門では、データマイニングソフトウェアによって、組織が不正や無駄、不正利用を排除し、犯罪解決にまで役立てています。その結果、公共部門の組織は納税者の費用を節約し、効率的に業務を運営できます。
残念ながら、市場にはデータマイニングツールが数多く存在し、組織固有のニーズに適したものを選ぶのは、ことわざにある干し草の山から針を探すように感じられるかもしれません。
十分な情報に基づいて判断できるよう、以下では、データマイニングソフトウェアの主要ツール5製品をレビューします。
データマイニングソフトウェアとは?
データマイニングソフトウェアは、データ内のパターンを見つけ出し、価値ある情報へ変換するためのツールです。大量のデータセットを分析し、見つかった情報に関するレポートを作成するビジネスインテリジェンス(BI)ソフトウェアの一種です。多くのツールが現在では人工知能(AI)や機械学習(ML)機能を備え、さまざまな可能性を切り開いています。
さらに、データ、人、プロセスを単一のプラットフォームに集約する流れにより、現在では複数の個別ツールを使う方法が取って代わられています。最新のデータマイニングプラットフォームは、すべての機能を1つの統合ソリューションに備え、低コストかつ迅速で柔軟な方法によって、データ準備とデータサイエンスのプロセス全体を自動化できます。
データマイニングソフトウェア市場は急速に拡大しており、2026年には13.1億米ドルに達すると予測されています。2019年から2026年までの年平均成長率(CAGR)は11.42%です。この急成長を支えているのは、AIを活用したデータマイニングソリューションに対する企業の需要です。
関連記事:データ移行におけるベストプラクティスと戦略トップ8
データマイニングツールのトップ5
Alteryx
Alteryxを使えば、誰でも大量のデータを迅速なインサイトに変換し、日々の業務で画期的な成果を上げられます。これを可能にしているのが、ローコード/ノーコード機能です。
現在、世界中の多くの組織がAlteryxを利用して従業員のスキルを高め、影響力の大きいビジネス成果を迅速に実現しています。
Alteryx Analytic Process Automation(APA)Platformは、エンドツーエンドのデータサイエンス、分析、ML自動化を提供し、組織のデジタルトランスフォーメーションの取り組みを拡大できます。Alteryx APA Platformを使えば、分析とデータサイエンスを自動化し、組織全体にインテリジェントな意思決定を組み込み、より迅速かつ優れたビジネス成果を生み出せるよう従業員を支援できます。
主な機能
- アセット入力の自動化:Amazon、Oracle、Salesforceなど、80を超える外部データソースと連携します。追加のデータソースにも安全にいくつでも接続でき、データをAlteryxにインポートすれば、検索に費やす時間を減らし、分析により多くの時間をかけられます。
- 分析プロセスの自動化:データサイエンスと分析のプロセス全体を自動化する幅広い機能を提供します。データの準備、ブレンディング、クレンジング、エンリッチメント、モデリング、スコアリング、デプロイが含まれます。
- データ品質と準備:データは正確かつタイムリーであって初めて価値を持ちます。品質の低いデータは、組織の収益に影響する誤った意思決定につながる可能性があります。Alteryxプラットフォームは、データが分析に適した状態か確認するための包括的なデータ品質機能を提供します。
- データエンリッチメントとインサイト:人口統計や位置情報などの追加のコンテキスト情報でデータを拡充することで、これまで不可能だったインサイトを発見できます。Alteryxプラットフォームは、一般的なデータソース向けの各種ビルド済みコネクターを含む、データエンリッチメント用の豊富なツールを提供します。
- データサイエンスと意思決定:Alteryxプラットフォームは、MLやAIを含む幅広いデータサイエンス機能を提供します。これらのツールを使えば、コーディングや分析の専門知識がなくても、予測や推奨を行うモデルを構築したり、データ内のパターンを発見したりできます。
- 成果の自動化:モデルを構築したら、それを本番環境に投入し、意思決定を自動的に行えるようにする必要があります。Alteryxプラットフォームには、分析モデルのデプロイと実行を自動化する複数のツールが含まれています。
メリット
- ローコード/ノーコード機能により、組織がデータマイニングツールの力を迅速に活用できる
- 80を超えるデータソースに自動接続
- コーディングや分析のスキルがないユーザーにも自動化されたインサイトを提供
- Salesforce、Marketo、Oracleなど既存の業務アプリケーションとツールをシームレスに統合
デメリット
- 競合製品と比べて価格が高い。
料金
基本パッケージはユーザー1人あたり年間5,195ドルで、30日間の無料トライアルが付属します。チームや組織向けの割引もあります。正確な料金の詳細は問い合わせが必要です。
Trifacta
Trifactaは、オープンでインタラクティブなデータエンジニアリング向けクラウドプラットフォームです。共同でデータのプロファイリング、準備、分析・ML向けのパイプ処理を行えます。Trifactaは、AI支援型のセルフサービスアプローチにより、アナリストやエンジニアがデータ品質を評価、修正、検証し、変換を高速化し、堅牢なデータパイプラインを大規模に自動化できるようにします。
主な機能
- マルチクラウド対応:オンプレミスでもクラウドでも、データが存在する場所で作業できます。Amazon Web Services(AWS)、Microsoft Azure、Google Cloud Platform(GCP)を含む主要なパブリッククラウドに対応するほか、組織に最適な方法を柔軟に選べるさまざまなデプロイオプションを提供しています。
- 柔軟な実行:データ準備の実行方法を選択できます。RESTful APIを使ってクラウドでワークフローを実行したり、インタラクティブなコマンドラインインターフェース(CLI)を介してオンプレミスで実行したり、環境内のDockerコンテナで実行したりできます。
- ユニバーサル接続:データサイエンティストは、50を超えるコネクターに対応するTrifactaのユニバーサル接続フレームワークを使い、あらゆるファイル、アプリケーション、データベースを扱えます。ClouderaやHortonworksなどのHadoopディストリビューションを含むデータソースにも簡単に接続でき、標準的な変換を適用したり、特許取得済みのWranglerテクノロジーを使ってデータの問題を自動的に発見・修正したりできます。
- API駆動:プロファイリングやデータ変換から、下流のアプリケーションへの結果のデプロイまで、データ準備プロセス全体を自動化できる豊富なAPIを通じて、ワークフローのオーケストレーション機能を提供します。
- スマートサンプリング:6つの高度かつ補完的なサンプリングアルゴリズムを使い、分析に最適なデータをインテリジェントに選択します。データの重要な部分に集中することでコストを削減し、時間を節約するとともに、モデルの精度向上にも役立ちます。
- アクティブデータプロファイリング:欠損、誤り、不整合のあるデータから外れ値まで、データセットの問題を瞬時に特定し、対処できるようにします。
- 予測変換:MLアルゴリズムに基づく機能で、手作業の代わりにデータセットをモデリングや分析向けに準備できます。ツールがデータセットに必要な変換ルールを自動的に検出するため、コードを書いたり複雑なアルゴリズムを学んだりする必要はありません。
- 適応型データ品質:データの変換中に品質を継続的に監視する機能です。ADQはMLを使ってデータの問題をほぼリアルタイムで検出・修正するため、分析時にすべてのデータがクリーンな状態であると確信できます。
- データクラスタリングと標準化:データセット内の類似レコードのグループを自動的に発見し、ラベル付けできます。一方、データ標準化では、フィールドを事前設定したスキーマに合わせて正規化し、さらなる探索やモデリングに備えます。データ準備中に任意のフィールドをその場で変更することも可能です。
メリット
- すぐに使えるビルド済みワークフロー
- ほぼリアルタイムで問題を自動的に発見・修正
- 共有可能なレシピ、マクロ、データフロー、テンプレート
- 共同作業に適した使いやすい環境
- 無制限のスケーラビリティ
デメリット
- データの準備やサンプルの作成・読み込み時に、ツールの動作が遅くなったり不安定になったりすることがあるという不満を、一部の顧客が訴えています。
料金
Trifactaには3つの料金プランがあります。Starterプランはユーザー1人あたり月額80ドルで、vCPU時間あたり0.60ドルが別途かかります。Professionalプランはユーザー1人あたり月額400ドルで、vCPU時間あたり0.60ドルが別途かかります。Enterpriseユーザーは申し込み後に見積もりを受け取れます。
すべてのプランに30日間の無料トライアルが付属します。学生、教育関係者、条件を満たす非営利団体向けの教育ライセンスも提供しています。
AWS Glue
AWS Glueは、SQLクエリやApache Sparkジョブを使い、異なるAWSのコンピューティング・ストレージサービス間、またはオンプレミスのサードパーティーデータベースとの間でデータを移動するための、抽出・変換・ロード(ETL)パイプラインを作成できるマネージドサービスです。
主な機能
- 高速なデータ統合:社内の異なるソースからデータを集約し、利用可能な情報へ変換するプロセスを自動化できます。これにより、数か月ではなく数分でデータ分析を完了できます。
- 大規模なデータ統合の自動化:複数のアベイラビリティーゾーン(AZ)にまたがってコンピューティングリソースを自動的に拡張し、データ統合ジョブのスループット要件に対応します。データ取り込みワークフローを管理するカスタムスケジューラーを定義することもできます。
- 管理するサーバー不要:AWS Glueを使うためにサーバーをデプロイ、設定、拡張する必要はありません。サービスとして実行され、ニーズに応じて自動的に拡張するため、インフラの監視に費やしていた時間を削減できます。
メリット
- SQLクエリによってサービス間でデータを容易に移動できる
- ワークロードに応じて自動的に拡張し、使用したリソース分だけ支払えばよい
デメリット
- 他のETLプラットフォームとの統合が少ない
- 複雑な料金体系
料金
多くのAWSサービスと同様、料金は使用量に基づきます。たとえば、ETLジョブと開発エンドポイントは、DPU(データ処理単位)時間あたり0.44ドルで、秒単位で課金されます。ジョブの種類(Apache Spark、Spark Streaming、Python shell)に応じて、最低利用時間は1分または10分です。
Incorta
Incortaは、複雑なデータの力を余すことなく引き出し、かつては不可能と思われていたインサイトを、短時間かつ低コストで得られるセルフサービス型データ分析ソリューションです。
Incortaは、インメモリー分析と独自のDirect Data Mappingテクノロジーを組み合わせ、オープンなデータストレージ・管理フレームワークの中で、卓越した速度、耐久性、スケーラビリティを実現します。
主な機能
- 拡張可能なコネクターアーキテクチャ:Incortaの50以上のコネクターは、一般的な多くのビッグデータソースを含む、あらゆるデータで動作するよう設計されています。
- ダイレクトデータマッピング:ダイレクトデータマッピングによって、クエリで考えられるすべての経路を特定します。データモデルを再構成・変換することなく、高速なクエリを実行できます。
- 信頼できる単一の情報源:全員が同じデータにアクセスし、作業できます。
- セキュリティ:ロールベースのアクセス制御、シングルサインオン(SSO)、暗号化、属性ベースの動的な行フィルタリング、監査機能を備えています。
- メモリ最適化分析エンジン:Incorta Data Analyzerや、Tableau、Power BIなどのサードパーティーBIツールからアクセスできるリアルタイムデータの分析機能を提供します。
メリット
- 高速なパフォーマンス――速度を低下させることなく大量のデータを処理できる
- 複雑な結合や集計が不要
デメリット
- やや使いにくく、専門的なスキルが必要
料金
Incortaはウェブサイト上で料金情報を公開していません。ただし、30日間の無料トライアルを開始し、カスタム見積もりを依頼できます。
TIMi Suite
TIMi Suiteは、データ内のパターンの発見、MLによる将来の行動予測、発見した内容の可視化を支援するツールスイートです。
主な機能
TIMiフレームワークは、以下で構成されています。
- Anatella:統合プラットフォームの中核であり、小規模なコンピューティングインフラでも、数十億行・数千列のテーブルを処理できます。Anatellaを使えば、直感的なノーコードインターフェースで複雑なデータ変換を迅速に構築できます。さらに、数回クリックするだけであらゆるデジタルプロセスを自動化し、グラフを定期的な時間間隔で自動実行するよう設定できます。Anatellaには400以上のボックスが用意されています。必要に応じて、R、Python、Javascriptのコラボレーションフレームワークを活用し、新しいボックスをすばやく簡単に作成することも可能です。
- Modeler:リアルタイムのAutoMLエンジンです。データを継続的に監視し、変化を検知するとモデルを自動的に再構築します。Modelerを使えば、顧客離れや製品需要などの将来の行動を予測したり、ビジネスパフォーマンスを左右する主要因を特定したり、新たな機会を見つけたりできます。
- Stardust:インタラクティブな3D VRデータ可視化ツールで、発見した内容をすばやく理解し、他者に伝えるのに役立ちます。Stardustには数百種類の可視化タイプが用意され、共有用にインタラクティブレポートを複数の形式でエクスポートできます。
- Kibella:無制限のセルフサービスBIポータルです。ユーザーは独自のダッシュボードをすばやく作成し、ビジュアルを組み合わせ、KPIを魅力的かつ動的に伝えられます。
メリット
- クラスタリング、分類、セグメンテーションなどの手法を含む、高度なデータ変換・分析に対応した強力な分析ツールボックス
- 高速かつメモリ効率に優れる
- 小規模な個人利用には十分な機能を備えた無料のコミュニティー版を提供
デメリット
- 一部のモジュールの見た目について不満を訴える顧客がいる
料金
TIMiはウェブサイト上で料金情報を公開していません。現在の料金を知るには、同社に問い合わせる必要があります。
データマイニングソフトウェアの選び方
市場にはデータマイニングソフトウェアやツールが数多く存在するため、自社に最適なものを選ぶのは容易ではありません。上記の5つを厳選して紹介しましたが、最終的にどのデータマイニングソフトウェアを選ぶかは、分析したいデータセットの規模と複雑さ、データマイニングに関する専門知識のレベル、実行したい分析の種類、予算によって決まります。
次の記事:2022年のデータセンター技術トレンド