La production mondiale de données devrait atteindre 180 zettaoctets d’ici 2025. Sur ce volume, environ 80–90 % correspondent à des données non structurées sous forme d’images, de vidéos, de documents et de texte brut, particulièrement difficiles à déchiffrer. Les organisations auraient sans aucun doute beaucoup à gagner en explorant ces immenses trésors de données encore inexploités. Mais force est de constater que les bases de données traditionnelles sont souvent incapables de les interpréter correctement.
Heureusement, les techniques avancées d’apprentissage automatique (ML) peuvent convertir les données non structurées en un format numérique facilement analysable, appelé représentations vectorielles. Les plateformes vectorielles sont conçues sur mesure pour stocker, indexer et interroger des millions de vecteurs, puis les classer avec précision en temps réel. Cependant, la création de ces bases de données avancées est difficile, car elle exige beaucoup de travail et des compétences spécialisées.
Relevance AI développe une plateforme « vectorielle » pensée pour les développeurs, qui permet aux entreprises de créer des applications d’intelligence artificielle (IA) afin d’extraire rapidement des informations de données non structurées, sans nécessiter ou presque d’étiquetage ni d’entraînement d’algorithmes. Récemment, l’entreprise a également levé 3 millions de dollars US pour poursuivre le développement de la plateforme.
Déjà utilisés par plus de trois millions d’utilisateurs finaux et traitant 100 millions de requêtes hebdomadaires dans divers secteurs, notamment le SaaS, le e-commerce et le jeu vidéo, les produits de Relevance AI bouleversent le secteur des bases de données vectorielles.
Nous nous sommes entretenus avec Jacky Koh, cofondateur de Relevance AI, pour discuter de la manière dont les technologies vectorielles peuvent aider les organisations à tirer des informations précieuses de leurs données non structurées.
Auparavant, Koh dirigeait l’équipe d’apprentissage automatique d’IAG satellite, où il se consacrait à l’application du ML au secteur de l’assurance. Koh a également remporté le premier Data Science Challenge d’EY et créé de nombreuses applications mobiles qui ont atteint la première place de l’App Store et cumulent 7,5 millions d’installations.
À lire également : Les meilleurs outils de modélisation des données en 2022
- Expliquez-nous comment et pourquoi vous avez créé Relevance AI.
- Pouvez-vous nous présenter les avancées récentes de la science des données rendues possibles par les technologies vectorielles ?
- Pouvez-vous donner à nos lecteurs quelques détails sur votre moteur de clustering ?
- Quels sont les problèmes courants auxquels les data scientists et les praticiens sont confrontés avec le clustering ?
- Pouvez-vous nous donner un aperçu des cas d’usage des applications vectorielles sur votre plateforme ?
- La PME moyenne est-elle en mesure d’adopter les technologies vectorielles ?
- Qu’est-ce qui rend Relevance AI unique ?
- Pour l’avenir, quels espoirs nourrissez-vous pour Relevance AI ?
Expliquez-nous comment et pourquoi vous avez créé Relevance AI.
Jacky Koh : Au cours de mon expérience dans le monde de l’entreprise et auprès des différentes sociétés et différents clients avec lesquels j’ai travaillé, j’ai constaté que de grandes quantités de données non structurées n’étaient pas vraiment exploitées. De nombreux cas d’usage essentiels pour améliorer les KPI de l’entreprise, comme les retours et la satisfaction des clients ou encore la fraude, produisaient beaucoup de données non structurées.
Les représentations issues de l’apprentissage profond (plus communément appelées vecteurs) sont l’un des moyens les plus efficaces d’analyser les données non structurées. Les vecteurs représentent les données dans un format qui permet aux algorithmes informatiques de les comparer et de les analyser correctement. C’est une technique utilisée par toutes les grandes entreprises technologiques. Elle reste toutefois assez difficile à mettre en œuvre lorsqu’on ne dispose pas d’une équipe de data science sophistiquée et expérimentée dans le traitement des données non structurées.
J’ai donc créé Relevance AI pour démocratiser cet accès et permettre à tous les développeurs et équipes data, quel que soit leur niveau de compétence, d’utiliser cette technologie et d’exploiter le potentiel de leurs données pour leur entreprise, tout en veillant à ce que les informations et les applications soient produites en collaboration avec les parties prenantes.
Pouvez-vous nous présenter les avancées récentes de la science des données rendues possibles par les technologies vectorielles ?
JK : En général, la data science s’est concentrée sur l’analyse de données structurées, comme les données démographiques et numériques. Les champs de texte libre, d’image_attachement ou d’URL étaient souvent ignorés. Grâce aux vecteurs, ces données peuvent désormais être correctement analysées et utilisées avec les données structurées afin d’améliorer les modèles et de mieux faire ressortir les facteurs qualitatifs des informations.
Par ailleurs, une base de données vectorielle est conçue pour stocker et interroger des vecteurs avec une faible latence et à grande échelle. Les bases de données traditionnelles n’offrent pas ces fonctionnalités, car elles traitent généralement des données structurées et tabulaires. En revanche, la plupart des bases de données vectorielles permettent rarement de stocker réellement les données structurées traditionnelles.
La particularité de la base de données vectorielle que nous proposons est que nous l’avons conçue en gardant à l’esprit les bases de données traditionnelles. En effet, les données non structurées sont mieux analysées lorsqu’elles sont combinées à des données structurées (par exemple, en reliant les thèmes courants exprimés en langage naturel dans le texte aux KPI et aux données démographiques des utilisateurs concernés).
Pouvez-vous donner à nos lecteurs quelques détails sur votre moteur de clustering ?
JK : Notre moteur de clustering est notre fonctionnalité phare pour aider les entreprises à trouver des tendances et des thèmes dans leurs données non structurées. Il fournit aux développeurs un ensemble d’outils pour obtenir les meilleurs clusters à partir de leurs données non structurées, puis les déployer dans un tableau de bord frontend sur lequel l’entreprise peut donner son avis et observer les tendances.
Le clustering consiste à regrouper les données non structurées en fonction de la similarité de leurs vecteurs, qui encapsulent toutes sortes de caractéristiques sémantiques que nous leur associerions.
Par exemple, dans un échantillon de texte comprenant un million de mots ou plus, deux phrases comme « Je n’ai vraiment pas aimé la fenêtre pop-up sur la page d’inscription » et « Je n’aime pas la fenêtre qui est apparue quand j’ai essayé de m’inscrire » peuvent sembler formulées différemment, tout en étant très proches sémantiquement. Les deux phrases appartiendront donc au même cluster. Cette méthode fonctionne ainsi non seulement au niveau des phrases, mais aussi à celui des mots, des paragraphes et des documents.
La particularité de la base de données vectorielle que nous proposons est que nous l’avons conçue en gardant à l’esprit les bases de données traditionnelles.
Notre application de clustering fournit non seulement ce regroupement, mais aussi des KPI permettant d’identifier les corrélations.
Prenons un exemple : si vous souhaitez analyser le message marketing le plus efficace pour votre voiture, faites-le passer dans notre moteur de clustering. L’application de clustering finale vous montrera tous les clusters et mettra en évidence les informations indiquant que le Cluster-29, sur 60 clusters, affiche le meilleur taux de clics et le coût le plus faible. Ce cluster porte principalement sur la question de savoir « à quel point la voiture est durable ».
Notre application vous permet d’examiner les données plus en détail afin de vérifier que le cluster est exact avant d’agir immédiatement sur cette information.
Quels sont les problèmes courants auxquels les data scientists et les praticiens sont confrontés avec le clustering ?
JK : L’évaluation et l’interprétation. Appliquer le clustering en tant qu’algorithme n’est pas difficile, mais son évaluation exige de solides connaissances en statistiques pour déterminer si le clustering est quantitativement fiable.
Une fois cela fait, il faut vérifier que ces clusters ont du sens pour les experts du domaine, ce qui implique de les visualiser afin que les experts non techniques puissent les consulter et les interpréter correctement.
Pouvez-vous nous donner un aperçu des cas d’usage des applications vectorielles sur votre plateforme ?
JK : Les cas d’usage concernent principalement l’analyse de textes et d’images non structurés. Les voici :
Recherche sémantique
Analyser des données textuelles fondées sur les retours et les demandes des clients afin de déterminer un nombre défini de thèmes de clusters.
Imaginons que vous disposiez d’un échantillon de retours textuels de plus de 100 k mots sur un produit, à partir duquel vous obtenez 30 thèmes de clusters. Le Cluster-1 pourrait contenir des phrases comme « la recharge s’est arrêtée », « la batterie ne fonctionne pas » ou « la puissance reste à 0 ». Bien que les mots de ce cluster soient totalement différents, leur sens est sémantiquement similaire.
Notre moteur de clustering vectoriel peut non seulement les regrouper, mais aussi faire ressortir leur thème commun. Dans ce cas, le thème du cluster serait « la recharge de la batterie ne fonctionne pas ».
Recherche d’images
Analyser des données marketing non structurées pour déterminer quelles images et caractéristiques visuelles sont les plus performantes. Imaginons que vous meniez une campagne avec un influenceur Instagram pour votre marque de vin et que vous extrayiez 60 thèmes de clustering visuel.
- Le Cluster-6 pourrait contenir des images de votre produit présentées devant une famille à table. Il totalise en moyenne 20 k mentions « J’aime », 2 millions de dollars US de ventes et coûte 25 000 dollars US pour 15 publications.
- Le Cluster-7 pourrait regrouper des images de votre produit présenté avec deux personnes dans un hôtel, avec une moyenne de 50 k mentions « J’aime », 1 million de dollars US de ventes et un coût de 75 000 dollars US pour 10 publications.
En analysant les caractéristiques visuelles, vous pouvez désormais déterminer que votre produit est le plus efficace pour générer des ventes lorsqu’il est présenté devant une famille.
Recherche personnalisée
Vous pouvez proposer une découverte plus pertinente et personnalisée grâce à la recherche et aux recommandations fondées sur la description et les caractéristiques visuelles du produit. Il existe également des cas d’usage dans d’autres domaines, notamment avec les données non structurées relatives aux interactions des utilisateurs dans le secteur du jeu vidéo. Vous pouvez vectoriser chaque action effectuée dans le jeu, puis utiliser le clustering pour déterminer les différents styles de jeu résultant de la combinaison de ces actions. Par exemple, le Cluster-1 correspond à un style polyvalent dans lequel le joueur attaque d’abord, se repose, puis se défend. À l’inverse, le Cluster-2 correspond à un style très agressif dans lequel le joueur attaque, se repose et attaque à nouveau. En identifiant ces styles de jeu, nous pouvons déterminer lequel présente le meilleur taux de victoire, mettre en relation de nouveaux joueurs et les aider à bénéficier d’une expérience plus personnalisée pour améliorer leur façon de jouer.
La PME moyenne est-elle en mesure d’adopter les technologies vectorielles ?
JK : Absolument ! L’un des grands avantages des vecteurs est qu’ils peuvent être standardisés pour le type de données que vous saisissez et qu’ils fonctionnent immédiatement très bien dans de nombreux domaines. Ainsi, la plupart des entreprises disposant des bons outils peuvent obtenir 80 % de la valeur grâce au processus standardisé ; les 20 % restants correspondent à l’optimisation réalisée par les équipes les plus sophistiquées.
Qu’est-ce qui rend Relevance AI unique ?
JK : Nous nous concentrons fortement, de bout en bout, sur les phases d’expérimentation et de collaboration. Quand nous parlons de bout en bout, nous voulons dire que nous couvrons tout le parcours, des données au praticien de la donnée, puis à l’expert du domaine, jusqu’aux informations sur lesquelles une entreprise peut agir.
Nous permettons aux praticiens de la donnée de transformer des données non structurées en vecteurs, puis de les déployer dans un tableau de bord partageable en quelques lignes de code. Une fois partagé, le tableau de bord recueille les retours des experts du domaine, afin que le praticien de la donnée puisse les exploiter et optimiser ou ajuster l’analyse pour qu’elle soit réellement utile à l’entreprise.
Une fois la phase d’expérimentation terminée, le praticien de la donnée peut passer en production avec une seule ligne de code app.go_live(). Là encore, tout se fait au sein de notre plateforme.
Pour l’avenir, quels espoirs nourrissez-vous pour Relevance AI ?
JK : Nous espérons que Relevance AI deviendra synonyme de données non structurées. De la même manière que Salesforce est synonyme de CRM et Slack de messagerie d’équipe, nous voulons être associés aux données non structurées.
Pour nous, cela signifie fournir à nos utilisateurs autant d’outils que possible autour des données non structurées. Même si nous commençons par le clustering vectoriel en libre-service, nous étudions déjà de nombreuses autres fonctionnalités prévues dans notre feuille de route, comme la découverte vectorielle et les fiches d’évaluation de modèles vectoriels pour l’interprétation, la détection d’anomalies, etc.
À lire ensuite : Les avantages et les inconvénients du stockage décentralisé des données