L’émergence du big data a ouvert de nombreuses possibilités aux entreprises qui souhaitent exploiter cet immense potentiel. Les initiatives d’IA (intelligence artificielle) et de ML (machine learning) fondées sur les données peuvent aider les entreprises à se développer plus rapidement et à accélérer leur mise sur le marché.
Cependant, l’entraînement des modèles d’IA nécessite l’accès à de nombreux jeux de données précis. De plus, l’accès aux données du monde réel présente plusieurs limites.
Ces contraintes vont de la difficulté à obtenir de vastes jeux de données au renforcement des exigences imposées par les lois sur la protection des données et de la vie privée. Face au risque d’enfreindre les lois en matière de conformité et de respect de la vie privée et de se voir infliger de lourdes amendes, les entreprises préfèrent ne pas exploiter les données disponibles et passent ainsi à côté d’opportunités commerciales.
Pour contourner les problèmes de confidentialité et de conformité, les organisations ont commencé à utiliser des données synthétiques.
Que sont les données synthétiques ?
Les données synthétiques sont des données générées artificiellement par des algorithmes de ML afin de créer des jeux de données qui ressemblent étroitement aux données d’origine. Il s’agit d’une méthode économique et peu coûteuse qui permet aux chercheurs de générer sans effort d’immenses jeux de données.
Pour créer des données synthétiques, on utilise souvent des frameworks de machine learning spécifiques, dont le plus courant est les réseaux antagonistes génératifs (GAN).
Dans ce modèle d’apprentissage profond, deux réseaux neuronaux — le générateur et le discriminateur — s’affrontent pour produire des données synthétiques. Les modèles génératifs apprennent à partir de jeux de données réels afin de produire des données synthétiques similaires aux données réelles, mais qui n’entretiennent aucune relation biunivoque avec les faits réels.
Les autres méthodes de génération de données synthétiques reposent sur les autoencodeurs variationnels (VAE) et les modèles autorégressifs. Alors que les VAE utilisent des schémas d’encodage et de décodage, le modèle autorégressif s’appuie sur un ensemble de schémas d’entrée et de sortie pour générer des données synthétiques.
À lire aussi : Les principaux défis et opportunités de la gestion des données auxquels les responsables informatiques sont confrontés en 2022
Pourquoi avons-nous besoin de données synthétiques ?
L’adoption des données synthétiques s’explique par de nombreuses raisons. Tout d’abord, les entreprises consacrent des sommes importantes à la collecte et à l’analyse des données réelles. Grâce aux données synthétiques, elles peuvent réduire considérablement les coûts d’acquisition de l’information. En outre, les données synthétiques jouent un rôle essentiel dans l’entraînement des modèles d’IA, en particulier lorsque les données réelles ne sont pas disponibles.
Une autre raison d’utiliser des données synthétiques est que les jeux de données peuvent contenir des informations personnelles, comme le nom ou le numéro de sécurité sociale d’une personne. Bien que l’on puisse éviter cela en adoptant des techniques telles que les informations permettant d’identifier une personne (non-PII) et l’anonymisation des données, le risque de réidentification est toujours présent.
Pour éviter cela, il est possible de dériver des données synthétiques à partir de données du monde réel à l’aide d’un outil de génération de données artificielles. Cette méthode préserve les propriétés des données réelles et permet d’utiliser les données sans risquer de compromettre les informations personnelles.
Avantages des données synthétiques
Les avantages de l’utilisation des données synthétiques sont notamment les suivants :
- Coût : La collecte de données réelles prend du temps et s’avère prohibitive, tandis que la production de données au moyen d’un logiciel de génération de données synthétiques est bien moins coûteuse, plus rapide et plus efficace.
- Tests des systèmes : Des données de test de haute qualité sont essentielles pour obtenir des données adaptées à la production ; toutefois, des réglementations contraignantes peuvent limiter les jeux de données complets. Une solution consiste à générer des données synthétiques qui répondent à tous vos besoins en matière d’entraînement des systèmes.
- Rapidité : Demander l’accès à des jeux de données sensibles peut être un processus long, semé d’obstacles. Avec les données synthétiques, les entreprises n’ont pas à suivre les procédures bureaucratiques nécessaires pour obtenir des données réelles ; elles peuvent au contraire créer des données dès qu’elles en ont besoin, bien plus rapidement.
- Garantit la confidentialité des données : L’un des principaux avantages des données synthétiques est qu’elles ne font pas appel à des données sensibles. Comme toutes les informations personnelles ont été supprimées, il est impossible de relier les données à une personne réelle.
- Accès facile : Dans certains cas d’usage, les données du monde réel peuvent ne pas être disponibles ; dans d’autres, il peut ne pas y avoir suffisamment de données pour entraîner correctement les modèles. Dans de telles situations, la seule façon d’obtenir des données consiste à les générer de manière synthétique.
Défis des données synthétiques
Bien que les données synthétiques soient avantageuses à bien des égards, elles comportent aussi leur lot de limites.
- Utilisation des tendances courantes : Bien que les données synthétiques puissent imiter les données réelles, elles ne peuvent pas entièrement reconstituer les données d’origine. Comme elles se concentrent principalement sur les tendances courantes, elles risquent de passer à côté des cas limites présents dans les données d’origine.
- Biais des données : Les données synthétiques ne valent que ce que valent les données sources dont elles sont dérivées. Si les données sources comportent des biais, les données synthétiques produiront elles aussi un résultat biaisé.
- Acceptation par les utilisateurs : Les données synthétiques étant un domaine nouveau, de nombreux utilisateurs expriment des réserves à leur sujet. L’acceptation par les utilisateurs est donc un problème auquel les organisations sont souvent confrontées lorsqu’elles utilisent des données synthétiques.
À lire aussi : Les meilleurs outils de modélisation des données en 2022
Cas d’usage des données synthétiques
Les données synthétiques sont utilisées dans de nombreux secteurs, notamment la finance, la santé, l’automobile et l’industrie manufacturière.
Véhicules autonomes
Les véhicules autonomes comptent parmi les réussites les plus remarquables des données synthétiques. Pour concevoir correctement des voitures autonomes, les entreprises doivent acquérir et annoter d’immenses volumes de données réelles.
Cependant, rassembler des jeux de données en temps réel montrant des voitures réelles en action est coûteux et chronophage. Grâce aux données synthétiques, les développeurs peuvent tester de manière réaliste des voitures autonomes sur des routes simulées, de façon sûre, rapide et plus efficace.
Industrie manufacturière
Lorsqu’une entreprise fabrique un nouveau produit, il se peut qu’il n’y ait pas suffisamment de jeux de données disponibles pour entraîner les modèles. Les données d’entraînement synthétiques constituent le moyen le plus rapide et le plus efficace de résoudre ce problème. En entraînant leurs modèles sur des jeux de données synthétiques couvrant tous les scénarios possibles, les entreprises peuvent détecter plus tôt les problèmes de qualité.
Services financiers
Les institutions financières disposent d’une grande quantité de données clients qu’elles peuvent utiliser pour obtenir de meilleures informations. Pourtant, elles hésitent à exploiter les données disponibles en raison de lois strictes en matière de conformité et d’exigences rigoureuses en matière de confidentialité. Les données synthétiques permettent à ces institutions de reproduire les propriétés statistiques des jeux de données d’origine sans mettre en danger la vie privée des clients.
Santé
Les données synthétiques sont couramment utilisées dans le secteur de la santé, car elles permettent aux chercheurs d’utiliser des données issues de dossiers sans se soucier des complications juridiques liées à la violation du secret médical. En outre, les chercheurs peuvent extrapoler les données synthétiques pour mener des études avancées lorsqu’aucune donnée clinique réelle n’existe.
Peuvent-elles contribuer à réduire les biais de l’IA ?
Même si nous souhaitons vivre dans un monde sans biais, la vérité est que les systèmes d’IA sont coupables de propager des biais involontaires. Les données synthétiques offrent la possibilité d’éradiquer les préjugés des algorithmes d’IA et de progresser vers une IA plus équitable, qui représente fidèlement le monde.
Cependant, le problème ne vient pas du système d’IA, mais des données qui lui sont fournies. Pour le résoudre, les chercheurs devraient étudier les biais présents dans les données existantes. Ils pourraient ensuite réentraîner le système en veillant à ce que les hypothèses et les préjugés ne s’infiltrent pas dans les nouvelles données synthétiques créées. Le nouveau jeu de données ainsi créé sera conforme à la définition prédéterminée d’une IA équitable.
L’utilisation croissante des données synthétiques
Gartner estime qu’en 2024, 60 % des données utilisées par les projets d’IA seront des données synthétiques. Les données synthétiques constituent un domaine émergent qui se développera à mesure que les politiques de confidentialité deviendront plus strictes.
Les données générées synthétiquement permettent aux entreprises d’obtenir des informations exploitables, de réduire leur délai de mise en production et de gagner en agilité. Au vu des immenses avantages qu’elles offrent, ce n’est qu’une question de temps avant que les données synthétiques ne remplacent les données réelles dans les modèles d’IA.
À lire ensuite : Automatiser le DevOps avec l’IA et le ML