Améliorer la productivité et l’efficacité du machine learning grâce aux données synthétiques

Les données sont devenues la ressource la plus précieuse de nombreuses organisations. Le machine learning (ML) passe du statut de technologie marginale, utilisée exclusivement par les entreprises les plus innovantes, à celui de pilier des entreprises modernes, faisant des données un outil indispensable. Pourtant, de nombreux projets liés aux données et au machine learning peinent à atteindre leur plein potentiel. Les entreprises sont confrontées à des projets de ML qui produisent des résultats inexacts, […]

Écrit par
Devin Partida
Devin Partida
Aug 10, 2022
7 minute read
enterprise data

Devops software development operations infinity symbol. Programmer administration system life cycle quality. Coding building testing release monitoring. Data flow vector illustration.

Enterprise Networking Planet Le contenu et les recommandations de produits sont indépendants de la rédaction. Nous pouvons gagner de l'argent lorsque vous cliquez sur des liens vers nos partenaires. En savoir plus

Les données sont devenues la ressource la plus précieuse de nombreuses organisations. Le machine learning (ML) passe du statut de technologie marginale, utilisée exclusivement par les entreprises les plus innovantes, à celui de pilier des entreprises modernes, faisant des données un outil indispensable. Pourtant, de nombreux projets liés aux données et au machine learning peinent à atteindre leur plein potentiel.

Les entreprises sont confrontées à des projets de ML qui produisent des résultats inexacts, en grande partie à cause de problèmes liés aux données elles-mêmes. Si la plupart des entreprises comprennent aujourd’hui la nécessité de tirer parti des données grâce au machine learning, elles sont moins nombreuses à réaliser que leurs pratiques en matière de données nuisent à ces résultats. Les données synthétiques peuvent contribuer à surmonter bon nombre de ces lacunes actuelles.

À lire aussi : 9 façons dont l’IA peut améliorer la gestion du cloud

Que sont les données synthétiques ?

Comme leur nom l’indique, les données synthétiques sont des informations générées artificiellement. Elles suivent les mêmes règles et reflètent les concepts et tendances du monde réel, mais ne proviennent pas d’une source réelle. Comme les données originales, elles peuvent également prendre diverses formes, du texte brut aux informations tabulaires, en passant par les contenus visuels ou audio.

Les données synthétiques se répartissent en trois grandes catégories :

  • Données entièrement synthétiques
  • Données partiellement synthétiques
  • Données hybrides

Les données entièrement synthétiques désignent des jeux de données artificiels à 100 %. Ils peuvent être fondés sur des jeux de données originaux, mais ne contiennent aucune information ni aucun contexte du monde réel. Les données partiellement synthétiques sont des informations originales dont certains champs ont été remplacés par des équivalents synthétiques, généralement afin de réduire les risques de violation de données. Comme on peut s’y attendre, les données hybrides désignent des jeux de données qui combinent des données originales et synthétiques.

À lire aussi : Principaux fournisseurs de services managés

Advertisement

Avantages des données synthétiques

De grandes entreprises technologiques comme Google et Amazon utilisent des données synthétiques dans leurs applications de ML, et de plus en plus d’organisations suivent cette voie. Bien entendu, la popularité ne suffit pas à justifier l’adoption d’une tendance. Voici donc quelques avantages des données synthétiques.

Suppression des biais

Cela peut sembler contre-intuitif, mais l’utilisation de données du monde réel produit parfois des résultats moins précis que les informations synthétiques. Cela tient à l’un des principaux défis du ML : les biais.

Les jeux de données originaux sont sujets aux biais humains. Les biais historiques et implicites, profondément ancrés, peuvent s’infiltrer dans les informations du monde réel à travers la manière dont les personnes les collectent, les enregistrent et les organisent, sans que les data scientists s’en rendent compte. Ce problème est si répandu que des études suggèrent que jusqu’à 38,6 % des données des bases de données d’IA populaires sont biaisées.

Les données synthétiques permettent de contourner des problèmes tels que la représentation inexacte de faits historiques, susceptible d’entraîner des biais. Par conséquent, leur utilisation dans les modèles de ML peut produire des résultats plus précis, même si les informations ne proviennent pas nécessairement du monde réel. Elle peut également permettre de créer des applications d’IA destinées aux clients plus appropriées et plus équitables.

Quantité de données

Les algorithmes fiables de ML exigent généralement de vastes jeux de données, mais toutes les entreprises ne disposent pas facilement de suffisamment de données pertinentes. Les données synthétiques permettent de contourner ce problème, car les entreprises peuvent en générer d’importantes quantités sans longs processus de collecte.

Cela peut se faire de deux manières. Premièrement, les équipes peuvent utiliser des jeux de données entièrement synthétiques. Elles peuvent également recourir à des techniques comme le suréchantillonnage synthétique des minorités, qui crée des données fictives à partir d’informations réelles pour combler les lacunes du jeu de données original.

Ces stratégies sont particulièrement utiles pour les entreprises ou les applications de ML disposant de peu de données du monde réel. Le manque d’informations disponibles ne doit plus nécessairement constituer un obstacle à une mise en œuvre efficace du ML.

Advertisement

Efficacité des projets

De même, les données synthétiques peuvent aider les équipes à achever leurs projets de ML plus rapidement. Selon une étude réalisée en 2020, un tiers des entreprises déclarent qu’il leur faut entre un et trois mois pour mettre en œuvre un modèle de ML. Pour 24 % d’entre elles, cette durée est encore plus longue, et ces chiffres n’incluent même pas le temps consacré à l’entraînement et à la collecte des données.

Avec des délais moyens de déploiement aussi longs, les entreprises doivent rationaliser autant que possible la collecte et l’entraînement des données afin de réduire les dépenses liées aux projets. Les données synthétiques constituent une réponse idéale, car elles permettent de fournir suffisamment d’informations en une fraction du temps.

Les données synthétiques évitent aux équipes de consacrer autant de ressources à la collecte et à l’organisation des données. Selon la manière dont elles sont générées, elles peuvent également être créées dans un format déjà standardisé, ce qui simplifie aussi la préparation. Cette efficacité peut faire des projets de ML un investissement plus rentable.

Sécurité

Un autre avantage des données synthétiques dans le ML réside dans leur capacité à réduire les risques de violation de données. Comme les projets de ML stockent généralement d’importantes quantités de données au même endroit, ils peuvent présenter des risques importants en matière de cybersécurité. Les données synthétiques réduisent ces risques en remplaçant les informations sensibles.

Si un projet de ML utilise des données du monde réel, en particulier des informations personnelles identifiables (PII), une violation pourrait avoir des conséquences désastreuses. Les entreprises pourraient subir une perte d’activité et des dommages-intérêts, en plus des coûts de remédiation. À l’inverse, si des données synthétiques sont divulguées, le problème est moins préoccupant, car elles ne révèlent aucune PII réelle.

Étant donné que le coût des violations de données a atteint un record historique de 4,34 millions de dollars US en 2022, cette sécurité constitue un avantage crucial. Elle est particulièrement importante pour les applications de ML qui traitent des informations sensibles telles que les PII.

Advertisement

Comment tirer parti des données synthétiques dans le ML

Les données synthétiques offrent de nombreux avantages aux développeurs de ML. Toutefois, comme toute autre ressource, leur efficacité dépend de la manière dont les équipes les utilisent. Voici donc quelques bonnes pratiques en matière de données synthétiques.

Savoir quand utiliser des données synthétiques

La première considération, et sans doute la plus importante, concernant les données synthétiques consiste à déterminer quand elles constituent le choix le plus approprié. Si les jeux de données synthétiques offrent de nombreux avantages par rapport aux données originales, ils ne correspondent pas toujours aux besoins des équipes.

Les entreprises doivent examiner leurs objectifs en matière de ML afin de déterminer s’il est important de disposer d’informations du monde réel. De manière générale, les données synthétiques sont idéales pour tester des scénarios hypothétiques, lorsque les données du monde réel sont limitées ou déséquilibrées, ou lorsque la confidentialité constitue une préoccupation majeure. À l’inverse, les données originales peuvent être plus adaptées aux jumeaux numériques, lorsque les valeurs aberrantes sont particulièrement importantes ou lorsque les informations du monde réel sont facilement disponibles.

Dans certains cas, il peut être préférable d’utiliser des jeux de données hybrides. Les équipes doivent déterminer leurs objectifs et leurs contraintes afin de comprendre quelle stratégie convient le mieux à leur projet de ML.

Nettoyer et préparer les données avant la génération

Il est également important de ne pas négliger la préparation et le nettoyage des données, même lorsqu’il s’agit d’informations synthétiques. Les données de mauvaise qualité coûtent en moyenne 15 millions de dollars par an aux entreprises, et 60 % d’entre elles ne savent même pas combien ces mauvaises données leur coûtent. Pour éviter ces dépenses, les équipes doivent préparer leurs données synthétiques avant de les utiliser.

Même si les données synthétiques peuvent être générées dans des formats déjà standardisés, des erreurs peuvent toujours se produire. Les équipes doivent examiner ces jeux de données afin de s’assurer qu’ils sont propres et organisés avant de les utiliser, pour tirer pleinement parti de leurs données synthétiques.

Fonder les données synthétiques sur des informations originales de haute qualité peut être utile. Plus la source est bonne, meilleures seront les données fictives, ce qui réduira le temps consacré au nettoyage et à la préparation.

Advertisement

Déterminer la meilleure méthode de génération

Les entreprises doivent également comprendre que les différentes méthodes de génération de données présentent des forces et des faiblesses variables. Les comparer afin de trouver la meilleure option est tout aussi important que de choisir entre données synthétiques et données originales.

Les autoencodeurs variationnels (VAE) peuvent générer efficacement des jeux de données complexes et sont faciles à mettre en œuvre, mais ils peinent à fournir une qualité constante pour tous les types de jeux de données originaux complexes. À l’inverse, les réseaux antagonistes génératifs (GAN) fonctionnent bien avec les jeux de données originaux non structurés ou complexes, mais sont plus difficiles à entraîner et à mettre en œuvre.

Dans certains cas, il peut être préférable d’externaliser la génération de jeux de données synthétiques. Ces possibilités se multiplient : plus de 70 fournisseurs proposaient des données synthétiques en 2021. Les équipes doivent examiner leur expertise interne, leurs budgets et leurs besoins afin de déterminer la meilleure voie à suivre.

Les données synthétiques peuvent libérer le potentiel des projets de ML

Exploiter pleinement le ML nécessite des jeux de données volumineux, fiables et sécurisés. Dans de nombreux cas, les données synthétiques peuvent contribuer à les fournir tout en réduisant les complications liées aux informations originales.

Les développeurs de ML doivent réfléchir à la manière dont les données synthétiques pourraient améliorer leurs projets. Tirer parti de cette ressource pourrait apporter des gains considérables en matière de précision, d’efficacité, de sécurité et de finances. Cela rendra à son tour le ML plus intéressant pour de nombreuses entreprises.

À lire aussi : 7 défis des réseaux d’entreprise 

Devin Partida

Devin Partida

Content Writer

Devin Partida writes about business technology and innovation. Her work has been featured on Yahoo! Finance, Entrepreneur, Startups Magazine, and other industry publications. She is also the Editor-in-Chief of ReHack.

Enterprise Networking Planet Logo

Enterprise Networking Planet aims to educate and assist IT administrators in building strong network infrastructures for their enterprise companies. Enterprise Networking Planet contributors write about relevant and useful topics on the cutting edge of enterprise networking based on years of personal experience in the field.

Propriété de TechnologyAdvice. © 2026 TechnologyAdvice. Tous droits réservés

Divulgation publicitaire : Certains des produits qui apparaissent sur ce site proviennent d'entreprises dont TechnologyAdvice reçoit une compensation. Cette compensation peut influencer la façon dont les produits apparaissent sur ce site, notamment l'ordre dans lequel ils apparaissent. TechnologyAdvice n'inclut pas toutes les entreprises ou tous les types de produits disponibles sur le marché.