Vector Space: Wie die nächste technologische Evolution die Datenwissenschaft weiterentwickelt

Jacky Koh von Relevance AI spricht mit ENP über die entwicklerorientierte Vektorplattform des Unternehmens, mit der sich KI-Anwendungen erstellen lassen, um schnell Erkenntnisse aus unstrukturierten Daten zu gewinnen.

Feb 11, 2022
7 minute read
Vector Space: How the Next Technological Evolution is Evolving Data Science

Collecting data and big information volume gathering tiny person concept. Cloud computing software with automatic server info catching vector illustration. Digital online document analysis for storage

Enterprise Networking Planet content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Die globale Datenproduktion dürfte bis 2025 180 Zettabyte erreichen. Davon sind etwa 80–90 % unstrukturierte Daten in Form von Bildern, Videos, Dokumenten und einfachem Text, die sich nur schwer auswerten lassen. Organisationen würden zweifellos immens davon profitieren, diese riesigen, bislang ungenutzten Datenschätze zu erschließen. Fakt ist jedoch, dass herkömmliche Datenbanken sie häufig nicht korrekt interpretieren können.

Glücklicherweise können fortschrittliche Verfahren des maschinellen Lernens (ML) unstrukturierte Daten in ein einfach analysierbares numerisches Format namens Vektorembeddings umwandeln. Vektorplattformen werden speziell dafür entwickelt, Millionen von Vektoren zu speichern, zu indizieren und abzufragen sowie sie in Echtzeit präzise zu bewerten. Der Aufbau solcher fortschrittlichen Datenbanken ist jedoch schwierig, da er sehr arbeitsintensiv ist und spezielle Fähigkeiten erfordert.

Jacky Koh, Mitgründer von Relevance AI

Relevance AI entwickelt eine entwicklerorientierte „Vektor“-Plattform, mit der Unternehmen Anwendungen für künstliche Intelligenz (KI) entwickeln können, um schnell Erkenntnisse aus unstrukturierten Daten zu gewinnen – nahezu ohne Labeling oder Algorithmustraining. Kürzlich nahm das Unternehmen außerdem 3 Millionen US-Dollar auf, um die Plattform weiterzuentwickeln.

Mit bereits mehr als drei Millionen Endnutzern und 100 Millionen Anfragen pro Woche in verschiedenen Bereichen, darunter SaaS, E-Commerce und Gaming, bringt Relevance AI die Vektordatenbankbranche in Bewegung.

Wir haben mit Jacky Koh, dem Mitgründer von Relevance AI, darüber gesprochen, wie vektorbasierte Technologie Unternehmen dabei helfen kann, wertvolle Erkenntnisse aus unstrukturierten Daten zu gewinnen.

Zuvor leitete Koh das Machine-Learning-Team bei IAG satellite und konzentrierte sich darauf, ML in der Versicherungsbranche einzusetzen. Koh gewann außerdem die erste Data Science Challenge von EY und entwickelte zahlreiche mobile Anwendungen, die im App Store auf Platz 1 standen und zusammen insgesamt 7,5 Millionen Installationen verzeichneten.

Außerdem lesenswert: Die besten Tools zur Datenmodellierung 2022

Erzählen Sie uns, wie und warum Sie Relevance AI gegründet haben.

Advertisement

Jacky Koh: Während meiner Zeit in der Unternehmenswelt und bei den verschiedenen Unternehmen und Kunden, mit denen ich gearbeitet habe, sah ich große Mengen unstrukturierter Daten, die kaum genutzt wurden. Viele der zentralen Anwendungsfälle zur Verbesserung geschäftlicher KPIs – etwa Kundenfeedback, Kundenzufriedenheit und Betrugserkennung – erzeugten große Mengen unstrukturierter Daten.

Deep-Learning-Embeddings, auch allgemein als Vektoren bekannt, gehören zu den effektivsten Möglichkeiten, unstrukturierte Daten zu analysieren. Vektoren stellen Daten in einem Format dar, mit dem Computeralgorithmen die Daten korrekt vergleichen und analysieren können. Diese Technik wird von allen großen Technologieunternehmen eingesetzt. Ohne ein hochentwickeltes Data-Science-Team mit Erfahrung im Umgang mit unstrukturierten Daten ist sie jedoch ziemlich anspruchsvoll.

Daher habe ich Relevance AI gegründet, um diesen Zugang zu demokratisieren und allen Entwicklern und Datenteams – unabhängig von ihrem Kenntnisstand – die Nutzung dieser Technologie zu ermöglichen. So können sie das Potenzial ihrer Daten für ihr Unternehmen ausschöpfen und zugleich sicherstellen, dass Erkenntnisse und Anwendungen gemeinsam mit den Stakeholdern erarbeitet werden.

Führen Sie uns durch die jüngsten Fortschritte in der Datenwissenschaft dank vektorbasierter Technologie.

JK: Typischerweise konzentrierte sich die Datenwissenschaft auf die Analyse strukturierter Daten wie demografischer und numerischer Daten. Freitextfelder, Bildanhänge oder URL-Felder wurden häufig ignoriert. Dank Vektoren lassen sich diese Daten nun korrekt analysieren und zusammen mit strukturierten Daten nutzen, um Modelle zu verbessern und mehr Einblick in qualitative Faktoren der Erkenntnisse zu gewinnen.

Darüber hinaus ist eine Vektordatenbank darauf ausgelegt, Vektoren mit geringer Latenz und in großen Mengen zu speichern und abzufragen. Herkömmliche Datenbanken bieten diese Funktionen nicht, da sie typischerweise mit strukturierten, tabellarischen Daten arbeiten. Die meisten Vektordatenbanken wiederum bieten nur selten Funktionen zum tatsächlichen Speichern herkömmlicher strukturierter Daten.

Das Besondere an der von uns bereitgestellten Vektordatenbank ist, dass wir sie mit Blick auf eine herkömmliche Datenbank entwickelt haben. Denn unstrukturierte Daten lassen sich am besten analysieren, wenn sie mit strukturierten Daten kombiniert werden – etwa indem gemeinsame Themen der natürlichen Sprache im Text mit den relevanten KPIs und Nutzerdemografien verknüpft werden.

Advertisement

Geben Sie unseren Lesern einige Einblicke in Ihre Clustering-Engine.

JK: Unsere Clustering-Engine ist unsere wichtigste Funktion, mit der Unternehmen Trends und Themen in unstrukturierten Daten aufspüren können. Sie stellt Entwicklern ein Werkzeugset zur Verfügung, mit dem sie die besten Cluster aus ihren unstrukturierten Daten gewinnen und anschließend in einem Frontend-Dashboard bereitstellen können, in dem das Unternehmen Feedback geben und Trends erkennen kann.

Beim Clustering werden unstrukturierte Daten anhand der Ähnlichkeit ihrer Vektoren gruppiert. Diese Vektoren kapseln alle semantischen Merkmale, die wir mit den Daten verbinden würden.

Nehmen wir beispielsweise eine Textstichprobe mit einer Million oder mehr Wörtern. Zwei Sätze wie „Ich mochte das Pop-up auf der Anmeldeseite wirklich nicht“ und „Ich bin kein Fan des zufälligen Fensters, das erschien, als ich beitreten wollte“ mögen unterschiedlich formuliert sein, sind semantisch jedoch sehr ähnlich. Daher gehören die beiden Sätze zum selben Cluster. Das funktioniert nicht nur auf Satzebene, sondern auch auf der Ebene von Wörtern, Absätzen und Dokumenten.

Das Besondere an der von uns bereitgestellten Vektordatenbank ist, dass wir sie mit Blick auf eine herkömmliche Datenbank entwickelt haben.

Unsere Clustering-Anwendung bietet nicht nur diese Gruppierung, sondern auch KPIs, mit denen sich ihre Zusammenhänge ermitteln lassen.

Ein Beispiel: Wenn Sie die effektivste Marketingbotschaft für Ihr Auto analysieren möchten, speisen Sie sie in unsere Clustering-Engine ein. Die fertige Clustering-Anwendung zeigt Ihnen alle Cluster und hebt Erkenntnisse hervor – etwa, dass Cluster-29 von 60 Clustern die höchste Klickrate und die niedrigsten Kosten aufweist. In diesem Cluster geht es hauptsächlich darum, „wie nachhaltig das Auto ist“.

Mit unserer App können Sie einen Drill-down durchführen, um die Genauigkeit des Clusters zu überprüfen und sicherzustellen, bevor Sie diese Erkenntnis unmittelbar nutzen.

Mit welchen typischen Problemen sind Datenwissenschaftler und Praktiker beim Clustering konfrontiert?

JK: Die Bewertung und Interpretation. Clustering als Algorithmus anzuwenden ist nicht schwierig, aber seine Bewertung erfordert umfassende statistische Kenntnisse, um zu prüfen, ob das Clustering quantitativ belastbar ist.

Anschließend müssen Sie feststellen, ob diese Cluster für Fachexperten sinnvoll sind. Das bedeutet, die Cluster für nichttechnische Fachexperten zu visualisieren, damit diese sie angemessen betrachten und interpretieren können.

Advertisement

Geben Sie uns einen Überblick über die Anwendungsfälle für Vektoranwendungen auf Ihrer Plattform.

JK: Die Anwendungsfälle beziehen sich hauptsächlich auf die Analyse unstrukturierter Text- und Bilddaten. Dazu gehören:

Semantische Suche

Analysieren Sie Textdaten auf Grundlage von Kundenfeedback und -anfragen, um eine festgelegte Anzahl von Clusterthemen zu bestimmen.

Angenommen, Sie haben eine Stichprobe mit mehr als 100.000 Wörtern an Textfeedback zu einem Produkt und erhalten daraus 30 Clusterthemen. Cluster-1 könnte Sätze wie „Lädt nicht mehr“, „Der Akku funktioniert nicht“ oder „Die Leistung bleibt bei 0“ enthalten. Obwohl die Wörter in diesem Cluster völlig unterschiedlich sind, ist ihre Bedeutung semantisch ähnlich.

Unsere Vektor-Clustering-Engine kann dies nicht nur gruppieren, sondern auch das gemeinsame Thema herausarbeiten. In diesem Fall wäre das Thema des Clusters „Akkuladung funktioniert nicht“.

Bildersuche

Analysieren Sie unstrukturierte Marketingdaten, um festzustellen, welche Bilder und visuellen Merkmale gut funktionieren. Angenommen, Sie führen für Ihre Weinmarke eine Kampagne mit einem Instagram-Influencer durch und extrahieren 60 visuelle Clusterthemen.

  • Cluster-6 könnte Produktbilder enthalten, auf denen Ihr Produkt vor einer Familie an einem Esstisch abgebildet ist. Es erzielt durchschnittlich 20.000 Likes und 2 Millionen US-Dollar Umsatz und verursacht über 15 Beiträge Kosten von 25.000 US-Dollar.
  • Cluster-7 könnte Produktbilder enthalten, auf denen Ihr Produkt mit zwei Personen in einem Hotel abgebildet ist. Es erzielt durchschnittlich 50.000 Likes und 1 Million US-Dollar Umsatz und verursacht über 10 Beiträge Kosten von 75.000 US-Dollar.

Durch die Analyse der visuellen Merkmale können Sie nun erkennen, dass sich Ihr Produkt am effektivsten verkauft, wenn es vor einer Familie abgebildet ist.

Advertisement

Personalisierte Suche

Sie können durch Suche und Empfehlungen eine bessere und stärker personalisierte Produktsuche anbieten, die auf der Produktbeschreibung und den visuellen Merkmalen basiert. Darüber hinaus gibt es bemerkenswerte Anwendungsfälle mit unstrukturierten Daten zu Nutzerinteraktionen in der Gamingbranche. Sie können jede Aktion im Spiel vektorisieren und anschließend Clustering einsetzen, um die verschiedenen Spielstile zu bestimmen, die sich aus einer Kombination von Aktionen ergeben. Cluster-1 könnte beispielsweise ein ausgeglichener Spielstil sein, bei dem der Spieler zuerst angreift, sich ausruht und dann verteidigt. Im Gegensatz dazu wäre Cluster-2 ein äußerst aggressiver Spielstil, bei dem der Spieler angreift, sich ausruht und wieder angreift. Indem wir diese Spielstile ermitteln, können wir herausfinden, welcher die höchste Siegesrate aufweist, neue Spieler zuordnen und ihnen eine stärker personalisierte Erfahrung bei der Verbesserung ihres Spiels bieten.

Ist das durchschnittliche KMU in der Lage, vektorbasierte Technologie einzusetzen?

JK: Absolut! Einer der großen Vorteile von Vektoren ist, dass sie für den eingegebenen Datentyp standardisiert werden können und sofort einsatzbereit in mehreren Bereichen hervorragend funktionieren. Die meisten Unternehmen können daher mit den richtigen unterstützenden Werkzeugen 80 % des Nutzens aus dem standardisierten Prozess ziehen; die übrigen 20 % entfallen auf die Optimierung durch anspruchsvollere Teams.

Was macht Relevance AI einzigartig?

JK: Wir konzentrieren uns durchgängig stark auf die Experimentier- und Kollaborationsphase. Wenn wir von durchgängig sprechen, meinen wir den Weg von den Daten über den Datenpraktiker und den Fachexperten bis hin zu Erkenntnissen, mit denen ein Unternehmen arbeiten kann.

Wir ermöglichen es Datenpraktikern, unstrukturierte Daten in Vektoren umzuwandeln und sie mit wenigen Codezeilen in einem gemeinsam nutzbaren Dashboard bereitzustellen. Nach der Freigabe sammelt das Dashboard Feedback von Fachexperten, sodass der Datenpraktiker dieses Feedback nutzen kann, um die Analyse zu optimieren und anzupassen, damit sie für das Unternehmen tatsächlich aussagekräftig ist.

Advertisement

Sobald diese Experimentierphase abgeschlossen ist, kann der Datenpraktiker die Anwendung mit einer einzigen App-Zeile in die Produktion überführen: go_live(). Auch dies geschieht vollständig innerhalb unserer Plattform.

Welche Hoffnungen haben Sie mit Blick auf die Zukunft für Relevance AI?

JK: Wir hoffen, dass Relevance AI zum Synonym für den Begriff „unstrukturierte Daten“ wird. So wie Salesforce als Synonym für CRM und Slack als Synonym für Team-Messaging gilt, möchten wir zum Synonym für unstrukturierte Daten werden.

Für uns würde das bedeuten, unseren Nutzern so viele Werkzeuge rund um unstrukturierte Daten wie möglich bereitzustellen. Zwar beginnen wir mit Self-Service-Vektor-Clustering, doch wir arbeiten bereits an vielen weiteren Funktionen auf unserer Roadmap, etwa vektorbasierter Suche und vektorbasierten Modell-Reportkarten zur Interpretation, Anomalieerkennung und mehr.

Als Nächstes lesen: Die Vor- und Nachteile dezentraler Datenspeicherung

Susnigdha Tripathy

Susnigdha Tripathy is a full-time writer and editor based in Singapore, and a regular contributor to Enterprise Networking Planet. She has over 10 years of experience writing, editing, and delivering exceptional content for a variety of international technology brands such as Virtasant, a cloud technology company, and Krista Software, a provider of intelligent automation solutions. She has also appeared in ServerWatch and other industry publications.

Enterprise Networking Planet Logo

Enterprise Networking Planet aims to educate and assist IT administrators in building strong network infrastructures for their enterprise companies. Enterprise Networking Planet contributors write about relevant and useful topics on the cutting edge of enterprise networking based on years of personal experience in the field.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.