Yandex publie le jeu de données Yambda pour les systèmes de recommandation

Yandex a mis à disposition Yambda, un nouveau jeu de données contenant environ 5 milliards d'interactions utilisateurs anonymisées, collectées sur sa plateforme de streaming musical Yandex Music.

12punto

Yandex a annoncé le lancement de Yambda, un nouveau jeu de données comprenant environ 5 milliards d'interactions utilisateurs anonymisées sur sa plateforme de streaming musical Yandex Music. Ce jeu de données se distingue comme l'une des plus grandes bases de données d'événements en open source au monde dans le domaine des systèmes de recommandation.

Yambda regroupe des interactions telles que les écoutes, les mentions « j'aime » et « je n'aime pas », collectées sur une période de 10 mois. Les données sont présentées avec des horodatages, des plongements audio (audio embeddings) et des informations sur la découverte organique, permettant ainsi de tester les algorithmes de recommandation dans des conditions réelles. Les détails concernant 1 million d'utilisateurs anonymisés et 9,3 millions de titres musicaux constituent une ressource critique pour les développeurs de modèles de recommandation, notamment dans les secteurs du commerce électronique, des réseaux sociaux et des plateformes de vidéos courtes.

Yandex a rendu Yambda accessible via Hugging Face en trois tailles différentes (50M, 500M et 5B d'événements). Le jeu de données est proposé au format Apache Parquet et est compatible avec des systèmes tels que Spark, Hadoop et Pandas.

Nikolai Savushkin, responsable des systèmes de recommandation chez Yandex, souligne que Yambda rassemble à la fois le monde académique et l'industrie, et qu'il permettra d'accélérer l'innovation dans le domaine des systèmes de recommandation.