Trouvez les actualités publiées dans la plage de dates ci-dessous
et et
et et
et et
Effacer
Euro
Arrow
55,5351
Dollar
Arrow
47,9152
Livre sterling
Arrow
64,8775
Or
Arrow
6848,4888
BIST 100
Arrow
14.078

Les entreprises d'intelligence artificielle détruisent des livres anciens

Des allégations selon lesquelles des livres rares et épuisés seraient achetés en masse, numérisés pour des modèles d'intelligence artificielle, puis détruits, suscitent l'indignation.

Ne laisse pas l'algorithme choisir tes actualités, décide toi-même ce que tu lis. Ajoute 12punto à tes sources préférées !
Les entreprises d'intelligence artificielle détruisent des livres anciens

Les découvertes selon lesquelles des entreprises d'intelligence artificielle achètent en masse des livres rares, anciens et épuisés pour entraîner leurs grands modèles de langage, puis déchiquettent et détruisent les exemplaires physiques après les avoir numérisés, ont déclenché un nouveau débat parmi les auteurs, les archivistes et les bibliophiles.

Selon des documents rendus publics dans le cadre d'un procès intenté contre Anthropic, l'entreprise prévoyait, dans le cadre d'un processus baptisé « Project Panama », d'acquérir des millions de livres physiques, de faire couper leurs reliures, de faire passer les pages dans des scanners à haute vitesse, puis de détruire les originaux. Les documents indiquent également qu'un contrat de fournisseur de six mois visait la numérisation de 500 000 à 2 millions de livres.

Un autre élément alimentant la controverse est l'allégation selon laquelle cette pratique ne se limiterait pas aux best-sellers ou aux livres facilement accessibles. Dans une enquête publiée par 404 Media, le mouvement de colis a été suivi grâce à un Apple AirTag placé dans une commande d'environ mille livres achetés auprès d'un libraire non identifié. Il a été rapporté que le colis a transité de Californie à Milwaukee, puis à Colorado Springs, pour finir dans un entrepôt portant le code VGT3, identifié comme appartenant à Amazon.

Selon l'article, les employés travaillant dans cette installation décrivaient leur travail comme de la « numérisation de livres ». Ces découvertes ont renforcé les allégations selon lesquelles les grandes entreprises technologiques mènent des processus de numérisation de livres à l'échelle industrielle afin de produire des données d'entraînement pour l'intelligence artificielle.

AU CŒUR DU DÉBAT : DROITS D'AUTEUR ET QUALITÉ DES DONNÉES

Deux raisons principales expliqueraient l'intérêt des entreprises pour les livres physiques : la réduction des risques juridiques et l'accès à des données d'entraînement de meilleure qualité. L'utilisation d'archives en ligne piratées avait exposé les entreprises d'IA à des poursuites pour violation du droit d'auteur intentées par des auteurs, des artistes, des photographes et des organes de presse.

L'achat légal d'un livre physique confère, aux États-Unis, un droit de disposition sur cet exemplaire. Selon les critiques, cela crée une faille juridique permettant aux entreprises de constituer de vastes ensembles de données numériques sans avoir à rémunérer les créateurs de contenu. Dans certaines évaluations judiciaires, la numérisation de livres imprimés acquis légalement à des fins d'entraînement de modèles internes peut être considérée comme relevant de l'usage loyal (fair use).

Cependant, la question ne se limite pas aux droits d'auteur. La destruction de livres rares et épuisés suscite également des réactions concernant la préservation du patrimoine culturel. Les critiques soutiennent que certains livres peuvent avoir été publiés en nombre limité et que la disparition des exemplaires physiques pourrait entraîner des pertes irréparables pour les chercheurs, les bibliothèques et les collections.

Du point de vue des entreprises d'IA, les livres publiés avant 2022 offrent des textes écrits par des humains et ayant fait l'objet de processus éditoriaux. Alors que la prolifération rapide de contenus générés par l'IA sur Internet augmente le risque que les nouveaux modèles soient entraînés sur des textes eux-mêmes produits par l'IA, les livres imprimés sont perçus par les entreprises comme une source de données plus propre et plus cohérente.

Il n'existe pas de données précises sur le nombre de livres détruits. Toutefois, les documents judiciaires et les commandes groupées rapportées par les libraires montrent que ces commandes peuvent aller de centaines de livres à une échelle de plusieurs millions. Par conséquent, le débat soulève une question plus large sur la manière dont la course au développement de l'IA affecte non seulement le monde numérique, mais aussi les biens culturels physiques.



Source de l'actualité: 12punto

intelligence artificielle Livres anciens Droits d'auteur anthropic 404 Media Grands Modèles de Langage patrimoine culturel