Reddit dit qu’il a surpris les entreprises d’IA en grattant ses données de la machine Wayback de l’archive d’Internet, il va donc commencer à empêcher les archives Internet en indexant la grande majorité de Reddit. La machine Wayback ne sera plus en mesure de ramper des pages de détail, des commentaires ou des profils; Au lieu de cela, il ne sera en mesure d’indexer la page d’accueil de Reddit.com, ce qui signifie effectivement que les archives Internet ne seront en mesure d’archiver des informations sur les titres et les publications les plus populaires un jour donné.
« Internet Archive fournit un service au Web ouvert, mais nous avons été informés des cas où les entreprises d’IA violent les politiques de plate-forme, y compris les nôtres, et racontez les données de la machine Wayback », a déclaré le porte-parole Tim Rathschmidt Le verge.
La mission de l’archive d’Internet est de garder une archive numérique de sites Web sur Internet et «d’autres artefacts culturels», et la machine Wayback est un outil que vous pouvez utiliser pour consulter les pages telles qu’elles sont apparues à certaines dates, mais Reddit pense que toutes ses contenus ne devraient pas être archivés de cette façon. Données Reddit pour protéger Redditors », explique Rathschmidt.
Les limites commenceront à «augmenter» aujourd’hui, et Reddit dit qu’il a contacté les archives Internet «à l’avance» pour «les informer des limites avant d’entrer en vigueur», selon Rathschmidt. Il dit que Reddit a également «soulevé des préoccupations» concernant la capacité des gens à éliminer le contenu des archives Internet dans le passé.
Reddit a un historique récent de réduction de l’accès aux outils de grattere car les sociétés de l’IA ont commencé à les utiliser (et à les abuser) en masse, mais il est disposé à fournir ces données si les entreprises paient. L’année dernière, Reddit a conclu un accord avec Google pour la recherche Google et les données de formation en IA au début de l’année dernière, et quelques mois plus tard, il a commencé à bloquer les principaux moteurs de recherche en rampant ses données à moins qu’ils ne paient. Il a également déclaré que ses infâmes changements d’API par rapport à 2023, qui ont forcé certaines applications tierces à fermer, conduisant à des manifestations, étaient parce que ces API ont été maltraitées pour former des modèles d’IA.
Reddit a également conclu un accord d’IA avec OpenAI, mais il a poursuivi Anthropic en juin, affirmant que Anthropic se grattait toujours de Reddit même après qu’Anthropic a dit qu’il ne grattait plus.
«Nous avons une relation de longue date avec Reddit et continuons à avoir des discussions en cours à ce sujet», a déclaré Mark Graham, directeur de la machine Wayback Le verge.
Mise à jour, 11 août: Ajout de la déclaration de la machine Wayback.