Internet Archive
Une bibliothèque numérique à but non lucratif dont Wayback Machine contient des centaines de milliards d'instantanés enregistrés de pages Web.
L’Internet Archive sont ce qui se rapproche le plus du Web d’une mémoire. Depuis 1996, il enregistre des copies de pages Web, ainsi que des livres, des fichiers audio et des logiciels, et sa Wayback Machine permet à quiconque de rechercher ce qu’une page dit à une date donnée. Les journalistes l’utilisent pour vérifier ce qu’une entreprise prétend avant de modifier discrètement la page, les chercheurs l’utilisent pour trouver des sources qui ont été mises hors ligne et les tribunaux ont accepté ses instantanés comme preuve.
Il est également soumis à des pressions considérables. Les archives sont confrontées à des cyberattaques, aux coûts d’ingénierie considérables liés au stockage d’un Web en constante expansion et à des litiges coûteux : après que les éditeurs ont gagné un procès concernant leur programme de prêt de livres numériques, certains organes de presse ont commencé à bloquer ses robots d’exploration, craignant que les copies archivées ne donnent aux sociétés d’IA une voie indirecte vers du matériel protégé par le droit d’auteur. Chaque bloc rend la sauvegarde un peu moins complète.