додому Internet et informatique Comment la Wayback Machine préserve le Web éphémère

Comment la Wayback Machine préserve le Web éphémère

Si un arbre tombe dans une forêt, fait-il un bruit ? Peut être. Mais si un site Web disparaît du jour au lendemain, sa page d’accueil existe-t-elle vraiment ? Dans un monde numérique qui donne la priorité au nouveau, l’histoire est fragile. La plupart des pages meurent avant de pouvoir être mémorisées. C’est pourquoi la Wayback Machine est importante. Il ne s’agit pas seulement d’une machine à voyager dans le temps pour Internet ; il s’agit d’une tentative désespérée de freiner la vague de décadence numérique.

La durée de vie moyenne d’une page Web est d’environ 100 jours. Mark Graham, le directeur de Wayback Machine, a souligné cette statistique dans un article d’Entrepreneur de 2016. Cent jours. Après cela, le contenu disparaît généralement. Pourquoi cela arrive-t-il ? Les créateurs de sites passent à autre chose. Les sociétés d’hébergement font faillite. Ou simplement, la page est remplacée par des données plus récentes. Sans archives numériques, ces mises à jour effaceraient entièrement le passé.

Comment la Wayback Machine a démarré

Le projet a été créé par Brewster Kahle et Bruce Gilliat. Ils ont également fondé Internet Archive, une bibliothèque numérique à but non lucratif basée à San Francisco. La Wayback Machine est un projet de cette plus grande institution. Il préserve les sites Web, les livres, les fichiers audio, vidéo et logiciels. (Ils ont également créé Alexa Internet, qui suivait le trafic Web avant qu’Amazon ne l’achète.)

Ils ont commencé à archiver des pages en 1996. Ils ont lancé l’outil public en 2001. Le nom vient de « The Rocky and Bullwinkle Show ». Dans le dessin animé, la machine WABAC a transporté M. Peabody et Sherman à travers l’histoire. L’orthographe est différente, mais l’intention est la même. Vous voulez voir ce qu’il y avait avant.

Comment cataloguer 1,7 milliard de sites Web ? Vous utilisez des robots d’exploration. Ce sont des robots logiciels automatisés qui se déplacent sur le Web. Ils prennent des instantanés de milliards de sites. Mais l’automatisation ne suffit pas. Les bibliothécaires d’Internet Archive hiérarchisent manuellement les sites qu’ils jugent importants. Ils décident de ce qui doit être sauvegardé pour les générations futures.

Ce que l’archive capture réellement

Les robots n’attrapent pas tout. La fréquence varie. Des sites très importants peuvent être enregistrés toutes les quelques heures. D’autres sont connectés à des semaines d’intervalle. La plupart des sites ne sont pas du tout connectés. Alors cette page de fans embarrassante que vous avez créée au lycée ? Il est probablement disparu pour toujours. La machine vise à capturer du contenu important. Les grands titres des médias. Dernières nouvelles.

Il ne recrée pas non plus exactement le site. Vous ne le vivrez pas comme un navigateur. Les archives ne peuvent capturer que quelques images de quelques pages. Il ne parvient souvent pas à préserver le contenu lié à des domaines externes. Il s’agit d’une limitation connue. La Wayback Machine offre un aperçu, pas une réplique parfaite.

Utilisation de la Wayback Machine

Vous avez vu l’erreur 404. “Page introuvable.” C’est frustrant. Vous voulez savoir ce qu’il y avait à l’origine. Les archives y contribuent.

Accédez à https://archive.org/web/. Tapez une URL dans la barre “Historique de navigation”. Essayez https://www.howstuffworks.com/ comme exemple. Les résultats affichent un graphique à barres chronologique. Il indique combien de fois le site a été exploré et enregistré chaque année.

Ces données visuelles révèlent le pouls d’un site Web. Certaines années présentent des pics. D’autres font preuve de silence. Il vous indique à quelle fréquence Internet a été consulté. Combien de fois il s’est arrêté pour prendre une photo.

Mais pourquoi certains sites disparaissent-ils alors que d’autres survivent ? Est-ce de la chance ? Ou est-ce de la valeur ? L’archive établit des priorités en fonction de l’importance perçue. Mais qui décide de ce qui est important ? Les bibliothécaires. Les robots. Les algorithmes.

Il y a des lacunes. Des énormes. Des époques entières du Web ont disparu. Ou seulement partiellement conservé. Vous ne pouvez pas toujours obtenir le contexte complet. Les liens externes sont rompus. Les feuilles de style ont disparu. La page semble fausse.

Pourtant, c’est mieux que rien. C’est mieux que le silence. L’arbre tombe. Le son s’estompe. Mais les archives tentent de garder l’écho.

Naviguez au-delà du sélecteur d’année et vous accédez à un calendrier de douze mois. C’est une histoire visuelle de survie. Les carrés bleus signifient qu’un site a été capturé avec succès. Le rouge signifie qu’il a échoué. Cliquez sur une date bleue et les instantanés se chargent. Cliquez sur l’instantané. Vous remontez le temps et consultez une ancienne version du site.

Parfois, il faut forcer le problème. Les robots d’exploration automatisés peuvent manquer une mise à jour critique. Vous pouvez enregistrer manuellement une page à l’aide de l’option “Enregistrer la page maintenant”. Cela capture instantanément une URL spécifique. Cela ne garantit pas les futures explorations. Il n’archive pas l’intégralité du site. Il enregistre simplement cette seule page.

Les propriétaires de contenu ont une issue. Si vous souhaitez que votre matériel soit conservé en dehors de Wayback Machine, vous pouvez l’exclure. Envoyez un e-mail à info@archive.org et ils honoreront la demande.

L’interface offre bien plus que de simples pages Web. Les icônes en haut de la page d’accueil ouvrent des livres, des vidéos, des enregistrements audio et des logiciels. Vous pouvez les télécharger de manière permanente ou les emprunter pour une durée déterminée. Les fonctionnalités de recherche avancées vous aident à approfondir la collection.

L’avenir de la Wayback Machine

Graham considère que l’existence de la Wayback Machine est un miracle. Considérez l’ampleur du Web public. Considérons maintenant la petite équipe et le budget serré qui la maintiennent en marche. Les bénévoles aident à combler les lacunes.

“Avec plus de support, nous pouvons faire un travail encore meilleur en matière de sauvegarde d’une plus grande partie du Web public”, déclare Graham. Le modèle de financement est un mélange. Archive-It.org fournit des revenus provenant de services d’archivage par abonnement. Les principaux donateurs et fondations y contribuent. Plus de 100 000 donateurs individuels participent. Ils refusent de diffuser des publicités. Ils préfèrent offrir leurs services.

Graham est certain que le service gagnera en importance. Les méthodes de communication évoluent. Le partage d’informations évolue. L’équipe doit créer de nouvelles technologies, processus et partenariats pour suivre le rythme. L’objectif est simple : préserver autant d’informations publiques que possible. Il soutient la mission d’aider les journalistes, les militants, les universitaires, les historiens, les chercheurs et le grand public. Son objectif est de rendre le Web plus utile et plus fiable.

Une note éditoriale mentionne que le 13ème paragraphe de l’article original a été mis à jour à la demande du personnel de Wayback Machine.

C’est intéressant

Les liens Wikipédia pourrissent. Ils meurent. Mark Graham note que plus de 11 millions de pages Web référencées dans les articles Wikipédia ont mal tourné. Ils renvoient une erreur 404 « Page non trouvée ». Mais comme la Wayback Machine les avait déjà archivés, des techniciens ont pu intervenir. Ils ont édité les pages Wikipédia. Maintenant, ces références pointent vers les versions archivées. Les liens restent vivants.

Questions fréquemment répondues

La Wayback Machine est-elle gratuite ?
Oui. Son utilisation est gratuite.

Existe-t-il une alternative à la Wayback Machine ?
Internet Archive Wayback Machine est un outil open source permettant d’accéder à des sites Web archivés. Il n’existe pas d’alternative officielle, mais des fonctionnalités similaires existent dans des outils tels que Google Cache, WebCite et Archive.is.

Comment puis-je consulter un ancien site Web sur Wayback ?
Accédez à https://web.archive.org/. Saisissez l’URL du site Web dans la barre de recherche. Appuyez sur Entrée.

Le Web est fragile. Nous le traitons comme si c’était permanent. Ce n’est pas le cas. Mais les archives s’agrandissent. Ça attend. Il surveille.

Exit mobile version