Cómo la Wayback Machine preserva la Web efímera

15

Si un árbol cae en un bosque, ¿emite algún sonido? Tal vez. Pero si un sitio web desaparece de la noche a la mañana, ¿existe realmente su página de inicio? En un mundo digital que prioriza lo nuevo, la historia es frágil. La mayoría de las páginas mueren antes de poder recordarlas. Por eso es importante la Wayback Machine. No es sólo una máquina del tiempo para Internet; es un intento desesperado de frenar la marea de decadencia digital.

La vida útil media de una página web es de aproximadamente 100 días. Mark Graham, director de Wayback Machine, destacó esta estadística en un artículo de Entrepreneur de 2016. Cien días. Después de eso, el contenido suele desaparecer. ¿Por qué sucede esto? Los creadores del sitio siguen adelante. Las empresas de hosting quiebran. O simplemente, la página se reemplaza con datos más nuevos. Sin un archivo digital, estas actualizaciones borrarían el pasado por completo.

Cómo empezó la Wayback Machine

El proyecto fue creado por Brewster Kahle y Bruce Gilliat. También fundaron Internet Archive, una biblioteca digital sin fines de lucro con sede en San Francisco. La Wayback Machine es un proyecto de esta institución más grande. Conserva sitios web, libros, audio, vídeo y software. (También crearon Alexa Internet, que rastreaba el tráfico web antes de que Amazon lo comprara).

Comenzaron a archivar páginas en 1996. Lanzaron la herramienta pública en 2001. El nombre proviene de “The Rocky and Bullwinkle Show”. En la caricatura, la máquina WABAC transportó al Sr. Peabody y a Sherman a través de la historia. La ortografía es diferente, pero la intención es la misma. Quieres ver lo que había antes.

¿Cómo se catalogan 1.700 millones de sitios web? Usas rastreadores. Estos son robots de software automatizados que se mueven por la web. Toman instantáneas de miles de millones de sitios. Pero la automatización no es suficiente. Los bibliotecarios de Internet Archive priorizan manualmente los sitios que consideran importantes. Ellos deciden qué es necesario salvar para las generaciones futuras.

Lo que realmente captura el archivo

Los rastreadores no lo captan todo. La frecuencia varía. Es posible que se registren sitios muy importantes cada pocas horas. Otros se registran con semanas de diferencia. La mayoría de los sitios no están registrados en absoluto. ¿Entonces esa vergonzosa página de fans que creaste en la escuela secundaria? Probablemente haya desaparecido para siempre. La máquina tiene como objetivo capturar contenido importante. Titulares de los principales medios de comunicación. Noticias de última hora.

Tampoco recrea el sitio exactamente. No lo experimentarás como un navegador. Es posible que el archivo solo capture algunas imágenes de unas pocas páginas. A menudo no logra preservar el contenido vinculado a dominios externos. Ésta es una limitación conocida. La Wayback Machine ofrece una visión, no una réplica perfecta.

Usando la máquina Wayback

Has visto el error 404. “Página no encontrada”. Es frustrante. Quieres saber qué había allí originalmente. El archivo ayuda con eso.

Vaya a https://archive.org/web/. Escribe una URL en la barra “Historial de exploración”. Pruebe https://www.howstuffworks.com/ como ejemplo. Los resultados muestran un gráfico de barras cronológico. Muestra cuántas veces se rastreó y guardó el sitio cada año.

Estos datos visuales revelan el pulso de un sitio web. Algunos años muestran picos. Otros muestran silencio. Le indica con qué frecuencia se buscaba en Internet. Con qué frecuencia se detuvo para tomar una fotografía.

Pero ¿por qué algunos sitios desaparecen mientras otros sobreviven? ¿Es suerte? ¿O es valor? El archivo prioriza según la importancia percibida. ¿Pero quién decide qué es importante? Los bibliotecarios. Los rastreadores. Los algoritmos.

Hay lagunas. Enormes. Faltan épocas enteras de la web. O sólo parcialmente conservado. No siempre se puede obtener el contexto completo. Los enlaces externos están rotos. Las hojas de estilo desaparecieron. La página parece incorrecta.

Aún así, es mejor que nada. Es mejor que el silencio. El árbol cae. El sonido se desvanece. Pero el archivo intenta conservar el eco.

Navegue más allá del selector de año y llegará a un calendario de doce meses. Es una historia visual de supervivencia. Los cuadrados azules significan que un sitio fue capturado exitosamente. Rojo significa que falló. Haga clic en una fecha azul y se cargarán las instantáneas. Haga clic en la instantánea. Estás atrás en el tiempo y estás viendo una versión anterior del sitio.

A veces es necesario forzar el asunto. Es posible que los rastreadores automáticos pierdan una actualización crítica. Puede guardar una página manualmente usando la opción “Guardar página ahora”. Esto captura una URL específica al instante. No garantiza rastreos futuros. No archiva todo el sitio. Simplemente guarda esa única página.

Los propietarios de contenido tienen una salida. Si desea que su material se mantenga fuera de Wayback Machine, puede excluirlo. Envíe un correo electrónico a [email protected] y aceptarán la solicitud.

La interfaz ofrece más que sólo páginas web. Los íconos en la parte superior de la página de inicio abren libros, videos, grabaciones de audio y software. Puede descargarlos de forma permanente o tomarlos prestados por un tiempo determinado. Las funciones de búsqueda avanzada te ayudan a profundizar en la colección.

El futuro de la Wayback Machine

Graham considera un milagro que la Wayback Machine exista. Considere la escala de la web pública. Ahora considere el equipo pequeño y el presupuesto ajustado que lo mantienen en funcionamiento. Los voluntarios ayudan a llenar los vacíos.

“Con más apoyo podemos hacer un trabajo [aún] mejor al respaldar una mayor parte de la web pública”, afirma Graham. El modelo de financiación es mixto. Archive-It.org proporciona ingresos obtenidos de servicios de archivo basados ​​en suscripción. Los principales donantes y fundaciones contribuyen. Más de 100.000 donantes individuales contribuyen. Se niegan a publicar anuncios. Prefieren regalar sus servicios.

Graham está seguro de que el servicio ganará importancia. Los métodos de comunicación están cambiando. El intercambio de información está evolucionando. El equipo debe crear nuevas tecnologías, procesos y asociaciones para mantenerse al día. El objetivo es simple: preservar la mayor cantidad de información pública posible. Apoya la misión de ayudar a periodistas, activistas, académicos, historiadores, investigadores y público en general. Su objetivo es hacer que la web sea más útil y fiable.

Una nota editorial menciona que el párrafo 13 del artículo original fue actualizado a solicitud del personal de Wayback Machine.

Eso sí que es interesante

Los enlaces de Wikipedia se pudren. Ellos mueren. Mark Graham señala que más de 11 millones de páginas web a las que se hace referencia en artículos de Wikipedia han fallado. Devuelven un error 404 “Página no encontrada”. Pero como Wayback Machine ya los había archivado, los técnicos pudieron intervenir. Editaron las páginas de Wikipedia. Ahora esas referencias apuntan a las versiones archivadas. Los enlaces siguen vivos.

Preguntas frecuentes

¿La Wayback Machine es gratuita?
Sí. Es de uso gratuito.

¿Existe una alternativa a la Wayback Machine?
Internet Archive Wayback Machine es una herramienta de código abierto para acceder a sitios web archivados. No existe una alternativa oficial, pero existe una funcionalidad similar en herramientas como Google Cache, WebCite y Archive.is.

¿Cómo veo un sitio web antiguo en Wayback?
Vaya a https://web.archive.org/. Ingrese la URL del sitio web en la barra de búsqueda. Presiona enter.

La red es frágil. Lo tratamos como si fuera permanente. No lo es. Pero el archivo crece. Espera. Él mira.