¡Hola, mundo hispanohablante y no hispanohablante al otro lado de la pantalla!
En esta ocasión vengo a hablarles de la Web Superficial y la Web Profunda.
Para poder realizar nuestras búsquedas para nuestros trabajos académicos o de investigación debemos tener en cuenta que los buscadores convencionales no muestran un acceso total a la red completa sino sólo una pequeña parte de ella, por lo que entonces podemos dividir la red en dos categorías:
1) Web Superficial o visible que es la que comprende todos aquellos sitios cuya información puede ser indexada por los robots de los buscadores convencionales.
Sus características principales son:
- Su información no está contenida en bases de datos.
- Es de libre acceso.
- No se requiere la realización de un proceso de registro para acceder a la información.
- Mayoritariamente esta formada por páginas web estáticas, es decir, páginas o archivos con una URL fija y accesibles desde otro enlace.
2) Web Profunda o invisible hace referencia a toda la información disponible en internet que no se recupera interrogando a los buscadores convencionales, generalmente es información almacenada y accesible mediante bases de datos.
Sherman y Price la dividen en cuatro tipos:
>Web opaca: Está compuesta por archivos que, si bien podrían estar incluidos en los índices de los buscadores no lo están por:
- Extensión de la indexación: a veces, por economía, no todas las páginas de un sitio son indexados en los buscadores.
- Frecuencia de la indexación: los buscadores no poseen la capacidad de indexar todas las páginas existentes ya que a diario se añaden o actualizan muchas y la indexación no se realiza a un ritmo que pueda permitirle incluirlas todas.
- Número máximo de resultados visibles: aunque los motores de búsqueda arrojan un gran número de resultados (supuestamente, pues es común que muchos estén repetidos), generalmente limitan el número de documentos que muestran que están en un rango de entre 200 y 1000 (y aún así salen repetidos).
- URL desconectadas: las generaciones más recientes de buscadores presentan los documentos por relevancia basada en el número de veces que aparecen referenciados en otros. Si un documento no cuenta con un enlace a él desde otro documento será (prácticamente) imposible que la página sea encontrada, pues no se encuentra indexada.
>Web privada: Son las páginas web que podrían estar indexadas pero son excluidas deliberadamente por:
- Las páginas están protegidas por contraseñas.
- Contienen un archivo "robots.txt" para evitar ser indexadas.
- Contienen un campo "noindex" para evitar que el buscador pueda indexar la parte correspondiente al cuerpo de la página.
Ya que son los envidiosos dueños de la información quienes deciden que no se encuentre disponible, difícilmente se podrá acceder a ella de forma legítima (pero podemos llamar a Lisbeth Salander para que la consiga por nosotros, ¿no?).
>Web propietaria: Incluye aquellas páginas en las que es necesario registrarse para tener acceso al contenido, ya sea de forma gratuita o arancelaria.
>Web realmente invisible: Se compone de páginas que no pueden ser indexadas por limitaciones técnicas de los buscadores, programas ejecutables y archivos comprimidos, etc.
A continuación les dejó algunos recursos de la Web Profunda que son totalmente académicos y muy útiles para los trabajos académicos y de investigación que exigen fuentes fiables:
- The WWW Virtual Library de la que se habló en la entrada de herramientas de búsqueda.
- Infoplease Cuenta con más de 57,000 artículos de la Enciclopedia Columbia además de facilitar la búsqueda con ramas específicas.
- DeepWebTech Ofrece cinco motores de búsqueda para temas específicos.
- TechXtra Se centra en ingeniería, matemáticas e informática.