El viernes pasado tuvimos una nueva reunión en Orbea donde presentamos el proyecto de investigación a diversas áreas de la empresa: gerencia, desarrollo de producto, marketing, comunicación y asistencia técnica. Mostramos algunas conclusiones muy iniciales aún del análisis del foro de discusión en Internet que vamos a tomar como ejemplo de conversación entre usuarios.

Excavar

Más adelante llegarán entrevistas tanto a determinados usuarios como a personas de Orbea, pero en el momento actual estamos analizando lo que ha dado de sí ese foro durante un tiempo en concreto. Para ello utilizamos la técnica del web scraping:

El web scraping está muy relacionado con la indexación de la web, la cual indexa la información de la web utilizando un robot y es una técnica universal adoptada por la mayoría de los motores de búsqueda. Sin embargo, el web scraping se enfoca más en la transformación de datos sin estructura en la web (como el formato HTML) en datos estructurados que pueden ser almacenados y analizados en una base de datos central, en una hoja de cálculo o en alguna otra fuente de almacenamiento. El término web scraping también está relacionado con la automatización de tareas en la Web, la cual simula la navegación de un humano utilizando un software de computadora. Alguno de los usos del web scraping son la comparación de precios en tiendas, la monitorización de datos relacionados con el clima de cierta región, la detección de cambios en sitios webs y la integración de datos en sitios webs.

Es decir, esta técnica nos permite, en el caso de un foro de discusión, analizar estadísticamente lo que está ocurriendo allí: qué volumen de mensajes se envía, quiénes lo hacen, con qué nivel de respuesta y de likes, cómo evolucionan en el tiempo y cosas así. El hecho de poder trabajar con los datos estructurados en una hoja de cálculo confiere capacidad de análisis a una información que, de otra forma, es muy compleja de seguir. Una cosa es tener datos, otra tener información.

Para llevar a cabo este análisis tengo que citar sí o sí a Gorka Julio Teketen, quien me puso sobre la pista de una extensión de Chrome, Web Scraper. Esta ha sido la elegida para extraer la información. En primer lugar hay que seleccionar los campos que queremos extraer y la paginación que debe seguir (al tratarse de un sitio web con múltiples páginas que agrupan la conversación en bloques de veinte mensajes). Con ello se elabora el sitemap que lanzaremos para realizar el scrape.

El resultado de ese trabajo es la obtención de un fichero en formato csv que permitirá el tratamiento estadístico. De esta forma hemos comenzado ya a analizar cerca de 16.000 mensajes, que son los que conforman la base de nuestra investigación.