miércoles, 16 de septiembre de 2015

TICS-Modelo de Búsqueda Web Basado en Información
del Contexto del  Usuario y Técnicas de
Filtrado Colaborativo (Análisis personal)

Análisis personal



Donnell Sara y Gredo Garcés A.. Modelo de Búsqueda Web Basado en Información del Contexto del Usuario y Técnicas de Filtrado Colaborativo. Facultad de Ingeniería Electrónica y Telecomunicaciones en Universidad del Cauca y Universidad Industrial de Santander. 2012



INTRODUCCIÓN

El presente artículo propone “un modelo de meta buscador Web”, que integra el filtrado colaborativo (basado en ítems en donde los ítems se consideran documentos) con la propuesta de Massimo Meluci, basada en proyectores sobre planos que se originan en la información del contexto del usuario. El modelo propuesto constituye un aporte para el área de recuperación de información, dado que muestra  resultados en pruebas realizadas sobre colecciones cerradas y con usuarios.

La Recuperación de la Información (RI) es un área de estudio que busca las mejores formas para representar, almacenar, organizar y acceder a la de información automáticamente. Esta necesidad de información del usuario, es un proceso de RI que produce como salida un conjunto de documentos cuyo contenido satisface potencialmente dicha necesidad, ya que la función de un sistema de RI no es devolver la información deseada por el usuario, unicamete la de indicar que documentos son potencialmente relevantes para dicha necesidad de información.

Un Sistema de Recuperación de Información (SRI) se compone por:

ü  documentos (almacenados en bases de datos o directos),
ü  usuarios,
ü  consultas,
ü  resultados/respuestas (documentos almacenados y ordenados por relevancia),
ü  re-alimentación (del usuario al sistema), y
ü  proceso (software y hardware que realiza el proceso de recuperación de información).


Un sistema clásico de RI como los motores de búsqueda ( Google, Yahoo!Bing y Asks entre otros) es popular y de utilidad cuando se desea recuperar información en la web. El problema con la búsqueda web se puede dividir en dos clases; de datos y de usuarios.


1.- El problema relacionado con los datos está en:

·         volumen,
·         la velocidad de los cambios,
·         la naturaleza de la web (spamming de metadatos, contenido y enlace ),
·         la diversidad de lenguajes y de contenidos,
·         el esquema de  cooperación de servidores web para los buscadores, entre otros.


2.- Y por el lado del usuario tenemos que:

·         se necesitan mejores lenguajes de consulta,
·         mejores interfaces de usuario,
·         y mejores esquemas de visualización de resultados.

En los motores de búsqueda tradicionales las características contextuales no son capturadas en el tiempo de indexación, ni son explotadas en el tiempo de recuperación. Por lo tanto la recuperación puede ser inexacta y con alta posibilidad a equivocarse.

Un meta buscador web usa explícitamente dos procesos:

·         una adecuada gestión del contexto del usuario (en las mejores condiciones)
·         y el filtrado colaborativo basado en retroalimentación.

La retroalimentación (feedback) del usuario es una de las estrategias más populares de reformulación de consulta en RI, su combinación con técnicas de filtrado colaborativo permiten a los usuarios del SRI tomar provecho de la información que otros usuarios ya han generado.

La búsqueda de información requiere procesos de:

            (A)  Expansión de consulta en SRI
           (B)  Bases para recuperar información en contexto
           (C)  Filtrado colaborativo

 5 caracteres Hipster, paquete de vectores

RESUMEN EXPOSITIVO

(A). Expansión de consulta en SRI:

Para la mayoría de usuarios es difícil formular consultas que sean bien estructuradas, con el propósito de recuperar información; Los documentos inicialmente obtenidos pueden ser revisados de acuerdo a la relevancia y posteriormente mejorar la formulación de la consulta con el objeto de encontrar documentos más relevantes”.

La reformulación involucra expandir la consulta inicial con nuevos términos y reponderar términos en la consulta expandida.

Los enfoques para mejorar la consulta inicial a través de expansión de la consulta y de reponderación de términos, se agrupan en tres categorías:

i.      Basados en el feedback del usuario,
ii.    Basados en información derivada del conjunto de documentos inicialmente recuperado (llamado conjunto local de documentos)
iii.   Basados en información global derivada de la colección de documentos.

El feedback del usuario, es la retroalimentación de relevancia del usuario (URF por sus siglas en inglés, User Relevance Feedback), requiere que el usuario marque los documentos como relevantes o no relevantes y luego, a cada nueva consulta del usuario se le agregan o quitan los términos que el sistema ha encontrado como relevantes o no en los documentos marcados. La idea básica de URF, en un modelo vectorial, es reformular la consulta de tal manera que se acerque más al espacio de los documentos relevantes.

Por otro lado, las categorías (ii) y (iii) expanden las consultas automáticamente, usando retroalimentación automática de relevancia (ARF por sus siglas en inglés, Automatic Relevance Feedback), también conocida como pseudo retroalimentación.

La retroalimentación se realiza con documentos locales, en una categoría (ii) y documentos globales, en la siguiente categoría (iii). En los métodos basados en documentos locales, categoría (ii), se envía originalmente la consulta al motor de búsqueda, con resultados entregados, se selecciona un grupo de los documentos (los primeros resultados, considerados como relevantes) y con ellos se reformula la consulta y se reenvía al motor. Los resultados de la segunda consulta (o consulta expandida) son los que realmente se presentan al usuario.

Los trabajos de Robertson y Sparck Jones que reponderan los términos de la consulta, o los de Dillon y Desper que abandonan los términos del usuario y usan términos de los documentos inicialmente recuperados, son enfoques de feedback local que expanden la consulta con términos correlacionados a los términos.

Otros enfoques de feedback local que expanden la consulta con términos correlacionados a los términos de la consulta actual, usan clusters locales, donde se encuentran dichos términos  correlacionados, construidos con el conjunto de documentos local, hay tres tipos de cluster comúnmente usados estos son:

û  Clusters de asociación: Se basa en la idea de que los términos que frecuentemente conocen dentro del documento tienen una asociación de sinonimia.
û  Clusters de métricas: Se basan en la idea que dos términos que están juntos en la misma sentencia, están más correlacionados que dos términos que ocurran separadamente en un documento.
û  Cluster escalar: Cuya idea básica es que dos términos con vecinos similares tienen alguna relación de sinonimia.

En los métodos basados en documentos globales categoría(iii), se analizan todos los documentos de la colección y se establecen las relaciones entre los términos, por lo que, estos métodos normalmente se realizan basados tesauros. La desventaja de este método es que necesita todos los documentos y el proceso de actualización del tesauro puede ser costoso y complejo.

Otro enfoque que es independiente del dominio o corpus de la colección, consiste en usar diccionarios o tesauros globales, tales como WordNet. 

Nuevos enfoques incluyen técnicas morfológicas que procesan términos de la consulta y técnicas semánticas que encuentran términos similares a los digitados por el usuario. Estos enfoques extienden la familia de matrices de coocurrencia,  el uso de conocimiento semántico representado en ontologías, a través del análisis de las relaciones de los conceptos y sus términos, las funciones, las instancias y los axiomas; y métodos que mezclan varias técnicas, por ejemplo el uso de ontologías con filtrado colaborativo y redes neuronales artificiales.

No solamente se usa la expansión de consultas en la recuperación de texto, también se puede emplear un framework de recuperación de imágenes, que representa las imágenes como vectores de conceptos ponderados. Para generar el vocabulario de conceptos se construye un modelo estadístico.

(B). Bases para recuperar información en contexto:

La recuperación de la información es un área de estudio que es atendida por diferentes investigadores. Melucci propone un modelo de manejo de la información del contexto, que toma cada propiedad o característica del contexto, como una base no orto normal de un espacio vectorial, que luego es usado para establecer una función probabilística denominada “probabilidad de relevancia o función de ranking”, con la que se reordena la presentación de los resultados al usuario.

Este modelo es general, e independiente del medio y aplicable a varias tareas, usa múltiples fuentes de evidencia presentes en una descripción de contexto, funciones de rastreo, matrices de densidad y los proyectores, para mejorar las estructuras de información de feedback implícito personalizado para cada usuario y para cada tarea de búsqueda.

El término factor contextual  se usa para significar uno de los posibles valores de una propiedad contextual. Una característica importante  de este modelo es que todo se describe como un subespacio de un espacio vectorial complejo o como una combinación lineal de subespacios.

Llevando mas a la practica este modelo se puede decir que en un escenario donde un usuario está accediendo a un SRI con el fin de recuperar documentos relevantes para su necesidad de información, el contexto influencia no sólo la selección de las palabras clave de la consulta, también su semántica y la forma en que ésta se relaciona con otras palabras.


(C). Filtrado colaborativo:


Motivados por las limitaciones de los sistemas de búsqueda tradicionales, varios investigadores deciden trabajan en estás limitantes. Estos sistemas de búsqueda y recomendación han sido diseñados para recolectar la experiencia de los usuarios con los datos de información y hacer recomendaciones con base en esa experiencia, las recomendaciones se hacen usando diferentes técnicas, donde el filtrado colaborativo es la más común.

Existen básicamente dos técnicas de filtrado colaborativo: una basada en el usuario, que pretenden encontrar a otros usuarios que tengan gustos similares; y otra basada en ítem(donde los ítem son datos), donde un usuario estaría interesado en encontrar ítems que son similares a los que le gustaron a un usuario anterior (sistema recomendador).

El sistema de recomendación cómo Amazon es el más conocido y usado en la actualidad, maneja más de 29 millones de usuarios y varios millones de ítems en su catalogo y se basa en un algoritmo de filtrado colaborativo de ítem a ítem.
En general el filtrado colaborativo es el proceso de filtrar información o patrones usando técnicas que involucran la colaboración de múltiples agentes, puntos de vista, fuentes de datos, entre otros.
En el caso de Amazon los ítems de información son los productos y las personas que los compran dan sus distintos puntos de vista, que sirven de recomendación a quienes compran productos similares.
Uno de los principales problemas que enfrentan la mayoría de técnicas de filtrado colaborativo es la falta de información, conocido en la literatura como el problema del ramp-up o cold start, cuando un nuevo usuario ingresa al sistema, ya que no se tiene información sobre sus preferencias, la segunda es análoga, ya que se crea un nuevo servicio, pues no hay ninguna información (experiencias) de ningún usuario para ese nuevo servicio.
"El filtrado colaborativo” busca un enfoque basado en la preferencia. En estos sistemas se le encuesta al usuario sobre sus preferencias, sobre los productos y basados en la teoría de la utilidad multiatributo se encuentran los ítems (productos) preferidos, sin importar el conjunto de alternativas.
Un ejemplo de filtrado colaborativo es el uso de la información que generan los usuarios para mejorar la búsqueda web; en donde el uso de ontologías junto con el filtrado colaborativo ítem a ítem para superar el problema de la falta de información.

CONCLUSIONES
El modelo del meta buscador web propuesto en este articulo, integra el filtrado colaborativo con la propuesta de Meluci, que se basa en proyectores sobre planos que se originan en la información del contexto del usuario. El modelo cuenta con los siguientes pasos:
Modelo general del proceso de expansión de consulta.
 





Figura 1 Modelo general del proceso de expansión de consulta.
Cada proceso proceso involucra subprocesos que ayudan a generar mejores resultados para la búsqueda, a continuación se describen cada uno de ellos:
1.- Registrarse e ingresar al sistema: Aquí el usuario llena inicialmente un formulario para registrarse, posteriormente cada vez que use el meta buscador web debe realizar un proceso de login con e cual es identificado.
2.- El usuario ingresa la consulta basada en palabras clave: El usuario debe digitar la consulta de manera tradicional, basado en palabras claves.
3.- Preprocesamiento de consulta: En el procesamiento de la consulta se eliminan acentos y caracteres especiales, se organizan las palabras de la consulta, se eliminan las palabras vacías, se dejan todas las palabras en minúscula y se realiza el proceso de stemming (llevar diferentes palabras a una raíz común) y luego se calcula la frecuencia de los términos en la colección de documentos.
4.- Expansión de la consulta: De manera automática el sistema realiza un proceso de expansión de consulta basado en la información de contexto disponible del usuario y de la comunidad y muestra una lista desplegable con los términos que se espera que complementen mejor los ya digitados por el usuario, para que éste los seleccione.

5.- Recuperación de documentos de los buscadores tradicionales: Se envía la petición de búsqueda  (consulta expandida) a las APIs de los buscadores tradicionales ( por ejemplo, Google y Bing ). Los documentos se organizan en una tabla de términos por documentos estándar, conocida como matriz de términos por documentos, aplicando el preprocesamiento de cada documento y registrando solamente la frecuencia de los términos en los documentos.
6.- Filtrado de información: Basado en la propuesta de Melucci, se toma provecho de la información del contexto del usuarios y se complementa con la información de la comunidad, basado en técnicas de filtrado colaborativo para filtrar y ordenar la información que muestra al usuario en una lista ordenada de documentos tal y como lo presentan los buscadores tradicionales.
7.- Visualizar y calificar resultados: A través de una interfaz gráfica de usuario, el usuario del modelo califica los documentos como relevantes o no relevantes a las necesidades de información inicialmente definidas en la consulta.
8.- Modificar información del contexto e información de feedback para la comunidad: A partir de la calificación que el usuario realiza de los resultados obtenidos, el sistema realiza la gestión de la información de contexto del usuario y de la comunidad. Con esta información de contexto actualizada se afecta el proceso de expansión, filtrado y ordenado de las futuras consultas.
Es decir que existes dos tipos de sistemas para el procesamiento de elementos de información en la búsqueda; los sistemas de recuperación de información y los sistemas de bases de datos que los contienen. Mientras los sistemas de bases de datos están optimizados para el manejo de los datos estructurados con una semántica completamente  definida, los sistemas de recuperación de información, por el contrario, son diseñados para el procesamiento de texto en lenguaje natural, raramente estructurado y en lo general de semántica ambigua.
Por ejemplo en un sistema de base de dato el usuario introduce una consulta específica, está obtiene como salida (en forma tabular) todos los resultados que satisfacen dicho requerimiento sin posibilidad alguna de error,  ya que invalidaría por completo el resultado y se esta maneja una base de datos determinada.
Sin embargo, en el caso de los sistemas de recuperación de información los resultados frecuentemente contienen errores, y no tienen por qué ser completos. de hecho, el objetivo de un sistema de recuperación de información es maximizar el número de documentos relevantes devueltos a la vez que se minimiza el número de documentos no relevantes devueltos.

















1 comentario:

  1. Es un tema muy complejo así como interesante, hubiera estado bien que los temas expresados hubieran sido expuestos de una manera mas corta y simple.

    ResponderEliminar