TICS-Modelo de Búsqueda Web Basado en Información
del Contexto del Usuario y Técnicas de
Filtrado Colaborativo (Análisis personal)
Análisis personal
Donnell
Sara y Gredo Garcés A.. Modelo de Búsqueda Web Basado en Información del
Contexto del Usuario y Técnicas de Filtrado Colaborativo. Facultad de
Ingeniería Electrónica y Telecomunicaciones en Universidad del Cauca y
Universidad Industrial de Santander. 2012
INTRODUCCIÓN
El
presente artículo propone “un modelo de meta buscador Web”, que integra
el filtrado colaborativo (basado en ítems en donde los ítems se consideran
documentos) con la propuesta de Massimo Meluci, basada en proyectores sobre
planos que se originan en la información del contexto del usuario. El modelo
propuesto constituye un aporte para el área de recuperación de información,
dado que muestra resultados en pruebas
realizadas sobre colecciones cerradas y con usuarios.
La
Recuperación de la Información (RI) es un área de estudio
que busca las mejores formas para representar, almacenar, organizar y
acceder a la de información automáticamente. Esta necesidad de información
del usuario, es un proceso de RI que produce como salida un conjunto de
documentos cuyo contenido satisface potencialmente dicha necesidad, ya que la
función de un sistema de RI no es devolver la información deseada por el
usuario, unicamete la de indicar que documentos son potencialmente relevantes
para dicha necesidad de información.
Un
Sistema de Recuperación de Información (SRI) se compone
por:
ü
documentos
(almacenados en bases de datos o directos),
ü
usuarios,
ü
consultas,
ü
resultados/respuestas
(documentos almacenados y ordenados por relevancia),
ü
re-alimentación
(del usuario al sistema), y
ü
proceso
(software y hardware que realiza el proceso de recuperación de información).
Un
sistema clásico de RI como los motores de búsqueda ( Google, Yahoo!Bing
y Asks entre otros) es popular y de utilidad cuando se desea recuperar
información en la web. El problema con la búsqueda web se puede dividir en dos
clases; de datos y de usuarios.
1.-
El problema relacionado con los datos está en:
·
volumen,
·
la
velocidad de los cambios,
·
la
naturaleza de la web (spamming de metadatos, contenido y enlace ),
·
la
diversidad de lenguajes y de contenidos,
·
el
esquema de cooperación de servidores web
para los buscadores, entre otros.
2.-
Y por el lado del usuario tenemos que:
·
se
necesitan mejores lenguajes de consulta,
·
mejores
interfaces de usuario,
·
y
mejores esquemas de visualización de resultados.
En
los motores de búsqueda tradicionales las características contextuales no son
capturadas en el tiempo de indexación, ni son explotadas en el tiempo de
recuperación. Por lo tanto la recuperación puede ser inexacta y con alta
posibilidad a equivocarse.
Un
meta buscador web usa explícitamente dos procesos:
·
una
adecuada gestión del contexto del usuario (en las mejores condiciones)
·
y
el filtrado colaborativo basado en retroalimentación.
La
retroalimentación (feedback) del usuario es una de las estrategias más
populares de reformulación de consulta en RI, su combinación con técnicas de
filtrado colaborativo permiten a los usuarios del SRI tomar provecho de la
información que otros usuarios ya han generado.
La
búsqueda de información requiere procesos de:
(A)
Expansión de consulta en SRI
(B) Bases para recuperar información en contexto
(C) Filtrado colaborativo
RESUMEN
EXPOSITIVO
(A).
Expansión de consulta en SRI:
Para
la mayoría de usuarios es difícil formular consultas que sean bien
estructuradas, con el propósito de recuperar información; “Los documentos inicialmente
obtenidos pueden ser revisados de acuerdo a la relevancia y posteriormente
mejorar la formulación de la consulta con el objeto de encontrar documentos más
relevantes”.
La
reformulación involucra expandir la consulta inicial con nuevos términos y
reponderar términos en la consulta expandida.
Los
enfoques para mejorar la consulta inicial a través de expansión de la consulta
y de reponderación de términos, se agrupan en tres categorías:
i.
Basados
en el feedback del usuario,
ii.
Basados
en información derivada del conjunto de documentos inicialmente recuperado
(llamado conjunto local de documentos)
iii.
Basados
en información global derivada de la colección de documentos.
El
feedback del usuario, es la retroalimentación de relevancia del usuario (URF
por sus siglas en inglés, User Relevance Feedback), requiere que el usuario
marque los documentos como relevantes o no relevantes y luego, a cada nueva
consulta del usuario se le agregan o quitan los términos que el sistema ha
encontrado como relevantes o no en los documentos marcados. La idea básica de
URF, en un modelo vectorial, es reformular la consulta de tal manera que se
acerque más al espacio de los documentos relevantes.
Por
otro lado, las categorías (ii) y (iii) expanden las consultas automáticamente, usando
retroalimentación automática de relevancia (ARF por sus siglas en inglés,
Automatic Relevance Feedback), también conocida como pseudo retroalimentación.
La
retroalimentación se realiza con documentos locales, en una categoría (ii) y
documentos globales, en la siguiente categoría (iii). En los métodos basados en
documentos locales, categoría (ii), se envía originalmente la consulta al motor
de búsqueda, con resultados entregados, se selecciona un grupo de los
documentos (los primeros resultados, considerados como relevantes) y con ellos
se reformula la consulta y se reenvía al motor. Los resultados de la segunda
consulta (o consulta expandida) son los que realmente se presentan al usuario.
Los
trabajos de Robertson y Sparck Jones que reponderan los términos de la
consulta, o los de Dillon y Desper que abandonan los términos del usuario y
usan términos de los documentos inicialmente recuperados, son enfoques de
feedback local que expanden la consulta con términos correlacionados a los
términos.
Otros
enfoques de feedback local que expanden la consulta con términos
correlacionados a los términos de la consulta actual, usan clusters locales,
donde se encuentran dichos términos
correlacionados, construidos con el conjunto de documentos local, hay
tres tipos de cluster comúnmente usados estos son:
û Clusters de asociación: Se basa en la idea de que los
términos que frecuentemente conocen dentro del documento tienen una asociación
de sinonimia.
û Clusters de métricas: Se basan en la idea que dos términos
que están juntos en la misma sentencia, están más correlacionados que dos
términos que ocurran separadamente en un documento.
û
Cluster
escalar: Cuya
idea básica es que dos términos con vecinos similares tienen alguna relación de
sinonimia.
En
los métodos basados en documentos globales categoría(iii), se analizan todos
los documentos de la colección y se establecen las relaciones entre los
términos, por lo que, estos métodos normalmente se realizan basados tesauros.
La desventaja de este método es que necesita todos los documentos y el proceso
de actualización del tesauro puede ser costoso y complejo.
Otro
enfoque que es independiente del dominio o corpus de la colección, consiste en
usar diccionarios o tesauros globales, tales como WordNet.
Nuevos
enfoques incluyen técnicas morfológicas que procesan términos de la consulta y
técnicas semánticas que encuentran términos similares a los digitados por el
usuario. Estos enfoques extienden la familia de matrices de coocurrencia, el uso de conocimiento semántico representado
en ontologías, a través del análisis de las relaciones de los conceptos y sus
términos, las funciones, las instancias y los axiomas; y métodos que mezclan
varias técnicas, por ejemplo el uso de ontologías con filtrado colaborativo y
redes neuronales artificiales.
(B).
Bases para recuperar información en contexto:
La
recuperación de la información es un área de estudio que es atendida por
diferentes investigadores. Melucci propone un modelo de manejo de la información
del contexto, que toma cada propiedad o característica del contexto, como una
base no orto normal de un espacio vectorial, que luego es usado para establecer
una función probabilística denominada “probabilidad de relevancia o función de
ranking”, con la que se reordena la presentación de los resultados al usuario.
Este
modelo es general, e independiente del medio y aplicable a varias tareas, usa
múltiples fuentes de evidencia presentes en una descripción de contexto,
funciones de rastreo, matrices de densidad y los proyectores, para mejorar las
estructuras de información de feedback implícito personalizado para cada
usuario y para cada tarea de búsqueda.
El
término factor contextual se usa para
significar uno de los posibles valores de una propiedad contextual. Una
característica importante de este modelo
es que todo se describe como un subespacio de un espacio vectorial complejo o
como una combinación lineal de subespacios.
Llevando
mas a la practica este modelo se puede decir que en un escenario donde un
usuario está accediendo a un SRI con el fin de recuperar documentos relevantes
para su necesidad de información, el contexto influencia no sólo la selección
de las palabras clave de la consulta, también su semántica y la forma en que
ésta se relaciona con otras palabras.
(C).
Filtrado colaborativo:
Motivados
por las limitaciones de los sistemas de búsqueda tradicionales, varios
investigadores deciden trabajan en estás limitantes. Estos sistemas de búsqueda
y recomendación han sido diseñados para recolectar la experiencia de los
usuarios con los datos de información y hacer recomendaciones con base en esa
experiencia, las recomendaciones se hacen usando diferentes técnicas, donde el
filtrado colaborativo es la más común.
Existen
básicamente dos técnicas de filtrado colaborativo: una basada en el usuario,
que pretenden encontrar a otros usuarios que tengan gustos similares; y otra
basada en ítem(donde los ítem son datos), donde un usuario estaría interesado
en encontrar ítems que son similares a los que le gustaron a un usuario
anterior (sistema recomendador).
El
sistema de recomendación cómo Amazon es el más conocido y usado en la
actualidad, maneja más de 29 millones de usuarios y varios millones de ítems en
su catalogo y se basa en un algoritmo de filtrado colaborativo de ítem a ítem.
En
general el filtrado colaborativo es el proceso de filtrar información o
patrones usando técnicas que involucran la colaboración de múltiples agentes,
puntos de vista, fuentes de datos, entre otros.
En
el caso de Amazon los ítems de información son los productos y las personas que
los compran dan sus distintos puntos de vista, que sirven de recomendación a
quienes compran productos similares.
Uno
de los principales problemas que enfrentan la mayoría de técnicas de filtrado
colaborativo es la falta de información, conocido en la literatura como el
problema del ramp-up o cold start, cuando un nuevo usuario ingresa al sistema,
ya que no se tiene información sobre sus preferencias, la segunda es análoga,
ya que se crea un nuevo servicio, pues no hay ninguna información
(experiencias) de ningún usuario para ese nuevo servicio.
"El
filtrado colaborativo” busca un enfoque basado en la preferencia. En estos
sistemas se le encuesta al usuario sobre sus preferencias, sobre los productos
y basados en la teoría de la utilidad multiatributo se encuentran los ítems
(productos) preferidos, sin importar el conjunto de alternativas.
Un
ejemplo de filtrado colaborativo es el uso de la información que generan los
usuarios para mejorar la búsqueda web; en donde el uso de ontologías junto con
el filtrado colaborativo ítem a ítem para superar el problema de la falta de
información.
CONCLUSIONES
El
modelo del meta buscador web propuesto en este articulo, integra el filtrado
colaborativo con la propuesta de Meluci, que se basa en proyectores sobre
planos que se originan en la información del contexto del usuario. El modelo
cuenta con los siguientes pasos:
Modelo
general del proceso de expansión de consulta.
|
|
Figura 1 Modelo general del proceso de expansión de consulta.
Cada
proceso proceso involucra subprocesos que ayudan a generar mejores resultados
para la búsqueda, a continuación se describen cada uno de ellos:
1.-
Registrarse e ingresar al sistema:
Aquí el usuario llena inicialmente un formulario para registrarse,
posteriormente cada vez que use el meta buscador web debe realizar un proceso
de login con e cual es identificado.
2.-
El usuario ingresa la consulta basada en palabras clave: El usuario debe digitar la consulta
de manera tradicional, basado en palabras claves.
3.-
Preprocesamiento de consulta:
En el procesamiento de la consulta se eliminan acentos y caracteres especiales,
se organizan las palabras de la consulta, se eliminan las palabras vacías, se
dejan todas las palabras en minúscula y se realiza el proceso de stemming
(llevar diferentes palabras a una raíz común) y luego se calcula la frecuencia
de los términos en la colección de documentos.
4.-
Expansión de la consulta:
De manera automática el sistema realiza un proceso de expansión de consulta
basado en la información de contexto disponible del usuario y de la comunidad y
muestra una lista desplegable con los términos que se espera que complementen
mejor los ya digitados por el usuario, para que éste los seleccione.
5.-
Recuperación de documentos de los buscadores tradicionales: Se envía la petición de búsqueda (consulta expandida) a las APIs de los
buscadores tradicionales ( por ejemplo, Google y Bing ). Los documentos se
organizan en una tabla de términos por documentos estándar, conocida como
matriz de términos por documentos, aplicando el preprocesamiento de cada
documento y registrando solamente la frecuencia de los términos en los
documentos.
6.-
Filtrado de información:
Basado en la propuesta de Melucci, se toma provecho de la información del
contexto del usuarios y se complementa con la información de la comunidad,
basado en técnicas de filtrado colaborativo para filtrar y ordenar la
información que muestra al usuario en una lista ordenada de documentos tal y
como lo presentan los buscadores tradicionales.
7.-
Visualizar y calificar resultados:
A través de una interfaz gráfica de usuario, el usuario del modelo califica los
documentos como relevantes o no relevantes a las necesidades de información
inicialmente definidas en la consulta.
8.-
Modificar información del contexto e información de feedback para la comunidad: A partir de la calificación que el
usuario realiza de los resultados obtenidos, el sistema realiza la gestión de
la información de contexto del usuario y de la comunidad. Con esta información
de contexto actualizada se afecta el proceso de expansión, filtrado y ordenado
de las futuras consultas.
Es
decir que existes dos tipos de sistemas para el procesamiento de elementos de
información en la búsqueda; los sistemas de recuperación de información y los
sistemas de bases de datos que los contienen. Mientras los sistemas de bases de
datos están optimizados para el manejo de los datos estructurados con una
semántica completamente definida, los
sistemas de recuperación de información, por el contrario, son diseñados para
el procesamiento de texto en lenguaje natural, raramente estructurado y en lo
general de semántica ambigua.
Por
ejemplo en un sistema de base de dato el usuario introduce una consulta
específica, está obtiene como salida (en forma tabular) todos los resultados
que satisfacen dicho requerimiento sin posibilidad alguna de error, ya que invalidaría por completo el resultado
y se esta maneja una base de datos determinada.
Sin
embargo, en el caso de los sistemas de recuperación de información los
resultados frecuentemente contienen errores, y no tienen por qué ser completos.
de hecho, el objetivo de un sistema de recuperación de información es maximizar
el número de documentos relevantes devueltos a la vez que se minimiza el número
de documentos no relevantes devueltos.
Es un tema muy complejo así como interesante, hubiera estado bien que los temas expresados hubieran sido expuestos de una manera mas corta y simple.
ResponderEliminar