lunes, 21 de marzo de 2011

Métodos de recuperación de información en las bases de datos

Técnicas de recuperación de información
o Sistemas de recuperación de lógica difusa
Esta técnica permite establecer consultas con frases normales, de forma que la máquina al realizar la búsqueda elimina signos de puntuación, artículos, conjunciones, plurales, tiempos verbales, palabras comunes (que suelen aparecer en todos los documentos), dejando sólo aquellas palabras que el sistema considera relevantes. La recuperación se basa en proposiciones lógicas con valores de verdadero y falso, teniendo en cuenta la localización de la palabra en el documento
o Técnicas de ponderación de términos
Es común que unos criterios en la búsqueda tenga más valor que otros, por tanto la ponderación pretende darle un valor adecuado a la búsqueda dependiendo de los intereses del usuario. Los documentos recuperados se encuentran en función del valor obtenido en la ponderación. El valor depende de los términos pertinentes que contenga el documento y la frecuencia con que se repita. De forma que, el documento más pertinente de búsqueda sería aquel que tenga representado todos los términos de búsqueda y además el que más valor tenga repetidos más veces, independientemente de donde se localice en el documento.
o Técnica de clustering
Es un modelo probabilístico que permite las frecuencias de los términos de búsqueda en los documentos recuperados. Se atribuyen unos valores (pesos) que actúan como agentes para agrupar los documentos por orden de importancia, mediante algoritmos ranking.
Algoritmos utilizados para realizar la categorización (cluster):
 Algoritmo K-means
 COBWEB
 Algoritmo EM

o Técnicas de retroalimentación por relevancia
Esta técnica pretende obtener el mayor número de documentos relevantes tras establecer varias estrategias de búsqueda. La idea es que, tras determinar unos criterios de búsqueda y observar los documentos recuperados se vuelva a repetir nuevamente la consulta pero esta vez con los elementos interesantes, seleccionados de los documentos primeramente recuperados.
Algoritmo Genético: es el que se ha utilizado para llevar a cabo este tipo de técnicas de recuperación http://www.pmsi.fr/gainits.htm
o Técnicas de stemming
Morfológicamente las palabras están estructuradas en prefijos, sufijos y la raíz. La técnica de Stemming lo que pretende es eliminar las posibles confusiones semánticas que se puedan dar en la búsqueda de un concepto, para ello trunca la palabra y busca solo por la raíz.
Algoritmos utilizados para desechar prefijos y sufijos:
 Paice/Husk
 S-stemmer / n-gramas
 Técnicas lingüísticas
Pretenden acotar de una manera eficaz los documentos relevantes. Por esta razón, esta técnica lo consigue mediante una correcta indización en el proceso de tratamiento de los documentos con ayuda de índices, tesauros, etc.; evitando las ambigüedades léxicas y semánticas a la hora de establecer las consultas.

Calidad de la recuperación
A continuación se presentan unos criterios básicos para que la recuperación llevada a cabo sea de calidad.
o Consistencia: Capacidad que tiene un sistema de búsqueda en coordinar su sistema de clasificación con el lenguaje de búsqueda, permitiendo de esta manera establecer ecuaciones de búsqueda sobre términos admitidos.
o Exhaustividad: Es la cualidad de un sistema de información para recuperar la totalidad de los documentos relevantes que posee una colección, conforme a los requerimientos establecidos en la estrategia de búsqueda.
o Tasa de acierto: coeficiente que surge de dividir el número de documentos relevantes recuperados, sobre el número total de documentos relevantes de la colección
o Relevancia: Característica de un documento recuperado que cumple con la necesidades de información.
o Tasa de relevancia: coeficiente que surge de dividir el número de documentos relevantes recuperados, sobre el número total de documentos recuperados
o Pertinencia: Es la cualidad que tiene el documento recuperado de adaptarse a las necesidades de información.
o Tasa de pertinencia: coeficiente que surge de dividir el número de documentos pertinentes recuperados, sobre el número total de documentos recuperados
o Precisión: es la capacidad que tiene el sistema de búsqueda en coordinar la ecuación con los documentos más relevantes. De otra forma son aquellos documentos relevantes recuperados.
o Tasa de precisión: coeficiente que surge de dividir el número de documentos relevantes recuperados, sobre el número total de documentos de la colección

http://www.mariapinto.es/e-coms/recu_infor.htm
http://caibco.ucv.ve/caibco/vitae/VitaeSiete/DeInteres/ArchivosHTML/metodosrecup.htm
http://www.mariapinto.es/e-coms/recu_infor.htm#ri9
http://www.monografias.com/trabajos11/basda/basda.shtml
http://www.google.com/search?q=%E2%80%A2%09M%C3%A9todos+de+recuperaci%C3%B3n+de+informaci%C3%B3n+en+las+bases+de+datos+&ie=utf-8&oe=utf-8&aq=t&rls=org.mozilla:es-ES:official&client=firefox-a

1 comentario:

  1. Lo que pasa con el es que ya vivio ago asi por lo que se tubo que alejar de su familia,creo que una vez ue pasa no le quedan ni ganas :S Pobre.Y los demas capitulos, no se estare viendo cuando, de todas maneras les estoy avisando.

    Gracias por comentar y visitar mi blog.
    Saludos
    :D

    ResponderEliminar