Saltar al contenido
Nota de investigación · TecnologíaNúmero de serie MSK–R/002

Evaluar sistemas RAG es más difícil de lo que parece.

Por qué la calidad de la recuperación, no el modelo, decide si tu sistema dice la verdad.

Escrito por
Ana Pérez · Maistik Studio
Publicado
Tiempo de lectura
3 min de lectura

Ficha técnica

MétodoRecuperación y generación puntuadas por separado, primero offline y después online
DatosTickets de soporte y registros de búsqueda reales, etiquetados con el equipo del cliente
MétricaRecall de pasajes, corrección de la respuesta y negativas correctas
CadenciaSemanal, sobre un conjunto fijo de preguntas

Resumen

La calidad de la recuperación, no el modelo, decide si un sistema RAG dice la verdad. Puntuamos recuperación y generación por separado, con preguntas reales, de forma periódica, y tratamos una negativa correcta como un resultado.

Hallazgos principales

  1. La mayoría de las respuestas incorrectas nacen en la recuperación; el modelo escribe con fluidez sobre lo que le llega.
  2. Negarse a responder cuando falta la fuente es un resultado correcto y hay que puntuarlo como tal.
  3. Una puntuación de la semana del lanzamiento no dice nada sobre el otoño; la periodicidad es la evaluación.
En esta página
  1. Metodología.
  2. Resultados.
  3. Límites.
  4. Conclusiones.

Metodología.

Todo el mundo prueba el modelo. Casi nadie prueba el paso de recuperación con el mismo rigor, y ahí es donde nacen la mayoría de las respuestas incorrectas. Por eso separamos dos preguntas que se suelen mezclar en una: si recuperamos los pasajes correctos y si respondimos bien dado lo que recuperamos.

Construimos el conjunto de evaluación con preguntas reales, no inventadas: tickets de soporte, registros de búsqueda, las preguntas que tu equipo ya recibe. Etiquetamos los pasajes que deberían aparecer para cada pregunta, así la recuperación tiene su propia puntuación, separada de la generación.

Resultados.

Un sistema RAG puede superar todas las pruebas rápidas que hace una persona a mano, porque una persona tiende a hacer las preguntas que el sistema resuelve bien, sobre los documentos que el sistema ya indexó bien. Los huecos aparecen en las preguntas que nadie pensó en hacer.

Una vez que recuperación y generación se miden por separado, los arreglos salen más baratos y se encuentran más rápido. Un problema de fragmentación deja de parecer un problema del modelo. Un índice desactualizado deja de parecer una alucinación que no puedes explicar.

También probamos qué pasa cuando la respuesta no está en los documentos. Un sistema que inventa en vez de decir “no tengo esa información” es peor que no tener sistema, porque esconde su propio fallo detrás de una gramática correcta. Negarse a responder bien es un resultado que medimos, no un detalle secundario.

Límites.

Nada de esto elimina la necesidad de criterio. Alguien tiene que decidir qué significa “correcto” para tus documentos, tus clientes y el riesgo que puedes asumir. Construimos la evaluación con tu equipo, no para tu equipo, porque ese criterio no se traslada bien de una empresa a otra.

Conclusiones.

Ejecutamos la evaluación de forma periódica, no una sola vez en el lanzamiento. Llegan documentos nuevos, otros se retiran, y una forma de preguntar que antes recuperaba el pasaje correcto puede dejar de funcionar sin que nadie se dé cuenta. Tratar la evaluación como un filtro que se pasa una única vez es cómo un sistema que superó todas las pruebas en marzo empieza a dar respuestas incorrectas en otoño, sin que nadie pueda decir cuándo empezó.

Referencias
  1. Lewis et al., “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks”, 2020.
  2. Es et al., “RAGAS: Automated Evaluation of Retrieval Augmented Generation”, 2023.
Red de conexiones que se extiende desde Valencia por todo el mundo

¿Trabajas en algo *parecido*?

Cuéntanos qué estás construyendo. Respondemos con claridad sobre si la IA es la herramienta adecuada.

Hablemoso escribe a hello@maistik.studio