Cómo evaluar un sistema de IA antes de confiar en él.
La confianza es un número que has medido, no una sensación que tuviste en la demo.
Por qué la calidad de la recuperación, no el modelo, decide si tu sistema dice la verdad.
| Método | Recuperación y generación puntuadas por separado, primero offline y después online |
|---|---|
| Datos | Tickets de soporte y registros de búsqueda reales, etiquetados con el equipo del cliente |
| Métrica | Recall de pasajes, corrección de la respuesta y negativas correctas |
| Cadencia | Semanal, sobre un conjunto fijo de preguntas |
La calidad de la recuperación, no el modelo, decide si un sistema RAG dice la verdad. Puntuamos recuperación y generación por separado, con preguntas reales, de forma periódica, y tratamos una negativa correcta como un resultado.
Todo el mundo prueba el modelo. Casi nadie prueba el paso de recuperación con el mismo rigor, y ahí es donde nacen la mayoría de las respuestas incorrectas. Por eso separamos dos preguntas que se suelen mezclar en una: si recuperamos los pasajes correctos y si respondimos bien dado lo que recuperamos.
Construimos el conjunto de evaluación con preguntas reales, no inventadas: tickets de soporte, registros de búsqueda, las preguntas que tu equipo ya recibe. Etiquetamos los pasajes que deberían aparecer para cada pregunta, así la recuperación tiene su propia puntuación, separada de la generación.
Un sistema RAG puede superar todas las pruebas rápidas que hace una persona a mano, porque una persona tiende a hacer las preguntas que el sistema resuelve bien, sobre los documentos que el sistema ya indexó bien. Los huecos aparecen en las preguntas que nadie pensó en hacer.
Una vez que recuperación y generación se miden por separado, los arreglos salen más baratos y se encuentran más rápido. Un problema de fragmentación deja de parecer un problema del modelo. Un índice desactualizado deja de parecer una alucinación que no puedes explicar.
También probamos qué pasa cuando la respuesta no está en los documentos. Un sistema que inventa en vez de decir “no tengo esa información” es peor que no tener sistema, porque esconde su propio fallo detrás de una gramática correcta. Negarse a responder bien es un resultado que medimos, no un detalle secundario.
Nada de esto elimina la necesidad de criterio. Alguien tiene que decidir qué significa “correcto” para tus documentos, tus clientes y el riesgo que puedes asumir. Construimos la evaluación con tu equipo, no para tu equipo, porque ese criterio no se traslada bien de una empresa a otra.
Ejecutamos la evaluación de forma periódica, no una sola vez en el lanzamiento. Llegan documentos nuevos, otros se retiran, y una forma de preguntar que antes recuperaba el pasaje correcto puede dejar de funcionar sin que nadie se dé cuenta. Tratar la evaluación como un filtro que se pasa una única vez es cómo un sistema que superó todas las pruebas en marzo empieza a dar respuestas incorrectas en otoño, sin que nadie pueda decir cuándo empezó.

Cuéntanos qué estás construyendo. Respondemos con claridad sobre si la IA es la herramienta adecuada.
Hablemoso escribe a hello@maistik.studio