Un pequeño harness de evaluación
Notas de construir un harness que puntúa por separado recuperación, razonamiento y negativas, sobre cincuenta casos reales en lugar de cinco mil inventados.
Qué es
Un script y una hoja de cálculo: entran casos etiquetados, salen tres puntuaciones. Sin panel, sin servicio, nada que tenga que correr en producción. Existe para responder una pregunta antes de lanzar un sistema: si de verdad funciona en los casos que importan, y cuál fue el primero en fallar.
Cómo funciona
Cada caso de la hoja lleva tres cosas: los pasajes de los que debería salir la respuesta, la respuesta esperada y si una negativa es el resultado correcto. El harness ejecuta el sistema bajo prueba contra cada caso, compara el resultado con el esperado y escribe una fila por caso en lugar de una única media. Una caída en la puntuación se puede rastrear hasta el caso exacto que la causó, no solo a “algo empeoró esta semana”.
Límites
No juzga por sí solo las respuestas de texto libre; una persona sigue etiquetando los desacuerdos entre lo que dijo el modelo y lo que esperaba el caso, y esa etiqueta pasa a formar parte del registro. Por ahora solo se ha ejecutado contra documentos y tickets de soporte, no contra series temporales ni lecturas de sensores, así que trata la mitad de recuperación como no probada fuera de texto.

¿Lo quieres sobre tus *datos*?
Todo lo que hay en el lab es público. Si uno de estos debería funcionar dentro de tu entorno, con tus datos, hablemos.
Hablemoso escribe a hello@maistik.studio