Saltar al contenido
Experimento

Un pequeño harness de evaluación

Notas de construir un harness que puntúa por separado recuperación, razonamiento y negativas, sobre cincuenta casos reales en lugar de cinco mil inventados.

Qué es

Un script y una hoja de cálculo: entran casos etiquetados, salen tres puntuaciones. Sin panel, sin servicio, nada que tenga que correr en producción. Existe para responder una pregunta antes de lanzar un sistema: si de verdad funciona en los casos que importan, y cuál fue el primero en fallar.

Cómo funciona

Cada caso de la hoja lleva tres cosas: los pasajes de los que debería salir la respuesta, la respuesta esperada y si una negativa es el resultado correcto. El harness ejecuta el sistema bajo prueba contra cada caso, compara el resultado con el esperado y escribe una fila por caso en lugar de una única media. Una caída en la puntuación se puede rastrear hasta el caso exacto que la causó, no solo a “algo empeoró esta semana”.

Límites

No juzga por sí solo las respuestas de texto libre; una persona sigue etiquetando los desacuerdos entre lo que dijo el modelo y lo que esperaba el caso, y esa etiqueta pasa a formar parte del registro. Por ahora solo se ha ejecutado contra documentos y tickets de soporte, no contra series temporales ni lecturas de sensores, así que trata la mitad de recuperación como no probada fuera de texto.

Red de conexiones que se extiende desde Valencia por todo el mundo

¿Lo quieres sobre tus *datos*?

Todo lo que hay en el lab es público. Si uno de estos debería funcionar dentro de tu entorno, con tus datos, hablemos.

Hablemoso escribe a hello@maistik.studio