Una respuesta incluye un enlace al manual correcto y, sin embargo, atribuye al manual una condición que no aparece. La presencia de citas facilita revisar la respuesta, pero no demuestra que cada afirmación esté respaldada.

La evaluación debe relacionar afirmaciones concretas con fragmentos concretos. Un enlace válido, una fuente pertinente y una evidencia suficiente son comprobaciones diferentes.

Divide la respuesta en afirmaciones comprobables

Separa las proposiciones que podrían ser correctas o incorrectas por sí mismas. Una frase puede mezclar un plazo, una excepción y una condición de acceso; una única cita al final no aclara qué parte justifica.

La investigación Enabling Large Language Models to Generate Text with Citations propone ALCE y distingue corrección de la respuesta y calidad de las citas. Es una referencia para diseñar la evaluación, no una garantía sobre los asistentes o modelos actuales.

Define qué afirmaciones requieren evidencia documental en tu producto. No todas las frases cumplen la misma función: una indicación de navegación, una inferencia y una condición contractual citada deben poder distinguirse.

Un ejemplo de respaldo parcial

Imagina un procedimiento sintético que dice: ‘Las solicitudes con documentación completa pasan a revisión’. El asistente responde que todas las solicitudes se aprueban automáticamente y cita ese procedimiento.

La fuente existe y trata el tema, pero no respalda la aprobación automática. También desaparece la condición de documentación completa y se cambia revisión por aprobación.

Una evaluación por similitud de palabras podría valorar favorablemente la relación. Una revisión por afirmaciones detecta que el significado no coincide. El caso de prueba debe conservar el texto de la fuente y la respuesta que se evalúa.

Aplica una rúbrica que permita explicar el fallo

Comprobación Pregunta de revisión
Existencia ¿El enlace y el documento corresponden a una fuente real del sistema?
Localización ¿Se puede encontrar el fragmento que supuestamente respalda la afirmación?
Correspondencia ¿Ese fragmento afirma lo que dice la respuesta?
Condiciones ¿Se mantienen excepciones, negaciones y alcance?
Vigencia ¿La versión es aplicable a la pregunta?
Cobertura ¿Las afirmaciones que necesitan respaldo lo tienen?

Marca también el respaldo parcial. Un fragmento puede justificar una parte de la frase y dejar otra sin evidencia. La solución puede ser separar afirmaciones, aportar otra fuente o limitar la respuesta.

Distingue cita correcta y respuesta completa

Una respuesta puede citar correctamente un dato secundario y omitir la información principal que pidió el usuario. Evaluar solo las citas presentes no detectará esa carencia.

Comprueba por separado si responde a la pregunta y si sus afirmaciones están respaldadas. Cuando se necesitan varias fuentes, revisa que su combinación no introduzca una conclusión que ninguna de ellas permite sostener.

Si el asistente realiza una inferencia, debe quedar claro qué parte procede de la documentación y cuál es la conclusión razonada. No presentes esa inferencia como una cita literal de la fuente.

Comprueba lo que realmente recibió el modelo

El documento completo puede contener la evidencia, pero el fragmento recuperado puede haberla perdido. Guarda el contexto entregado al modelo para diferenciar un problema de chunking de uno de generación o selección de citas.

Verifica que el enlace apunta a la versión utilizada. Si el repositorio cambia, una cita puede conducir después a otro contenido. Conserva referencias de versión o una estrategia de trazabilidad acorde con el producto.

Las citas también deben respetar los permisos documentales. No deben revelar títulos, fragmentos o rutas de recursos que el usuario no puede conocer.

Utiliza evaluadores automáticos con una referencia humana

Un evaluador puede ayudar a revisar muchas respuestas, pero también puede aceptar una relación superficial o interpretar mal una excepción. Contrasta sus etiquetas con una muestra adjudicada y conserva los desacuerdos.

No ajustes la rúbrica solo para que aumente una puntuación. Selecciona casos con negaciones, versiones antiguas, tablas y múltiples condiciones, además de respuestas sencillas.

Cuando falta evidencia, evalúa si el asistente limita la afirmación o se abstiene de forma útil. Añade esa decisión a la evaluación del RAG.

Para revisar las citas de un asistente empresarial de IA, comparte con Nexeus Big Data respuestas, preguntas y los fragmentos que recibió el modelo. Ese conjunto permite comprobar el respaldo real y localizar dónde se pierde el significado de la documentación.