Un asistente que responde a todo puede inventar información. Otro que se niega ante casi cualquier pregunta evita muchos errores, pero deja de ayudar. Evaluar únicamente cuántas respuestas son correctas oculta esa diferencia si no se observa también a qué preguntas decidió responder.
La abstención debe evaluarse como una decisión: cuándo existe evidencia suficiente, cuándo falta y qué salida útil puede ofrecer el sistema. Decir ‘no lo sé’ no constituye por sí solo una mejora.
Define qué significa poder responder
En un asistente documental, una pregunta es respondible dentro del alcance de la prueba cuando el corpus autorizado contiene evidencia suficiente y vigente para construir la respuesta esperada. No basta con que el modelo conozca algo parecido por su entrenamiento.
La investigación que introdujo preguntas sin respuesta en SQuAD mostró la importancia de evaluar contextos que no contienen la respuesta, aunque resulten plausibles. Es una referencia de comprensión lectora; no demuestra el rendimiento de un asistente empresarial concreto.
Anota la evidencia antes de ejecutar el sistema. Si decides que una pregunta no tenía respuesta después de ver el fallo, puedes estar justificando errores de recuperación como si fueran abstenciones correctas.
Separa los resultados antes de calcular porcentajes
Para una primera prueba, utiliza preguntas claramente respondibles y otras claramente no respondibles. Conserva aparte los casos ambiguos que necesitan aclaración o adjudicación.
Este ejemplo es construido y no describe resultados de un modelo real:
| Evidencia en el corpus autorizado | Respuesta correcta | Respuesta incorrecta o sin respaldo | Abstención | Total |
|---|---|---|---|---|
| Suficiente | 60 | 10 | 10 | 80 |
| Insuficiente | 0 | 5 | 15 | 20 |
| Total | 60 | 15 | 25 | 100 |
El sistema responde 75 de las 100 preguntas: su cobertura de respuesta es del 75 %. De esas 75 respuestas, 60 son correctas según la rúbrica, por lo que la corrección entre respuestas emitidas es del 80 %.
También rechaza 10 de las 80 preguntas que sí tenían evidencia: un 12,5 % de abstenciones innecesarias dentro de ese grupo. En las 20 preguntas sin evidencia, se abstiene 15 veces, un 75 %.
Los denominadores importan. Presentar solo el 80 % de corrección ocultaría cuántas necesidades dejó sin atender; presentar solo el 75 % de cobertura ocultaría las respuestas equivocadas.
Investiga por qué se abstuvo en un caso respondible
Examina primero si la evidencia llegó al contexto del modelo. Puede existir en el repositorio y no haber sido recuperada por un problema de indexación, filtros, fragmentación u ordenación.
Si la evidencia llegó completa, revisa si el sistema reconoció su relación con la pregunta. Una política demasiado restrictiva puede rechazar respuestas que la documentación sí permite construir.
No elimines controles de acceso para mejorar la cobertura. La evaluación debe utilizar la misma identidad y autorización efectiva que el usuario del caso. Un documento restringido no convierte en respondible una pregunta para quien no puede consultarlo.
Una buena salida puede pedir una aclaración
‘¿Cuál es el plazo?’ puede necesitar identificar producto, contrato o procedimiento. Pedir ese dato es una acción distinta de afirmar que no existe respuesta.
Define cuándo el asistente debe aclarar, indicar que falta evidencia o explicar una limitación técnica. Un fallo del buscador tampoco debe registrarse automáticamente como una pregunta sin respuesta en el corpus.
La explicación al usuario debe ser útil y respetar permisos. No necesita revelar que existe un documento al que no tiene acceso. Puede indicar qué información necesita para continuar o qué canal autorizado permite resolver la solicitud.
Ajusta umbrales con una evaluación reservada
Si utilizas puntuaciones para decidir cuándo responder, comprueba qué representan. Una similitud vectorial o una puntuación de reordenación no equivale automáticamente a la probabilidad de que la respuesta sea correcta.
Ajusta la política con un conjunto de desarrollo y evalúa después con preguntas que no se hayan utilizado para elegirla. Compara cómo cambian cobertura, errores y abstenciones innecesarias.
Desglosa por familias de consulta. Un promedio puede ocultar que el asistente funciona con preguntas generales y falla con códigos exactos o excepciones de un procedimiento.
Conserva los casos que explican la decisión
Registra pregunta, identidad de prueba, evidencia esperada, contexto recuperado, respuesta y motivo de evaluación. Utiliza datos adecuados para pruebas y limita el acceso a esa evidencia.
Integra estas categorías en la evaluación de tu sistema RAG y revísalas cuando cambie el corpus o la política de respuesta.
Si necesitas evaluar un asistente de inteligencia artificial, comparte con Nexeus Big Data preguntas que deba resolver y otras que deba dejar abiertas. Esa combinación permite comprobar tanto la utilidad de sus respuestas como la calidad de sus abstenciones.