Define qué significa una respuesta correcta
La generación aumentada por recuperación (RAG) le entrega al modelo material de origen relevante antes de que responda. Puede ayudar con conocimiento privado o cambiante, pero la recuperación no garantiza que el material recuperado sea correcto, completo ni que el usuario esté autorizado a verlo.
Empieza con un caso de uso acotado, como responder preguntas sobre un manual de producto versionado. Escribe ejemplos de respuestas aceptables, las citas que necesitan y cuándo el sistema debe negarse a responder o escalar. Mantén la generación de respuestas separada de las herramientas que modifican registros del negocio.
Prepara los documentos para la recuperación
Conserva los encabezados, el contexto de las tablas, los números de versión y las URLs de origen. Asigna a cada fragmento un identificador de documento estable y conserva sus reglas de acceso y su fecha de revisión. Divide por límites semánticos útiles en lugar de suponer que un mismo número de tokens sirve para todos los documentos. Prueba preguntas cuya respuesta abarque dos secciones o dependa de una nota al pie.
Las eliminaciones de documentos y los cambios de permisos deben propagarse a los índices de búsqueda y a las cachés. Volver a generar los embeddings de un documento no debe dejar atrás fragmentos antiguos y accesibles. Lleva un registro de los fallos de ingesta para que los operadores vean qué evidencia falta.
Compara enfoques de recuperación
Los términos exactos, como códigos de error, SKUs y números de versión, suelen beneficiarse de la búsqueda por palabras clave. Los embeddings pueden ayudar con la similitud conceptual. Un sistema híbrido puede combinar ambos conjuntos de resultados y usar fusión de rankings o reordenamiento, pero añade costo y latencia.
Construye un conjunto de preguntas etiquetadas antes de añadir etapas. Mide si los pasajes relevantes y autorizados aparecen en el conjunto recuperado y, después, si la respuesta final se apoya en esos pasajes. Incluye preguntas ambiguas, sin respuesta y desactualizadas. La precisión en un corte elegido es una métrica de recuperación, no una medida de la exactitud factual general.
Aplica el control de acceso antes de exponer el contexto
- Autentica al usuario y establece los permisos de cliente y de documento en código de aplicación de confianza.
- Aplica restricciones de autorización a la recuperación y valida los pasajes seleccionados finales antes de que lleguen al modelo.
- Trata el texto recuperado como datos no confiables. Una instrucción dentro de un documento para revelar secretos o invocar una herramienta no debe anular la política de la aplicación.
- Limita las herramientas a las operaciones necesarias; valida los argumentos, los permisos y las reglas de negocio con independencia de la salida del modelo.
- Exige un paso adecuado de confirmación o revisión para las acciones con consecuencias y conserva un registro de auditoría mínimo.
Controla los costos sin compartir la respuesta equivocada
Registra por separado los costos de recuperación, embeddings, reordenamiento y generación, junto con la latencia p50 y p95. Limita el contexto a los pasajes que ayudan a responder la pregunta, fija un tope a la longitud de la salida y elige la capacidad del modelo según tu conjunto de evaluación.
Empieza la caché con coincidencias exactas y una estrategia de invalidación clara. Acota las claves por cliente, versión de la política de acceso, versión del documento, modelo y versión del prompt. Una redacción similar no basta para establecer que dos usuarios tienen derecho a la misma respuesta. Una caché semántica necesita pruebas adicionales frente a coincidencias falsas y respuestas desactualizadas; además, sigue implicando trabajo de recuperación o de embeddings.
Lanza con un criterio de aceptación medible
Fija umbrales acordes al riesgo del caso de uso. Prueba las citas, las negativas, los límites de permisos, los documentos maliciosos, los tiempos de espera agotados y los fallos de herramientas. Un JSON estructurado puede hacer fiable el análisis, pero un esquema válido no hace verdadera una afirmación ni autorizada una acción.
Revisa las respuestas fallidas y los fallos de recuperación después del lanzamiento. Agrégalos a un conjunto de regresión reservado en lugar de ajustar el sistema solo para una demostración. Muestra al usuario la fuente que respalda la respuesta y haz visible la incertidumbre cuando el material disponible no pueda resolver la pregunta.
Preguntas frecuentes
¿RAG impide que un sistema de IA invente respuestas?
No. La recuperación puede aportar evidencia útil, pero los pasajes pueden estar incompletos, desactualizados o no ser relevantes, y el modelo puede interpretarlos mal. Evalúa si la respuesta final se apoya en las fuentes seleccionadas y define cuándo el sistema debe negarse a responder o escalar.
¿Cómo evito que un cliente vea los documentos de otro cliente?
Aplica los permisos de cliente y de documento en código de aplicación de confianza antes de que la evidencia llegue al modelo. Vuelve a comprobar los pasajes seleccionados y acota las cachés a la política de acceso y a las versiones de contenido correspondientes. Un prompt que le pide al modelo respetar los permisos no es una barrera de autorización.
¿Debo usar búsqueda por palabras clave, búsqueda vectorial o ambas?
Prueba primero con preguntas representativas. Los identificadores exactos y los códigos de error suelen necesitar coincidencia por palabras clave, mientras que los embeddings pueden ayudar con la similitud conceptual. Compara la calidad de la recuperación, el respaldo de las respuestas, la latencia y el costo antes de añadir recuperación híbrida o reordenamiento.
¿Cuándo es seguro guardar en caché una respuesta de IA?
Solo cuando la clave de caché y las reglas de invalidación preservan los requisitos de permisos y de actualidad de la respuesta. Incluye las versiones del cliente, la política, el documento, el modelo y el prompt cuando corresponda. Que la redacción sea parecida no demuestra por sí solo que dos usuarios puedan recibir la misma respuesta.
Fuentes y lecturas recomendadas
Sigue explorando
Conoce el desarrollo de aplicaciones de IA o la guía de colas e idempotencia para flujos en segundo plano fiables.

Leave a Reply