IA generativa, LLM, RAG y conocimiento
RAG para empresas: qué es, cómo funciona y por qué importa
La mayoría de las empresas no necesita un modelo de IA que parezca saberlo todo. Necesita un sistema que encuentre la información autorizada, la utilice correctamente y enseñe de dónde sale cada respuesta.
RAG, siglas de retrieval-augmented generation o generación aumentada por recuperación, conecta un modelo de lenguaje con conocimiento externo: políticas internas, documentación de producto, contratos, incidencias, investigaciones, expedientes o datos de un CRM. Cuando una persona hace una pregunta, el sistema recupera evidencia relevante y se la entrega al modelo antes de que responda.
Este mecanismo permite generar respuestas más actuales, específicas y trazables que las producidas únicamente con el conocimiento aprendido por el modelo durante su entrenamiento.
RAG ya se ha consolidado como uno de los patrones principales de la IA empresarial. Menlo Ventures registró un aumento de adopción del 31% en 2023 al 51% en 2024. En el mismo estudio, solo el 9% de los modelos en producción utilizaba fine-tuning (Menlo Ventures, 2024).
La razón es sencilla: una empresa puede actualizar una base documental con mucha más facilidad que reentrenar un modelo cada vez que cambia una política, una tarifa o un catálogo.
RAG en una frase: RAG recupera información relevante de una fuente externa y se la entrega a un modelo de IA para que genere una respuesta fundamentada, actual y potencialmente acompañada de citas.
RAG se convirtió en un patrón habitual de IA empresarial
2023
2024
2024
Qué es RAG
RAG es una arquitectura de IA que combina dos capacidades. La primera busca información en una fuente externa. La segunda utiliza la información recuperada para redactar una respuesta.
Patrick Lewis y su equipo introdujeron el término en el artículo científico de 2020 Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Los investigadores combinaron la «memoria paramétrica» de un modelo —el conocimiento almacenado en sus pesos— con una «memoria no paramétrica» formada por un índice documental externo (Lewis et al., 2020).
La distinción tiene consecuencias prácticas. Un LLM estándar no puede consultar automáticamente los contratos privados de una empresa, la última actualización de una política, el historial de un cliente ni el catálogo publicado ayer. Incluso cuando conoce bien un tema, puede generar una afirmación razonable que no se apoya en ninguna fuente verificable.
RAG crea una vía controlada para que la aplicación consulte información empresarial en el momento de la petición.
No elimina todos los errores del modelo. Lo que hace es convertir un problema difuso —«esperemos que la IA conozca la respuesta»— en tres preguntas que un equipo puede medir:
- ¿El sistema recuperó la evidencia correcta?
- ¿El modelo utilizó esa evidencia con fidelidad?
- ¿Debía responder, abstenerse o derivar el caso a una persona?
RAG añade memoria empresarial gobernada al modelo
RAG y un LLM estándar
Un modelo de lenguaje sin retrieval responde con el conocimiento adquirido durante su entrenamiento, las instrucciones del sistema y el contenido incluido directamente en el prompt. Esta combinación funciona bien para redactar, resumir un texto breve, clasificar contenido o generar ideas.
RAG empieza a aportar valor cuando la respuesta depende de información privada, extensa, cambiante, restringida por permisos o sensible a la fuente. Por ejemplo:
- «¿Qué permite la política vigente de viajes para visitas a clientes?»
- «¿Qué cláusula de este contrato regula los créditos de servicio?»
- «¿El producto admite la configuración solicitada por este cliente?»
- «Resume las incidencias asociadas a este activo durante los últimos 90 días».
- «¿Qué afirmaciones aprobadas puede utilizar marketing para este producto sanitario?»
El modelo aporta lenguaje y capacidad de síntesis. La capa de retrieval aporta la evidencia.
Por qué RAG importa a una empresa
RAG responde a cuatro necesidades habituales.
Actualización. El equipo puede actualizar documentos o registros sin reentrenar el modelo. Una política nueva puede entrar en el índice y quedar disponible para las siguientes consultas.
Trazabilidad. La aplicación puede acompañar la respuesta con el título, el enlace, el fragmento, la fecha o la versión del documento utilizado. Una cita no garantiza que la interpretación sea correcta, pero permite revisar la evidencia.
Control de acceso. El sistema puede filtrar la información por usuario, departamento, cliente, país, producto o nivel de confidencialidad antes de enviarla al modelo.
Control operativo. La empresa puede medir por separado la calidad de la recuperación, la fidelidad de la respuesta, la latencia, el coste y las derivaciones.
Por eso RAG aparece en asistentes internos, copilotos de soporte, herramientas jurídicas y buscadores empresariales. Convierte el conocimiento de la organización en un servicio consultable tanto por personas como por otros sistemas.
Cómo funciona RAG, paso a paso
Un sistema RAG de producción combina dos procesos: preparar el conocimiento y contestar preguntas.
1. Conectar y procesar las fuentes
El sistema recopila contenido autorizado desde SharePoint, Google Drive, Confluence, una base de conocimiento, un CRM, un ERP, un data warehouse o un repositorio de contratos.
El parsing extrae texto y estructura utilizables. Esta fase suele causar más problemas de los que muestra una demo. Los PDF escaneados requieren OCR. Las tablas deben conservar la relación entre filas y columnas. Los encabezados, notas, páginas duplicadas y versiones obsoletas necesitan reglas específicas.
2. Dividir el contenido en fragmentos
El pipeline separa cada documento en unidades recuperables o chunks. Un fragmento debe contener contexto suficiente para responder, sin incorporar tanto texto irrelevante que diluya la evidencia útil.
El tamaño fijo puede servir como punto de partida para texto limpio. Sin embargo, la estructura documental suele ofrecer mejores límites. En una política conviene respetar secciones. En un contrato, cláusulas y anexos. En un manual, procedimientos, advertencias y títulos.
Un equipo puede empezar con fragmentos de varios cientos de tokens y un solapamiento limitado. Después debe probar alternativas con preguntas reales. No existe un tamaño mágico que funcione para todos los documentos.
3. Añadir metadatos y permisos
Cada fragmento necesita información adicional que el buscador pueda utilizar. Un esquema útil puede incluir:
source_id, title, section, language, document_type, tenant_id, acl_tags, created_at, updated_at y version.
Los metadatos permiten responder a peticiones como «utiliza únicamente la política vigente en español para la plantilla de Colombia» con más control que una búsqueda semántica sobre todo el repositorio.
4. Crear un índice de búsqueda
Muchos sistemas transforman los fragmentos en embeddings: representaciones numéricas que sitúan textos con significados parecidos en zonas cercanas de un espacio vectorial.
Una base vectorial o un motor de búsqueda con soporte para vectores guarda esas representaciones. El índice también puede conservar una representación tradicional basada en palabras. La búsqueda léxica sigue siendo esencial para códigos de producto, artículos legales, nombres, acrónimos y frases exactas.
5. Procesar la pregunta
Cuando llega una consulta, la aplicación identifica al usuario, aplica sus permisos y puede reformular la pregunta para mejorar la búsqueda. También puede extraer filtros como jurisdicción, fecha, cliente o producto.
6. Recuperar y ordenar la evidencia
El sistema busca los fragmentos más probables. La búsqueda densa encuentra similitud semántica. La búsqueda sparse, como BM25, localiza coincidencias léxicas. La búsqueda híbrida combina ambas.
Después, un reranker puede evaluar con más precisión los candidatos y seleccionar la evidencia que entrará en el prompt. Esta etapa suele ayudar cuando el corpus contiene muchas secciones parecidas.
7. Generar una respuesta controlada
La aplicación envía la evidencia seleccionada al LLM junto con instrucciones. Un prompt empresarial debería pedir al modelo que:
- responda a partir de las fuentes entregadas;
- cite la evidencia de las afirmaciones relevantes;
- diferencie hechos e interpretación;
- indique cuándo la información es insuficiente o contradictoria;
- respete un formato definido; y
- derive los casos sensibles cuando corresponda.
8. Registrar y evaluar
El sistema registra la consulta, los fragmentos recuperados, las versiones de las fuentes, la respuesta, la latencia y, cuando la política lo permite, la valoración del usuario.
Estos registros permiten distinguir un fallo de búsqueda de un error de síntesis, un documento obsoleto, una fuga de permisos o un coste innecesario.
La lección operativa: Una respuesta RAG es el resultado de un pipeline, no de una única llamada al modelo. Cambiar de LLM no corrige un documento ausente, un parser defectuoso, metadatos pobres ni un filtro de acceso incorrecto.
Cómo funciona un pipeline RAG de producción
Arquitecturas y métodos de retrieval
Los primeros prototipos RAG seguían una secuencia simple: recuperar y generar. Los sistemas maduros añaden controles antes y después de la búsqueda porque las colecciones empresariales contienen duplicados, versiones, permisos y formatos difíciles.
RAG naive, avanzado y modular
Naive RAG genera embeddings, recupera los fragmentos más cercanos y los coloca en el prompt. Sirve para validar una idea, pero puede devolver evidencia ruidosa, repetida o incompleta.
Advanced RAG mejora la indexación, el procesamiento de consultas, los filtros, la búsqueda híbrida, el reranking y la selección de contexto. Representa una base razonable para muchas aplicaciones en producción.
Modular RAG convierte la recuperación en un conjunto de componentes configurables. Un router puede elegir entre documentos legales, CRM, datos de producto o búsqueda web. El sistema puede dividir una pregunta, lanzar varias consultas, contrastar fuentes y verificar el borrador.
RAG añade controles cuando el caso de negocio se vuelve más exigente
Retrieval sparse, denso e híbrido
El retrieval sparse busca términos. BM25 sigue siendo una referencia frecuente. Funciona bien cuando importa la coincidencia exacta: un artículo normativo, un SKU, el nombre de un cliente, un código de error o una cláusula.
El retrieval denso compara embeddings. Capta paráfrasis y preguntas naturales. Una persona puede preguntar «¿Puedo acumular vacaciones para el año siguiente?» aunque el documento utilice «trasladar el saldo anual».
El retrieval híbrido combina ambos métodos. Suele ofrecer el punto de partida más seguro para contenido empresarial heterogéneo, donde las preguntas mezclan conceptos con identificadores exactos.
Sparse y dense retrieval detectan señales distintas
Sparse / BM25
Prioriza coincidencias como HR-42, «vacaciones no utilizadas» y redacción literal.
Mejor señal: identificadores, nombres, referencias legales y códigos.Dense / embeddings
Conecta la pregunta con frases como «el saldo anual puede trasladarse».
Mejor señal: paráfrasis, conceptos y similitud multilingüe.Retrieval híbrido
Usa el identificador y el significado semántico; después fusiona o reordena resultados.
Punto de partida práctico para contenido empresarial heterogéneo.Reranking
Una búsqueda inicial puede recuperar 20 o 50 candidatos de forma rápida. El reranker compara cada candidato con la pregunta con mayor precisión y devuelve un conjunto más pequeño al modelo.
Esta etapa añade latencia y coste. Conviene comprobar si mejora las preguntas importantes. Suele resultar valiosa en documentación jurídica, soporte técnico y repositorios con muchas secciones similares.
El retrieval rápido encuentra candidatos; el reranker selecciona la evidencia
Embeddings, índices y bases vectoriales
El modelo de embeddings determina qué significados considera cercanos el sistema. Las empresas multilingües deben evaluar cada idioma operativo, incluidas las consultas en un idioma cuya respuesta se encuentra en otro.
El índice establece el equilibrio entre exactitud, memoria y velocidad. HNSW es una estructura habitual para búsqueda aproximada con baja latencia. La búsqueda plana puede servir en colecciones pequeñas o cuando se necesita una comparación exhaustiva. PostgreSQL con pgvector puede bastar si la organización ya utiliza PostgreSQL y no necesita otra plataforma.
La marca de la base vectorial importa menos que el diseño de datos, los filtros, la evaluación y el encaje operativo. La infraestructura existente, la seguridad, el conocimiento del equipo y las integraciones deben guiar la decisión.
Elige el índice según escala y operación, no por reconocimiento de marca
Búsqueda plana
Compara la consulta con cada vector. Es simple y exacta, pero el trabajo crece con la colección.
HNSW / índice aproximado
Recorre un grafo de vectores cercanos para devolver buenos candidatos con baja latencia.
PostgreSQL + pgvector
Mantiene vectores junto a los datos existentes cuando simplificar la operación pesa más que añadir otra plataforma.
Casos de uso de RAG en empresa
RAG crea más valor cuando las personas dedican tiempo recurrente a buscar, interpretar y comunicar conocimiento autorizado.
Los mejores casos combinan preguntas repetidas con conocimiento gobernado
Atención al cliente
Un asistente puede recuperar instrucciones, procedimientos, reglas de cuenta e incidencias conocidas. Puede responder al cliente o sugerir una respuesta al agente.
La métrica crítica no es cuántas conversaciones toca la IA, sino cuántos problemas resuelve correctamente sin provocar un contacto posterior. Algunos proveedores publican cifras elevadas de ticket deflection. Gartner ha advertido que la desviación aparente puede superar ampliamente la resolución real en autoservicio.
La empresa debe medir recontacto, calidad de las derivaciones, satisfacción y gravedad de las respuestas incorrectas.
Conocimiento interno y recursos humanos
Los empleados pierden tiempo buscando entre wikis, carpetas compartidas, chats y portales. Un asistente con permisos puede contestar preguntas sobre onboarding, gastos, vacaciones, compras, TI o servicios internos y enlazar la política aplicable.
Los casos sensibles siguen necesitando responsabilidad humana. La IA puede explicar una política y dirigir una excepción, pero no debería decidir silenciosamente los derechos de una persona.
Legal y compliance
Los equipos jurídicos pueden recuperar cláusulas, comparar contratos, resumir fuentes, identificar obligaciones y rastrear cada afirmación hasta su origen.
Los metadatos son decisivos. La jurisdicción, la fecha de vigencia, la versión y el tipo de acuerdo pueden cambiar por completo la respuesta.
RAG facilita el trabajo legal porque expone evidencia. No convierte un modelo generalista en asesor jurídico ni elimina la revisión profesional.
Finanzas e investigación regulada
RAG puede ayudar a consultar documentación de producto, investigación interna, políticas, informes y comentarios aprobados. Morgan Stanley ha descrito públicamente herramientas de IA que ayudan a sus asesores financieros a acceder y sintetizar conocimiento interno.
En un entorno regulado, la aplicación necesita fuentes autorizadas, trazas, límites claros y reglas para información temporal o asesoramiento personalizado.
Ventas y propuestas
Un copiloto comercial puede recuperar afirmaciones aprobadas, casos de éxito, respuestas de seguridad, condiciones y contenido de propuestas. Después prepara un borrador manteniendo el vínculo con cada fuente.
Para evitar compromisos erróneos, el corpus debe separar el material vigente de propuestas antiguas y excepciones concedidas a un cliente concreto.
Producto y operaciones técnicas
Los equipos pueden consultar runbooks, incidentes, decisiones de arquitectura, catálogos de servicio y procedimientos de mantenimiento. RAG también puede proporcionar conocimiento fiable a un agente que ejecuta un flujo técnico.
Un ejemplo documentado de mejora
Un estudio de ortopedia publicado en 2024 evaluó modelos frente a guías clínicas. La incorporación de RAG mejoró la precisión media de todos los modelos evaluados en un 39,7%. La mejor configuración, que combinaba RAG y un agente, alcanzó un 95% de precisión.
El resultado no se puede extrapolar automáticamente a cualquier sector. Sí demuestra que el acceso a una fuente fiable puede cambiar de forma material el rendimiento en una tarea delimitada (Pasternak et al., Arthroscopy, 2024).
Desviar una consulta no significa resolverla
RAG frente a otras opciones de IA
RAG no es la respuesta automática a cualquier problema de conocimiento. La arquitectura adecuada depende del tamaño del corpus, su frecuencia de cambio, la necesidad de citas, los permisos, la latencia aceptable y el comportamiento esperado.
Prompting estándar
- Conviene cuando
- Basta el conocimiento general o un contexto breve.
- Fortaleza
- La implementación más simple y rápida.
- Límite
- No crea una capa escalable de conocimiento privado.
Contexto largo
- Conviene cuando
- Un corpus estable y acotado cabe en la ventana de contexto.
- Fortaleza
- Conserva contexto amplio con menos componentes.
- Límite
- Coste, latencia y atención empeoran al crecer.
RAG
- Conviene cuando
- El conocimiento cambia, abarca fuentes o requiere permisos y citas.
- Fortaleza
- Acceso selectivo, actual y trazable.
- Límite
- Retrieval y calidad de datos requieren ingeniería.
Fine-tuning
- Conviene cuando
- El modelo necesita comportamiento, estilo o estructura constante.
- Fortaleza
- Cambia cómo ejecuta la tarea.
- Límite
- No encaja bien con hechos cambiantes y citas.
Búsqueda empresarial
- Conviene cuando
- El usuario necesita documentos y enlaces originales.
- Fortaleza
- Resultados predecibles y controles maduros.
- Límite
- Deja la interpretación al usuario.
Grafo / GraphRAG
- Conviene cuando
- Las relaciones y preguntas multi-hop dominan la tarea.
- Fortaleza
- Conexiones explícitas y análisis relacional.
- Límite
- Mayor esfuerzo de modelado, indexación y mantenimiento.
RAG y prompting estándar
Utiliza prompting cuando el usuario puede aportar toda la información necesaria o cuando la tarea depende de conocimiento general. Añadir retrieval a una herramienta de reescritura o a un clasificador simple crea infraestructura innecesaria.
Elige RAG cuando el modelo necesita consultar un corpus que no cabe razonablemente en cada petición.
RAG y ventanas de contexto largo
Los modelos con contexto largo pueden procesar documentos extensos directamente. Este enfoque puede ser más simple para un corpus estable, delimitado y consultado de forma ocasional. También conserva el contexto global que el chunking podría fragmentar.
RAG gana sentido cuando el corpus crece, cambia, exige permisos o recibe consultas repetidas. El sistema recupera una pequeña cantidad de evidencia en lugar de procesar toda la colección cada vez.
Ambos enfoques pueden combinarse. RAG selecciona los documentos adecuados y un modelo de contexto largo analiza el conjunto elegido.
RAG y fine-tuning
RAG aporta conocimiento. El fine-tuning modifica comportamiento.
Si el modelo conoce los hechos pero responde con el formato, tono o clasificación equivocados, el fine-tuning puede ayudar. Si le faltan hechos privados o actuales, RAG suele encajar mejor.
Una aplicación madura puede combinar un modelo ajustado para ejecutar una tarea de forma consistente con RAG para consultar evidencia vigente.
RAG y búsqueda empresarial
Un buscador devuelve resultados para que una persona los revise. RAG añade síntesis y puede convertir varios fragmentos en una respuesta directa.
La búsqueda tradicional sigue siendo preferible cuando el usuario debe inspeccionar los documentos originales, cuando el recall importa más que una respuesta breve o cuando la síntesis introduce un riesgo inaceptable. Una interfaz RAG responsable siempre debería permitir abrir las fuentes.
RAG, grafos de conocimiento y GraphRAG
Un grafo representa entidades y relaciones de forma explícita. Puede responder mejor a preguntas como «¿Qué proveedores participan en los productos afectados por esta norma?».
RAG vectorial recupera pasajes con significado parecido. GraphRAG añade análisis de grafos para preguntas que requieren patrones globales o conexiones de varios pasos. Puede mejorar investigaciones complejas, pero introduce extracción de entidades, construcción del grafo, agrupación y nuevas evaluaciones.
La opción sensata es comenzar con RAG estándar o híbrido. Solo conviene añadir grafos cuando el razonamiento conectado forma parte central del caso y las pruebas muestran que el retrieval simple falla.
Proceso práctico para elegir
- Define la tarea. Determina si el problema es conocimiento, comportamiento, búsqueda documental o relaciones.
- Mide el corpus. Registra tamaño, idiomas, ritmo de actualización, formatos y permisos.
- Prueba la opción más simple. Evalúa prompting o contexto largo con preguntas representativas.
- Añade retrieval cuando necesites seleccionar evidencia. Empieza con un corpus pequeño y evaluado.
- Utiliza fine-tuning solo para una carencia de comportamiento demostrada.
- Añade grafos solo para fallos demostrados de razonamiento relacional.
- Compara calidad, riesgo, latencia y coste operativo antes de escalar.
Elige la arquitectura más sencilla que resuelva la tarea
Cómo evaluar un sistema RAG
Un scorecard útil mide tres capas
Una demo fluida puede ocultar una recuperación débil. La evaluación debe utilizar preguntas similares a las que llegarán en producción.
Calidad del retrieval
La precisión de contexto mide si los fragmentos recuperados son relevantes. Una precisión baja llena el prompt de ruido.
El recall de contexto mide si el sistema encontró evidencia suficiente. Un recall bajo genera respuestas incompletas incluso cuando el modelo sigue bien las instrucciones.
También deben medirse el respeto de permisos, la vigencia de las fuentes y la duplicación.
Calidad de la generación
La faithfulness o fidelidad pregunta si la respuesta está respaldada por el contexto.
La relevancia mide si la respuesta atiende la intención real.
La corrección compara el resultado con una referencia fiable cuando existe.
RAGAS formalizó varias de estas métricas de evaluación sin referencia. Haystack, TruLens, LangSmith y las herramientas de evals de los proveedores cubren distintas partes del proceso (RAGAS, EACL 2024).
Métricas empresariales y operativas
La calidad técnica no basta. Una implantación necesita medir:
- tareas completadas o problemas resueltos;
- recontacto y derivación;
- tiempo de revisión ahorrado;
- errores ponderados por gravedad;
- adopción y satisfacción;
- latencia p50 y p95;
- coste por tarea completada; y
- tiempo necesario para actualizar la base.
El conjunto de evaluación debe incluir preguntas sencillas, peticiones ambiguas, casos sin información, documentos contradictorios, intentos de acceder a contenido no autorizado y ataques contra las instrucciones.
Costes, herramientas y hoja de ruta
El coste de RAG incluye preparación de datos, infraestructura de búsqueda, inferencia, integraciones, evaluación, seguridad y operación. Los embeddings suelen representar una parte pequeña.
El dossier recoge precios de referencia de $0,02 por millón de tokens para text-embedding-3-small y $0,13 para text-embedding-3-large. Estos precios pueden cambiar y deben verificarse antes de elaborar un presupuesto.
La conclusión útil no es el céntimo exacto: limpiar documentos, conectar sistemas y mantener controles suele costar más que vectorizar el texto.
Opciones tecnológicas
Entre los frameworks habituales se encuentran LangChain, LlamaIndex, Haystack y Semantic Kernel. Los servicios gestionados incluyen Azure AI Search y Azure OpenAI, Amazon Bedrock Knowledge Bases, Google Vertex AI y herramientas de retrieval ofrecidas por los proveedores de modelos.
Las opciones de búsqueda y vectores incluyen Pinecone, Weaviate, Qdrant, Milvus, Elasticsearch, Azure AI Search y PostgreSQL con pgvector.
La empresa debería elegir según:
- su nube y plataforma de datos;
- conectores necesarios;
- residencia y seguridad;
- calidad multilingüe;
- filtros y permisos;
- observabilidad y evaluación;
- escala y latencia; y
- equipo responsable de operar el sistema.
El mercado crece, pero las previsiones no son una medición exacta
Las estimaciones recogidas en el dossier apuntan en la misma dirección y difieren mucho en magnitud. MarketsandMarkets sitúa el mercado RAG en 1.940 millones de dólares en 2025 y proyecta 9.860 millones para 2030. Grand View Research parte de 1.200 millones en 2024 y proyecta 11.000 millones en 2030.
Estas previsiones proceden de firmas de análisis con metodologías propias. Sirven para mostrar inversión y expansión, no para establecer un único tamaño «correcto» del mercado.
Las previsiones apuntan a un fuerte crecimiento del mercado RAG
Hoja de ruta de implantación
- Selecciona un conjunto de preguntas valioso. Empieza donde las personas buscan repetidamente en una base relativamente limpia.
- Define el éxito. Fija calidad, riesgo, latencia, adopción y resultado económico.
- Audita los datos. Detecta duplicados, versiones antiguas, falta de metadatos, archivos ilegibles y problemas de permisos.
- Construye un baseline estrecho. Prueba chunking y retrieval simples antes de incorporar agentes.
- Crea un conjunto de evaluación. Los expertos deben indicar fuentes esperadas y respuestas aceptables.
- Añade salvaguardas. Implementa filtros, citas, abstención, logs y derivación.
- Pilota con usuarios reales. Clasifica los fallos en lugar de mirar solo una puntuación de satisfacción.
- Mejora el cuello de botella. Ajusta parsing, chunks, búsqueda, reranking, prompt o modelo según la evidencia.
- Amplía las fuentes gradualmente. Cada repositorio añade formatos, permisos y propietarios.
- Asigna la operación. Alguien debe mantener conectores, vigencia, evaluaciones, incidentes y costes.
Liorant suele plantear un primer sistema operativo en cuatro a seis semanas cuando el estado de los datos y el alcance de integración lo permiten. El objetivo no debería ser «un chatbot para toda la empresa», sino un asistente gobernado que resuelva un trabajo valioso y medible.
Dónde suele concentrarse el esfuerzo de implementar RAG
Distribución ilustrativa, no un benchmark universal. La calidad de datos y las integraciones suelen dominar la entrega.
Seguridad, GDPR y Reglamento Europeo de IA
Los controles deben cubrir todo el ciclo de retrieval
RAG puede mejorar el control porque mantiene el conocimiento en una capa externa gobernada. Esa ventaja solo existe si los permisos y la seguridad de retrieval se implementan correctamente.
Siete salvaguardas
- Minimizar la ingesta. No indexar datos personales o confidenciales sin necesidad y base jurídica.
- Aplicar permisos antes de recuperar. Los filtros deben impedir que el documento llegue al modelo.
- Separar clientes y dominios. Utilizar namespaces, colecciones o límites de metadatos.
- Cifrar y proteger conexiones. Cubrir datos en tránsito y en reposo.
- Registrar procedencia. Guardar fuente, versión, fragmentos y política de respuesta cuando corresponda.
- Definir retención y borrado. Extender caducidad y supresión a índices y copias derivadas.
- Probar fugas y fidelidad. Incluir preguntas no autorizadas y ataques en las evaluaciones.
Implicaciones del GDPR
Un embedding puede seguir relacionado con datos personales. Convertir texto en números no elimina automáticamente las obligaciones del GDPR.
La empresa necesita limitación de finalidad, minimización, retención, seguridad, procesos para derechos, evaluación de proveedores y salvaguardas para transferencias internacionales cuando sean aplicables.
Los permisos deben comprobarse durante el retrieval. Eliminar datos sensibles después de que el modelo los haya procesado llega demasiado tarde.
Implicaciones del Reglamento Europeo de IA
El Reglamento utiliza un enfoque basado en riesgo. Muchos asistentes internos no se clasificarán como sistemas de alto riesgo, pero la clasificación depende del uso y no de la etiqueta «RAG».
La Comisión Europea incluye entre las áreas de alto riesgo determinados usos en empleo, crédito, educación, infraestructuras, justicia y biometría. También destaca calidad de datos, logging, documentación, supervisión humana, robustez, ciberseguridad y precisión (Comisión Europea).
A fecha de 22 de junio de 2026, el calendario publicado por la Comisión refleja el acuerdo político del 7 de mayo de 2026: las reglas para determinados ámbitos de alto riesgo están previstas para el 2 de diciembre de 2027 y los sistemas integrados en productos regulados para el 2 de agosto de 2028.
Las organizaciones deben confirmar el estado jurídico definitivo y las guías sectoriales antes de publicar o desplegar, ya que el marco de implementación sigue activo.
RAG puede facilitar la atribución de fuentes, el versionado, los permisos, los logs y la revisión humana. No convierte por sí solo una aplicación en conforme.
Agentic RAG, GraphRAG y RAG multimodal
Los nuevos patrones amplían retrieval en tres direcciones
Planifica, elige fuentes, busca varias veces, llama herramientas, revisa resultados y verifica.
Representa entidades y conexiones para seguir rutas multi-hop y detectar patrones globales.
Recupera imágenes de página, tablas, gráficos, diagramas, audio y vídeo además de texto.
Agentic RAG
Agentic RAG permite que un sistema planifique búsquedas, seleccione fuentes, divida preguntas, utilice herramientas, inspeccione resultados y repita el proceso.
Ayuda en investigaciones y operaciones con varios pasos, pero amplía la superficie de riesgo. Cada herramienta, bucle y decisión añade estados que deben probarse. Conviene utilizar retrieval agentic cuando una secuencia fija no complete una tarea valiosa.
GraphRAG
GraphRAG crea o utiliza un grafo de entidades y relaciones para responder preguntas que la recuperación plana resuelve mal. Puede identificar patrones globales y seguir conexiones de varios pasos.
Microsoft Research ha publicado mejoras de cobertura en determinadas preguntas globales frente a RAG vectorial. La construcción del grafo ha requerido históricamente más coste y trabajo de indexación, aunque nuevos métodos buscan reducirlo.
La empresa debe validar GraphRAG con sus propias preguntas relacionales antes de asumir esa complejidad.
RAG multimodal
RAG multimodal recupera información desde imágenes, páginas escaneadas, gráficos, audio o vídeo además de texto. Es importante cuando el significado depende de la disposición visual.
ColPali, presentado en ICLR 2025, mostró un enfoque que representa páginas como imágenes y conserva tablas, figuras y formato. Puede resultar útil para manuales técnicos, informes financieros, documentos médicos y archivos escaneados.
Preguntas frecuentes
Las preguntas cubren cuatro decisiones prácticas
¿Qué es RAG?
RAG es una arquitectura de IA que recupera información relevante de una fuente externa y se la entrega a un modelo de lenguaje antes de que responda. Permite utilizar datos actuales o privados y fundamentar la respuesta.
¿Cómo funciona RAG?
El sistema procesa y divide documentos, los indexa, recupera los fragmentos relevantes para una pregunta y los incluye en el prompt. El modelo genera la respuesta con citas y debería abstenerse cuando la evidencia no basta.
¿Para qué se utiliza RAG en empresas?
Se utiliza en soporte, búsqueda interna, asistentes de RR. HH., investigación legal, análisis financiero, propuestas comerciales, descubrimiento de producto y operaciones técnicas.
¿RAG es mejor que fine-tuning?
RAG suele ser mejor para datos privados, hechos cambiantes y atribución. El fine-tuning suele ser mejor para modificar comportamiento, tono o formato. Muchas aplicaciones combinan ambos.
¿RAG es mejor que una ventana de contexto largo?
RAG encaja mejor en bases grandes, cambiantes, con permisos y consultas frecuentes. El contexto largo puede ser más simple para un conjunto delimitado de documentos. También pueden combinarse.
¿RAG puede alucinar?
Sí. El retrieval puede recuperar evidencia equivocada y el modelo puede ignorar o interpretar mal la correcta. Las citas, la abstención, las evaluaciones y la derivación reducen el riesgo, pero no lo eliminan.
¿Cuánto cuesta implementar RAG?
Depende del estado de los datos, integraciones, seguridad, volumen, modelo y operación. Los embeddings pueden ser baratos; la preparación, ingeniería, evaluación e inferencia suelen pesar más.
¿RAG mantiene privados los datos?
Puede mantener el conocimiento en una capa gobernada y aplicar permisos durante cada consulta. La privacidad depende de arquitectura, proveedores, contratos, retención y controles; no viene garantizada por usar RAG.
¿Cómo se mide la calidad de RAG?
Hay que medir precisión y recall del retrieval, fidelidad, relevancia, corrección, seguridad, latencia y coste. Después se conectan con resolución, tiempo ahorrado, gravedad de errores y adopción.
¿RAG forma parte de los agentes de IA?
RAG proporciona conocimiento fiable a muchos agentes. Agentic RAG permite además planificar, elegir fuentes, recuperar varias veces y utilizar herramientas durante una tarea.
Nota de implementación FAQPage: El CMS debe generar marcado JSON-LD FAQPage únicamente a partir de las preguntas y respuestas visibles de esta sección. Validar el marcado con Schema.org y las herramientas de resultados enriquecidos antes de publicar. No incluir en el schema contenido que no aparezca en la página.
Cómo puede ayudar Liorant
La parte difícil no es dibujar la arquitectura. Es convertir información fragmentada en un sistema seguro, evaluado y suficientemente fiable para que las personas lo utilicen.
Liorant cubre el proceso completo: selección del caso, auditoría de datos, arquitectura, integraciones, retrieval, evaluación, despliegue y operación continua. Trabajamos sobre las herramientas que el cliente ya utiliza —Microsoft, Google, Anthropic o una arquitectura propia— y añadimos desarrollo a medida cuando el flujo lo requiere.
Medimos tareas resueltas, horas, euros, riesgo y adopción. No solo latencia.
Liorant lleva RAG de una pregunta valiosa a un sistema operado
Construye un sistema RAG alrededor de un trabajo valioso
Empieza con una sesión de descubrimiento gratuita de 30 minutos. Identificamos tu mayor oportunidad de automatización y te explicamos cómo puede ayudarte Liorant, sin presentaciones de venta.
Reserva tu sesión