Saltar al artículo

IA generativa, LLM, RAG y conocimiento

RAG para empresas: qué es, cómo funciona y por qué importa

Artículo pilarActualizado en 202625 min de lecturaPor Ricardo Mendoza Castro

La mayoría de las empresas no necesita un modelo de IA que parezca saberlo todo. Necesita un sistema que encuentre la información autorizada, la utilice correctamente y enseñe de dónde sale cada respuesta.

RAG, siglas de retrieval-augmented generation o generación aumentada por recuperación, conecta un modelo de lenguaje con conocimiento externo: políticas internas, documentación de producto, contratos, incidencias, investigaciones, expedientes o datos de un CRM. Cuando una persona hace una pregunta, el sistema recupera evidencia relevante y se la entrega al modelo antes de que responda.

Este mecanismo permite generar respuestas más actuales, específicas y trazables que las producidas únicamente con el conocimiento aprendido por el modelo durante su entrenamiento.

RAG ya se ha consolidado como uno de los patrones principales de la IA empresarial. Menlo Ventures registró un aumento de adopción del 31% en 2023 al 51% en 2024. En el mismo estudio, solo el 9% de los modelos en producción utilizaba fine-tuning (Menlo Ventures, 2024).

La razón es sencilla: una empresa puede actualizar una base documental con mucha más facilidad que reentrenar un modelo cada vez que cambia una política, una tarifa o un catálogo.

RAG en una frase: RAG recupera información relevante de una fuente externa y se la entrega a un modelo de IA para que genere una respuesta fundamentada, actual y potencialmente acompañada de citas.

Adopción

RAG se convirtió en un patrón habitual de IA empresarial

Encuesta a 600 responsables de TI de empresas estadounidenses. Fuente: Menlo Ventures, State of Generative AI in the Enterprise 2024.

Qué es RAG

RAG es una arquitectura de IA que combina dos capacidades. La primera busca información en una fuente externa. La segunda utiliza la información recuperada para redactar una respuesta.

Patrick Lewis y su equipo introdujeron el término en el artículo científico de 2020 Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Los investigadores combinaron la «memoria paramétrica» de un modelo —el conocimiento almacenado en sus pesos— con una «memoria no paramétrica» formada por un índice documental externo (Lewis et al., 2020).

La distinción tiene consecuencias prácticas. Un LLM estándar no puede consultar automáticamente los contratos privados de una empresa, la última actualización de una política, el historial de un cliente ni el catálogo publicado ayer. Incluso cuando conoce bien un tema, puede generar una afirmación razonable que no se apoya en ninguna fuente verificable.

RAG crea una vía controlada para que la aplicación consulte información empresarial en el momento de la petición.

No elimina todos los errores del modelo. Lo que hace es convertir un problema difuso —«esperemos que la IA conozca la respuesta»— en tres preguntas que un equipo puede medir:

  1. ¿El sistema recuperó la evidencia correcta?
  2. ¿El modelo utilizó esa evidencia con fidelidad?
  3. ¿Debía responder, abstenerse o derivar el caso a una persona?
Concepto

RAG añade memoria empresarial gobernada al modelo

El modelo aporta lenguaje y razonamiento. Retrieval aporta evidencia actual y controlada por permisos.

RAG y un LLM estándar

Un modelo de lenguaje sin retrieval responde con el conocimiento adquirido durante su entrenamiento, las instrucciones del sistema y el contenido incluido directamente en el prompt. Esta combinación funciona bien para redactar, resumir un texto breve, clasificar contenido o generar ideas.

RAG empieza a aportar valor cuando la respuesta depende de información privada, extensa, cambiante, restringida por permisos o sensible a la fuente. Por ejemplo:

  • «¿Qué permite la política vigente de viajes para visitas a clientes?»
  • «¿Qué cláusula de este contrato regula los créditos de servicio?»
  • «¿El producto admite la configuración solicitada por este cliente?»
  • «Resume las incidencias asociadas a este activo durante los últimos 90 días».
  • «¿Qué afirmaciones aprobadas puede utilizar marketing para este producto sanitario?»

El modelo aporta lenguaje y capacidad de síntesis. La capa de retrieval aporta la evidencia.

Por qué RAG importa a una empresa

RAG responde a cuatro necesidades habituales.

Actualización. El equipo puede actualizar documentos o registros sin reentrenar el modelo. Una política nueva puede entrar en el índice y quedar disponible para las siguientes consultas.

Trazabilidad. La aplicación puede acompañar la respuesta con el título, el enlace, el fragmento, la fecha o la versión del documento utilizado. Una cita no garantiza que la interpretación sea correcta, pero permite revisar la evidencia.

Control de acceso. El sistema puede filtrar la información por usuario, departamento, cliente, país, producto o nivel de confidencialidad antes de enviarla al modelo.

Control operativo. La empresa puede medir por separado la calidad de la recuperación, la fidelidad de la respuesta, la latencia, el coste y las derivaciones.

Por eso RAG aparece en asistentes internos, copilotos de soporte, herramientas jurídicas y buscadores empresariales. Convierte el conocimiento de la organización en un servicio consultable tanto por personas como por otros sistemas.

Cómo funciona RAG, paso a paso

Un sistema RAG de producción combina dos procesos: preparar el conocimiento y contestar preguntas.

1. Conectar y procesar las fuentes

El sistema recopila contenido autorizado desde SharePoint, Google Drive, Confluence, una base de conocimiento, un CRM, un ERP, un data warehouse o un repositorio de contratos.

El parsing extrae texto y estructura utilizables. Esta fase suele causar más problemas de los que muestra una demo. Los PDF escaneados requieren OCR. Las tablas deben conservar la relación entre filas y columnas. Los encabezados, notas, páginas duplicadas y versiones obsoletas necesitan reglas específicas.

2. Dividir el contenido en fragmentos

El pipeline separa cada documento en unidades recuperables o chunks. Un fragmento debe contener contexto suficiente para responder, sin incorporar tanto texto irrelevante que diluya la evidencia útil.

El tamaño fijo puede servir como punto de partida para texto limpio. Sin embargo, la estructura documental suele ofrecer mejores límites. En una política conviene respetar secciones. En un contrato, cláusulas y anexos. En un manual, procedimientos, advertencias y títulos.

Un equipo puede empezar con fragmentos de varios cientos de tokens y un solapamiento limitado. Después debe probar alternativas con preguntas reales. No existe un tamaño mágico que funcione para todos los documentos.

3. Añadir metadatos y permisos

Cada fragmento necesita información adicional que el buscador pueda utilizar. Un esquema útil puede incluir:

source_id, title, section, language, document_type, tenant_id, acl_tags, created_at, updated_at y version.

Los metadatos permiten responder a peticiones como «utiliza únicamente la política vigente en español para la plantilla de Colombia» con más control que una búsqueda semántica sobre todo el repositorio.

4. Crear un índice de búsqueda

Muchos sistemas transforman los fragmentos en embeddings: representaciones numéricas que sitúan textos con significados parecidos en zonas cercanas de un espacio vectorial.

Una base vectorial o un motor de búsqueda con soporte para vectores guarda esas representaciones. El índice también puede conservar una representación tradicional basada en palabras. La búsqueda léxica sigue siendo esencial para códigos de producto, artículos legales, nombres, acrónimos y frases exactas.

5. Procesar la pregunta

Cuando llega una consulta, la aplicación identifica al usuario, aplica sus permisos y puede reformular la pregunta para mejorar la búsqueda. También puede extraer filtros como jurisdicción, fecha, cliente o producto.

6. Recuperar y ordenar la evidencia

El sistema busca los fragmentos más probables. La búsqueda densa encuentra similitud semántica. La búsqueda sparse, como BM25, localiza coincidencias léxicas. La búsqueda híbrida combina ambas.

Después, un reranker puede evaluar con más precisión los candidatos y seleccionar la evidencia que entrará en el prompt. Esta etapa suele ayudar cuando el corpus contiene muchas secciones parecidas.

7. Generar una respuesta controlada

La aplicación envía la evidencia seleccionada al LLM junto con instrucciones. Un prompt empresarial debería pedir al modelo que:

  • responda a partir de las fuentes entregadas;
  • cite la evidencia de las afirmaciones relevantes;
  • diferencie hechos e interpretación;
  • indique cuándo la información es insuficiente o contradictoria;
  • respete un formato definido; y
  • derive los casos sensibles cuando corresponda.

8. Registrar y evaluar

El sistema registra la consulta, los fragmentos recuperados, las versiones de las fuentes, la respuesta, la latencia y, cuando la política lo permite, la valoración del usuario.

Estos registros permiten distinguir un fallo de búsqueda de un error de síntesis, un documento obsoleto, una fuga de permisos o un coste innecesario.

La lección operativa: Una respuesta RAG es el resultado de un pipeline, no de una única llamada al modelo. Cambiar de LLM no corrige un documento ausente, un parser defectuoso, metadatos pobres ni un filtro de acceso incorrecto.

Arquitectura

Cómo funciona un pipeline RAG de producción

Indexación offline
Fuentes empresariales
Parsing
Chunks + metadatos
Índices léxico + vectorial
Respuesta online
Pregunta + identidad
Filtros de acceso
Retrieval + reranking
LLM + respuesta citada
Los permisos se aplican antes del retrieval. El sistema puede responder con evidencia, abstenerse o derivar el caso.

Arquitecturas y métodos de retrieval

Los primeros prototipos RAG seguían una secuencia simple: recuperar y generar. Los sistemas maduros añaden controles antes y después de la búsqueda porque las colecciones empresariales contienen duplicados, versiones, permisos y formatos difíciles.

RAG naive, avanzado y modular

Naive RAG genera embeddings, recupera los fragmentos más cercanos y los coloca en el prompt. Sirve para validar una idea, pero puede devolver evidencia ruidosa, repetida o incompleta.

Advanced RAG mejora la indexación, el procesamiento de consultas, los filtros, la búsqueda híbrida, el reranking y la selección de contexto. Representa una base razonable para muchas aplicaciones en producción.

Modular RAG convierte la recuperación en un conjunto de componentes configurables. Un router puede elegir entre documentos legales, CRM, datos de producto o búsqueda web. El sistema puede dividir una pregunta, lanzar varias consultas, contrastar fuentes y verificar el borrador.

Madurez de arquitectura

RAG añade controles cuando el caso de negocio se vuelve más exigente

BaseNaive RAGEmbeddings, chunks cercanos y generación. Sirve para validar si retrieval aporta valor.
ProducciónAdvanced RAGBúsqueda híbrida, filtros, reranking, metadatos, citas y evaluación.
Flujos complejosModular RAGRouting de fuentes, descomposición de preguntas, contraste y verificación.
Cada componente adicional debe responder a un fallo medido del retrieval o del flujo.

Retrieval sparse, denso e híbrido

El retrieval sparse busca términos. BM25 sigue siendo una referencia frecuente. Funciona bien cuando importa la coincidencia exacta: un artículo normativo, un SKU, el nombre de un cliente, un código de error o una cláusula.

El retrieval denso compara embeddings. Capta paráfrasis y preguntas naturales. Una persona puede preguntar «¿Puedo acumular vacaciones para el año siguiente?» aunque el documento utilice «trasladar el saldo anual».

El retrieval híbrido combina ambos métodos. Suele ofrecer el punto de partida más seguro para contenido empresarial heterogéneo, donde las preguntas mezclan conceptos con identificadores exactos.

Métodos de retrieval

Sparse y dense retrieval detectan señales distintas

Pregunta de ejemplo: «¿Puedo trasladar las vacaciones no utilizadas según la política HR-42?»
Términos exactos

Sparse / BM25

Prioriza coincidencias como HR-42, «vacaciones no utilizadas» y redacción literal.

Mejor señal: identificadores, nombres, referencias legales y códigos.
Significado

Dense / embeddings

Conecta la pregunta con frases como «el saldo anual puede trasladarse».

Mejor señal: paráfrasis, conceptos y similitud multilingüe.
Evidencia combinada

Retrieval híbrido

Usa el identificador y el significado semántico; después fusiona o reordena resultados.

Punto de partida práctico para contenido empresarial heterogéneo.
Ejemplo esquemático. El enfoque híbrido reduce el riesgo de perder un identificador exacto o una paráfrasis.

Reranking

Una búsqueda inicial puede recuperar 20 o 50 candidatos de forma rápida. El reranker compara cada candidato con la pregunta con mayor precisión y devuelve un conjunto más pequeño al modelo.

Esta etapa añade latencia y coste. Conviene comprobar si mejora las preguntas importantes. Suele resultar valiosa en documentación jurídica, soporte técnico y repositorios con muchas secciones similares.

Reranking

El retrieval rápido encuentra candidatos; el reranker selecciona la evidencia

Embudo esquemático, no una proporción fija. Ajusta tamaños según calidad, latencia y coste.

Embeddings, índices y bases vectoriales

El modelo de embeddings determina qué significados considera cercanos el sistema. Las empresas multilingües deben evaluar cada idioma operativo, incluidas las consultas en un idioma cuya respuesta se encuentra en otro.

El índice establece el equilibrio entre exactitud, memoria y velocidad. HNSW es una estructura habitual para búsqueda aproximada con baja latencia. La búsqueda plana puede servir en colecciones pequeñas o cuando se necesita una comparación exhaustiva. PostgreSQL con pgvector puede bastar si la organización ya utiliza PostgreSQL y no necesita otra plataforma.

La marca de la base vectorial importa menos que el diseño de datos, los filtros, la evaluación y el encaje operativo. La infraestructura existente, la seguridad, el conocimiento del equipo y las integraciones deben guiar la decisión.

Selección del índice

Elige el índice según escala y operación, no por reconocimiento de marca

Búsqueda plana

Compara la consulta con cada vector. Es simple y exacta, pero el trabajo crece con la colección.

Corpus pequeñoComparación exacta

PostgreSQL + pgvector

Mantiene vectores junto a los datos existentes cuando simplificar la operación pesa más que añadir otra plataforma.

Postgres existenteMenos sistemas
Guía conceptual. Prueba el corpus, filtros, idiomas, actualizaciones y concurrencia reales.

Casos de uso de RAG en empresa

RAG crea más valor cuando las personas dedican tiempo recurrente a buscar, interpretar y comunicar conocimiento autorizado.

Mapa de casos de uso

Los mejores casos combinan preguntas repetidas con conocimiento gobernado

Atención al clienteResolución, reglas de producto, procedimientos y asistencia al agente.
Conocimiento internoRR. HH., onboarding, compras, TI y servicios internos.
Legal y complianceCláusulas, autoridades, obligaciones y trazabilidad.
Finanzas e investigaciónInformes, políticas y análisis interno controlado.
Ventas y propuestasAfirmaciones aprobadas, casos, seguridad y reglas comerciales.
Operaciones técnicasRunbooks, incidentes, arquitectura y mantenimiento.
RAG aporta menos cuando el usuario ya puede incluir todo el contexto necesario en un prompt corto.

Atención al cliente

Un asistente puede recuperar instrucciones, procedimientos, reglas de cuenta e incidencias conocidas. Puede responder al cliente o sugerir una respuesta al agente.

La métrica crítica no es cuántas conversaciones toca la IA, sino cuántos problemas resuelve correctamente sin provocar un contacto posterior. Algunos proveedores publican cifras elevadas de ticket deflection. Gartner ha advertido que la desviación aparente puede superar ampliamente la resolución real en autoservicio.

La empresa debe medir recontacto, calidad de las derivaciones, satisfacción y gravedad de las respuestas incorrectas.

Conocimiento interno y recursos humanos

Los empleados pierden tiempo buscando entre wikis, carpetas compartidas, chats y portales. Un asistente con permisos puede contestar preguntas sobre onboarding, gastos, vacaciones, compras, TI o servicios internos y enlazar la política aplicable.

Los casos sensibles siguen necesitando responsabilidad humana. La IA puede explicar una política y dirigir una excepción, pero no debería decidir silenciosamente los derechos de una persona.

Legal y compliance

Los equipos jurídicos pueden recuperar cláusulas, comparar contratos, resumir fuentes, identificar obligaciones y rastrear cada afirmación hasta su origen.

Los metadatos son decisivos. La jurisdicción, la fecha de vigencia, la versión y el tipo de acuerdo pueden cambiar por completo la respuesta.

RAG facilita el trabajo legal porque expone evidencia. No convierte un modelo generalista en asesor jurídico ni elimina la revisión profesional.

Finanzas e investigación regulada

RAG puede ayudar a consultar documentación de producto, investigación interna, políticas, informes y comentarios aprobados. Morgan Stanley ha descrito públicamente herramientas de IA que ayudan a sus asesores financieros a acceder y sintetizar conocimiento interno.

En un entorno regulado, la aplicación necesita fuentes autorizadas, trazas, límites claros y reglas para información temporal o asesoramiento personalizado.

Ventas y propuestas

Un copiloto comercial puede recuperar afirmaciones aprobadas, casos de éxito, respuestas de seguridad, condiciones y contenido de propuestas. Después prepara un borrador manteniendo el vínculo con cada fuente.

Para evitar compromisos erróneos, el corpus debe separar el material vigente de propuestas antiguas y excepciones concedidas a un cliente concreto.

Producto y operaciones técnicas

Los equipos pueden consultar runbooks, incidentes, decisiones de arquitectura, catálogos de servicio y procedimientos de mantenimiento. RAG también puede proporcionar conocimiento fiable a un agente que ejecuta un flujo técnico.

Un ejemplo documentado de mejora

Un estudio de ortopedia publicado en 2024 evaluó modelos frente a guías clínicas. La incorporación de RAG mejoró la precisión media de todos los modelos evaluados en un 39,7%. La mejor configuración, que combinaba RAG y un agente, alcanzó un 95% de precisión.

El resultado no se puede extrapolar automáticamente a cualquier sector. Sí demuestra que el acceso a una fuente fiable puede cambiar de forma material el rendimiento en una tarea delimitada (Pasternak et al., Arthroscopy, 2024).

Medición

Desviar una consulta no significa resolverla

Mide recontacto, calidad de la derivación, satisfacción y gravedad del error; no solo deflection.
Benchmark direccional de Gartner resumido en el dossier; las cifras no son universales.

RAG frente a otras opciones de IA

RAG no es la respuesta automática a cualquier problema de conocimiento. La arquitectura adecuada depende del tamaño del corpus, su frecuencia de cambio, la necesidad de citas, los permisos, la latencia aceptable y el comportamiento esperado.

Prompting estándar

Conviene cuando
Basta el conocimiento general o un contexto breve.
Fortaleza
La implementación más simple y rápida.
Límite
No crea una capa escalable de conocimiento privado.

Contexto largo

Conviene cuando
Un corpus estable y acotado cabe en la ventana de contexto.
Fortaleza
Conserva contexto amplio con menos componentes.
Límite
Coste, latencia y atención empeoran al crecer.

Fine-tuning

Conviene cuando
El modelo necesita comportamiento, estilo o estructura constante.
Fortaleza
Cambia cómo ejecuta la tarea.
Límite
No encaja bien con hechos cambiantes y citas.

Búsqueda empresarial

Conviene cuando
El usuario necesita documentos y enlaces originales.
Fortaleza
Resultados predecibles y controles maduros.
Límite
Deja la interpretación al usuario.

Grafo / GraphRAG

Conviene cuando
Las relaciones y preguntas multi-hop dominan la tarea.
Fortaleza
Conexiones explícitas y análisis relacional.
Límite
Mayor esfuerzo de modelado, indexación y mantenimiento.

RAG y prompting estándar

Utiliza prompting cuando el usuario puede aportar toda la información necesaria o cuando la tarea depende de conocimiento general. Añadir retrieval a una herramienta de reescritura o a un clasificador simple crea infraestructura innecesaria.

Elige RAG cuando el modelo necesita consultar un corpus que no cabe razonablemente en cada petición.

RAG y ventanas de contexto largo

Los modelos con contexto largo pueden procesar documentos extensos directamente. Este enfoque puede ser más simple para un corpus estable, delimitado y consultado de forma ocasional. También conserva el contexto global que el chunking podría fragmentar.

RAG gana sentido cuando el corpus crece, cambia, exige permisos o recibe consultas repetidas. El sistema recupera una pequeña cantidad de evidencia en lugar de procesar toda la colección cada vez.

Ambos enfoques pueden combinarse. RAG selecciona los documentos adecuados y un modelo de contexto largo analiza el conjunto elegido.

RAG y fine-tuning

RAG aporta conocimiento. El fine-tuning modifica comportamiento.

Si el modelo conoce los hechos pero responde con el formato, tono o clasificación equivocados, el fine-tuning puede ayudar. Si le faltan hechos privados o actuales, RAG suele encajar mejor.

Una aplicación madura puede combinar un modelo ajustado para ejecutar una tarea de forma consistente con RAG para consultar evidencia vigente.

RAG y búsqueda empresarial

Un buscador devuelve resultados para que una persona los revise. RAG añade síntesis y puede convertir varios fragmentos en una respuesta directa.

La búsqueda tradicional sigue siendo preferible cuando el usuario debe inspeccionar los documentos originales, cuando el recall importa más que una respuesta breve o cuando la síntesis introduce un riesgo inaceptable. Una interfaz RAG responsable siempre debería permitir abrir las fuentes.

RAG, grafos de conocimiento y GraphRAG

Un grafo representa entidades y relaciones de forma explícita. Puede responder mejor a preguntas como «¿Qué proveedores participan en los productos afectados por esta norma?».

RAG vectorial recupera pasajes con significado parecido. GraphRAG añade análisis de grafos para preguntas que requieren patrones globales o conexiones de varios pasos. Puede mejorar investigaciones complejas, pero introduce extracción de entidades, construcción del grafo, agrupación y nuevas evaluaciones.

La opción sensata es comenzar con RAG estándar o híbrido. Solo conviene añadir grafos cuando el razonamiento conectado forma parte central del caso y las pruebas muestran que el retrieval simple falla.

Proceso práctico para elegir

  1. Define la tarea. Determina si el problema es conocimiento, comportamiento, búsqueda documental o relaciones.
  2. Mide el corpus. Registra tamaño, idiomas, ritmo de actualización, formatos y permisos.
  3. Prueba la opción más simple. Evalúa prompting o contexto largo con preguntas representativas.
  4. Añade retrieval cuando necesites seleccionar evidencia. Empieza con un corpus pequeño y evaluado.
  5. Utiliza fine-tuning solo para una carencia de comportamiento demostrada.
  6. Añade grafos solo para fallos demostrados de razonamiento relacional.
  7. Compara calidad, riesgo, latencia y coste operativo antes de escalar.
Marco de decisión

Elige la arquitectura más sencilla que resuelva la tarea

NecesidadPromptContexto largoRAGFine-tuningBúsquedaGraphRAG
Conocimiento cambianteDébilCondicionalFuerteDébilFuerteCondicional
CitasDébilCondicionalFuerteDébilFuerteFuerte
PermisosDébilDébilFuerteDébilFuerteCondicional
Control de comportamientoCondicionalCondicionalCondicionalFuerteDébilCondicional
Razonamiento multi-hopDébilCondicionalCondicionalDébilDébilFuerte
SimplicidadFuerteFuerteCondicionalDébilFuerteDébil
Estas opciones pueden combinarse. Empieza con prompting o contexto largo acotado y añade retrieval cuando seleccionar evidencia resulte necesario.

Cómo evaluar un sistema RAG

Evaluación

Un scorecard útil mide tres capas

Calidad del retrievalPrecisión, recall, vigencia, duplicados y permisos.
Calidad de respuestaFidelidad, relevancia, corrección, citas y abstención.
Rendimiento empresarialFinalización, tiempo ahorrado, errores, adopción, latencia y coste.
Las barras ilustran las capas de medición, no benchmarks. Las tres deben cumplir sus objetivos.

Una demo fluida puede ocultar una recuperación débil. La evaluación debe utilizar preguntas similares a las que llegarán en producción.

Calidad del retrieval

La precisión de contexto mide si los fragmentos recuperados son relevantes. Una precisión baja llena el prompt de ruido.

El recall de contexto mide si el sistema encontró evidencia suficiente. Un recall bajo genera respuestas incompletas incluso cuando el modelo sigue bien las instrucciones.

También deben medirse el respeto de permisos, la vigencia de las fuentes y la duplicación.

Calidad de la generación

La faithfulness o fidelidad pregunta si la respuesta está respaldada por el contexto.

La relevancia mide si la respuesta atiende la intención real.

La corrección compara el resultado con una referencia fiable cuando existe.

RAGAS formalizó varias de estas métricas de evaluación sin referencia. Haystack, TruLens, LangSmith y las herramientas de evals de los proveedores cubren distintas partes del proceso (RAGAS, EACL 2024).

Métricas empresariales y operativas

La calidad técnica no basta. Una implantación necesita medir:

  • tareas completadas o problemas resueltos;
  • recontacto y derivación;
  • tiempo de revisión ahorrado;
  • errores ponderados por gravedad;
  • adopción y satisfacción;
  • latencia p50 y p95;
  • coste por tarea completada; y
  • tiempo necesario para actualizar la base.

El conjunto de evaluación debe incluir preguntas sencillas, peticiones ambiguas, casos sin información, documentos contradictorios, intentos de acceder a contenido no autorizado y ataques contra las instrucciones.

Costes, herramientas y hoja de ruta

El coste de RAG incluye preparación de datos, infraestructura de búsqueda, inferencia, integraciones, evaluación, seguridad y operación. Los embeddings suelen representar una parte pequeña.

El dossier recoge precios de referencia de $0,02 por millón de tokens para text-embedding-3-small y $0,13 para text-embedding-3-large. Estos precios pueden cambiar y deben verificarse antes de elaborar un presupuesto.

La conclusión útil no es el céntimo exacto: limpiar documentos, conectar sistemas y mantener controles suele costar más que vectorizar el texto.

Opciones tecnológicas

Entre los frameworks habituales se encuentran LangChain, LlamaIndex, Haystack y Semantic Kernel. Los servicios gestionados incluyen Azure AI Search y Azure OpenAI, Amazon Bedrock Knowledge Bases, Google Vertex AI y herramientas de retrieval ofrecidas por los proveedores de modelos.

Las opciones de búsqueda y vectores incluyen Pinecone, Weaviate, Qdrant, Milvus, Elasticsearch, Azure AI Search y PostgreSQL con pgvector.

La empresa debería elegir según:

  • su nube y plataforma de datos;
  • conectores necesarios;
  • residencia y seguridad;
  • calidad multilingüe;
  • filtros y permisos;
  • observabilidad y evaluación;
  • escala y latencia; y
  • equipo responsable de operar el sistema.

El mercado crece, pero las previsiones no son una medición exacta

Las estimaciones recogidas en el dossier apuntan en la misma dirección y difieren mucho en magnitud. MarketsandMarkets sitúa el mercado RAG en 1.940 millones de dólares en 2025 y proyecta 9.860 millones para 2030. Grand View Research parte de 1.200 millones en 2024 y proyecta 11.000 millones en 2030.

Estas previsiones proceden de firmas de análisis con metodologías propias. Sirven para mostrar inversión y expansión, no para establecer un único tamaño «correcto» del mercado.

Perspectiva de mercado

Las previsiones apuntan a un fuerte crecimiento del mercado RAG

$0B$4B$8B$12B20242030
MarketsandMarkets: $1,94B (2025) → $9,86B (2030)Grand View Research: $1,2B (2024) → $11,0B (2030)
Las previsiones usan metodologías y años base distintos. Indican impulso, no una única medida definitiva.

Hoja de ruta de implantación

  1. Selecciona un conjunto de preguntas valioso. Empieza donde las personas buscan repetidamente en una base relativamente limpia.
  2. Define el éxito. Fija calidad, riesgo, latencia, adopción y resultado económico.
  3. Audita los datos. Detecta duplicados, versiones antiguas, falta de metadatos, archivos ilegibles y problemas de permisos.
  4. Construye un baseline estrecho. Prueba chunking y retrieval simples antes de incorporar agentes.
  5. Crea un conjunto de evaluación. Los expertos deben indicar fuentes esperadas y respuestas aceptables.
  6. Añade salvaguardas. Implementa filtros, citas, abstención, logs y derivación.
  7. Pilota con usuarios reales. Clasifica los fallos en lugar de mirar solo una puntuación de satisfacción.
  8. Mejora el cuello de botella. Ajusta parsing, chunks, búsqueda, reranking, prompt o modelo según la evidencia.
  9. Amplía las fuentes gradualmente. Cada repositorio añade formatos, permisos y propietarios.
  10. Asigna la operación. Alguien debe mantener conectores, vigencia, evaluaciones, incidentes y costes.

Liorant suele plantear un primer sistema operativo en cuatro a seis semanas cuando el estado de los datos y el alcance de integración lo permiten. El objetivo no debería ser «un chatbot para toda la empresa», sino un asistente gobernado que resuelva un trabajo valioso y medible.

Estructura de costes

Dónde suele concentrarse el esfuerzo de implementar RAG

Distribución ilustrativa, no un benchmark universal. La calidad de datos y las integraciones suelen dominar la entrega.

El precio de embeddings suele representar una parte pequeña del coste total. Verifica las tarifas vigentes antes de presupuestar.

Seguridad, GDPR y Reglamento Europeo de IA

Gobernanza

Los controles deben cubrir todo el ciclo de retrieval

01Antes de ingerirFinalidad, minimización, base jurídica, clasificación y propiedad.
02Antes de recuperarIdentidad, tenants, permisos, jurisdicción y filtros documentales.
03Durante la generaciónPrompts controlados, citas, rechazo y derivación humana.
04Después de responderLogs, retención, borrado, monitorización e incidentes.
Filtrar después de que el modelo procese el contenido sensible es demasiado tarde.

RAG puede mejorar el control porque mantiene el conocimiento en una capa externa gobernada. Esa ventaja solo existe si los permisos y la seguridad de retrieval se implementan correctamente.

Siete salvaguardas

  1. Minimizar la ingesta. No indexar datos personales o confidenciales sin necesidad y base jurídica.
  2. Aplicar permisos antes de recuperar. Los filtros deben impedir que el documento llegue al modelo.
  3. Separar clientes y dominios. Utilizar namespaces, colecciones o límites de metadatos.
  4. Cifrar y proteger conexiones. Cubrir datos en tránsito y en reposo.
  5. Registrar procedencia. Guardar fuente, versión, fragmentos y política de respuesta cuando corresponda.
  6. Definir retención y borrado. Extender caducidad y supresión a índices y copias derivadas.
  7. Probar fugas y fidelidad. Incluir preguntas no autorizadas y ataques en las evaluaciones.

Implicaciones del GDPR

Un embedding puede seguir relacionado con datos personales. Convertir texto en números no elimina automáticamente las obligaciones del GDPR.

La empresa necesita limitación de finalidad, minimización, retención, seguridad, procesos para derechos, evaluación de proveedores y salvaguardas para transferencias internacionales cuando sean aplicables.

Los permisos deben comprobarse durante el retrieval. Eliminar datos sensibles después de que el modelo los haya procesado llega demasiado tarde.

Implicaciones del Reglamento Europeo de IA

El Reglamento utiliza un enfoque basado en riesgo. Muchos asistentes internos no se clasificarán como sistemas de alto riesgo, pero la clasificación depende del uso y no de la etiqueta «RAG».

La Comisión Europea incluye entre las áreas de alto riesgo determinados usos en empleo, crédito, educación, infraestructuras, justicia y biometría. También destaca calidad de datos, logging, documentación, supervisión humana, robustez, ciberseguridad y precisión (Comisión Europea).

A fecha de 22 de junio de 2026, el calendario publicado por la Comisión refleja el acuerdo político del 7 de mayo de 2026: las reglas para determinados ámbitos de alto riesgo están previstas para el 2 de diciembre de 2027 y los sistemas integrados en productos regulados para el 2 de agosto de 2028.

Las organizaciones deben confirmar el estado jurídico definitivo y las guías sectoriales antes de publicar o desplegar, ya que el marco de implementación sigue activo.

RAG puede facilitar la atribución de fuentes, el versionado, los permisos, los logs y la revisión humana. No convierte por sí solo una aplicación en conforme.

Agentic RAG, GraphRAG y RAG multimodal

Patrones emergentes

Los nuevos patrones amplían retrieval en tres direcciones

Núcleo RAG estándarRecuperar pasajes → entregar evidencia al modelo → generar una respuesta fundamentada
Cada rama amplía la misma base en una dirección: acciones, relaciones o medios.

Agentic RAG

Agentic RAG permite que un sistema planifique búsquedas, seleccione fuentes, divida preguntas, utilice herramientas, inspeccione resultados y repita el proceso.

Ayuda en investigaciones y operaciones con varios pasos, pero amplía la superficie de riesgo. Cada herramienta, bucle y decisión añade estados que deben probarse. Conviene utilizar retrieval agentic cuando una secuencia fija no complete una tarea valiosa.

GraphRAG

GraphRAG crea o utiliza un grafo de entidades y relaciones para responder preguntas que la recuperación plana resuelve mal. Puede identificar patrones globales y seguir conexiones de varios pasos.

Microsoft Research ha publicado mejoras de cobertura en determinadas preguntas globales frente a RAG vectorial. La construcción del grafo ha requerido históricamente más coste y trabajo de indexación, aunque nuevos métodos buscan reducirlo.

La empresa debe validar GraphRAG con sus propias preguntas relacionales antes de asumir esa complejidad.

RAG multimodal

RAG multimodal recupera información desde imágenes, páginas escaneadas, gráficos, audio o vídeo además de texto. Es importante cuando el significado depende de la disposición visual.

ColPali, presentado en ICLR 2025, mostró un enfoque que representa páginas como imágenes y conserva tablas, figuras y formato. Puede resultar útil para manuales técnicos, informes financieros, documentos médicos y archivos escaneados.

Preguntas frecuentes

Guía de lectura

Las preguntas cubren cuatro decisiones prácticas

3Cómo funcionaDefinición, pipeline y relación con agentes.
3Cuándo usarloCasos, fine-tuning y contexto largo.
2Riesgo y privacidadAlucinaciones y protección de datos.
2OperaciónCoste y medición de calidad.
Las respuestas son breves para que lectores y buscadores puedan extraerlas de forma independiente.

¿Qué es RAG?

RAG es una arquitectura de IA que recupera información relevante de una fuente externa y se la entrega a un modelo de lenguaje antes de que responda. Permite utilizar datos actuales o privados y fundamentar la respuesta.

¿Cómo funciona RAG?

El sistema procesa y divide documentos, los indexa, recupera los fragmentos relevantes para una pregunta y los incluye en el prompt. El modelo genera la respuesta con citas y debería abstenerse cuando la evidencia no basta.

¿Para qué se utiliza RAG en empresas?

Se utiliza en soporte, búsqueda interna, asistentes de RR. HH., investigación legal, análisis financiero, propuestas comerciales, descubrimiento de producto y operaciones técnicas.

¿RAG es mejor que fine-tuning?

RAG suele ser mejor para datos privados, hechos cambiantes y atribución. El fine-tuning suele ser mejor para modificar comportamiento, tono o formato. Muchas aplicaciones combinan ambos.

¿RAG es mejor que una ventana de contexto largo?

RAG encaja mejor en bases grandes, cambiantes, con permisos y consultas frecuentes. El contexto largo puede ser más simple para un conjunto delimitado de documentos. También pueden combinarse.

¿RAG puede alucinar?

Sí. El retrieval puede recuperar evidencia equivocada y el modelo puede ignorar o interpretar mal la correcta. Las citas, la abstención, las evaluaciones y la derivación reducen el riesgo, pero no lo eliminan.

¿Cuánto cuesta implementar RAG?

Depende del estado de los datos, integraciones, seguridad, volumen, modelo y operación. Los embeddings pueden ser baratos; la preparación, ingeniería, evaluación e inferencia suelen pesar más.

¿RAG mantiene privados los datos?

Puede mantener el conocimiento en una capa gobernada y aplicar permisos durante cada consulta. La privacidad depende de arquitectura, proveedores, contratos, retención y controles; no viene garantizada por usar RAG.

¿Cómo se mide la calidad de RAG?

Hay que medir precisión y recall del retrieval, fidelidad, relevancia, corrección, seguridad, latencia y coste. Después se conectan con resolución, tiempo ahorrado, gravedad de errores y adopción.

¿RAG forma parte de los agentes de IA?

RAG proporciona conocimiento fiable a muchos agentes. Agentic RAG permite además planificar, elegir fuentes, recuperar varias veces y utilizar herramientas durante una tarea.

Nota de implementación FAQPage: El CMS debe generar marcado JSON-LD FAQPage únicamente a partir de las preguntas y respuestas visibles de esta sección. Validar el marcado con Schema.org y las herramientas de resultados enriquecidos antes de publicar. No incluir en el schema contenido que no aparezca en la página.

Cómo puede ayudar Liorant

La parte difícil no es dibujar la arquitectura. Es convertir información fragmentada en un sistema seguro, evaluado y suficientemente fiable para que las personas lo utilicen.

Liorant cubre el proceso completo: selección del caso, auditoría de datos, arquitectura, integraciones, retrieval, evaluación, despliegue y operación continua. Trabajamos sobre las herramientas que el cliente ya utiliza —Microsoft, Google, Anthropic o una arquitectura propia— y añadimos desarrollo a medida cuando el flujo lo requiere.

Medimos tareas resueltas, horas, euros, riesgo y adopción. No solo latencia.

Modelo de entrega

Liorant lleva RAG de una pregunta valiosa a un sistema operado

1. SeleccionarDefinir flujo, valor, riesgo, usuarios y métricas.
2. ConstruirPreparar datos, integrar fuentes, diseñar retrieval y controles.
3. DemostrarEvaluar preguntas reales, pilotar y medir resultados.
4. OperarMantener fuentes, evaluaciones, incidentes, coste y expansión.
Un primer sistema enfocado puede llegar a usuarios en cuatro a seis semanas si los datos y las integraciones lo permiten.

Construye un sistema RAG alrededor de un trabajo valioso

Empieza con una sesión de descubrimiento gratuita de 30 minutos. Identificamos tu mayor oportunidad de automatización y te explicamos cómo puede ayudarte Liorant, sin presentaciones de venta.

Reserva tu sesión