Agentes de IA, copilotos y automatización

Frameworks de agentes de IA: comparativa de las mejores opciones para empresas

Guía pilar Actualizado en septiembre de 2026 16 minutos de lectura Por Ricardo Mendoza Castro

LangGraph, Microsoft Agent Framework, CrewAI, ADK y más: comparados por arquitectura, coste y encaje de gobernanza, además de un método estructurado para probar candidatos con tu propia carga de trabajo.

De un vistazo

El mercado empresarial de frameworks de agentes, resumido

Todo lo que sigue se desarrolla en la guía. Lee este bloque si tienes dos minutos y debes tomar una decisión este trimestre.

40%

de las aplicaciones empresariales podrían integrar agentes de IA para tareas específicas para fines de 2026, según el pronóstico de Gartner, frente a menos del 5% en 2025.

Gartner, agosto de 2025

>40%

de los proyectos de IA agéntica podrían cancelarse antes de finales de 2027 por sobrecostes, valor poco claro o lagunas de gobernanza.

Gartner, junio de 2025

57%

de los encuestados reportan validación humana de los resultados, sin supervisión de cada acción o decisión de los agentes.

KPMG primer trimestre de 2026, página 7

11

frameworks evaluados en orquestación, multiagente, herramientas, datos, observabilidad y portabilidad.

ESTA GUÍA

Decisión 1

Qué framework construye el agente

Grafos, estado, bucles de herramientas, handoffs multiagente y retrieval. La mayoría de las opciones incluye componentes open source; revisa por separado las condiciones del SDK, el runtime y el servicio.

Los once incluidos en la comparativa

LangGraph Microsoft Agent Framework OpenAI Agents SDK Claude Agent SDK Google ADK Strands Agents CrewAI LlamaIndex Haystack Pydantic AI Mastra

Decisión 2

¿Qué plataforma lo ejecuta en producción?

Identidad, políticas, observabilidad, controles de cumplimiento, alojamiento en runtime: gestionado, autohospedado o una combinación.

Plataformas gestionadas

Amazon Bedrock AgentCore Microsoft Foundry Agent Service Google Agent Runtime Anthropic Managed Agents

Runtimes locales, autohospedados y alternativos

Infraestructura local/soberana Contenedores propios, Kubernetes/GKE Cloud Run Ray Serve Temporal / DBOS / Prefect

Por dónde empezar, por prioridad dominante

Control máximo

LangGraph

Microsoft / .NET

MAF + Foundry

Nativo de AWS

Strands + AgentCore

Google Cloud / Gemini

ADK + Agent Runtime

Trabajo con muchos documentos

LlamaIndex / Haystack

Prototipo basado en roles

CrewAI

Neutralidad del proveedor

Haystack / Pydantic AI

TypeScript full-stack

Mastra

La mayor partida de coste, casi siempre

Tokens del modelo fundacional

Licencia del framework

Normalmente $0

En modo mantenimiento: no empieces aquí

AutoGen, Semantic Kernel

Gartner pronostica que el 40% de las aplicaciones empresariales integrarán agentes de IA para tareas específicas para fines de 2026, frente a menos del 5% en 2025 (Gartner, agosto de 2025). También pronostica que más del 40% de los proyectos de IA agéntica se cancelarán para fines de 2027 debido a costes crecientes, valor comercial poco claro o controles de riesgo inadecuados (Gartner, junio de 2025). Estos pronósticos resaltan tanto el riesgo de oportunidad como el de ejecución. La selección del framework, los controles operativos y un caso de negocio claro merecen atención antes de la implementación.

La elección de un framework de agente de IA empresarial implica dos decisiones relacionadas: cómo crear la lógica del agente y cómo alojarla, protegerla y observarla. AWS, Microsoft y Google ofrecen servicios gestionados que admiten frameworks de terceros. Los equipos también pueden proporcionar su propio runtime y controles. Esta guía compara once opciones y sugiere una forma de probar a los candidatos con tu carga de trabajo antes de dedicar tiempo a ingeniería.

Qué significa realmente "framework de agentes de IA"

El "framework de agente" se utiliza como un todo para al menos cinco cosas diferentes, y compararlas en el mismo eje produce malas decisiones. Una pila de agentes empresariales normalmente abarca cinco capas.

CAPA 1

SDK de agentes / tool calling

El bucle que permite a un modelo invocar una función, leer el resultado y decidir el siguiente paso.

OpenAI Agents SDK Claude Agent SDK Hilos

CAPA 2

Frameworks de orquestación

Grafos, routing, checkpoints y coordinación multiagente para trabajo estable y de larga duración.

LangGraph Microsoft Agent Framework CrewAI

CAPA 3

Frameworks de datos y contexto

Conectan agentes con retrieval, documentos y bases de conocimiento.

LlamaIndex Haystack

CAPA 4

Infraestructura de serving/runtime

La capa de cómputo que sostiene todo lo anterior: infraestructura, no un framework de agentes.

Ray Serve Contenedores / GKE / Ejecución en la nube

CAPA 5

Plataformas gestionadas

Identidad, políticas, observabilidad y controles de cumplimiento alrededor de agentes construidos en cualquiera de las capas anteriores.

Amazon Bedrock AgentCore Microsoft Foundry Agent Service Google Agent Runtime
Las cinco capas de una pila de agentes empresariales. Comparar herramientas de diferentes capas en el mismo eje es la fuente más común de malas decisiones framework.

Empieza con el diseño más simple que cubra las necesidades de la carga de trabajo. Añade agentes, orquestación y autonomía cuando la evaluación demuestre que mejoran el resultado lo suficiente como para justificar el coste y la complejidad adicionales. Un único agente con unas pocas herramientas puede bastar para un proceso bien acotado.

Los frameworks líderes, comparados

Esta guía compara once frameworks utilizando una evaluación editorial de Liorant de 1 a 5 de las características documentadas. Estos puntajes son juicios de preselección, no mediciones de desempeño ni clasificaciones validadas de forma independiente. Las versiones, la configuración y las integraciones afectan las capacidades. Interpretación amplia: 1 = apoyo limitado; 2 = trabajo de integración sustancial; 3 = soporte utilizable con compensaciones; 4 = amplio apoyo; 5 = un énfasis particular dentro de esta comparación. Los rangos indican evaluaciones dependientes de la integración; las cifras de adopción no determinan las puntuaciones.

Framework Orq. / estado Multiagente Herramientas RAG / datos Observabilidad Portabilidad Mejor para
LangGraph 5 5 5 4 5 5 Agentes complejos, controlables y auditables de larga duración
Microsoft Agent Framework 5 5 5 3 5 4 Empresas Microsoft/Azure/.NET que necesitan API estables y gobernadas
OpenAI Agents SDK 3 4 5 3 5 2–3 Desarrollo rápido dentro del ecosistema OpenAI
Claude Agent SDK 3 3–4 5 3 3–4 2–3 Agentes autónomos centrados en Claude, coding y computer-use
Google ADK 4 5 5 4 4 4 Equipos GCP/Gemini que construyen sistemas multiagente a escala
Strands Agents 4 5 5 3 5 4 Agentes ligeros, model-driven y nativos de AWS
CrewAI 4 5 4 3 4 4 Prototipado multiagente basado en roles
LlamaIndex 4 4 4 5 4 5 Workflows empresariales intensivos en documentos y RAG
Haystack 4 3 4 5 4 5 Despliegues soberanos, regulados y centrados en retrieval
Pydantic AI 5* 4 4 3 5 5 Equipos Python con tipado fuerte que ya usan Temporal o DBOS
Mastra 4 4 4 3 4 4 Equipos TypeScript full-stack que despliegan agentes en producción

*La evaluación de orquestación de Pydantic AI supone un backend de durabilidad externo como Temporal, DBOS o Prefect. Esta integración puede respaldar la recuperación después de fallas; la puntuación no establece paridad de durabilidad con otros frameworks.

Huellas dactilares de capacidad

Evaluaciones editoriales en seis áreas de capacidad

ORQUESTACIÓN MULTIAGENTE HERRAMIENTAS RAG / DATOS OBSERVABILIDAD PORTABILIDAD 3 5

Lea las formas, no el área: una parte superior derecha ancha significa profundidad de orquestación y coordinación; un punto inferior bajo significa que la capa de datos es trabajo de otra persona.

Primero la orquestación

LangGraph

Microsoft Agent Framework

Google ADK

Strands Agents

CrewAI

Pydantic AI

SDK y datos primero

OpenAI Agents SDK

Claude Agent SDK

LlamaIndex

Haystack

Mastra

Las puntuaciones son una síntesis de 1 a 5 dentro de esta comparación, no una calidad absoluta. Anillo exterior = 5, anillo interior = 3.

LangGraph

Orquestación mediante grafos

LangGraph anunció la versión 1.0 el 22 de octubre de 2025, con el compromiso de no realizar cambios importantes hasta la 2.0 (anuncio de lanzamiento). Su modelo basado en grafos define nodos y aristas de flujo de control, con persistencia y checkpoints para los workflows que deben reanudarse después de interrupciones. En octubre de 2025, LangChain informó 90 millones de descargas mensuales combinadas para LangChain y LangGraph (anuncio de LangChain); las descargas no miden usuarios únicos ni implementaciones de producción. El mecanismo de interrupción/reanudación puede admitir la revisión humana. Considéralo para workflows complejos y con estado, mientras evalúas si tu tarea necesita un grafo explícito.

Microsoft Agent Framework (MAF)

Azure/.NET

Microsoft lanzó Agent Framework 1.0 para .NET y Python el 3 de abril de 2026 (anuncio de Microsoft). Combina ideas de AutoGen y Semantic Kernel, incluida la orquestación de múltiples agentes, workflows, gestión de estado y observabilidad. La compatibilidad con ambos lenguajes no implica una cobertura de funciones idéntica: consulta el SDK y las integraciones elegidos. Microsoft Foundry proporciona una opción de implementación gestionada con capacidades de identidad y gobernanza que los equipos deben configurar para su carga de trabajo.

OpenAI Agents SDK

Superficie mínima

El OpenAI Agents SDK admite agentes, handoffs, guardrails, sesiones, tracing y ejecución en sandbox. El historial de sesiones conversacionales y la memoria persistente del sandbox tienen diferentes propósitos (documentación del sandbox). El soporte para proveedores que no son OpenAI depende de las capacidades de integración y modelo (documentación del proveedor). Considéralo para agentes basados en herramientas y handoffs sin un grafo de workflow explícito.

Claude Agent SDK

Autonomía, nativa de MCP

El Claude Agent SDK expone capacidades desarrolladas para Claude Code para su uso en aplicaciones autónomas. Los equipos pueden ejecutarlo en la infraestructura que controlan; Anthropic también ofrece un servicio alojado para trabajos de larga duración (Arquitectura de agentes gestionados). El SDK admite MCP y la implementación en contenedores. Revisa las licencias por separado: El wrapper de Python usa términos MIT, mientras que el TypeScript SDK hace referencia a los términos comerciales de Anthropic con excepciones específicas de los componentes. Evalúa la portabilidad del modelo y el aislamiento del runtime para la implementación elegida.

Google Agent Development Kit (ADK)

Multilenguaje, GCP

Google ADK es compatible con Python, Go, TypeScript, Java y Kotlin, con madurez de las versiones y características que varían según el SDK. Python 2.0 alcanzó disponibilidad general el 19 de mayo de 2026 (documentación de Python 2.0). ADK proporciona capacidades de evaluación y composición de múltiples agentes; consulta la disponibilidad en el idioma elegido. La Agents CLI admite la implementación en Agent Runtime, Cloud Run y GKE, con configuración específica del objetivo. Las integraciones de modelos incluyen LiteLLM. Considera ADK para equipos que desarrollan dentro del ecosistema de Google Cloud.

Strands Agents

AWS, basado en modelos

Strands enfatiza un bucle de agente basado en modelos y también admite la orquestación mediante grafos deterministas y otros patrones de múltiples agentes (documentación de grafos de Strands). AWS informó más de 14 millones de descargas de SDK en febrero de 2026, sin identificarlo como una cifra mensual (anuncio de AWS). El harness de AgentCore proporciona una ruta gestionada basada en configuración y admite la exportación de código de Strands cuando se necesita una mayor personalización.

CrewAI

Crews basadas en roles

CrewAI organiza a los agentes en crews basadas en roles y ofrece una capa Flows para el control estructurado de procesos. En una entrevista con un inversor, el fundador João Moura informó aproximadamente 450 millones de agentes por mes (entrevista al fundador). Esta es una métrica informada por el proveedor, no un recuento auditado independientemente de los workflows completados. Considera CrewAI para procesos basados en roles, como investigación y revisión; prueba el esfuerzo de desarrollo y la fiabilidad frente a tu propia carga de trabajo.

LlamaIndex

Profundidad de retrieval

LlamaIndex se centra en conectar modelos de lenguaje con datos, con workflows basados en eventos y AgentWorkflow para coordinar agentes. KPMG describe el uso de LlamaIndex y LlamaCloud para acceder, seleccionar e ingerir datos para soluciones específicas de la industria (anuncio de KPMG). Considéralo para workflows con uso intensivo de documentos donde el retrieval y la preparación de datos son fundamentales para el resultado.

Haystack

Soberanía de datos

Haystack, mantenido por deepset, proporciona pipelines inspeccionables para retrieval y aplicaciones de agentes. Su documentación establece que el content tracing está deshabilitado de forma predeterminada para evitar el envío de entradas y salidas confidenciales a un backend de tracing. Esto no significa que toda la telemetría esté deshabilitada. Considera Haystack cuando el control del despliegue y el retrieval sean importantes; evalúa las obligaciones del GDPR y cualquier afirmación sobre certificaciones a nivel de servicio y organización.

Pydantic AI

Tipado fuerte y ejecución durable

Pydantic AI proviene del equipo detrás de la biblioteca de validación de Pydantic. La versión 2.0 se lanzó el 23 de junio de 2026 e introduce un enfoque de capacidades componibles (anuncio oficial). Los backends externos como Temporal, DBOS o Prefect pueden proporcionar una ejecución duradera. Considéralo para los equipos de Python que valoran las interfaces tipadas y ya operan un backend adecuado; valida el comportamiento de recuperación para la integración elegida.

Mastra

TypeScript-first

Mastra es el framework TypeScript-first creado por un cofundador de Gatsby y ex líderes de productos e ingeniería de Gatsby. Anunció una ronda seed de 13 millones de dólares en octubre de 2025 (anuncio de financiación). Mastra anuncia acceso a más de 1000 modelos y nombra a Replit, SoftBank, PayPal, Plaid y Marsh McLennan como usuarios (página del framework de Mastra). Su oferta empresarial autohospedada anuncia una tarifa anual fija; otros planes tienen términos diferentes (precios). Considéralo para los equipos de TypeScript que crean agentes junto con las aplicaciones existentes.

Documentación oficial de cada framework de esta comparativa

Framework vs. plataforma: dónde se ejecuta realmente el agente

El patrón más útil de entender en 2026 es que las tres principales plataformas en la nube desacoplaron deliberadamente "qué framework crea el agente" de "qué plataforma lo ejecuta". Cada uno de ellos aloja agentes creados en frameworks que ellos no escribieron.

AWS

Amazon Bedrock AgentCore

Disponible con carácter general desde el 13 de octubre de 2025 · Independiente del framework y del modelo

Agentes de alojamiento integrados

LangGraph Hilos CrewAI LlamaIndex Google ADK OpenAI Agents SDK

AWS enumera tasas de consumo activo de microVM de 0,0895 dólares estadounidenses por hora de vCPU y 0,00945 dólares estadounidenses por hora de GB. Estas tarifas no describen todas las opciones de runtime ni la factura completa; el uso del modelo y los servicios adicionales conllevan cargos separados. Comprueba la región y opción aplicables (Precios de AWS, revisado el 7 de septiembre de 2026).

Microsoft Azure

Microsoft Foundry Agent Service

Identidad por agente basada en Intra · Aprobaciones HITL

Agentes de alojamiento integrados

CrewAI LangGraph LlamaIndex Microsoft Agent Framework

La integración langchain-azure-ai admite el uso de Foundry Memory con LangChain y LangGraph (guía de integración de Microsoft). La conexión a la memoria alojada no establece la portabilidad de exportación. Valida los requisitos de identidad, flujos de aprobación, seguimiento y migración para la implementación seleccionada.

Google Cloud

Google Agent Runtime

Agent Runtime es parte de la plataforma más amplia de agentes empresariales Gemini

Agentes de alojamiento integrados

Google ADK LangChain LangGraph LlamaIndex (nivel SDK) CrewAI (plantillas)

La actualización de precios publicada por Google en diciembre de 2025 enumera USD 0,0864 por vCPU-hora y USD 0,0090 por GB-hora, con cargos adicionales por sesión y memoria (actualización de precios publicada). Verifica las tarifas regionales actuales y las opciones de runtime antes de realizar el presupuesto. El anuncio de la plataforma de Google explica la plataforma más amplia y su componente Agent Runtime.

La elección del framework y la elección de la plataforma son ahora decisiones separadas.

Los servicios gestionados admiten una variedad de frameworks de terceros, pero la profundidad de la integración difiere. Valida el soporte de alojamiento, la persistencia, los controles de seguridad y los precios para la combinación exacta de framework/servicio. El autohospedaje sigue siendo una opción cuando tu equipo puede operar la infraestructura y los controles necesarios.

Muchos frameworks tienen componentes gratuitos de open source. Los costes de producción también incluyen inferencia, ingeniería y operaciones, infraestructura, herramientas, retrieval, observabilidad y revisión humana. Su importancia relativa varía según la carga de trabajo y el modelo de implementación.

Qué ha pasado con AutoGen y Semantic Kernel

El repositorio de AutoGen lo identifica explícitamente como en modo de mantenimiento. Microsoft identifica Agent Framework como el sucesor de Semantic Kernel preparado para producción y proporciona orientación sobre migración. Estas declaraciones no establecen políticas de apoyo idénticas para los dos proyectos más antiguos.

Para un nuevo proyecto de agente del ecosistema de Microsoft, empieza la evaluación con MAF. Las implementaciones existentes de AutoGen y Semantic Kernel necesitan una decisión de migración basada en los requisitos de soporte, las dependencias y el valor comercial. Para una tarea que una función convencional puede realizar de forma fiable, eso puede ser suficiente.

Nuevo proyecto de ecosistema de Microsoft

Empieza la evaluación con Microsoft Agent Framework.

Sistema AutoGen existente

Revisa el soporte de mantenimiento y planifica la migración cuando los requisitos lo justifiquen.

Sistema de Semantic Kernel existente

Revisa la guía del sucesor de Microsoft y evalúa el esfuerzo de migración para los sistemas existentes.

Cómo elegir: un marco de decisión por prioridad de negocio

No existe un "mejor" framework universal: sólo el que mejor se adapta a una determinada prioridad dominante. Usa esta tabla como una lista inicial, no como una respuesta final.

Tu prioridad dominante Empieza aquí Alternativa razonable Evitar como única opción
Máximo control sobre workflows complejos y con estadoLangGraphMAF, Pydantic AI + TemporalFunction calling en solitario
Entorno Microsoft/Azure/.NETMicrosoft Agent Framework + Microsoft FoundryLangGraph sobre FoundryAutoGen para un proyecto nuevo
Entorno AWSStrands Agents + Bedrock AgentCoreLangGraph en AgentCoreTratar AgentCore como si fuera un framework
Entorno Google Cloud/GeminiGoogle ADK + Agent RuntimeLangGraphConstruir toda la capa operacional desde cero
Desarrollo rápido sobre modelos OpenAIOpenAI Agents SDKLangGraphUn grafo complejo sin necesidad real de ramificación
Autonomía centrada en ClaudeClaude Agent SDKLangGraph + ClaudeTool use aislado para workflows durables largos
Neutralidad de proveedor por encima de todoLangGraph, Haystack o Pydantic AILlamaIndexUn SDK muy acoplado a un único proveedor de modelo
Trabajo de conocimiento intensivo en documentosLlamaIndex o HaystackLangChainUn framework multiagente sin una capa de datos real
Equipos multiagente basados en rolesCrewAIMAF, LangGraph, ADKAñadir agentes solo por arquitectura
Python con tipado fuerte y backend de durabilidad existentePydantic AILangGraph + PydanticUn toolkit dinámico sin schemas
TypeScript full-stackMastraADK TypeScriptForzar a un equipo TypeScript a cambiar de lenguaje

El movimiento más defendible para una decisión real es más limitado que esta tabla: seleccione dos o tres candidatos que se ajusten a tu prioridad y nube, luego ejecute una carga de trabajo idéntica en cada uno como prueba de concepto antes de comprometerse. La siguiente sección paso a paso explica exactamente cómo estructurar esa prueba de concepto.

Seguridad, gobernanza y el Reglamento de IA de la UE

La gobernanza es un criterio importante de selección empresarial. En el AI Quarterly Pulse de KPMG del primer trimestre de 2026, el 57% de los encuestados informó la validación humana de los resultados sin supervisar cada acción o decisión de los agentes. El informe también encontró que el 91% de los líderes encuestados identificaron la seguridad de los datos, la privacidad y los riesgos como el principal factor que influirá en la estrategia de IA durante los próximos seis meses (KPMG primer trimestre de 2026, página 7). Determina si tu uso previsto se encuentra dentro de las categorías de alto riesgo del Reglamento de IA antes de establecer las obligaciones aplicables.

ARTÍCULOS 12, 19 Y 26

Artículo 12 requiere capacidades de registro automático para sistemas de IA de alto riesgo. Artículo 19 y Artículo 26 generalmente requieren que los proveedores e implementadores mantengan los registros bajo su control durante al menos seis meses, sujeto a la ley aplicable.

ARTÍCULO 14

Artículo 14 requiere una supervisión humana eficaz de los sistemas de alto riesgo, incluida la capacidad de interpretar los resultados e intervenir de manera adecuada.

ARTÍCULO 50

Los deberes de transparencia cubren interacciones específicas de IA y contenido generado o manipulado, generalmente a partir del 2 de agosto de 2026. Se aplica una transición limitada al 2 de diciembre de 2026 a los deberes de marcado del Artículo 50(2) para calificar los sistemas existentes (Preguntas frecuentes de la Comisión).

El calendario de implementación actual de la Comisión Europea sitúa las obligaciones de alto riesgo del Anexo III al 2 de diciembre de 2027 y las obligaciones de alto riesgo relacionadas con productos al 2 de agosto de 2028 tras los cambios de AI Omnibus. Asigna tus obligaciones a la categoría de sistema aplicable y mantenga un calendario de cumplimiento junto con los controles técnicos.

Las capacidades de registro, rastreo y revisión humana pueden respaldar un diseño de cumplimiento. Compara esas características entre tus frameworks y servicios preseleccionados; después valida el sistema completo y los procedimientos operativos. El Reglamento no prescribe ni respalda un framework particular.

Un segundo punto es igualmente importante para los compradores europeos que evalúan las afirmaciones de los proveedores: un framework open source que se ejecuta en infraestructura propia no tiene una postura de cumplimiento automática propia. GDPR es una obligación sobre cómo se procesan los datos; SOC 2 es una certificación sobre los controles de una organización; tampoco es una propiedad que un paquete de Python pueda atribuirse en tu nombre. La cadena que realmente necesita evaluación es más larga de lo que admiten la mayoría de las conversaciones con los proveedores.

Arquitectura

La cadena de cumplimiento que realmente debes evaluar

Nueve saltos, en orden, desde la persona que activa el agente hasta la persona que lo aprueba. Para cada uno, la pregunta es la misma: ¿qué datos llegan aquí, quién los opera y cuánto tiempo se conservan?

Saltos 1-2 · dentro de tu perímetro Tus controles, tus registros, tu responsabilidad
01
Usuario Lleva: la solicitud

Verifica quién está autorizado a activar el agente, qué se les dice al respecto y qué se les permite ver.

02
Framework del agente Lleva: avisos, estado, llamadas a herramientas

Un paquete open source no tiene una postura de cumplimiento propia. Verifica qué registra de forma predeterminada, dónde se escriben los checkpoints y quién puede leerlos.

Saltos 3 a 8 · los datos salen de su perímetro Cada uno es una evaluación de proveedor separada.
03
API modelo Lleva: indicaciones y contexto completo

Verifica la región de procesamiento, la ventana de retención, la exclusión voluntaria de la capacitación y los propios subprocesadores del proveedor.

04
Observabilidad Lleva: indicaciones y resultados, retenidos

Un posible punto ciego de privacidad. Las trazas a menudo contienen la conversación completa. Verifica si el content tracing está activado de forma predeterminada, dónde se almacenan las trazas y durante cuánto tiempo.

05
Base de datos vectorial Lleva: incrustaciones y texto fuente.

Verifica el cifrado en reposo, la región de alojamiento y si una solicitud de eliminación realmente elimina los fragmentos indexados.

06
Servidores MCP Lleva: entradas y resultados de herramientas.

Verifica quién opera cada servidor, el alcance de las credenciales que posee y a qué puede llegar.

07
Herramientas SaaS conectadas Lleva: registros comerciales y acciones.

El salto donde el agente cambia algo en el mundo real. Verificar el acuerdo de procesamiento de datos, el alcance de las acciones permitidas y la pista de auditoría de cada una.

08
Base de datos Lleva: resultados y registros de registro.

Verifica la residencia, la política de retención y que exista un camino funcional para el borrado.

Salto 9 · supervisión humana Artículo 14 de el Reglamento de IA de la UE
09
Revisor humano Lleva: la decisión de aprobación.

Verifica que una persona designada pueda comprender, monitorear e interrumpir el sistema, y que tu decisión se escriba en el registro junto con la acción que aprobó.

El cumplimiento de un eslabón no cubre el resto de la cadena.

GDPR es una obligación sobre cómo se procesan los datos; SOC 2 es una certificación sobre los controles de una organización. Tampoco es una propiedad que un paquete Python pueda atribuirse en tu nombre: la evaluación es por salto y es toda la cadena la que debe mantenerse.

Nueve saltos desde el desencadenante hasta la aprobación. Los saltos 3 a 8 necesitan cada uno su propia evaluación del proveedor para los términos de residencia, retención y procesamiento.

Realice comprobaciones de autorización deterministas entre una acción propuesta y la ejecución de la herramienta. La identidad establece quién actúa; los permisos de acceso definen los recursos y acciones permitidos; Las reglas comerciales imponen condiciones como límites de pago. La identidad basada en Entra por sí sola no implementa una regla de monto de transacción. Haga cumplir esa regla en un servicio de políticas, puerta de enlace, aplicación o herramienta antes de realizar la acción.

Arquitectura

Dónde pertenece realmente la autorización

PASO 1

Modelo propone una acción.

"Emitir un pago de proveedor de 7.200 €."

PASO 2: DETERMINISTA

Capa de política/autorización

permitir si pago <= 5.000 €
Y rol == gestionador_financiero

Código e identidad, no un aviso del sistema. El modelo no puede discutirlo.

Aprobado

La herramienta se ejecuta

Marcado

Aprobación humana

La herramienta se ejecuta
Cada decisión, tanto las ramas como la identidad que la autorizó, pertenecen al registro; eso es lo que significa en la práctica la reconstrucción del artículo 12 de el Reglamento de IA de la UE.

Lo que cuestan realmente los agentes: los verdaderos motores de coste

La mayoría de las opciones ofrecen componentes open source, pero la licencia es sólo una parte de la evaluación de costes. La elección del framework puede afectar el esfuerzo de ingeniería, los gastos generales de orquestación y las necesidades operativas. Mide el coste total de un caso completo para la arquitectura prevista.

Composición de costes · ejemplo hipotético

Una asignación de costes de agente de producción ilustrativa

Participación del coste mensual total en este ejemplo. Cada barra utiliza la misma escala de 0 a 100%.

  1. Fichas / inferencia 38%
  2. Ingeniería y operaciones 18%
  3. Calcular 9%
  4. Llamadas a herramientas y API 8%
  5. Recuperación 7%
  6. Tiempo humano en el circuito 7%
  7. Observabilidad 5%
  8. Estado 4%
  9. Seguridad 4%
Solo un ejemplo hipotético: estos porcentajes no son datos observados de la industria ni un benchmark. La asignación real depende de la carga de trabajo, el volumen de uso, la arquitectura, la elección del modelo y los costes laborales.

Básculas con autonomía

Tokens (pasos × agentes × reintentos × longitud del contexto), llamadas a herramientas y API, horas de revisión humana.

Escalas con datos

Incorporaciones, almacenamiento de vectores, reclasificación, ingesta continua, checkpoints e historial de sesiones.

Suelo fijo

Computación, almacenamiento de seguimiento y ejecuciones de evaluación, VPC y enlaces privados, puertas de enlace de políticas, gestión de secretos, tiempo de ingeniería.

Los pasos adicionales del agente, los reintentos, las críticas y los contextos más amplios pueden aumentar los costes de inferencia, herramientas y revisión. El aumento depende de la carga de trabajo. Mídelo junto con la tasa de éxito y la latencia en lugar de asumir una relación fija entre autonomía y coste.

La economía unitaria que importa

Coste por caso resuelto correctamente, coste por workflow completado y coste de una acción incorrecta, no coste por token ni coste por llamada de modelo.

Paso a paso: cómo ejecutar un PoC de evaluación de frameworks

Prueba una preselección acotada con tu propia carga de trabajo. Define el alcance del PoC en torno a una tarea representativa, los datos disponibles y los controles necesarios para evaluarla de forma segura; el tiempo necesario dependerá de ese alcance.

  1. 01

    Nombra tu prioridad dominante

    Elige una de la tabla de decisión anterior: control, alineación con la nube, velocidad de prototipado, profundidad de RAG, tipado fuerte o entrega nativa en TypeScript. Intentar optimizarlas todas a la vez suele llevar a los equipos a sobrediseñar un caso de uso sencillo.

  2. 02

    Preselecciona dos o tres frameworks, no más

    Basa la preselección en esa prioridad y en tus compromisos actuales de nube y ecosistema. Una lista más amplia multiplica el coste del PoC sin mejorar sustancialmente la decisión.

  3. 03

    Define una única carga de trabajo idéntica

    Debe reflejar un caso real de producción, no una demo. Incluye al menos una tarea multietapa, una llamada a una herramienta con efectos secundarios y un escenario que deba activar una revisión humana.

  4. 04

    Instrumenta el PoC para medir

    Para cada candidato, registra:

    Tasa de éxito de extremo a extremo Latencia p50/p95 Número de llamadas al modelo y a herramientas Coste por caso completado Comportamiento ante fallos y recuperación Seguridad de la autorización de herramientas Facilidad de tracing Complejidad del despliegue Horas de ingeniería invertidas
  5. 05

    Ejecuta la misma carga de trabajo con cada candidato

    Mismo modelo, mismas herramientas, mismos casos de prueba y mismas condiciones.

  6. 06

    Puntúa cada candidato frente a la prioridad definida

    No frente a una checklist genérica. Un framework que «gana» sobre el papel pero rinde peor en tu prioridad real es la elección equivocada.

  7. 07

    Valida la postura de seguridad y cumplimiento de la combinación ganadora

    Incluye la cadena completa, desde el framework y la API del modelo hasta la observabilidad y cualquier herramienta SaaS conectada, antes de comprometerte con producción, no después.

Esta guía no se basa en un benchmark de rendimiento entre frameworks universalmente aceptado. Los estudios públicos comparan workflows particulares, pero sus hallazgos dependen de tareas, modelos y configuraciones. Una evaluación controlada de tu propia carga de trabajo proporciona evidencia para tu decisión.

Preguntas frecuentes

¿Es LangGraph mejor que CrewAI para uso empresarial?

Ninguno es universalmente mejor. LangGraph ofrece control explícito mediante grafos y checkpoints para workflows con estado. CrewAI ofrece equipos de agentes basados en roles y Flows estructurados. Considera LangGraph para flujos de control complejos y CrewAI para procesos basados en roles; después compara la fiabilidad y el esfuerzo de ingeniería con la misma carga de trabajo.

¿Siguen siendo viables AutoGen y Semantic Kernel para proyectos nuevos?

AutoGen está en modo mantenimiento. Microsoft identifica Microsoft Agent Framework como el sucesor de Semantic Kernel preparado para producción y ofrece guías de migración. Empieza la evaluación de proyectos nuevos del ecosistema Microsoft con MAF; evalúa cada sistema existente según sus necesidades de soporte y el esfuerzo de migración.

¿Elegir un framework open source significa que no necesito una plataforma gestionada?

Una plataforma gestionada es opcional. El framework define la lógica del agente; también debes aportar el hosting del runtime, la identidad, la observabilidad y los controles operativos. Puedes usar un servicio gestionado, operar esas capacidades por tu cuenta o combinar ambos enfoques.

¿Cómo afecta el Reglamento de IA de la UE al framework de agentes que debemos elegir?

El Reglamento no prescribe un framework. Las capacidades de registro y supervisión humana pueden ayudar a cumplir las obligaciones de los sistemas de alto riesgo: el artículo 12 aborda las capacidades de registro y el artículo 14, la supervisión humana. El cumplimiento depende del sistema completo, el uso previsto, los controles y los procedimientos operativos.

¿Cuál es el mayor coste oculto de un proyecto de IA agéntica?

No existe un único coste principal universal. La inferencia, la ingeniería y las operaciones, la infraestructura, las llamadas a herramientas, el retrieval, la observabilidad y la revisión humana pueden ser partidas relevantes. Mide el coste por caso completado correctamente, incluidos los reintentos y la revisión, con tu propia carga de trabajo.

Siguiente paso

Traza un camino claro hacia un agente funcional en producción

La oferta de Activación Rápida de IA de Liorant busca poner un agente funcional en producción en un plazo de 4 a 6 semanas para un alcance acordado. El plan de entrega depende del acceso a los datos, las integraciones, los requisitos de seguridad y los ciclos de revisión. Confirmamos contigo el alcance y los plazos antes de implementar, utilizando el framework y la plataforma que mejor encajen con tus herramientas actuales.

Empieza con una sesión gratuita de descubrimiento de IA de 30 minutos. Identificamos tu oportunidad de automatización de mayor valor y te explicamos exactamente cómo puede ayudarte Liorant, sin presentaciones comerciales.