Frameworks de agentes de IA: comparativa de las mejores opciones para empresas
Guía pilarActualizado en septiembre de 202616 minutos de lecturaPor Ricardo Mendoza Castro
LangGraph, Microsoft Agent Framework, CrewAI, ADK y más: comparados por arquitectura, coste y encaje de gobernanza, además de un método estructurado para probar candidatos con tu propia carga de trabajo.
De un vistazo
El mercado empresarial de frameworks de agentes, resumido
Todo lo que sigue se desarrolla en la guía. Lee este bloque si tienes dos minutos y debes tomar una decisión este trimestre.
40%
de las aplicaciones empresariales podrían integrar agentes de IA para tareas específicas para fines de 2026, según el pronóstico de Gartner, frente a menos del 5% en 2025.
frameworks evaluados en orquestación, multiagente, herramientas, datos, observabilidad y portabilidad.
ESTA GUÍA
Decisión 1
Qué framework construye el agente
Grafos, estado, bucles de herramientas, handoffs multiagente y retrieval. La mayoría de las opciones incluye componentes open source; revisa por separado las condiciones del SDK, el runtime y el servicio.
Gartner pronostica que el 40% de las aplicaciones empresariales integrarán agentes de IA para tareas específicas para fines de 2026, frente a menos del 5% en 2025 (Gartner, agosto de 2025). También pronostica que más del 40% de los proyectos de IA agéntica se cancelarán para fines de 2027 debido a costes crecientes, valor comercial poco claro o controles de riesgo inadecuados (Gartner, junio de 2025). Estos pronósticos resaltan tanto el riesgo de oportunidad como el de ejecución. La selección del framework, los controles operativos y un caso de negocio claro merecen atención antes de la implementación.
La elección de un framework de agente de IA empresarial implica dos decisiones relacionadas: cómo crear la lógica del agente y cómo alojarla, protegerla y observarla. AWS, Microsoft y Google ofrecen servicios gestionados que admiten frameworks de terceros. Los equipos también pueden proporcionar su propio runtime y controles. Esta guía compara once opciones y sugiere una forma de probar a los candidatos con tu carga de trabajo antes de dedicar tiempo a ingeniería.
Qué significa realmente "framework de agentes de IA"
El "framework de agente" se utiliza como un todo para al menos cinco cosas diferentes, y compararlas en el mismo eje produce malas decisiones. Una pila de agentes empresariales normalmente abarca cinco capas.
CAPA 1
SDK de agentes / tool calling
El bucle que permite a un modelo invocar una función, leer el resultado y decidir el siguiente paso.
OpenAI Agents SDKClaude Agent SDKHilos
CAPA 2
Frameworks de orquestación
Grafos, routing, checkpoints y coordinación multiagente para trabajo estable y de larga duración.
LangGraphMicrosoft Agent FrameworkCrewAI
CAPA 3
Frameworks de datos y contexto
Conectan agentes con retrieval, documentos y bases de conocimiento.
LlamaIndexHaystack
CAPA 4
Infraestructura de serving/runtime
La capa de cómputo que sostiene todo lo anterior: infraestructura, no un framework de agentes.
Ray ServeContenedores / GKE / Ejecución en la nube
CAPA 5
Plataformas gestionadas
Identidad, políticas, observabilidad y controles de cumplimiento alrededor de agentes construidos en cualquiera de las capas anteriores.
Las cinco capas de una pila de agentes empresariales. Comparar herramientas de diferentes capas en el mismo eje es la fuente más común de malas decisiones framework.
Empieza con el diseño más simple que cubra las necesidades de la carga de trabajo. Añade agentes, orquestación y autonomía cuando la evaluación demuestre que mejoran el resultado lo suficiente como para justificar el coste y la complejidad adicionales. Un único agente con unas pocas herramientas puede bastar para un proceso bien acotado.
Los frameworks líderes, comparados
Esta guía compara once frameworks utilizando una evaluación editorial de Liorant de 1 a 5 de las características documentadas. Estos puntajes son juicios de preselección, no mediciones de desempeño ni clasificaciones validadas de forma independiente. Las versiones, la configuración y las integraciones afectan las capacidades. Interpretación amplia: 1 = apoyo limitado; 2 = trabajo de integración sustancial; 3 = soporte utilizable con compensaciones; 4 = amplio apoyo; 5 = un énfasis particular dentro de esta comparación. Los rangos indican evaluaciones dependientes de la integración; las cifras de adopción no determinan las puntuaciones.
Framework
Orq. / estado
Multiagente
Herramientas
RAG / datos
Observabilidad
Portabilidad
Mejor para
LangGraph
5
5
5
4
5
5
Agentes complejos, controlables y auditables de larga duración
Microsoft Agent Framework
5
5
5
3
5
4
Empresas Microsoft/Azure/.NET que necesitan API estables y gobernadas
OpenAI Agents SDK
3
4
5
3
5
2–3
Desarrollo rápido dentro del ecosistema OpenAI
Claude Agent SDK
3
3–4
5
3
3–4
2–3
Agentes autónomos centrados en Claude, coding y computer-use
Google ADK
4
5
5
4
4
4
Equipos GCP/Gemini que construyen sistemas multiagente a escala
Strands Agents
4
5
5
3
5
4
Agentes ligeros, model-driven y nativos de AWS
CrewAI
4
5
4
3
4
4
Prototipado multiagente basado en roles
LlamaIndex
4
4
4
5
4
5
Workflows empresariales intensivos en documentos y RAG
Haystack
4
3
4
5
4
5
Despliegues soberanos, regulados y centrados en retrieval
Pydantic AI
5*
4
4
3
5
5
Equipos Python con tipado fuerte que ya usan Temporal o DBOS
Mastra
4
4
4
3
4
4
Equipos TypeScript full-stack que despliegan agentes en producción
*La evaluación de orquestación de Pydantic AI supone un backend de durabilidad externo como Temporal, DBOS o Prefect. Esta integración puede respaldar la recuperación después de fallas; la puntuación no establece paridad de durabilidad con otros frameworks.
Huellas dactilares de capacidad
Evaluaciones editoriales en seis áreas de capacidad
Lea las formas, no el área: una parte superior derecha ancha significa profundidad de orquestación y coordinación; un punto inferior bajo significa que la capa de datos es trabajo de otra persona.
Primero la orquestación
LangGraph
Microsoft Agent Framework
Google ADK
Strands Agents
CrewAI
Pydantic AI
SDK y datos primero
OpenAI Agents SDK
Claude Agent SDK
LlamaIndex
Haystack
Mastra
Las puntuaciones son una síntesis de 1 a 5 dentro de esta comparación, no una calidad absoluta. Anillo exterior = 5, anillo interior = 3.
LangGraph
Orquestación mediante grafos
LangGraph anunció la versión 1.0 el 22 de octubre de 2025, con el compromiso de no realizar cambios importantes hasta la 2.0 (anuncio de lanzamiento). Su modelo basado en grafos define nodos y aristas de flujo de control, con persistencia y checkpoints para los workflows que deben reanudarse después de interrupciones. En octubre de 2025, LangChain informó 90 millones de descargas mensuales combinadas para LangChain y LangGraph (anuncio de LangChain); las descargas no miden usuarios únicos ni implementaciones de producción. El mecanismo de interrupción/reanudación puede admitir la revisión humana. Considéralo para workflows complejos y con estado, mientras evalúas si tu tarea necesita un grafo explícito.
Microsoft Agent Framework (MAF)
Azure/.NET
Microsoft lanzó Agent Framework 1.0 para .NET y Python el 3 de abril de 2026 (anuncio de Microsoft). Combina ideas de AutoGen y Semantic Kernel, incluida la orquestación de múltiples agentes, workflows, gestión de estado y observabilidad. La compatibilidad con ambos lenguajes no implica una cobertura de funciones idéntica: consulta el SDK y las integraciones elegidos. Microsoft Foundry proporciona una opción de implementación gestionada con capacidades de identidad y gobernanza que los equipos deben configurar para su carga de trabajo.
OpenAI Agents SDK
Superficie mínima
El OpenAI Agents SDK admite agentes, handoffs, guardrails, sesiones, tracing y ejecución en sandbox. El historial de sesiones conversacionales y la memoria persistente del sandbox tienen diferentes propósitos (documentación del sandbox). El soporte para proveedores que no son OpenAI depende de las capacidades de integración y modelo (documentación del proveedor). Considéralo para agentes basados en herramientas y handoffs sin un grafo de workflow explícito.
Claude Agent SDK
Autonomía, nativa de MCP
El Claude Agent SDK expone capacidades desarrolladas para Claude Code para su uso en aplicaciones autónomas. Los equipos pueden ejecutarlo en la infraestructura que controlan; Anthropic también ofrece un servicio alojado para trabajos de larga duración (Arquitectura de agentes gestionados). El SDK admite MCP y la implementación en contenedores. Revisa las licencias por separado: El wrapper de Python usa términos MIT, mientras que el TypeScript SDK hace referencia a los términos comerciales de Anthropic con excepciones específicas de los componentes. Evalúa la portabilidad del modelo y el aislamiento del runtime para la implementación elegida.
Google Agent Development Kit (ADK)
Multilenguaje, GCP
Google ADK es compatible con Python, Go, TypeScript, Java y Kotlin, con madurez de las versiones y características que varían según el SDK. Python 2.0 alcanzó disponibilidad general el 19 de mayo de 2026 (documentación de Python 2.0). ADK proporciona capacidades de evaluación y composición de múltiples agentes; consulta la disponibilidad en el idioma elegido. La Agents CLI admite la implementación en Agent Runtime, Cloud Run y GKE, con configuración específica del objetivo. Las integraciones de modelos incluyen LiteLLM. Considera ADK para equipos que desarrollan dentro del ecosistema de Google Cloud.
Strands Agents
AWS, basado en modelos
Strands enfatiza un bucle de agente basado en modelos y también admite la orquestación mediante grafos deterministas y otros patrones de múltiples agentes (documentación de grafos de Strands). AWS informó más de 14 millones de descargas de SDK en febrero de 2026, sin identificarlo como una cifra mensual (anuncio de AWS). El harness de AgentCore proporciona una ruta gestionada basada en configuración y admite la exportación de código de Strands cuando se necesita una mayor personalización.
CrewAI
Crews basadas en roles
CrewAI organiza a los agentes en crews basadas en roles y ofrece una capa Flows para el control estructurado de procesos. En una entrevista con un inversor, el fundador João Moura informó aproximadamente 450 millones de agentes por mes (entrevista al fundador). Esta es una métrica informada por el proveedor, no un recuento auditado independientemente de los workflows completados. Considera CrewAI para procesos basados en roles, como investigación y revisión; prueba el esfuerzo de desarrollo y la fiabilidad frente a tu propia carga de trabajo.
LlamaIndex
Profundidad de retrieval
LlamaIndex se centra en conectar modelos de lenguaje con datos, con workflows basados en eventos y AgentWorkflow para coordinar agentes. KPMG describe el uso de LlamaIndex y LlamaCloud para acceder, seleccionar e ingerir datos para soluciones específicas de la industria (anuncio de KPMG). Considéralo para workflows con uso intensivo de documentos donde el retrieval y la preparación de datos son fundamentales para el resultado.
Haystack
Soberanía de datos
Haystack, mantenido por deepset, proporciona pipelines inspeccionables para retrieval y aplicaciones de agentes. Su documentación establece que el content tracing está deshabilitado de forma predeterminada para evitar el envío de entradas y salidas confidenciales a un backend de tracing. Esto no significa que toda la telemetría esté deshabilitada. Considera Haystack cuando el control del despliegue y el retrieval sean importantes; evalúa las obligaciones del GDPR y cualquier afirmación sobre certificaciones a nivel de servicio y organización.
Pydantic AI
Tipado fuerte y ejecución durable
Pydantic AI proviene del equipo detrás de la biblioteca de validación de Pydantic. La versión 2.0 se lanzó el 23 de junio de 2026 e introduce un enfoque de capacidades componibles (anuncio oficial). Los backends externos como Temporal, DBOS o Prefect pueden proporcionar una ejecución duradera. Considéralo para los equipos de Python que valoran las interfaces tipadas y ya operan un backend adecuado; valida el comportamiento de recuperación para la integración elegida.
Mastra
TypeScript-first
Mastra es el framework TypeScript-first creado por un cofundador de Gatsby y ex líderes de productos e ingeniería de Gatsby. Anunció una ronda seed de 13 millones de dólares en octubre de 2025 (anuncio de financiación). Mastra anuncia acceso a más de 1000 modelos y nombra a Replit, SoftBank, PayPal, Plaid y Marsh McLennan como usuarios (página del framework de Mastra). Su oferta empresarial autohospedada anuncia una tarifa anual fija; otros planes tienen términos diferentes (precios). Considéralo para los equipos de TypeScript que crean agentes junto con las aplicaciones existentes.
Documentación oficial de cada framework de esta comparativa
Framework vs. plataforma: dónde se ejecuta realmente el agente
El patrón más útil de entender en 2026 es que las tres principales plataformas en la nube desacoplaron deliberadamente "qué framework crea el agente" de "qué plataforma lo ejecuta". Cada uno de ellos aloja agentes creados en frameworks que ellos no escribieron.
AWS
Amazon Bedrock AgentCore
Disponible con carácter general desde el 13 de octubre de 2025 · Independiente del framework y del modelo
AWS enumera tasas de consumo activo de microVM de 0,0895 dólares estadounidenses por hora de vCPU y 0,00945 dólares estadounidenses por hora de GB. Estas tarifas no describen todas las opciones de runtime ni la factura completa; el uso del modelo y los servicios adicionales conllevan cargos separados. Comprueba la región y opción aplicables (Precios de AWS, revisado el 7 de septiembre de 2026).
Microsoft Azure
Microsoft Foundry Agent Service
Identidad por agente basada en Intra · Aprobaciones HITL
La integración langchain-azure-ai admite el uso de Foundry Memory con LangChain y LangGraph (guía de integración de Microsoft). La conexión a la memoria alojada no establece la portabilidad de exportación. Valida los requisitos de identidad, flujos de aprobación, seguimiento y migración para la implementación seleccionada.
Google Cloud
Google Agent Runtime
Agent Runtime es parte de la plataforma más amplia de agentes empresariales Gemini
Agentes de alojamiento integrados
Google ADKLangChainLangGraphLlamaIndex (nivel SDK)CrewAI (plantillas)
La actualización de precios publicada por Google en diciembre de 2025 enumera USD 0,0864 por vCPU-hora y USD 0,0090 por GB-hora, con cargos adicionales por sesión y memoria (actualización de precios publicada). Verifica las tarifas regionales actuales y las opciones de runtime antes de realizar el presupuesto. El anuncio de la plataforma de Google explica la plataforma más amplia y su componente Agent Runtime.
La elección del framework y la elección de la plataforma son ahora decisiones separadas.
Los servicios gestionados admiten una variedad de frameworks de terceros, pero la profundidad de la integración difiere. Valida el soporte de alojamiento, la persistencia, los controles de seguridad y los precios para la combinación exacta de framework/servicio. El autohospedaje sigue siendo una opción cuando tu equipo puede operar la infraestructura y los controles necesarios.
Muchos frameworks tienen componentes gratuitos de open source. Los costes de producción también incluyen inferencia, ingeniería y operaciones, infraestructura, herramientas, retrieval, observabilidad y revisión humana. Su importancia relativa varía según la carga de trabajo y el modelo de implementación.
Qué ha pasado con AutoGen y Semantic Kernel
El repositorio de AutoGen lo identifica explícitamente como en modo de mantenimiento. Microsoft identifica Agent Framework como el sucesor de Semantic Kernel preparado para producción y proporciona orientación sobre migración. Estas declaraciones no establecen políticas de apoyo idénticas para los dos proyectos más antiguos.
Para un nuevo proyecto de agente del ecosistema de Microsoft, empieza la evaluación con MAF. Las implementaciones existentes de AutoGen y Semantic Kernel necesitan una decisión de migración basada en los requisitos de soporte, las dependencias y el valor comercial. Para una tarea que una función convencional puede realizar de forma fiable, eso puede ser suficiente.
Nuevo proyecto de ecosistema de Microsoft
Empieza la evaluación con Microsoft Agent Framework.
Sistema AutoGen existente
Revisa el soporte de mantenimiento y planifica la migración cuando los requisitos lo justifiquen.
Sistema de Semantic Kernel existente
Revisa la guía del sucesor de Microsoft y evalúa el esfuerzo de migración para los sistemas existentes.
Cómo elegir: un marco de decisión por prioridad de negocio
No existe un "mejor" framework universal: sólo el que mejor se adapta a una determinada prioridad dominante. Usa esta tabla como una lista inicial, no como una respuesta final.
Tu prioridad dominante
Empieza aquí
Alternativa razonable
Evitar como única opción
Máximo control sobre workflows complejos y con estado
LangGraph
MAF, Pydantic AI + Temporal
Function calling en solitario
Entorno Microsoft/Azure/.NET
Microsoft Agent Framework + Microsoft Foundry
LangGraph sobre Foundry
AutoGen para un proyecto nuevo
Entorno AWS
Strands Agents + Bedrock AgentCore
LangGraph en AgentCore
Tratar AgentCore como si fuera un framework
Entorno Google Cloud/Gemini
Google ADK + Agent Runtime
LangGraph
Construir toda la capa operacional desde cero
Desarrollo rápido sobre modelos OpenAI
OpenAI Agents SDK
LangGraph
Un grafo complejo sin necesidad real de ramificación
Autonomía centrada en Claude
Claude Agent SDK
LangGraph + Claude
Tool use aislado para workflows durables largos
Neutralidad de proveedor por encima de todo
LangGraph, Haystack o Pydantic AI
LlamaIndex
Un SDK muy acoplado a un único proveedor de modelo
Trabajo de conocimiento intensivo en documentos
LlamaIndex o Haystack
LangChain
Un framework multiagente sin una capa de datos real
Equipos multiagente basados en roles
CrewAI
MAF, LangGraph, ADK
Añadir agentes solo por arquitectura
Python con tipado fuerte y backend de durabilidad existente
Pydantic AI
LangGraph + Pydantic
Un toolkit dinámico sin schemas
TypeScript full-stack
Mastra
ADK TypeScript
Forzar a un equipo TypeScript a cambiar de lenguaje
El movimiento más defendible para una decisión real es más limitado que esta tabla: seleccione dos o tres candidatos que se ajusten a tu prioridad y nube, luego ejecute una carga de trabajo idéntica en cada uno como prueba de concepto antes de comprometerse. La siguiente sección paso a paso explica exactamente cómo estructurar esa prueba de concepto.
Seguridad, gobernanza y el Reglamento de IA de la UE
La gobernanza es un criterio importante de selección empresarial. En el AI Quarterly Pulse de KPMG del primer trimestre de 2026, el 57% de los encuestados informó la validación humana de los resultados sin supervisar cada acción o decisión de los agentes. El informe también encontró que el 91% de los líderes encuestados identificaron la seguridad de los datos, la privacidad y los riesgos como el principal factor que influirá en la estrategia de IA durante los próximos seis meses (KPMG primer trimestre de 2026, página 7). Determina si tu uso previsto se encuentra dentro de las categorías de alto riesgo del Reglamento de IA antes de establecer las obligaciones aplicables.
ARTÍCULOS 12, 19 Y 26
Artículo 12 requiere capacidades de registro automático para sistemas de IA de alto riesgo. Artículo 19 y Artículo 26 generalmente requieren que los proveedores e implementadores mantengan los registros bajo su control durante al menos seis meses, sujeto a la ley aplicable.
ARTÍCULO 14
Artículo 14 requiere una supervisión humana eficaz de los sistemas de alto riesgo, incluida la capacidad de interpretar los resultados e intervenir de manera adecuada.
ARTÍCULO 50
Los deberes de transparencia cubren interacciones específicas de IA y contenido generado o manipulado, generalmente a partir del 2 de agosto de 2026. Se aplica una transición limitada al 2 de diciembre de 2026 a los deberes de marcado del Artículo 50(2) para calificar los sistemas existentes (Preguntas frecuentes de la Comisión).
El calendario de implementación actual de la Comisión Europea sitúa las obligaciones de alto riesgo del Anexo III al 2 de diciembre de 2027 y las obligaciones de alto riesgo relacionadas con productos al 2 de agosto de 2028 tras los cambios de AI Omnibus. Asigna tus obligaciones a la categoría de sistema aplicable y mantenga un calendario de cumplimiento junto con los controles técnicos.
Las capacidades de registro, rastreo y revisión humana pueden respaldar un diseño de cumplimiento. Compara esas características entre tus frameworks y servicios preseleccionados; después valida el sistema completo y los procedimientos operativos. El Reglamento no prescribe ni respalda un framework particular.
Un segundo punto es igualmente importante para los compradores europeos que evalúan las afirmaciones de los proveedores: un framework open source que se ejecuta en infraestructura propia no tiene una postura de cumplimiento automática propia. GDPR es una obligación sobre cómo se procesan los datos; SOC 2 es una certificación sobre los controles de una organización; tampoco es una propiedad que un paquete de Python pueda atribuirse en tu nombre. La cadena que realmente necesita evaluación es más larga de lo que admiten la mayoría de las conversaciones con los proveedores.
Arquitectura
La cadena de cumplimiento que realmente debes evaluar
Nueve saltos, en orden, desde la persona que activa el agente hasta la persona que lo aprueba. Para cada uno, la pregunta es la misma: ¿qué datos llegan aquí, quién los opera y cuánto tiempo se conservan?
Saltos 1-2 · dentro de tu perímetroTus controles, tus registros, tu responsabilidad
01
UsuarioLleva: la solicitud
Verifica quién está autorizado a activar el agente, qué se les dice al respecto y qué se les permite ver.
02
Framework del agenteLleva: avisos, estado, llamadas a herramientas
Un paquete open source no tiene una postura de cumplimiento propia. Verifica qué registra de forma predeterminada, dónde se escriben los checkpoints y quién puede leerlos.
Saltos 3 a 8 · los datos salen de su perímetroCada uno es una evaluación de proveedor separada.
03
API modeloLleva: indicaciones y contexto completo
Verifica la región de procesamiento, la ventana de retención, la exclusión voluntaria de la capacitación y los propios subprocesadores del proveedor.
04
ObservabilidadLleva: indicaciones y resultados, retenidos
Un posible punto ciego de privacidad. Las trazas a menudo contienen la conversación completa. Verifica si el content tracing está activado de forma predeterminada, dónde se almacenan las trazas y durante cuánto tiempo.
05
Base de datos vectorialLleva: incrustaciones y texto fuente.
Verifica el cifrado en reposo, la región de alojamiento y si una solicitud de eliminación realmente elimina los fragmentos indexados.
06
Servidores MCPLleva: entradas y resultados de herramientas.
Verifica quién opera cada servidor, el alcance de las credenciales que posee y a qué puede llegar.
07
Herramientas SaaS conectadasLleva: registros comerciales y acciones.
El salto donde el agente cambia algo en el mundo real. Verificar el acuerdo de procesamiento de datos, el alcance de las acciones permitidas y la pista de auditoría de cada una.
08
Base de datosLleva: resultados y registros de registro.
Verifica la residencia, la política de retención y que exista un camino funcional para el borrado.
Salto 9 · supervisión humanaArtículo 14 de el Reglamento de IA de la UE
09
Revisor humanoLleva: la decisión de aprobación.
Verifica que una persona designada pueda comprender, monitorear e interrumpir el sistema, y que tu decisión se escriba en el registro junto con la acción que aprobó.
El cumplimiento de un eslabón no cubre el resto de la cadena.
GDPR es una obligación sobre cómo se procesan los datos; SOC 2 es una certificación sobre los controles de una organización. Tampoco es una propiedad que un paquete Python pueda atribuirse en tu nombre: la evaluación es por salto y es toda la cadena la que debe mantenerse.
Nueve saltos desde el desencadenante hasta la aprobación. Los saltos 3 a 8 necesitan cada uno su propia evaluación del proveedor para los términos de residencia, retención y procesamiento.
Realice comprobaciones de autorización deterministas entre una acción propuesta y la ejecución de la herramienta. La identidad establece quién actúa; los permisos de acceso definen los recursos y acciones permitidos; Las reglas comerciales imponen condiciones como límites de pago. La identidad basada en Entra por sí sola no implementa una regla de monto de transacción. Haga cumplir esa regla en un servicio de políticas, puerta de enlace, aplicación o herramienta antes de realizar la acción.
Arquitectura
Dónde pertenece realmente la autorización
PASO 1
Modelo propone una acción.
"Emitir un pago de proveedor de 7.200 €."
PASO 2: DETERMINISTA
Capa de política/autorización
permitir si pago <= 5.000 € Y rol == gestionador_financiero
Código e identidad, no un aviso del sistema. El modelo no puede discutirlo.
Aprobado
La herramienta se ejecuta
Marcado
Aprobación humana
La herramienta se ejecuta
Cada decisión, tanto las ramas como la identidad que la autorizó, pertenecen al registro; eso es lo que significa en la práctica la reconstrucción del artículo 12 de el Reglamento de IA de la UE.
Lo que cuestan realmente los agentes: los verdaderos motores de coste
La mayoría de las opciones ofrecen componentes open source, pero la licencia es sólo una parte de la evaluación de costes. La elección del framework puede afectar el esfuerzo de ingeniería, los gastos generales de orquestación y las necesidades operativas. Mide el coste total de un caso completo para la arquitectura prevista.
Composición de costes · ejemplo hipotético
Una asignación de costes de agente de producción ilustrativa
Participación del coste mensual total en este ejemplo. Cada barra utiliza la misma escala de 0 a 100%.
Fichas / inferencia38%
Ingeniería y operaciones18%
Calcular9%
Llamadas a herramientas y API8%
Recuperación7%
Tiempo humano en el circuito7%
Observabilidad5%
Estado4%
Seguridad4%
Solo un ejemplo hipotético: estos porcentajes no son datos observados de la industria ni un benchmark. La asignación real depende de la carga de trabajo, el volumen de uso, la arquitectura, la elección del modelo y los costes laborales.
Básculas con autonomía
Tokens (pasos × agentes × reintentos × longitud del contexto), llamadas a herramientas y API, horas de revisión humana.
Escalas con datos
Incorporaciones, almacenamiento de vectores, reclasificación, ingesta continua, checkpoints e historial de sesiones.
Suelo fijo
Computación, almacenamiento de seguimiento y ejecuciones de evaluación, VPC y enlaces privados, puertas de enlace de políticas, gestión de secretos, tiempo de ingeniería.
Los pasos adicionales del agente, los reintentos, las críticas y los contextos más amplios pueden aumentar los costes de inferencia, herramientas y revisión. El aumento depende de la carga de trabajo. Mídelo junto con la tasa de éxito y la latencia en lugar de asumir una relación fija entre autonomía y coste.
La economía unitaria que importa
Coste por caso resuelto correctamente, coste por workflow completado y coste de una acción incorrecta, no coste por token ni coste por llamada de modelo.
Paso a paso: cómo ejecutar un PoC de evaluación de frameworks
Prueba una preselección acotada con tu propia carga de trabajo. Define el alcance del PoC en torno a una tarea representativa, los datos disponibles y los controles necesarios para evaluarla de forma segura; el tiempo necesario dependerá de ese alcance.
01
Nombra tu prioridad dominante
Elige una de la tabla de decisión anterior: control, alineación con la nube, velocidad de prototipado, profundidad de RAG, tipado fuerte o entrega nativa en TypeScript. Intentar optimizarlas todas a la vez suele llevar a los equipos a sobrediseñar un caso de uso sencillo.
02
Preselecciona dos o tres frameworks, no más
Basa la preselección en esa prioridad y en tus compromisos actuales de nube y ecosistema. Una lista más amplia multiplica el coste del PoC sin mejorar sustancialmente la decisión.
03
Define una única carga de trabajo idéntica
Debe reflejar un caso real de producción, no una demo. Incluye al menos una tarea multietapa, una llamada a una herramienta con efectos secundarios y un escenario que deba activar una revisión humana.
04
Instrumenta el PoC para medir
Para cada candidato, registra:
Tasa de éxito de extremo a extremoLatencia p50/p95Número de llamadas al modelo y a herramientasCoste por caso completadoComportamiento ante fallos y recuperaciónSeguridad de la autorización de herramientasFacilidad de tracingComplejidad del despliegueHoras de ingeniería invertidas
05
Ejecuta la misma carga de trabajo con cada candidato
Mismo modelo, mismas herramientas, mismos casos de prueba y mismas condiciones.
06
Puntúa cada candidato frente a la prioridad definida
No frente a una checklist genérica. Un framework que «gana» sobre el papel pero rinde peor en tu prioridad real es la elección equivocada.
07
Valida la postura de seguridad y cumplimiento de la combinación ganadora
Incluye la cadena completa, desde el framework y la API del modelo hasta la observabilidad y cualquier herramienta SaaS conectada, antes de comprometerte con producción, no después.
Esta guía no se basa en un benchmark de rendimiento entre frameworks universalmente aceptado. Los estudios públicos comparan workflows particulares, pero sus hallazgos dependen de tareas, modelos y configuraciones. Una evaluación controlada de tu propia carga de trabajo proporciona evidencia para tu decisión.
Preguntas frecuentes
¿Es LangGraph mejor que CrewAI para uso empresarial?
Ninguno es universalmente mejor. LangGraph ofrece control explícito mediante grafos y checkpoints para workflows con estado. CrewAI ofrece equipos de agentes basados en roles y Flows estructurados. Considera LangGraph para flujos de control complejos y CrewAI para procesos basados en roles; después compara la fiabilidad y el esfuerzo de ingeniería con la misma carga de trabajo.
¿Siguen siendo viables AutoGen y Semantic Kernel para proyectos nuevos?
AutoGen está en modo mantenimiento. Microsoft identifica Microsoft Agent Framework como el sucesor de Semantic Kernel preparado para producción y ofrece guías de migración. Empieza la evaluación de proyectos nuevos del ecosistema Microsoft con MAF; evalúa cada sistema existente según sus necesidades de soporte y el esfuerzo de migración.
¿Elegir un framework open source significa que no necesito una plataforma gestionada?
Una plataforma gestionada es opcional. El framework define la lógica del agente; también debes aportar el hosting del runtime, la identidad, la observabilidad y los controles operativos. Puedes usar un servicio gestionado, operar esas capacidades por tu cuenta o combinar ambos enfoques.
¿Cómo afecta el Reglamento de IA de la UE al framework de agentes que debemos elegir?
El Reglamento no prescribe un framework. Las capacidades de registro y supervisión humana pueden ayudar a cumplir las obligaciones de los sistemas de alto riesgo: el artículo 12 aborda las capacidades de registro y el artículo 14, la supervisión humana. El cumplimiento depende del sistema completo, el uso previsto, los controles y los procedimientos operativos.
¿Cuál es el mayor coste oculto de un proyecto de IA agéntica?
No existe un único coste principal universal. La inferencia, la ingeniería y las operaciones, la infraestructura, las llamadas a herramientas, el retrieval, la observabilidad y la revisión humana pueden ser partidas relevantes. Mide el coste por caso completado correctamente, incluidos los reintentos y la revisión, con tu propia carga de trabajo.
Siguiente paso
Traza un camino claro hacia un agente funcional en producción
La oferta de Activación Rápida de IA de Liorant busca poner un agente funcional en producción en un plazo de 4 a 6 semanas para un alcance acordado. El plan de entrega depende del acceso a los datos, las integraciones, los requisitos de seguridad y los ciclos de revisión. Confirmamos contigo el alcance y los plazos antes de implementar, utilizando el framework y la plataforma que mejor encajen con tus herramientas actuales.
Empieza con una sesión gratuita de descubrimiento de IA de 30 minutos. Identificamos tu oportunidad de automatización de mayor valor y te explicamos exactamente cómo puede ayudarte Liorant, sin presentaciones comerciales.