IA para Investigación y Marketing

NVIDIA publicó 148.000 registros de personas sintéticas salvadoreñas: esto es lo que descubrimos en Liorant

Artículo de investigación Actualizado 2026 12 min de lectura Por Ricardo Mendoza Castro

El dataset Nemotron-Personas-El-Salvador de NVIDIA pone 148.000 registros de personas sintéticas salvadoreñas directamente al alcance de cualquier analista, equipo de marketing o investigador. Cada registro contiene siete narrativas de persona distintas que cubren la vida profesional, hábitos deportivos, intereses artísticos, comportamiento de viaje, preferencias culinarias, dinámica familiar y un perfil general.

El dataset de un vistazo

148,000
registros publicados por NVIDIA
× 7 textos de persona por registro
≈ 1,000,000
textos de persona en total

Personas por departamento

27%13%9%8%8%6%5%5%4%4%3%3%3%2%
Tamaño y tono del círculo = proporción de personas

San Salvador concentra 26.8% de la población sintética; los 14 departamentos están representados.

25 campos, tres niveles

7 campos de narrativa de persona
6 campos de texto contextual
11 campos demográficos + UUID
25 columnas · 0% faltantes (análisis Liorant) · un único split de entrenamiento · Licencia: CC-BY 4.0

Fuente: Creado por Liorant a partir del dataset NVIDIA Nemotron-Personas-El-Salvador.

NVIDIA, en colaboración con la reconocida empresa Widelabs, diseñó el dataset para investigación de Sovereign AI — para apoyar el entrenamiento de LLMs, mejorar la diversidad de datos sintéticos y reducir el colapso de modelos. Este artículo explora cómo los equipos de investigación pueden usarlo como capa de generación de hipótesis de audiencia; esa es la interpretación aplicada de Liorant para este artículo, no el propósito declarado de NVIDIA.

Liorant ejecutó este dataset a través de un pipeline de análisis completo: estadísticas exploratorias sobre las 148.000 filas, embeddings generados por IA de los campos narrativos, una segmentación no supervisada sobre una muestra de trabajo de 20.000 personas y un demo de investigación de marketing conversacional impulsado por un modelo de lenguaje pequeño. Este artículo presenta lo que el análisis reveló — hallazgos, patrones e hipótesis posibles de audiencia — y explica qué pueden hacer los equipos de marketing y los ejecutivos con un flujo de trabajo como este.

Una nota de encuadre antes de comenzar: todo lo producido a partir de este dataset es exploratorio por naturaleza. Las personas sintéticas representan diversidad demográfica y narrativa plausible, no comportamiento real de consumidores.

Los patrones que emergen de una muestra de 20.000 filas de un dataset sintético apuntan hacia hipótesis que vale la pena probar, no hacia conclusiones sobre las que actuar. Esa distinción define cómo debe leerse cada hallazgo en este artículo — y por qué Liorant considera que este tipo de análisis es más valioso al inicio de un proceso de investigación de audiencias, no al final.

Qué contiene el dataset Nemotron-Personas-El-Salvador

El dataset está disponible en nvidia/Nemotron-Personas-El-Salvador en Hugging Face, distribuido en formato Parquet como un único split de entrenamiento. Contiene 148.000 filas y 25 columnas.

Los campos demográficos estructurados proveen el andamiaje factual de cada persona: sexo, edad, idiomas que habla, estado civil, tipo de hogar, nivel educativo, ocupación, clasificación urbana o rural, municipio, departamento y país. El campo de ocupación cubre 119 clases de actividad económica CIIU Rev.4 distribuidas en ocho categorías censales de empleo.

Los campos de texto dan a cada persona su profundidad. La documentación oficial de NVIDIA identifica siete campos de narrativa de persona principales por registro — persona, professional_persona, sports_persona, arts_persona, travel_persona, culinary_persona y family_persona — que en conjunto producen aproximadamente un millón de textos de persona individuales en el dataset completo. El esquema incluye también seis campos de texto contextuales adicionales: cultural_background, skills_and_expertise, hobbies_and_interests, career_goals_and_ambitions y sus equivalentes en formato de lista skills_and_expertise_list y hobbies_and_interests_list (que contienen el mismo contenido como arrays JSON en lugar de prosa). Según el análisis de Liorant, las 13 columnas de texto son únicas en las 148.000 filas, con una longitud narrativa combinada en prosa de aproximadamente 6.817 caracteres y 1.165 palabras por registro.

Todos los campos en las 25 columnas muestran cero valores faltantes. El dataset está estructuralmente completo. Para analistas y equipos de marketing, eso significa que cada persona puede usarse sin imputación, filtrado ni limpieza de datos.

Diagrama

Arquitectura del dataset: 25 campos en tres niveles

7 campos principales de narrativa de persona
  • personaPerfil general
  • professional_personaCarrera y trabajo
  • sports_personaActividad física
  • arts_personaIntereses culturales
  • travel_personaComportamiento de viaje
  • culinary_personaAlimentación
  • family_personaHogar y familia
≈ 1 M de textos únicos en el dataset completo.
6 campos de texto contextual
  • cultural_background
  • skills_and_expertise
  • skills_and_expertise_list
  • hobbies_and_interests
  • hobbies_and_interests_list
  • career_goals_and_ambitions
Párrafos en prosa + variantes de lista JSON estructurada.
11 campos demográficos estructurados + UUID
  • uuid · sex · age
  • languages_spoken
  • marital_status · household_type
  • education_level · occupation
  • area (urbana / rural)
  • municipality · department · country
Valores categóricos y numéricos. Cero faltantes en todas las filas (análisis Liorant).
Total: 25 columnas · 148.000 filas · un único split de entrenamiento · Licencia: CC-BY 4.0

Fuente: Creado por Liorant a partir del dataset NVIDIA Nemotron-Personas-El-Salvador.

Explorar 148.000 personas sin saturar los sistemas

Cargar el dataset completo directamente en un entorno de análisis estándar requeriría varios gigabytes de memoria — más allá de lo que la mayoría de los entornos de notebook en la nube manejan cómodamente. El enfoque de Liorant en la primera fase de análisis fue consultar los archivos del dataset de forma remota mediante un motor SQL en memoria, sin cargar nunca el dataset completo en un entorno local.

Este enfoque produjo todas las estadísticas descriptivas — conteos de filas, inspección del esquema, conteos de valores faltantes, valores únicos y frecuencias categóricas principales — a través de consultas directas contra los archivos tal como existen en Hugging Face. Los únicos datos traídos a memoria local fueron una muestra aleatoria de 20.000 filas, extraída para el trabajo posterior de segmentación y demo de IA.

El resultado: un panorama demográfico y estructural completo de las 148.000 personas, producido sin los costos de infraestructura ni los requisitos de memoria que normalmente acompañarían a un dataset de este tamaño. Todos los estadísticos reportados en la sección siguiente provienen del análisis directo de Liorant y están respaldados por los tres notebooks referenciados en este artículo.

Hallazgo estructural clave (análisis Liorant): las 25 columnas registran 0% de valores faltantes. Las 13 columnas de texto contienen cada una 148.000 entradas únicas — cada persona tiene un texto completamente distinto en cada campo, tanto en los siete campos de narrativa de persona principales como en las seis columnas de texto contextual. Desde el punto de vista de calidad de datos, el dataset es inusualmente limpio.

Flujo de trabajo

El pipeline de análisis en tres notebooks

Notebook 1 · EDA remota
Consultas SQL sobre archivos Parquet de Hugging Face — el dataset completo nunca sale de la nube.
Muestra de 20.000 filas + estadísticas EDA
Notebook 2 · Segmentation
Un modelo de IA multilingüe convierte los textos en vectores de 384 dimensiones · clustering k=4 aplicado.
Embeddings + muestra segmentada
Notebook 3 · Demo de marketing
La búsqueda semántica recupera personas relevantes · un modelo de lenguaje pequeño genera hipótesis estructuradas.
Interfaz de preguntas y respuestas en el navegador
Funciona completamente en el nivel gratuito de Google Colab · sin instalación local · sin API propietaria

Fuente: Creado por Liorant a partir del dataset NVIDIA Nemotron-Personas-El-Salvador.

Qué muestran los datos: patrones demográficos y ocupacionales clave

El análisis exploratorio de las 148.000 personas revela varios patrones estructurales. Estos son hallazgos descriptivos del dataset sintético — conteos y distribuciones directos — no inferencias sobre consumidores salvadoreños reales.

Edad

La población sintética abarca de 18 a 100 años. La media de edad se sitúa en 42,8 años con una desviación estándar de 17,6. La mediana es 40. El rango intercuartil va de 28 a 55, lo que significa que la mitad de la población cae entre esas dos edades. La distribución es más amplia que una muestra típica de adultos jóvenes y más representativa del espectro completo desde la edad activa hasta la vejez.

Visual 1

Distribución de edad — Personas Nemotron El Salvador (muestra n = 20.000)

Mediana 40 · Media 42,8183040557085100EDAD

Fuente: Creado por Liorant a partir del dataset NVIDIA Nemotron-Personas-El-Salvador.

Sexo

  • Femenino: 79.632 personas — 53,81%
  • Masculino: 68.368 personas — 46,19%

Visual 1b

Distribución de sexo — dataset completo

148,000 personas Femenino · 53,81%79.632 personas Masculino · 46,19%68.368 personas

La ligera mayoría femenina refleja decisiones de diseño del dataset, no datos censales.

Fuente: Creado por Liorant a partir del dataset NVIDIA Nemotron-Personas-El-Salvador.

Idiomas hablados

Idioma Cantidad %
Solo español 134.650 90,98%
Español e inglés 12.770 8,63%
Español y otro idioma 453 0,31%
Lengua de señas salvadoreña (LESSA) 89 0,06%
Español y lengua indígena 37 0,03%
Solo lengua indígena 1 0,00%

Para cualquier equipo de marketing que trabaje en El Salvador, esta distribución confirma que la creatividad solo en español alcanza a la abrumadora mayoría de cualquier audiencia realista. El contenido bilingüe español-inglés es relevante para menos del 9% de la población sintética, concentrado en grupos con mayor educación formal y residencia urbana probable.

Visual 1c

Idiomas hablados — población sintética

Solo español9 de cada 10 personas sintéticas hablan únicamente español90.98%
Español + inglés8.63%
Todos los demás combinados0.39%

Las personas bilingües español-inglés se concentran en perfiles urbanos con mayor educación.

Fuente: Creado por Liorant a partir del dataset NVIDIA Nemotron-Personas-El-Salvador.

Nivel educativo

Nivel Cantidad Porcentaje
Bachillerato 45.436 30,70%
Primaria 36.437 24,62%
Secundaria 26.057 17,61%
Universitario 17.766 12,00%
Ninguno 17.363 11,73%
Técnico 3.864 2,61%
Posgrado 1.077 0,73%

Más de la mitad de la población sintética tiene como máximo educación primaria o secundaria. La educación universitaria aparece en solo el 12% de las personas. Este patrón tiene implicaciones directas sobre cómo las marcas calibran la complejidad de los mensajes, el diseño de productos financieros, los flujos de incorporación digital y las estrategias de construcción de confianza en diferentes grupos de audiencia en El Salvador.

Visual 2

Distribución del nivel educativo — 148.000 personas sintéticas

Bachillerato45.436 · 30,70%
Primaria36.437 · 24,62%
Secundaria26.057 · 17,61%
Universitario17.766 · 12,00%
Ninguno17.363 · 11,73%
Técnico3.864 · 2,61%
Posgrado1.077 · 0,73%

Fuente: Creado por Liorant a partir del dataset NVIDIA Nemotron-Personas-El-Salvador.

Departamento — Distribución geográfica

Departamento Cantidad Porcentaje
San Salvador 39.603 26,76%
La Libertad 19.625 13,26%
Santa Ana 13.868 9,37%
Sonsonate 12.111 8,18%
San Miguel 11.140 7,53%
Ahuachapán 8.728 5,90%
Usulután 8.094 5,47%
La Paz 7.737 5,23%
Cuscatlán 6.115 4,13%
La Unión 5.337 3,61%
Chalatenango 4.261 2,88%
Morazán 4.005 2,71%
San Vicente 3.902 2,64%
Cabañas 3.474 2,35%

San Salvador concentra el 26,76% de la población sintética. La Libertad, Santa Ana y Sonsonate suman otro 30,8%. Los 14 departamentos aparecen en el dataset, y los diez restantes representan colectivamente alrededor del 42% de las personas. Cualquier marca que trate El Salvador como un mercado único centrado en la capital está, según la distribución interna del dataset, dejando sin atender a la mayoría de la audiencia con un perfil equivocado.

Visual 3

Personas sintéticas por departamento

San Salvador39.603 · 26,76%
La Libertad19.625 · 13,26%
Santa Ana13.868 · 9,37%
Sonsonate12.111 · 8,18%
San Miguel11.140 · 7,53%
Ahuachapán8.728 · 5,90%
Usulután8.094 · 5,47%
La Paz7.737 · 5,23%
Cuscatlán6.115 · 4,13%
La Unión5.337 · 3,61%
Chalatenango4.261 · 2,88%
Morazán4.005 · 2,71%
San Vicente3.902 · 2,64%
Cabañas3.474 · 2,35%

San Salvador concentra la población; los otros 13 departamentos distribuyen el resto.

Fuente: Creado por Liorant a partir del dataset NVIDIA Nemotron-Personas-El-Salvador.

Principales ocupaciones

El dataset cubre 119 clases de actividad económica CIIU Rev.4. Las siete más frecuentes en el dataset completo de 148.000 personas, según el análisis de Liorant:

Ocupación Cantidad %
Restaurantes y comida ambulante 12.359 8,35%
Cultivo de cereales y legumbres 9.324 6,30%
Comercio minorista no especializado (base alimentaria) 9.163 6,19%
Empleadores de personal doméstico 8.996 6,08%
Construcción de edificios 6.862 4,64%
Elaboración de productos de panadería 6.137 4,15%
Fabricación de prendas de vestir 5.068 3,42%

La economía representada en el dataset se inclina hacia el comercio informal, la agricultura, el trabajo doméstico y la producción alimentaria — coherente con la estructura del mercado laboral real de El Salvador, donde el sector informal representa una parte sustancial del empleo. Las marcas que diseñan campañas alrededor del empleo formal y los trabajadores asalariados estarán, según estas distribuciones, optimizando para un perfil minoritario.

Descubrimos cuatro patrones de audiencia emergentes del análisis de segmentación

La segunda fase de análisis pasó de las estadísticas descriptivas del dataset completo a una muestra de trabajo de 20.000 personas seleccionadas aleatoriamente. El objetivo: comprobar si la segmentación con IA de los campos narrativos produce agrupaciones de audiencia coherentes que van más allá de lo que revelan por sí solas las columnas demográficas estructuradas.

El enfoque combinó los siete campos de narrativa de persona principales y los campos de texto contextual disponibles por persona en una representación de texto única, y luego usó un modelo de IA multilingüe para convertir la narrativa combinada de cada persona en un vector numérico — una representación matemática de su significado. Esos vectores se agruparon con un algoritmo de segmentación no supervisado, probado con múltiples tamaños de grupo para identificar cuál producía las agrupaciones más internamente coherentes.

Flujo de trabajo

Cómo se construyeron los segmentos de audiencia

Muestra de trabajo de 20.000 personas
Combinar 7 campos de persona + texto contextual en un bloque por registro
Un modelo de IA multilingüe codifica cada bloque como un vector de 384 números
Probar k = 3–10 — medir cohesión interna
k = 4 seleccionado — mayor cohesión (0,119)
Perfilar cada segmento por demografía, geografía y ocupación
Todos los pasos representan el análisis de Liorant · los resultados son hipótesis exploratorias de audiencia, no segmentos de clientes estadísticamente validados

Fuente: Creado por Liorant a partir del dataset NVIDIA Nemotron-Personas-El-Salvador.

Una medida estadística de la cohesión de segmentos — que cuantifica qué tan claramente separadas e internamente consistentes son cada agrupación — alcanzó su punto óptimo con cuatro segmentos, con una puntuación de 0,1185 en una escala donde valores más altos son mejores. Esa puntuación es modesta en términos absolutos, como es esperable para texto narrativo rico en lugar de datos puramente numéricos, pero supera significativamente todas las demás opciones de número de grupos probadas (de tres a diez).

Visual 4

Puntuación de cohesión por número de segmentos de audiencia

0.060.080.100.12Óptimo: 4 segmentos (0,119)345678910NÚMERO DE SEGMENTOS DE AUDIENCIA (k)

Las puntuaciones más altas indican agrupaciones más internamente consistentes.

Fuente: Creado por Liorant a partir del dataset NVIDIA Nemotron-Personas-El-Salvador.

Los cuatro segmentos a continuación representan patrones que surgieron del análisis narrativo de la muestra de trabajo de 20.000 personas. Son hipótesis de audiencia fundamentadas en los datos, no perfiles de clientes verificados. Su valor está en estructurar las preguntas que un equipo de marketing debería llevar a la investigación real — no en reemplazar esa investigación.

Segmento A — Trabajadoras del sector informal (28,8% de la muestra — 5.757 personas)

El primer patrón es el más grande por volumen y el más específico de género en el dataset. El 97,99% de las personas en este segmento son mujeres. Sus ocupaciones se concentran en el empleo doméstico (831 personas), trabajo en restaurantes y comida ambulante (509), comercio minorista no especializado (485) y confección de prendas (328). La educación se centra en primaria (28,2%) y bachillerato (27,5%), con un 14,3% sin educación formal. El segmento se inclina hacia ciudades y municipios medianos fuera de la capital, distribuido en La Libertad (18,7%), Santa Ana (12,1%) y Sonsonate (10,9%). El 71% está clasificado como urbano.

Lo que este patrón sugiere para los equipos de marketing: El texto narrativo en este segmento describe mujeres que gestionan economías informales de efectivo, administran las compras del hogar y toman decisiones diarias con presupuestos ajustados pero consistentes. Hipótesis que vale la pena probar: productos de acceso financiero y dinero móvil, mensajes de seguridad familiar, bienes de consumo prácticos, herramientas para pequeños negocios enmarcadas en necesidades operativas diarias más que en inversión a largo plazo. El mensaje correcto para este segmento casi con certeza difiere del que funciona en audiencias urbanas con empleo formal — y el canal adecuado difícilmente será digital-first.

Segmento B — Economía física y rural (30,0% de la muestra — 6.004 personas)

El segmento más grande por conteo de personas es casi exclusivamente masculino — 94,85% hombres — y se concentra en edades jóvenes, con el rango modal entre 20 y 29 años. Las ocupaciones las dominan el cultivo de cereales y legumbres (1.058 personas), la construcción de edificios (636), el mantenimiento y reparación de vehículos (207), el transporte terrestre (185) y la seguridad pública (164). El bachillerato es el nivel educativo modal (30,2%), seguido de la primaria (26,0%). Este es el único segmento con representación rural significativa: el 34,9% de las personas está clasificado como rural, frente al promedio de la muestra de aproximadamente el 23%.

Lo que este patrón sugiere para los equipos de marketing: Las descripciones narrativas en este segmento muestran hombres jóvenes dedicados a trabajo físico, frecuentemente al aire libre, con infraestructura formal limitada a su alrededor. El alcance digital probablemente sea menor que en el segmento de servicios urbanos. Las brechas de conectividad, el menor tiempo en plataformas y la distancia de los servicios financieros formales aparecen como patrones contextuales. Hipótesis que vale la pena probar: canales offline y radio, mensajes sobre herramientas prácticas y estabilidad de ingresos, insumos agrícolas, seguros enmarcados en riesgo laboral, y creatividad orientada a la comunidad más que a la aspiración individual.

Segmento C — Profesionales de servicios urbanos (26,8% de la muestra — 5.365 personas)

Este segmento destaca como el más concentrado geográficamente y el más equilibrado en términos de género. El 71,3% de sus personas proviene del departamento de San Salvador — el 32,3% solo de San Salvador Centro. Es el único segmento donde las personas masculinas y femeninas aparecen en números aproximadamente iguales (50,2% hombres, 49,8% mujeres). La educación universitaria alcanza el 17,2% — cinco puntos porcentuales por encima del promedio del dataset completo — y el 89,2% está clasificado como urbano. Las principales ocupaciones reflejan una economía de servicios más diversa: restaurantes (360), comercio minorista no especializado (309), empleo doméstico (293), construcción (250) y otros servicios (250).

Lo que este patrón sugiere para los equipos de marketing: Este es el perfil que más se acerca al modelo mental que muchas marcas usan cuando piensan en el consumidor salvadoreño. Es real — pero representa aproximadamente uno de cada cuatro personas en la muestra, y se concentra casi completamente en la capital. Hipótesis que vale la pena probar: canales digitales, servicios financieros, productos de desarrollo profesional, mensajes de estilo de vida y consumo. La mayor presencia universitaria y la concentración urbana convierten a este segmento en el más propenso a responder a creatividad digital-first, productos financieros formales y comercio mediado por plataformas.

Segmento D — Emprendedoras de la economía alimentaria (14,4% de la muestra — 2.874 personas)

El segmento más pequeño es el más distintamente definido. La elaboración de productos de panadería concentra 847 personas; los restaurantes y la comida ambulante, 753. El comercio minorista no especializado de alimentos (349), los puestos de mercado (249) y el comercio especializado en alimentos (229) siguen a continuación. El 76,4% de las personas en este segmento son mujeres. La educación se concentra en bachillerato (30,2%) y primaria (25,5%). A diferencia del Segmento C, este grupo está distribuido geográficamente — aparece en múltiples departamentos en lugar de centrarse en una sola ciudad, con San Salvador (15,9%), Santa Ana (11,8%), La Libertad (10,6%) y Sonsonate (9,5%) contribuyendo de forma significativa.

Lo que este patrón sugiere para los equipos de marketing: Las descripciones narrativas en este segmento muestran mujeres que operan sus propios negocios de alimentos — gestionando proveedores, fijando precios, atendiendo clientes habituales y navegando cadenas de suministro informales. Lo que les falta, en el contexto narrativo, es acceso a crédito formal, infraestructura de gestión empresarial y estabilidad en la cadena de suministro que los negocios más grandes dan por sentado. Hipótesis que vale la pena probar: microfinanzas y capital de trabajo, proveeduría de ingredientes y envases, herramientas de punto de venta, y mensajes de gestión empresarial enmarcados en eficiencia operativa más que en aspiración.

Visual 5

Tamaño de los segmentos y composición de género en la muestra de trabajo

Conteo de personas por segmento
Segmento A5,757
Segmento B6,004
Segmento C5,365
Segmento D2,874
Composición de género
Segmento A
98% F
2% M
Segmento B
5% F
95% M
Segmento C
50% F
50% M
Segmento D
76% F
24% M

Fuente: Creado por Liorant a partir del dataset NVIDIA Nemotron-Personas-El-Salvador.

Visual

Tarjetas de perfil de los cuatro segmentos

Segmento A — Trabajadoras del sector informal

28,8% de la muestra · 5.757 personas
Género98% femenino
GeografíaLa Libertad, Santa Ana, Sonsonate
TrabajoTrabajo doméstico · comida ambulante · comercio · confección
EducaciónPrimaria / Bachillerato
CanalAudiencia predominantemente offline

Segmento B — Economía física y rural

30,0% de la muestra · 6.004 personas
Género95% masculino
GeografíaRural y periurbano
TrabajoAgricultura · construcción · transporte · seguridad
EducaciónBachillerato / Primaria
CanalRadio y canales comunitarios

Segmento C — Servicios urbanos

26,8% de la muestra · 5.365 personas
Género50/50 masculino / femenino
GeografíaSan Salvador (71% of segment)
TrabajoServicios formales · administración · comercio
EducaciónBachillerato + Universidad (17%)
CanalDigital-first, preparada para plataformas

Segmento D — Economía alimentaria emprendedora

14,4% de la muestra · 2.874 personas
Género76% femenino
GeografíaDistribución multidepartamental
TrabajoPanadería · comida ambulante · puestos de mercado · comercio alimentario
EducaciónBachillerato / Primaria
CanalMixtos · arraigo comunitario
Análisis Liorant · muestra de 20.000 personas · los segmentos son hipótesis exploratorias, no perfiles de clientes verificados

Visual

Perfiles de segmentos de audiencia en cinco dimensiones

Dimensión (% del segmento)Segmento A
Sector informal
Segmento B
Trabajo físico
Segmento C
Servicios urbanos
Segmento D
Economía alimentaria
Femenino98%5%50%76%
Urban71%65%89%70%
Educación universitaria9%7%17%11%
Del departamento de San Salvador13%12%71%16%
Rural29%35%11%30%

Cada celda se sombrea dentro de su fila; la más oscura marca el segmento con mayor puntuación en esa dimensión. Valores aproximados de la muestra de trabajo de 20.000 personas.

Fuente: Creado por Liorant a partir del dataset NVIDIA Nemotron-Personas-El-Salvador.

Métodos de investigación: antes y después de las personas sintéticas

La mayoría de los equipos de marketing que trabajan en El Salvador — o en cualquier mercado centroamericano — comienzan una campaña desde uno de tres puntos de partida: intuición de stakeholders senior moldeada por experiencias pasadas, plantillas globales de personas recicladas ("María, 35 años, madre de clase media"), o un ciclo de investigación formal que tarda entre seis y diez semanas y cuesta miles de dólares antes de que aparezca la primera hipótesis estructurada.

Esto es lo que cambia cuando un dataset de personas sintéticas entra en el flujo de trabajo:

Visual

Comparativa de tiempos: investigación tradicional y asistida por IA

Investigación tradicional
Semanas 1–2 Definir brief + diseñar instrumento de encuesta
Semanas 3–4 Conseguir panel, lanzar trabajo de campo y recopilar respuestas
Semanas 5–6 Limpiar datos y ejecutar análisis estadístico
Semanas 7–8 Redactar informe → llega la primera hipótesis estructurada
$10.000+ · 4–10 semanas · un ciclo de hipótesis por ronda de trabajo de campo
Asistida por IA con personas sintéticas
Hora 1 EDA remota sobre el dataset completo de 148.000 filas
Horas 2–3 Generar embeddings de los textos y ejecutar la segmentación
Hora 4 Perfilar segmentos y redactar hipótesis de audiencia
Hora 5+ Entrar al trabajo de campo con preguntas estructuradas y verificables
≈ Costos de cómputo · horas, no semanas · hipótesis iterables en tiempo real
Las personas sintéticas comprimen la formación de hipótesis — no el trabajo de campo que sigue.

Fuente: Creado por Liorant. Los rangos de costo y tiempo son estimaciones de Liorant para el mercado centroamericano.

Dimensión Enfoque tradicional Con personas sintéticas
Tiempo hasta la primera hipótesis de audiencia 4–10 semanas (diseño de encuesta, trabajo de campo, análisis) Horas (análisis exploratorio + segmentación)
Costo para producir segmentos iniciales $10.000+ según metodología Solo herramientas open source y costos de cómputo
Resolución geográfica Nivel de ciudad o región amplia Nivel de municipio, los 14 departamentos
Granularidad ocupacional Categorías amplias ("empleado / autónomo") 119 clases de actividad económica CIIU Rev.4
Profundidad narrativa Preguntas de encuesta y respuestas cerradas Narrativas de forma libre en 11 dimensiones de vida
Velocidad de iteración Nuevo ciclo de trabajo de campo por cada hipótesis Reejecutar segmentación o cambiar consulta en horas
Preparación para flujos de trabajo de IA Limitada — solo datos estructurados Directa: embeddings narrativos, búsqueda semántica, preparada para LLM
Requisito de validación Autovalidado — los datos vienen de respondentes reales Requiere validación con datos reales antes de cualquier decisión estratégica

La última fila de esa tabla es la más importante. Las personas sintéticas aceleran la fase de formación de hipótesis de la investigación, no la fase de conclusiones. Cada segmento, patrón e idea de campaña producido a partir de este dataset requiere validación con datos reales de clientes, registros de CRM, entrevistas de campo o resultados de campañas antes de que cualquier decisión estratégica se apoye en él.

Lo que el enfoque ofrece es velocidad al inicio del proceso de investigación: entrar a un briefing de campaña con cuatro hipótesis de audiencia estructuradas, ángulos creativos pre-evaluados y una lista específica de supuestos a validar — en lugar de una página en blanco. La ventaja competitiva no está en reemplazar el trabajo de campo. Está en llegar al trabajo de campo con preguntas mejor formuladas.

Un asistente inteligente de investigación construido sobre el mismo dataset

La tercera fase del análisis construyó una capa interactiva sobre el trabajo de segmentación. Los vectores narrativos precomputados y la muestra de trabajo segmentada se cargaron en un pipeline ligero que conecta una capa de búsqueda semántica con un pequeño modelo de lenguaje con capacidad de seguir instrucciones — ejecutándose en una GPU de nube estándar sin costo incremental.

El sistema funciona así: un usuario escribe una pregunta en lenguaje natural. El sistema identifica las cinco narrativas de personas semánticamente más similares a la pregunta. Esas cinco personas se pasan luego al modelo de lenguaje, que genera una respuesta estructurada — hipótesis de audiencia, borrador de brief de campaña, resumen de segmento o marco de mensajes — fundamentada en las personas recuperadas, no en el conocimiento general del modelo.

Flujo de trabajo

Cómo funciona el asistente de investigación con IA

Etapa 1
El usuario escribe una pregunta de marketing en lenguaje natural
Etapa 2
La pregunta se codifica como un vector semántico con el mismo modelo usado para las personas
Etapa 3
Se recuperan las 5 narrativas de persona semánticamente más similares
Etapa 4
El modelo de lenguaje pequeño lee las 5 personas y la pregunta
Etapa 5
Output estructurado: hipótesis · motivaciones · barreras · canales · afirmaciones a validar
Ejemplo de output

Pregunta: "¿Qué personas podrían responder a una campaña de educación financiera digital?"

Motivaciones
estabilidad de ingresos, seguridad financiera familiar
Barreras
confianza en proveedores informales, experiencia digital limitada
Canales
grupos de WhatsApp, radio comunitaria, referidos presenciales
Validar con
entrevistas a clientes, datos CRM, resultados de campaña piloto
Funciona en local y en GPU estándar en la nube · los outputs son hipótesis generadas por IA, no investigación de mercado validada · siempre validar con clientes reales antes de actuar

Fuente: Creado por Liorant. Pipeline construido sobre el dataset NVIDIA Nemotron-Personas-El-Salvador.

Interfaz activa

Crear una consulta de investigación y conversar en lenguaje natural

liorant · asistente de investigación con IA
El asistente en uso: el material fuente se carga a la izquierda y una pregunta escrita en lenguaje natural devuelve a la derecha una respuesta estructurada y fundamentada en las fuentes.

El asistente en uso. Un miembro del equipo carga el material fuente y escribe una pregunta en lenguaje natural; el sistema devuelve una respuesta estructurada y fundamentada en las fuentes en el mismo idioma. Sin sintaxis de consulta, exportación de datos ni pasos técnicos intermedios: la pregunta y la consulta ocurren en una sola conversación.

Fuente: Interfaz funcional de Liorant, construida sobre el flujo de trabajo NVIDIA Nemotron-Personas-El-Salvador.

Ejemplo de pregunta enviada al sistema: "¿Qué personas de este dataset podrían ser receptivas a una campaña de educación financiera digital?"

El sistema recuperó personas del segmento de servicios urbanos concentrado en San Salvador, junto con individuos del sector informal cuyas descripciones narrativas tocaban temas de remesas, hábitos de ahorro y gestión de efectivo de micronegocios. La respuesta generada identificó motivaciones probables (estabilidad de ingresos, seguridad financiera familiar), posibles barreras de confianza (preferencia por proveedores informales, experiencia previa limitada con plataformas digitales), canales sugeridos (grupos comunitarios, radio, WhatsApp), y una lista específica de afirmaciones a validar con clientes reales antes de actuar.

Esto no es investigación de mercado. Es un acelerador de hipótesis — una herramienta que ayuda a un equipo de marketing a entrar a un brief con supuestos estructurados y verificables en lugar de intuiciones no validadas. Una interfaz accesible desde el navegador, construida al final del pipeline de análisis, hace esto interactivo para usuarios no técnicos, sin requerir ningún conocimiento de datos para operar.

Cómo reproducir este flujo de trabajo

El pipeline completo funciona en el nivel gratuito de Google Colab sin instalación local requerida. La complejidad técnica la gestionan los notebooks; el aporte del equipo de negocio es la pregunta, el producto y el contexto de audiencia.

  • Ejecutar el análisis exploratorio. El primer notebook se conecta a los archivos del dataset de forma remota, ejecuta todas las estadísticas descriptivas como consultas de base de datos sin cargar el dataset completo en memoria, y exporta una muestra de trabajo de 20.000 filas. Tiempo estimado: 8–12 minutos.

  • Guardar la muestra de trabajo. Descargar el archivo de muestra — aproximadamente 60–80 MB — del entorno de análisis antes de pasar al siguiente paso.

  • Ejecutar el análisis de segmentación. El segundo notebook toma la muestra de trabajo, genera embeddings narrativos con un modelo de IA multilingüe, evalúa múltiples opciones de número de segmentos, aplica la solución óptima de cuatro segmentos, perfila todos los segmentos en dimensiones demográficas y ocupacionales, y exporta la muestra segmentada y el archivo de embeddings. Tiempo estimado: 20–30 minutos en un entorno GPU gratuito.

  • Guardar dos archivos de salida. El archivo de embeddings y la muestra segmentada son necesarios para el demo interactivo del paso siguiente.

  • Ejecutar el demo de investigación de marketing. El tercer notebook carga los dos archivos guardados, construye la capa de búsqueda semántica, conecta un modelo de lenguaje pequeño y lanza una interfaz accesible desde el navegador. Se escribe una pregunta de marketing en lenguaje natural para recuperar hipótesis de audiencia, borradores de brief de campaña o resúmenes de segmento.

Este proceso está diseñado para que equipos no técnicos los ejecuten con una configuración mínima. Cambiar la pregunta, la categoría de producto o la geografía objetivo cambia el resultado sin reconstruir nada desde cero.

Flujo de trabajo

Cinco pasos del dataset a una interfaz de investigación funcional

1
Ejecutar EDA remota
El primer notebook consulta el dataset completo de 148.000 filas vía Hugging Face — sin descarga local
2
Guardar la muestra de trabajo
Descargar el archivo de muestra de 20.000 filas (~60–80 MB)
3
Ejecutar la segmentación
El segundo notebook genera embeddings y aplica el clustering de cuatro segmentos
4
Guardar dos archivos de salida
Archivo de embeddings + muestra segmentada necesarios para el demo
5
Lanzar el demo
El tercer notebook crea una interfaz de navegador — escribe cualquier pregunta y recibe hipótesis fundamentadas en personas
Google Colab nivel gratuito · sin configuración local · sin suscripción a APIs

Fuente: Creado por Liorant. Flujo de trabajo construido sobre el dataset NVIDIA Nemotron-Personas-El-Salvador.

Lo que este flujo de trabajo no puede reemplazar

Las personas sintéticas no sustituyen:

Entrevistas reales con clientes. Solo las personas reales pueden confirmar si una hipótesis sobre motivación, barrera o comportamiento realmente les aplica. La profundidad narrativa de las personas sintéticas puede ayudar a los equipos a formular mejores preguntas de entrevista — pero las entrevistas siguen siendo esenciales.

Datos de CRM y comportamiento. La frecuencia de compra, las señales de churn, los patrones de uso de producto y los cálculos de valor de vida del cliente requieren registros de transacciones reales. Un dataset sintético no puede replicar esto.

Datos de rendimiento de campañas. Solo las pruebas A/B reales y los resultados de campañas en vivo revelan si un mensaje funciona. Las personas sintéticas pueden ayudar a reducir las opciones creativas que vale la pena probar — no pueden reemplazar la prueba.

Experiencia cultural y local. Un dataset, por estructuralmente rico que sea, no lleva el conocimiento de un investigador, estratega de marca o miembro de la comunidad que vive dentro de la cultura estudiada. La experiencia local no es opcional; es la capa interpretativa que hace que los hallazgos de datos sean significativos.

Supervisión ética. Cualquier flujo de trabajo asistido por IA que oriente decisiones que afectan a comunidades reales requiere revisión humana, transparencia metodológica y validación documentada antes de actuar sobre sus resultados. El uso responsable de datos sintéticos es una elección activa, no un estado por defecto.

Limitaciones conocidas documentadas por NVIDIA. La tarjeta oficial del dataset de NVIDIA señala varias restricciones específicas que los equipos deben tener en cuenta: las comunidades indígenas y afrodescendientes están sub-representadas en la población sintética; las narrativas generadas por IA pueden contener supuestos de roles de género heredados de los datos de entrenamiento subyacentes; el español salvadoreño en el dataset es una aproximación generada por un modelo de IA, no extraída de un corpus lingüístico salvadoreño autorizado; y la religión no está modelada en ningún campo de persona. Los equipos que apliquen este dataset a investigación sobre comunidades marginadas, precisión lingüística o matices culturales deben ponderar estas limitaciones con especial cuidado.

El dataset Nemotron es un punto de partida para la generación estructurada de hipótesis — una de las fases más valiosas de un proceso de investigación, y una que los equipos de marketing en América Latina sistemáticamente subfinancian y preparan de forma insuficiente. No es un atajo que omite la investigación posterior.

Visual

Lo que las personas sintéticas no cubren

Entrevistas reales con clientes

Solo las personas reales pueden confirmar si una motivación o barrera realmente les aplica.

Datos de CRM y comportamiento

La frecuencia de compra, las señales de churn y el valor de vida requieren registros de transacciones.

Rendimiento de campaña

Solo las pruebas A/B en vivo revelan si un mensaje realmente funciona.

Experiencia cultural y local

Ningún dataset reemplaza el conocimiento de quien vive dentro de la cultura estudiada.

Supervisión ética

La investigación con IA que afecta a comunidades reales requiere revisión humana y validación documentada.

Limitaciones documentadas por NVIDIA

Subrepresenta comunidades indígenas y afrodescendientes · puede contener supuestos de género heredados · español salvadoreño aproximado por IA · religión no modelada.

Las personas sintéticas aceleran la formación de hipótesis. La validación con personas reales, datos reales y campañas reales siempre es necesaria antes de cualquier decisión estratégica.

Fuente: Creado por Liorant. Limitaciones según la tarjeta oficial del dataset de NVIDIA.

Cómo Liorant ayuda a los equipos de investigación a construir esto

Liorant diseña y opera sistemas de IA para equipos de marketing, operaciones y legal en España, Colombia y El Salvador. El flujo de trabajo descrito en este artículo representa una categoría de capacidad que llamamos Inteligencia de Clientes con IA — combinando datos estructurados, embeddings narrativos, segmentación, búsqueda semántica y modelos de lenguaje ligeros en herramientas de investigación repetibles que los equipos de marketing pueden operar ellos mismos.

Un compromiso típico comienza con un lanzamiento de producto, una expansión regional o una pregunta de audiencia que el equipo no ha podido responder con la investigación existente. Liorant diseña y despliega un flujo de trabajo de investigación de audiencias asistido por IA, calibrado al entorno de datos del cliente — registros de CRM, datos de campaña, uso de producto, o un dataset sintético como punto de partida — y entrega un sistema funcional en cuatro a seis semanas.

El entregable no es un informe. Es una herramienta activa que el equipo de marketing opera por sí mismo, respaldado por el equipo de ingeniería de IA de Liorant para mantenimiento, iteración y expansión continuos. Reportamos resultados en términos de negocio: hipótesis generadas, ciclos de investigación comprimidos, calidad de los briefings de campaña mejorada — no en métricas de infraestructura.

Descubre cómo Liorant entrega sistemas de IA funcionales en cuatro a seis semanas →

Preguntas frecuentes

¿El dataset Nemotron-Personas-El-Salvador es gratuito?

Sí. NVIDIA lo publicó en Hugging Face bajo una licencia Creative Commons Atribución 4.0 Internacional (CC-BY 4.0). Esta licencia permite el uso para cualquier propósito — incluyendo aplicaciones comerciales — siempre que se otorgue el crédito correspondiente a NVIDIA como fuente. Verifica siempre los términos actuales en la tarjeta del dataset antes de su uso.

¿Los cuatro segmentos representan a consumidores salvadoreños reales?

No. Los segmentos son patrones que emergieron de un análisis con IA de una muestra de 20.000 personas extraída de un dataset sintético. Representan agrupaciones demográficas y ocupacionales plausibles que vale la pena investigar — no perfiles de clientes verificados. Cada hipótesis que generan requiere validación con personas reales antes de informar una decisión estratégica.

¿Necesitamos un equipo técnico para trabajar con estos datos?

No si trabajas con Liorant. Todo el diseño técnico, la implementación, la selección del modelo y las operaciones continuas recaen en el equipo de ingeniería de Liorant. Un ejecutivo de marketing aporta la pregunta de negocio, el contexto estratégico y las prioridades de validación. El sistema entrega insights en lenguaje comercial.

¿Cuál es la diferencia entre una persona sintética y un buyer persona?

Un buyer persona es un perfil compuesto construido a partir de investigación real de clientes — entrevistas, encuestas, análisis de CRM. Una persona sintética es un perfil generado computacionalmente que representa diversidad demográfica y narrativa plausible, no a un individuo real específico. Los buyer personas resumen conocimiento validado. Las personas sintéticas exploran el espacio de hipótesis antes de que esa validación comience. Los dos son complementarios, no intercambiables.

¿Cuál es el primer paso para una empresa interesada en esta capacidad?

Una sesión de descubrimiento de 30 minutos con Liorant. Revisamos tus activos de datos existentes, identificamos la pregunta de audiencia más valiosa que vale la pena responder y describimos exactamente cómo un flujo de trabajo de investigación asistida por IA se calibraría a tu mercado, tu producto y tu equipo — sin compromiso previo.

Empieza a construir investigación de audiencias asistida por IA

Los equipos de marketing que esperan dos o tres meses para recibir resultados de trabajo de campo antes de formular una sola hipótesis verificable perderán terreno frente a equipos que llegan al campo con preguntas más precisas. El análisis de personas sintéticas no acorta el trabajo de campo — mejora lo que los equipos llevan a él.

El dataset Nemotron, disponible gratuitamente, analizado en horas y capaz de revelar patrones de audiencia en la población sintética de El Salvador, es una demostración temprana de cómo funciona ese cambio en la práctica. Los equipos que actúen primero — validando las hipótesis más prometedoras con clientes reales — construirán una ventaja estructural en la comprensión de una audiencia que sus competidores todavía están aproximando.