
El moat de datos: cada simulación se compone
Build in Public #3
Este es el tercer post de nuestra serie Build in Public, donde comparto el pensamiento honesto detrás de la construcción de DOB Capital. La Parte 1 cubrió por qué construimos un simulador antes que un producto. La Parte 2 explicó cómo pasamos de una planilla de cálculo a un motor de tasas multifactorial. Este post es sobre lo que me quita el sueño -- en el buen sentido.
Cada vez que alguien corre una simulación en DOB Capital, nos entrega algo que no existe en ningún otro lugar del mundo: un perfil de riesgo completo de un operador de infraestructura en un mercado latinoamericano, con preferencias económicas reveladas, entregado voluntariamente.
Déjame explicar por qué eso importa, por qué se compone, y por qué puede ser lo más valioso que estamos construyendo.
Qué capturamos (y por qué cada campo importa)
Cada simulación captura 8 puntos de datos primarios, más varios valores derivados. Estos son exactamente cuales son y por qué cada uno es valioso.
Los 8 inputs primarios
1. Tipo de activo (10 categorías: centros de datos, energía, SaaS, bienes raíces, flotas, minería, industrial, agricultura, salud, otro)
Esto nos dice que tipo de infraestructura esta buscando financiamiento en LATAM. No lo que los bancos reportan en sus portafolios. No lo que las encuestas gubernamentales dicen. Lo que los operadores reales, sentados en sus escritorios, están tratando de financiar ahora mismo.
2. Monto de capital ($50K a $10M, 8 niveles)
Demanda revelada. No "cuánto te gustaría pedir prestado en teoría" sino "cuánto necesitas para un proyecto específico en el que estás trabajando." La distribución de solicitudes de capital por país y tipo de activo nos dice donde están las verdaderas brechas de financiamiento.
3. Plazo (1 a 10 años)
Combinado con el monto de capital, esto revela la visión del operador sobre la economía de su propio proyecto. Un plazo de 2 años en una instalación solar de $500K sugiere expectativas de flujo de caja distintas a un plazo de 7 años por el mismo monto. La distribución de plazos por tipo de activo nos da insight sobre como los operadores piensan sobre períodos de retorno.
4. País (12 opciones: Chile, Perú, Colombia, México, Brasil, Ecuador, Costa Rica, Panamá, Uruguay, Paraguay, Otro LATAM, Fuera de LATAM)
Distribución geográfica de la demanda. Qué mercados tienen más operadores buscando activamente financiamiento alternativo? Donde está más roto el crédito bancario? La respuesta no siempre es lo que esperarias leyendo reportes macro.
5. Disponibilidad de colateral (binario: si/no)
Tiene el operador activos físicos o garantías para asegurar el financiamiento? Este único dato binario nos dice sobre la base de capital del operador y su perfil de riesgo. Los operadores sin colateral son los que los bancos rechazan automáticamente -- y frecuentemente están operando proyectos perfectamente viables.
6. Historial crediticio (binario: si/no)
Ha sido el operador parte del sistema financiero formal? En LATAM, donde el 70% de las PYMEs no tiene acceso a crédito, un "no" aquí no significa "mal pagador". Significa "invisible para el sistema bancario". Esta distinción es todo.
7. Track record operacional (binario: distribución día 1 lista o no)
Puede el activo generar ingresos desde el día uno? Una instalación solar con un PPA firmado está lista para día 1. Un proyecto greenfield sin contratos no lo está. Esto nos dice sobre la madurez del proyecto y la capacidad del operador para reducir riesgo.
8. Contrato de servicio (binario: si/no)
Tiene el operador un contrato formal con un cliente final? Este es uno de los predictores más fuertes de capacidad de repago. Un operador con un contrato de servicio a 5 años tiene un perfil de riesgo fundamentalmente diferente a uno vendiendo en el mercado spot.
Los valores derivados
De estos 8 inputs, nuestro motor calcula:
- Score de riesgo (0-7): Un score compuesto que pondera colateral, historial crediticio, track record, preparación de distribución y contratos de servicio.
- Dificultad de acceso bancario (fácil/medio/difícil): Basado en criterios bancarios específicos por país y el perfil del operador. Esto nos dice si el banco siquiera consideraría la solicitud.
- Tasa indicativa: El costo de financiamiento estimado del operador a través de nuestra plataforma.
- Tasa potencial: La tasa alcanzable después de verificación de due diligence.
- Tasa de comparación bancaria: Lo que el operador pagaria en un banco -- si el banco dijera que si.
- Diferencial de tasa: El spread entre DOB y tasas bancarias, que nos dice que tan competitiva es nuestra oferta para cada perfil específico.
- Pago mensual: Estimación del pago mensual de interés solamente.
- Preferencia de fondeo (crypto/fiat): Preferencia revelada por infraestructura de liquidación -- capturada al enviar el lead.
Eso son 8 inputs primarios más 8 valores derivados. Dieciseis puntos de datos por simulación. Cada uno estructurado, comparable y composable.
Por qué este dataset no existe
Déjame ser muy específico sobre por qué esto importa. Este dataset -- perfiles de riesgo individuales de operadores de infraestructura a lo largo de LATAM -- no existe en ningún otro lugar del mundo. Aquí está quien podría tener partes de el, y por qué no tienen la imagen completa:
Los bancos tienen datos crediticios de los operadores que aprueban. Pero los bancos rechazan al 70% de las solicitudes PYME en LATAM. Su dataset tiene sesgo de supervivencia -- solo contiene información sobre los operadores que ya tenían acceso. El 70% invisible es exactamente donde vive la oportunidad, y los bancos no tienen datos sobre ellos.
Los bancos centrales publican estadísticas agregadas. El BCRP en Perú publica tasas PYME promedio. El BCB en Brasil publica volumen de crédito por sector. El Banco de México publica márgenes de intermediación. Estos agregados son útiles para análisis macro pero no dicen nada sobre perfiles individuales de operadores, tipos de activos específicos o demanda de capital revelada a nivel de proyecto.
Los buros de crédito (Equifax LATAM, TransUnion, DICOM en Chile) tienen datos de historial de pagos, pero solo para operadores que ya participan en el sistema crediticio formal. Mismo sesgo de supervivencia que los bancos. Y sus datos no incluyen información a nivel de activo -- saben si alguien pagó su tarjeta de crédito, no si su instalación solar genera $40K/mes.
Los bancos de desarrollo (BID, CAF, BNDES, CORFO) tienen datos a nivel de proyecto para los deals que financian. Pero el financiamiento de bancos de desarrollo sirve a una fracción minuscula del mercado. BNDES, el banco de desarrollo más grande de América Latina, alcanza aproximadamente al 2% de las PYMEs brasileñas. Su dataset es profundo pero estrecho.
Los prestadores fintech en LATAM (Credijusto, Konfio, Cora, etc.) tienen datos de préstamos, pero enfocados en capital de trabajo y factoring -- préstamos de corto plazo y alta frecuencia. No capturan perfiles de proyectos de infraestructura con plazos multianuales y factores de riesgo específicos del activo.
Las encuestas gubernamentales (Sebrae en Brasil, CORFO en Chile) periódicamente encuestan las necesidades de financiamiento PYME. Son valiosas pero infrecuentes, auto-reportadas, y no capturan los datos de preferencia revelada en tiempo real que vienen de alguien activamente tratando de financiar un proyecto específico.
El simulador de DOB se ubica en la brecha entre todos estos. Captura datos de operadores que están activamente buscando financiamiento (preferencia revelada, no declarada), a lo largo del espectro completo de acceso bancario (incluyendo el 70% que es rechazado), a nivel de proyecto individual (no agregado), en tiempo real (no encuestas periódicas), y estructurado en un formato que permite comparación entre países e industrias.
El flywheel
Aquí es donde se pone interesante. Este dataset no es estatico. Se compone.
Mas simulaciones llevan a mejor calibración de tasas. A medida que acumulamos datos, podemos validar y refinar nuestro modelo de tasas. Los operadores de energía en Perú consistentemente piden plazos de 5 años? Eso nos dice algo sobre las estructuras de PPA en Perú que debería influir en nuestro ajuste de riesgo por plazo. Los operadores SaaS chilenos desproporcionadamente carecen de colateral? Eso podría significar que nuestro peso de colateral es demasiado punitivo para negocios de software en Chile.
Mejor calibración de tasas lleva a resultados más precisos. Cuando un operador corre una simulación y obtiene una tasa que se alinea con su realidad de mercado, confía en la herramienta. Cuando la comparación bancaria es precisa -- cuando el operador piensa "sí, eso es exactamente lo que me cotizó mi banco" o "sí, eso es exactamente por qué mi banco me dijo que no" -- la credibilidad se compone.
Resultados más precisos llevan a más confianza. Los operadores comparten herramientas que les dan información útil. "Oye, has probado este simulador? Me dijo que mi tasa sería X y fue exacto" es el mecanismo de crecimiento más poderoso en fintech B2B. No cuesta nada, no se puede falsificar, y se compone con cada simulación precisa.
Mas confianza lleva a más simulaciones. Y el ciclo se repite.
Este es un flywheel de datos clasico. Pero a diferencia de los flywheels de datos de consumo (de los que se ha hablado hasta el cansancio), este opera en un mercado donde la línea base de disponibilidad de datos es cercana a cero. En fintech de consumo, compites contra empresas con miles de millones de puntos de datos de transacciones. En crédito de infraestructura LATAM, compites contra un vacio.
Lo que podemos ver (y lo que eventualmente veremos)
Hoy, con nuestro dataset actual, podemos responder preguntas cómo:
- Cuál es el capital promedio solicitado por operadores de energía en Perú?
- Qué porcentaje de operadores colombianos tienen colateral disponible?
- Qué países tienen la mayor concentración de operadores que prefieren liquidación en crypto?
- Cuál es el score de riesgo más común por tipo de activo?
Estas son útiles para calibrar nuestro modelo de tasas y entender nuestro mercado. Pero son descriptivas. Nos dicen cómo luce el mercado hoy.
Con escala, el dataset se vuelve predictivo:
- Predicción de conversión: Qué perfiles de operadores tienen mayor probabilidad de proceder de simulación a creación de cuenta a publicación de activo? Si podemos identificar las características de los operadores que convierten, podemos optimizar todo el funnel -- no con trucos de marketing, sino con mejor diseño de producto.
- Mapa de calor de mercado: Donde está creciendo la demanda más rápido? Si las simulaciones de operadores de agricultura en Uruguay se triplicaron el último trimestre, eso es un indicador adelantado de oportunidad de mercado que ningún reporte macro captaría por otros 6-12 meses.
- Predicción de default: Eventualmente, cuando tengamos historial de financiamiento, podemos correlacionar perfiles pre-financiamiento con resultados de repago. Qué combinación de factores de riesgo realmente predice default? La respuesta probablemente no es lo que los modelos crediticios tradicionales asumen.
- Optimización de tasas: Ajuste dinámico de tasas basado en datos de desempeño acumulado, no solo en indicadores macro. La tasa para una empresa SaaS chilena con colateral y contrato de servicio debería estar informada por cómo perfiles similares se han desempenado, no solo por la tasa de política de Chile y un modelo teórico de spread.
Este es el juego a largo plazo. No estamos ahí todavia. El dataset es joven. Pero cada simulación nos acerca.
La arquitectura de privacidad
Quiero ser directo sobre cómo manejamos estos datos, porque la confianza es el cimiento del flywheel.
Para analítica: Todos los datos son anonimizados. Los agregados a nivel de país e industria se usan para calibración del modelo de tasas y análisis de mercado. Ningún perfil individual se usa en reportes agregados.
Para el operador: Tus datos de simulación son tuyos. Son accesibles solo para ti dentro de la plataforma, y (con tu consentimiento explícito) para DOB con el propósito de estructurar tu financiamiento. No vendemos perfiles individuales. No los compartimos con terceros. No usamos tu simulación específica para hacer marketing a tus competidores.
Para el dataset: El valor compuesto viene de patrones, no de individuos. Necesitamos saber que "los operadores de energía en Perú típicamente solicitan $500K-$1M a plazos de 5 años con un score de riesgo de 4-5." No necesitamos saber que tu específicamente solicitaste $750K.
Esto no es solo ético -- es estratégico. Un operador que no confía en la privacidad del simulador no lo usará. Un operador que no lo usa no contribuye al dataset. Romper la confianza rompe el flywheel.
Una evaluación honesta
Déjame ser honesto sobre donde estamos. El dataset es pequeño. Somos tempranos. El flywheel ha comenzado a girar pero no ha alcanzado velocidad de escape.
No tenemos suficientes datos todavia para modelos predictivos significativos. Nuestra calibración de tasas esta más informada por investigación macro (datos OECD, publicaciones de bancos centrales, spreads EMBI) que por datos de simulación acumulados. El mapeo de calor de mercado es interesante pero aún no estadisticamente significativo.
Lo que si tenemos:
- Estructura. Cada punto de dato es capturado en un formato consistente y estructurado desde el día uno. Cuando el dataset sea lo suficientemente grande para machine learning, no necesitara limpieza ni normalización -- fue diseñado para análisis desde el inicio.
- Captura en tiempo real. A diferencia de encuestas o reportes gubernamentales, nuestros datos reflejan lo que los operadores están haciendo ahora mismo, no lo que hicieron hace 18 meses.
- Comparabilidad global. Los mismos 8 inputs, el mismo modelo de scoring, a través de 12 países y 10 tipos de activos. Eso son 840 combinaciones posibles, cada una un micro-mercado que puede analizarse independientemente o compararse entre dimensiones.
- Composición. Cada simulación hace el dataset más valioso. No hay un punto en el que datos adicionales dejen de ser útiles. El valor marginal de cada simulación aumenta a medida que el dataset crece, porque cada nuevo punto de dato puede compararse contra más patrones existentes.
El simulador no es solo una herramienta de generación de leads. Ni siquiera es primariamente una herramienta de generación de leads. Es la base de una plataforma de inteligencia crediticia que, a escala, sabra más sobre la demanda de crédito de infraestructura LATAM que cualquier banco, banco central o institución de desarrollo.
Ese es el moat. Y cada simulación lo profundiza.
Tu simulación es parte de la imagen
Si eres un operador de infraestructura en América Latina -- ya sea que estes operando paneles solares en Chile, gestionando una flota de vehículos en México, u operando un centro de datos en Brasil -- tu simulación contribuye a algo más grande que tu estimación individual de tasa.
Obtienes valor inmediato: una tasa, una comparación bancaria, una imagen clara de tus opciones de financiamiento. Pero también te conviertes en parte de un dataset que, con el tiempo, hara el financiamiento alternativo más preciso, más accesible y más asequible para cada operador en la región.
El primer paso toma 2 minutos.
Simula tu tasa ahora -- gratis, confidencial, sin compromiso. Mira donde estás parado, y ayuda a construir el dataset que cambia cómo se financia la infraestructura LATAM.
Este es Build in Public #3. Anterior: De planilla a motor de tasas (Build in Public #2). Este es el post 19 de nuestra serie de 20 partes. Siguiente: La brecha de $250 mil millones: cerrarla requiere rieles, no retórica.
DOB Capital
Financiamiento alternativo para operadores de activos en LATAM. Sin bancos, sin fronteras.
Simular