01
Almacén de datos de múltiples fuentes
Muchas fuentes desordenadas, un registro fiable por jugador.
El problema
Cada fuente tiene sus propios identificadores, nombres y temporadas, y falla sin avisar. Una vez, un conjunto de datos abierto borró el valor de mercado de 10.021 jugadores sin cambiar el número de filas.
Cómo funciona
- Cada importación pasa cinco controles antes de publicarse: estructura, pérdida máxima del 15 % de filas, cantidades mínimas, columnas completas y fechas que no retroceden. Si falla un control, los datos en uso no cambian.
- Los jugadores se vinculan en tres pasadas con una puntuación de confianza: identificador exacto (1,0), nombre y fecha de nacimiento (0,95), nombre parecido con un candidato claro (0,8). Los enlaces manuales nunca se sobrescriben.
- Los clubes se vinculan por votación: al menos tres jugadores comunes y una ventaja clara. La coincidencia es del 99,7 %.
- Antes de cargar datos, 21 traspasos de referencia deben coincidir con un margen del 1 %. Las fuentes se concilian cada semana y las discrepancias se convierten en incidencias.
Estado
- En uso: funciona en producción529.137 registros de traspasos de 1996 a 2026, 72.828 jugadores y 15.961 clubes.
Otras aplicaciones
Catálogos de múltiples proveedores, datos inmobiliarios, registros médicos, KYC y logística.