Esto es para ti si…
- Tu equipo ya trabaja con Spark y Databricks es el destino natural.
- Sigues en el metastore de Hive y necesitas gobierno de datos centralizado.
- Tienes una bodega heredada — Teradata, Redshift, Synapse, Snowflake — y necesitas una ruta de salida.
- Quieres empezar por un caso de uso de alto valor, no por migrar todo.
Qué es
Construcción o migración de un lakehouse en Azure Databricks con arquitectura medallón, usando despliegue parametrizado para acelerar el aprovisionamiento de la plataforma.
Escenarios cubiertos
- Implementación nueva de arquitectura medallón: despliegue de la instancia, pipelines de ingesta desde las fuentes soportadas hacia bronce, y transformaciones hacia plata y oro.
- Migración desde una bodega o lakehouse heredado: traslado directo desde plataformas soportadas, con conversión de datos y de código.
- Caso de uso nuevo sobre un despliegue existente: pipelines de ingesta hacia bronce y transformaciones hacia plata y oro.
- Actualización a Unity Catalog: migración del metastore de Hive a Unity Catalog.
Qué incluye
- Aprovisionamiento acelerado del espacio de trabajo de Databricks, Unity Catalog como metastore, Delta Live Tables, Data Lake y los demás componentes de la plataforma, mediante despliegue parametrizado
- Migración a arquitectura medallón con capas bronce, plata y oro
- Transformaciones con notebooks de Spark, orquestación con Azure Data Factory y pipelines declarativos
- Migración desde Synapse Dedicated Pool y SQL Server, con traducción de código T-SQL a notebooks de Databricks
- Un informe básico de Power BI que demuestra la conexión a las tablas de la capa oro
- Orígenes soportados: Azure SQL Database y Managed Instance, PostgreSQL, MySQL, Oracle, SQL Server local, Cloudera con HDFS, Spark, Hive e Impala, archivos planos, Hadoop, AWS Redshift, Event Hubs, Teradata y Snowflake. En modalidad piloto: Teradata, Redshift, Synapse, Snowflake, Oracle, Hive, SAP HANA, SAS y Databricks en AWS
- Coordinación y gestión del proyecto en el alcance acordado
Qué no incluye
- Rediseño o reevaluación de arquitectura
- Modelado de datos y rediseño de la lógica de negocio
- Dimensionamiento de capacidad y estimación de costos
- Aprovisionamiento de capacidad, preparación del entorno, instalación de gateway y configuración de red
- Pruebas, ajuste y comparación de rendimiento
- Configuración de CI/CD
- Configuración y prueba de procesos aguas arriba y aguas abajo
- Operación posterior: continuidad, respaldo y monitoreo
- Optimización de costos y prácticas de gestión financiera de la nube
Entregables
- Espacio de trabajo de Databricks desplegado con Unity Catalog, Delta Live Tables y Data Lake
- Arquitectura medallón implementada
- Código migrado y traducido cuando aplica
- Un informe básico de Power BI conectado a la capa oro
- Documentación y traspaso
Cómo trabajamos
- Determinación del escenario y del alcance
- Ejecución según el escenario acordado
- Traspaso para las actividades posteriores
Qué ganas
Una plataforma de datos con gobierno centralizado en Unity Catalog y una ruta de salida de las bodegas heredadas que hoy te cuestan licencia y mantención.
Preguntas frecuentes
Gobierno de datos centralizado: permisos, linaje y catálogo en un solo lugar, en vez de repartidos por espacio de trabajo.
Databricks da más control sobre el motor Spark y calza mejor con equipos de ingeniería de datos maduros. Fabric integra mejor con Power BI y el ecosistema Microsoft.
Sí, están entre los orígenes soportados, algunos en modalidad piloto. Se valida en el dimensionamiento.