
Ingeniería de datos
Diseño, implementación y optimización de flujos de datos en PythonBy José OrtegaLength12h 48m
About this audiobook
Este libro es una guía esencial para quienes desean dominar los conceptos y técnicas de
ingeniería de datos. A través de un enfoque
teórico-práctico, se exploran los métodos para la
ingesta, almacenamiento y procesamiento eficiente de datos, con énfasis en el uso de
Python y otras tecnologías clave.
Los lectores aprenderán sobre la importancia de los datos en las organizaciones, comprendiendo las funciones y responsabilidades de la ingeniería de datos. Además, se profundiza en las tecnologías y herramientas disponibles para extraer datos de diferentes sistemas y aplicaciones. El libro guía a los usuarios en la implementación de
modelos de almacenamiento que faciliten el análisis eficiente y en la
programación de scripts para el procesamiento de datos en tiempo real.
A lo largo del libro, se desarrollan ejemplos prácticos para afianzar los conocimientos, permitiendo a los lectores
crear y ejecutar scripts en Python desde la consola. A través de la web del libro está disponible un repositorio con todos los ejemplos analizados para que los lectores puedan realizar pruebas y asimilar los contenidos teóricos.
Esta obra es ideal para quienes buscan una comprensión profunda y práctica de la ingeniería de datos, sus tecnologías y aplicaciones en el procesamiento de grandes volúmenes de información.
El libro contiene material adicional que podrá descargar accediendo a la ficha del libro en
www.ra-ma.es.
Audiobook details
Rating★★★★ 4.5 (13)
Includes Amazon
GenreTechnology
Length12 hrs 48 mins
Narrated byListen with 1,000+ voices
FormateBook with Audio
Publish dateFeb 5, 2025
LanguageSpanish
Table of contents
1Informática
2INTRODUCCIÓN
31.1 INTRODUCCIÓN
41.2 IMPORTANCIA DE LOS DATOS EN LAS ORGANIZACIONES
5Capítulo 1. INGENIERÍA DE DATOS 17
Show all chaptersShow less
61.3 CICLO DE VIDA DE LOS DATOS
71.3.1 Ingesta y almacenamiento
81.3.2 Procesamiento y preparación
91.4 ROL DE INGENIERO/A DE DATOS
101.5 INGESTA DE DATOS
11Los destinos donde se almacenan los datos son:
121.5.2 Arquitectura de la capa de ingesta
131.5.3 Herramientas de ingesta de datos
141.5.4 AWS Glue
151.6 PROCESAMIENTO Y PREPARACIÓN
161.6.1 Tipos de procesamiento de datos
171.6.2 Procesamiento batch
181.6.3 Procesamiento streaming
191.7 ALMACENAMIENTO
201.7.1 Big Data
211.7.2 Almacenamiento distribuido
221.7.3 Elegir una herramienta ETL para trabajar en Big Data
23Capítulo 1. INGENIERÍA DE DATOS 29
24Figura 1.2. Esquema con las tres fases ETL: Extract, Transform, Load
251.8.1 Extracción
261.8.2 Transformación
271.8.3 Carga
281.8.4 Herramientas ETL
291.8.5 Herramientas de orquestación de flujos de datos
301.9 TÉCNICAS DE EXTRACCIÓN DE DATOS
311.9.2 Ingesta en tiempo real
321.9.3 Change Data Capture
331.10.1 Definición de pipeline
34Figura 1.6. Definición de pipeline de datos
351.10.2 Fases de un pipeline de datos
361.10.3 Pipeline iterativo
371.11 FUENTES DE DATOS
38datos, transformación de datos y consolidación de datos.
391.11.1 Bases de datos
40Capítulo 1. INGENIERÍA DE DATOS 43
411.12 FORMATOS ANALÍTICOS
42(Sales):
431.12.1 Apache Avro
441.12.2 Fastavro
45# Leemos el csv mediante pandas df = pd.read_csv(‘ventas.csv’,sep=’;’)
461.12.4 Parquet
471.12.6 Apache ORC
481.12.7 Comparando formatos
492.1 INTRODUCCIÓN
502.2 DEFINICIÓN DE DATA LAKE