
Big data con python
Recolección, almacenamiento y procesoBy Rafael Caballero Roldán, Enrique Martín Martín, Adrián Riesco RodríguezLength11h 27m
About this audiobook
Para lograr analizar datos y convertirlos en información, el primer paso es ser capaz de incorporarlos a nuestro programa, esto es, cargar los datos. En este capítulo discutimos la adquisición de datos desde fichero, por lo que en primer lugar es necesario plantearse una serie de preguntas: ¿qué son datos? ¿Su adquisición se limita a descargar datos de internet? ¿Es capaz el lenguaje Python de entender cualquier fuente de información, tales como texto, imágenes, audio y vídeo? ¿Puedo obtener información de cualquier fuente, como páginas oficiales del gobierno, periódicos, redes sociales y foros de opinión?
Aunque en general entendemos por datos cualquier tipo de información que se almacena en un ordenador, en el contexto de este libro usaremos datos para referirnos a colecciones de elementos con una serie de atributos.
Audiobook details
GenreTechnology
Length11 hrs 27 mins
Narrated byListen with 1,000+ voices
FormateBook with Audio
Publish dateOct 30, 2019
LanguageSpanish
Table of contents
1BIG DATA CON PYTHON
2BIG DATA CON PYTHON: RECOLECCIÓN, ALMACENAMIENTO Y PROCESO
3CAPÍTULO 1: LECTURA DE FICHEROS
4>>> import csv
5EXCEL
Show all chaptersShow less
6libro
7Obsérvese que, por ejemplo, la casilla A3 (con valor AMPA ANTONIO MACHADO)
8>>> libro_escr = xlwt.Workbook()
93 AMPA BACHILLER ALONSO LOPEZ
10XML
112 Véase https://docs.python.org/3/library/xml.html#xml-vulnerabilities para más
12raíz:
13REFERENCIAS
14consulta se incluye con la forma v=codificaciónDeLaConsulta.
15>>> import matplotlib.pyplot as plt >>> import csv
16<elemento atributo="valor">Contenido</elemento>
17<p>…</p>: un nuevo párrafo.
18Hay 4 atributos que podremos encontrar en la mayoría de elementos HTML:
19Navegación absoluta
20biblioteca requests:
21python -m pip install selenium
22>>> ulti = driver.find_elements_by_xpath( "(//label)[last()]") >>> print(ulti[0].text)
23etiqueta de esta clase, el fragmento de código muestra 38026A035000010000EI.
24BÚSQUEDA PUNTUAL DE TWEETS
25http://www.omdbapi.com/?apikey=XXX&s=The%20Matrix&type=movie
26REFERENCIAS
27BIG DATA CON PYTHON: RECOLECCIÓN, ALMACENAMIENTO Y PROCESO
28CAPÍTULO 4: MONGODB
29mongo -port 28000
30Ejemplo: inserción de tweets aleatorios
31Estructura general de find
32ARRAYS
33> db.tweets.aggregate([ {$sortByCount: "$usuario.nick"} ])
34la siguiente
35$lookup
36[ {$match:{"RT":true}}, {$unwind:"$mentions"}, {$sortByCount: "$mentions"}, ])
37aparece que Bertoldo se ha dado de baja. Podemos escribir:
38CAPÍTULO 4: MONGODB
39CAPÍTULO 5: APRENDIZAJE AUTOMÁTICO CON SCIKIT-LEARN
401 𝑛
41S
42Clasificación
43>>> train_X, train_y, test_X, test_y = split_label(titanic, 0.2, ‘Fare’)
44Análisis de grupos
45OPTIMIZACIÓN DE HIPERPARÁMETROS
46>>> r = sc.parallelize(["hola", "hi", "ciao"])
47>>> r.reduce(lambda x,y: x+y) 15
48map y flatMap
49RDDs de parejas
50CAPÍTULO 6: PROCESAMIENTO DISTRIBUIDO CON SPARK