Contacta con nosotros

Temario del curso

Introducción

Comprensión del Big Data

Descripción general de Spark

Descripción general de Python

Descripción general de PySpark

  • Distribución de datos mediante el marco Resilient Distributed Datasets (RDD)
  • Distribución de la computación usando operadores de la API de Spark

Configuración de Python con Spark

Configuración de PySpark

Uso de instancias EC2 de Amazon Web Services (AWS) para Spark

Configuración de Databricks

Configuración del clúster AWS EMR

Aprendizaje de los fundamentos de la programación en Python

  • Primeros pasos con Python
  • Uso de Jupyter Notebook
  • Uso de variables y tipos de datos simples
  • Trabajo con listas
  • Uso de sentencias if
  • Uso de entradas del usuario
  • Trabajo con bucles while
  • Implementación de funciones
  • Trabajo con clases
  • Trabajo con archivos y excepciones
  • Trabajo con proyectos, datos y APIs

Aprendizaje de los fundamentos del Spark DataFrame

  • Primeros pasos con DataFrames de Spark
  • Implementación de operaciones básicas con Spark
  • Uso de agrupaciones por (groupby) y operaciones de agregación
  • Trabajo con marcas de tiempo y fechas

Realización del ejercicio práctico de un proyecto Spark DataFrame

Comprensión del aprendizaje automático con MLlib

Trabajo con MLlib, Spark y Python para el aprendizaje automático

Comprensión de las regresiones

  • Aprendizaje de la teoría de la regresión lineal
  • Implementación de código para evaluar una regresión
  • Realización del ejercicio de ejemplo de regresión lineal
  • Aprendizaje de la teoría de la regresión logística
  • Implementación de código para la regresión logística
  • Realización del ejercicio de ejemplo de regresión logística

Comprensión de los bosques aleatorios (Random Forests) y árboles de decisión

  • Aprendizaje de la teoría de los métodos basados en árboles
  • Implementación de códigos para árboles de decisión y bosques aleatorios
  • Realización del ejercicio de ejemplo de clasificación con bosques aleatorios

Trabajo con agrupamiento K-means

  • Comprensión de la teoría del agrupamiento K-means
  • Implementación de código para el agrupamiento K-means
  • Realización del ejercicio de ejemplo de agrupamiento

Trabajo con sistemas de recomendación

Implementación de procesamiento de lenguaje natural

  • Comprensión del procesamiento de lenguaje natural (NLP)
  • Descripción general de las herramientas de NLP
  • Realización del ejercicio de ejemplo de NLP

Transmisión de datos (Streaming) con Spark en Python

  • Descripción general del streaming con Spark
  • Ejercicio de ejemplo de streaming con Spark

Observaciones finales

Requerimientos

  • Habilidades generales de programación

Audiencia objetivo

  • Desarrolladores
  • Profesionales de TI
  • Científicos de datos
 21 Horas

Número de participantes


Precio por participante

Reseñas (6)

Próximos cursos

Categorías Relacionadas