Ponte en Contacto

Temario del curso

Introducción

Comprensión del Big Data

Visión general de Spark

Visión general de Python

Visión general de PySpark

  • Distribución de datos usando el marco de trabajo de Resilient Distributed Datasets
  • Distribución de cómputo usando operadores de la API de Spark

Configuración de Python con Spark

Configuración de PySpark

Uso de instancias EC2 de Amazon Web Services (AWS) para Spark

Configuración de Databricks

Configuración del clúster AWS EMR

Aprendizaje de las bases de la programación en Python

  • Introducción a Python
  • Uso del Jupyter Notebook
  • Uso de variables y tipos de datos simples
  • Trabajo con listas
  • Uso de instrucciones if
  • Uso de entradas del usuario
  • Trabajo con bucles while
  • Implementación de funciones
  • Trabajo con clases
  • Trabajo con archivos y excepciones
  • Trabajo con proyectos, datos y API

Aprendizaje de las bases de Spark DataFrame

  • Introducción a Spark DataFrames
  • Implementación de operaciones básicas con Spark
  • Uso de Groupby y operaciones de agregación
  • Trabajo con marcas de tiempo y fechas

Trabajo en un ejercicio de proyecto de Spark DataFrame

Comprensión del aprendizaje automático con MLlib

Trabajo con MLlib, Spark y Python para el aprendizaje automático

Comprensión de las regresiones

  • Aprendizaje de la teoría de la regresión lineal
  • Implementación de un código de evaluación de regresión
  • Trabajo en un ejercicio de ejemplo de regresión lineal
  • Aprendizaje de la teoría de la regresión logística
  • Implementación de un código de regresión logística
  • Trabajo en un ejercicio de ejemplo de regresión logística

Comprensión de los bosques aleatorios y los árboles de decisión

  • Aprendizaje de la teoría de métodos de árboles
  • Implementación de códigos de árboles de decisión y bosques aleatorios
  • Trabajo en un ejercicio de ejemplo de clasificación con bosques aleatorios

Trabajo con clústerización K-means

  • Comprensión de la teoría de clústerización K-means
  • Implementación de un código de clústerización K-means
  • Trabajo en un ejercicio de ejemplo de clústerización

Trabajo con sistemas de recomendación

Implementación del procesamiento de lenguaje natural

  • Comprensión del Procesamiento de Lenguaje Natural (NLP)
  • Visión general de las herramientas de NLP
  • Trabajo en un ejercicio de ejemplo de NLP

Streaming con Spark en Python

  • Visión general del streaming con Spark
  • Ejercicio de ejemplo de Spark Streaming

Requerimientos

  • Conocimientos generales de programación

Público objetivo

  • Desarrolladores
  • Profesionales de TI
  • Científicos de datos
 21 Horas

Número de participantes


Precio por participante

Reseñas (6)

Próximos cursos

Categorías Relacionadas