[general_dat] Optativa 2do Cuatrimestre: Machine Learning y Modelado Predictivo

Dirección Ciencias de Datos Exactas UBA direccion.lcd at exactas.uba.ar
Wed Jul 29 12:00:52 -03 2026


Hola!

Les escribo para comentarles que en el segundo cuatrimestre de 2026, el
Prof. Sebastián Ríos Pérez de la Universidad de Chile, dictará en forma
virtual la materia optativa "Machine Learning y Modelado Predictivo" como
invitado del Instituto de Cálculo de la FCEN.

Este curso brinda una formación integral en aprendizaje automático y
modelado predictivo, abarcando todas las etapas del desarrollo de modelos,
desde el pre-procesamiento de datos hasta su validación e interpretación.
Los estudiantes aprenderán a implementar pipelines reproducibles, comparar
y optimizar modelos mediante métricas apropiadas, diagnosticar problemas
como sesgo, sobreajuste y desbalance, interpretar predicciones utilizando
técnicas modernas como SHAP y aplicar métodos avanzados de regularización,
optimización bayesiana y modelos de ensamble para construir soluciones
predictivas robustas y confiables.

El programa de la materia se encuentra a continuación.

Esta materia tiene una carga total de 32 hs. y será dictada en forma
virtual. Está siendo presentada como materia optativa de la Licenciatura en
Ciencias de Datos y su reconocimiento está en trámite por lo que hemos
habilitado un formulario de inscripción provisoria:

https://docs.google.com/forms/d/e/1FAIpQLScoAWzMWM6ZSrHqQFxSlnzwdZYquVC49quHO-e7Nr7zc1m2Xg/viewform?usp=header


Cualquier duda, pueden escribirme a anambianco at gmail.com


Saludos,

Ana M. Bianco


#####################
Programa


Unidad 1. Introducción y problemas clásicos:
Fundamentos ML & Herramientas para Gestión de Proyectos DS
Conceptos: - Taxonomía ML (supervisado/unsupervised,
regresión/clasificación) - Generalización: train/val/test, validación
cruzada - Sesgo vs varianza
Herramientas prácticas: - Estructura de carpetas reproducible - Jupyter
Notebooks + Colab best practices - Git básico: commits, branches, pull
requests - Versionado de datos (DVC intro) - Documentación con README y
docstrings - Requirements.txt y reproducibilidad.

Unidad 2. EDA & Limpieza de Datos:
• Análisis exploratorio
• Valores faltantes: imputación y validación de impacto
• Outliers: detección y decisión
• Encoding de categóricas
• Escalado y normalización
• Feature engineering: lógica y validación

Unidad 3.  Clasificación Binaria & Multiclase
• Regresión logística: odds, probabilidades calibradas
• Árboles de decisión: teoría y diagnósticos
• Desbalance: SMOTE, class weights, métricas apropiadas
• Threshold tuning: ROC, Precision-Recall
• Métricas: Precision, Recall, F1, AUC-ROC (nunca Accuracy sola)
MINI PROYECTO 1: Análisis Exploratorio + Limpieza de Dataset (Semana 6) —
25%

Unidad 4.  Ensemble Methods Fundamentales:
• Random Forests: teoría e importancia de features
• Gradient Boosting, XGBoost, LightGBM
• Stacking y blending
• Tuning de hiperparámetros: grid/random/Bayesian

Unidad 5.  Interpretabilidad & Explicabilidad
• Feature importance: tree-based, permutation
• SHAP: Shapley values, force plots, dependence plots, interaction
• LIME: explicaciones locales
• Análisis sistemático de errores
• Fairness y sesgo

Unidad 6.  Validación Avanzada & Gotchas
• Data leakage: tipos y prevención
• Temporal data: walk-forward validation, drift
• Producción: persistencia, monitoreo, retraining
• Reproducibilidad garantizada
• Tests estadísticos de diferencia

Evaluación General:

La evaluación comprenderá un Mini proyecto de Eda y Limpieza de Datos, un
segundo Mini proyecto de Clasificación y SHA y un proyecto final integrador.
Programa


Bibliografía General
Géron, A. (2019). Hands-On Machine Learning with Scikit-Learn, Keras, and
TensorFlow: Concepts, Tools, and Techniques to Build Intelligent Systems
(2da ed.). O'Reilly Media.

James, G., Witten, D., Hastie, T., & Tibshirani, R. (2021). An Introduction
to Statistical Learning: with Applications in R (2da. ed.). Springer.

Molnar, C. (2022). Interpretable Machine Learning (2da. ed.). Leanpub.
Disponible gratuitamente en: https://christophm.github.io/interpretable-ml/


Más información sobre la lista de distribución general_dat