D

Glosario

92 conceptos que tienes que tener en la cabeza

Cada termino esta definido en su contexto y enlazado desde los capitulos donde se usa.

Dificultad: introductorio intermedio avanzado

M1 Industria 4.0 y el Ecosistema de Datos

Industria 4.0

I

Cuarta revolucion industrial: automatizacion inteligente, interconexion, y toma de decisiones basada en datos en tiempo real.

Ej: Una fabrica con sensores IoT en cada linea de produccion que ajustan parametros automaticamente.

Sistemas Ciberfisicos (CPS)

I

Integracion profunda de componentes fisicos (sensores, maquinas) y software que permite la comunicacion y toma de decisiones descentralizada.

Gemelo Digital

I

Replica virtual de un sistema fisico usada para simular, predecir y optimizar procesos antes de ejecutarlos en el mundo real.

IIoT (Industrial IoT)

I

Aplicacion del IoT especificamente en la industria: manufactura, energia, logistica. Sensores en maquinaria que reportan datos continuamente.

Ecosistema IoT-IoS-IoD-IoP

I

Flujo de datos en 4 capas: IoT captura, IoS procesa, IoD almacena, IoP visualiza para decision humana.

M2 Python para Data Science: mas alla de la sintaxis

List Comprehension

I

Sintaxis compacta de Python para generar o filtrar listas en una sola linea.

Ej: [x for x in lista if x > 0]

Closure

I

Funcion que "recuerda" el entorno y las variables locales de su ambito de creacion, incluso despues de que el ambito haya terminado.

Vectorizacion

I

Uso de operaciones sobre arrays completos (NumPy/Pandas) en lugar de bucles for, logrando velocidad 10-100x mayor.

M3 NumPy y Pandas: el motor de la manipulacion de datos

Broadcasting

I

Mecanismo de NumPy que permite operaciones entre arrays de distintas dimensiones ajustandolos automaticamente.

Series (Pandas)

I

Array unidimensional indexado de Pandas. Equivale a una columna de un DataFrame con etiquetas de fila.

DataFrame (Pandas)

I

Estructura bidimensional de Pandas: una o mas Series compartiendo el mismo indice. Es la estructura central para datos tabulares.

SettingWithCopyWarning

I

Warning de Pandas cuando intentas modificar un slice. Indica ambiguedad entre modificar el original o una copia.

Ej: Solucion: usar df.loc[mask, "col"] = valor, nunca df[mask]["col"] = valor

Tidy Data

I

Formato estandar donde cada variable es una columna, cada observacion es una fila, y cada tipo de unidad forma una tabla.

Split-Apply-Combine (Groupby)

I

Paradigma: dividir datos en grupos, aplicar una funcion, combinar resultados. Implementado en groupby().agg() y groupby().transform().

M4 Pandas avanzado: limpieza, series temporales y datos faltantes

Imputacion

I

Reemplazo de valores faltantes por sustitutos estadisticamente razonables (media, mediana, KNN, etc).

IQR (Rango Intercuartilico)

I

Diferencia entre el percentil 75 (Q3) y el percentil 25 (Q1). Usado para detectar outliers (> Q3 + 1.5*IQR o < Q1 - 1.5*IQR).

MCAR / MAR / MNAR

A

Tres mecanismos de datos faltantes: MCAR (completamente al azar), MAR (al azar dado lo observado), MNAR (no al azar - relacionado con el valor faltante).

Resample (Pandas)

I

Agregacion temporal: convierte serie de tiempo a otra frecuencia (D/W/M/Q/Y). Requiere DatetimeIndex ordenado.

M5 Visualizacion: contar historias con datos

Chart Junk

I

Elementos visuales innecesarios (cuadriculas gruesas, texturas 3D) que distraen de la informacion.

KDE (Kernel Density Estimation)

I

Tecnica no parametrica para estimar la funcion de densidad. Crea una curva suave en lugar de bloques como un histograma.

Paleta Colorblind-Safe

I

Paleta distinguible por personas con daltonismo. Varia luminosidad, no solo tono. Ej: viridis, cividis.

M6 Machine Learning basico: el primer modelo de verdad

Machine Learning

I

Campo donde los sistemas aprenden patrones desde datos sin estar programados explicitamente para cada caso.

Aprendizaje Supervisado

I

Tipo de ML con pares (X, y) etiquetados. El modelo aprende a mapear X -> y observando ejemplos historicos.

Features (X) y Target (y)

I

Features son las variables de entrada. Target es lo que queremos predecir: categorico (clasificacion) o numerico (regresion).

Overfitting

I

Cuando el modelo memoriza los datos de entrenamiento (alta accuracy en train) pero generaliza mal a datos nuevos (baja en test).

Underfitting

I

Cuando el modelo es demasiado simple y no captura la estructura real (bajo desempeno en train Y test).

Trade-off Bias-Variance

A

Bias alto = modelo simple que subajusta. Variance alta = modelo complejo que sobreajusta. El objetivo: encontrar el equilibrio.

Regresion Logistica

I

Algoritmo de CLASIFICACION (no regresion) que estima probabilidades con funcion sigmoide.

Arbol de Decision

I

Algoritmo que particiona el espacio de features recursivamente. Cada nodo pregunta una condicion.

Random Forest

I

Ensemble de muchos arboles. Cada arbol vota (clasificacion) o se promedia (regresion). Robusto, no requiere escalado.

K-Nearest Neighbors (KNN)

I

Algoritmo lazy que clasifica un punto segun la mayoria de sus K vecinos mas cercanos en el espacio de features.

Hiperparametros

I

Configuraciones que fijas ANTES del fit (max_depth, C, K). No se aprenden automaticamente.

Parametros del Modelo

I

Valores que el algoritmo aprende durante el fit (coeficientes en LR, splits en arboles).

Train-Test Split

I

Division de datos en entrenamiento (~80%) y prueba (~20%) para evaluar capacidad de generalizacion.

Cross-Validation (CV)

I

Tecnica que divide datos en k folds. El modelo se entrena k veces, rotando el fold de validacion. Reduce sesgo en la evaluacion.

M7 ML aplicado: pipelines, segmentacion y sistemas de recomendacion

Pipeline (scikit-learn)

I

Secuencia encadenada de transformaciones + modelo final. Automatiza flujo y previene data leakage.

ColumnTransformer

I

Aplica transformaciones distintas a columnas segun tipo (numericas/categoricas) y las une en una sola salida.

K-Means

I

Algoritmo de clustering que asigna cada punto al centroide mas cercano, minimizando inercia intra-cluster.

Analisis RFM

I

Framework de segmentacion: Recency (recencia), Frequency (frecuencia), Monetary (valor monetario).

Sistema de Recomendacion

I

Predice que items le gustaran a un usuario. Tipos: user-based, item-based, filtrado colaborativo, matrix factorization.

TimeSeriesSplit

A

Validacion cruzada para series temporales. Train en [0:t], val en [t:t+k], desplazandose. Evita mirar el futuro.

M8 Aprendizaje Supervisado profundo: regresion, metricas, cross-validation

Regresion Lineal

I

Modelo que ajusta un hiperplano minimizando suma de errores al cuadrado (OLS).

Ridge / Lasso

A

Variantes de regresion lineal con regularizacion L2 (Ridge) o L1 (Lasso) para evitar overfitting.

Data Leakage

A

Cuando informacion del test contamina el entrenamiento. Ej: imputar nulos con media global antes del split.

Accuracy

I

(TP + TN) / Total. Proporcion de predicciones correctas. Enganoso en clases desbalanceadas.

Precision

I

TP / (TP + FP). De los positivos predichos, cuantos eran correctos. Usala cuando FP son costosos.

Recall (Sensibilidad)

I

TP / (TP + FN). De los positivos reales, cuantos detectamos. Usala cuando FN son costosos.

F1-Score

I

Media armonica de Precision y Recall. 2*P*R / (P+R). Balanceada, util en desbalance.

ROC-AUC

A

Area bajo la curva ROC. Mide capacidad discriminante. Independiente del threshold. Bueno en clases balanceadas.

PR-AUC (Average Precision)

A

Area bajo la curva Precision-Recall. MEJOR que ROC-AUC en desbalance extremo (fraude, enfermedades raras).

MSE / RMSE / MAE

I

Metricas de regresion. MSE/RMSE penalizan errores grandes al cuadrado. MAE es mas robusto a outliers.

R-cuadrado

I

Proporcion de varianza en y explicada por el modelo. Rango 0-1. Mayor es mejor.

Escalado de Features

I

Llevar features a escala comun (StandardScaler media 0 std 1; MinMax rango [0,1]; Robust usa mediana+IQR).

One-Hot Encoding

I

Conversion de variable categorica en N columnas binarias (0/1), una por categoria.

Target Encoding

A

Reemplaza cada categoria con la media del target. Util con alta cardinalidad. Riesgo de leakage.

M9 Aprendizaje No Supervisado: clustering, asociacion y reduccion de dimensionalidad

Aprendizaje No Supervisado

I

Aprende estructura/patrones a partir de datos SIN etiquetas. Sin variable objetivo.

Clustering

I

Tecnica de agrupamiento que particiona observaciones en grupos homogeneos segun similitud.

Inercia (WCSS)

I

Suma de distancias cuadradas de cada punto a su centroide. K-Means la minimiza.

Silhouette Score

A

Metrica interna de clustering. Rango [-1, 1]. Mayor = mejor. Mide que tan bien asignado esta un punto.

Metodo del Codo (Elbow)

I

Tecnica para elegir K en K-Means. Graficar inercia vs K y buscar el "codo" donde agregar clusters ya no aporta.

Clustering Jerarquico Aglomerativo

I

Construye un arbol de clusters (dendrograma) de abajo hacia arriba. No requiere K de antemano.

Dendrograma

I

Diagrama en arbol que muestra la jerarquia de clusters. La altura de corte determina K.

Linkage (Jerarquico)

A

Criterio de distancia entre clusters: Ward (varianza), complete (max), average (promedio), single (min).

DBSCAN

A

Clustering basado en densidad. Encuentra clusters de forma arbitraria y marca outliers. Parametros: eps y min_samples.

eps (DBSCAN)

A

Radio de vecindad. Dos puntos estan "conectados" si su distancia es menor a eps.

min_samples (DBSCAN)

A

Minimo de puntos en la vecindad eps para que un punto sea "core" (centro de cluster).

Reglas de Asociacion

I

Patrones "si A entonces B" extraidos de datos transaccionales. Miden co-ocurrencia entre items.

Support (Soporte)

I

Fraccion de transacciones que contienen un itemset. Mide frecuencia de la combinacion.

Confidence (Confianza)

I

P(B|A). De las transacciones con A, que fraccion tiene B. Mide fuerza de la regla.

Lift (Elevacion)

A

Ratio entre confianza observada y esperada. = 1 independencia, > 1 correlacion positiva, < 1 negativa.

Apriori

I

Algoritmo clasico de reglas de asociacion. Genera candidatos y poda por support minimo.

FP-Growth

A

Algoritmo de asociacion mas eficiente que Apriori. Usa estructura de arbol (FP-Tree).

PCA (Principal Component Analysis)

A

Reduccion de dimensionalidad. Encuentra direcciones de maxima varianza y proyecta datos sobre ellas.

Componente Principal

A

Nueva variable (combinacion lineal de originales) que captura la mayor varianza posible.

Explained Variance Ratio

A

Fraccion de varianza total capturada por cada componente. Accesible via pca.explained_variance_ratio_.

Loadings (PCA)

A

Coeficientes que indican cuanto aporta cada feature original a cada componente principal.

t-SNE / UMAP

A

Tecnicas no lineales de reduccion para visualizacion 2D/3D. Preservan estructura local (t-SNE) o global (UMAP).

M10 Fundamentos de IA, Machine Learning y Produccion

IA vs ML vs Deep Learning

I

IA es el campo amplio. ML es subcampo (aprenden de datos). Deep Learning es subcampo de ML (redes neuronales profundas).

IA Generativa

I

Modelos que CREAN contenido nuevo (texto, imagenes, codigo). Ej: GPT-4, DALL-E, Stable Diffusion.

LLM (Large Language Model)

I

Modelo de lenguaje entrenado con miles de millones de parametros. Ej: GPT, LLaMA, Claude, Gemini.

Aprendizaje por Refuerzo (RL)

A

Paradigma donde un agente aprende a tomar decisiones maximizando recompensa acumulada.

Feature Engineering

I

Crear, transformar y seleccionar features para mejorar el modelo. La parte mas impactante de un proyecto.

GridSearchCV

I

Busqueda exhaustiva de hiperparametros. Prueba todas las combinaciones de un grid. Costoso para espacios grandes.

I

Busqueda aleatoria de hiperparametros. Muestrea N combinaciones. Mas eficiente que GridSearch para espacios grandes.

Optuna / Hyperopt

A

Frameworks de busqueda BAYESIANA de hiperparametros. Aprenden de iteraciones anteriores.

Data Drift

A

Cambio en la distribucion de los INPUTS entre train y produccion. Detectado con KS test o PSI.

Concept Drift

A

Cambio en la relacion X -> y entre train y produccion. El mundo cambio, el modelo quedo desactualizado.

joblib

I

Libreria de sklearn para serializar modelos y pipelines a disco. joblib.dump(pipeline, "modelo.joblib").

MLOps

A

Conjunto de practicas para llevar modelos de ML del notebook a produccion: pipelines, versionado, monitoreo, reentrenamiento.

SHAP (SHapley Additive exPlanations)

A

Tecnica de explicabilidad basada en teoria de juegos. Mide contribucion de cada feature a una prediccion individual.

MLflow

A

Plataforma open source para tracking de experimentos de ML. Registra parametros, metricas, modelos y artefactos.

FastAPI

I

Framework Python para construir APIs REST rapidas y tipadas. Muy usado para servir modelos de ML.