D

Glosario

23 conceptos que tienes que tener en la cabeza

Cada termino esta definido en su contexto y enlazado desde los capitulos donde se usa.

Dificultad: introductorio intermedio avanzado

M0 Fundamentos para Machine Learning

Tipado dinamico

I

Modelo de Python en el que el tipo se asocia al valor en tiempo de ejecucion y no necesita declararse antes de asignar una variable.

Ej: precio = 19.99 crea una variable float sin declarar el tipo.

f-string

I

Cadena formateada que permite insertar expresiones de Python dentro de llaves y controlar su presentacion.

Ej: f"Total: ${total:.2f}"

Guard clause

I

Validacion temprana que resuelve un caso borde y retorna antes de ejecutar la logica principal.

Ej: if not valores: return 0

Modelo relacional

I

Forma de organizar datos en tablas relacionadas mediante filas, columnas y claves.

NULL en SQL

I

Valor que representa un dato desconocido o ausente. No equivale a cero ni a una cadena vacia y se consulta con IS NULL.

GROUP BY

I

Clausula SQL que agrupa filas para aplicar funciones de agregacion como SUM, COUNT o AVG.

HAVING

I

Clausula que filtra grupos despues de una agregacion. WHERE filtra filas antes de agrupar.

Problem statement

I

Descripcion verificable del problema de negocio, el objetivo, el target, las restricciones y la metrica de exito.

Variable objetivo (target)

I

Variable que un modelo intenta predecir o explicar. Debe tener una definicion operativa y un horizonte temporal claros.

M1 Fundamentos de Bases de Datos

Esquema relacional

I

Definicion estructural de tablas, columnas, tipos, restricciones y relaciones de una base de datos.

DML

I

Data Manipulation Language: conjunto de sentencias para consultar y modificar datos, principalmente SELECT, INSERT, UPDATE y DELETE.

DCL

I

Data Control Language: sentencias para administrar permisos y acceso a datos, como GRANT y REVOKE.

Normalizacion

I

Proceso de organizar tablas para reducir redundancia y evitar dependencias incorrectas, usando formas normales.

SQLite

I

Motor de base de datos relacional embebido, sin servidor, que almacena una base completa en un archivo local.

Pipeline de datos

I

Secuencia reproducible de pasos para extraer, transformar, validar y entregar datos a un consumidor o modelo.

Aprendizaje supervisado

I

Tipo de Machine Learning que aprende una relacion entre variables de entrada y una etiqueta objetivo conocida.

Aprendizaje no supervisado

I

Tipo de Machine Learning que busca estructura o patrones en datos sin una etiqueta objetivo proporcionada.

M3 Introducción a Machine Learning y Data Acquisition I

Ciclo de vida de Machine Learning

I

Secuencia iterativa que va de la pregunta de negocio a la adquisicion, preparacion, modelado, evaluacion y despliegue. Cada etapa condiciona la siguiente y la evaluacion puede obligar a volver a los datos.

Data acquisition

I

Proceso de obtener datos desde una fuente externa (archivo, API, base) y dejarlos disponibles para validar, transformar y analizar dentro del pipeline.

Ej: Leer ventas_mensuales.csv con pandas y configuracion_tienda.json con json.load registrando origen y encoding.

Imputación por mediana

I

Reemplazo de valores faltantes numéricos por la mediana de la columna. Es robusta a valores extremos, a diferencia de la media.

Ej: gasto_mensual con valores [150, 250, 300, 400, 50000] → mediana 300, media 10220.

train_test_split

I

Función de scikit-learn que divide un dataset en conjuntos de entrenamiento y prueba. test_size controla la proporción y random_state garantiza reproducibilidad.

Ej: train_test_split(X, y, test_size=0.2, random_state=123) → 80% train, 20% test reproducibles.

Data leakage

I

Fuga de información del conjunto de test o del futuro hacia el entrenamiento. Produce métricas artificialmente optimistas que colapsan en producción.

Ej: Calcular la mediana o ajustar un scaler sobre todo el dataset antes de separar train/test.

pathlib.Path

I

Módulo de Python para manejar rutas de archivos de forma portable entre sistemas operativos. Evita rutas absolutas hardcodeadas y resuelve separadores automáticamente.

Ej: Path("data") / "ventas.csv" en lugar de "C:\\Users\\...\\ventas.csv"