Sección 1 de 5
Del archivo CSV a un DataFrame
Lee un CSV, filtra filas y resume ventas con groupby.
Al terminar podrás
Leer un archivo CSV con pandas, filtrar filas y agrupar ventas para obtener un resumen sencillo.
- Duración
- 40 min
- Nivel
- Aplicar
- Secciones
- 5
- Reconocimiento
- Constancia verificable
En las lecciones anteriores trabajaste con valores, listas y diccionarios. Ahora pasarás a pandas, una biblioteca de Python diseñada para trabajar con datos tabulares. Su estructura central es el DataFrame: una tabla con filas y columnas que puedes filtrar, transformar y resumir mediante código.
Seguiremos con un conjunto ficticio de ventas de una tienda. El archivo ventas_tienda.csv contiene las columnas fecha, sucursal, producto, cantidad y precio. En Google Colab, abre el panel Archivos de la barra lateral y usa Subir al almacenamiento de sesión para seleccionar el CSV. Ese archivo queda disponible en la sesión de Colab.
En una celda de código escribirías import pandas as pd y después ventas = pd.read_csv("ventas_tienda.csv"). Al pulsar Ejecutar, pandas lee el archivo y crea el DataFrame ventas. Para observar las primeras filas puedes usar ventas.head(). En el Campus Digital no se ejecutará este código: aquí practicarás qué hace cada instrucción y qué salida esperar.
Ordena la carga del CSV
Esta actividad necesita JavaScript.
Sección 2 de 5
Seleccionar columnas y filtrar filas
Supón que el DataFrame contiene cinco ventas ficticias: Centro–Café–2–180; Norte–Té–3–120; Centro–Galletas–5–45; Sur–Café–1–180; Norte–Galletas–4–45. Para concentrarte en ventas con tres o más unidades, puedes escribir ventas_grandes = ventas[ventas["cantidad"] >= 3].
Lee el filtro de adentro hacia afuera. Primero, ventas["cantidad"] >= 3 pregunta fila por fila si la cantidad cumple el criterio. Después, ventas[ ... ] conserva únicamente las filas donde la respuesta fue verdadera. En este ejemplo permanecerían las ventas con cantidades 3, 5 y 4.
Filtrar no cambia automáticamente el DataFrame original cuando asignas el resultado a otro nombre. Esto te permite conservar ventas y trabajar con una versión como ventas_grandes para responder una pregunta específica.
Decide qué filas permanecen
Esta actividad necesita JavaScript.
Sección 3 de 5
Crear un importe y resumir con groupby
Para responder preguntas de negocio necesitas combinar columnas. En las ventas ficticias, el importe de cada fila puede calcularse con ventas["importe"] = ventas["cantidad"] * ventas["precio"]. pandas realiza la multiplicación fila por fila y guarda el resultado en una nueva columna llamada importe.
Después puedes resumir por sucursal: ventas.groupby("sucursal")["importe"].sum(). La lectura es: agrupa las filas por el valor de sucursal, toma la columna importe y suma dentro de cada grupo. Con los cinco registros del ejemplo, Centro suma 585, Norte 540 y Sur 180.
La figura resume el flujo completo. Primero entra el archivo, luego se convierte en DataFrame, después se seleccionan o transforman filas y finalmente se agrupan datos para responder una pregunta.
Elige la operación pandas
Esta actividad necesita JavaScript.
Sección 4 de 5
Cierre: traduce una pregunta a pasos de análisis
Una pregunta como “¿qué sucursal vendió más importe en estos registros?” no se resuelve con una sola palabra de Python. Se convierte en una secuencia: cargar los datos, verificar las columnas, calcular importe, agrupar por sucursal y sumar. La programación se vuelve más clara cuando cada línea responde a una parte de esa secuencia.
En la siguiente lección trabajarás con un problema inevitable en datos reales: valores faltantes, filas duplicadas y columnas con tipos incorrectos. Antes de resumir, tendrás que decidir si los datos están listos para ser usados.
Comprueba tu flujo pandas
Esta actividad necesita JavaScript.
Sección 5 de 5