Curso: Herramientas Estadísticas y Computacionales para el Análisis de Datos en Investigación Bioquímica
Sesión 1: Introducción a Python y manejo de datos experimentales
Docente: Andrés García Medina
Contacto: andgarm.n@gmail.com
Tiempo sugerido: 60 minutos de trabajo + 30 minutos de discusión
Modalidad: parejas
Entregable: notebook completo, datos limpios, bitácora de datos y una breve conclusión.
Recibiste una tabla de absorbancia a 405 nm procedente de un experimento con cinco niveles de pH, tres temperaturas, tres réplicas biológicas y dos réplicas técnicas. La tabla contiene problemas de captura deliberados.
Tu objetivo no es construir un
conjunto de datos limpios (preprocesados) trazable.
Nota: Los datos son sintéticos.
Conserva intacto el archivo de datos crudos. Realiza la limpieza mediante código y guarda el resultado en un archivo nuevo.
Mantén los valores originales. Cuando corrijas o transformes una variable, conserva la columna original y crea una nueva columna con el resultado.
No adivines ni corrijas sin evidencia. Utiliza únicamente el protocolo, la bitácora o el registro de correcciones del laboratorio. Si no existe evidencia suficiente, conserva el valor como faltante y documenta el problema.
Registra cada cambio en una bitácora de datos. Indica la muestra, la variable, el valor original, el valor corregido, la razón del cambio y la fuente que lo justifica.
Verifica el diseño experimental después de la limpieza. Comprueba que continúen representados los tratamientos, las condiciones experimentales y las réplicas biológicas y técnicas esperadas.
import numpy as np
import pandas as pd
import matplotlib.pyplot as plt
import seaborn as sns
Importa el archivo crudo en datos_actividad_enzimatica_crudos.csv. Reporta dimensiones, columnas, tipos, valores faltantes, duplicados exactos y duplicados del identificador
muestra_id.
# TODO 1: importa y audita la tabla.
# datos_raw = ...
# print(...)
En una base de laboratorio, una columna puede parecer numérica y, aun así, ser importada como texto. Esto sucede cuando contiene unidades, espacios, comas decimales o anotaciones.
Examina valores únicos de ph, temperatura_c, tiempo_reaccion_min y
operador. Explica por qué las columnas que deberían ser numéricas pueden
haber sido interpretadas como texto.
# TODO 2: muestra valores únicos y formula tu diagnóstico.
Crea datos como copia. Conserva las versiones originales de las columnas
problemáticas y genera columnas normalizadas:
ph_numtemperatura_c_numtiempo_reaccion_min_numoperador_limpioEl valor 120 s equivale a 2 minutos.
# TODO 3: transforma sin perder los valores originales.
Elimina solamente duplicados exactos. Después verifica:
# TODO 4: elimina duplicados exactos y crea indicadores de calidad.
Importa registro_correcciones_laboratorio.csv. Aplica las correcciones por
muestra_id y campo. Documenta cuántos valores se corrigieron y de qué fuente
procedieron.
# TODO 5: aplica las correcciones verificadas. No imputes por promedio.
Calcula:
$ \text{actividad (U/mL)} = \frac{A_{final}-A_{inicial}}{\text{tiempo (min)}}\times 10 $
La constante 10 es una escala didáctica de este conjunto sintético.
# TODO 6: crea actividad_u_ml y confirma que no existan valores faltantes.
Debe haber seis mediciones por combinación de pH y temperatura (3 biológicas × 2 técnicas). Construye una tabla de conteos y una gráfica exploratoria de actividad por pH, separada por temperatura.
# TODO 7: tabla de conteos y gráfica.
Exporta:
actividad_enzimatica_limpia_equipo.csvbitacora_calidad_equipo.csvEscribe una conclusión de 100 a 150 palabras que responda:
# TODO 8: exporta sin sobrescribir los datos crudos.
Escribe aquí tu conclusión.