Diego PérezDirección de analítica e IA
EN ES
Método · 04

Elegir la métrica es elegir el error

2026 Nota 04 de 04

En septiembre de 2026 terminé el programa Artificial Intelligence Technologies Specialist del Tecnológico de Monterrey: catorce cursos, cada uno cerrado con un problema real por resolver. Lo que me quedó no fue ningún modelo. Fue que el resultado dependía, cada vez, de una métrica elegida antes de ver la salida.

El modelo que parecía mejor

Uno de los problemas era la calidad del aire hora por hora en el Área Metropolitana de Monterrey: anticipar las horas en que las partículas finas pasan el límite de la norma. Esas horas son la minoría, poco menos de una de cada cinco.

Entrenado sin pesos de clase, el bosque aleatorio tenía la mejor exactitud de las dos versiones. También dejaba pasar sin aviso el 92% de las contingencias. Acertaba porque aprendió a decir "el aire está bien", que es cierto casi siempre e inútil justo cuando importa.

La exactitud premia a quien le da la razón a la mayoría. Cuando el caso caro es el raro, es el número equivocado para optimizar, y no te lo va a avisar.

El promedio que esconde la clase

Otro era clasificar lesiones de piel en imágenes con PyTorch. El modelo llegó a 75% de exactitud en prueba, que se lee bien hasta que abres el reporte por clase: en dermatofibroma, 17 imágenes de prueba, el F1 fue cero. No acertó ni una.

Mismo modelo, mismas predicciones, dos resúmenes honestos. El F1 ponderado fue 0.74 y el F1 macro, 0.48. El primero responde "qué tan seguido acierta"; el segundo, "si acierta con cada tipo de caso". Cuál va en la lámina es una decisión sobre a quién estás dispuesto a fallarle, y merece tomarse en voz alta.

La línea base que casi gana

El problema de aprendizaje por refuerzo era repartir regalos a un grupo de personas con un inventario limitado. El agente entrenado llegó al 96% de la mejor asignación posible. Suena a resultado hasta que le pones al lado una regla codiciosa que cualquiera escribe en diez líneas: 94%.

Con cinco personas la diferencia era de tres décimas. Solo se abrió con ocho personas y poco inventario, cuando una elección temprana empieza a limitar las demás. Ese es el hallazgo de verdad: el agente vale su complejidad en unas condiciones y en otras no, y sin la línea base simple nadie habría sabido en cuáles.

Es el mismo argumento del grupo de control de la nota 02. Un número sin nada contra qué compararlo todavía no es un resultado.

El número que no pasó

El último es del que más orgulloso estoy. Una red convolucional entrenada desde cero para clasificar amenazas aéreas llegó a 0.49 de exactitud. La rúbrica pedía 0.70. El modelo preentrenado sí llegó, con 0.71.

Hacer pasar el modelo desde cero era cuestión de barajar la muestra hasta que se viera mejor. Lo entregué con 0.49 y con la razón por la que no llegaba. Una cifra ajustada para pasar la prueba mide el ajuste, no el modelo, y ese hábito cuesta mucho más quitárselo cuando del otro lado hay dinero de verdad.

Qué cambia cuando un agente actúa sobre ella

En un cuaderno, una métrica mala produce un gráfico engañoso. En producción, un agente que actúa sobre una métrica hereda cada punto ciego que esa métrica tiene, y actúa sobre ellos a escala, en cada ciclo, sin preguntar.

Por eso, antes de que un agente mío toque una decisión real, quedan cuatro cosas por escrito. La métrica principal, declarada antes del primer resultado. El error que se le permite cometer, dicho en términos del negocio: una tienda con inventario parado o un estante vacío, una alerta perdida o una falsa alarma. Una línea base deliberadamente simple que tiene que superar. Y el resultado abierto por segmento, porque el promedio es donde se esconde la clase que importa.

La credencial se puede verificar en credential.net. Las cifras de arriba salen de los proyectos de los cursos del programa.