Cuaderno de operación · Detección de mulas
Falsos positivos en la detección de mulas: el coste de bloquear a un cliente legítimo
Métricas de precisión que importan más allá del recall
Publicado el 14 de marzo · Lectura de 7 minutos · Equipo de riesgo operativo
Un modelo con recall del 0,93 sobre un conjunto de validación se ve impecable en la presentación trimestral. En producción, ese mismo modelo puede estar bloqueando cada mañana a decenas de clientes que cobran su nómina el día 1 y mueven el saldo a una cuenta de ahorro a las 9:07. La diferencia entre ambos escenarios no está en el algoritmo: está en el umbral y en el segmento sobre el que se aplica.
Cuando desplegamos la primera versión del clasificador de cuentas mula en un entorno retail, el equipo de fraude celebró el recall. A las tres semanas, el centro de atención al cliente recibió un 22% más de reclamaciones por operaciones retenidas. Ninguna de esas reclamaciones aparecía en la matriz de confusión. Ese es el punto ciego que este texto intenta poner sobre la mesa.
Por qué el recall alto no basta
El recall mide qué proporción de mulas reales detectamos. La precisión mide qué proporción de lo que bloqueamos era realmente una mula. En un problema con prevalencia baja, como el fraude de cuentas puente, un modelo puede alcanzar recall alto a costa de una precisión mediocre sin que nadie lo note en el informe. Si en una cartera de 100.000 transferencias diarias hay 40 casos de mula, un clasificador que marque 800 operaciones sospechosas y acierte 32 tendrá recall del 80% y precisión del 4%. El resto, 768 bloqueos, son clientes con historial limpio.
El coste de cada falso positivo no es solo la llamada del cliente. Es la reclamación formal, la investigación manual del analista, la posible compensación por demora y, sobre todo, la erosión de confianza. Un cliente que ve su transferencia retenida dos veces en un mes cambia de banco. Esa pérdida no entra en la curva ROC.
Comparar curvas por segmento, no en agregado
La curva de precisión-recall agregada oculta diferencias enormes entre tipos de cuenta. Al desglosarla, aparecen tres patrones que se repiten:
- Cuentas nómina con más de cinco años de antigüedad: precisión alta incluso con umbrales agresivos, porque el comportamiento es estable y predecible.
- Cuentas nuevas de banca retail, abiertas en los últimos noventa días: precisión baja. El modelo no tiene historial suficiente y confunde la dispersión inicial de fondos con patrón de mula.
- Cuentas corporativas con múltiples firmantes: el volumen y la velocidad de las operaciones se parecen mucho a una cadena de dispersión, aunque el contexto sea completamente distinto.
Un mismo modelo, con el mismo umbral, puede tener una precisión del 71% en el primer grupo y del 19% en el segundo. Ajustar el umbral por segmento no es un lujo: es la diferencia entre un sistema usable y uno que genera más ruido que señal.
Antigüedad de la cuenta como variable de calibración
La antigüedad no es solo un dato descriptivo. Es un proxy de cuánta información tiene el modelo para juzgar. En cuentas con menos de treinta días, cualquier umbral agresivo produce falsos positivos masivos. La alternativa razonable es aplicar un umbral más conservador durante la fase de maduración y reservar la decisión dura para señales adicionales: dispositivo nuevo, cambio de huella biométrica, receptor sin historial previo con el emisor.
En banca corporativa el problema es distinto. Una empresa que paga a cien proveedores el mismo día genera un grafo de dispersión idéntico al de una red de mulas. La diferencia está en la consistencia temporal: la empresa repite el patrón cada mes, la red no. Incorporar esa periodicidad al modelo reduce los falsos positivos corporativos sin tocar el recall sobre el segmento retail.
Regla práctica que adoptamos tras el primer año: ningún umbral se fija en agregado. Cada segmento (retail nuevo, retail maduro, corporativo, nómina) tiene su propio punto de corte, revisado cada trimestre con datos de reclamaciones reales, no solo con la matriz de confusión del modelo.
Lo que no aparece en el informe del modelo
Las métricas de un clasificador se calculan sobre un conjunto etiquetado. Las reclamaciones se calculan sobre clientes reales que llaman enfadados. Entre ambos mundos hay una brecha que solo se cierra midiendo el coste operativo por falso positivo: minutos de analista, llamadas entrantes, compensaciones y bajas posteriores. Cuando ese coste se pone en la misma balanza que el coste de un falso negativo, la conversación sobre umbrales cambia por completo.
No se trata de bajar la guardia frente al fraude. Se trata de aceptar que un sistema de detección de mulas vive en un equilibrio incómodo, y que la precisión por segmento es tan importante como el recall global. Un modelo que detecta mucho pero bloquea a demasiados clientes legítimos termina siendo desactivado por el propio negocio, y entonces el recall baja a cero.