Cuaderno de operación · Detección de mulas

Falsos positivos en la detección de mulas: el coste de bloquear a un cliente legítimo

Métricas de precisión que importan más allá del recall

Publicado el 14 de marzo · Lectura de 7 minutos · Equipo de riesgo operativo

Un modelo con recall del 0,93 sobre un conjunto de validación se ve impecable en la presentación trimestral. En producción, ese mismo modelo puede estar bloqueando cada mañana a decenas de clientes que cobran su nómina el día 1 y mueven el saldo a una cuenta de ahorro a las 9:07. La diferencia entre ambos escenarios no está en el algoritmo: está en el umbral y en el segmento sobre el que se aplica.

Cuando desplegamos la primera versión del clasificador de cuentas mula en un entorno retail, el equipo de fraude celebró el recall. A las tres semanas, el centro de atención al cliente recibió un 22% más de reclamaciones por operaciones retenidas. Ninguna de esas reclamaciones aparecía en la matriz de confusión. Ese es el punto ciego que este texto intenta poner sobre la mesa.

Por qué el recall alto no basta

El recall mide qué proporción de mulas reales detectamos. La precisión mide qué proporción de lo que bloqueamos era realmente una mula. En un problema con prevalencia baja, como el fraude de cuentas puente, un modelo puede alcanzar recall alto a costa de una precisión mediocre sin que nadie lo note en el informe. Si en una cartera de 100.000 transferencias diarias hay 40 casos de mula, un clasificador que marque 800 operaciones sospechosas y acierte 32 tendrá recall del 80% y precisión del 4%. El resto, 768 bloqueos, son clientes con historial limpio.

El coste de cada falso positivo no es solo la llamada del cliente. Es la reclamación formal, la investigación manual del analista, la posible compensación por demora y, sobre todo, la erosión de confianza. Un cliente que ve su transferencia retenida dos veces en un mes cambia de banco. Esa pérdida no entra en la curva ROC.

Comparar curvas por segmento, no en agregado

La curva de precisión-recall agregada oculta diferencias enormes entre tipos de cuenta. Al desglosarla, aparecen tres patrones que se repiten:

  • Cuentas nómina con más de cinco años de antigüedad: precisión alta incluso con umbrales agresivos, porque el comportamiento es estable y predecible.
  • Cuentas nuevas de banca retail, abiertas en los últimos noventa días: precisión baja. El modelo no tiene historial suficiente y confunde la dispersión inicial de fondos con patrón de mula.
  • Cuentas corporativas con múltiples firmantes: el volumen y la velocidad de las operaciones se parecen mucho a una cadena de dispersión, aunque el contexto sea completamente distinto.

Un mismo modelo, con el mismo umbral, puede tener una precisión del 71% en el primer grupo y del 19% en el segundo. Ajustar el umbral por segmento no es un lujo: es la diferencia entre un sistema usable y uno que genera más ruido que señal.

Antigüedad de la cuenta como variable de calibración

La antigüedad no es solo un dato descriptivo. Es un proxy de cuánta información tiene el modelo para juzgar. En cuentas con menos de treinta días, cualquier umbral agresivo produce falsos positivos masivos. La alternativa razonable es aplicar un umbral más conservador durante la fase de maduración y reservar la decisión dura para señales adicionales: dispositivo nuevo, cambio de huella biométrica, receptor sin historial previo con el emisor.

En banca corporativa el problema es distinto. Una empresa que paga a cien proveedores el mismo día genera un grafo de dispersión idéntico al de una red de mulas. La diferencia está en la consistencia temporal: la empresa repite el patrón cada mes, la red no. Incorporar esa periodicidad al modelo reduce los falsos positivos corporativos sin tocar el recall sobre el segmento retail.

Regla práctica que adoptamos tras el primer año: ningún umbral se fija en agregado. Cada segmento (retail nuevo, retail maduro, corporativo, nómina) tiene su propio punto de corte, revisado cada trimestre con datos de reclamaciones reales, no solo con la matriz de confusión del modelo.

Lo que no aparece en el informe del modelo

Las métricas de un clasificador se calculan sobre un conjunto etiquetado. Las reclamaciones se calculan sobre clientes reales que llaman enfadados. Entre ambos mundos hay una brecha que solo se cierra midiendo el coste operativo por falso positivo: minutos de analista, llamadas entrantes, compensaciones y bajas posteriores. Cuando ese coste se pone en la misma balanza que el coste de un falso negativo, la conversación sobre umbrales cambia por completo.

No se trata de bajar la guardia frente al fraude. Se trata de aceptar que un sistema de detección de mulas vive en un equilibrio incómodo, y que la precisión por segmento es tan importante como el recall global. Un modelo que detecta mucho pero bloquea a demasiados clientes legítimos termina siendo desactivado por el propio negocio, y entonces el recall baja a cero.

Falsos positivos en la detección de mulas: el coste de bloquear a un cliente legítimo

El equipo que calibra precisión y recall en producción no trabaja solo con métricas agregadas. Cada ajuste de umbral pasa por manos que conocen el coste real de un bloqueo erróneo: la reclamación del cliente, la carga del equipo de soporte y la pérdida de confianza cuando una nómina no llega a tiempo.

Calibración de umbrales

Valeria Romero Herrera

Responsable de ajustar los puntos de corte por segmento de cuenta. Trabaja con las curvas de precisión y recall separadas para banca retail y banca corporativa, porque un mismo modelo se comporta de forma muy distinta según la antigüedad y el volumen habitual del titular. Su criterio: ningún umbral se aprueba sin revisar antes cuántos clientes legítimos caerían en el lado equivocado.

Análisis de falsos positivos

Rosa Gonzalez Navarro

Revisa cada bloqueo erróneo que llega a reclamación y lo cruza con el patrón que lo disparó. Su trabajo consiste en distinguir entre un fallo de umbral y un fallo de señal: no es lo mismo una cuenta nómina con movimientos irregulares que una cuenta nueva con dispersión rápida. Documenta los casos recurrentes para que el siguiente ciclo de entrenamiento los incorpore.

Operación y soporte

Lorena Aguilar Torres

Coordina la respuesta cuando un cliente legítimo queda bloqueado en medio de una transferencia interbancaria. Mide tiempos de resolución y traslada al equipo de modelo qué tipo de operaciones generan más fricción. Su lectura es directa: un recall alto que dispara reclamaciones diarias no es un modelo listo para producción.

Validación de modelos

Fernando Aguilar Mendoza

Audita las curvas de precisión y recall antes de cada despliegue y comprueba que los umbrales ajustados por segmento se mantienen estables con datos nuevos. También revisa que las métricas reportadas reflejen el coste operativo real de un falso positivo, no solo el porcentaje de mulas detectadas.

Falsos positivos en la detección de mulas: el coste de bloquear a un cliente legítimo

Analista de riesgo de fraude, MuleTrace AI

Falsos positivos en la detección de mulas: el coste de bloquear a un cliente legítimo

Antes de discutir umbrales conviene fijar el vocabulario. En detección de mulas, un bloqueo erróneo no siempre es un error del modelo: a veces es una decisión de política. Estas son las definiciones que usamos al revisar resultados en producción.

Falsos positivos en la detección de mulas: el coste de bloquear a un cliente legítimo

Si tu entidad necesita revisar por qué un modelo marcó como mula una cuenta que no lo era, o quieres contrastar umbrales por segmento antes de subirlos a producción, aquí tienes las vías de contacto y los tiempos de respuesta que manejamos. No es un buzón genérico: cada consulta llega a alguien que trabaja con curvas de precisión y recall a diario.

Configuracion de cookiesUsamos cookies para mantener el sitio estable, recordar opciones basicas y entender que paginas resultan utiles. Puedes aceptar, rechazar o revisar la configuracion antes de continuar.