Contribuciones a la detección de fraude en los seguros de salud
No Thumbnail Available
Date
2026
Authors
Journal Title
Journal ISSN
Volume Title
Publisher
Universidad Nacional Mayor de San Marcos
Abstract
El fraude en los sistemas de seguros de salud (FSS) representa una de las
amenazas financieras más críticas para la sostenibilidad de la salud pública
global. A pesar de que el Aprendizaje Automático Supervisado (AAS) ha
emergido como una herramienta con alto potencial disruptivo, la literatura
actual evidencia una fragmentación metodológica, predominando enfoques
ad-hoc que carecen de marcos sistemáticos que aseguren la replicabilidad
y eficacia en entornos de datos altamente desequilibrados. La presente
investigación tiene como objetivo proponer y validar empíricamente un
marco metodológico integral diseñado específicamente para este dominio.
Como piedra angular del estudio, se estableció un marco teórico robusto
para la delimitación conceptual y de dominio del FSS. Esta fundamentación
permitió identificar no solo la naturaleza del fenómeno, sino sus
manifestaciones específicas y su interdependencia con los actores clave
del sistema: el proveedor (prestador de servicios), el asegurado (usuario) y
la entidad aseguradora. Bajo este enfoque sistémico, se desarrolló la
metodología PDHIF (Phases for Detecting Health Insurance Fraud), una
arquitectura estructurada en seis fases que amalgama el conocimiento
experto del dominio pericial con el ciclo de vida avanzado de la ciencia de
datos.
Para la validación del modelo, se ejecutó un estudio de caso sobre un
corpus masivo de 8.5 millones de reclamaciones pertenecientes a un
seguro de salud público en el Perú, contrastando el desempeño de tres
arquitecturas algorítmicas: Random Forest, XGBoost y Multilayer
Perceptron. Los hallazgos revelan una asimetría crítica en el rendimiento
de los modelos según el tratamiento de los datos. En escenarios con
desequilibrio de clase natural, los algoritmos mostraron una ineficacia
sustancial para la detección (F1-score < 0.521), a pesar de reportar
precisiones nominales superiores al 98%, lo que evidencia el sesgo de la
métrica tradicional. Por el contrario, tras la implementación de técnicas de
balanceo dentro del marco PDHIF, el rendimiento experimentó una
optimización drástica. El algoritmo Random Forest alcanzó una métrica F1,
sensibilidad y AUC de 0.994, demostrando una capacidad de
discriminación casi absoluta frente a reclamaciones anómalas. En
conclusión, la investigación demuestra que la robustez de un sistema de
detección no reside exclusivamente en la sofisticación del algoritmo, sino
en la aplicación metódica de una arquitectura de fases especializada. El
marco PDHIF se posiciona como un modelo de referencia para el desarrollo
de sistemas de monitoreo financiero robustos, capaces de mitigar la fuga
de recursos y fortalecer la integridad de los sistemas de salud.
Description
Keywords
Atención médica, Fraude, Seguros, Aprendizaje automático
Citation
Villegas, J. (2026). Contribuciones a la detección de fraude en los seguros de salud. [Tesis de doctorado, Universidad Nacional Mayor de San Marcos, Facultad de Ingeniería de Sistemas e Informática, Unidad de Posgrado]. Repositorio institucional Cybertesis UNMSM.