TENDENCIAS Y PATRONES DE LOS
MODELOS DE INTELIGENCIA ARTIFICIAL
EN SALUD

TRENDS AND PATTERNS OF ARTIFICIAL

INTELLIGENCE MODELS IN HEALTHCARE

Carlos Zepeda Lugo

Universidad Autónoma de Baja California, Facultad de Ingeniería, Arquitectura y Diseño

Jonathan Ramón Ramírez Castro

Universidad Autónoma de Baja California, Facultad de Ingeniería, Arquitectura y Diseño
pág. 8080
DOI:
https://doi.org/10.37811/cl_rcm.v10i1.22887
Tendencias y patrones de los modelos de inteligencia artificial en salud

Carlos Zepeda Lugo
1
czepeda@uabc.edu.mx

https://orcid.org/0000-0002-9444-3106

Universidad Autónoma de Baja California,
Facultad de Ingeniería, Arquitectura y Diseño

País Ensenada, Baja California, México

Jonathan Ramón Ramírez Castro

ramirez.jonathan15
@uabc.edu.mx
https://orcid.org/0009-0003-3922-8838

Universidad Autónoma de Baja California,
Facultad de Ingeniería, Arquitectura y Diseño

País Ensenada, Baja California, México

RESUMEN

En los últimos años, la inteligencia artificial y el aprendizaje automático se expandieron rápidamente en
el sector de la salud, no obstante, la literatura reportó los algoritmos de forma inconsistente. El objetivo
de este estudio fue identificar y caracterizar las familias de algoritmos con mayor frecuencia reportadas
en aplicaciones clínicas, estratificadas por modalidad de datos y tarea clínica. Para este fin, se realizó
una revisión de alcance y se recuperó literatura publicada entre 2020 y 2025 en bases de datos médicas.
Se incluyeron artículos de revistas que reportaron modelos de inteligencia artificial entrenados o
evaluados y que presentaron métricas cuantitativas. Se extrajeron datos sobre arquitecturas de modelos,
dominios clínicos, tareas, conjuntos de datos, validación y rendimiento. Se identificaron 20 estudios
primarios de implementación que abarcaron tres modalidades principales: imágenes médicas (n = 9),
datos tabulares de historia clínica electrónica (n = 7) y señales fisiológicas (n = 4). Las redes neuronales
convolucionales dominaron en imágenes, mientras que los modelos híbridos prevalecieron en señales.
Los modelos de aprendizaje automático clásico fueron comunes en predicción tabular. En conjunto, los
modelos de inteligencia artificial en salud mostraron patrones claros de especialización por modalidad
de datos, con arquitecturas profundas que dominaron datos no estructurados y métodos clásicos que
persistieron en datos tabulares.

Palabras clave: Inteligencia artificial; aprendizaje automático; salud digital; revisión de literatura;
modalidad de datos.

1
Autor principal
Correspondencia:
czepeda@uabc.edu.mx
pág. 8081
Trends and patterns of artificial intelligence models in healthcare

ABSTRACT

In recent years, artificial intelligence and machine learning expanded rapidly in the health sector,

nevertheless, the literature reported algorithms inconsistently. The objective of this study was to identify

and characterize the families of algorithms mo
st frequently reported in clinical applications, stratified
by data modality and clinical task. For this purpose, a scoping review was conducted and literature

published between 2020 and 2025 was retrieved from medical databases. Journal articles were incl
uded
that reported trained or evaluated artificial intelligence models and that presented quantitative metrics.

Data were extracted on model architectures, clinical domains, tasks, datasets, validation, and

performance. Twenty primary implementation studie
s were identified that covered three main
modalities: medical images (n = 9), tabular electronic health record data (n = 7) and physiological signals

(n = 4). Convolutional neural networks dominated in images, while hybrid models prevailed in signals.

Clas
sical machine learning models were common in tabular prediction. Overall, artificial intelligence
models in health showed clear patterns of specialization by data modality, with deep architectures that

dominated unstructured data and classical methods that
persisted in tabular data.
Keywords
: Artificial intelligence; machine learning; digital health; literature review; data modality.
Artículo recibido
20 enero 2026
Aceptado para publicación:
20 febrero 2026
pág. 8082
INTRODUCCIÓN

La inteligencia artificial (IA) se ha consolidado como un agente de transformación en el sector de la
salud, con aplicaciones que incluyen el diagnóstico por imagen, el apoyo a la toma de decisiones
clínicas, la predicción de riesgos y la medicina personalizada. En los últimos años se ha observado una
aceleración sin precedentes en el desarrollo y la implementación de modelos de IA, impulsada por
avances en arquitecturas de aprendizaje automático (Machine Learning, ML), una mayor disponibilidad
de conjuntos de datos a gran escala y el incremento de los recursos computacionales.

En este contexto, esta evolución ha dado lugar a una diversidad de familias de modelos, contextos de
implementación y referentes de desempeño, cuya comprensión exige una síntesis sistemática que oriente
la investigación futura y su aplicación clínica. En concordancia con esta transformación, los análisis
bibliométricos han documentado tasas de crecimiento superiores al 20 % anual, así como una
concentración de la producción en imagen médica, cuidados intensivos (UCI) y aplicaciones
cardiovasculares (Awasthi et al., 2025; Tang et al., 2022). De manera similar, algunas revisiones
sistemáticas de la literatura han señalado el potencial de la IA para mejorar la precisión diagnóstica,
reducir la variabilidad entre observadores y posibilitar una detección más temprana de enfermedades en
múltiples especialidades (Kitsios et al., 2023; Patel et al., 2026).

No obstante, persisten desafíos relativos a la generalización de los modelos, el rigor de la validación, la
transparencia algorítmica y la integración en los flujos de trabajo clínicos (Kumari et al., 2023; Loftus
et al., 2022). A pesar del volumen creciente de evidencia y del reconocimiento de su potencial, se
mantienen vacíos de conocimiento relevantes. En primer lugar, la relación entre la modalidad de los
datos y la selección de arquitecturas no se ha caracterizado de forma sistemática a través de dominios
clínicos. En segundo término, el reporte de métricas de desempeño continúa siendo heterogéneo, lo que
restringe la comparación entre estudios y limita la síntesis de tipo meta-analítico. En tercer lugar, la
concordancia entre estudios primarios de implementación y literatura secundaria de revisión, en lo que
respecta a efectividad y limitaciones de los modelos, requiere un examen explícito. Finalmente, las
tendencias temporales en la adopción de familias de modelos y en los enfoques de validación no se han
caracterizado de manera integral.

Por lo tanto, la presente revisión de alcance aborda estos vacíos mediante una caracterización sistemática
pág. 8083
de los patrones de implementación de modelos de IA en salud durante 20202025. A diferencia de las
revisiones sistemáticas centradas en la efectividad para preguntas clínicas específicas, las revisiones de
alcance se orientan a delimitar la amplitud de la evidencia, identificar conceptos clave y precisar
definiciones operativas en campos emergentes (Tricco et al., 2018).

Con base en lo anterior, la revisión se estructura a partir de tres preguntas de investigación:

P1. ¿Qué familias de modelos y arquitecturas de IA se implementaron, entre 2020 y 2025, en distintas
modalidades de datos de la salud?

P2. ¿Qué patrones de desempeño se observaron según las tareas clínicas, y de qué manera variaron los
enfoques de validación?

P3. ¿En qué medida los hallazgos de los estudios primarios de implementación se alinearon con, o
divergieron de, los patrones identificados en la literatura contemporánea de revisiones?

Finalmente, esta revisión aporta una síntesis estructurada de patrones de implementación que puede
orientar la selección de modelos, el diseño de estudios y la estandarización del reporte en investigaciones
futuras. Al contrastar evidencia primaria de implementación con la literatura de revisión, también
identifica zonas de convergencia y divergencia que requieren investigación adicional.

Antecedentes y fundamentos teóricos

La IA aplicada a la salud abarca un continuo de enfoques computacionales que va desde algoritmos
clásicos de ML hasta arquitecturas contemporáneas de aprendizaje profundo (Deep Learning, DL). Los
métodos clásicos, entre los que se incluyen la regresión logística, las máquinas de vectores de soporte
(Vector Space Model, VSM), los bosques aleatorios (Random Forest, RF) y los métodos de potenciación
por gradiente (p. ej., XGBoost), se han utilizado en datos clínicos estructurados para predicción de riesgo
y apoyo a decisiones clínicas desde inicios de la década de 2000. Estas técnicas suelen desempeñarse
adecuadamente en datos tabulares con variables diseñadas; sin embargo, requieren conocimiento del
dominio para la selección de características y el preprocesamiento (Nam et al., 2022).

Posteriormente, el giro hacia el DL, impulsado por avances en redes neuronales convolucionales
(Convolutional Neural Networks, CNN) para reconocimiento de imágenes, modificó de forma sustantiva
el panorama de la IA en salud. Las CNN aprenden representaciones jerárquicas mediante capas
convolucionales, operaciones de agrupamiento y activaciones no lineales, lo que permite el aprendizaje
pág. 8084
de extremo a extremo a partir de datos de píxeles sin ingeniería manual de características. Por ejemplo,
algunas arquitecturas como ResNet, DenseNet, Inception y EfficientNet han alcanzado desempeños
comparables al humano o superiores en tareas de clasificación de imágenes médicas (Egger et al., 2022;
Pei et al., 2023).

En paralelo, en el caso de datos secuenciales, las redes neuronales recurrentes (Recurrent Neural
Networks, RNN) y sus variantesmemoria a largo-corto plazo (Long Short-Term Memory, LSTM) y
unidades recurrentes con compuertas (Gated Recurrent Units, GRU)modelan dependencias
temporales en señales fisiológicas y en registros clínicos longitudinales. De igual forma, arquitecturas
híbridas que combinan CNN para la extracción de rasgos espaciales con LSTM para el modelado
temporal han mostrado utilidad particular en el análisis de electrocardiogramas (ECG) y en la predicción
sobre series de tiempo (Qureshi et al., 2022).

Asimismo, en años recientes emergieron arquitecturas con base en transformadores, desarrolladas
originalmente para procesamiento de lenguaje natural (Natural Language Processing, NLP), que
posteriormente se adaptaron a imagen médica y al análisis de texto clínico. Estos modelos utilizan
mecanismos de autoatención para capturar dependencias de largo alcance y han mostrado potencial en
tareas de aprendizaje multimodal (Changalidis et al., 2026).

Por otra parte, la validación de modelos de IA en salud exige procedimientos rigurosos para sustentar
su capacidad de generalización más allá de los datos de entrenamiento. La validación interna, mediante
conjuntos de prueba separados o validación cruzada, aporta estimaciones iniciales del desempeño; no
obstante, puede sobreestimar la efectividad en condiciones reales por fuga de información o por cambios
en la distribución de los datos. En contraste, la validación externa con conjuntos independientes
provenientes de instituciones, poblaciones o periodos temporales distintos ofrece evidencia más sólida
de robustez (Feng et al., 2022). La validación temporal, en la que modelos entrenados con datos
históricos se evalúan en cohortes posteriores, aproxima con mayor fidelidad escenarios de despliegue
clínico.

En este sentido, las métricas de desempeño dependen del tipo de tarea. En clasificación se reportan con
frecuencia exactitud, sensibilidad, especificidad, área bajo la curva (Area Under the Receiver Operating
Characteristic Curve, AUROC) y la puntuación F1 (F1-score). En segmentación se emplean el
pág. 8085
coeficiente de similitud de Dice, índice de Jaccard y distancia de Hausdorff. En regresión se utilizan el
error absoluto medio (Mean Absolute Error, MAE) y la raíz del error cuadrático medio (Root Mean
Squared Error, RMSE). Sin embargo, la selección y el reporte de métricas continúan siendo
inconsistentes entre estudios, lo que dificulta la comparación sistemática (Thurzo et al., 2022).

De manera complementaria, la transferencia de modelos desde la investigación hacia la práctica clínica
enfrenta barreras múltiples. La interpretabilidad y la explicabilidad resultan determinantes tanto para la
confianza clínica como para procesos regulatorios, lo que ha incrementado el interés por mecanismos
de atención, visualizaciones basadas en gradientes y métodos de explicación post hoc (Gao et al., 2026).
Asimismo, la equidad algorítmica y la mitigación de sesgos se han posicionado como preocupaciones
centrales, en particular cuando los modelos se entrenan con conjuntos de datos no representativos
(Sanker et al., 2026). La integración en flujos de trabajo clínicos, la eficiencia computacional y las rutas
regulatorias adicionalmente condicionan el éxito de la implementación (Huqh et al., 2022).

En consonancia con lo anterior, la literatura ha documentado estas tendencias en dominios específicos.
Por ejemplo, los análisis bibliométricos señalan una concentración de la investigación en radiología,
patología y cuidados intensivos, junto con un interés creciente en aprendizaje multimodal y enfoques
federados (Nam et al., 2022; Tang et al., 2022). Revisiones sistemáticas en cardiología han reportado
mejoras consistentes en detección de arritmias y estratificación de riesgo, aunque también subrayan la
escasez de validación prospectiva y de estudios de implementación (Patel et al., 2026).

Por su parte, meta-revisiones sobre DL en medicina destacan el predominio de CNN en tareas de imagen
y señalan vacíos en cuantificación de incertidumbre y evaluación de calibración (Egger et al., 2022). En
conjunto, este marco teórico delimita el campo conceptual necesario para caracterizar patrones de
implementación de IA en salud.

METODOLOGÍA

Diseño, protocolo y criterios de elegibilidad

Esta revisión de alcance se llevó a cabo conforme a la guía de elementos de informe preferidos para
revisiones sistemáticas y metanálisis (PRISMA-ScR) (Tricco et al., 2018). El protocolo se elaboró a
priori y además incorporó las preguntas de investigación, los criterios de elegibilidad, la estrategia de
búsqueda y los procedimientos de extracción de datos. No se realizó registro del protocolo, debido en
pág. 8086
parte a que las revisiones de alcance no se registran de manera rutinaria en bases de datos prospectivas.

Se incluyeron estudios originales con evaluación empírica en salud humana, publicados como artículos
de revista y, cuando estuvieron disponibles en texto completo, como proceedings de congreso o
preprints, siempre que reportaran el entrenamiento o la evaluación de modelos de IA/ML y al menos
una métrica cuantitativa de desempeño (p. ej., exactitud, AUROC, sensibilidad, especificidad, F1-score,
coeficiente Dice). El contexto a su vez se limitó a aplicaciones del sector salud orientadas a tareas de
diagnóstico, predicción, clasificación, segmentación o detección, publicadas entre el 1 de enero de 2020
y el 31 de diciembre de 2025.

Se excluyeron resúmenes de congreso sin texto completo, editoriales, comentarios y cartas; estudios sin
métricas cuantitativas; investigaciones en sujetos no humanos (modelos animales o sistemas in vitro);
trabajos puramente metodológicos sin evaluación empírica en datos de salud; estudios que no
describieran el conjunto de datos o el enfoque de validación.

Fuentes de información, estrategia de búsqueda y proceso de selección

Se realizaron búsquedas de exploración en PubMed/MEDLINE e IEEE Xplore, con apoyo de búsquedas
complementarias en Google Scholar y SciSpace para ampliar la cobertura y enriquecer metadatos y
acceso a texto completo. En este marco, la estrategia combinó vocabulario controlado (términos MeSH
en PubMed) y palabras clave de texto libre, organizadas en tres bloques conceptuales: (i) métodos de
IA/ML (p. ej., artificial intelligence, machine learning, deep learning, neural network, CNN, RNN,
LSTM, random forest, XGBoost, support vector machine), (ii) dominios y aplicaciones en salud (p. ej.,
healthcare, clinical, diagnosis, prediction, imagen médica, radiología, patología, expediente clínico
electrónico (EHR), UCI, cardiología, ECG) y (iii) términos asociados a evaluación y tipo de estudio (p.
ej., implementation, evaluation, validation, performance, classification, detection, segmentation).

Las búsquedas se efectuaron en diciembre de 2025. Adicionalmente, se revisaron manualmente las listas
de referencias de las revisiones incluidas para identificar estudios primarios potencialmente elegibles.
Con el fin de reducir el riesgo de omisión por indexación tardía de artículos publicados en 2025, se
realizó una actualización de la búsqueda en enero de 2026, aplicando la misma estrategia y los mismos
criterios de elegibilidad.

Con base en los registros recuperados, la selección se desarrolló en tres etapas. En primer lugar, los
pág. 8087
registros se importaron a un gestor bibliográfico y se eliminaron duplicados mediante coincidencia por
identificadores y comparación de título/autores, con verificación manual. En segundo lugar, dos
revisores evaluaron de manera independiente títulos y resúmenes frente a los criterios de elegibilidad;
las discrepancias se resolvieron por discusión, y los casos dudosos avanzaron a texto completo. En tercer
lugar, dos revisores evaluaron de forma independiente los textos completos, con verificación específica
de: presencia de métricas cuantitativas, descripción del conjunto de datos y disponibilidad en texto
completo con reporte suficiente de métricas y validación. En todos los casos, las discrepancias se
resolvieron por consenso.

Extracción de datos y estrategia de síntesis

Se diseñó un formulario estandarizado para la extracción de datos y se sometió a una prueba piloto en
cinco estudios con el fin de mejorar la consistencia y la exhaustividad de la información recolectada. A
partir de este procedimiento, en los estudios incluidos se extrajeron datos sobre las características del
estudio (autor, año, ubicación geográfica, entorno, diseño y objetivo), el problema clínico (dominio, tipo
de tarea y condición o desenlace evaluado), los datos utilizados (modalidad, fuente, tamaño muestral,
periodo de recolección y criterios de inclusión y exclusión), las características del modelo (tipo de
enfoque, arquitectura, estrategia de entrenamiento y métodos de interpretabilidad, cuando se reportaron),
el enfoque de validación (validación interna, cruzada, externa o temporal, proporciones de partición y
número de sitios en validación externa), las métricas de desempeño (incluidas medidas de incertidumbre
y comparaciones con líneas base o referentes clínicos, cuando estuvieron disponibles) y consideraciones
adicionales (calibración, equidad o análisis por subgrupos y limitaciones reconocidas por los autores,
cuando se informaron).

La síntesis se realizó de forma narrativa y se presentó en tablas estructuradas. En este contexto, debido
a la heterogeneidad en tareas clínicas, arquitecturas y métricas, no se consideró apropiado un
metaanálisis (Thompson & Sharp, 1999). En su lugar, la síntesis se concentró en: patrones de adopción
de familias de modelos de acuerdo con modalidad de datos, rangos de desempeño por tipo de tarea
clínica y tendencias en enfoques de validación. Con el propósito de facilitar la comparación entre
estudios, se construyeron tablas comparativas agrupadas por modalidad (imagen, datos tabulares y
señales).
pág. 8088
RESULTADOS

Descripción de los estudios incluidos

La estrategia de búsqueda identificó 1,491 registros en el total de fuentes consultadas. Después de la
eliminación de duplicados, se conservaron 1,247 registros únicos para el cribado por título y resumen.
En esta etapa se excluyeron 858 registros y 389 avanzaron a la recuperación de texto completo. De estos,
10 informes no pudieron recuperarse y 379 fueron evaluados para elegibilidad a texto completo. En la
revisión a texto completo se excluyeron 359 estudios por actas sin texto completo, reporte insuficiente
de métricas de desempeño, sujetos no humanos, trabajos metodológicos sin evaluación empírica,
cohortes duplicadas y año de publicación fuera del periodo. Finalmente, se incluyeron 20 estudios en la
síntesis. El proceso de selección de estudios se resume en la Figura 1.

Figura 1

Diagrama de flujo PRISMA del proceso de selección de estudios.

Nota. Adaptado de Page et al., 2021.

Aplicaciones en imagen médica

Nueve estudios evaluaron modelos de IA en tareas de imagen médica en diversos dominios clínicos. La
Tabla 1 resume las características detalladas de todos los estudios primarios, incluyendo las aplicaciones
pág. 8089
de imagen. La distribución global de los estudios incluidos por modalidad de datos se presenta en la
Figura 2.

Figura 2

Distribución de los estudios por modalidad de datos (n = 20).

En oftalmología, cuatro estudios abordaron la detección y la gradación de retinopatía diabética a partir
de fotografías de fondo de ojo (Feng et al., 2022; Malarvannan et al., 2025; Santos et al., 2022; Vijayan
& S, 2023). Las arquitecturas incluyeron ResNet-18 con aprendizaje contrastivo supervisado (Feng
et al., 2022), ResNet-50 con una función de pérdida híbrida adaptativa focal-entropía (Malarvannan
et al., 2025), EfficientNet-B0 para gradación basada en regresión (Vijayan & S, 2023) y YOLOv5 para
detección de lesiones (Santos et al., 2022). Los conjuntos de datos oscilaron entre 516 y 13,673 imágenes
provenientes de bases de datos públicas y bancos institucionales. El desempeño varió de acuerdo a la
complejidad de la tarea. Por ejemplo, en clasificación binaria (presencia/ausencia de retinopatía
diabética) se reportó una exactitud de 8687 % y AUROC de 0.960.97 (Feng et al., 2022), mientras
que la gradación de severidad en cinco categorías alcanzó 8486 % de exactitud (Vijayan & S, 2023).
El modelo YOLOv5 para detección de lesiones obtuvo un mAP 0.154 en DDR prueba; mAP 0.295 en
IDRiD prueba; F1 0.252 (Santos et al., 2022), en concordancia con la mayor exigencia de las tareas de
localización frente a las de clasificación.
pág. 8090
En radiología (neumonía por COVID-19), dos estudios desarrollaron modelos de aprendizaje profundo
para diagnóstico de COVID-19 mediante tomografía computarizada (TC) de tórax (Ni et al., 2020; Xu
et al., 2022). Los investigadores implementaron un MVP-Net convolucional para detección de lesiones
y un U-Net 3D para segmentación, con sensibilidad por paciente de 1.00 (IC 95 %: 0.961.00) y
especificidad de 0.25 (IC 95 %: 0.030.65) en una cohorte de validación externa de 96 pacientes (Ni
et al., 2020). El otro equipo de expertos optimizaron una CNN profunda mediante un algoritmo seno-
coseno basado en IP y reportaron 98.32 % de exactitud, 97.22 % de sensibilidad y 96.77 % de
especificidad en el conjunto SARS-CoV-2 CT-scan (2,482 imágenes de 120 pacientes) (Xu et al., 2022).
Ambos estudios utilizaron validación tipo cruzada dejando un paciente fuera (Leave-One-Patient-Out,
LOPO) o validación externa. En el enfoque MVP-Net se observó especificidad reducida pese a la
sensibilidad reportada.

En radiología (segmentación hepática), desarrollaron RA-UNet, una red híbrida con atención que integra
la arquitectura U-Net con aprendizaje residual y mecanismos de atención para segmentación de hígado
y tumor en TC (Jin et al., 2020). El modelo se evaluó en dos bases de datos públicas de tomografía
computarizada (TC) para segmentación hepática y tumoral: LiTS 2017 (Liver Tumor Segmentation
Challenge, MICCAI 2017; 200 estudios) y 3D-IRCADb (20 estudios). En LiTS se realizó validación
cruzada de 5 pliegues, con coeficientes Dice de 0.961 (hígado) y 0.595 (tumor). La validación externa
en 3D-IRCADb mostró Dice de 0.977 (hígado) y 0.830 (tumor).

En patología (cáncer de mama), se ha propuesto un modelo híbrido de aprendizaje por transferencia
(MobileNet-SVM) que combina la extracción de características mediante MobileNet y la clasificación
con SVM, aplicado a imágenes histopatológicas. En BreakHis v1 (400×; 2,462 imágenes), el modelo
alcanzó una exactitud de 91.3 %, sensibilidad (recall) de 93.2 %, precisión de 89.4 % y un AUROC de
0.915 para la clasificación de lesiones benignas versus malignas (Ogundokun et al., 2023).

En dermatología (cáncer de piel), se desarrolló una CNN con base en regiones (Faster R-CNN con SE-
ResNeXt-50) para la detección de cáncer cutáneo queratinocítico en imágenes faciales. El entrenamiento
se realizó con 1,106,886 recortes de imagen, y la validación con 2,844 imágenes de 673 pacientes
provenientes de tres hospitales. En el conjunto de validación, el modelo reportó un AUROC de 0.910,
una sensibilidad de 76.8 % y una especificidad de 90.6 % al umbral T80 (Han et al., 2020).
pág. 8091
En las aplicaciones por imagen predominó el uso de arquitecturas CNN, especialmente variantes ResNet
(n = 3), seguidas de U-Net para segmentación (n = 2), EfficientNet (n = 1) y enfoques híbridos (n = 1).
Se identificó el uso de aprendizaje por transferencia/preentrenamiento y, en algunos casos, mecanismos
de atención (p. ej., RA-UNet). La validación incluyó particiones internas (n = 5), validación cruzada (n
= 2) y validación externa (n = 3), esta última más frecuente en aplicaciones radiológicas. Las métricas
variaron según la tarea: en clasificación, se reportaron exactitudes de 86 99.79 % y AUROC de 0.865
0.97; en segmentación, coeficientes Dice de 0.600.98, con valores menores en segmentación tumoral
que en segmentación de órgano.

Modelos predictivos con expedientes clínicos electrónicos

Siete estudios primarios desarrollaron modelos de IA para tareas de predicción clínica a partir de datos
estructurados de EHR, de los cuales cinco se enfocaron en desenlaces relacionados con sepsis y dos en
predicción de riesgos en UCI de alcance más amplio.

En la predicción de mortalidad por sepsis, cinco estudios utilizaron EHR de UCI, principalmente de la
base de datos Medical Information Mart for Intensive Care III (MIMIC-III) y, en menor medida, de
sistemas institucionales, con muestras de entre 3,000 y 40,000 pacientes (Dong et al., 2025; Duan et al.,
2023; Gupta et al., 2020; Shi et al., 2025; Su et al., 2021). Los enfoques fueron heterogéneos e
incluyeron XGBoost y ensambles integrados a flujos clínicos, con un AUROC mayor de 0.80 en
validación interna y de 0.63 a 0.77 en validación externa (Shi et al., 2025), una red integrada temporal
basada en redes de Kolmogorov-Arnold (time-constant KAN integrated network, TCKAN) con AUROC
de 87.76 % en MIMIC-III y 88.07 % en MIMIC-IV (Dong et al., 2025), modelos ocultos de Markov
con AUROC de 0.865 e intervalo de confianza (IC) del 95 % de 0.749 a 0.982 (Gupta et al., 2020),
modelos de potenciación por gradiente con el mejor rendimiento comparativo para mortalidad temprana
(Su et al., 2021) y un enfoque de DL con doble fusión de características, con AUROC de 0.855 y 0.893
y puntajes F1 de 0.420 y 0.412 (Duan et al., 2023).

En predicción de mortalidad por COVID-19, algunos autores desarrollaron modelos de aprendizaje
automático para predecir mortalidad y eventos críticos en pacientes con COVID-19 a partir de EHR de
hospitales de la ciudad de Nueva York (Vaid et al., 2023). El estudio evaluó múltiples algoritmos,
incluyendo random forest, XGBoost y redes neuronales, en una cohorte de más de 4,000 pacientes, con
pág. 8092
AUROC entre 0.78 y 0.92 según el momento de predicción y el desenlace.

En la predicción de múltiples riesgos clínicos en UCI, se evaluaron modelos de ML en diversos
hospitales y se analizó su desempeño en condiciones reales de implementación. El rendimiento varió
entre instituciones, con AUROC de 0.72 a 0.88, lo que sugiere variabilidad interinstitucional y resalta
la necesidad de validación local antes de su adopción clínica (Sun et al., 2022).

Análisis de señales fisiológicas

Cuatro estudios evaluaron modelos de IA para el análisis de señales fisiológicas, todos enfocados en la
detección de arritmias cardiacas a partir de ECG. Tres de ellos abordaron específicamente la detección
de fibrilación auricular (FA) mediante modelos de DL, mientras que un estudio se centró en la
clasificación multiclase de arritmias
(Hori et al., 2020; Xia et al., 2024; Xie et al., 2024; Zhang et al.,
2023)
. En detección de FA, se propusieron arquitecturas heterogéneas con resultados altos en bases
públicas y validaciones externas. Un estudio utilizó un modelo híbrido CNN-LSTM para tamizaje
automático en registros Holter de 24 horas y reportó un AUROC a nivel de paciente de 0.999 en
escenarios comunitarios y hospitalarios, con IC 95 % muy estrechos. Además, en la validación externa
con bases de datos públicas de la familia Massachusetts Institute of TechnologyBeth Israel Hospital
(MIT-BIH), obtuvo un AUROC de 0.998 y, en el escenario comunitario, una sensibilidad de 1.000 y
una especificidad de 0.997 (Zhang et al., 2023).

Otro estudio desarrolló un ResNet multirrama con transformada continua de Wavelet (continuous
wavelet transform, CWT-MB-ResNet) para un ECG de una sola derivación y reportó un puntaje F1 de
0.8865 y AUROC de 0.9761, con descenso del rendimiento en validación externa con datos (F1 =
0.7396, AUROC = 0.9351) (Xie et al., 2024).

Un tercer estudio propuso la red AF-MSDC, basada en bloques de convolución dilatada multiescala, y
reportó sensibilidad de 99.45 % y especificidad de 99.64 % en la MIT-BIH, además de puntaje F1 de
85.63 % (Xia et al., 2024).

En clasificación multiclase de arritmias, se desarrolló un enfoque autoencoder-CNN para detección
específica por paciente usando la MIT-BIH, bajo una estrategia de personalización basada en el ECG
basal individual. En 3,000 formas de onda de prueba de 30 pacientes, el modelo alcanzó 88.4 % de
exactitud, 76.7 % de precisión, 95.2 % de especificidad y un puntaje F1 de 76.7 % (Hori et al., 2020).
pág. 8093
Tabla 1

Características de los estudios incluidos.

Estudio
(país)

Dominiotarea
(modalidad)
Modelo (familia) Datos (n) Validación Métricas clave
(formato uniforme)

Feng 2022
(CHN)

OftalmologíaClasif RD
sí/no (FO)
ResNet-18 + aprendizaje contrastivo (CNN) DDR (n =
12,519 img)
Int (5:2:3)
Acc 86.64%,
AUROC 0.965, Sens
86.24%, Esp 88.00%

Malarvannan
2025 (IND)

OftalmologíaClasif
estadios RD (FO)

ResNet-50 (CNN; comparó
DenseNet121/Xception/MobileNetV2/InceptionV3)

APTOS 2019 (n
= 3,662 img)
NR
Acc 99.79%, Prec
98.57%, Rec 99.29%,
F1 98.93%

Vijayan
2023 (IND)

OftalmologíaGradación
RD (FO)
EfficientNet-B0 (CNN)
APTOS (n =
3,662 img) /
DDR (n =
13,673 img) /
IDRiD (n = 516
img)

Int
(80:10:10;
IDRiD
80:20)

APTOS: Acc 86.2%,
Kappa 0.939; DDR:
Acc 84.8%, Kappa
0.903

Santos 2022
(BRA)

OftalmologíaDetección
lesiones (FO)
YOLOv5s (CNN)
DDR (n = 757
anotadas) /
IDRiD (NR)

Int+Ext
(IDRiD)

DDR (prueba): mAP
0.154, F1 0.252;
IDRiD (prueba):
mAP 0.295

Ni 2020
(CHN)

Radiología tóraxDet+Seg
COVID-19 (TC)
MVP-Net + U-Net 3D (CNN)
7 hosp (CHN) +

3 hosp Ext;

Entr: n =

Ext

Sens 1.00, Esp 0.25,
AUROC 0.865, Acc
0.94 (por paciente)
pág. 8094
19,291 esc

(14,435 pac);

Prueba: n = 96

pac

Xu 2022
(CHN)

Radiología tóraxClasif
COVID-19 (TC)
DCNN optimizada (CNN)
SARS
-CoV-2
CT
-scan (n =
2,482 img; 120

pac) / COVID
-
CT (n = 349

img; 216 pac)

LOPO-CV

Acc 98.32% (SARS
-
CoV
-2), 98.01%
(COVID
-CT),
AUROC NR

Jin 2020
(CHN)

Radiología hígado
Segmentación (TC)
RA-UNet (CNN; residual + atención)
LiTS (n = 200)
/ 3DIRCADb (n
= 20)

CV (5) +
Ext

Dice LiTS: hígado
0.961, tumor 0.595;
3DIRCADb: hígado
0.977, tumor 0.830

Ogundokun
2023 (LTU)

PatologíaClasif
benigno/maligno (Histo)
MobileNetSVM (Híbrido)
BreakHis v1
400× (n = 2,462
img)

Int

Acc 91.3%, Prec

89.4%, Rec 93.2%,

F1 91.3%, AUROC

0.915

Han 2020
(KOR)

DermatologíaDet+Clasif
cáncer piel (Derma)
Faster R-CNN + SE-ResNeXt-50 (CNN)
3 hosp +
públicos; Entr:
1,106,886
recortes; Val: n
= 2,844 img;

Multic
(Int)

Val: AUROC 0.910,
Sens 76.8%, Esp
90.6%; Prueba: F1
0.831
pág. 8095
Prueba: n = 325
img

Shi 2025
(CHN)

UCI/SepsisPred
mortalidad (EHR)
XGBoost/regresión/ensamble (ML)
EHR inst

(US+CHN)

(NR)

Int+Ext
(entre
países)

AUROC interna >
0.80, AUROC
externa 0.630.77

Dong 2025
(CHN)

UCI/SepsisPred
mortalidad (EHR)
TCKAN (DL)
MIMIC
-III /
MIMIC
-IV
(NR)

CV (5)

AUROC 87.76%

(MIMIC
-III),
AUROC 88.07%

(MIMIC
-IV),
AUPRC ~0.55

Gupta 2020
(USA)

UCI/SepsisRiesgo
continuo mortalidad
(EHR)

Modelos ocultos de Markov (ML)
EHR inst (NR) Int AUROC 0.865, F1
0.97, Acc 0.94

Duan 2023
(CHN)

UCI/SepsisPred
temprana sepsis (EHR)
Autoencoder + variables clínicas (Híbrido)
MIMIC
-III Set
A (n = 6,000) /

eICU Set B (n =

6,000)

Entre bases

AUROC 0.855
(A→B), 0.893
(B→A), F1
0.420/0.412

Su 2021
(CHN)

UCI/Sepsis
Mortalidad/severidad/LOS
(EHR)

Gradient boosting/RF/logística (ML)
EHR inst (NR) Int
Mejor desempeño
con gradient boosting
(métricas NR)

Vaid 2023
(USA)

UCI/COVID-19
Mortalidad + eventos
críticos (EHR)

RF/XGBoost/redes neuronales (ML)
EHR inst NYC
(n > 4,000 pac)
Int
AUROC 0.780.92
(según
desenlace/tiempo)
pág. 8096
Sun 2022
(BEL)

UCIMultirriesgo clínico
(EHR)
Múltiples algoritmos (ML)
EHR
multicéntrico
(NR)

Ext

AUROC 0.720.88
(por
institución/riesgo)

Zhang 2023
(CHN)

CardioDetección FA
(ECG)
CNNLSTM (Híbrido)
Cohorte inst +

MIT
-BIH
AF/NSR + NSR

RR (n = 24,707

reg)

Int+Ext

AUROC 0.999
(comunidad/hospital),
0.998 (externa), Sens
hasta 1.000, Esp
hasta 0.997

Xie 2024
(USA)

CardioDetección FA
(ECG)
ResNet multirrama + CWT (CNN)
PhysioNet/CinC
2017 (n = 8,528
señales) /
OUHSC (n =
5,809)

Int+Ext

PhysioNet: F1 0.887,

AUROC 0.976;

OUHSC: F1 0.740,

AUROC 0.935

Xia 2024
(CHN)

CardioDetección FA
(ECG)
AF-MSDC (CNN)
MIT
-BIH AF (n
= 82,660 seg) /

PhysioNet 2017

(n = 8,528 +

3,658)

Int (8:1:1)

MIT
-BIH: Sens
99.45%, Esp 99.64%;

PhysioNet: F1

85.63%

Hori 2020
(JPN)

CardioClasif arritmias
(ECG)
Autoencoder + CNN (Híbrido)
MIT-BIH
Arrhythmia (n
= 30 pac;
30,000 entr;
3,000 prueba)

Int

Acc 88.4%, Prec
76.7%, Esp 95.2%,
F1 76.7%
pág. 8097
Nota: FO = fondo de ojo; TC = tomografía computarizada; Derma = dermatoscopia; Histo = histopatología; EHR = historia clínica electrónica; ECG =
electrocardiograma; Int = validación interna; Ext = externa; CV = validación cruzada; LOPO-CV = leave-one-patient-out cross-validation; NR = no reportado;
Acc = exactitud; AUROC = área bajo la curva ROC; Sens = sensibilidad; Esp = especificidad; Prec = precisión; Rec = recall.
pág. 8098
DISCUSIÓN

La presente revisión de alcance caracterizó patrones de implementación de modelos de IA a partir de 20
estudios primarios en aplicaciones en el sector de la salud entre 2020 y 2025, y permitió identificar tres
hallazgos principales.

En primer lugar, la selección de arquitecturas mostró una especialización marcada por modalidad de
datos: las CNN predominaron en imagen médica, las arquitecturas híbridas CNNrecurrentes fueron las
más frecuentes en el análisis de señales fisiológicas y los métodos clásicos de aprendizaje automático
(XGBoost, RF, gradient boosting) conservaron competitividad en datos tabulares estructurados de EHR.

En segundo término, el desempeño varió de forma consistente con la complejidad de la tarea: la
clasificación binaria alcanzó métricas superiores (AUROC 0.910.99) frente a la gradación multiclase
(exactitud 8486 %) o tareas de localización espacial (mAP 0.150.30).

En tercer lugar, el rigor de validación se mantuvo heterogéneo, con validación externa reportada en
menos de la mitad de los estudios y una reducción típica del rendimiento de 515 % cuando los modelos
se evaluaron en conjuntos o instituciones independientes. La alineación observada entre modalidad y
arquitectura es coherente con diferencias sustantivas en la estructura de los datos y en los objetivos de
aprendizaje.

Las imágenes médicas presentan organización espacial y rasgos jerárquicos que se ajustan a
arquitecturas convolucionales; dentro de este marco, la recurrencia de variantes ResNet (3/9 estudios de
imagen) resulta congruente con su efectividad en clasificación de imagen médica, atribuida a conexiones
residuales que facilitan el flujo de gradientes y el entrenamiento de redes profundas (Egger et al., 2022).
De igual forma, el uso de U-Net en segmentación refleja la pertinencia de su diseño codificador
decodificador con conexiones de salto para preservar información espacial necesaria en predicciones a
nivel de píxel (Jin et al., 2020). En contraste, las señales fisiológicas incorporan dependencias
temporales que requieren modelado secuencial; por ello, la frecuencia de enfoques CNNLSTM (1/4
estudios de señales) se asocia con la extracción local de rasgos morfológicos y la captura de patrones
temporales de largo alcance en el ritmo cardiaco (Xia et al., 2024; Xie et al., 2024; Zhang et al., 2023).

En datos tabulares de EHR, la persistencia de métodos clásicos (6/7 estudios) cuestiona la presunción
de superioridad universal del aprendizaje profundo. En escenarios con variables diseñadas, los
pág. 8099
ensambles basados en árboles pueden igualar el desempeño de redes neuronales y ofrecer ventajas en
interpretabilidad, eficiencia computacional y robustez ante tamaños muestrales reducidos (Shi et al.,
2025; Su et al., 2021; Vaid et al., 2023). Este resultado coincide con estudios comparativos que
documentan un rendimiento frecuentemente equivalente o superior de ensambles arbóreos frente a redes
neuronales en datos tabulares, especialmente cuando el tamaño muestral es moderado (n < 10,000) y la
ingeniería de características es exhaustiva (Nam et al., 2022). Al comparar estos patrones con la
literatura de revisión, se observó tanto concordancia como divergencia.

Los análisis bibliométricos confirman el crecimiento acelerado de publicaciones de IA en salud
(incremento anual de 2134 %) y su concentración en imagen médica, cuidados intensivos y cardiología
(Liu et al., 2024; Tang et al., 2022), en línea con la distribución temática de los estudios primarios
incluidos. Asimismo, revisiones sistemáticas en cardiología reportan alta precisión diagnóstica en
detección de arritmias (AUROC > 0.95) (Patel et al., 2026), consistente con el desempeño observado en
estudios de detección de fibrilación auricular (Xia et al., 2024; Xie et al., 2024; Zhang et al., 2023). No
obstante, la literatura de revisión enfatiza el potencial de arquitecturas basadas en transformadores y del
aprendizaje multimodal (Changalidis et al., 2026), mientras que en esta muestra no se identificaron
estudios primarios que emplearan transformadores en tareas clínicas y los enfoques multimodales fueron
infrecuentes (1/20 estudios), lo que sugiere un desfase entre innovación metodológica y adopción
clínica.

De manera consistente con revisiones previas, la validación externa y la evaluación prospectiva
continúan siendo vacíos críticos (Feng et al., 2022; Loftus et al., 2022; Patel et al., 2026). En esta
revisión, únicamente 40 % de los estudios primarios reportó validación externa y ninguno describió
despliegue clínico prospectivo con monitoreo en tiempo real; además, la disminución de desempeño en
validación externa (reducción de AUROC de 515 %) refuerza la existencia de una brecha de
generalización entre instituciones, poblaciones y periodos (Feng et al., 2022). A ello se suma que
variables clave para la traslación clínicaequidad algorítmica, calibración y cuantificación de
incertidumbrefueron reportadas de forma marginal: la calibración se evaluó en 1/20 estudios, y no se
identificaron análisis de equidad ni cuantificación de incertidumbre (Gao et al., 2026; Loftus et al., 2022;
Sanker et al., 2026).
pág. 8100
En paralelo, se observaron tendencias arquitectónicas que incrementan la complejidad del despliegue:
mecanismos de atención en algunos estudios de imagen y señales, así como aprendizaje por
transferencia/preentrenamiento en parte de la evidencia, y ensambles en 4/7 estudios con EHR; aunque
estas estrategias pueden mejorar el rendimiento o la robustez, también introducen interrogantes sobre
validez explicativa, desajuste de dominio y costos computacionales, y sugieren la necesidad de
preentrenamiento en grandes conjuntos médicos, aún limitados (Pei et al., 2023), así como de
evaluaciones de calibración más sistemáticas.

Finalmente, la ausencia de modelos de lenguaje de gran escala y modelos fundacionales en estudios
primarios contrasta con su prominencia reciente en el discurso y con el crecimiento bibliométrico desde
2022 (Awasthi et al., 2025), lo que probablemente refleja barreras regulatorias, de privacidad y de
validación.

En conjunto, la variabilidad entre bases e instituciones en estudios con EHR (AUROC 0.630.89 en
predicción de sepsis) evidencia desafíos de transportabilidad (Duan et al., 2023; Shi et al., 2025; Sun
et al., 2022) y respalda estrategias orientadas a mejorar la generalizacióndatos multisitio, adaptación
de dominio, aprendizaje federado y monitoreo/recalibración continua en despliegue (Huqh et al.,
2022), además de subrayar la ausencia de validación temporal, recomendada como estándar para
modelos predictivos clínicos (Feng et al., 2022).

CONCLUSIONES

Esta revisión de alcance demuestra que la implementación de modelos de IA en salud durante 2020
2025 no ha seguido una trayectoria uniforme, sino que refleja decisiones arquitectónicas condicionadas
por la estructura intrínseca de cada modalidad de datos. La correspondencia entre tipo de dato y familia
de modelo, lejos de ser arbitraria, constituye un principio organizador que puede orientar decisiones de
diseño en investigaciones futuras, reduciendo la exploración indiscriminada de arquitecturas y
concentrando los recursos en configuraciones con mayor probabilidad de éxito por dominio clínico.

Sin embargo, el campo enfrenta una tensión no resuelta en la que el ritmo de innovación metodológica
supera consistentemente la capacidad de validación clínica rigurosa. La brecha entre el entusiasmo por
arquitecturas emergentes como transformadores, modelos fundacionales y aprendizaje multimodal, y su
presencia real en estudios primarios con evaluación empírica robusta, señala que la madurez traslacional
pág. 8101
de la IA en salud es aún incipiente. Publicar modelos con alto rendimiento en conjuntos de
entrenamiento no equivale a demostrar utilidad clínica sostenida.

Para que la IA en salud avance de forma responsable, la agenda investigativa requiere reorientarse en al
menos tres direcciones complementarias. La primera implica estandarizar el reporte de métricas,
condiciones de validación y características de los conjuntos de datos. La segunda demanda incorporar
sistemáticamente dimensiones de calibración, equidad algorítmica e incertidumbre predictiva como
criterios centrales de evaluación y no como elementos opcionales. La tercera exige priorizar estudios de
implementación prospectiva con monitoreo continuo que permitan detectar la degradación del modelo
ante cambios en la distribución de los datos.

Finalmente, el valor clínico de la IA en salud no se determinará por la sofisticación de las arquitecturas
empleadas, sino por la solidez con que se demuestre su generalización, seguridad y equidad en
condiciones reales de atención.

REFERENCIAS BIBLIOGRÁFICAS

Awasthi, R., Ramachandran, S. P., Mishra, S., Mahapatra, D., Arshad, H., Atreja, A., Bhattacharyya,
A., Bhattad, A., Singh, N., Cywinski, J. B., Khanna, A. K., Maheshwari, K., Dave, C., Khare,
A., Papay, F. A., & Mathur, P. (2025).
Artificial Intelligence in Healthcare: 2024 Year in
Review
(p. 2025.02.26.25322978). medRxiv. https://doi.org/10.1101/2025.02.26.25322978
Changalidis, A., Barbitoff, Y., Nasykhova, Y., & Glotov, A. (2026). A systematic review on the

generative AI applications in human medical genetics.
Frontiers in Genetics, 16(1694070).
https://doi.org/10.3389/fgene.2025.1694070

Dong, F., Li, S., & Li, W. (2025). TCKAN: A novel integrated network model for predicting mortality

risk in sepsis patients.
Medical & Biological Engineering & Computing, 63(4), 10131025.
https://doi.org/10.1007/s11517
-024-03245-2
Duan, Y., Huo, J., Chen, M., Hou, F., Yan, G., Li, S., & Wang, H. (2023). Early prediction of sepsis

using double fusion of deep features and handcrafted features.
Applied Intelligence, 53(14),
17903
17919. https://doi.org/10.1007/s10489-022-04425-z
pág. 8102
Egger, J., Gsaxner, C., Pepe, A., Pomykala, K. L., Jonske, F., Kurz, M., Li, J., & Kleesiek, J. (2022).

Medical deep learning
A systematic meta-review. Computer Methods and Programs in
Biomedicine
, 221, 106874. https://doi.org/10.1016/j.cmpb.2022.106874
Feng, C., Zhou, X., Wang, H., He, Y., Li, Z., & Tu, C. (2022). Research hotspots and emerging trends

of deep learning applications in orthopedics: A bibliometric and visualized study.
Frontiers in
Public Health
, 10. https://doi.org/10.3389/fpubh.2022.949366
Gao, Q., Chen, L., & Huang, Z. (2026). Opportunities and challenges of artificial intelligence in public

health: A systematic review on technological efficacy, ethical dilemmas, and governance

pathways.
Frontiers in Public Health, 13. https://doi.org/10.3389/fpubh.2025.1748797
Gupta, A., Liu, T., & Crick, C. (2020). Utilizing time series data embedded in electronic health records

to develop continuous mortality risk prediction models using hidden Markov models: A sepsis

case study.
Statistical Methods in Medical Research, 29(11), 34093423.
https://doi.org/10.1177/0962280220929045

Han, S. S., Moon, I. J., Lim, W., Suh, I. S., Lee, S. Y., Na, J.
-I., Kim, S. H., & Chang, S. E. (2020).
Keratinocytic Skin Cancer Detection on the Face Using Region
-Based Convolutional Neural
Network.
JAMA Dermatology, 156(1), 2937.
https://doi.org/10.1001/jamadermatol.2019.3807

Hori, S., Shono, T., Gyohten, K., Ohki, H., Takami, T., & Sato, N. (2020, diciembre 30).
Arrhythmia
detection based on patient
-specific normal ECGs using deep learning. 2020 Computing in
Cardiology Conference. https://doi.org/10.22489/CinC.2020.137

Huqh, M. Z. U., Abdullah, J. Y., Wong, L. S., Jamayet, N. B., Alam, M. K., Rashid, Q. F., Husein, A.,

Ahmad, W. M. A. W., Eusufzai, S. Z., Prasadh, S., Subramaniyan, V., Fuloria, N. K., Fuloria,

S., Sekar, M., & Selvaraj, S. (2022). Clinical Applications o
f Artificial Intelligence and
Machine Learning in Children with Cleft Lip and Palate
A Systematic Review. International
Journal of Environmental Research and Public Health
, 19(17).
https://doi.org/10.3390/ijerph191710860
pág. 8103
Jin, Q., Meng, Z., Sun, C., Cui, H., & Su, R. (2020).
RA-UNet: A Hybrid Deep Attention-Aware
Network to Extract Liver and Tumor in CT Scans.
Frontiers in Bioengineering and
Biotechnology
, 8. https://doi.org/10.3389/fbioe.2020.605132
Kitsios, F., Kamariotou, M., Syngelakis, A. I., & Talias, M. A. (2023). Recent Advances of Artificial

Intelligence in Healthcare: A Systematic Literature Review.
Applied Sciences, 13(13).
https://doi.org/10.3390/app13137479

Kumari, J., Kumar, E., & Kumar, D. (2023). A Structured Analysis to study the Role of Machine

Learning and Deep Learning in The Healthcare Sector with Big Data Analytics.
Archives of
Computational Methods in Engineering
, 30(6), 36733701. https://doi.org/10.1007/s11831-
023
-09915-y
Liu, Y., Liang, R., & Zhang, C. (2024). The application of machine learning algorithms for predicting

length of stay before and during the COVID
-19 pandemic: Evidence from Wuhan-area
hospitals.
Frontiers in Digital Health, 6. https://doi.org/10.3389/fdgth.2024.1506071
Loftus, T. J., Shickel, B., Ruppert, M. M., Balch, J. A., Ozrazgat
-Baslanti, T., Tighe, P. J., Efron, P. A.,
Hogan, W. R., Rashidi, P., Upchurch, G. R., & Bihorac, A. (2022). Uncertainty
-aware deep
learning in healthcare: A scoping review.
PLOS Digital Health, 1(8), e0000085.
https://doi.org/10.1371/journal.pdig.0000085

Malarvannan, S., V, P., Venkatraman, S., A, A., B, P., & A, K. (2025).
A Novel Adaptive Hybrid Focal-
Entropy Loss for Enhancing Diabetic Retinopathy Detection Using Convolutional Neural

Networks
(arXiv:2411.10843). arXiv. https://doi.org/10.48550/arXiv.2411.10843
Nam, S., Kim, D., Jung, W., & Zhu, Y. (2022). Understanding the Research Landscape of Deep

Learning in Biomedical Science: Scientometric Analysis.
Journal of Medical Internet
Research
, 24(4), e28114. https://doi.org/10.2196/28114
Ni, Q., Sun, Z. Y., Qi, L., Chen, W., Yang, Y., Wang, L., Zhang, X., Yang, L., Fang, Y., Xing, Z., Zhou,

Z., Yu, Y., Lu, G. M., & Zhang, L. J. (2020). A deep learning approach to characterize 2019

coronavirus disease (COVID
-19) pneumonia in chest CT images. European Radiology,
30
(12), 65176527. https://doi.org/10.1007/s00330-020-07044-9
pág. 8104
Ogundokun, R. O., Misra, S., Akinrotimi, A. O., & Ogul, H. (2023). MobileNet
-SVM: A Lightweight
Deep Transfer Learning Model to Diagnose BCH Scans for IoMT
-Based Imaging Sensors.
Sensors
, 23(2). https://doi.org/10.3390/s23020656
Page, M. J., McKenzie, J. E., Bossuyt, P. M., Boutron, I., Hoffmann, T. C., Mulrow, C. D., Shamseer,

L., Tetzlaff, J. M., Akl, E. A., Brennan, S. E., Chou, R., Glanville, J., Grimshaw, J. M.,

Hróbjartsson, A., Lalu, M. M., Li, T., Loder, E. W., Mayo
-Wilson, E., McDonald, S., …
Moher, D. (2021). The PRISMA 2020 statement: An updated guideline for reporting

systematic reviews.
BMJ, 372, n71. https://doi.org/10.1136/bmj.n71
Patel, D., Kantamneni, R., John, J. D., Patel, T., Shukla, A., Salma, A., & Anand, N. (2026). Artificial

intelligence in cardiology: An updated systematic review with ethical considerations and

challenges in implementing artificial intelligence models.
Annals of Medicine and Surgery,
88
(2), 1789. https://doi.org/10.1097/MS9.0000000000004607
Pei, X., Zuo, K., Li, Y., & Pang, Z. (2023). A Review of the Application of Multi
-modal Deep
Learning in Medicine: Bibliometrics and Future Directions.
International Journal of
Computational Intelligence Systems
, 16(1), 44. https://doi.org/10.1007/s44196-023-00225-6
Qureshi, M. A., Qureshi, K. N., Jeon, G., & Piccialli, F. (2022). Deep learning
-based ambient assisted
living for self
-management of cardiovascular conditions. Neural Computing and Applications,
34
(13), 1044910467. https://doi.org/10.1007/s00521-020-05678-w
Sanker, V., Venkatesan, A., Salma, A., Sp, A., Li, Z., Heesen, P., Park, C., Park, D. J., & Desai, A.

(2026). Artificial intelligence models in the surgical planning of low
-grade gliomas: A
systematic review.
Frontiers in Oncology, 15(15), 1672289.
https://doi.org/10.3389/fonc.2025.1672289

Santos, C., Aguiar, M., Welfer, D., & Belloni, B. (2022). A New Approach for Detecting Fundus

Lesions Using Image Processing and Deep Neural Network Architecture Based on YOLO

Model.
Sensors, 22(17). https://doi.org/10.3390/s22176441
Shi, S., Zhang, L., Zhang, S., Shi, J., Hong, D., Wu, S., Pan, X., & Lin, W. (2025). Developing a rapid

screening tool for high
-risk ICU patients of sepsis: Integrating electronic medical records with
machine learning methods for mortality prediction in ho
spitalized patientsmodel
pág. 8105
establishment, internal and external validation, and visualization.
Journal of Translational
Medicine
, 23(1), 97. https://doi.org/10.1186/s12967-025-06102-4
Su, L., Xu, Z., Chang, F., Ma, Y., Liu, S., Jiang, H., Wang, H., Li, D., Chen, H., Zhou, X., Hong, N.,

Zhu, W., & Long, Y. (2021). Early Prediction of Mortality, Severity, and Length of Stay in the

Intensive Care Unit of Sepsis Patients Based on Sepsis 3.0
by Machine Learning Models.
Frontiers in Medicine
, 8. https://doi.org/10.3389/fmed.2021.664966
Sun, H., Depraetere, K., Meesseman, L., Silva, P. C., Szymanowsky, R., Fliegenschmidt, J., Hulde, N.,

Dossow, V. von, Vanbiervliet, M., Baerdemaeker, J. D., Roccaro
-Waldmeyer, D. M., Stieg, J.,
Hidalgo, M. D., & Dahlweid, F.
-M. (2022). Machine LearningBased Prediction Models for
Different Clinical Risks in Different Hospitals: Evaluation of Live Performance.
Journal of
Medical Internet Research
, 24(6), e34295. https://doi.org/10.2196/34295
Tang, R., Zhang, S., Ding, C., Zhu, M., & Gao, Y. (2022). Artificial Intelligence in Intensive Care

Medicine: Bibliometric Analysis.
Journal of Medical Internet Research, 24(11), e42185.
https://doi.org/10.2196/42185

Thompson, S. G., & Sharp, S. J. (1999). Explaining heterogeneity in meta
-analysis: A comparison of
methods.
Statistics in Medicine, 18(20), 26932708. https://doi.org/10.1002/(SICI)1097-
0258(19991030)18:20%253C2693::AID
-SIM235%253E3.0.CO;2-V
Thurzo, A., Urbanová, W., Novák, B., Czako, L., Siebert, T., Stano, P., Mareková, S., Fountoulaki, G.,

Kosnáčová, H., & Varga, I. (2022). Where Is the Artificial Intelligence Applied in Dentistry?

Systematic Review and Literature Analysis.
Healthcare, 10(7).
https://doi.org/10.3390/healthcare10071269

Tricco, A. C., Lillie, E., Zarin, W., O’Brien, K. K., Colquhoun, H., Levac, D., Moher, D., Peters, M. D.

J., Horsley, T., Weeks, L., Hempel, S., Akl, E. A., Chang, C., McGowan, J., Stewart, L.,

Hartling, L., Aldcroft, A., Wilson, M. G., Garritty, C., … Str
aus, S. E. (2018). PRISMA
Extension for Scoping Reviews (PRISMA
-ScR): Checklist and Explanation. Annals of
Internal Medicine
, 169(7), 467473. https://doi.org/10.7326/M18-0850
Vaid, A., Sawant, A., Suarez
-Farinas, M., Lee, J., Kaul, S., Kovatch, P., Freeman, R., Jiang, J.,
Jayaraman, P., Fayad, Z., Argulian, E., Lerakis, S., Charney, A. W., Wang, F., Levin, M.,
pág. 8106
Glicksberg, B., Narula, J., Hofer, I., Singh, K., & Nadkarni, G. N. (2023). Implications of the

Use of Artificial Intelligence Predictive Models in Health Care Settings.
Annals of Internal
Medicine
, 176(10), 13581369. https://doi.org/10.7326/M23-0949
Vijayan, M., & S, V. (2023). A Regression
-Based Approach to Diabetic Retinopathy Diagnosis Using
Efficientnet.
Diagnostics, 13(4). https://doi.org/10.3390/diagnostics13040774
Xia, L., He, S., Huang, Y.
-F., & Ma, H. (2024). Multiscale dilated convolutional neural network for
Atrial Fibrillation detection.
PLOS ONE, 19(6), e0301691.
https://doi.org/10.1371/journal.pone.0301691

Xie, J., Stavrakis, S., & Yao, B. (2024). Automated identification of atrial fibrillation from single
-lead
ECGs using multi
-branching ResNet. Frontiers in Physiology, 15.
https://doi.org/10.3389/fphys.2024.1362185

Xu, B., Martín, D., Khishe, M., & Boostani, R. (2022). COVID
-19 diagnosis using chest CT scans and
deep convolutional neural networks evolved by IP
-based sine-cosine algorithm. Medical &
Biological Engineering & Computing
, 60(10), 29312949. https://doi.org/10.1007/s11517-
022
-02637-6
Zhang, P., Lin, F., Ma, F., Chen, Y., Fang, S., Zheng, H., Xiang, Z., Yang, X., & Li, Q. (2023).

Automatic screening of patients with atrial fibrillation from 24
-h Holter recording using deep
learning.
European Heart Journal - Digital Health, 4(3), 216224.
https://doi.org/10.1093/ehjdh/ztad018