Données épidémiologiques et climatiques
Le nombre hebdomadaire de cas de dengue a été obtenu par le National Brasien Notification System (SINAN) pour tous les capitaux de l’État de 2014 à 2024. Les données de la série chronologique pour chaque municipalité ont été divisées en périodes d’une année, à partir de la semaine 27 épidémiologique et prolongée à la semaine 26 de l’année suivante. Chaque segment correspond à une saison, comme 2014/2015, 2015/2016 et ainsi de suite, jusqu’en 2023/2024. Dans la ville comme Rio de Janeiro, la transmission de la dengue en général commence à la fin de l’année, avec une baisse au cours du premier semestre de l’année suivante. Cependant, ce cycle varie chaque année et peut différer des municipalités. Le Brésil a 27 capitaux d’État, ce qui se traduit par un ensemble de données de 270 séries chronologiques d’un an, chacune représentée par quelques municipalités et saisons. Chaque couple comprend également un nombre cumulatif total de cas, qui représente le nombre saisonnière des cas de dengue.
Les données de notification de Sinan étaient accessibles via le projet InfoEngue (InfoDengue.mat.BR)17. Des variables supplémentaires, y compris la température hebdomadaire minimale, la température moyenne, l’humidité minimale et l’humidité moyenne, ont également été obtenues à partir du projet infosable. Les données climatiques dans l’infodéggue proviennent de stations météorologiques situées dans les municipalités respectives18. La base de données a été divisée en ensembles de formation et de tests par échantillonnage aléatoire, avec les deux tiers des séries chronologiques désignées pour la formation et un tiers pour les tests.
Résultats d’intérêt
L’écart moyen et type du logarithme du nombre cumulatif de cas a été calculé. Chaque paire de municipalité / année a été classée sur la base du fait que son incidence cumulative relève du plus grand nombre de cas saisonniers, déterminé par une coupe spécifiée. Cette coupure, exprimée à une échelle logarithmique, a été dérivée de la valeur moyenne (logarithme) des cas plus l’écart type, régulé par un facteur AA correspondant k centile. Nous avons évalué plusieurs scénarios qui varient la valeur de k depuis k = De 0,4 à 0,9 avec 0,1 augmentation.
Les accidents les plus élevés représentent une partie de 1 – k de l’ensemble total. Par exemple, si k Il est réglé à 80%, cela classerait les couples de manière à ce que 80% tombent en dessous de la réduction, avec le résultat conséquent de 0. Au contraire, 20% plus élevé (1-0,80) de toutes les valeurs d’impact auraient le résultat de 1, ce qui indique qu’il s’agit de 20% des unités avec les accidents les plus élevés.
Construction d’itinéraires et de signatures de l’itinéraire
Chaque municipalité a une série de fonctionnalités Xje mesuré dans les unités du temps (semaines). Pour chaque paire de la municipalité et de la saison, une matrice (: {V} _ {n tempes : w} )de caractéristiques, qui se compose de N caractéristiques Wsemaines, décrit un chemin. Toutes les combinaisons de la municipalité et de la saison n’ont pas nécessairement le même nombre d’observations pour ces caractéristiques. Les caractéristiques sont sur une base hebdomadaire: le nombre de cas de dense, le nombre cumulatif de cas denses, la température moyenne, la température minimale, l’humidité moyenne et l’humidité minimale. Dans une phase d’augmentation des données, nous améliorons également les caractéristiques de l’ensemble en incorporant l’incidence cumulative partielle. De nombreuses études, comme celles de Fermanian et al.19Ils ont souligné la nécessité d’incorporer des données.
Une option évaluée consiste à inclure le temps passé en semaines dans l’ensemble de données comme modification initiale. Plusieurs études ont utilisé des transformations de plomb-laboratoire5.19. Ces techniques ont été appliquées à toutes les variables originales de cette étude. Par conséquent, les méthodes d’incorporation ont été classées comme « aucune », « temps » et « temps / délai de plomb » pour l’incidence cumulative, avec les trois méthodes appliquées à l’incidence cumulative.
Pour chaque chemin, une signature est calculée par les éléments20:
$$ : S Left (x à droite) = Left (1, : : Left {{s} _ {{i} _ {1}} droite }, : : Left {{s} _ {{i} _ {2}} }, : dots : : {} }, : DOT _ {i} _ {n}} droite }, : Left {s} {1}, {i} _ {1}} à droite }, : : Left {{s} _ {{i}} _ {1}, {i} _ {2}} }, : {i} _ _ : : : Left {{s} _ {{i} _ {1}, {i} _ {1}, : {i} _ {1}} à droite }, Dots : à droite), $$
Où ( » _ {n}} ^ {:} d {x} _ {{1} _ {1} Dots : d {x} _ {{1} _ {n} ).
Théoriquement, la signature capture les interactions entre les caractéristiques le= 1, 2, 3, … (: Infty : ) niveaux. Pour des raisons pratiques, la signature est coupée au plus haut niveau M . Par conséquent, les termes au quatrième niveau, comme (« , (: Left {{s} _ {{i} _ {1}, {i} _ {1}, : {i} _ {1}, : {i} _ {2}} droite ) )etc., ont été inclus. La signature du registre a été utilisée pour réduire le nombre de termes et réduire les licenciements21et la valeur utilisée pour la troncature était M = 4. Par exemple, avec 7 fonctionnalités et M = 4 Cette troncature se traduit en 728 termes dans la signature du registre.
Analyse statistique
L’ensemble des signatures (: {S} _ {c tempes : z} )Où z C’est la longueur d’une signature de la troncature choisie e C Il s’agit du nombre total de combinaisons de la municipalité / saison, elle est utilisée comme variables pour l’analyse de régression. Chaque couple, défini par la municipalité et la saison, a un résultat qui indique si la saison fait partie de celle spécifique k centile de l’incidence totale. Pour un transporteur y En représentant les résultats de tous les couples de la saison commune, nous analysons les données en utilisant la régression logistique avec la pénalité du Lazo22Application de termes normalisés en fonction des moyennes et des écarts-types dérivés des signatures des données de formation. Cette régression est combinée avec la régularisation du Lazo car elle peut réduire ou éliminer efficacement l’influence de composants non pertinents en raison du manque d’association ou de signification statistique. Cette approche est fondamentale, étant donné la durée des signatures et des signatures tronquées. Pour prédire les résultats, nous utilisons les meilleurs coefficients du modèle, qui minimisent l’hyperparamètre lazo (: lambda : )avec les termes normalisés par la signature des données de test. Le nombre de semaines d’observation variait de 26 à 50 semaines pour les prévisions avec l’ensemble de test.
L’implémentation utilise le package Python Demande Pour obtenir des signatures et des signatures de troncs, tandis que l’outil d’analyse a été développé en r avec le réticuléemballer. Nous avons utilisé le GlmnetET GlmnettitilsPackages pour la régression de Lazo.