Skip to main content

Agrégation de séries chronologiques (Outils d'exploration des modèles spatio-temporels)

Résumé

Cet outil partitionne une collection de séries chronologiques, stockées dans un cube spatio-temporel, en fonction de la similarité de leurs caractéristiques. Les séries chronologiques peuvent être agrégées en fonction de trois critères : disposer de valeurs similaires dans le temps, tendance à augmenter et diminuer simultanément et disposer de motifs se répétant similaires. La sortie de cet outil est un affichage cartographique 2D de chaque emplacement dans le cube symbolisé par des messages et une appartenance à un agrégat. Cette sortie contient également des diagrammes présentant des informations sur la caractéristique représentative des séries chronologiques de chaque agrégat.

En savoir plus sur le fonctionnement de l’outil Agrégation de séries chronologiques

Illustration

Illustration de l’outil Agrégation de séries chronologiques

Utilisation

  • Cet outil accepte les fichiers netCDF créés par divers outils de la boîte à outils Exploration des modèles spatio-temporels.

    En savoir plus sur la création d’un cube spatio-temporel

  • Cet outil compare la série chronologique à chaque localisation à toutes les autres localisations du cube spécifié dans Input Space Time Cube (Cube spatio-temporel en entrée) et les séries chronologiques sont agrégées en fonction de leur similarité. Le paramètre Characteristic of Interest (Caractéristique remarquable) est utilisé pour définir ce qui fait que deux séries chronologiques sont similaires, sachant que vous pouvez définir la similarité en fonction de l’une des caractéristiques suivantes :

    • Value (Valeur) : les séries chronologiques sont similaires si elles ont des valeurs Analysis Variable (Variable d’analyse) approximativement égales dans le temps. Par exemple, une série chronologique ayant les valeurs (1, 0, 1, 0, 1) ressemble plus à une série chronologique ayant les valeurs (1, 1, 1, 1, 1) qu’à une série chronologique ayant les valeurs (10, 0, 10, 0, 10) car les valeurs sont plus similaires.

    • Profile (Correlation) (Profil [Corrélation]) : les séries chronologiques sont similaires si leurs valeurs tendent à augmenter et à diminuer simultanément et sont approximativement proportionnelles (en d’autres termes, si elles sont corrélées dans le temps). Par exemple, une série chronologique ayant les valeurs (1, 0, 1, 0, 1) ressemble plus à une série chronologique ayant les valeurs (10, 0, 10, 0, 10) qu’à une série chronologique ayant les valeurs (1, 1, 1, 1, 1) car les valeurs augmentent et diminuent simultanément et conservent une proportion cohérente.

    • Profile (Fourier) (Profil [Fourier]) : les séries chronologiques sont similaires si leurs valeurs présentent des motifs réguliers périodiques similaires dans le temps. Ces périodes sont parfois nommées cycles ou saisons et représentent des durées d’un motif qui se répète alors dans une nouvelle période. Par exemple, les entreprises peuvent constater des motifs se répétant périodiques dans leurs ventes totales chaque semaine, la période commençant le lundi et se terminant le dimanche. Si vous le souhaitez, vous pouvez choisir d’ignorer certaines caractéristiques de ces motifs dans le paramètre Time Series Characteristics to Ignore (Caractéristiques de série chronologique à ignorer). Les motifs se répétant sont détectés à l’aide d’une analyse de données fonctionnelles avec une famille de Fourier. Pour que cette option soit la plus efficace possible, les séries chronologiques de votre cube spatio-temporel en entrée doivent couvrir toute la durée d’au moins une période. Par exemple, la température a une période annuelle déterminée par les saisons météorologiques, mais si toutes les données étaient collectées dans un délai de plusieurs mois d’une seule année, cette option ne pourrait peut-être pas détecter la période annuelle.

    Avec la définition de la similarité, les localisations du cube spatio-temporel sont regroupées à l’aide de plusieurs algorithmes d’agrégation pour produire les agrégats finaux renvoyés par l’outil. Reportez-vous à la rubrique Fonctionnement de l’outil Agrégation de séries chronologiques pour plus d’informations sur ces algorithmes d’agrégation.

  • Les entités spécifiées dans Output Features (Entités en sortie) sont ajoutées à la fenêtre Contents (Contenu) avec un rendu dépendant du champ CLUSTER_ID et indiquent l’agrégat auquel chaque localisation appartient. Si vous spécifiez trois agrégats, par exemple, chaque enregistrement affiche la valeur 1, 2 ou 3 dans le champ CLUSTER_ID. Le champ CENTER_REP identifie la série chronologique de médoïde de chaque agrégat et contient la valeur 1 pour la série chronologique de médoïde de chaque agrégat et la valeur 0 pour toutes les autres entités.

  • Cet outil crée des messages et des diagrammes facultatifs pour mieux comprendre les caractéristiques des agrégats identifiés. Vous pouvez accéder aux messages en passant le curseur de la souris sur la barre de progression, en cliquant sur le bouton de menu contextuel ou en développant la section de messages dans la fenêtre Geoprocessing (Géotraitement). Vous pouvez également accéder aux messages d’une précédente exécution de l’outil Agrégation de séries chronologiques via l’historique de géotraitement. Si vous spécifiez une valeur dans le paramètre Output Table for Charts (Table en sortie pour les diagrammes), des diagrammes sont créés pour la table en sortie et affichent la série chronologique moyenne pour chaque agrégat et le médoïde de la série chronologique dans chaque agrégat. Ces diagrammes sont accessibles dans la fenêtre Contents (Contenu) sous la table créée dans la section Standalone Tables (Tables autonomes). Pour plus d’informations sur les diagrammes et les messages en sortie, reportez-vous à la rubrique Fonctionnement de l’outil Agrégation de séries chronologiques.

  • Parfois, vous connaissez le nombre d’agrégats le plus approprié pour vos données. Si ce n’est pas le cas, vous devrez essayer différents nombres d’agrégats et noter les valeurs qui permettent de mieux les différencier. Si vous ne renseignez pas la valeur Number of Clusters (Nombre d’agrégats), l’outil évalue le nombre optimal d’agrégats par la méthode de statistique pseudo F et signale le nombre optimal d’agrégats dans un message de géotraitement. Plus la statistique de pseudo F est élevée, plus chaque agrégat se distingue des autres agrégats. Le nombre optimal d’agrégats ne sera pas supérieur à 10, et calculer le nombre optimal d’agrégats nécessite l’essentiel du temps d’exécution de l’outil. Nous vous recommandons de fournir un nombre d’agrégats si vous connaissez une valeur appropriée ou si le délai d’exécution de l’outil est trop long.

    Pour calculer le nombre optimal d’agrégats, l’outil essaye entre 2 et 10 agrégats. Pour chacun de ces 9 nombres possibles d’agrégats, l’outil procède à 10 agrégations à l’aide de valeurs initiales aléatoires, sauf lorsque Profile (Correlation) (Profil [Corrélation]) est utilisé avec plus de 10 000 localisations dans le cube spatio-temporel, auquel cas chaque nombre de voisins est répété 20 fois. Cela produit 90 (ou 180) résultats d’agrégats possibles (10 ou 20 pour chacun des 9 nombres possibles d’agrégats), et celui ayant la statistique pseudo F la plus élevée est choisi pour le nombre final d’agrégats utilisés dans l’outil. La statistique pseudo F la plus élevée pour chacun des 9 nombres possibles d’agrégats est imprimée sous la forme d’une table dans les messages de géotraitement.

    Remarque :

    Une statistique pseudo F d’infinité signifie que toutes les séries chronologiques dans le même agrégat sont parfaitement similaires les unes aux autres.

  • L’ID d’agrégat attribué à un emplacement peut changer à chaque exécution, car les valeurs initiales utilisées pour créer des agrégats sont sélectionnées de manière aléatoire par l’algorithme. Supposons, par exemple, que vous divisiez les emplacements en deux agrégats basés sur la croissance annuelle de la population. La première fois que vous effectuez l’analyse, vous pouvez voir les localisations à forte croissance étiquetées en tant qu’agrégat 2 et les localisations à faible croissance comme agrégat 1 ; lorsque vous effectuez la même analyse pour la seconde fois, les localisations à forte croissance peuvent être étiquetées en tant qu’agrégat 1. Vous pouvez aussi constater que certaines localisations à croissance moyenne changent d’agrégat d’une exécution à l’autre. Ceci est dû au caractère aléatoire de l’algorithme d’agrégation. Si les résultats d’agrégation changent significativement suite à la ré-exécution de l’outil avec les mêmes paramètres, envisagez de changer la valeur du paramètre Number of Clusters (Nombre d’agrégats).

Paramètres

Etiqueter Explication Type de données

Cube spatio-temporel en entrée

Le cube spatio-temporel contenant la variable à analyser. Les cubes spatio-temporels présentent une extension de fichier .nc et sont créés à l’aide de divers outils de la boîte à outils Exploration des modèles spatio-temporels.

File

Variable d'analyse

Variable numérique figurant dans le fichier netCDF, qui évolue au fil du temps et est utilisée pour distinguer les agrégats entre eux.

String

Entités en sortie

Nouvelle classe d’entités en sortie qui contient toutes les localisations du cube spatio-temporel et un champ indiquant à quel agrégat chaque entité appartient. Cette classe d'entités sera une représentation en deux dimensions des tendances des agrégats dans vos données.

Feature Class

Caractéristique remarquable

Spécifie la caractéristique de la série chronologique qui sera utilisée pour déterminer les emplacements à agréger.

  • ValeurLes emplacements ayant des valeurs similaires dans le temps sont agrégés.

  • Profil (Corrélation)Les emplacements dont les valeurs tendent à augmenter et diminuer proportionnellement en même temps sont agrégés.

  • Profil (Fourier)Les emplacements ayant des motifs réguliers périodiques similaires sont agrégés.

String

Nombre d’agrégats

(Facultatif)

Nombre d’agrégats à créer. Si ce paramètre n’est pas renseigné, l’outil évalue le nombre optimal d’agrégats à l’aide de la statistique de pseudo F. Le nombre optimal d’agrégats est indiqué dans la fenêtre de messages.

Long

Table en sortie pour les diagrammes

(Facultatif)

Si ce paramètre est défini, cette table contient les séries chronologiques représentatives de chaque agrégat en fonction à la fois de la moyenne et des médoïdes des séries chronologiques par agrégat. Les diagrammes créés à partir de cette table sont accessibles dans la section Standalone Tables (Tables autonomes).

Table

Caractéristiques de série chronologique à ignorer

(Facultatif)

Spécifie les caractéristiques qui seront ignorées lors de l’établissement de la similarité entre deux séries chronologiques.

Si les deux caractéristiques sont ignorées, deux séries chronologiques sont considérées comme similaires si les durées des périodes sont similaires, même si elles commencent à des heures différentes et ont des valeurs différentes dans les périodes.

  • Décalage temporelL’heure de début de chaque période, y compris les décalages temporels, seront ignorés. Par exemple, si deux séries chronologiques ont des motifs périodiques similaires, mais que les valeurs de l’une sont trois jours derrière l’autre, ces deux séries chronologiques sont considérées comme similaires.

  • PlageLa magnitude des valeurs dans chaque période sera ignorée. Par exemple, si deux séries chronologiques commencent et terminent leurs périodes en même temps, elles sont considérées comme similaires, même si les valeurs réelles sont très différentes.

String

Activer les fenêtres contextuelles de série chronologique

(Facultatif)

Indique si les diagrammes de série chronologique sont créés dans les fenêtres contextuelles de chaque entité en sortie affichant la série chronologique de l’entité et la série chronologique moyenne de toutes les entités dans le même agrégat que l’entité. Les fenêtres contextuelles de série chronologique ne sont pas prises en charge pour les sorties shapefile.

  • ActivéLes diagrammes de série chronologique sont créés pour les entités en sortie.

  • DécochéLes diagrammes de série chronologique ne sont pas créés. Il s’agit de l’option par défaut.

Boolean

Environnements

Facteur de traitement parallèle, Générateur de nombres aléatoires

Cas particuliers

Générateur de nombres aléatoires

The Random Generator Type used is always Mersenne Twister.

Informations de licence

  • Basic: Oui
  • Standard: Oui
  • Advanced: Oui