Skip to main content

Extraire les entités de plan d’étage d’un PDF (Outils Indoors)

Résumé

Extrait des entités polylignes d’un plan d’étage au format PDF. Extrait éventuellement des entités texte sous forme de points à partir du PDF.

La sortie de cet outil peut être utilisée comme entrée pour que l’outil Import Features To Indoor Dataset (Importer des entités dans un jeu de données Indoor) alimente un espace de travail Indoors.

Utilisation

  • Cet outil accepte un fichier .pdf en entrée et crée des polylignes basées sur les lignes du PDF comme suit :

    • Pour les PDF vectoriels, l’outil extrait directement les informations vectorielles.

    • Pour les PDF raster, l’outil extrait des polylignes en fonction de la largeur de pixel de ligne. Pour les lignes d’une largeur inférieure à 10 pixels, les axes médians des pixels sont utilisés. Pour les lignes d’une largeur supérieure à 10 pixels, les contours des pixels sont utilisés. Utilisez cet outil dans le cadre d’un processus de plus grande envergure pour extraire des plans d’étage à partir de fichiers PDF.

    Remarque :

    Pour les PDF contenant à la fois des données vectorielles et raster, l’outil ne lit que les éléments vectoriels.

  • Vous pouvez utiliser le paramètre optionnel Output Text Point Features (Entités ponctuelles du texte en sortie) pour extraire du texte du PDF. Le texte extrait est écrit pour indiquer les entités ponctuelles contenant le texte dans la table d’attributs. Les points sont placés au centre du texte détecté. Cet outil extrait le texte de la manière suivante :

    • PDF text or PDF comment—Le texte est stocké sous forme d’objets texte dans le PDF que l’outil peut lire directement.

    • OCR text—Pour le texte non stocké sous forme d’objets texte dans le PDF, l’outil utilise la reconnaissance optique de caractères (OCR) pour détecter et reconnaître le texte à extraire.

    Remarque :

    La reconnaissance Optique des Caractères (OCR) désigne une technologie qui permet de détecter du texte dans des images et de le rendre sous forme de chaînes de caractères. Cet outil utilise l’OCR, qui exploite des modèles de Machine Learning pour améliorer la détection et la reconnaissance du texte. Cet outil est compatible avec l’OCR uniquement pour l’anglais et ne prend en charge que le texte horizontal. Signalez toute préoccupation de sécurité ou de confidentialité concernant la technologie de reconnaissance optique des caractères au ArcGIS Trust Center.

  • Si le fichier .pdf en entrée est géoréférencé, les informations de géoréférencement sont prises en compte. Si le fichier .pdf en entrée n’est pas géoréférencé, les polylignes générées sont créées dans WGS 1984 Web Mercator aux coordonnées 0,0. Lors du géoréférencement, assurez-vous que le PDF est ajouté à la carte avec la résolution par défaut dans le réglage DPI dans la boîte de dialogue PDF Options (Options PDF).

  • Pour les PDF comportant plusieurs pages, utilisez le paramètre Page Number (Numéro de page) pour indiquer la page à importer.

  • La valeur du paramètre Output Line Features (Entités linéaires en sortie) prend en charge la création d’une classe d’entités ou l’ajout de nouvelles entités polylignes à une couche existante. Lors de l’ajout à une couche existante qui contient des entités avec des valeurs de champ PDF_NAME et PDF_PAGE correspondant au PDF en entrée, ces entités polylignes sont supprimées et de nouvelles entités polylignes sont ajoutées. L’outil stocke les informations d’attribut en sortie.

  • Les entités linéaires en sortie sont créées avec une valeur z de 0. Définissez la valeur z du niveau lors de l’exécution de l’outil Import Features To Indoor Dataset (Importer des entités dans un jeu de données Indoor).

  • La valeur du paramètre Output Text Point Features (Entités linéaires en sortie) prend en charge la création d’une classe d’entités ou l’ajout de nouvelles entités polylignes à une couche existante. Si une couche existante qui contient des entités avec des valeurs de champ PDF_NAME et PDF_PAGE correspondant au PDF en entrée est fournie, ces entités polylignes sont supprimées et de nouvelles entités polylignes sont ajoutées. L’outil stocke les informations d’attribut, comme la couleur et la taille du texte, pour le texte détecté dans la sortie des caractéristiques ponctuelles.

  • Les entités ponctuelles du texte en sortie sont situées de façon centralisée dans l’emprise de texte détecté.

  • Utilisez le paramètre Extent (Étendue) pour limiter l’étendue de traitement et exclure des éléments PDF tels que les légendes, les zones de texte et les lignes de rattachement.

  • Vous pouvez utiliser la sortie de cet outil comme entrée pour l’outil Import Features To Indoor Dataset (Importer des entités dans le jeu de données Indoor) dans le cadre de l’action Extraire les caractéristiques de plans d’étage des PDFs**.

Paramètres

Etiqueter Explication Type de données

PDF en entrée

Le fichier .pdf en entrée à partir duquel les entités seront extraites.

File

Entités linéaires en sortie

La couche d’entités polylignes en sortie dans laquelle les polylignes extraites seront écrites.

Feature Layer

Numéro de page

(Facultatif)

Le numéro de page du fichier .pdf en entrée à partir duquel les entités seront extraites. La valeur par défaut est 1.

String

Etendue

(Facultatif)

Étendue des données qui seront évaluées.

  • Current Display Extent (Étendue actuellement affichée) Vue cartographique : l’étendue repose sur la carte ou scène active.

  • Draw Extent (Dessiner l’étendue) Terminer avec mise à l’échelle : l’étendue est basée sur un rectangle dessiné sur la carte ou dans la scène.

  • Extent of a Layer (Étendue d’une couche) Couche : l’étendue repose sur une couche de carte active. Choisissez une couche disponible ou utilisez l’option Étendue des données dans toutes les couches. Chaque couche de carte comporte les options suivantes :

    • All Features (Toutes les entités) Sélectionner tout : étendue de toutes les entités.

    • Selected Features (Entités sélectionnées) Zone des entités sélectionnées : étendue des entités sélectionnées.

    • Visible Features (Entités visibles) Indicateur de l’étendue : étendue des entités visibles.

  • Browse (Parcourir) Parcourir : l’étendue repose sur un jeu de données existant.

  • Intersection of Inputs (Intersection des entrées) Intersection : l’étendue repose sur l’étendue d’intersection de toutes les entrées.

  • Union of Inputs (Union des entrées) Union : l’étendue est basée sur l’étendue combinée de toutes les entrées.

  • Clipboard (Presse-papiers) Coller : l’étendue peut être copiée depuis et vers le Presse-papiers.

    • Copy Extent (Copier l’étendue) Copier : copie l’étendue et le système de coordonnées dans le Presse-papiers.

    • Paste Extent (Coller l’étendue) Coller : colle l’étendue et les coordonnées depuis le Presse-papiers. Si le Presse-papiers n’inclut pas de système de coordonnées, l’étendue utilise celui de la carte.

  • Reset Extent (Réinitialiser l’étendue) Réinitialiser : la valeur par défaut de l’étendue est rétablie.

Lorsque les coordonnées sont saisies manuellement, elles doivent être des valeurs numériques incluses dans le système de coordonnées de la carte active. La carte peut utiliser des unités d’affichage différentes de celles des coordonnées saisies. Utilisez le signe moins pour les coordonnées sud et ouest.

Extent

Entités ponctuelles de texte en sortie

(Facultatif)

La couche d’entités ponctuelles en sortie dans laquelle le texte extrait est écrit.

Feature Layer

Environnements

Etendue

Informations de licence

  • Basic: Non
  • Standard: Non
  • Advanced: Requiert ArcGIS Indoors Pro ou ArcGIS Indoors Maps