Extraire les entités de plan d’étage d’un PDF (Outils Indoors)
Résumé
Extrait des entités polylignes d’un plan d’étage au format PDF. Extrait éventuellement des entités texte sous forme de points à partir du PDF.
La sortie de cet outil peut être utilisée comme entrée pour que l’outil Import Features To Indoor Dataset (Importer des entités dans un jeu de données Indoor) alimente un espace de travail Indoors.
Utilisation
Cet outil accepte un fichier
.pdfen entrée et crée des polylignes basées sur les lignes du PDF comme suit :Pour les PDF vectoriels, l’outil extrait directement les informations vectorielles.
Pour les PDF raster, l’outil extrait des polylignes en fonction de la largeur de pixel de ligne. Pour les lignes d’une largeur inférieure à 10 pixels, les axes médians des pixels sont utilisés. Pour les lignes d’une largeur supérieure à 10 pixels, les contours des pixels sont utilisés. Utilisez cet outil dans le cadre d’un processus de plus grande envergure pour extraire des plans d’étage à partir de fichiers PDF.
Remarque :
Pour les PDF contenant à la fois des données vectorielles et raster, l’outil ne lit que les éléments vectoriels.
Vous pouvez utiliser le paramètre optionnel Output Text Point Features (Entités ponctuelles du texte en sortie) pour extraire du texte du PDF. Le texte extrait est écrit pour indiquer les entités ponctuelles contenant le texte dans la table d’attributs. Les points sont placés au centre du texte détecté. Cet outil extrait le texte de la manière suivante :
PDF text or PDF comment—Le texte est stocké sous forme d’objets texte dans le PDF que l’outil peut lire directement.
OCR text—Pour le texte non stocké sous forme d’objets texte dans le PDF, l’outil utilise la reconnaissance optique de caractères (OCR) pour détecter et reconnaître le texte à extraire.
Remarque :
La reconnaissance Optique des Caractères (OCR) désigne une technologie qui permet de détecter du texte dans des images et de le rendre sous forme de chaînes de caractères. Cet outil utilise l’OCR, qui exploite des modèles de Machine Learning pour améliorer la détection et la reconnaissance du texte. Cet outil est compatible avec l’OCR uniquement pour l’anglais et ne prend en charge que le texte horizontal. Signalez toute préoccupation de sécurité ou de confidentialité concernant la technologie de reconnaissance optique des caractères au ArcGIS Trust Center.
Si le fichier
.pdfen entrée est géoréférencé, les informations de géoréférencement sont prises en compte. Si le fichier.pdfen entrée n’est pas géoréférencé, les polylignes générées sont créées dans WGS 1984 Web Mercator aux coordonnées 0,0. Lors du géoréférencement, assurez-vous que le PDF est ajouté à la carte avec la résolution par défaut dans le réglage DPI dans la boîte de dialogue PDF Options (Options PDF).Pour les PDF comportant plusieurs pages, utilisez le paramètre Page Number (Numéro de page) pour indiquer la page à importer.
La valeur du paramètre Output Line Features (Entités linéaires en sortie) prend en charge la création d’une classe d’entités ou l’ajout de nouvelles entités polylignes à une couche existante. Lors de l’ajout à une couche existante qui contient des entités avec des valeurs de champ
PDF_NAMEetPDF_PAGEcorrespondant au PDF en entrée, ces entités polylignes sont supprimées et de nouvelles entités polylignes sont ajoutées. L’outil stocke les informations d’attribut en sortie.Les entités linéaires en sortie sont créées avec une valeur z de 0. Définissez la valeur z du niveau lors de l’exécution de l’outil Import Features To Indoor Dataset (Importer des entités dans un jeu de données Indoor).
La valeur du paramètre Output Text Point Features (Entités linéaires en sortie) prend en charge la création d’une classe d’entités ou l’ajout de nouvelles entités polylignes à une couche existante. Si une couche existante qui contient des entités avec des valeurs de champ
PDF_NAMEetPDF_PAGEcorrespondant au PDF en entrée est fournie, ces entités polylignes sont supprimées et de nouvelles entités polylignes sont ajoutées. L’outil stocke les informations d’attribut, comme la couleur et la taille du texte, pour le texte détecté dans la sortie des caractéristiques ponctuelles.Les entités ponctuelles du texte en sortie sont situées de façon centralisée dans l’emprise de texte détecté.
Utilisez le paramètre Extent (Étendue) pour limiter l’étendue de traitement et exclure des éléments PDF tels que les légendes, les zones de texte et les lignes de rattachement.
Vous pouvez utiliser la sortie de cet outil comme entrée pour l’outil Import Features To Indoor Dataset (Importer des entités dans le jeu de données Indoor) dans le cadre de l’action Extraire les caractéristiques de plans d’étage des PDFs**.
Paramètres
| Etiqueter | Explication | Type de données |
|---|---|---|
|
PDF en entrée |
Le fichier |
File |
|
Entités linéaires en sortie |
La couche d’entités polylignes en sortie dans laquelle les polylignes extraites seront écrites. |
Feature Layer |
|
Numéro de page (Facultatif) |
Le numéro de page du fichier |
String |
|
Etendue (Facultatif) |
Étendue des données qui seront évaluées.
Lorsque les coordonnées sont saisies manuellement, elles doivent être des valeurs numériques incluses dans le système de coordonnées de la carte active. La carte peut utiliser des unités d’affichage différentes de celles des coordonnées saisies. Utilisez le signe moins pour les coordonnées sud et ouest. |
Extent |
|
Entités ponctuelles de texte en sortie (Facultatif) |
La couche d’entités ponctuelles en sortie dans laquelle le texte extrait est écrit. |
Feature Layer |
Environnements
Informations de licence
- Basic: Non
- Standard: Non
- Advanced: Requiert ArcGIS Indoors Pro ou ArcGIS Indoors Maps