Site Scanner
Le Site Scanner permet d’analyser un site web en le parcourant automatiquement : capture d’écran des pages, extraction de texte (y compris via OCR si besoin) et génération d’un rapport d’extraction.
Vue d’ensemble
- Route :
/site-scanner - Contrôleur :
SiteScannerController - Description : Scanner de sites pour analyser la structure et le contenu (captures, extraction, logs).
Le module lance un processus en arrière-plan (script Node.js avec Tesseract pour l’OCR). Vous pouvez suivre l’avancement et consulter les captures une fois le scan terminé.
Accéder au module
- Accédez à l’URL Site Scanner (menu ou
/site-scanner). - Saisissez l’URL du site à analyser.
Lancer un scan
- URL cible : Indiquez l’URL complète du site (ex.
https://example.com). - Nombre max de pages (optionnel) : Limite entre 1 et 100 pages.
- OCR : Activer ou désactiver l’extraction de texte par OCR sur les captures.
- Cliquez sur Démarrer le scan.
Un identifiant de scan (scan_id) est retourné. Le traitement s’exécute en arrière-plan.
Suivre un scan
- Statut : Vérifier si le scan est en cours ou terminé via l’API ou l’interface (statut :
runningoucompleted). - Captures : Les captures d’écran sont stockées dans
storage/app/public/screenshots/et accessibles par scan. - Logs : Les logs du processus sont enregistrés (fichier
.logassocié auscan_id).
Résultats
- Captures : Liste des PNG par page parcourue, avec chemin et date.
- Rapport d’extraction : Fichier
extraction-report.jsondans le dossier du scan (URL cible, métadonnées). - Contenu par page : Données extraites (texte, structure) disponibles via l’API pour chaque capture.
Prérequis techniques
- Node.js installé sur le serveur.
- Script :
scripts/extract-with-tesseract.jsprésent à la racine du projet. - OCR : Tesseract utilisé si l’option OCR est activée.
Voir aussi
- Sites crawlés : gestion des sites à crawler (admin).
- Scans planifiés : automatisation des scans.