Aller au contenu

Vous cherchez l’agence web Beriox (site, SEO, publicité) ? beriox.ca Ici, c’est BerioxHUB : rapports GA4 et Search Console.

Site Scanner

Site Scanner

Le Site Scanner permet d’analyser un site web en le parcourant automatiquement : capture d’écran des pages, extraction de texte (y compris via OCR si besoin) et génération d’un rapport d’extraction.

Vue d’ensemble

  • Route : /site-scanner
  • Contrôleur : SiteScannerController
  • Description : Scanner de sites pour analyser la structure et le contenu (captures, extraction, logs).

Le module lance un processus en arrière-plan (script Node.js avec Tesseract pour l’OCR). Vous pouvez suivre l’avancement et consulter les captures une fois le scan terminé.

Accéder au module

  1. Accédez à l’URL Site Scanner (menu ou /site-scanner).
  2. Saisissez l’URL du site à analyser.

Lancer un scan

  1. URL cible : Indiquez l’URL complète du site (ex. https://example.com).
  2. Nombre max de pages (optionnel) : Limite entre 1 et 100 pages.
  3. OCR : Activer ou désactiver l’extraction de texte par OCR sur les captures.
  4. Cliquez sur Démarrer le scan.

Un identifiant de scan (scan_id) est retourné. Le traitement s’exécute en arrière-plan.

Suivre un scan

  • Statut : Vérifier si le scan est en cours ou terminé via l’API ou l’interface (statut : running ou completed).
  • Captures : Les captures d’écran sont stockées dans storage/app/public/screenshots/ et accessibles par scan.
  • Logs : Les logs du processus sont enregistrés (fichier .log associé au scan_id).

Résultats

  • Captures : Liste des PNG par page parcourue, avec chemin et date.
  • Rapport d’extraction : Fichier extraction-report.json dans le dossier du scan (URL cible, métadonnées).
  • Contenu par page : Données extraites (texte, structure) disponibles via l’API pour chaque capture.

Prérequis techniques

  • Node.js installé sur le serveur.
  • Script : scripts/extract-with-tesseract.js présent à la racine du projet.
  • OCR : Tesseract utilisé si l’option OCR est activée.

Voir aussi