Audit technique SEO complet : la checklist 2026 en 14 volets
Un audit technique SEO complet vérifie que les moteurs de recherche, et désormais les agents IA, peuvent explorer, comprendre et citer chaque page d’un site. En 2026, la partie classique de l’exercice (crawl, indexation, vitesse, sécurité) reste la même qu’il y a cinq ans. Ce qui change, c’est qu’un site peut cocher toutes ces cases et rester invisible pour ChatGPT, Perplexity ou les AI Overviews de Google. Voici les 14 volets à passer en revue, du plus fondamental au plus récent.
1. Crawlabilité : ce que robots.txt autorise vraiment
Un fichier robots.txt accumule des règles ajoutées par un développeur en 2019, jamais retirées. Certaines bloquent des dossiers entiers sans que personne ne sache pourquoi. Première étape d’un audit sérieux : relire chaque ligne et se demander si elle sert encore un but. Un « Disallow » posé sur un dossier CSS ou JS empêche Google de rendre la page correctement, ce qui pénalise le classement depuis l’indexation mobile-first. Vérifier aussi les balises meta robots et les en-têtes X-Robots-Tag, qui peuvent contredire silencieusement le fichier robots.txt.
2. Budget de crawl : où Googlebot perd son temps
Le budget de crawl ne pèse vraiment que sur les sites de plusieurs milliers de pages. C’est justement là que la plupart des audits s’arrêtent avant d’y regarder. Sur un catalogue e-commerce ou un site à facettes, Googlebot explore souvent en majorité des URL à paramètres : filtres de couleur, tri, pagination. Pendant ce temps, les nouvelles fiches produit attendent leur tour. Le rapport « Statistiques d’exploration » de Search Console donne une première photo. Les logs serveur donnent la vérité complète : quelles URL Googlebot visite, à quelle fréquence, avec quel code de réponse. C’est le point que la plupart des audits sautent, faute de temps ou d’accès aux logs.
3. Indexation : sitemap XML et canonicalisation
Un sitemap XML doit contenir uniquement des URL canoniques, indexables, renvoyant un code 200. Une URL bloquée par robots.txt ou marquée noindex n’a rien à y faire. Elle sème la confusion chez Google et gaspille une ligne de budget. La balise canonical mérite le même niveau d’exigence. Une page qui pointe vers une URL différente d’elle-même sans raison claire dilue son propre signal d’indexation. Le rapport de couverture de Search Console liste les pages exclues et leur raison. Cest la première chose à consulter avant de deviner.
4. Architecture et maillage interne
La profondeur de clic compte encore. Une page à cinq clics de la page d’accueil reçoit moins de crawl et moins d’autorité qu’une page à deux clics, même si son contenu est meilleur. Un audit d’architecture cartographie combien de clics séparent les pages stratégiques de la home. Il renforce ensuite le maillage vers les pages qui en ont besoin, plutôt que de tout lier depuis un mega-menu. Un menu qui pointe vers cinquante pages à la fois dilue son propre poids. Mieux vaut des liens contextuels, insérés dans le corps du texte, vers les pages qui comptent vraiment pour le sujet traité.
5. Rendu JavaScript : que voit vraiment le crawler ?
Un site en React ou en Vue peut afficher un beau contenu dans un navigateur et une coquille vide pour un crawler mal configuré. L’outil d’inspection d’URL de Search Console permet de comparer le HTML brut et le code rendu après exécution du JavaScript. Si un texte, un titre ou un lien n’apparaît que dans le second, le risque existe. Google peut le mal interpréter, ou le découvrir en retard. Le rendu côté serveur (SSR) ou la génération statique restent les options les plus sûres pour les pages qui doivent absolument être indexées vite.
6. Performance : Core Web Vitals, les seuils qui comptent en 2026
Google évalue trois métriques réelles, mesurées sur de vrais visiteurs Chrome, au 75ᵉ percentile (75 % des visites) sur une fenêtre glissante de 28 jours.
| Métrique | Ce qu’elle mesure | Bon seuil |
| LCP | Vitesse de chargement du plus gros élément visible | Sous 2,5 secondes |
| INP | Réactivité aux interactions (clic, tap, saisie) | Sous 200 millisecondes |
| CLS | Stabilité visuelle pendant le chargement | Sous 0,1 |
L’INP a remplacé le FID en mars 2024. C’est la métrique la plus difficile à tenir. Elle capture la pire interaction de toute la visite. Notre article sur les Core Web Vitals 2026 détaille comment les corriger poste par poste. Sur un site e-commerce, l’impact business est direct. Un temps de chargement qui dépasse deux secondes fait grimper le taux de rebond de 32 %, comme l’explique notre article sur la refonte SEO e-commerce.
7. Mobile-first : l’index qui compte vraiment
Google indexe la version mobile d’un site en priorité depuis plusieurs années déjà. L’écart persiste pourtant sur beaucoup de sites :
- Un texte présent en desktop mais absent en mobile
- Des données structurées ajoutées sur une seule des deux versions
- Un menu qui masque du contenu au lieu de le replier proprement
Un audit vérifie que le contenu, les balises meta, les liens internes et les données structurées sont strictement identiques entre les deux versions.
8. HTTPS et sécurité technique
HTTPS doit couvrir toutes les URL indexables, sans contenu mixte qui déclenche un avertissement navigateur. Vérifier aussi les scripts tiers installés au fil des années. Un plugin abandonné ou une balise de tracking mal maintenue élargit la surface d’attaque, sans que personne ne s’en rende compte. Un site piraté qui héberge des pages de spam injectées perd sa réputation aux yeux de Google bien avant que quiconque ne remarque le piratage.
9. Contenu dupliqué et URLs à paramètres
Un filtre de couleur, un tri par prix, un identifiant de session : chacun peut générer une nouvelle URL techniquement différente pour un contenu identique. Multiplié par un catalogue de plusieurs milliers de références, cela crée des dizaines de milliers de doublons. La solution combine généralement plusieurs leviers :
- Une balise canonical claire vers la version de référence
- Un noindex sur les combinaisons de filtres à faible valeur
- Un blocage robots.txt sur celles qui n’apportent rien, ni aux visiteurs ni aux moteurs
10. Erreurs 404 et chaînes de redirection
Un lien cassé ou une redirection qui rebondit trois fois avant d’arriver à destination gaspille une requête de crawl à chaque passage. Un audit liste les 404 encore liées depuis le site ou depuis des backlinks externes. Il aplatit ensuite les chaînes de redirection. Une 301 doit mener directement à la page finale, jamais à une autre redirection.
11. Données structurées : utile, mais pas la baguette magique promise
Le balisage JSON-LD (Organization, Article, Product, FAQPage, BreadcrumbList) aide Google à comprendre sans ambiguïté ce qu’une page représente. Il reste la voie d’accès aux rich results classiques. Ce qui mérite d’être tempéré, c’est la promesse selon laquelle ajouter du schéma ferait mécaniquement grimper les citations dans les réponses IA. Une étude a suivi près de 1 900 pages ayant ajouté du JSON-LD, comparées à 4 000 pages témoins. Elle n’a mesuré aucune hausse significative des citations sur Google AI Overviews, AI Mode ou ChatGPT. Le schéma reste une bonne pratique d’hygiène technique. Ce n’est pas un raccourci vers la visibilité IA.
12. Hreflang : la source silencieuse de baisses de trafic à l’international
Sur un site multilingue ou multi-pays, une balise hreflang mal renseignée peut envoyer un visiteur allemand sur la version espagnole d’une page. Rien, dans les rapports classiques, ne signale le problème. Les erreurs les plus fréquentes :
- Une balise de retour manquante : la page A pointe vers B, mais B ne pointe pas vers A
- Un code de langue ou de région incorrect
- Un conflit avec la balise canonical
Le rapport de ciblage international de Search Console reste l’endroit le plus fiable pour les repérer.
13. Agent-readiness : qui a le droit de lire votre site ?
Les moteurs de recherche ne sont plus les seuls visiteurs non humains à prendre au sérieux. Un agent IA qui compare des offres, résume un site ou passe une commande pour le compte d’un internaute devient un visiteur ordinaire. Google I/O 2026 l’a officialisé sans détour. La première question technique à trancher : qui a le droit d’accéder au site ?
Deux familles de bots méritent des règles séparées dans robots.txt :
- Les bots de recherche et de récupération (OAI-SearchBot pour ChatGPT, Claude-SearchBot pour Claude, PerplexityBot, Google-Extended pour les AI Overviews) déterminent si le site peut apparaître dans une réponse IA.
- Les bots d’entraînement (GPTBot, ClaudeBot) alimentent les modèles de fondation. Une décision distincte, à prendre consciemment plutôt que par défaut d’une vieille règle générique. Vérifier aussi que le pare-feu ou le CDN ne bloque pas silencieusement ces bots, alors même que robots.txt les autorise sur le papier. C’est l’écart le plus souvent découvert trop tard.
Sur le fichier llms.txt, la prudence est de mise. Nos données montrent qu’il ne produit aucun effet mesurable sur le classement ou l’indexation classique, même si certains moteurs semblent malgré tout le consulter.
14. Agent-readiness : rendre le contenu citable, pas juste lisible
Être accessible à un agent IA ne suffit pas à être cité par lui. Un modèle qui évalue des dizaines de sources pour répondre à une question privilégie celles où l’auteur, la date et la source d’une affirmation sont explicites. Ce sont les mêmes signaux qui nourrissent l’E-E-A-T côté Google. Un contenu construit autour d’une donnée ou d’un chiffre qu’on ne trouve nulle part ailleurs a statistiquement plus de chances d’être repris tel quel.
Une structure propre en Markdown ou en HTML sémantique facilite la lecture par un modèle. Un modèle traite le contenu par blocs plutôt que visuellement, donc les blocs de mise en page qui cassent la logique du texte lui compliquent la tâche. Pour distinguer ce qui relève du SEO classique, du GEO ou de l’AEO, notre cartographie des acronymes 2026 évite la confusion entre ces trois approches. Côté suivi, Bing Performance AI reste l’un des rares outils gratuits pour mesurer concrètement la visibilité d’un site dans les réponses génératives.
Un audit qui coche ces 14 volets ne garantit pas la première place sur Google, mais il élimine à coups sûrs les blocages invisibles qui empêchent un bon contenu d’être vu, humains et IA confondus. Les six premiers volets se corrigent souvent en quelques semaines. Les deux derniers demandent une vigilance plus récente, mais ils ne resteront pas optionnels longtemps.
Nos dernières success stories SEO
Blast.club, dirigé par Anthony Bourbon, est une plateforme permettant d'investir dans des startups via des adhésions offrant des opportunités exclusives.
En 2018, Cybertek a racheté Grosbill, une autre marque reconnue dans le domaine de l'informatique, qui avait rencontré des difficultés financières. Ce rachat a permis de relancer Grosbill, tout en conservant son magasin phare à Paris et en maintenant son site web opérationnel
Horiz.io est un SaaS spécialisé dans l’investissement locatif, permettant aux utilisateurs de calculer rapidement le rendement des biens immobiliers directement à partir des annonces en ligne. Avec plus de 300 000 utilisateurs, il propose des outils pour analyser la rentabilité locative, simuler des investissements, et gérer des biens locatifs.
Nomadia est un SaaS de mobilité pour les professionnels itinérants, offrant des outils d’optimisation de tournées et de gestion des forces de vente. Créée en 2021, elle vise à réduire les émissions de CO2 jusqu’à 30 % et à améliorer la productivité des entreprises dans plus de 90 pays
Chaque semaine, recevez les meilleurs articles growth résumés et découvrez un outil unique pour booster votre business. Profitez aussi d’outils gratuits et de webinars exclusifs.