guides · 5 min read
Référencement d'un site d'affiliation: contrôler pages et robots.txt
Le référencement d'un site d'affiliation se joue souvent sur la qualité des pages que Google explore et indexe. Un robots.txt mal réglé peut gaspiller le crawl budget et laisser remonter des pages sans valeur. Voici une méthode opérationnelle pour contrôler les pages et le fichier robots.txt, sans casser l’accès aux contenus qui convertissent.
Sur un site d’affiliation, 10 pages “utiles” peuvent être noyées par 1 000 URL techniques. Le référencement d'un site d'affiliation: contrôler les pages et le fichier robots.txt devient alors une priorité: si Google crawl trop de filtres, paramètres, tags ou pages de recherche interne, vos pages money reçoivent moins d’attention et l’index se remplit de contenu faible. Objectif: décider précisément ce que Google peut explorer, ce qu’il peut indexer, et ce que vous devez corriger côté architecture.
Cartographier ce que Google explore (avant de bloquer)
Le robots.txt n’est pas un bouton “désindexer”. Il pilote surtout l’exploration (crawl) et peut empêcher Google de récupérer une page pour en comprendre le contenu. Google rappelle aussi que le robots.txt est public et que certains robots peuvent l’ignorer: ne l’utilisez pas pour masquer des données sensibles. Avant d’écrire des règles, partez d’une cartographie réelle: exports d’URL depuis votre CMS, logs serveur si vous les avez, et inventaire des modèles d’URL (produits, catégories, comparatifs, paramètres de tri, pagination, recherche interne, pages tag).
Ensuite, classez chaque famille d’URL en trois bacs: (1) à indexer, (2) à crawler mais souvent non indexer, (3) à ne pas crawler. Sur un site d’affiliation en 2026, le bac (3) contient fréquemment les résultats de recherche interne, les pages de filtres illimités, et les paramètres d’UTM/aff_id quand ils génèrent des URL uniques.
- Listez 20 à 50 patterns d’URL (ex:
/?s=,/search/,?sort=,?filter=,?utm_,/tag/), puis estimez leur volume. - Bloquez dans robots.txt les patterns qui créent un nombre quasi infini d’URL sans valeur (filtres combinatoires, recherche interne).
- Évitez de bloquer des répertoires qui contiennent aussi des pages business (ex: ne bloquez pas
/blog/par réflexe). - Gardez un Sitemap propre: uniquement les URL à indexer, et mettez-le dans robots.txt via
Sitemap: https://votresite.tld/sitemap.xml. - Testez chaque règle avec un environnement de préprod ou un fichier robots.txt temporaire, puis surveillez les effets via l’évolution des pages explorées/indexées.
Décider entre robots.txt, noindex et refonte d’URL
Choisir le bon levier dépend du problème. Si vous devez réduire l’exploration de milliers d’URL “bruit”, le robots.txt est pertinent. Si l’URL doit rester accessible aux internautes mais ne pas être indexée (ex: pages de tag faibles), privilégiez noindex (dans la balise meta robots), car bloquer via robots.txt peut empêcher Google de voir la directive noindex.
Exemple hypothétique: un site d’affiliation FR qui compare des VPN et génère des pages /comparatif?provider=A&provider=B&sort=price. Les combinaisons explosent. Ici, mieux vaut: (a) bloquer les paramètres combinatoires (Disallow: /*?provider=), (b) créer 10 pages fixes “comparatif” éditorialisées (A vs B), et (c) garder la pagination crawlable si elle mène à des pages réellement distinctes.
Gardez une règle simple: si une famille d’URL doit exister, rendez-la “finie” (nombre limité) et éditorialement justifiée. Sinon, coupez le robinet.
Source de référence : Google Search Central — présentation du fichier robots.txt.
Pour aller plus loin, consultez aussi les guides d’affiliation ABC en français.
Conclusion et plan d’action
- Ouvrez votre robots.txt et vérifiez la présence d’un Sitemap et l’absence de blocage accidentel de
/. - Dressez une table « pattern d’URL → valeur SEO → action (index/noindex/disallow) ».
- Bloquez en priorité la recherche interne et les filtres illimités.
- Nettoyez vos sitemaps: retirez tags, pages de recherche, et URL paramétrées.
- Planifiez une refonte des modèles d’URL qui génèrent des combinaisons infinies.
Questions fréquentes
Comment écrire un robots.txt pour un site d’affiliation WordPress sans bloquer les pages d’argent ?
Commencez par ne bloquer que des patterns sûrs: recherche interne (/ ?s=), paramètres UTM (?utm_), et filtres combinatoires si votre thème en crée. Ajoutez le lien vers votre sitemap. Évitez Disallow: /wp-content/ si vos images s’y trouvent: Google doit voir les ressources nécessaires.
Le fichier robots.txt peut-il désindexer des pages d’affiliation déjà visibles sur Google ?
Non, pas de façon fiable. Le robots.txt gère surtout le crawl. Une URL déjà indexée peut rester dans l’index, parfois sans contenu (“URL connue”). Pour sortir une page de l’index, utilisez une directive noindex accessible au crawl, ou supprimez/redirectez la page selon votre stratégie.
Quelles pages faut-il bloquer en priorité pour améliorer le référencement d’un site d’affiliation ?
Priorité aux pages qui se multiplient sans apporter d’intention claire: résultats de recherche interne, filtres/tri infinis, paramètres d’ID de session, UTM/aff_id qui créent des duplicatas, tags automatiques faibles. L’objectif est de réduire les URL “bruit” pour concentrer le crawl sur comparatifs, guides et pages transactionnelles.
Vous voulez une check-list robots.txt + un plan d’architecture SEO spécial affiliation (comparatifs, silos, sitemaps) ? Rejoignez l’Affiliate Business Club: on y décortique des sites réels, on partage des templates, et on corrige vos règles avant mise en prod.
Frequently asked questions
Comment écrire un robots.txt pour un site d’affiliation WordPress sans bloquer les pages d’argent ?
Commencez par ne bloquer que des patterns sûrs: recherche interne (`/?s=`), paramètres UTM (`?utm_`), et filtres combinatoires si votre thème en crée. Ajoutez le lien vers votre sitemap. Évitez `Disallow: /wp-content/` si vos images s’y trouvent: Google doit voir les ressources nécessaires.
Le fichier robots.txt peut-il désindexer des pages d’affiliation déjà visibles sur Google ?
Non, pas de façon fiable. Le robots.txt gère surtout le crawl. Une URL déjà indexée peut rester dans l’index, parfois sans contenu (“URL connue”). Pour sortir une page de l’index, utilisez une directive **noindex** accessible au crawl, ou supprimez/redirectez la page selon votre stratégie.
Quelles pages faut-il bloquer en priorité pour améliorer le référencement d’un site d’affiliation ?
Priorité aux pages qui se multiplient sans apporter d’intention claire: résultats de recherche interne, filtres/tri infinis, paramètres d’ID de session, UTM/aff_id qui créent des duplicatas, tags automatiques faibles. L’objectif est de réduire les URL “bruit” pour concentrer le crawl sur comparatifs, guides et pages transactionnelles.