Selon blog.cloudflare.com, afin de maintenir un web ouvert et dynamique, il est impératif d'offrir aux créateurs de contenu davantage d'outils pour exprimer la manière dont ils souhaitent que leurs données soient utilisées, tout en permettant un accès ouvert. Le compromis actuel est trop limité : soit les opérateurs de sites web gardent leur contenu accessible au public et risquent son utilisation à des fins indésirables, soit ils le placent derrière des identifiants, limitant ainsi leur audience. Pour pallier ces préoccupations, Cloudflare lance sa nouvelle Content Signals Policy.
Les enjeux actuels pour les créateurs de contenu
De nos jours, de nombreuses entreprises "scrappy" (récupèrent massivement des données) exploitent le contenu du web. Cette pratique génère un coût réel pour les opérateurs de sites web, d'autant plus qu'ils ne reçoivent souvent aucune compensation en retour. Cloudflare identifie cela comme un problème de passager clandestin classique. La situation devrait s'aggraver, le trafic des bots étant anticipé pour dépasser celui des humains d'ici fin 2029, et l'activité des bots seule surpasser le trafic Internet actuel total d'ici 2031.
L'évolution des normes d'utilisation du contenu
Historiquement, la norme voulait que les données soient ingérées, mais qu'en retour, le créateur obtienne quelque chose : du trafic de référence monétisable ou, à minima, une attribution (comme les "linkbacks" des débuts des blogs). Cette attribution intrinsèque favorisait la découverte future. Ce modèle est intégré dans des licences permissives comme MIT et Creative Commons, qui exigent toutes une attribution à l'auteur original. Cependant, ce monde a changé : le contenu "scrappé" est désormais parfois utilisé pour concurrencer économiquement le créateur original, laissant un choix difficile : verrouiller l'accès au contenu ou accepter moins de références et une attribution minimale, au détriment de la libre circulation des idées.
Qu'est-ce que la Content Signals Policy de Cloudflare ?
La Content Signals Policy est une nouvelle addition au fichier robots.txt, permettant d'exprimer les préférences d'utilisation du contenu une fois qu'il a été accédé. Elle complète le rôle du robots.txt traditionnel.
Rappel sur le fichier robots.txt
Le robots.txt est un fichier texte simple qui implémente le Robots Exclusion Protocol. Il permet d'indiquer quels crawlers et bots peuvent accéder à quelles parties d'un site. Par exemple :
User-agent: *(tous les agents)Allow: /(accès à toutes les parties du site)Disallow: /archives/(interdit l'accès au dossier archives)
Le robots.txt contrôle l'accès, mais ne donne aucune indication sur ce que les bots peuvent faire avec le contenu après l'avoir accédé. C'est là qu'intervient la Content Signals Policy.
Comment fonctionne la Content Signals Policy ?
La Content Signals Policy s'intègre aux fichiers robots.txt sous forme de commentaires (précédés du symbole #). Elle définit trois signaux de contenu et leur pertinence pour les crawlers :
search: construction d'un index de recherche et fourniture de résultats de recherche (hyperliens, extraits courts). N'inclut pas les résumés de recherche générés par l'IA.ai-input: entrée de contenu dans un ou plusieurs modèles d'IA (ex: génération augmentée par récupération, "grounding", ou prise de contenu en temps réel pour des réponses de recherche génératives par IA).ai-train: entraînement ou affinement de modèles d'IA.
Interprétation des signaux
La politique définit comment interpréter ces signaux :
- Si
content-signal = yes: l'utilisation correspondante du contenu est autorisée. - Si
content-signal = no: l'utilisation correspondante du contenu est interdite. - Si un signal n'est pas inclus : l'opérateur du site ne donne ni n'interdit la permission via ce signal pour l'utilisation correspondante.
Il est également précisé que toute restriction exprimée via les signaux de contenu constitue une réserve expresse de droits en vertu de l'article 4 de la directive européenne 2019/790 sur le droit d'auteur et les droits voisins dans le marché unique numérique.
Exemple d'implémentation dans robots.txt
Un opérateur de site peut exprimer ses préférences via une syntaxe simple, délimitée par des virgules :
# As a condition of accessing this website, you agree to abide by the following content signals:
# (a) If a content-signal = yes, you may collect content for the corresponding use.
# (b) If a content-signal = no, you may not collect content for the corresponding use.
# (c) If the website operator does not include a content signal for a corresponding use, the website operator neither grants nor restricts permission via content signal with respect to the corresponding use.
# The content signals and their meanings are:
# search: building a search index and providing search results (e.g., returning hyperlinks and short excerpts from your website's contents). Search does not include providing AI-generated search summaries.
# ai-input: inputting content into one or more AI models (e.g., retrieval augmented generation, grounding, or other real-time taking of content for generative AI search answers).
# ai-train: training or fine-tuning AI models.
# ANY RESTRICTIONS EXPRESSED VIA CONTENT SIGNALS ARE EXPRESS RESERVATIONS OF RIGHTS UNDER ARTICLE 4 OF THE EUROPEAN UNION DIRECTIVE 2019/790 ON COPYRIGHT AND RELATED RIGHTS IN THE DIGITAL SINGLE MARKET.
content-signal: search=yes, ai-train=no
Dans cet exemple, l'opérateur autorise la recherche, interdit l'entraînement d'IA, et n'exprime aucune préférence pour ai-input.
Adoption et limites de la politique
Mise en œuvre par Cloudflare
Cloudflare facilite l'adoption :
- Pour les clients ayant activé la fonction robots.txt gérée (plus de 3,8 millions de domaines), Cloudflare mettra à jour leur fichier
robots.txtpour inclure la politique et les signauxai-train=noetsearch=yes. - Le signal
ai-inputne sera pas servi par défaut, laissant le choix aux utilisateurs. - Pour les zones gratuites sans
robots.txtexistant, Cloudflare servira les commentaires lisibles par l'homme définissant la politique, mais sans directives d'autorisation/interdiction ni signaux réels, laissant aux utilisateurs la liberté d'exprimer leurs préférences. - Des outils sont mis à disposition via ContentSignals.org et un bouton "Deploy to Cloudflare".
Limitations et recommandations
Il est crucial de se rappeler que les signaux de contenu expriment des préférences ; ce ne sont pas des contre-mesures techniques contre le "scraping". Certaines entreprises pourraient simplement les ignorer. Pour un contrôle plus robuste, Cloudflare recommande de combiner les signaux de contenu avec des règles WAF (Web Application Firewall) et la gestion des bots (Bot Management).
La politique est publiée sous une licence CC0, permettant à quiconque de l'implémenter et de l'utiliser librement, afin d'encourager son adoption généralisée.
Conclusion
Les signaux de contenu permettent aux créateurs d'exprimer la manière dont ils souhaitent que leur contenu soit utilisé après son accès, une fonctionnalité jugée "trop tardive" par Cloudflare. Bien que le travail ne soit pas terminé et que la reconnaissance de ces règles par l'ensemble de l'écosystème soit essentielle, Cloudflare s'engage à poursuivre ses efforts au sein des organismes de normalisation. L'objectif est de redonner le contrôle aux propriétaires de contenu et de garantir un web ouvert et équitable pour tous.
Source : Blog.cloudflare.com
Cet article a été rédigé avec l’assistance d’un modèle de langage (LLM).