Claude Code note désormais vos plugins : « claude plugin eval » arrive avec un bras témoin sans plugin

Claude Code note désormais vos plugins : « claude plugin eval » arrive avec un bras témoin sans plugin

Anthropic a livré le 11 septembre, dans la version 2.1.269 de Claude Code, une commande « claude plugin eval » qui note les plugins et les skills sur des cas de test reproductibles, avec rapport HTML et JSON. La ligne du changelog est laconique, mais la mécanique est complète : génération d'une première suite de tests avec « claude plugin eval init », six types de correcteurs (graders), et surtout une exécution en double de chaque cas, avec puis sans le plugin, pour mesurer sa contribution réelle.

TL;DRL'essentiel pour les pressés
  • « claude plugin eval » exécute chaque cas de test deux fois, avec et sans le plugin : le delta entre les deux passes mesure ce que le plugin apporte vraiment, et un cas réussi dans les deux bras signale un plugin inutile sur ce cas.
  • Quatre correcteurs sont gratuits car calculés sur la transcription (regex, tool_used, tool_order, file_exists), deux facturent un modèle juge (llm, baseline) : on peut donc écrire une suite entière sans coût d'inférence supplémentaire.
  • Le seuil de score (--threshold), le plafond de dépense (--max-cost-usd) et la sortie JSON transforment la commande en barrière de CI pour bloquer les régressions de prompts.
9,59 $coût total constaté pour une suite de 7 cas exécutés 6 fois chacun, appels au modèle juge inclus (retour d'expérience Big Hat Group, 13 septembre 2026)

Le bras témoin sans plugin, la vraie bonne idée

Le problème que résout cette commande est connu de quiconque maintient des skills : un prompt system modifié, une consigne ajoutée, et un comportement qui marchait se met à dériver, sans qu'aucun test ne le détecte. Jusqu'ici, évaluer un plugin Claude Code se faisait à la main, en relançant des sessions et en jugeant à l'oeil. La nouveauté structurante n'est pas la notation elle-même mais le bras témoin : chaque cas tourne aussi sans le plugin chargé. Si le modèle réussit le cas tout seul, le plugin n'a rien prouvé. Cette logique de baseline, standard en expérimentation, manquait à tout l'écosystème des skills, où l'on attribue volontiers au prompt ce qui relève du modèle.

Côté coûts, la séparation est nette : les quatre correcteurs mécaniques (motif regex dans la réponse, outil déclenché, ordre d'exécution des outils, fichier créé) se calculent sur la transcription et ne coûtent rien de plus que l'exécution des cas. Les correcteurs « llm » (notation sur critères) et « baseline » (comparaison à une réponse de référence) appellent un modèle juge configurable, par exemple un modèle léger via --judge-model pour contenir la facture. Le rapport HTML est horodaté dans evals/results/ et publié par défaut sur claude.ai, ce qui se désactive avec --no-publish. Limite à connaître, signalée dans la documentation : les hooks et serveurs MCP du plugin évalué s'exécutent avec vos droits, donc on n'évalue que des plugins de confiance, --trust-plugin n'est pas un mot magique. Mon avis : notable pour toute équipe qui a industrialisé ses prompts, et cohérent avec la course aux harnais d'agents où OpenAI vient d'ouvrir son Agents API. Pour une agence ou un consultant français qui vit sur ses skills métier, c'est le chaînon manquant entre bricolage et produit.

Ce que ça change si vos skills sont votre outillage

Si vous maintenez des skills de production (génération de contenus, audits, veille), vous pouvez maintenant détecter qu'une mise à jour de modèle ou une réécriture de consigne dégrade un comportement, avant de vous en apercevoir en production. Le scénario type : une suite de dix cas sur votre skill le plus critique, correcteurs gratuits d'abord, branchée dans la CI du dépôt qui héberge vos plugins, avec un seuil à 0,8. Si vous utilisez Claude Code occasionnellement, sans plugin maison, rien à faire : la commande ne concerne que les auteurs de plugins et de skills, pas l'usage quotidien.

Ce que vous devez faireConcrètement, pour votre visibilité
  • Mets à jour Claude Code vers la 2.1.269 ou plus (claude update), puis lance « claude plugin eval init » sur ton plugin le plus utilisé pour générer une première suite de cas.
  • Commence avec les correcteurs gratuits (regex, tool_used, tool_order, file_exists) et n'active llm qu'avec --max-cost-usd pour plafonner la dépense de jugement.
  • Ajoute « claude plugin eval . --json results.json --threshold 0.8 » dans la CI du dépôt de tes plugins et fais échouer le build sous le seuil.

Sources

Source : Code.claude.com

Cet article a été rédigé avec l’assistance d’un modèle de langage (LLM).

Besoin d'un accompagnement personnalisé?

Je propose des accompagnements au forfait et en régie pour vous aider à améliorer votre visibilité en ligne.