
de sage1,197
Créer, itérer et évaluer des compétences d'agent : rédiger le SKILL.md, concevoir des cas de test, exécuter des benchmarks et améliorer le déclenchement et la performance.
Skill Creator aide les auteurs et les équipes à concevoir, tester et affiner les compétences des agents. Il fournit un processus étape par étape pour capturer l'intention, rédiger les métadonnées et le corps du SKILL.md, créer des cas de test réalistes, lancer des sessions d'évaluation parallèles (avec et sans la compétence) et produire un benchmark révisable. La compétence inclut également des conseils sur les outils d'emballage, la génération de visionneuses et l'itération jusqu'à ce que la compétence se déclenche et fonctionne de manière fiable.
Utilisez Skill Creator lorsque vous avez besoin de : créer une nouvelle compétence d'agent à partir d'un concept ; améliorer les instructions ou la description du déclencheur d'une compétence existante ; créer des cas de test reproductibles et des benchmarks quantitatifs ; ou exécuter une boucle d'optimisation de la description pour améliorer la précision de l'invocation. C'est l'outil idéal pour les auteurs souhaitant un flux de travail de bout en bout (ébauche → test → révision → amélioration).
Conçu pour les environnements multi-agents/harnais de test et les flux de travail d'auteur supportant le déploiement de sous-agents et l'exécution d'évaluations parallèles. Fonctionne avec des environnements capables d'exécuter des visionneuses et des scripts Python (ex: systèmes type Claude Code / Cowork).
Une compétence skill-creator complète pour l'écriture, le test, l'évaluation et l'itération des Agent Skills. Inclut un framework d'évaluation avec benchmarking, comparaison à l'aveugle et boucle d'optimisation des descriptions. Les scripts sont bien écrits avec argparse, des docstrings et une gestion des erreurs, mais la plupart échouent lors de l'extraction vers un répertoire temporaire en raison d'imports croisés utilisant `from scripts.utils import ...` au lieu d'imports relatifs. Seul utils.py s'est exécuté correctement ; les points d'entrée CLI (aggregate_benchmark, generate_report) valident correctement les arguments mais nécessitent des données d'entrée.
Le problème de chemin d'import est un problème de packaging/portabilité, pas une faille de sécurité. La compétence provient du projet Anthropic Sage — haute qualité, bien documentée. La description est intentionnellement verbeuse/insistante selon leur philosophie de conception pour le déclenchement. Le framework d'évaluation (run_eval, run_loop, improve_description) est sophistiqué et bien architecturé.