
de eval-layer12
Ajoutez une couche d'évaluation basée sur une rubrique aux projets d'agents pour mesurer la qualité via un scoring LLM-as-a-judge et des métriques pondérées.
Cette compétence permet à un agent d'implémenter un système d'évaluation rigoureux et basé sur une rubrique pour tout projet d'agent IA. Elle transforme les « impressions » qualitatives en métriques quantitatives en établissant un cadre de notation et un harnais programmatique pour l'exécuter.
Utilisez cette compétence lorsque vous avez besoin de :
main.yaml et de cas de test seed.yaml.Conçu principalement pour Claude Code, mais agnostique au framework et compatible avec tout agent capable d'écrire du Python et de gérer un espace de travail local (ex: Cursor, Codex).
Cette compétence n'a pas encore été examinée par notre pipeline d'audit automatisé.