
Exécute les évaluations AgentV et optimise les agents via une itération basée sur les évaluations.
Un skill complet pour évaluer les agents d'IA et les améliorer itérativement grâce à une optimisation basée sur les données. Il propose une boucle structurée : comprendre le comportement de l'agent, rédiger des cas de test d'évaluation (EVAL.yaml/evals.json), exécuter et noter les sorties, analyser les résultats pour identifier des modèles et appliquer des améliorations.
Fonctionnalités clés :
Cette compétence n'a pas encore été examinée par notre pipeline d'audit automatisé.