
de aeon-bench-pod21
Exécutez des benchmarks LLM de bout en bout via AEON Bench Pod. De la vérification du modèle à la soumission au classement.
Cette compétence fournit le schéma opérationnel pour exécuter des évaluations LLM vérifiées à l'aide d'AEON Bench Pod. Elle permet à un agent de déployer un appareil de benchmarking local, de vérifier les poids du modèle par rapport à Hugging Face, d'exécuter une suite complète (texte, agentique, vision, audio, vidéo et performance), et de soumettre des résultats attestés au classement public.
Utilisez cette compétence lorsqu'on vous demande de benchmarker, de noter ou d'évaluer les performances d'un LLM. C'est le chemin principal pour générer des résultats « attestés » qui se classent sur le leaderboard AEON, dépassant les simples tests de fumée pour passer à une évaluation vérifiée à pleine échelle.
aeon_pod_mcp.py pour le contrôle d'agent sans tête.Tout agent IA capable d'exécuter des commandes shell (Docker) et d'utiliser des outils MCP.
Cette compétence n'a pas encore été examinée par notre pipeline d'audit automatisé.