
de ako4all262
Boucle automatisée qui profile, itère, analyse les performances et commit des optimisations de kernels GPU sur CUDA/Triton/TileLang/Python/C++ pour obtenir des gains de vitesse mesurables.
AKO4ALL exécute un workflow agentique optimiser→benchmark→log→commit pour les kernels GPU. À partir d'un kernel (CUDA, Triton, TileLang, C++, Python), il initialise un espace de travail, profile le code, effectue des micro-optimisations itératives, vérifie la correction et enregistre chaque itération. L'objectif est d'obtenir une amélioration mesurable du temps d'exécution par rapport à une référence fournie, tout en préservant la correction et la reproductibilité des commits.
Utilisez AKO4ALL lorsque vous avez un kernel GPU existant que vous souhaitez accélérer et mesurer : « optimiser ce kernel », « lancer AKO sur mon kernel CUDA », ou lorsque vous avez besoin d'itérations répétables avec profiling (ncu) et journalisation d'expériences via git. Ce n'est pas conçu pour écrire un kernel à partir de zéro ou pour des conseils de performance GPU génériques.
Idéalement utilisé par des agents disposant de capacités d'exécution de code et de shell (type Copilot/Codex ou agents CLI capables d'exécuter Python, le shell et des outils de profiling). La compétence suppose que l'environnement peut exécuter des benchmarks, invoquer ncu et effectuer des commits git.
AKO4ALL pilote une boucle agentique pour l'optimisation itérative de noyaux GPU (CUDA/Triton/TileLang). Le fichier SKILL.md est exceptionnellement détaillé avec des déclencheurs clairs, un flux de travail, une gestion des blocages et des garde-fous anti-triche. Aucun script joint n'était présent pour être testé. La compétence se concentre sur le profilage, la modification, le benchmarking et l'engagement d'améliorations de noyaux dans une boucle structurée et suivie par git.
Compétence bien conçue avec une documentation solide. Le fichier SKILL.md est approfondi avec des mesures anti-triche explicites et la détection de blocages. Aucune préoccupation de sécurité — toutes les opérations sont des flux de développement locaux. De niche mais précieux pour les flux d'optimisation GPU.