Packages SKILL.md qui étendent Claude Code, Cursor, Copilot et autres agents IA.
Étiquettes

ako4all
Boucle automatisée qui profile, itère, analyse les performances et commit des optimisations de kernels GPU sur CUDA/Triton/TileLang/Python/C++ pour obtenir des gains de vitesse mesurables.

claude-skill-registry
Guide et patterns pour le parallélisme Python et les performances GPU/CPU : threading vs multiprocessing vs asyncio, flux CUDA, PyTorch DDP et benchmarking.

megatron-bridge
Guide l'activation et la validation du chevauchement de communication expert-parallel MoE dans Megatron-Bridge pour masquer la latence de dispatch/combine et améliorer le débit.

graphsignal-profiler
Configurez et gérez le profilage, le traçage et la surveillance des GPU pour les charges de travail d'inférence IA utilisant vLLM, SGLang et PyTorch.

pjt222
Identifiez systématiquement si un noyau GPU est limité par le calcul (compute-bound), la mémoire (memory-bound) ou la latence (latency-bound).

asb-skill-collections
Chargez des checkpoints de modèles PyTorch pré-entraînés pour classer des molécules candidates ou analyser des spectres en métabolomique sans réentraînement.