
de ai-infra-auto-driven-skills699
Analyse les traces du torch profiler pour les LLM afin d'identifier les goulots d'étranglement au niveau des couches, les flux de kernels et les écarts de timing dans les passes forward.
Cette compétence fournit une analyse haute résolution des pipelines d'exécution des LLM en traitant les fichiers JSON Chrome-trace du torch profiler. Elle transforme des données de trace brutes en tableaux de timing exploitables, permettant aux développeurs de localiser précisément les couches ou les kernels responsables de la dégradation des performances.
Activez cette compétence lorsqu'un résumé général du profiler est trop vague. Elle est particulièrement utile pour les modèles aux architectures complexes (comme DeepSeek-V4 NSA) où des types de couches alternés ou des kernels d'ancrage spécifiques sont nécessaires pour délimiter les frontières entre les blocs d'attention et FFN.
layer_timeline_analyzer.py pour la détection de fenêtres en état stable, layer_kernel_breakdown.py pour l'analyse approfondie du flux de calcul, et perfetto_time_mapper.py pour la navigation dans l'UI.Conçue pour les agents disposant de capacités d'exécution shell et d'un accès au système de fichiers pour les configurations de modèles et les fichiers de trace, tels que Codex, Claude Code ou d'autres environnements compatibles ACP.
Cette compétence n'a pas encore été examinée par notre pipeline d'audit automatisé.
Optimisation vLLM Qwen3 Coder
Guide manuel basé sur des PR pour l'audit, le débogage et l'extension du parseur d'outils Qwen3 Coder dans vLLM — se concentre sur les cas limites de schéma, les régressions du parseur et v
Optimisation vLLM Qwen3.6
Guide et étapes de validation basées sur des PR pour optimiser et documenter le support de Qwen3.6 dans vLLM ; à utiliser lors d'audits ou de l'implémentation de modifications spécifiques au modèle.