Loading...
Loading...
共找到 27 个 Skills
当处理需要逐步逻辑、多步算术、常识推理、符号操作或简单提示失效的复杂推理任务时使用,本指南提供Chain-of-Thought(CoT)及相关提示技术(Zero-shot CoT、Self-Consistency、Tree of Thoughts、Least-to-Most、ReAct、PAL、Reflexion)的全面介绍,包含模板、决策矩阵和有研究支持的实施模式
借助Hyperloom多智能体优化器,在AMD Instinct GPU上自主优化端到端LLM推理吞吐量,并报告经过验证的性能提升效果。给定模型、框架、工作负载(TP/EP、并发数、ISL/OSL、精度)、优化目标和时间预算,它会针对每个工作负载探索可调整的优化维度(服务/配置参数与环境、框架功能启用与源码补丁、热点GPU内核重写),为每个候选方案做基准测试,并返回实现性能提升的优化栈。适用于以下场景:用户希望提升模型服务速度、提高tokens/sec或吞吐量、在MI300X/MI325X/MI355X上优化或调优vLLM或SGLang、运行Hyperloom、运行kernel-agent、使用Quark先量化再优化、从零搭建Hyperloom,或恢复Hyperloom会话。不适用于以下场景:仅搭建普通服务服务器、诊断损坏的ROCm安装、或在无优化循环的情况下运行一次性内核/基准测试或追踪分析。
借助Magpie对LLM推理进行基准测试并推动GPU内核优化。适用于以下场景:用户需要对vLLM、SGLang或Atom进行基准测试;捕获torch轨迹;使用TraceLens对推理轨迹进行后处理,生成prefill/decode(预填充/解码)报告和roofline(roofline模型)报告;识别核心瓶颈内核或分析器名称与源代码的映射;分析或对比HIP、CUDA、PyTorch或Triton内核;验证并排序优化后的变体;运行本地、容器或Ray工作负载;或者提及Magpie、TraceLens、差距分析、TTFT、TPOT、内核评估或AMD GPU优化。