Loading...
Loading...
共找到 27 个 Skills
Agentica Server + Claude Proxy 搭建指南 - 架构、启动流程、调试方法
借助vLLM的PagedAttention和连续批处理技术,以高吞吐量为大语言模型(LLMs)提供服务。适用于部署生产级LLM API、优化推理延迟/吞吐量,或是在GPU内存有限的情况下部署模型。支持兼容OpenAI的端点、量化(GPTQ/AWQ/FP8)以及张量并行。
适用于华为Ascend NPU的vLLM Ascend插件,用于大语言模型(LLM)推理服务。支持离线批量推理、API服务器部署、量化推理(搭配msmodelslim量化模型)、分布式服务的张量/流水线并行,以及兼容OpenAI的API端点。通过Ascend优化内核,支持Qwen、DeepSeek、GLM、LLaMA等模型。
在surf.cascade.fyi使用按调用付费的Surf API进行开发。支持Twitter数据、Reddit数据、网页搜索/爬取以及LLM推理服务——无需注册,无需API密钥,仅按调用次数付费。适用于使用Surf端点、获取Twitter/X数据、Reddit数据、网页爬取/搜索、按请求付费的LLM推理、配置x402-proxy或结合Surf使用@x402/fetch,以及任何涉及surf.cascade.fyi的场景。触发关键词包括surf、surf.cascade.fyi、surf API、twitter data、reddit data、web crawl、surf inference、x402 endpoints、MCP surf tools。
Ollama命令行界面——通过Ollama REST API实现本地LLM推理与模型管理。专为无需GUI即可管理模型、生成文本、聊天和创建嵌入的AI agents及高级用户设计。
面向Apple Silicon平台MLX的无损DFlash推测解码——通过块扩散草稿生成+目标模型验证实现1.7-4倍更快的LLM推理
连接本地LLM端点(Ollama、llama.cpp、vLLM)并支持自动提供商降级切换。适用于以下场景:(1) 出于隐私/成本考虑需要在本地运行LLM推理,(2) 想要使用云API未提供的模型,(3) 需要离线运行能力,(4) 希望在本地服务失败时自动切换到云提供商。
使用该Skill来建立并操作模型的内部工作区——J-space——适用于所有需要超越流畅输出的任务:多步骤或链式推理、规划、长期任务与Agentic工作、竞赛级问题、复杂调试、确保交付成果各部分全局一致、在冗长机械任务中保持目标或约束、审核模型已知但未表述的内容、校准置信度与错误检测、处理可疑或操纵性输入、恢复退化的推理,以及用户要求模型更深入、更快、更努力思考的任何场景。从这里开始;本文件确立前提、分类任务,并将任务路由至所需模块。
Microsoft GraphRAG 全能使用指南——基于模块化图结构的RAG系统,用于私有数据集的推理任务
借助NVIDIA TensorRT优化LLM推理,实现最大吞吐量与最低延迟。适用于在NVIDIA GPU(A100/H100)上进行生产部署,当你需要比PyTorch快10-100倍的推理速度,或是用于部署支持量化(FP8/INT4)、in-flight batching和多GPU扩展的模型时。
借助KEDA、自定义GPU指标和水平Pod自动扩缩容,在Kubernetes上实现LLM推理集群的自动扩缩。应对流量峰值,实现基于队列的扩缩,并通过抢占式实例优化AI工作负载的成本。
部署并管理vLLM以实现高吞吐量LLM推理。配置连续批处理、张量并行、量化以及兼容OpenAI的API端点,用于生产环境中的LLM服务。