vLLM 推理服务
原名:serving-llms-vllm
使用 vLLM 部署高吞吐的大模型推理服务,并处理量化和多卡配置。
中文 Skills 技能说明
适合在 Linux 或 GPU 服务器上搭建兼容 OpenAI 接口形式的自有推理服务。技能会整理模型、显存、并发和启动参数;正式开放前必须补齐鉴权、限流、日志脱敏和网络边界。
上游能力依据
上游原始适用说明:vLLM: high-throughput LLM serving, OpenAI API, quantization.
上游 SKILL.md 主要章节(保留原文标题):
- When to use
- Quick start
- Common workflows
- Workflow 1: Production API deployment
- Workflow 2: Offline batch inference
- Workflow 3: Quantized model serving
- When to use vs alternatives
- Common issues
- Advanced topics
- Hardware requirements
使用边界
先读取项目约定、依赖版本和现有测试,再提出最小改动。写文件、运行脚本、提交代码或发布前应检查差异并保留回退路径。
作者、翻译与许可证
- 原作者
- Orchestra Research
- 中文翻译
- CEOFans翻译
- 许可证
- MIT
- 上游来源
- https://hermes-agent.nousresearch.com/docs/zh-Hans/user-guide/skills/bundled/mlops/mlops-inference-serving-llms-vllm
适用范围
平台:linux、macos;标签:vLLM、Inference Serving、PagedAttention、Continuous Batching、High Throughput、Production、OpenAI API、Quantization、Tensor Parallelism
安全提示
基础静态扫描不等于绝对安全。技能可能调用命令、浏览器、云服务或本地文件,请在最小权限环境中使用,高风险操作必须人工确认。
如发现侵权、许可证或安全问题,可在本页前台提交投诉,管理员复核后可立即下架。