vLLM 推理服务

原名:serving-llms-vllm

使用 vLLM 部署高吞吐的大模型推理服务,并处理量化和多卡配置。

中文 Skills 技能说明

须补齐鉴权、限流、日志脱敏和网络边界。

作者、翻译与许可证

原作者
Orchestra Research
中文翻译
CEOFans翻译
许可证
MIT
上游来源
https://hermes-agent.nousresearch.com/docs/zh-Hans/user-guide/skills/bundled/mlops/mlops-inference-serving-llms-vllm

适用范围

平台:linux、macos;标签:vLLM、Inference Serving、PagedAttention、Continuous Batching、High Throughput、Production、OpenAI API、Quantization、Tensor Parallelism

安全提示

基础静态扫描不等于绝对安全。技能可能调用命令、浏览器、云服务或本地文件,请在最小权限环境中使用,高风险操作必须人工确认。

如发现侵权、许可证或安全问题,可在本页前台提交投诉,管理员复核后可立即下架。