GKE AI 推理部署
原名:gke-inference
在 GKE 上规划和运行模型推理工作负载,包括加速器、网关与伸缩。
中文 Skills 技能说明
适合自管模型服务或需要 Kubernetes 调度能力的推理场景。先核对模型许可证、镜像、显存、区域供给和成本,再生成部署方案;创建集群资源、拉取模型、开放端点和扩缩 GPU 都需人工确认,默认不把推理服务直接暴露到公网。
上游能力依据
上游原始适用说明:Deploys and optimizes AI/ML inference workloads on GKE, using GPUs, TPUs, and model servers. Use when deploying GKE inference servers, configuring GKE GPU resources for inference, or deploying LLMs on GKE. Don't use for generic batch jobs or HPC task queues (use gke-batch-hpc instead).
上游 SKILL.md 主要章节(保留原文标题):
- When to Use
- Prerequisites
- Workflow
- 1. Discovery: Find Models and Hardware
- 2. Generate Manifest
- 3. Review and Deploy
- GPU ComputeClass for Inference
- Accelerator Selection Guide
- Autoscaling LLM Inference
- GPU-based autoscaling
使用边界
先读取项目约定、依赖版本和现有测试,再提出最小改动。写文件、运行脚本、提交代码或发布前应检查差异并保留回退路径。
作者、翻译与许可证
- 原作者
- 中文翻译
- CEOFans翻译
- 许可证
- Apache-2.0
- 上游来源
- https://github.com/google/skills/tree/8db47666a1307cb838f056ac03193f85c42e2c69/skills/cloud/gke-inference
适用范围
平台:linux、macos、windows;标签:Google Cloud、Gke、Inference
安全提示
基础静态扫描不等于绝对安全。技能可能调用命令、浏览器、云服务或本地文件,请在最小权限环境中使用,高风险操作必须人工确认。
如发现侵权、许可证或安全问题,可在本页前台提交投诉,管理员复核后可立即下架。