llama.cpp 本地推理
原名:llama-cpp
用 llama.cpp 和 GGUF 模型在 CPU、Apple Silicon 或常见 GPU 上运行本地大模型。
中文 Skills 技能说明
适合离线问答、边缘设备部署和量化模型验证。技能会帮助选择构建方式、模型文件和启动参数;下载权重前要核对模型许可与来源,敏感数据处理应优先保持在本地环境。
上游能力依据
上游原始适用说明:llama.cpp local GGUF inference + HF Hub model discovery.
上游 SKILL.md 主要章节(保留原文标题):
- When to use
- Model Discovery workflow
- Quick start
- Install llama.cpp
- Run directly from the Hugging Face Hub
- Run an exact GGUF file from the Hub
- OpenAI-compatible server check
- Python bindings (llama-cpp-python)
- Basic generation
- Chat + streaming
使用边界
先读取项目约定、依赖版本和现有测试,再提出最小改动。写文件、运行脚本、提交代码或发布前应检查差异并保留回退路径。
作者、翻译与许可证
- 原作者
- Orchestra Research
- 中文翻译
- CEOFans翻译
- 许可证
- MIT
- 上游来源
- https://hermes-agent.nousresearch.com/docs/zh-Hans/user-guide/skills/bundled/mlops/mlops-inference-llama-cpp
适用范围
平台:linux、macos、windows;标签:llama.cpp、GGUF、Quantization、Hugging Face Hub、CPU Inference、Apple Silicon、Edge Deployment、AMD GPUs、Intel GPUs、NVIDIA、URL-first
安全提示
基础静态扫描不等于绝对安全。技能可能调用命令、浏览器、云服务或本地文件,请在最小权限环境中使用,高风险操作必须人工确认。
如发现侵权、许可证或安全问题,可在本页前台提交投诉,管理员复核后可立即下架。