视觉模型训练

原名:huggingface-vision-trainer

用 Hugging Face 工具链准备和训练图像分类等视觉模型。

中文 Skills 技能说明

适合有合法数据集的计算机视觉项目;先核验图片版权、肖像授权、标签质量、硬件和评测,再执行训练。开源工具可以本地使用;访问 Hugging Face Hub、Spaces、ZeroGPU、AWS 或托管服务时,用户需自行确认中国大陆网络、账户、区域、费用、模型与数据许可证及跨境要求。执行前应读取项目现状和官方文档,输出目标、依据、影响、验证结果与回退方式;没有真实证据时明确说明未知,不编造配置、数据或成功状态。 创建、修改、训练、部署、发布、迁移、删除或产生费用的操作,必须先展示具体目标和差异并获得人工确认。 代码、日志、令牌、连接串、模型、数据集和企业资料按敏感内容处理,只读取任务所需范围,上传或外发前完成授权、脱敏和最小化。

上游能力依据

上游原始适用说明:Trains and fine-tunes vision models for object detection (D-FINE, RT-DETR v2, DETR, YOLOS), image classification (timm models — MobileNetV3, MobileViT, ResNet, ViT/DINOv3 — plus any Transformers classifier), and SAM/SAM2 segmentation using Hugging Face Transformers on Hugging Face Jobs cloud GPUs. Covers COCO-format dataset preparation, Albumentations augmentation, mAP/mAR evaluation, accuracy metrics, SAM segmentation with bbox/point prompts, DiceCE loss, hardware selection, cost estimation, Trackio monitoring, and Hub persistence. Use when users mention training object detection, image classification, SAM, SAM2, segmentation, image matting, DETR, D-FINE, RT-DETR, ViT, timm, MobileNet, ResNet, bounding box models, or fine-tuning vision models on Hugging Face Jobs.

上游 SKILL.md 主要章节(保留原文标题):

使用边界

先读取项目约定、依赖版本和现有测试,再提出最小改动。写文件、运行脚本、提交代码或发布前应检查差异并保留回退路径。

作者、翻译与许可证

原作者
Hugging Face 与 huggingface/skills contributors
中文翻译
CEOFans翻译
许可证
Apache-2.0
上游来源
https://github.com/huggingface/skills/tree/cead19e10754e773bad24fecef83cb64be24094e/skills/huggingface-vision-trainer

适用范围

平台:linux、macos、windows;标签:AI 工程、视觉模型训练

安全提示

基础静态扫描不等于绝对安全。技能可能调用命令、浏览器、云服务或本地文件,请在最小权限环境中使用,高风险操作必须人工确认。

如发现侵权、许可证或安全问题,可在本页前台提交投诉,管理员复核后可立即下架。