
Soup模型部署autopilot10种硬件目标自动选PEFT、量化与投机解码【免费下载链接】SoupFine-tune LLMs from one YAML. Layer streaming trains an 8B model on a 4 GB laptop GPU.项目地址: https://gitcode.com/GitHub_Trending/soup12/SoupSoup是一个一个 YAML 搞定 LLM 微调的开源训练工具而它的deploy autopilot部署自动驾驶是部署环节里的智能助手你只需说出目标硬件它就从内置的10 种硬件档案中自动挑选PEFT 微调方式 量化方案 投机解码的最优组合并直接生成可训练的配置文件和部署脚本。对于 Mac、消费级显卡、云端 H100 甚至 iPhone部署策略一步到位。为什么部署不该靠手摸同一个微调后的模型放到不同硬件上正确的打开方式完全不同内存紧张如 12GB 显卡必须上 4bit 量化还要靠 QLoRA 省训练开销内存宽裕如 H100 80GB直接 FP8 甚至不量化把全部算力用在推理速度上端侧设备iPhone / Pixel模型要压缩到 2048 token 上下文的 4bit 小体量新手最容易踩的坑就是一套配置打天下在 MacBook 上跑 8bit 直接爆显存在 A100 上开 4bit 又白白损失精度。Soup deploy autopilot 把这套硬件 → 最优组合的经验固化成了冻结的官方档案表杜绝拍脑袋配置。10 种硬件目标一张表看懂自动选型运行soup deploy autopilot --list会列出全部 10 个内置档案核心内容如下目标档案典型硬件推理运行时量化PEFT投机解码建议上下文mac-m3Apple M3 / M3 Pro / M3 MaxMLX4bitLoRA关8Kmac-m4-proApple M4 / M4 ProMLX4bitLoRA关16Krtx-3060-12gb消费级 12GB 显卡Transformers4bitQLoRA开4Krtx-4090-24gb消费级 24GB 显卡vLLMAWQLoRA开8Kiphone-16iPhone 16 / 16 ProExecuTorch4bitQLoRA关2Kpixel-9Pixel 9端侧ExecuTorch4bitQLoRA关2Kollama-local本地 Ollama / llama.cppOllama4bitLoRA关4Klm-studioLM Studio 桌面应用LM Studio4bitLoRA关4Krunpod-a100RunPod A100 40GBvLLM不量化LoRA开32Khf-jobs-h100HF Jobs H100 80GBvLLMFP8LoRA开64K一眼能看出策略差异低显存设备全部走 4bit24GB 级显卡用 AWQ 换取更高吞吐而 H100 直接用 FP8 64K 超长上下文——这正是同一模型、不同硬件、不同打法的自动体现。三步部署从训练配方到上线脚本整个过程就一条命令列出档案确认目标硬件soup deploy autopilot --list指定目标自动生成两份文件soup deploy autopilot --target rtx-4090-24gb --base meta-llama/Llama-3.2-1Bdeploy_autopilot.yaml—— 可直接开训的 Soup 配方LoRA r16 / alpha32、量化方式、max_length 等都已按档案填好deploy_autopilot.sh—— 部署脚本会打印计划好的soup serve命令对 4090 档案自动带上--auto-spec投机解码开关由你最终确认执行训练完成后跑一下部署脚本模型即按档案策略在目标硬件上服务。 想在选量化前量一量真实掉点幅度可加--measure --tasks jsonlSoup 会对候选量化方案跑一轮评测结果缓存在~/.soup/deploy_autopilot_cache.json优先选精度几乎无损OK的方案。小白必读PEFT、量化、投机解码是什么术语一句话解释在 Soup 里怎么体现PEFT参数高效微调只训练 LoRA 等少量适配器不动整个模型档案自动在lora / qlora / dora / full中选型量化把模型权重压成 4bit/8bit 等低位宽省内存允许名单4bit、8bit、GPTQ、AWQ、FP8、MXFP4、HQQ 等投机解码用草稿模型先猜、大模型再验加速推理4090 / A100 / H100 档案默认开启这套档案在源码里是导入即冻结的只读字典量化、PEFT、运行时都有严格白名单选错就是报错而不是自由发挥——这是给新手的安全垫。深入了解相关源码与文档部署档案表与生成逻辑src/soup_cli/utils/deploy_autopilot.py10 个内置档案 配方/脚本渲染命令行入口src/soup_cli/commands/deploy.pysoup deploy autopilot实现约 deploy.py#L570-L599部署与导出完整指南docs/serving-and-export.md量化与性能调优docs/performance-and-quantization.md零配置训练 autopilot与部署 autopilot 互补src/soup_cli/autopilot/小结Soup deploy autopilot 把模型部署到 10 种硬件从玄学变成了查表一句命令自动锁定 PEFT 量化 投机解码组合产出可训练配方和部署脚本。配合 Soup 的 layer streaming8B 模型在 4GB 笔记本显卡上也能训和零配置训练 autopilot从数据到上线的全链路都被自动驾驶接管了——新手照着档案表走不会配错。【免费下载链接】SoupFine-tune LLMs from one YAML. Layer streaming trains an 8B model on a 4 GB laptop GPU.项目地址: https://gitcode.com/GitHub_Trending/soup12/Soup创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考