在把大模型真正落到业务场景时,"用 API 还是自己微调"几乎是一个绕不开的决策点。Prompt Engineering 和 RAG 能解决知识注入问题,但解决不了"风格对齐、格式约束、指令遵循、领域术语一致性"这类需要改变模型行为的需求。本文从工程视角梳理一条可落地的 LoRA 微调路径:原理、参数选择、数据构造、训练流程与显存优化、效果评估,以及我在生产环境中踩过的坑。
一、为什么是 LoRA:全参微调的成本账
全参微调(Full Fine-Tuning)意味着对模型的每一个权重都计算梯度并更新优化器状态。以 7B 模型为例,FP32 下权重约 28GB,Adam 优化器需要额外保存一阶矩和二阶矩,再乘以 2,加上梯度本身,训练态峰值显存轻松突破 120GB。这决定了全参微调基本只能在多卡集群上做,中小团队很难承受。
2026/9/12大约 13 分钟