跳到主要内容
AI教程

LLaMA Factory 零代码微调 100+ 大模型

LlamaFactory 是一个统一高效的大语言模型微调框架,由北京航空航天大学郑耀威博士团队发起,以 ACL 2024 论文为学术背书,凭借“零代码 CLI + Web UI”的极简设计理念,在 GitHub 斩获 7.2 万+ Stars,成为全球大模型微调领域的标杆项目。

LLaMA Factory 零代码微调 100+ 大模型

LLaMA Factory(现更名为 LlamaFactory)是一个面向大语言模型的统一微调框架。该项目由北京航空航天大学郑耀威博士团队发起,并以 ACL 2024 论文提供学术支撑。框架采用“零代码 CLI + Web UI”的设计,旨在简化微调流程。LlamaFactory 在 GitHub 上累计获得超过 72 000 个 Stars,已成为大模型微调领域的参考实现。

>

一、项目概述

  • 维度|详情

  • 项目全称|LlamaFactory(原名 LLaMA-Factory)

  • GitHub 地址|github.com/hiyouga/LlamaFactory

  • Stars|72,476 ⭐

  • Forks|8,861

  • 主要语言|Python(99.7%)

  • 许可证|Apache-2.0

  • 创建时间|2023-03-21

  • 最新版本|v0.9.5(2026-05-30)

  • 总提交数|3,042 commits

  • 核心贡献者|hiyouga(郑耀威,2,188 commits,占总提交 72%)

  • 学术论文|ACL 2024 System Demonstrations

  • 仓库大小|~412.9 MB

  • Open Issues|57

创始人郑耀威(hiyouga)是北京航空航天大学的博士生,曾以第一作者身份在 ACL、CVPR、WWW 等国际顶级会议发表多篇论文,并担任 AAAI、EMNLP 等会议的审稿人。其获奖经历包括华为杯、蓝桥杯全国一等奖、北航大学生年度人物以及昇腾生态开源卓越贡献奖。合作团队成员有北航教授张日崇、张俊豪、叶彦涵、罗哲炎、冯章驰、马永强等。

二、项目定位与核心价值

2.1 一句话定位

标准化的大模型微调流水线:适用于任意模型的统一流程,涵盖数据准备、模型训练、推理验证以及部署等全链路步骤。

2.2 解决的核心痛点

  • 痛点|LLaMA Factory 的解法

  • 不同模型微调流程各异,切换成本高|算法-模型-数据"解耦"设计,100+ 模型统一入口

  • 微调代码门槛高,需要深度学习专业背景|零代码 CLI + LLaMA Board Web UI(Gradio)

  • 显存不足,消费级 GPU 无法训练大模型|QLoRA 4-bit:7B 仅需 6GB,70B 仅需 48GB

  • 开源社区缺少一站式工具链|覆盖 PT→SFT→RM→PPO→DPO 全生命周期

  • 推理部署复杂|一键导出 + OpenAI 风格 API + vLLM/SGLang

2.3 设计哲学:算法-模型-数据"解耦"

在一次专访中,郑耀威将模型推理过程比作在标准化高速公路上行驶的车辆,模型本身相当于不同类型的车辆,而数据则相当于装载在车辆上的货物。只要模型能够在这条高速公路上顺利运行,微调过程只需通过调节参数即可完成。

三、技术架构深度解析

3.1 双架构并行设计

LLaMA Factory 同时提供 v0(稳定版)和 v1(实验版)两套架构,可通过设置环境变量 USE_V1 在两者之间切换。

v0(默认): api/webui → chat/eval/train → data/model → hparams → extras
v1(实验): trainers → core → accelerator/plugins/config → utils

v0 架构是当前的主流实现,提供完整的功能并配备齐全的文档。v1 架构仍在实验阶段,采用更为模块化的分层设计。

3.2 v0 核心模块详解

src/llamafactory/
├── cli.py              # CLI 入口,llamafactory-cli 命令分发
├── launcher.py          # 启动器,根据 USE_V1 分发
├── api/                 # OpenAI 风格 REST API
│   ├── app.py           # FastAPI 应用
│   ├── chat.py          # 对话端点
│   └── protocol.py      # 协议定义
├── chat/                # 推理引擎层
│   ├── base_engine.py   # 抽象基类
│   ├── hf_engine.py     # HuggingFace 原生推理
│   ├── vllm_engine.py   # vLLM 高性能推理
│   └── sglang_engine.py # SGLang 推理
├── data/                # 数据处理层
│   ├── template.py      # 100+ 模型 Prompt 模板注册
│   ├── mm_plugin.py     # 多模态(图/视频/音频)处理
│   ├── loader.py        # 数据集加载器
│   ├── processor/       # 按训练阶段的处理器
│   └── converter.py     # 格式转换(Alpaca/ShareGPT)
├── model/               # 模型层
│   ├── loader.py        # 模型+分词器加载、量化、LoRA
│   └── patcher.py       # 模型兼容补丁
├── train/               # 训练层
│   ├── sft/             # 监督微调
│   ├── dpo/             # DPO 偏好优化
│   ├── ppo/             # PPO 强化学习
│   ├── rm/              # 奖励建模
│   ├── pt/              # 预训练
│   ├── kto/             # KTO 训练
│   └── mca/             # Megatron-Core 适配
├── hparams/              # 参数配置层
│   ├── model_args.py    # 模型参数
│   ├── data_args.py     # 数据参数
│   ├── finetuning_args.py # 微调参数
│   └── training_args.py # 训练参数(继承 HF TrainingArguments)
├── extras/               # 工具包
│   ├── constants.py     # 全局常量/枚举
│   └── packages.py      # 依赖检查
└── webui/                # LLaMA Board Web 界面
    ├── interface.py     # Gradio 界面构建
    ├── runner.py        # 训练任务启动
    └── components/      # UI 组件

3.3 训练流程(v0 Training Flow)

llamafactory-cli train xxx.yaml
  → run_exp() [tuner.py]
    → read_args() → 解析 YAML/JSON 配置
    → get_train_args() → 生成 4 个类型化 dataclass:
        ModelArguments + DataArguments + FinetuningArguments + TrainingArguments
    → 路由到具体训练函数:
        run_sft / run_dpo / run_ppo / run_rm / run_pt / run_kto
    → (可选) export_model() → 合并 LoRA 权重导出

3.4 推理引擎矩阵

  • 引擎|特点|适用场景

  • HF Engine|原生 HuggingFace,兼容性最好|开发调试、小规模推理

  • vLLM Engine|270% 推理加速,PagedAttention|高性能在线推理

  • SGLang Engine|RadixAttention,结构化生成|批量推理、复杂生成

  • KT Engine|知识迁移专用|模型蒸馏

四、功能体系

4.1 支持的训练范式(8 种 × 6 种微调方法 = 48 种组合)

  • 训练范式|Full|Freeze|LoRA|QLoRA|OFT|QOFT

  • 预训练 (PT)|✅|✅|✅|✅|✅|✅

  • 监督微调 (SFT)|✅|✅|✅|✅|✅|✅

  • 奖励建模 (RM)|✅|✅|✅|✅|✅|✅

  • PPO 训练|✅|✅|✅|✅|✅|✅

  • DPO 训练|✅|✅|✅|✅|✅|✅

  • KTO 训练|✅|✅|✅|✅|✅|✅

  • ORPO 训练|✅|✅|✅|✅|✅|✅

  • SimPO 训练|✅|✅|✅|✅|✅|✅

4.2 支持的模型系列(60+ 系列,100+ 变体)

精选代表性模型:

  • 模型系列|参数规模|特色

  • Llama 3-4|1B–402B|Meta 旗舰开源模型

  • Qwen 2-3.6|0.5B–397B|阿里通义千问全系列

  • DeepSeek R1|1.5B–671B|推理模型蒸馏版

  • Gemma 3|270M–27B|Google 轻量级模型

  • InternVL 2.5-3.5|1B–241B|多模态视觉语言模型

  • MiniCPM|0.5B–9B|端侧部署优化

  • GLM-4/4.5|9B–355B|智谱 ChatGLM 系列

  • Mistral/Mixtral|7B–8x22B|MoE 专家混合

  • Phi-3/4|3.8B–14B|微软小型高性能模型

  • Qwen-VL 2-3|2B–235B|视觉语言模型

4.3 高级算法支持

  • 算法|功能|引入版本

  • FlashAttention-2|加速注意力计算|2023-09

  • Unsloth|170% 训练加速 + 50% 显存节省|2023-12

  • DoRA|权重分解 LoRA|2024-02

  • GaLore|梯度低秩优化|2024-03

  • BAdam|块坐标下降优化|2024-04

  • APOLLO|高阶优化器|2025-Q1

  • Liger Kernel|Triton 内核加速|2025

  • FP8 训练|Transformer Engine 支持|2025

4.4 LLaMA Board Web UI

  • 基于 Gradio 构建的零代码可视化界面

  • 模型选择 → 数据集配置 → 微调参数 → 一键启动训练

  • 实时监控:Loss 曲线、GPU 利用率、训练进度

  • 支持 TensorBoard、Wandb、MLflow、SwanLab 多后端日志

  • 内置推理 Chat 界面,训练完即可测试

4.5 部署方式

# CLI 微调(一行命令)
llamafactory-cli train examples/train_lora/qwen3_lora_sft.yaml

# Web UI
llamafactory-cli webui

# OpenAI 风格 API 部署
API_PORT=8000 llamafactory-cli api examples/inference/qwen3.yaml

# Docker
docker run -it --rm --gpus=all hiyouga/llamafactory:latest

五、硬件需求(显存估算)

  • 方法|精度|7B|14B|30B|70B

  • Full (bf16)|32-bit|120GB|240GB|600GB|1200GB

  • Full (pure_bf16)|16-bit|60GB|120GB|300GB|600GB

  • Freeze/LoRA|16-bit|16GB|32GB|64GB|160GB

  • QLoRA|8-bit|10GB|20GB|40GB|80GB

  • QLoRA|4-bit|6GB|12GB|24GB|48GB

  • QLoRA|2-bit|4GB|8GB|16GB|24GB

QLoRA 4‑bit 量化可以在单块 RTX 3060(12 GB 显存)上微调 14 B 参数模型,在单块 RTX 4090(24 GB 显存)上微调 30 B 参数模型。

六、版本演进

  • 版本|日期|关键变更

  • v0.1.0|2023-03|初始发布,支持 LLaMA 微调

  • 早期迭代|2023|SFT + LoRA/QLoRA、DPO、Web UI、FlashAttention-2、Unsloth

  • 早期迭代|2024 Q1-Q3|DoRA、GaLore、BAdam、FSDP+QLoRA、vLLM、多模态 LLaVA、论文发表

  • v0.9.1|2025 Q1|Llama 3.2 Vision、LLaVA-NeXT、Pixtral、Video-LLaVA

  • v0.9.2|2025 Q1|MiniCPM-o、SwanLab、APOLLO 优化器

  • v0.9.3|2025 Q2|Llama 4、Gemma 3、Qwen3、InternVL3、Qwen2.5-Omni

  • v0.9.4|2025-12|🔄 仓库更名为 LlamaFactory,弃用 Python 3.9-3.10

  • v0.9.5|2026-05-30|Qwen3.5/3.6、Gemma 4、Transformers v5 兼容

  • v1.x (实验)|2026|新架构 trainers → core → accelerator,模块化重写

关键里程碑解读

  1. ACL 2024 论文发表 —— 学术背书使 Stars 从 1 万飙升至 3 万+

  2. 2024 下半年 —— 多模态支持(LLaVA/Video/音频)打开新市场

  3. 2025 年 —— 保持月更节奏,支持 Qwen3/DeepSeek/Llama4,成中国开源社区首选

  4. 仓库更名 —— LLaMA-Factory → LlamaFactory,去 Meta 品牌依赖

  5. v1 实验架构 —— 暗示重大重构在即

七、社区生态

7.1 项目生态矩阵

  • 项目|描述|Stars

  • LlamaFactory|核心微调框架|72K+

  • EasyR1|VLM 强化学习(GRPO/DAPO/Reinforce++)|新兴

  • FastEdit|高效模型事实编辑|已归档

  • llamafactory-community|社区交流中心|-

  • Easy Dataset|合成数据生成工具|第三方

  • DataFlow|数据处理管道|第三方

7.2 社区热度

  • 中国 AI 社区:CSDN、知乎、博客园有数百篇教程/实践经验

  • 企业采用:阿里云、华为昇腾、亚马逊 AWS、英伟达官方推荐

  • 教育场景:被复旦大学、多所高校作为大模型课程教学工具

  • 中文适配:原生支持 ModelScope(魔搭社区)、OpenMind Hub 镜像下载

  • LLaMA Factory Online:曾提供在线平台服务,2026-06-20 关停

7.3 竞品对比

  • 框架|Stars|核心特色|模型支持|易用性

  • LlamaFactory|72K|一站式 GUI/CLI、ACL 论文背书|100+|⭐⭐⭐⭐⭐

  • HuggingFace TRL|12K|HF 官方工具链,与生态深度融合|所有 HF 模型|⭐⭐⭐

  • Axolotl|8K|YAML 驱动,高级用户定制|主流模型|⭐⭐⭐

  • Unsloth|20K+|极致性能优化(2-5x 加速)|LLaMA/Mistral 等|⭐⭐⭐⭐

  • Firefly|5K|中文大模型优化|中文模型为主|⭐⭐⭐

  • LLaMA-Adapter|6K|学术研究导向|LLaMA 系列|⭐⭐

LlamaFactory 的核心优势

  • 唯一同时拥有 ACL 论文 + 7 万 Stars + 商业落地案例 + 零代码 GUI 的框架

  • 模型覆盖面最广(从 GPT-2 到 Llama 4、从纯文本到多模态)

  • 中国社区生态最强(HuggingFace 镜像 + ModelScope 集成)

八、SWOT 分析

8.1 优势 (Strengths)

  • 优势|详述

  • 🔬 学术权威性|ACL 2024 论文,引入学术引用超 500+ 次

  • 🎯 极低门槛|一行命令微调、Web UI 零代码操作

  • 🌐 最广模型覆盖|100+ 模型、60+ 系列、文本/视觉/视频/音频

  • 🇨🇳 中国社区生态|ModelScope/OpenMind 镜像、中文教程海量

  • 🔧 工业级工具链|Docker/分布式/API 部署一应俱全

  • 💾 极致显存优化|QLoRA 4-bit 消费级 GPU 跑 70B

8.2 劣势 (Weaknesses)

  • 劣势|详述

  • 👤 单点依赖严重|hiyouga 一人占 72% 提交(2,188/3,042),Bus Factor = 1

  • 📚 文档分散|README 超长(68KB),Wiki/ReadTheDocs/社区文章信息碎片化

  • 🐛 Issue 积压|仅 57 Open Issues,但 Issue 区讨论量巨大

  • 🏗️ v0/v1 双轨分裂|双架构维护成本高,v1 长期未稳定

  • 📦 包依赖复杂|CUDA/PyTorch/FlashAttn 版本矩阵极易出错

  • 🔒 学术项目属性|缺乏全职运营团队,长期可持续性存疑

8.3 机会 (Opportunities)

  • 机会|详述

  • 🚀 Agent 微调场景|Function Calling / Tool Use 微调需求爆发

  • 🎥 多模态扩展|Video/Audio/3D 模型微调蓝海市场

  • ☁️ 云原生 SaaS|LLaMA Factory Online 虽关停,但企业级托管需求仍在

  • 🏢 企业培训市场|大模型微调培训课程、认证体系

  • 🔗 MCP 集成|作为 AI Agent 基础设施的微调后端

8.4 威胁 (Threats)

  • 威胁|详述

  • 🏢 大厂自研框架|阿里 PAI、华为 ModelArts 提供集成方案

  • 🔄 HF 官方竞争|HuggingFace TRL/peft 生态日趋完善

  • 📉 微调需求萎缩|Prompt Engineering + RAG 部分替代微调场景

  • 👨‍🎓 创始人毕业|郑耀威博士毕业后项目维护力度可能下降

九、风险评估

  • 风险类别|风险等级|说明

  • Bus Factor|🔴 高风险|单一核心开发者占 72% 提交,一旦离开项目停滞风险极高

  • 技术债|🟡 中风险|v0/v1 双架构、68KB README、文档碎片化

  • 依赖链|🟡 中风险|CUDA/PyTorch/FlashAttn 版本矩阵维护成本高

  • 商业化|🟢 低风险|Apache-2.0 许可,无商业限制

  • 社区健康度|🟢 健康|7.2 万 Stars、全球社区活跃、企业广泛采用

十、技术亮点与创新

10.1 "标准化高速公路"架构

在传统微调中,不同模型需要分别进行适配。LLaMA Factory 采用模板注册机制并结合 monkey‑patch 技术,显著降低了适配成本。

# 添加新模型只需 3 步:
# 1. 在 template.py 的 TEMPLATES 字典注册 Prompt 模板
# 2. 在 patcher.py 添加模型兼容补丁(如需要)
# 3. 在 mm_plugin.py 添加多模态支持(如需要)

10.2 四层参数配置系统

YAML/JSON 配置文件
  → parser.py 解析
    → ModelArguments(模型选择、量化)
    → DataArguments(数据集、模板、预处理)
    → FinetuningArguments(LoRA rank/target、训练方法)
    → TrainingArguments(继承 HF,分布式/日志/checkpoint)

10.3 数据管道标准化

本工具支持 Alpaca 与 ShareGPT 两种主流数据格式,可自动转换超过 50 个预置数据集,并兼容 JSON、JSONL、CSV、Parquet、Arrow 等文件格式。

10.4 渐进式量化支持

支持从 16 位全精度到 2 位 QLoRA 的六种精度级别,可在 A100 服务器集群及普通笔记本等不同硬件环境中使用。

十一、竞品对比矩阵

  • 维度|LlamaFactory|HuggingFace TRL|Unsloth|Axolotl

  • Stars|72K|12K|20K+|8K

  • 模型支持|100+ 系列|所有 HF|LLaMA/Qwen/Mistral|主流系列

  • GUI|✅ LLaMA Board|❌|❌|❌

  • 零代码|✅ CLI + YAML|❌ 需编码|❌ 需编码|仅 YAML

  • 训练范式|8 种|4 种 (SFT/DPO/PPO/GRPO)|3 种|5 种

  • 量化深度|2-16bit|4-16bit|4-16bit|4-16bit

  • 多模态|✅ 图片/视频/音频|❌|❌|❌

  • 中文生态|✅ ModelScope + 魔搭|⚠️ 需翻墙|⚠️ 需翻墙|❌

  • 学术论文|ACL 2024|-|-|-

  • 推理引擎|vLLM/SGLang/HF|HF only|HF only|vLLM/HF

  • 学习曲线|极低|中等|低|中高

十二、部署实战要点

12.1 快速上手(3 步)

# Step 1: 安装
git clone --depth 1 github.com/hiyouga/LlamaFactory.git
cd LlamaFactory
pip install -e ".[torch,metrics]"

# Step 2: 启动 Web UI
llamafactory-cli webui

# Step 3: 浏览器打开 localhost:7860,选择模型 → 数据集 → 训练!

12.2 生产环境建议

# Docker 部署(推荐)
docker run -it --rm --gpus=all \
    -v ./hf_cache:/root/.cache/huggingface \
    -v ./data:/app/shared_data \
    -v ./output:/app/output \
    -p 7860:7860 -p 8000:8000 \
    hiyouga/llamafactory:latest

# API 部署(OpenAI 兼容)
API_PORT=8000 llamafactory-cli api \
    examples/inference/qwen3.yaml \
    infer_backend=vllm

12.3 Windows 用户注意事项

  • 需手动安装 PyTorch GPU 版本:pip install torch torchvision torchaudio --index-url download.pytorch.org/whl/cu126

  • QLoRA 需安装 Windows 专用 bitsandbytes 预编译版

  • FlashAttention-2 在 Windows 上需手动编译

  • 设置 dataloader_num_workers: 0 避免序列化错误

十三、未来展望

  1. v1 架构稳定化:实验分支预计 2026-2027 成为主架构,模块化程度更高

  2. Agent 微调深化:Tool Use / Function Calling 微调将成为标准功能

  3. 推理模型 (Reasoning) 微调:DeepSeek-R1 蒸馏 + GRPO 微调(EasyR1 项目)

  4. 云原生托管:LLaMA Factory Online 关停后,第三方托管方案可能出现

  5. 多模态训练统一:文本/图像/视频/音频在同一框架内微调

十四、评分与总结

  • 维度|评分|评语

  • 技术架构|9.5/10|模块化设计、双架构演进、引擎矩阵丰富

  • 功能完整性|10/10|8 种训练范式 × 6 种微调方法 × 100+ 模型

  • 易用性|10/10|一行命令微调 + 零代码 Web UI,业界最佳

  • 文档质量|7.5/10|README 详尽但过长,碎片化严重

  • 社区活跃度|9.5/10|72K Stars、中国社区现象级热度

  • 生产就绪度|9.0/10|Docker/API/分布式完整,企业验证充分

  • 可持续发展|6.5/10|Bus Factor=1,学术项目属性,长期存疑

  • 创新性|8.5/10|ACL 论文、模板注册机制、四层参数系统

综合评分:9.

一句话总结

LLaMA Factory 是一个开源的大模型微调框架,基于 ACL 2024 论文实现,并在 GitHub 上获得约 72 000 颗星的社区认可。框架遵循“算法‑模型‑数据解耦”的设计理念,提供零代码的命令行界面(CLI)和 Web UI,支持对 100 多种模型进行微调,从而显著降低了大模型微调的技术门槛。它可作为大模型应用落地的基础设施使用。