
LLaMA Factory(现更名为 LlamaFactory)是一个面向大语言模型的统一微调框架。该项目由北京航空航天大学郑耀威博士团队发起,并以 ACL 2024 论文提供学术支撑。框架采用“零代码 CLI + Web UI”的设计,旨在简化微调流程。LlamaFactory 在 GitHub 上累计获得超过 72 000 个 Stars,已成为大模型微调领域的参考实现。

>
一、项目概述
维度|详情
项目全称|LlamaFactory(原名 LLaMA-Factory)
GitHub 地址|github.com/hiyouga/LlamaFactory
Stars|72,476 ⭐
Forks|8,861
主要语言|Python(99.7%)
许可证|Apache-2.0
创建时间|2023-03-21
最新版本|v0.9.5(2026-05-30)
总提交数|3,042 commits
核心贡献者|hiyouga(郑耀威,2,188 commits,占总提交 72%)
学术论文|ACL 2024 System Demonstrations
仓库大小|~412.9 MB
Open Issues|57
创始人郑耀威(hiyouga)是北京航空航天大学的博士生,曾以第一作者身份在 ACL、CVPR、WWW 等国际顶级会议发表多篇论文,并担任 AAAI、EMNLP 等会议的审稿人。其获奖经历包括华为杯、蓝桥杯全国一等奖、北航大学生年度人物以及昇腾生态开源卓越贡献奖。合作团队成员有北航教授张日崇、张俊豪、叶彦涵、罗哲炎、冯章驰、马永强等。
二、项目定位与核心价值
2.1 一句话定位
标准化的大模型微调流水线:适用于任意模型的统一流程,涵盖数据准备、模型训练、推理验证以及部署等全链路步骤。
2.2 解决的核心痛点
痛点|LLaMA Factory 的解法
不同模型微调流程各异,切换成本高|算法-模型-数据"解耦"设计,100+ 模型统一入口
微调代码门槛高,需要深度学习专业背景|零代码 CLI + LLaMA Board Web UI(Gradio)
显存不足,消费级 GPU 无法训练大模型|QLoRA 4-bit:7B 仅需 6GB,70B 仅需 48GB
开源社区缺少一站式工具链|覆盖 PT→SFT→RM→PPO→DPO 全生命周期
推理部署复杂|一键导出 + OpenAI 风格 API + vLLM/SGLang
2.3 设计哲学:算法-模型-数据"解耦"
在一次专访中,郑耀威将模型推理过程比作在标准化高速公路上行驶的车辆,模型本身相当于不同类型的车辆,而数据则相当于装载在车辆上的货物。只要模型能够在这条高速公路上顺利运行,微调过程只需通过调节参数即可完成。
三、技术架构深度解析
3.1 双架构并行设计
LLaMA Factory 同时提供 v0(稳定版)和 v1(实验版)两套架构,可通过设置环境变量 USE_V1 在两者之间切换。
v0(默认): api/webui → chat/eval/train → data/model → hparams → extras
v1(实验): trainers → core → accelerator/plugins/config → utils
v0 架构是当前的主流实现,提供完整的功能并配备齐全的文档。v1 架构仍在实验阶段,采用更为模块化的分层设计。
3.2 v0 核心模块详解
src/llamafactory/
├── cli.py # CLI 入口,llamafactory-cli 命令分发
├── launcher.py # 启动器,根据 USE_V1 分发
├── api/ # OpenAI 风格 REST API
│ ├── app.py # FastAPI 应用
│ ├── chat.py # 对话端点
│ └── protocol.py # 协议定义
├── chat/ # 推理引擎层
│ ├── base_engine.py # 抽象基类
│ ├── hf_engine.py # HuggingFace 原生推理
│ ├── vllm_engine.py # vLLM 高性能推理
│ └── sglang_engine.py # SGLang 推理
├── data/ # 数据处理层
│ ├── template.py # 100+ 模型 Prompt 模板注册
│ ├── mm_plugin.py # 多模态(图/视频/音频)处理
│ ├── loader.py # 数据集加载器
│ ├── processor/ # 按训练阶段的处理器
│ └── converter.py # 格式转换(Alpaca/ShareGPT)
├── model/ # 模型层
│ ├── loader.py # 模型+分词器加载、量化、LoRA
│ └── patcher.py # 模型兼容补丁
├── train/ # 训练层
│ ├── sft/ # 监督微调
│ ├── dpo/ # DPO 偏好优化
│ ├── ppo/ # PPO 强化学习
│ ├── rm/ # 奖励建模
│ ├── pt/ # 预训练
│ ├── kto/ # KTO 训练
│ └── mca/ # Megatron-Core 适配
├── hparams/ # 参数配置层
│ ├── model_args.py # 模型参数
│ ├── data_args.py # 数据参数
│ ├── finetuning_args.py # 微调参数
│ └── training_args.py # 训练参数(继承 HF TrainingArguments)
├── extras/ # 工具包
│ ├── constants.py # 全局常量/枚举
│ └── packages.py # 依赖检查
└── webui/ # LLaMA Board Web 界面
├── interface.py # Gradio 界面构建
├── runner.py # 训练任务启动
└── components/ # UI 组件
3.3 训练流程(v0 Training Flow)
llamafactory-cli train xxx.yaml
→ run_exp() [tuner.py]
→ read_args() → 解析 YAML/JSON 配置
→ get_train_args() → 生成 4 个类型化 dataclass:
ModelArguments + DataArguments + FinetuningArguments + TrainingArguments
→ 路由到具体训练函数:
run_sft / run_dpo / run_ppo / run_rm / run_pt / run_kto
→ (可选) export_model() → 合并 LoRA 权重导出
3.4 推理引擎矩阵
引擎|特点|适用场景
HF Engine|原生 HuggingFace,兼容性最好|开发调试、小规模推理
vLLM Engine|270% 推理加速,PagedAttention|高性能在线推理
SGLang Engine|RadixAttention,结构化生成|批量推理、复杂生成
KT Engine|知识迁移专用|模型蒸馏
四、功能体系
4.1 支持的训练范式(8 种 × 6 种微调方法 = 48 种组合)
训练范式|Full|Freeze|LoRA|QLoRA|OFT|QOFT
预训练 (PT)|✅|✅|✅|✅|✅|✅
监督微调 (SFT)|✅|✅|✅|✅|✅|✅
奖励建模 (RM)|✅|✅|✅|✅|✅|✅
PPO 训练|✅|✅|✅|✅|✅|✅
DPO 训练|✅|✅|✅|✅|✅|✅
KTO 训练|✅|✅|✅|✅|✅|✅
ORPO 训练|✅|✅|✅|✅|✅|✅
SimPO 训练|✅|✅|✅|✅|✅|✅
4.2 支持的模型系列(60+ 系列,100+ 变体)
精选代表性模型:
模型系列|参数规模|特色
Llama 3-4|1B–402B|Meta 旗舰开源模型
Qwen 2-3.6|0.5B–397B|阿里通义千问全系列
DeepSeek R1|1.5B–671B|推理模型蒸馏版
Gemma 3|270M–27B|Google 轻量级模型
InternVL 2.5-3.5|1B–241B|多模态视觉语言模型
MiniCPM|0.5B–9B|端侧部署优化
GLM-4/4.5|9B–355B|智谱 ChatGLM 系列
Mistral/Mixtral|7B–8x22B|MoE 专家混合
Phi-3/4|3.8B–14B|微软小型高性能模型
Qwen-VL 2-3|2B–235B|视觉语言模型
4.3 高级算法支持
算法|功能|引入版本
FlashAttention-2|加速注意力计算|2023-09
Unsloth|170% 训练加速 + 50% 显存节省|2023-12
DoRA|权重分解 LoRA|2024-02
GaLore|梯度低秩优化|2024-03
BAdam|块坐标下降优化|2024-04
APOLLO|高阶优化器|2025-Q1
Liger Kernel|Triton 内核加速|2025
FP8 训练|Transformer Engine 支持|2025
4.4 LLaMA Board Web UI
基于 Gradio 构建的零代码可视化界面
模型选择 → 数据集配置 → 微调参数 → 一键启动训练
实时监控:Loss 曲线、GPU 利用率、训练进度
支持 TensorBoard、Wandb、MLflow、SwanLab 多后端日志
内置推理 Chat 界面,训练完即可测试
4.5 部署方式
# CLI 微调(一行命令)
llamafactory-cli train examples/train_lora/qwen3_lora_sft.yaml
# Web UI
llamafactory-cli webui
# OpenAI 风格 API 部署
API_PORT=8000 llamafactory-cli api examples/inference/qwen3.yaml
# Docker
docker run -it --rm --gpus=all hiyouga/llamafactory:latest
五、硬件需求(显存估算)
方法|精度|7B|14B|30B|70B
Full (bf16)|32-bit|120GB|240GB|600GB|1200GB
Full (pure_bf16)|16-bit|60GB|120GB|300GB|600GB
Freeze/LoRA|16-bit|16GB|32GB|64GB|160GB
QLoRA|8-bit|10GB|20GB|40GB|80GB
QLoRA|4-bit|6GB|12GB|24GB|48GB
QLoRA|2-bit|4GB|8GB|16GB|24GB
QLoRA 4‑bit 量化可以在单块 RTX 3060(12 GB 显存)上微调 14 B 参数模型,在单块 RTX 4090(24 GB 显存)上微调 30 B 参数模型。
六、版本演进
版本|日期|关键变更
v0.1.0|2023-03|初始发布,支持 LLaMA 微调
早期迭代|2023|SFT + LoRA/QLoRA、DPO、Web UI、FlashAttention-2、Unsloth
早期迭代|2024 Q1-Q3|DoRA、GaLore、BAdam、FSDP+QLoRA、vLLM、多模态 LLaVA、论文发表
v0.9.1|2025 Q1|Llama 3.2 Vision、LLaVA-NeXT、Pixtral、Video-LLaVA
v0.9.2|2025 Q1|MiniCPM-o、SwanLab、APOLLO 优化器
v0.9.3|2025 Q2|Llama 4、Gemma 3、Qwen3、InternVL3、Qwen2.5-Omni
v0.9.4|2025-12|🔄 仓库更名为 LlamaFactory,弃用 Python 3.9-3.10
v0.9.5|2026-05-30|Qwen3.5/3.6、Gemma 4、Transformers v5 兼容
v1.x (实验)|2026|新架构 trainers → core → accelerator,模块化重写
关键里程碑解读
ACL 2024 论文发表 —— 学术背书使 Stars 从 1 万飙升至 3 万+
2024 下半年 —— 多模态支持(LLaVA/Video/音频)打开新市场
2025 年 —— 保持月更节奏,支持 Qwen3/DeepSeek/Llama4,成中国开源社区首选
仓库更名 —— LLaMA-Factory → LlamaFactory,去 Meta 品牌依赖
v1 实验架构 —— 暗示重大重构在即
七、社区生态
7.1 项目生态矩阵
项目|描述|Stars
LlamaFactory|核心微调框架|72K+
EasyR1|VLM 强化学习(GRPO/DAPO/Reinforce++)|新兴
FastEdit|高效模型事实编辑|已归档
llamafactory-community|社区交流中心|-
Easy Dataset|合成数据生成工具|第三方
DataFlow|数据处理管道|第三方
7.2 社区热度
中国 AI 社区:CSDN、知乎、博客园有数百篇教程/实践经验
企业采用:阿里云、华为昇腾、亚马逊 AWS、英伟达官方推荐
教育场景:被复旦大学、多所高校作为大模型课程教学工具
中文适配:原生支持 ModelScope(魔搭社区)、OpenMind Hub 镜像下载
LLaMA Factory Online:曾提供在线平台服务,2026-06-20 关停
7.3 竞品对比
框架|Stars|核心特色|模型支持|易用性
LlamaFactory|72K|一站式 GUI/CLI、ACL 论文背书|100+|⭐⭐⭐⭐⭐
HuggingFace TRL|12K|HF 官方工具链,与生态深度融合|所有 HF 模型|⭐⭐⭐
Axolotl|8K|YAML 驱动,高级用户定制|主流模型|⭐⭐⭐
Unsloth|20K+|极致性能优化(2-5x 加速)|LLaMA/Mistral 等|⭐⭐⭐⭐
Firefly|5K|中文大模型优化|中文模型为主|⭐⭐⭐
LLaMA-Adapter|6K|学术研究导向|LLaMA 系列|⭐⭐
LlamaFactory 的核心优势:
唯一同时拥有 ACL 论文 + 7 万 Stars + 商业落地案例 + 零代码 GUI 的框架
模型覆盖面最广(从 GPT-2 到 Llama 4、从纯文本到多模态)
中国社区生态最强(HuggingFace 镜像 + ModelScope 集成)
八、SWOT 分析
8.1 优势 (Strengths)
优势|详述
🔬 学术权威性|ACL 2024 论文,引入学术引用超 500+ 次
🎯 极低门槛|一行命令微调、Web UI 零代码操作
🌐 最广模型覆盖|100+ 模型、60+ 系列、文本/视觉/视频/音频
🇨🇳 中国社区生态|ModelScope/OpenMind 镜像、中文教程海量
🔧 工业级工具链|Docker/分布式/API 部署一应俱全
💾 极致显存优化|QLoRA 4-bit 消费级 GPU 跑 70B
8.2 劣势 (Weaknesses)
劣势|详述
👤 单点依赖严重|hiyouga 一人占 72% 提交(2,188/3,042),Bus Factor = 1
📚 文档分散|README 超长(68KB),Wiki/ReadTheDocs/社区文章信息碎片化
🐛 Issue 积压|仅 57 Open Issues,但 Issue 区讨论量巨大
🏗️ v0/v1 双轨分裂|双架构维护成本高,v1 长期未稳定
📦 包依赖复杂|CUDA/PyTorch/FlashAttn 版本矩阵极易出错
🔒 学术项目属性|缺乏全职运营团队,长期可持续性存疑
8.3 机会 (Opportunities)
机会|详述
🚀 Agent 微调场景|Function Calling / Tool Use 微调需求爆发
🎥 多模态扩展|Video/Audio/3D 模型微调蓝海市场
☁️ 云原生 SaaS|LLaMA Factory Online 虽关停,但企业级托管需求仍在
🏢 企业培训市场|大模型微调培训课程、认证体系
🔗 MCP 集成|作为 AI Agent 基础设施的微调后端
8.4 威胁 (Threats)
威胁|详述
🏢 大厂自研框架|阿里 PAI、华为 ModelArts 提供集成方案
🔄 HF 官方竞争|HuggingFace TRL/peft 生态日趋完善
📉 微调需求萎缩|Prompt Engineering + RAG 部分替代微调场景
👨🎓 创始人毕业|郑耀威博士毕业后项目维护力度可能下降
九、风险评估
风险类别|风险等级|说明
Bus Factor|🔴 高风险|单一核心开发者占 72% 提交,一旦离开项目停滞风险极高
技术债|🟡 中风险|v0/v1 双架构、68KB README、文档碎片化
依赖链|🟡 中风险|CUDA/PyTorch/FlashAttn 版本矩阵维护成本高
商业化|🟢 低风险|Apache-2.0 许可,无商业限制
社区健康度|🟢 健康|7.2 万 Stars、全球社区活跃、企业广泛采用
十、技术亮点与创新
10.1 "标准化高速公路"架构
在传统微调中,不同模型需要分别进行适配。LLaMA Factory 采用模板注册机制并结合 monkey‑patch 技术,显著降低了适配成本。
# 添加新模型只需 3 步:
# 1. 在 template.py 的 TEMPLATES 字典注册 Prompt 模板
# 2. 在 patcher.py 添加模型兼容补丁(如需要)
# 3. 在 mm_plugin.py 添加多模态支持(如需要)
10.2 四层参数配置系统
YAML/JSON 配置文件
→ parser.py 解析
→ ModelArguments(模型选择、量化)
→ DataArguments(数据集、模板、预处理)
→ FinetuningArguments(LoRA rank/target、训练方法)
→ TrainingArguments(继承 HF,分布式/日志/checkpoint)
10.3 数据管道标准化
本工具支持 Alpaca 与 ShareGPT 两种主流数据格式,可自动转换超过 50 个预置数据集,并兼容 JSON、JSONL、CSV、Parquet、Arrow 等文件格式。
10.4 渐进式量化支持
支持从 16 位全精度到 2 位 QLoRA 的六种精度级别,可在 A100 服务器集群及普通笔记本等不同硬件环境中使用。
十一、竞品对比矩阵
维度|LlamaFactory|HuggingFace TRL|Unsloth|Axolotl
Stars|72K|12K|20K+|8K
模型支持|100+ 系列|所有 HF|LLaMA/Qwen/Mistral|主流系列
GUI|✅ LLaMA Board|❌|❌|❌
零代码|✅ CLI + YAML|❌ 需编码|❌ 需编码|仅 YAML
训练范式|8 种|4 种 (SFT/DPO/PPO/GRPO)|3 种|5 种
量化深度|2-16bit|4-16bit|4-16bit|4-16bit
多模态|✅ 图片/视频/音频|❌|❌|❌
中文生态|✅ ModelScope + 魔搭|⚠️ 需翻墙|⚠️ 需翻墙|❌
学术论文|ACL 2024|-|-|-
推理引擎|vLLM/SGLang/HF|HF only|HF only|vLLM/HF
学习曲线|极低|中等|低|中高
十二、部署实战要点
12.1 快速上手(3 步)
# Step 1: 安装
git clone --depth 1 github.com/hiyouga/LlamaFactory.git
cd LlamaFactory
pip install -e ".[torch,metrics]"
# Step 2: 启动 Web UI
llamafactory-cli webui
# Step 3: 浏览器打开 localhost:7860,选择模型 → 数据集 → 训练!
12.2 生产环境建议
# Docker 部署(推荐)
docker run -it --rm --gpus=all \
-v ./hf_cache:/root/.cache/huggingface \
-v ./data:/app/shared_data \
-v ./output:/app/output \
-p 7860:7860 -p 8000:8000 \
hiyouga/llamafactory:latest
# API 部署(OpenAI 兼容)
API_PORT=8000 llamafactory-cli api \
examples/inference/qwen3.yaml \
infer_backend=vllm
12.3 Windows 用户注意事项
需手动安装 PyTorch GPU 版本:
pip install torch torchvision torchaudio --index-url download.pytorch.org/whl/cu126QLoRA 需安装 Windows 专用 bitsandbytes 预编译版
FlashAttention-2 在 Windows 上需手动编译
设置
dataloader_num_workers: 0避免序列化错误
十三、未来展望
v1 架构稳定化:实验分支预计 2026-2027 成为主架构,模块化程度更高
Agent 微调深化:Tool Use / Function Calling 微调将成为标准功能
推理模型 (Reasoning) 微调:DeepSeek-R1 蒸馏 + GRPO 微调(EasyR1 项目)
云原生托管:LLaMA Factory Online 关停后,第三方托管方案可能出现
多模态训练统一:文本/图像/视频/音频在同一框架内微调
十四、评分与总结
维度|评分|评语
技术架构|9.5/10|模块化设计、双架构演进、引擎矩阵丰富
功能完整性|10/10|8 种训练范式 × 6 种微调方法 × 100+ 模型
易用性|10/10|一行命令微调 + 零代码 Web UI,业界最佳
文档质量|7.5/10|README 详尽但过长,碎片化严重
社区活跃度|9.5/10|72K Stars、中国社区现象级热度
生产就绪度|9.0/10|Docker/API/分布式完整,企业验证充分
可持续发展|6.5/10|Bus Factor=1,学术项目属性,长期存疑
创新性|8.5/10|ACL 论文、模板注册机制、四层参数系统
综合评分:9.
一句话总结
LLaMA Factory 是一个开源的大模型微调框架,基于 ACL 2024 论文实现,并在 GitHub 上获得约 72 000 颗星的社区认可。框架遵循“算法‑模型‑数据解耦”的设计理念,提供零代码的命令行界面(CLI)和 Web UI,支持对 100 多种模型进行微调,从而显著降低了大模型微调的技术门槛。它可作为大模型应用落地的基础设施使用。
