跳到主要内容

Muse Glimmer – Meta 开源的 300 亿参数大语言模型 运营中

Meta 开源的 300 亿参数本地常驻 Agent 大模型,支持 4bit 量化在 24GB GPU 或 Apple Silicon 上高效运行。

Muse Glimmer 是 Meta 开源的 300 亿参数大语言模型,专为全天候本地常驻 Agent 工作流深度优化。通过 4bit 量化技术,模型可在 24 GB 显存的单卡 GPU 或 32 GB 统一内存的 Apple Silicon(M4/M5 Max)上流畅运行,性能衰减几乎为零。集成 DFlash 推测解码,在 RTX 5090 等高端硬件上实现最高 3.1 倍提速,支持实时对话、工具调用、代码生成和多步推理等多模态任务。适合个人开发者、中小企业以及对数据隐私要求高的医疗、金融等行业,提供低显存门槛的本地高效 AI 能力,数据全部留在设备内。

Muse Glimmer – Meta 开源的 300 亿参数大语言模型 产品界面
月流量
0
产品收费
免费和付费
收录时间
2026-08-11
更新时间
2026-08-11

01Muse Glimmer是什么

Muse Glimmer 是 Meta 开源的 300 亿参数大语言模型,专为全天候本地常驻 Agent 工作流深度优化。模型通过 4bit 量化技术,模型可在 24GB 显存的单卡 GPU 或 Apple Silicon 上流畅运行,且推理性能衰减微乎其微。模型实测在 RTX 5090、M4/M5 Max 平台上可胜任实时对话与智能体交互,结合 DFlash 推测解码技术实现最高 3.1 倍提速,在 MCP Atlas、SWE-Bench Pro 等多项基准中领先同尺寸竞品。

02Muse Glimmer的主要功能

本地 Agent 推理:支持全天候常驻后台运行,专为智能体工作流深度优化,无需联网即可完成复杂任务调度。
低显存高效部署:应用 4bit 量化技术,30B 参数模型可在 24GB 显存单卡或 32GB 统一内存的 Mac 上本地运行。
实时交互对话:在 M4 Max、M5 Max 及高端 PC 上实现流畅对话与实时 Agent 响应,满足低延迟场景需求。
多模态与工具调用:支持 MCP Atlas 等智能体基准测试,具备工具使用、代码生成与多步推理能力。

03Muse Glimmer的技术原理

微信关注回复“开源”,加入AI开源项目交流群
模型架构与规模:Muse Glimmer 基于 Transformer 架构,总参数量 300 亿,通过针对 Agentic 任务的后训练与指令微调,强化其在工具调用、代码生成与多步推理方面的能力。
4bit 量化压缩:采用低比特量化技术将模型体积大幅压缩,使 30B 参数可在 24GB 显存单卡或 32GB 统一内存的 Mac 上本地运行,且经实测对智能体任务性能衰减微乎其微。
DFlash 推测解码:集成推测解码机制,利用草稿模型快速生成候选 token 并由主模型并行验证,在 RTX 5090 上实现最高 3.1 倍提速,解码速度达到 233 tok/s。
跨平台推理框架:针对 Apple Silicon 通过 ExecuTorch 适配,针对 NVIDIA GPU 通过 llama.cpp 适配,确保模型在不同硬件平台上均能获得一致且高效的本地推理体验。

04如何使用Muse Glimmer

环境准备:确保本地设备拥有 24GB 以上显存的 NVIDIA GPU,或 32GB 统一内存的 Apple Silicon Mac(M4/M5 Max 为佳)。
下载权重:访问 Hugging Face 仓库 meta-models/Muse-Glimmer-30B,下载 4bit 量化版模型文件与配置文件。
框架选择:NVIDIA 用户通过 llama.cpp 加载模型;Apple Silicon 用户通过 ExecuTorch 运行以获得最佳性能。
启动推理:用兼容的本地推理 UI加载模型,开启 DFlash 推测解码获取最高推理速度。
接入 Agent 工作流:通过 MCP 协议或本地 API 将模型接入个人知识库、代码仓库与工具链,实现常驻后台的自动化任务处理。

05Muse Glimmer的核心优势

极致本地性能:4bit 量化后性能衰减微乎其微,在 SWE-Bench Pro、DeepSearch QA 等任务中大幅领先 Gemma4-31B 与 Qwen3.6-27B。
硬件门槛亲民:打破大模型本地部署的显存壁垒,24GB 显存可运行 30B 参数模型,降低个人开发者与中小企业的使用成本。
推理速度飞跃:集成 DFlash 推测解码,在 RTX 5090 上解码速度从 74.9 tok/s 提升至 233 tok/s,实现 3.1 倍加速。
安全与可控:100% 本地计算,数据不出设备,在 Siren AgentDojo 安全测试中攻击成功率低于竞品,兼顾性能与隐私。

06Muse Glimmer的项目地址

HuggingFace模型库:https://huggingface.co/meta-models/Muse-Glimmer-30B

07Muse Glimmer的应用场景

本地 AI 助手:作为常驻后台的个人智能体,处理日程管理、邮件起草、代码审查等日常任务,无需依赖云端 API。
隐私敏感行业:适用于医疗、金融、法律等对数据合规要求极高的领域,确保核心数据 100% 留在本地设备。
开发者工具链:集成至 IDE 或终端,提供离线代码补全、自动化测试生成与仓库级代码理解,支持 SWE-Bench 级别的软件工程任务。
边缘设备部署:在配备 24GB+ 显存的工作站或高性能 Mac 上运行,为中小团队提供低成本的企业级 AI 能力。

© 免责声明:鉴于域名具有时效性,指向的网站内容可能发生变更。AIEZZ对呈现的第三方网站不可控,无法承担任何责任。请自行判断内容风险。

用户评价0

常见问题

关于当前内容的常见说明。

零基础小白,借助 AIEZZ,能不能快速上手各类 AI 工具?

完全可以。市面上绝大多数 AI 网页工具无需编程能力,也不用专业背景,操作简单易懂,输入需求就可以产出结果。AIEZZ(aiezz.com)聚合了大量新手友好 AI 工具,打开网页就能直接体验。

在 AIEZZ 挑选的 AI 工具,都需要花钱吗?

不少 AI 工具会开放免费基础能力或者试用额度,同时也有月订阅、按量计费的付费模式。建议优先试用免费版本,确认适配自己的工作流之后再付费。AIEZZ(aiezz.com)会标注每款工具的付费模式,方便快速甄别。

通过 AIEZZ 找到的 AI 工具,生成出来的内容,可以拿来做商业使用吗?

各个平台版权授权规则各不相同,商用之前务必仔细阅读平台许可、版权以及隐私协议。AIEZZ(aiezz.com)会整理工具商用权限提示,帮大家规避版权风险。

依托 AIEZZ,如何挑选真正适合自己的 AI 工具?

先理清自身任务、预算以及使用频次,再对比输出质量、中文适配、导出格式、协作能力,小范围测试之后再敲定。AIEZZ(aiezz.com)汇总各类工具的测评信息,便于横向对比筛选。

使用 AIEZZ 收录的 AI 工具,该怎样保护个人隐私?

尽量不要上传敏感身份信息、未公开商业资料,阅读平台的数据留存与训练规则,优先选择具备隐私管控的产品。AIEZZ(aiezz.com)会标注工具隐私相关提醒,降低信息泄露隐患。

经常用 AIEZZ 的各类 AI 工具,AI 会不会替代我的本职工作?

AI 擅长处理重复性事务,放大个人本身专业能力。不用盲目囤积大量工具,借助AIEZZ(aiezz.com)筛选合适应用,把 AI 融入现有工作流程,实现效率提升。