EN
AI模型

主流开放权重模型横评:Llama 4、Qwen3、DeepSeek、Mistral、Gemma 4 与 gpt-oss 怎么选

从参数规模、激活参数、上下文、多模态、许可证、硬件门槛和实际任务表现,对比六大主流开放权重模型,并给出本地部署与企业选型建议。

Jacky Wang 7 分钟阅读 52 阅读

如果只看参数量,2026 年的开放权重模型几乎已经失去可比性。同样写着“百亿”或“千亿参数”,有的每次只激活 5B,有的把条件记忆模块也计入总参数;有的能在一张 80GB GPU 上运行,有的则更适合多机集群。真正影响选型的,是激活参数、上下文、模态、许可证、推理框架,以及模型在你的任务链里能否稳定工作。

下面这份横评以截至 2026 年 9 月 29 日可获得的官方模型卡和发布说明为准,对比六个有代表性的开放权重模型:Meta Llama 4 Maverick、Qwen3 235B-A22B、DeepSeek V4.1 Flash、Mistral Small 4、Gemma 4 12B 与 OpenAI gpt-oss-120b。

先说明一个容易混淆的概念:本文使用“开放权重模型”,而不是把所有模型都笼统称为“开源模型”。Apache 2.0、MIT 与 Meta 的 Llama Community License 在再分发、商业使用和附加条款上并不相同;能下载权重,不代表它符合严格的开源定义。

核心参数一览

模型 总参数 / 激活参数 上下文 输入模态 许可证 更适合的场景
Llama 4 Maverick 约 400B / 17B 1M 文本、图像 Llama 4 Community License 成熟生态、长上下文、多模态应用
Qwen3 235B-A22B 235B / 22B 128K 文本 Apache 2.0 中文、推理、代码与企业二次开发
DeepSeek V4.1 Flash 552B 主干;含条件记忆约 763B / 预填充 8B、解码 16B 1M 文本、图像 MIT 长上下文、多模态 Agent、复杂推理
Mistral Small 4 119B / 6.5B 256K 文本、图像 Apache 2.0 低激活成本、工具调用、私有部署
Gemma 4 12B 12B 256K 文本、图像、音频 Apache 2.0 工作站、本地多模态、原型验证
gpt-oss-120b 117B / 5.1B 128K 文本 Apache 2.0 + 使用政策 推理、工具调用、单机 80GB GPU 部署
参数口径来自各厂商模型卡。MoE、条件记忆和多阶段推理的统计方式不同,不能只按“总参数”排座次。

性能怎么比:别把不同厂商的跑分硬拼成排行榜

公开模型卡里的数字值得参考,但不适合直接做一张“谁第一”的总榜。原因很现实:评测版本、提示词、采样参数、推理预算、工具权限和评测框架都可能不同。比如 Meta 为 Llama 4 Maverick 报告了 MMLU-Pro 80.5、LiveCodeBench 43.4 和 MMMU 73.4;Google 为 Gemma 4 12B 报告了 MMLU-Pro 77.2、LiveCodeBench v6 72.0 与 GPQA Diamond 78.8。数字看起来能横向排列,但 LiveCodeBench 的版本和运行条件已经不同。

DeepSeek 的模型卡则把重点放在 Agent 和工程任务上:DeepSWE v1.1 为 74.2,Terminal-Bench 2.1 为 90.6;Mistral 强调 Small 4 在三项内部选定的评测中与 gpt-oss 竞争,同时主打相较上一代的延迟和吞吐改进。这些都是厂商报告结果,更适合用来判断研发方向,而不是替代你自己的回归测试。

真正有用的比较方式,是先固定业务任务,再统一量化精度、推理引擎、提示模板、上下文长度和硬件,至少测四件事:

  1. 质量:在你的真实问题集上,答案是否正确、完整、可复现。
  2. 延迟:首 token 时间和完整响应时间,而不只是实验室吞吐。
  3. 稳定性:长上下文、结构化输出和工具调用是否容易失控。
  4. 单位成本:达到目标质量时,每百万 token、每个任务或每次 Agent 运行的真实成本。

六款模型各自强在哪里

Llama 4 Maverick:生态仍是最大资产

Maverick 是典型的“大总量、低激活”MoE:约 400B 总参数,每个 token 激活 17B,并提供 1M 上下文与原生图文输入。它的优势不只是模型本身,而是围绕 Llama 建立的量化、推理、微调和部署生态。许多团队已有现成的 Llama 工具链,迁移成本低于更换整个技术栈。

但许可证必须单独审查。Llama 4 Community License 不是 Apache 2.0,并包含品牌、再分发及超大规模产品的附加条件。面向外部客户的商业产品,不能只因为“权重可下载”就跳过法务评估。

Qwen3 235B-A22B:中文与工程落地的均衡选手

Qwen3 235B-A22B 有 235B 总参数、22B 激活参数、128 个专家且每次激活 8 个。它支持思考与非思考两种模式,适合把同一套模型用于快速问答和高推理预算任务。Apache 2.0 许可证也降低了企业二次开发和私有部署的阻力。

如果核心场景是中文知识问答、代码生成、数据分析或工具调用,Qwen3 值得进入第一轮实测。对于单机部署,不必执着于旗舰版;30B-A3B 等更小的 MoE 版本,往往能以更合理的显存成本完成大部分业务。

DeepSeek V4.1 Flash:参数口径最需要看懂

DeepSeek V4.1 Flash 的模型卡给出 552B 主干参数;若把 Engram 条件记忆模块计入,总量约 763B。它在预填充阶段激活约 8B、解码阶段约 16B,并把上下文扩展到 1M。这个结构说明了为什么“总参数最大”不等于“每个 token 都最贵”。

它原生支持文本与图像输入,还提供 1 到 100 的可控推理强度。对多步骤 Agent、代码仓库理解和超长资料分析很有吸引力。不过,大规模权重的存储、分片、KV Cache 和高并发调度依然考验基础设施;低激活参数并不会自动消除部署复杂度。

Mistral Small 4:把能力密度放在首位

Mistral Small 4 用 119B 总参数、6.5B 激活参数覆盖 256K 上下文,并把推理、指令遵循、图像理解和函数调用整合到一个 Apache 2.0 模型里。128 个专家中每次激活 4 个,使它在自托管场景中呈现出很高的能力密度。

它不是面向笔记本的轻量模型,但对希望在企业 GPU 集群里同时运行客服、文档理解和 Agent 工作流的团队,比一味追求数百亿激活参数更务实。

Gemma 4 12B:本地多模态的实用派

Gemma 4 12B 的定位和前几款不同:它不追求最大参数,而是把文本、图像、音频输入与 256K 上下文塞进更容易落地的 12B 级模型。Google 表示它可以在具备 16GB 显存或统一内存的开发者工作站上运行,这让它很适合本地原型、隐私敏感应用和端侧前置处理。

它的上限未必能替代最大型 MoE,但在“足够好、部署快、模态多”这个三角里很有竞争力。对于需要处理会议音频、产品图片和文本资料的内部工具,Gemma 4 往往比纯文本旗舰更贴近问题本身。

gpt-oss-120b:为推理与工具调用设计

gpt-oss-120b 有 117B 总参数、每个 token 激活 5.1B,使用 128 个专家、每次激活 4 个,支持 128K 上下文。OpenAI 采用 MXFP4 量化,使其可装入单张 80GB GPU;更小的 gpt-oss-20b 则面向约 16GB 内存级设备。

它是文本模型,优势集中在推理、结构化输出和工具使用。Apache 2.0 对商业部署友好,但仍应同时阅读其使用政策。若产品高度依赖音频或图像理解,它更适合作为后端推理核心,而不是单模型包办全部模态。

按需求选,而不是按榜单选

  • 中文、代码与企业二次开发:优先测试 Qwen3;旗舰用于服务端,小版本用于成本敏感场景。
  • 1M 长上下文与多模态 Agent:比较 DeepSeek V4.1 Flash 和 Llama 4 Maverick,同时把集群复杂度与许可证算进成本。
  • Apache 2.0、工具调用和私有化:Mistral Small 4 与 gpt-oss-120b 都值得进入 PoC。
  • 本地工作站上的图像与音频:Gemma 4 12B 是六款中最明确的轻量多模态选择。
  • 现有 Llama 技术栈:Maverick 的生态兼容性可能比小幅跑分差异更值钱,但先完成许可证审查。

准备自托管时,可以先阅读本站的 Runpod GPU 云平台部署指南;如果希望了解本地推理工具链,可参考 llama.cpp 入门介绍。无论选哪款模型,先用 50 到 200 个真实业务样本建立小型评测集,比追逐公开榜单更快接近正确答案。

结论

这一代开放权重模型已经分成几条清晰路线:Llama 4 押注生态与百万上下文,Qwen3 强调中文和混合推理,DeepSeek 用条件记忆与低激活架构挑战超长任务,Mistral 追求能力密度,Gemma 4 把多模态带到本地工作站,gpt-oss 则聚焦可部署的推理与工具调用。

所以,2026 年选模型最不该问的是“谁参数最大”,而应该问:在我的数据、硬件、许可证边界和延迟预算里,谁能最稳定地完成任务?参数表只能帮你缩小候选范围,最终答案仍然来自同条件下的业务评测。

主要资料来源

注:本文中的基准成绩均为厂商在各自模型卡中披露的结果。模型版本、评测框架和推理预算不同,不构成严格的同条件排行榜。

发表评论