0.6B 级别开源模型资料汇总

2026-10-01 笔记 · 阅读 1 · 访客 1

说明:本汇总仅收录参数规模在 0.5B–1.2B 之间的开源模型,所有关键数据均标注来源。未找到独立来源的数据不予收录。

1. 模型总览

模型系列代表型号开发者参数规模架构类型上下文窗口许可证
Qwen3Qwen3-0.6B阿里巴巴0.6BDense Transformer32,768 / 40,960Apache 2.0
Qwen2.5Qwen2.5-0.5B阿里巴巴0.5BDense Transformer32,768Apache 2.0
HunyuanHunyuan-0.5B腾讯0.5BDense Transformer256K开源
MobileLLMMobileLLM-600MMeta600M深窄架构—开源
OpenELMOpenELM-270M/450MApple270M/450MDecoder-only—开源
SmolLM2SmolLM2-360MHugging Face360MLlama 架构8,192Apache 2.0
TinyLlamaTinyLlama-1.1B社区1.1BLlama 2 架构2,048Apache 2.0
PythiaPythia-410MEleutherAI410MGPT-NeoX2,048Apache 2.0
OLMoOLMo-1BAI21BDecoder-only4KApache 2.0
Cerebras-GPTCerebras-GPT-111MCerebras111MGPT-3 架构—开源
GPT-NeoGPT-Neo-125MEleutherAI125MGPT-3 架构2,048MIT
H2O-Danube3Danube3-500MH2O.ai500M——开源

2. 各模型关键信息

2.1 Qwen3-0.6B(阿里巴巴)

架构规格(来源:CS 486/686 课程讲义 + ModelHub 模型卡):

  • 参数:0.6B(非嵌入参数 0.44B)
  • 层数:28
  • 隐藏维度:1024
  • FFN 宽度:3072
  • 注意力头:GQA,16 Q / 8 KV
  • 上下文长度:原始训练 32,768,默认最大支持 40,960 tokens
  • 词表大小:约 151,936
  • 许可证:Apache 2.0

备注:Qwen3 系列还包含 1.7B、4B、8B、14B、32B 等 Dense 版本,以及 MoE 版本(30B-A3B、235B-A22B)。

2.2 Qwen2.5-0.5B(阿里巴巴)

架构规格(来源:arXiv 论文 + Hugging Face):

  • 参数:0.5B(非嵌入参数 0.358B,嵌入参数 0.136B)
  • 隐藏维度:896
  • FFN 中间维度:4864
  • 层数:24
  • 注意力:GQA 14:2
  • 许可证:Apache 2.0

备注:Qwen2.5-0.5B 是 Qwen3 之前的主力小模型,社区微调资源丰富。

2.3 Hunyuan-0.5B(腾讯)

架构规格(来源:科技日报 + Hugging Face README):

  • 参数:0.5B
  • 上下文窗口:原生 256K
  • 类型:融合推理模型(支持快思考/慢思考模式)
  • 开源日期:2025年7月30日(预训练版)
  • 适用场景:笔记本电脑、手机、智能座舱、智能家居
  • 许可:开源

关键特性:Agent 能力(任务规划、工具调用、复杂决策)和长文能力是核心亮点,通过强化学习奖励信号设计提升。主流推理框架(SGLang、vLLM、TensorRT-LLM)均支持。

2.4 MobileLLM-600M(Meta)

架构规格(来源:QCon 报道 + arXiv 论文):

  • 参数:600M
  • 架构:深而窄设计,40 层
  • 关键技术:嵌入共享(embedding sharing)+ 分组查询注意力(GQA)
  • 激活函数:SwiGLU
  • 系列版本:125M、350M、600M、1B

设计理念(来源:QCon 报道):

  • 核心发现:对于小模型,加深比加宽更重要。浅层架构(<10 层)在推理任务上表现很差。
  • 嵌入共享对 125M 模型可减少约 11.8% 参数,精度仅下降 0.2 个百分点,节省的参数可用于增加层数。

2.5 OpenELM(Apple)

型号与架构(来源:机器之心 + Hugging Face 模型卡):

  • 变体:270M、450M、1.1B、3B(均有预训练和指令微调版本)
  • 架构:Decoder-only Transformer
  • 核心技术:逐层缩放(layer-wise scaling),每层使用不同的头数和 FFN 维度,实现参数的非均匀分配

技术细节(来源:机器之心):

  • 不使用可学习偏置参数
  • 使用 RMSNorm 预标准化 + RoPE
  • GQA 替代 MHA
  • SwiGLU FFN + FlashAttention
  • 使用与 Llama 相同的 tokenizer

开源范围:完整框架,包括数据准备、训练、微调、评估程序,以及预训练 checkpoint 和训练日志。

2.6 SmolLM2-360M(Hugging Face)

架构规格(来源:Hugging Face 模型配置文件):

  • 参数:360M(实际约 362M)
  • 嵌入维度:960
  • 层数:32
  • 注意力头:15
  • 查询组:5(GQA)
  • 中间维度:2560
  • 块大小:8192
  • 词表大小:49,152
  • 架构:Llama 架构
  • 许可证:Apache 2.0

系列版本:135M、360M、1.7B。

2.7 TinyLlama-1.1B(社区)

架构规格(来源:arXiv 论文):

  • 参数:1.1B
  • 架构:与 Llama 2 完全相同的架构和 tokenizer
  • 训练数据:约 1 万亿 tokens,最多 3 个 epoch
  • 层数:22
  • 许可证:Apache 2.0

项目目标:在 3 万亿 tokens 上预训练 1.1B Llama 模型。由于架构与 Llama 2 完全兼容,可以直接嵌入许多基于 Llama 的开源项目。

2.8 Pythia-410M(EleutherAI)

架构规格(来源:GGUF 元数据 + ModelHub):

  • 参数:410M(实际约 302M 非嵌入参数)
  • 架构:GPT-NeoX
  • 层数:24
  • 隐藏维度:1024
  • 注意力头:16
  • 上下文长度:2,048
  • 词表大小:50,304
  • 训练数据:The Pile
  • 许可证:Apache 2.0

定位:EleutherAI 的可解释性研究套件,提供一系列可控尺寸的检查点。

2.9 OLMo-1B(AI2)

架构规格(来源:fairseq2 文档 + Hugging Face):

  • 参数:1B
  • 上下文长度:4K
  • 架构:Decoder-only Transformer
  • 激活函数:SwiGLU
  • 许可证:Apache 2.0

核心特点:完全开源——不仅开放权重,还发布训练数据、训练代码、中间检查点和训练日志。OLMo-2 版本(2025年4月)增加了 RLVR 微调,增强了数学和推理能力。

2.10 Cerebras-GPT-111M(Cerebras)

架构规格(来源:Hugging Face 模型卡 + arXiv 论文):

  • 参数:111M
  • 层数:10
  • 隐藏维度:768
  • 注意力头:12
  • 中间维度:3072
  • 架构:GPT-3 风格自回归 Transformer

训练特点:遵循 Chinchilla 缩放定律,所有模型按 20 tokens/参数 的最优比例训练。系列涵盖 111M 到 13B。

2.11 GPT-Neo-125M(EleutherAI)

架构规格(来源:Hugging Face 模型卡):

  • 参数:125M
  • 架构:EleutherAI 对 GPT-3 的复现
  • 层数:12
  • 隐藏维度:768
  • 注意力头:12
  • 上下文长度:2,048
  • 训练数据:The Pile

备注:早期开源 GPT 复现项目,已不再积极维护,但作为历史参考仍有价值。

2.12 H2O-Danube3-500M(H2O.ai)

架构规格(来源:H2O 官方公告 + 技术报告):

  • 参数:500M
  • 训练数据:4T tokens
  • 定位:边缘设备,低内存占用,高吞吐低成本

系列版本:500M 和 4B。官方称其性能“超越 Apple,可与 Microsoft 的模型匹敌”。

3. 选型参考

需求场景推荐模型理由
微调生态与社区支持Qwen3-0.6B / Qwen2.5-0.5B教程和工具链最成熟,社区资源最丰富
端侧极致性能MobileLLM-600M“深而窄”架构在子十亿参数中推理能力突出
苹果生态部署OpenELM-270M/450M针对 Apple Silicon 优化,逐层缩放效率高
超长上下文需求Hunyuan-0.5B原生 256K 上下文,Agent 能力领先
低延迟推理SmolLM2-360M块大小 8192,架构精简
学术研究与教学TinyLlama-1.1B / OLMo-1B完全开源,可复现性强
边缘设备低成本部署H2O-Danube3-500M专为边缘设备设计,4T tokens 训练

4. 核心结论

  1. 0.6B 级别模型的共同边界:适合窄而深的任务(格式转换、信息抽取、分类),不适合复杂语义理解、多步推理和开放域问答。

  2. Qwen 系列的综合优势:在微调生态、社区资源和部署灵活性上领先,Qwen3-0.6B 和 Qwen2.5-0.5B 均有丰富的公开微调案例。

  3. 差异化竞争格局:

    • Hunyuan-0.5B 以原生 256K 上下文和 Agent 能力为差异化卖点。
    • MobileLLM-600M 在架构设计上验证了“加深比加宽更重要”的假设。
    • OpenELM 以逐层缩放和完全开源(含训练日志)为特色。
    • SmolLM2-360M 和 H2O-Danube3-500M 面向边缘设备优化。
  4. 生产落地前提:无论选择哪个模型,“模型做语义映射 + 代码做确定性抽取” 的任务拆分策略是确保稳定性和低成本的关键。

5. 数据来源汇总

模型主要来源
Qwen3-0.6BCS 486/686 课程讲义、ModelHub 模型卡、Featherless.ai
Qwen2.5-0.5BarXiv 论文、Hugging Face
Hunyuan-0.5B科技日报报道、Hugging Face README
MobileLLM-600MQCon 报道、arXiv 论文
OpenELM机器之心报道、Hugging Face 模型卡
SmolLM2-360MHugging Face 模型配置文件
TinyLlama-1.1BarXiv 论文、GitHub README
Pythia-410MHugging Face GGUF 元数据、ModelHub
OLMo-1Bfairseq2 文档、Hugging Face
Cerebras-GPT-111MHugging Face 模型卡、arXiv 论文
GPT-Neo-125MHugging Face 模型卡
H2O-Danube3-500MH2O 官方公告、技术报告

提示:以上信息截至搜索结果日期(2026-10-01)。开源模型生态变化较快,建议在 Hugging Face 上确认各模型的最新版本和许可证条款。