0.6B 级别开源模型资料汇总
2026-10-01 笔记 · 阅读 1 · 访客 1
说明:本汇总仅收录参数规模在 0.5B–1.2B 之间的开源模型,所有关键数据均标注来源。未找到独立来源的数据不予收录。
1. 模型总览
| 模型系列 | 代表型号 | 开发者 | 参数规模 | 架构类型 | 上下文窗口 | 许可证 |
|---|---|---|---|---|---|---|
| Qwen3 | Qwen3-0.6B | 阿里巴巴 | 0.6B | Dense Transformer | 32,768 / 40,960 | Apache 2.0 |
| Qwen2.5 | Qwen2.5-0.5B | 阿里巴巴 | 0.5B | Dense Transformer | 32,768 | Apache 2.0 |
| Hunyuan | Hunyuan-0.5B | 腾讯 | 0.5B | Dense Transformer | 256K | 开源 |
| MobileLLM | MobileLLM-600M | Meta | 600M | 深窄架构 | — | 开源 |
| OpenELM | OpenELM-270M/450M | Apple | 270M/450M | Decoder-only | — | 开源 |
| SmolLM2 | SmolLM2-360M | Hugging Face | 360M | Llama 架构 | 8,192 | Apache 2.0 |
| TinyLlama | TinyLlama-1.1B | 社区 | 1.1B | Llama 2 架构 | 2,048 | Apache 2.0 |
| Pythia | Pythia-410M | EleutherAI | 410M | GPT-NeoX | 2,048 | Apache 2.0 |
| OLMo | OLMo-1B | AI2 | 1B | Decoder-only | 4K | Apache 2.0 |
| Cerebras-GPT | Cerebras-GPT-111M | Cerebras | 111M | GPT-3 架构 | — | 开源 |
| GPT-Neo | GPT-Neo-125M | EleutherAI | 125M | GPT-3 架构 | 2,048 | MIT |
| H2O-Danube3 | Danube3-500M | H2O.ai | 500M | — | — | 开源 |
2. 各模型关键信息
2.1 Qwen3-0.6B(阿里巴巴)
架构规格(来源:CS 486/686 课程讲义 + ModelHub 模型卡):
- 参数:0.6B(非嵌入参数 0.44B)
- 层数:28
- 隐藏维度:1024
- FFN 宽度:3072
- 注意力头:GQA,16 Q / 8 KV
- 上下文长度:原始训练 32,768,默认最大支持 40,960 tokens
- 词表大小:约 151,936
- 许可证:Apache 2.0
备注:Qwen3 系列还包含 1.7B、4B、8B、14B、32B 等 Dense 版本,以及 MoE 版本(30B-A3B、235B-A22B)。
2.2 Qwen2.5-0.5B(阿里巴巴)
架构规格(来源:arXiv 论文 + Hugging Face):
- 参数:0.5B(非嵌入参数 0.358B,嵌入参数 0.136B)
- 隐藏维度:896
- FFN 中间维度:4864
- 层数:24
- 注意力:GQA 14:2
- 许可证:Apache 2.0
备注:Qwen2.5-0.5B 是 Qwen3 之前的主力小模型,社区微调资源丰富。
2.3 Hunyuan-0.5B(腾讯)
架构规格(来源:科技日报 + Hugging Face README):
- 参数:0.5B
- 上下文窗口:原生 256K
- 类型:融合推理模型(支持快思考/慢思考模式)
- 开源日期:2025年7月30日(预训练版)
- 适用场景:笔记本电脑、手机、智能座舱、智能家居
- 许可:开源
关键特性:Agent 能力(任务规划、工具调用、复杂决策)和长文能力是核心亮点,通过强化学习奖励信号设计提升。主流推理框架(SGLang、vLLM、TensorRT-LLM)均支持。
2.4 MobileLLM-600M(Meta)
架构规格(来源:QCon 报道 + arXiv 论文):
- 参数:600M
- 架构:深而窄设计,40 层
- 关键技术:嵌入共享(embedding sharing)+ 分组查询注意力(GQA)
- 激活函数:SwiGLU
- 系列版本:125M、350M、600M、1B
设计理念(来源:QCon 报道):
- 核心发现:对于小模型,加深比加宽更重要。浅层架构(<10 层)在推理任务上表现很差。
- 嵌入共享对 125M 模型可减少约 11.8% 参数,精度仅下降 0.2 个百分点,节省的参数可用于增加层数。
2.5 OpenELM(Apple)
型号与架构(来源:机器之心 + Hugging Face 模型卡):
- 变体:270M、450M、1.1B、3B(均有预训练和指令微调版本)
- 架构:Decoder-only Transformer
- 核心技术:逐层缩放(layer-wise scaling),每层使用不同的头数和 FFN 维度,实现参数的非均匀分配
技术细节(来源:机器之心):
- 不使用可学习偏置参数
- 使用 RMSNorm 预标准化 + RoPE
- GQA 替代 MHA
- SwiGLU FFN + FlashAttention
- 使用与 Llama 相同的 tokenizer
开源范围:完整框架,包括数据准备、训练、微调、评估程序,以及预训练 checkpoint 和训练日志。
2.6 SmolLM2-360M(Hugging Face)
架构规格(来源:Hugging Face 模型配置文件):
- 参数:360M(实际约 362M)
- 嵌入维度:960
- 层数:32
- 注意力头:15
- 查询组:5(GQA)
- 中间维度:2560
- 块大小:8192
- 词表大小:49,152
- 架构:Llama 架构
- 许可证:Apache 2.0
系列版本:135M、360M、1.7B。
2.7 TinyLlama-1.1B(社区)
架构规格(来源:arXiv 论文):
- 参数:1.1B
- 架构:与 Llama 2 完全相同的架构和 tokenizer
- 训练数据:约 1 万亿 tokens,最多 3 个 epoch
- 层数:22
- 许可证:Apache 2.0
项目目标:在 3 万亿 tokens 上预训练 1.1B Llama 模型。由于架构与 Llama 2 完全兼容,可以直接嵌入许多基于 Llama 的开源项目。
2.8 Pythia-410M(EleutherAI)
架构规格(来源:GGUF 元数据 + ModelHub):
- 参数:410M(实际约 302M 非嵌入参数)
- 架构:GPT-NeoX
- 层数:24
- 隐藏维度:1024
- 注意力头:16
- 上下文长度:2,048
- 词表大小:50,304
- 训练数据:The Pile
- 许可证:Apache 2.0
定位:EleutherAI 的可解释性研究套件,提供一系列可控尺寸的检查点。
2.9 OLMo-1B(AI2)
架构规格(来源:fairseq2 文档 + Hugging Face):
- 参数:1B
- 上下文长度:4K
- 架构:Decoder-only Transformer
- 激活函数:SwiGLU
- 许可证:Apache 2.0
核心特点:完全开源——不仅开放权重,还发布训练数据、训练代码、中间检查点和训练日志。OLMo-2 版本(2025年4月)增加了 RLVR 微调,增强了数学和推理能力。
2.10 Cerebras-GPT-111M(Cerebras)
架构规格(来源:Hugging Face 模型卡 + arXiv 论文):
- 参数:111M
- 层数:10
- 隐藏维度:768
- 注意力头:12
- 中间维度:3072
- 架构:GPT-3 风格自回归 Transformer
训练特点:遵循 Chinchilla 缩放定律,所有模型按 20 tokens/参数 的最优比例训练。系列涵盖 111M 到 13B。
2.11 GPT-Neo-125M(EleutherAI)
架构规格(来源:Hugging Face 模型卡):
- 参数:125M
- 架构:EleutherAI 对 GPT-3 的复现
- 层数:12
- 隐藏维度:768
- 注意力头:12
- 上下文长度:2,048
- 训练数据:The Pile
备注:早期开源 GPT 复现项目,已不再积极维护,但作为历史参考仍有价值。
2.12 H2O-Danube3-500M(H2O.ai)
架构规格(来源:H2O 官方公告 + 技术报告):
- 参数:500M
- 训练数据:4T tokens
- 定位:边缘设备,低内存占用,高吞吐低成本
系列版本:500M 和 4B。官方称其性能“超越 Apple,可与 Microsoft 的模型匹敌”。
3. 选型参考
| 需求场景 | 推荐模型 | 理由 |
|---|---|---|
| 微调生态与社区支持 | Qwen3-0.6B / Qwen2.5-0.5B | 教程和工具链最成熟,社区资源最丰富 |
| 端侧极致性能 | MobileLLM-600M | “深而窄”架构在子十亿参数中推理能力突出 |
| 苹果生态部署 | OpenELM-270M/450M | 针对 Apple Silicon 优化,逐层缩放效率高 |
| 超长上下文需求 | Hunyuan-0.5B | 原生 256K 上下文,Agent 能力领先 |
| 低延迟推理 | SmolLM2-360M | 块大小 8192,架构精简 |
| 学术研究与教学 | TinyLlama-1.1B / OLMo-1B | 完全开源,可复现性强 |
| 边缘设备低成本部署 | H2O-Danube3-500M | 专为边缘设备设计,4T tokens 训练 |
4. 核心结论
-
0.6B 级别模型的共同边界:适合窄而深的任务(格式转换、信息抽取、分类),不适合复杂语义理解、多步推理和开放域问答。
-
Qwen 系列的综合优势:在微调生态、社区资源和部署灵活性上领先,Qwen3-0.6B 和 Qwen2.5-0.5B 均有丰富的公开微调案例。
-
差异化竞争格局:
- Hunyuan-0.5B 以原生 256K 上下文和 Agent 能力为差异化卖点。
- MobileLLM-600M 在架构设计上验证了“加深比加宽更重要”的假设。
- OpenELM 以逐层缩放和完全开源(含训练日志)为特色。
- SmolLM2-360M 和 H2O-Danube3-500M 面向边缘设备优化。
-
生产落地前提:无论选择哪个模型,“模型做语义映射 + 代码做确定性抽取” 的任务拆分策略是确保稳定性和低成本的关键。
5. 数据来源汇总
| 模型 | 主要来源 |
|---|---|
| Qwen3-0.6B | CS 486/686 课程讲义、ModelHub 模型卡、Featherless.ai |
| Qwen2.5-0.5B | arXiv 论文、Hugging Face |
| Hunyuan-0.5B | 科技日报报道、Hugging Face README |
| MobileLLM-600M | QCon 报道、arXiv 论文 |
| OpenELM | 机器之心报道、Hugging Face 模型卡 |
| SmolLM2-360M | Hugging Face 模型配置文件 |
| TinyLlama-1.1B | arXiv 论文、GitHub README |
| Pythia-410M | Hugging Face GGUF 元数据、ModelHub |
| OLMo-1B | fairseq2 文档、Hugging Face |
| Cerebras-GPT-111M | Hugging Face 模型卡、arXiv 论文 |
| GPT-Neo-125M | Hugging Face 模型卡 |
| H2O-Danube3-500M | H2O 官方公告、技术报告 |
提示:以上信息截至搜索结果日期(2026-10-01)。开源模型生态变化较快,建议在 Hugging Face 上确认各模型的最新版本和许可证条款。