WeLM Blog

WeLM Blog

探索大语言模型的智能边界WeLM Blog 由微信 AI 团队发布,分享 WeLM 系列在资源效率、模型架构、预训练、后训练与推理能力方面的研究笔记和系统设计实践。

WeLM Blog 页面快照
4
当前公开研究文章
80B-A3B
稀疏 MoE 模型规模示例
130B
深度扩展模型变体规模
258B
WeLM-258B MoE 模型规模
研究方向

围绕模型能力与系统效率展开实践

从潜空间计算、序列长度扩展到稀疏 MoE 和大模型后训练,集中呈现 WeLM 系列的技术探索。

研究笔记发布

发布 WeLM 系列关于大语言模型训练、架构设计与系统实践的研究文章。

潜空间计算扩展

介绍 Hidden Decoding 方法,探索通过增加有效计算量提升模型能力的路径。

稀疏 MoE 架构

分享在有限资源下构建高效稀疏 Mixture of Experts 模型的架构设计与实践经验。

模型后训练实践

以 WeLM-258B MOE 模型为例,介绍后训练阶段的流程与关键实践。

研究动态

近期发布的 WeLM 系列文章

浏览公开的研究进展、模型设计经验与训练实践记录。

Hidden Decoding at Scale:面向前沿大模型的潜空间计算扩展

介绍前沿模型在复杂推理、代码生成与通用对话等能力上的潜空间计算扩展进展。

Hidden Decoding: 在预训练中扩展序列长度

介绍通过复制多份 Vocab Embedding 扩展序列长度的方法,并分享基于 Qwen3-8B 的 Dense 模型及本地部署相关信息。

初探 WeLM-258B MOE 模型后训练

以 WeLM-V3-258B-A22B 为例,分享团队在后训练阶段的流程与关键实践。

以适度资源构建高效稀疏 MoE 模型

分享使用不足 14T tokens 语料训练 80B-A3B MoE 模型,并通过深度扩展获得 130B 变体的实践观察。

公开入口

按语言与文章主题阅读

通过官方页面进入中文或英文站点,并阅读各篇研究笔记的完整内容。

WeLM Blog

从这里开始使用WeLM Blog。