Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective· 重新思考异质大模型合并
Can large language models with substantially different parameter spaces be merged by direct weighted averaging, without training or semantic alignment? Existing heterogeneous fusion methods typically introduce distillation, adapters, learned latent spaces, routing, or feature alignment, leaving open whether a simpler recipe can work for genuinely different billion-parameter checkpoints. We revisit this counterintuitive question through training-free dimensional adaptation followed by ratio-controlled interpolation. In union-style merging, we expand the smaller model into the larger parameter space; in intersection-style merging, we truncate the larger model into the smaller parameter space. Across Qwen-family model pairs and benchmarks covering mathematical reasoning, code generation, lang
研究了直接加权平均异质大模型的可行性。
- 核心方法
- 提出了两种模型合并方法:联合样合并(将小模型扩展到大模型的参数空间)和交集样合并(将大模型截断到小模型的参数空间);通过无训练的维度适应和比例控制插值实现模型合并。
- 适合谁读
- 研究者 / 工程师
- 要解决的问题
- 探讨如何不经训练或语义对齐直接合并参数空间显著不同的大语言模型。
- 关键实验
- 在Qwen系列模型对和涵盖数学推理、代码生成等任务的基准测试上进行了实验。
- 主要贡献
- 证明了直接加权平均异质大模型在某些任务上的有效性和可能性。
- 意义与局限
- 为异质大模型的简单高效合并提供了新思路;可能减少模型合并的计算成本;局限在于未普遍适用于所有类型的大模型。