热点事件观察中
闭式轨迹权重嫁接:Qwen3.5 4B能力迁至0.8B
2 篇报道1 个报道来源2 天前更新
先了解这件事
AI 综述
2026年10月6日,Reddit r/LocalLLaMA研究者披露一项将Qwen 3.5 4B能力迁移到0.8B学生模型的工作。该方法跳过反向传播,采用闭式轨迹匹配,通过正则化最小二乘与谱投影,将4B教师模型层间隐藏状态轨迹直接对齐到0.8B模型上,属于一次性权重嫁接。起初编辑全部24层时,模型负对数似然(NLL)暴涨64.78%,出现中间层崩溃。后续报道指出,研究者改用仅4个锚点块的方案进行修复。同日17:41的进一步报道披露,该方法被称为DynamicTune,可在约12分钟内在消费级硬件上完成,且Qwen3.5-0.8B经该方法处理后在ARC-Challenge基准上超越了2B模型。整体来看,闭式轨迹嫁接在能力迁移上具备可行性,但全层编辑会破坏表征稳定性,需要借助稀疏锚点策略才能恢复并提升性能。
AI 根据报道生成 · 2 天前更新
最新进展10月6日 17:41
DynamicTune闭式权重手术12分钟完成,Qwen3.5-0.8B在ARC-Challenge上超越2B模型。报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- Reddit · r/LocalLLaMADynamicTune 用闭式权重手术让 Qwen3.5-0.8B 在 ARC-Challenge 上超越 2B 模型
DynamicTune 提出一种无需反向传播的闭式权重手术方法,仅用约 12 分钟在消费级硬件上把 4B 模型的轨迹动力学迁移进 Qwen3.5-0.8B 学生模型。
- Reddit · r/LocalLLaMA用闭式轨迹权重手术把 Qwen 3.5 4B 能力迁移到 0.8B:中间层为何崩溃及 4 个锚点块如何修复
研究者提出一种跳过反向传播的闭式轨迹匹配方法,通过正则化最小二乘和谱投影直接把 Qwen 3.5 4B 的层间隐藏状态轨迹迁移到 0.8B 学生模型;起初编辑全部 24 层导致 NLL 暴涨 64.78%。
本事件热度走势
当前热度 3·可比范围峰值 10(10月6日 19:00)·近 24 小时可比范围变化 -50%
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。