跳到正文
原文
Hacker News · 首页· nicowaltz·· 9 天前AI 评分55

Jeeves:基于 Qwen3.5-9B 的推理决策模型

Jeeves. Reasoning improves Jev-like decision models

AI 导读

Jeeves 是基于 Qwen3.5-9B 的决策模型,使用 SFT 和 CISPO 训练,配备块-4 扩散起草器。在 MMLU 上达到 0.793,MMLU-Pro 达到 0.739。通过扩散起草器实现 1.6-1.76 倍推理加速,批处理时可达约 960 链 token/秒。模型现已开源,提供完整的训练和推理代码。

来源:Hacker News · 首页 · github.com