跳到正文
热点事件持续更新

Strix Halo NPU 加速本地编码代理工具链实测

1 篇报道1 个报道来源11 小时前更新

先了解这件事

AI 综述

一名用户在 r/LocalLLaMA 展示了利用 AMD Strix Halo 闲置 XDNA2 NPU 加速本地 coding agent 的工具链 Halogen。Halogen 0.16+ 将 NPU 暴露为 OpenAI 风格接口,作者将其中四个模型接入真实编码代理工作流。最新发布的 0.17.1 版本进一步优化性能,使 NPU 调用延迟相比 0.16 降低约 30 倍,解码速度提升约 40%。测试中,联合投机解码实现双流聚合吞吐 72.7 tok/s,串行解码 59.6 tok/s,prefill 约 1,300 tok/s。报道为单一来源的用户实测分享,未提供与早期版本或其他工具的对比细节。

AI 根据报道生成 · 10 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. Reddit · r/LocalLLaMA
    利用 Strix Halo NPU 加速本地 coding agent:Halogen 0.17.1 实测

    Halogen 0.16+ 将闲置的 XDNA2 NPU 暴露为 OpenAI 风格接口,作者将其中四个模型接入真实 coding agent。0.17.1 让 NPU 调用延迟降低约 30 倍,解码速度提升约 40%;联合投机解码使双流聚合吞吐达 72.7 tok/s,串行解码 59.6 tok/s,prefill 约 1,300 tok/s。

本事件热度走势

当前热度 8·可比范围峰值 10(10月8日 05:00)·近 24 小时可比范围变化 –

02.557.51010月8日05:0010月8日08:0010月8日11:0010月8日14:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。