跳到正文

#Hugging Face

今日 0 条

研究 · 工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

research6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月6日周二
10月5日周一
  1. Reddit · r/MachineLearning17

    用十亿棋谱蒸馏 Stockfish,3.9B 位置数据集在 Hugging Face 开源

    用户 microscope1024 将 Stockfish 价值函数蒸馏到一个 ResNet/ViT 模型中,训练数据来自 Gigafish 的一亿个棋谱位置,对应的 39 亿位置完整数据集已在 Hugging Face 上发布,由 Lichess 37 个月对局生成;实验发现纯 ViT 难以理解棋盘,CNN 凭借归纳偏置训练初期表现更好,CNN 与 ViT 结合时效果最佳。

10月2日周五
  1. Hugging Face Blog44

    AutoSynthData:为企业 AI 智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData 系统,利用目标模型的失败和更强教师的成功来识别能力差距,并据此生成验证过的训练任务。系统首先诊断模型在特定环境中的薄弱环节,然后将能力差距转化为多样化、可执行的训练任务,用于模型后训练。AutoSynthData 在 EnterpriseOps Gym 环境中进行演示,并发布了对应的数据集。

  2. Reddit · r/MachineLearning35

    Jev 与 Laya 置信度评分模型基准测试

    作者对 TypeSafe AI 托管的 Jev 1.13.0 和开源的 Laya 两款小规模置信度评分分类模型进行了评估。Jev 的 ECE 为 0.013,Laya 为 0.486;通过将 AML 标签描述从意图改为交易特征,准确率从 65% 提升至 77%。结果表明校准质量决定阈值策略效果:Jev 在 90% 置信度阈值下准确率从 92.3% 提升至 97.6%,覆盖 82% 案例。

10月1日周四
8月25日周二
  1. Hugging Face Blog66

    Quantization-Aware Healing:压缩到 4-bit 的模型如何超越其原始全精度版本

    提出 Quantization-Aware Healing(QAH)方法,针对经过结构压缩和量化后的 LLM 进行恢复训练。核心改变是直接从原始全精度模型蒸馏,而非从恢复后的 bf16 检查点蒸馏。

    推荐理由:原文给出具体实验数据:4-bit QAH 模型在 7/9 基准上超越 16-bit 源头模型,4 倍权重内存节省。这为压缩模型的恢复训练提供了可迁移的方法思路。

8月21日周五
8月14日周五
8月10日周一
  1. Hugging Face Blog65

    如何让知识蒸馏便宜到足以大规模运行

    知识蒸馏需要同时加载教师和学生模型,显存需求极高。论文提出两种系统改进:缓存教师模型的 top-100 logits 避免其常驻内存,以及新的分块 KL 散度损失函数避免实例化完整的词汇表×序列长度矩阵。

    推荐理由:给出了具体的显存峰值对比数据,读者可以据此判断该方法对自己硬件条件下的可行性。

7月30日周四
7月21日周二
  1. Hugging Face Blog70

    Hugging Face 开源 Grabette:手持式机器人操作数据采集系统

    Hugging Face 发布 Grabette,一款开源手持式机器人操作数据采集系统。用户可用手持夹持器记录人类演示,自动转换为 LeRobot 格式的数据集用于训练机器人策略。

    推荐理由:原文给出了具体的硬件成本 BOM、配套的 Gripette 机械爪和 LeRobot 训练流程,读者可以据此判断这个数据采集方案是否适合自己的机器人学习项目。

7月1日周三
6月30日周二
  1. Hugging Face Blog19

    为什么专业化对于 AI 是不可避免的

    优化理论、进化生物学和竞争市场共同预测专业化是AI系统的必然选择。Goldfeder、Wyder、LeCun和Shwartz-Ziv的2026年论文引用Wolpert与Macready 1997年的定理证明,没有通用优化算法能在所有问题上胜出,资源有限时集中能力必然优于分散能力。该论文指出“通用性是理论概念,实际中是神话”,生物学和市场竞争同样通过选择机制淘汰无法在特定领域达到性能门槛的实体。