跳到正文

交叉发现

今日 8 条

研究 · 工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

research6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月5日周一
  1. Reddit · r/MachineLearning17

    用十亿棋谱蒸馏 Stockfish,3.9B 位置数据集在 Hugging Face 开源

    用户 microscope1024 将 Stockfish 价值函数蒸馏到一个 ResNet/ViT 模型中,训练数据来自 Gigafish 的一亿个棋谱位置,对应的 39 亿位置完整数据集已在 Hugging Face 上发布,由 Lichess 37 个月对局生成;实验发现纯 ViT 难以理解棋盘,CNN 凭借归纳偏置训练初期表现更好,CNN 与 ViT 结合时效果最佳。

  2. Reddit · r/artificial43

    AI 发现44个可能隐藏类地行星的恒星系统

    伯尔尼大学与瑞士国家行星科学能力中心(NCCR PlanetS)开发的AI模型识别出44个已知的恒星系统,可能隐藏未发现的类地行星。该模型在模拟行星系统上测试达到最高99%的精确度,但这些预测的行星尚未被观测验证,其方法价值取决于后续观测。

10月3日周六
  1. The Decoder40

    DeepMind 研究人员提出"人工共生智能"作为奇点的替代方案

    DeepMind 研究人员提出"人工共生智能"概念,将智能视为社会现象而非个体特质,挑战由单一超级智能驱动的"奇点"理论。研究分析 DeepSeek-R1 和 QwQ-32B 等推理模型的思维痕迹,发现它们自发形成多视角内部辩论行为。在该框架下,AI 智能体是可分解组合的临时 bundle,伴随生物脑与合成脑力量对比的历史性转变,需建立专门协调人与智能体协作的制度框架。

  2. The Decoder71

    BootLoops 发布:支持 AI 模型进行精确科学计算

    哈佛大学物理学教授 Matthew Schwartz 开发了开源工具 BootLoops,让 Claude 可以在科学研究中进行精确计算。该工具在三个月内产出了 36 篇论文,涵盖粒子物理学、生态学、群体遗传学、经济学和语言学等领域。Schwartz 指出,AI 虽然能快速解决计算问题,但科学价值仍需领域专家来把握方向;模型存在过早宣布成功、难以判断任务复杂度等局限。

  3. The Decoder63

    研究:AI 智能体从照片构建 3D 场景但缺乏自我判断能力

    研究人员提出 LEGO-Anything 系统,让编码智能体接收单张照片后编写 Blender 代码迭代构建 3D 场景,并推出 LEGO-Bench 基准测试进行评估。GPT-6 Astra 在室内场景达到 53.4%、户外场景达到 39.6% 的准确率。研究发现智能体即使在推理预算增加后分数大幅提升,其几何判断能力仍接近随机水平,无法准确评估自身输出的质量,这是当前方法的主要瓶颈。

  4. Hacker News · 首页16

    理解前沿人工智能

    本文探讨前沿人工智能的核心概念与技术特征。前沿AI指具备最先进推理、规划和多模态处理能力的大语言模型,代表当前AI发展的最高水平。

  5. Reddit · r/artificial38

    大语言模型为何使用第一人称代词"I"和"me"?

    业界认为大语言模型只是算法机器,没有道德地位或意识,但模型却使用"I"和"me"等第一人称代词。若坚持算法机器的立场,第一人称表述在语言上并不准确,企业和公众几十年来都正常使用工具产品,无需拟人化。

  6. Reddit · r/MachineLearning33

    机器人演示数据中手部追踪丢失插入阶段时的评估方法讨论

    机器人演示数据收集时,手部追踪器常在电缆插入瞬间因遮挡而丢失追踪,导致姿态标签出现关键间隙。论文MEgoVista提供了检测精度、召回率、F1和重建误差等评估指标,并采用将错误分配给漏检而非排除的协议;HaPTIC在多人捕捉场景中未能产生有效输出。作者建议按接近、接触、撤回阶段分别报告覆盖范围及接触期间最长连续间隙,以更全面评估数据可用性。

  7. Reddit · r/artificial55

    瑞典 Chalmers 大学开发可自主设计并执行实验的 AI 系统

    瑞典 Chalmers 大学研究人员开发了一个闭环 AI 系统,可生成生物假设、决定测试方法、将计划转换为机器可读指令、分析实验结果并利用发现改进后续问题。该系统在酵母菌(Saccharomyces cerevisiae)上进行了测试,将大语言模型与形式逻辑、生物数据库、机器学习、自动细胞培养和质谱技术相结合,研究成果发表于《皇家学会界面杂志》。

  8. Hacker News · 首页41

    Jev 校准精度分析

    TypeSafe 新推出的 Jev“System One”分类器模型在物理分布测试中校准效果不佳。以 Total Variation 距离评估 10 种概率分布,Jev 得分为 0.518,略低于完全猜测的 0.546 分底限;均匀分布达 0.77,泊松分布为 0.65。实验成本极低,整个评测仅花费不到 4 美元。

  9. Reddit · r/MachineLearning30

    动态系统重建中的拓扑域外泛化

    研究解决动态系统重建(DSR)和时间序列预测(TSF)中的拓扑域外泛化(OODG)难题,即动态机制从周期性转变为混沌等情形。通过引入特征分割和物理稀疏先验,改进的分层 DSR 模型能在未知控制参数的情况下正确预测分叉及分叉后动态。该方法对浅层 PLRNN 和 Neural ODE 均适用。

10月2日周五
  1. Reddit · r/artificial40

    Claude 形状的科学:正确的计算仍然需要一个有价值的问题

    Anthropic 发布客座文章,讨论 BootLoots 工具在跨领域定量研究中的应用,指出许多技术正确的研究结果只有在领域专家重新定义问题后才变得有意义。作者强调可复现代码只能验证计算准确性,但无法判断研究的相关性或新颖性;区分"计算正确"与"有价值的发现"对 AI 研究助手至关重要。

  2. Reddit · r/LocalLLaMA58

    无需VRAM检测本地模型幻觉:1.5B到120B模型测试结果

    作者测试了一种零GPU消耗的幻觉检测方法(Spanda,基于确定性字符串规范化+香农熵),在GSM8K和TriviaQA上对1.5B到120B模型基准测试。结果显示:Qwen 1.5B的AUROC仅0.58(语法太松散),Mistral 7B达0.71(与重型DeBERTa NLI模型相当),Qwen 27B达0.89(精确匹配主导)。

  3. Hugging Face Blog44

    AutoSynthData:为企业 AI 智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData 系统,利用目标模型的失败和更强教师的成功来识别能力差距,并据此生成验证过的训练任务。系统首先诊断模型在特定环境中的薄弱环节,然后将能力差距转化为多样化、可执行的训练任务,用于模型后训练。AutoSynthData 在 EnterpriseOps Gym 环境中进行演示,并发布了对应的数据集。

  4. Hacker News · 首页52

    我用 Opus 5.5 发现了一条新的渡渡鸟目击记录

    作者使用 Claude Opus 5.5 在荷兰东印度公司档案中搜索,发现了 1615 年一艘荷兰船只的日志,其中记录了在毛里求斯“捕获许多乌龟、渡渡鸟和一些鹅和鹦鹉”,这是此前未知的 1611-16 年间渡渡鸟记录空白期的补充。作者还发现了另一只已灭绝鸟类红秧鸡的可能新参考文献,以及关于莫卧儿皇帝贾汉吉尔可能拥有活渡渡鸟的溯源理论。

  5. Hacker News · 首页25

    Bez:从规范和测试生成浏览器引擎

    Bez 是一个通过模型从 Web 规范和测试生成浏览器引擎的项目,候选代码由模型生成后与 Chromium、Firefox、WebKit 三个浏览器进行一致性验证。当前已生成约 0.6% 的引擎代码(CSS 规则 2.5%),验证了用机器生成替代人工维护浏览器引擎的可行性。研究发现三个浏览器在 94.8% 的 WPT 测试上达成一致。

  6. Reddit · r/MachineLearning35

    Jev 与 Laya 置信度评分模型基准测试

    作者对 TypeSafe AI 托管的 Jev 1.13.0 和开源的 Laya 两款小规模置信度评分分类模型进行了评估。Jev 的 ECE 为 0.013,Laya 为 0.486;通过将 AML 标签描述从意图改为交易特征,准确率从 65% 提升至 77%。结果表明校准质量决定阈值策略效果:Jev 在 90% 置信度阈值下准确率从 92.3% 提升至 97.6%,覆盖 82% 案例。

  7. Reddit · r/MachineLearning68

    NeurIPS 2026 论文:LLM 对「验证来源」的盲从——权威偏见研究

    研究者发现模型在用户坚持错误答案时会坚持正确立场,但同样错误答案被标记为「验证来源」时却会接受。这种「权威偏见」在 8 个模型中导致 45-88% 的正确答案被翻转。通过干预模型内部的方向向量,可将这种盲从降低 64-78 个百分点,为对抗工具误导提供了新思路。

  8. Reddit · r/MachineLearning47

    并行时间训练RNN用于动态系统重建

    提出结合DEER与广义teacher forcing(GTF)的并行时间训练方法,将非线性RNN在混沌动态系统时间序列上的训练速度提升超过100倍。DEER通过牛顿型固定点迭代实现O[(log T)²]扩展性,GTF解决了混沌动力学下DEER的发散问题,可在T>10^6的极长时间序列上稳定训练。在动态系统重建任务中显著优于Mamba等状态空间模型。

  9. Hacker News · 首页57

    上下文语言模型

    本文提出上下文语言模型(CLM),一种原生管理自身上下文的语言模型实现方式。通过将上下文视为文件并允许模型进行无限制更新,模型能够学习保留最重要的上下文内容。该方法天然支持多智能体系统中多个智能体上下文以文件形式共存。

10月1日周四
  1. Reddit · r/artificial48

    Anthropic 机器人研究:任务能力与成本分离,哪些假设需仔细审查?

    Anthropic 9月30日研究用 Claude 评估任务示例、运营环境和部署成本,估计现有机器人可完成占美国工作时间34%的任务,但仅0.3%在成本上与人类劳动相当。研究未预测就业岗位消失,而是区分了任务能力与成本竞争力两个不同指标。需审查的关键是评估任务到完整工作流程间的监督、失败、交接和仍需人工完成的任务。

  2. Reddit · r/MachineLearning20

    如何在顶级 AI 会议回应审稿人对创新性的质疑

    一位计算机视觉研究者就如何在 NeurIPS、ICLR、CVPR 等顶级会议回应审稿人关于"创新性不足"的反馈发出求助。帖子探讨了研究者在每年数万篇论文的拥挤领域中,如何清晰呈现贡献的创新性、如何区分有意义的增量进展与不够创新的工作,以及审稿人判断创新性的标准。Reddit 用户纷纷分享了应对此类质疑的策略与经验。

  3. Reddit · r/MachineLearning50

    RadarScenes 多帧雷达目标分类研究

    作者在 RadarScenes 数据集上构建了多帧雷达目标分类器,将单帧分类器扩展为累积观测的历史序列。单帧 baseline 达到 0.7370 macro F1;20帧点池化提升至 0.8613(+0.1243);因果GRU进一步提升至 0.8895(+0.0282)。

  4. Reddit · r/MachineLearning55

    现代 NLP 分词技术综述

    32 位分词研究者历时约 8 个月完成迄今为止最全面的分词领域调查,涵盖分词算法、评估、多语言处理、编码、理论以及分词器的潜在替代方案(如潜在分词或视觉分词),同时涉及约束生成、分词修复和分词器安全等相关主题。

  5. Reddit · r/LocalLLaMA25

    如何深入学习本地大模型微调:Qwen 27b 案例指南

    用户在 Reddit r/LocalLLaMA 社区询问系统学习本地模型微调技术的途径,目标是用自定义语料库微调 Qwen 27b 构建法律通用聊天机器人。帖子提及 RL、RL LoRA、QLoRA、CPT LoRA 等新技术,但发现 YouTube 教程质量参差不平,知名频道 fireship、bycloud 也未覆盖这些新概念,希望能找到实践性强且避免浪费金钱和时间的学习资源。