跳到正文

#推理

今日 2 条

洞察 · 工具·提示词·论文 三栏速览

每栏 3 / 6 · 直达分类页

提示词

6 条
查看全部

论文

6 条
查看全部
今天10月8日周四
  1. Hacker News · 首页83

    OpenAI 一次发布 372 项数学证明,包括唯一游戏猜想

    据 Scott Aaronson 整理,OpenAI 在顾问组推荐下一次性公开 372 项数学突破结果,其中包括 Subhash Khot 的唯一游戏猜想(UGC)证明、L=BPL、Fourier 变换整数乘法低于 O(n log n) 的新上界、Unitary Synthesis 问题的正面解答、Parity 不在 QAC0 等,部分配有 Lean 证书。

    推荐理由:原文列出 372 项数学突破与所用算力、问题类型,可帮助读者判断新模型在深度推理上的实际边界。

10月7日周三
  1. Reddit · r/MachineLearning23

    Transformer、RNN 与 SSM 的记忆机制对比:从循环状态、KV cache 到类突触连接

    作者从"工作记忆"视角比较了 RNN、Transformer 与 SSM 三类架构的记忆承载方式:RNN 将记忆压缩为逐步传递的循环隐藏状态,参数规模约 O(N²) 而状态仅 O(N);Transformer 在推理时冻结权重,以不断增长的 KV cache 保存历史键值,更像便利贴式的外部上下文;SSM(如 Mamba)回到定长循环状态,并通过输入依赖机制决定遗忘。

10月6日周二
  1. Hacker News · 首页29

    数学家在 AI 时代如何继续前行:解决更难的问题、思考更大的图景

    卡内基梅隆大学数学教授 Jeremy Avigad 撰文指出,AI 已能轻松生成过去足以发表的结果,但数学作为严谨推理文化的核心价值并未消失。他提出三条路径:借助 AI 求解更难的开放性问题、主动选择值得追求的真正有趣问题,以及回归对数学理解的本质追求。作者认为,强化学习驱动的模型虽具备超人的组合技巧,但尚不具备真正的创造力,数学共同体现在需要重新思考研究与人才培养的方向。

  2. Simon Willison15

    Qwen3.8 27B 加法用英文单词表达能力的基准测试

    一项基准测试考察本地运行的 Qwen3.8-27B-Q4_K_M.gguf 模型能否完成正整数加法并仅用英文单词表达结果。在 5,070 个关闭推理的测试用例中,数字正确率仅 23.57%,格式合规率达 96.29%,但操作数从 1-3 位升至 10-13 位时,正确率从 97.04% 跌至 6.44%。开启推理后,在 169 对配对样本的一次性测试中答对 167 题。

10月5日周一
  1. Reddit · r/ChatGPT39

    LLMs 让"何时该放弃"变得更难判断

    长期使用大语言模型后,用户越来越难判断何时该放弃一个无法解决的问题。因为 LLM 总能提供另一个看似合理的尝试方案,这让"无法解决"和"只需再试几次"的感觉变得几乎相同。作者以优化 Hashcat 模块为例,经过大量失败尝试后 LLM 最终找到了有效的优化方案,导致用户不再将十次失败视为放弃的理由。

  2. Reddit · r/artificial20

    AI 回答质量与实际效用之间的鸿沟

    AI 系统能生成令人信服的分析、建议或计划,但实际效用取决于用户是否提供了正确的上下文,以及输出是否在现实中站得住脚。Reddit 用户讨论了"令人印象深刻的 AI 响应"与"真正有用的东西"之间存在的最大差距。

  3. Reddit · r/LocalLLaMA14

    Strix Halo (GMKtec EVO-X2) 是目前最接近"梦想"本地大语言模型运行设备的选择吗?

    讨论认为内存容量仍是运行20B-32B模型(Q5/Q6量化)的真正瓶颈,消费级GPU带宽优秀但显存有限,NPU/AI加速器算力强但内存不足,FPGA方案带宽仍受限制。Strix Halo系统(GMKtec EVO-X2、Framework Desktop)提供大统一内存池但价格昂贵。"梦想"加速器需要48+ GB内存、500+ GB/s带宽、低于1000美元,但目前尚无产品真正达到该规格。

10月1日周四
  1. 量子位 QbitAI76

    何恺明团队新作:看猫片就能学会ARC挑战

    何恺明团队提出NAT-ARC,用ImageNet上的MAE预训练视觉encoder来解决ARC抽象推理任务。纯视觉方案首次在ARC-1上达到63.4%单模型pass@2,集成后达70.2%,逼近专用LLM系统的71.6%。

    推荐理由:提出了一个可验证的方法创新:自然图像预训练的视觉encoder可以迁移到抽象格子推理任务,并首次打通视觉路线的scaling瓶颈。