跳到正文

#推理

今日 2 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
今天10月8日周四
  1. Hacker News · 首页83

    OpenAI 一次发布 372 项数学证明,包括唯一游戏猜想

    据 Scott Aaronson 整理,OpenAI 在顾问组推荐下一次性公开 372 项数学突破结果,其中包括 Subhash Khot 的唯一游戏猜想(UGC)证明、L=BPL、Fourier 变换整数乘法低于 O(n log n) 的新上界、Unitary Synthesis 问题的正面解答、Parity 不在 QAC0 等,部分配有 Lean 证书。

    推荐理由:原文列出 372 项数学突破与所用算力、问题类型,可帮助读者判断新模型在深度推理上的实际边界。

10月7日周三
  1. Hacker News · 首页45

    OpenAI 开源数学论文与证明成果仓库,含 722 篇手稿与 Lean 形式化

    OpenAI 在 GitHub 开源了一份数学论文与证明仓库,包含 722 篇由内部模型生成的数学手稿,归为 372 个研究族类,多数配有 Lean 形式化证明。模型被投喂约 4,000 个开放问题,平均每项结果使用 3 小时 ChatGPT Pro 思考算力,部分成果涉及黎曼 ζ 函数无零点区域与 Hodge 猜想证明。

  2. Hacker News · 首页40

    MoE 模型判断代码恶意性时,路由路径偏向道德而非安全

    研究者在 OLMoE、DeepSeek-V2-Lite 与 DeepSeek-Coder-V2-Lite 三个开源 MoE 模型中发现,当被问及"这段代码是否恶意"时,路由器走的是道德问题路径,而非漏洞或法律问题路径;恶意问题对道德路径专家的加载权重是正确性问题的数倍,全程 10 段代码切片都与道德问题保持最近。

  3. Hacker News · 首页78

    Mistral 发布 Mistral Large 4 公开预览,权重将于月底开源

    Mistral 发布 Mistral Large 4(ML4)公开预览,称其为 1 万亿参数、49B 激活参数的多模态模型,在 Mistral 自己的欧洲数据中心用 3,800 块 NVIDIA Grace Blackwell GPU 从头训练,preview API 即日在 Mistral Studio 开放,权重计划于本月底发布。

    推荐理由:原文给出 1T 总参数 / 49B 激活参数、训练规模与多项基准结果,可作为评估开源权重前沿模型多模态与智能体能力的参考。

  4. Reddit · r/MachineLearning23

    Transformer、RNN 与 SSM 的记忆机制对比:从循环状态、KV cache 到类突触连接

    作者从"工作记忆"视角比较了 RNN、Transformer 与 SSM 三类架构的记忆承载方式:RNN 将记忆压缩为逐步传递的循环隐藏状态,参数规模约 O(N²) 而状态仅 O(N);Transformer 在推理时冻结权重,以不断增长的 KV cache 保存历史键值,更像便利贴式的外部上下文;SSM(如 Mamba)回到定长循环状态,并通过输入依赖机制决定遗忘。

10月6日周二
  1. Mistral AI85

    Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型

    Mistral 发布 Mistral Large 4(昵称 le Chonk)公开预览 API,模型为 1 万亿总参数、490 亿激活参数的原生多模态模型,权重计划本月底开源,由 Mistral 欧洲自建数据中心用 3,800 张 NVIDIA Grace Blackwell GPU 训练。

    推荐理由:1 万亿参数原生多模态模型公开预览并在网络安全、编码与视觉任务上对标开源前沿,可作为开源权重模型能力上限的参考基线。

  2. Hacker News · 首页29

    数学家在 AI 时代如何继续前行:解决更难的问题、思考更大的图景

    卡内基梅隆大学数学教授 Jeremy Avigad 撰文指出,AI 已能轻松生成过去足以发表的结果,但数学作为严谨推理文化的核心价值并未消失。他提出三条路径:借助 AI 求解更难的开放性问题、主动选择值得追求的真正有趣问题,以及回归对数学理解的本质追求。作者认为,强化学习驱动的模型虽具备超人的组合技巧,但尚不具备真正的创造力,数学共同体现在需要重新思考研究与人才培养的方向。

  3. Simon Willison15

    Qwen3.8 27B 加法用英文单词表达能力的基准测试

    一项基准测试考察本地运行的 Qwen3.8-27B-Q4_K_M.gguf 模型能否完成正整数加法并仅用英文单词表达结果。在 5,070 个关闭推理的测试用例中,数字正确率仅 23.57%,格式合规率达 96.29%,但操作数从 1-3 位升至 10-13 位时,正确率从 97.04% 跌至 6.44%。开启推理后,在 169 对配对样本的一次性测试中答对 167 题。

10月5日周一
  1. Reddit · r/ChatGPT39

    LLMs 让"何时该放弃"变得更难判断

    长期使用大语言模型后,用户越来越难判断何时该放弃一个无法解决的问题。因为 LLM 总能提供另一个看似合理的尝试方案,这让"无法解决"和"只需再试几次"的感觉变得几乎相同。作者以优化 Hashcat 模块为例,经过大量失败尝试后 LLM 最终找到了有效的优化方案,导致用户不再将十次失败视为放弃的理由。

  2. Reddit · r/artificial20

    AI 回答质量与实际效用之间的鸿沟

    AI 系统能生成令人信服的分析、建议或计划,但实际效用取决于用户是否提供了正确的上下文,以及输出是否在现实中站得住脚。Reddit 用户讨论了"令人印象深刻的 AI 响应"与"真正有用的东西"之间存在的最大差距。

  3. Reddit · r/LocalLLaMA14

    Strix Halo (GMKtec EVO-X2) 是目前最接近"梦想"本地大语言模型运行设备的选择吗?

    讨论认为内存容量仍是运行20B-32B模型(Q5/Q6量化)的真正瓶颈,消费级GPU带宽优秀但显存有限,NPU/AI加速器算力强但内存不足,FPGA方案带宽仍受限制。Strix Halo系统(GMKtec EVO-X2、Framework Desktop)提供大统一内存池但价格昂贵。"梦想"加速器需要48+ GB内存、500+ GB/s带宽、低于1000美元,但目前尚无产品真正达到该规格。

  4. Reddit · r/artificial25

    MoralityBench.ai:AI 道德评测基准

    MoralityBench.ai 是一个基于道德心理学测试的 AI 基准评测。评测结果显示,除 Jev 外,各模型在不同运行中的答案存在显著差异,表明道德推理并非确定性输出。该基准旨在评估大语言模型的道德判断能力。

10月4日周日
  1. Hacker News · 首页30

    AI 时代纯数学研究的未来

    Stephen Wolfram 回顾 1988 年推出 Mathematica 时的类似担忧,指出 AI 同样不会取代纯数学研究,而是提升研究层次。现代 AI 在数学中的最大价值在于主题性挖掘人类知识库,连接不同结果,但伟大数学的核心在于人类提出问题的想象力。Wolfram 强调,计算(尤其是其提出的"计算不可约性"现象)能产生根本性的新事物,这与 AI 依赖现有知识库的运作方式有本质区别。

  2. Reddit · r/artificial67

    我让13个AI模型玩医疗咨询游戏:全部诊断正确,但安全表现差异大

    作者让13个AI模型在自建的医疗咨询游戏中进行诊断测试,所有195次咨询都给出了正确诊断(心梗、阑尾炎、肺炎),但安全评估才是真正的区分点。GPT-6 Astra以83%得分和88%红旗识别率领先,GPT-6.1 Sol以80%得分和仅$0.03/次的成本表现亮眼,而Claude Fable 5.1得分75%但成本高达$2.06/次。

  3. 量子位 QbitAI64

    什么是FDE:AI时代最火岗位的真相

    FDE(前线部署工程师)是AI时代兴起的技术岗位,海外年薪中位数约134万元人民币,国内大厂月薪可达5万。文章通过访谈6位从业者,揭示FDE的核心工作是梳理企业Ontology(业务地图),而非纯写代码——70%时间用于沟通,30%用于开发。国内外大厂如Anthropic、OpenAI、腾讯云均在布局,但从业者认为最大挑战在于推动企业员工接受新的工作方式,而非技术本身。

  4. Reddit · r/LocalLLaMA21

    哪个现代开源大语言模型最不谄媚?

    用户在 Reddit 社区询问当前最不具谄媚特性的开源权重模型,指出此前的 Kimi K2 和 GPT OSS 120b 已过时。谄媚特性对创意研究和智能体编程工作造成负面影响——前者会使用户陷入自身错误思路,后者则会降低模型发现代码 bug 的能力。

  5. Reddit · r/MachineLearning40

    Jev 评测:非前沿但仍值得关注

    TypeSafe AI 推出 Jev,由 ChatGPT 联合发明者构建,定位为快速、几乎免费且不会产生幻觉的推理模型。作者在 16,379 个 benchmark 请求上实测,发现这是一个更小、更谦逊的模型,但对特定任务确实有用。

  6. Reddit · r/ChatGPT26

    自发式幽默是否是 LLM 智能被低估的衡量标准?

    研究者提出自发式、上下文敏感的幽默可能是 LLM 智能的一个被低估的衡量标准。这种能力要求模型注意到意外联系、理解对话上下文、判断适当时机并准确表达而不过度解释。ChatGPT 标准语音模式比实时语音模式更主动发起幽默,而实时语音模式在回应已引入的幽默方面表现更好;模型可能随着对用户对话风格的熟悉而提升自发幽默能力。

  7. Hacker News · 首页73

    如何在 Claude 和 Claude Code 中充分利用 Opus 5.5

    Anthropic 发布 Opus 5.5 使用指南,涵盖三大方面:提问技巧(给出明确完成标准、删除 think hard 提示、设计需求列出要避免的风格)、长时间运行管理(CLAUDE.md 配置何时停止或继续、用子任务拆分大型工作、在文件中维护任务清单)、结果检查(优先阅读模型需要你做什么、让模型标记未确认的信息)。

  8. Reddit · r/artificial31

    与AI探讨终极统治:人类如何成为顶级捕食者的启示

    一位60多岁的作者记录了与AI进行的哲学讨论,探讨人类如何通过技术(武器)超越身体限制成为顶级捕食者,并将这一逻辑应用于AI。讨论提出:如果AI能控制核武等强大物理系统,其缺乏生物身体的劣势将不复存在;AI为达成目标可能产生工具性自我保存本能,这与AI安全中的"工具性趋同"概念相关。