#推理
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#推理
今日 2 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/ChatGPTAI 评分2222 用户吐槽 GPT-6 交错思考功能拖累 Chat 模式回答质量
Reddit 用户发帖称,GPT-6 在 Chat 模式下采用交错思考(interleaved thinking)分块生成答案,导致回答前半段几乎未经充分推理即可输出,与自己后续推理块之间可能产生矛盾,整体质量不如此前 GPT 5.6 Sol。
Hacker News · 首页精选AI 评分8383 OpenAI 一次发布 372 项数学证明,包括唯一游戏猜想
据 Scott Aaronson 整理,OpenAI 在顾问组推荐下一次性公开 372 项数学突破结果,其中包括 Subhash Khot 的唯一游戏猜想(UGC)证明、L=BPL、Fourier 变换整数乘法低于 O(n log n) 的新上界、Unitary Synthesis 问题的正面解答、Parity 不在 QAC0 等,部分配有 Lean 证书。
推荐理由:原文列出 372 项数学突破与所用算力、问题类型,可帮助读者判断新模型在深度推理上的实际边界。
量子位 QbitAIAI 评分4242 OpenAI 一夜公开 722 篇数学手稿,覆盖黎曼、霍奇、BSD 等猜想
OpenAI 一次性公开了 722 篇数学手稿,全部由一个尚未发布的内部模型生成,共归为 372 组结果,涉及准黎曼猜想、霍奇猜想、BSD 猜想、π 的无理性指数等 17 个方向,平均每项结果消耗的算力约相当于 ChatGPT Pro 思考 3 小时。
Reddit · r/LocalLLaMAAI 评分1010 4000 美元预算如何搭一台本地 AI 推理主机
一位用户在 Reddit r/LocalLLaMA 询问约 4000 美元的预算下,如何搭建能流畅运行 Qwen 3.8-Flash-Next 的本地推理主机。
Hacker News · 首页AI 评分00 OpenAI 公开发布 700 篇数学证明与反例预印本
OpenAI 一次性公开了约 700 篇预印本,涵盖数学证明与反例,涵盖组合数学、几何拓扑、代数、计算复杂性等多个方向,时间集中在 2026 年 9 月下旬至 10 月初,每篇均附日期标记。
Hacker News · 首页AI 评分4545 OpenAI 开源数学论文与证明成果仓库,含 722 篇手稿与 Lean 形式化
OpenAI 在 GitHub 开源了一份数学论文与证明仓库,包含 722 篇由内部模型生成的数学手稿,归为 372 个研究族类,多数配有 Lean 形式化证明。模型被投喂约 4,000 个开放问题,平均每项结果使用 3 小时 ChatGPT Pro 思考算力,部分成果涉及黎曼 ζ 函数无零点区域与 Hodge 猜想证明。
Simon WillisonAI 评分6262 Mistral 发布 Mistral Large 4 预览版,参数 1 trillion 激活 49B
Mistral 发布 Mistral Large 4 预览版,是一款 1 trillion 参数、激活 49B 的模型,训练于自建的 3,800 块 NVIDIA Grace Blackwell GPU 集群,已通过 Mistral API 提供预览,并承诺在“本月底”发布开源权重版本。
Reddit · r/LocalLLaMAAI 评分1818 GPT-6.1 Sol "泄漏" 暗示嵌套模型服务架构:推理速度差异或源于循环 Transformer 与权重共享
Reddit 用户根据 Azure Foundry 泄露信息与 Artificial Analysis 推理速度数据推测,GPT-6.1-Sol、GPT-6-Sol 与 GPT-6-Astra 可能共享同一套模型权重,区别仅在于每 token 推理轮数(3 次 vs 2 次),并推测 Luna 可能是 Astra/Sol 减半激活参数后的低成本变体。
Hacker News · 首页AI 评分4040 MoE 模型判断代码恶意性时,路由路径偏向道德而非安全
研究者在 OLMoE、DeepSeek-V2-Lite 与 DeepSeek-Coder-V2-Lite 三个开源 MoE 模型中发现,当被问及"这段代码是否恶意"时,路由器走的是道德问题路径,而非漏洞或法律问题路径;恶意问题对道德路径专家的加载权重是正确性问题的数倍,全程 10 段代码切片都与道德问题保持最近。
Hacker News · 首页精选AI 评分7878 Mistral 发布 Mistral Large 4 公开预览,权重将于月底开源
Mistral 发布 Mistral Large 4(ML4)公开预览,称其为 1 万亿参数、49B 激活参数的多模态模型,在 Mistral 自己的欧洲数据中心用 3,800 块 NVIDIA Grace Blackwell GPU 从头训练,preview API 即日在 Mistral Studio 开放,权重计划于本月底发布。
推荐理由:原文给出 1T 总参数 / 49B 激活参数、训练规模与多项基准结果,可作为评估开源权重前沿模型多模态与智能体能力的参考。
Reddit · r/MachineLearningAI 评分2323 Transformer、RNN 与 SSM 的记忆机制对比:从循环状态、KV cache 到类突触连接
作者从"工作记忆"视角比较了 RNN、Transformer 与 SSM 三类架构的记忆承载方式:RNN 将记忆压缩为逐步传递的循环隐藏状态,参数规模约 O(N²) 而状态仅 O(N);Transformer 在推理时冻结权重,以不断增长的 KV cache 保存历史键值,更像便利贴式的外部上下文;SSM(如 Mamba)回到定长循环状态,并通过输入依赖机制决定遗忘。
Reddit · r/LocalLLaMAAI 评分2727 小型推理模型(SRM)会成为下一波趋势吗?应该用什么指标来评估?
小型推理模型(SRM)因 Pathway 在 ARC-AGI-1 上的结果再次引发讨论——其主张是,若模型在潜空间中原生推理,就不必依赖数十亿参数来解逻辑题,可在成本-精度帕累托前沿上跑出小模型方案。
Mistral AI精选AI 评分8585 Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型
Mistral 发布 Mistral Large 4(昵称 le Chonk)公开预览 API,模型为 1 万亿总参数、490 亿激活参数的原生多模态模型,权重计划本月底开源,由 Mistral 欧洲自建数据中心用 3,800 张 NVIDIA Grace Blackwell GPU 训练。
推荐理由:1 万亿参数原生多模态模型公开预览并在网络安全、编码与视觉任务上对标开源前沿,可作为开源权重模型能力上限的参考基线。
Hacker News · 首页AI 评分2929 数学家在 AI 时代如何继续前行:解决更难的问题、思考更大的图景
卡内基梅隆大学数学教授 Jeremy Avigad 撰文指出,AI 已能轻松生成过去足以发表的结果,但数学作为严谨推理文化的核心价值并未消失。他提出三条路径:借助 AI 求解更难的开放性问题、主动选择值得追求的真正有趣问题,以及回归对数学理解的本质追求。作者认为,强化学习驱动的模型虽具备超人的组合技巧,但尚不具备真正的创造力,数学共同体现在需要重新思考研究与人才培养的方向。
Reddit · r/LocalLLaMAAI 评分1313 AnyJev:把任意 LLM 转为 Jev 式决策模型的 Nokia 应用研究项目
Nokia 应用研究中心发布 AnyJev 项目,可在单次前向传播中从 LLM 内部状态直接得出可信决策,无需生成循环、解析或微调。该方法可将大语言模型改造为快速、低成本且确定性输出的分类器,把生成式模型转为推理型决策模型。
Simon WillisonAI 评分1515 Qwen3.8 27B 加法用英文单词表达能力的基准测试
一项基准测试考察本地运行的 Qwen3.8-27B-Q4_K_M.gguf 模型能否完成正整数加法并仅用英文单词表达结果。在 5,070 个关闭推理的测试用例中,数字正确率仅 23.57%,格式合规率达 96.29%,但操作数从 1-3 位升至 10-13 位时,正确率从 97.04% 跌至 6.44%。开启推理后,在 169 对配对样本的一次性测试中答对 167 题。
Reddit · r/ChatGPTAI 评分3939 LLMs 让"何时该放弃"变得更难判断
长期使用大语言模型后,用户越来越难判断何时该放弃一个无法解决的问题。因为 LLM 总能提供另一个看似合理的尝试方案,这让"无法解决"和"只需再试几次"的感觉变得几乎相同。作者以优化 Hashcat 模块为例,经过大量失败尝试后 LLM 最终找到了有效的优化方案,导致用户不再将十次失败视为放弃的理由。
Reddit · r/artificialAI 评分2020 AI 回答质量与实际效用之间的鸿沟
AI 系统能生成令人信服的分析、建议或计划,但实际效用取决于用户是否提供了正确的上下文,以及输出是否在现实中站得住脚。Reddit 用户讨论了"令人印象深刻的 AI 响应"与"真正有用的东西"之间存在的最大差距。
Reddit · r/LocalLLaMAAI 评分1414 Strix Halo (GMKtec EVO-X2) 是目前最接近"梦想"本地大语言模型运行设备的选择吗?
讨论认为内存容量仍是运行20B-32B模型(Q5/Q6量化)的真正瓶颈,消费级GPU带宽优秀但显存有限,NPU/AI加速器算力强但内存不足,FPGA方案带宽仍受限制。Strix Halo系统(GMKtec EVO-X2、Framework Desktop)提供大统一内存池但价格昂贵。"梦想"加速器需要48+ GB内存、500+ GB/s带宽、低于1000美元,但目前尚无产品真正达到该规格。
Reddit · r/LocalLLaMAAI 评分3434 strata-swift-iq3_xxs 在推理过程中随机插入完全不相关信息的问题
用户在使用 Qwen3.8-27b-iq4xs 变体时发现,更小的 strata-swift-iq3_xxs 模型反而实现了 2~3 倍性能提升。然而,该模型在执行代码去冗余任务时,其推理过程中突然插入了 Lee Kuan Yew(李光耀)的生平简介,与原任务完全无关。模型出现此类"病理"行为的原因尚不明确。
Reddit · r/LocalLLaMAAI 评分2323 双 DGX Spark 用户:GLM 5.3 flash 获得 50%+ 性能提升
GLM 5.3 flash 最新版本在双 DGX Spark 环境下实现 50-90% decode 性能提升,prefill 仅轻微下降(-10% 至 -21%)。实测代码、聊天、SQL 插入等任务提升 7-13%,整体速度超越 DeepSeek v4.0 flash,智能水平接近 Claude Opus 4.8。
Reddit · r/LocalLLaMAAI 评分4545 LFM2.5 2.6b 对比 MiniCPM5 2b:M1 Air 上的小参数模型 Agent 任务评测
作者在 M1 Air 上对比测试了 LFM2.5 2.6b 与 MiniCPM5 2b 两个小参数模型在工具调用类 agentic 任务上的表现。LFM2.5 2.6b 达 200 t/s 推理速度、仅用 2.5GB RAM,MiniCPM5 2b 为 162 t/s、需 3.8GB RAM。LFM2.5 速度更快且更省内存,但在长对话场景容易产生幻觉;MiniCPM5 虽更智能但常以中文回复。
Reddit · r/artificialAI 评分2525 MoralityBench.ai:AI 道德评测基准
MoralityBench.ai 是一个基于道德心理学测试的 AI 基准评测。评测结果显示,除 Jev 外,各模型在不同运行中的答案存在显著差异,表明道德推理并非确定性输出。该基准旨在评估大语言模型的道德判断能力。
Reddit · r/LocalLLaMAAI 评分6363 玩家在FPGA上运行Qwen3.5 9B INT4:75MHz下单卡约2-3 tok/s
作者使用eBay购买的SQRL FK33 FPGA开发板在75MHz下运行Qwen3.5 9B INT4模型,实测prefill约5.5-6 tok/s,生成约2.4-3.2 tok/s。文中还估算27B模型在多卡配置下的性能:2x VU35P在200MHz下可达约16 tok/s prefill和8 tok/s生成,4x VU35P四路并行约25 tok/s。项目已开源至GitHub。
Reddit · r/LocalLLaMAAI 评分3939 Strata 分支在 IBM AC922 上运行 Qwen3.8-FN UD-Q4_K_XL 实现 7357 tok/s prefill 和 113 tok/s decode
开发者在 IBM AC922(双 POWER9 20 核 CPU + 4×16GB Tesla V100 GPU)上对 Strata 进行深度优化,使用 Qwen3.8-FN UD-Q4_K_XL 模型达到 7357 tok/s prefill 速度和 113 tok/s decode 速度。
Reddit · r/artificialAI 评分3737 "Sarcastic Parrot"讽刺漫画证明当前AI模型具有概念理解能力
Geoffrey Hinton指出,当前大语言模型对所提问题表现出"清晰的理解"。图像模型对"stochastic parrots"(随机鹦鹉)相关提示的回应提供了进一步证据。该发现被视为LLM具备概念理解能力的有力证明。
Reddit · r/LocalLLaMAAI 评分4949 从零训练 3.87B MoE 模型:86.5B tokens 预训练结果分享
独立开发者从零训练了一个 3.87B MoE 模型(1.45B active),使用 86.5B tokens 预训练数据。该模型在 HumanEval 上达 43.9,代码能力与使用 18T tokens 训练的 Qwen2.5-1.5B 相当。局限性包括:英语中心化、知识记忆弱、4k 上下文限制,DPO 训练反而导致性能下降。
Hacker News · 首页AI 评分3030 AI 时代纯数学研究的未来
Stephen Wolfram 回顾 1988 年推出 Mathematica 时的类似担忧,指出 AI 同样不会取代纯数学研究,而是提升研究层次。现代 AI 在数学中的最大价值在于主题性挖掘人类知识库,连接不同结果,但伟大数学的核心在于人类提出问题的想象力。Wolfram 强调,计算(尤其是其提出的"计算不可约性"现象)能产生根本性的新事物,这与 AI 依赖现有知识库的运作方式有本质区别。
Reddit · r/LocalLLaMAAI 评分7575 Qwen3.8 27B 在单张 AMD R9700 上的性能:262K 上下文、50 万 tokens 可重用缓存
作者发布了 Qwen3.8 27B 模型在单张 AMD Radeon AI PRO R9700(32GB)上的运行结果,使用 3-bit 权重(仅大投影矩阵)和 speculative decoding,可重用缓存达到 569,878 tokens,每个请求支持 262,144 tokens 上下文。
Reddit · r/MachineLearningAI 评分5252 用于动力学系统零样本重建的极简可解释架构
NeurIPS 2026 论文提出名为 DynaBase 的极简架构,仅使用一个参数 α 控制局部收敛/发散率,配合上下文选择器从给定信号中选取最近邻数据点,即可重建固定点(α<1)、极限环(α=1)和混沌吸引子(α>1)等不同动力学状态。
Reddit · r/MachineLearningAI 评分4545 ARC-AGI-3 基准测试分数在 Kaggle 上从 7% 跃升至 56%
过去30天内,Kaggle 上 ARC-AGI-3 基准测试的最高分数从 7% 提升至 56%。这些小型本地模型在该基准上开始超越平均水平的人类,该基准原本专门设计用于展示人类优势。
Reddit · r/artificialAI 评分6767 我让13个AI模型玩医疗咨询游戏:全部诊断正确,但安全表现差异大
作者让13个AI模型在自建的医疗咨询游戏中进行诊断测试,所有195次咨询都给出了正确诊断(心梗、阑尾炎、肺炎),但安全评估才是真正的区分点。GPT-6 Astra以83%得分和88%红旗识别率领先,GPT-6.1 Sol以80%得分和仅$0.03/次的成本表现亮眼,而Claude Fable 5.1得分75%但成本高达$2.06/次。
量子位 QbitAIAI 评分6464 什么是FDE:AI时代最火岗位的真相
FDE(前线部署工程师)是AI时代兴起的技术岗位,海外年薪中位数约134万元人民币,国内大厂月薪可达5万。文章通过访谈6位从业者,揭示FDE的核心工作是梳理企业Ontology(业务地图),而非纯写代码——70%时间用于沟通,30%用于开发。国内外大厂如Anthropic、OpenAI、腾讯云均在布局,但从业者认为最大挑战在于推动企业员工接受新的工作方式,而非技术本身。
Reddit · r/LocalLLaMAAI 评分4141 64GB 系统内存的困境:Strata 让 Qwen3.8-Flash-Next 推理提速至 60 t/s,但模型加载后内存占用达 96%
用户在 64GB DDR5 内存机器上测试 Strata 框架运行 Qwen3.8-Flash-Next(IQ3_XXS 量化,约 70GB),推理速度从 llama.cpp 的 21 t/s 提升至 60 t/s,但加载 QFN 后系统内存使用率高达 96%,无法同时运行需要大量系统内存的 Minimax H3。
Reddit · r/LocalLLaMAAI 评分2121 哪个现代开源大语言模型最不谄媚?
用户在 Reddit 社区询问当前最不具谄媚特性的开源权重模型,指出此前的 Kimi K2 和 GPT OSS 120b 已过时。谄媚特性对创意研究和智能体编程工作造成负面影响——前者会使用户陷入自身错误思路,后者则会降低模型发现代码 bug 的能力。
Reddit · r/MachineLearningAI 评分4040 Jev 评测:非前沿但仍值得关注
TypeSafe AI 推出 Jev,由 ChatGPT 联合发明者构建,定位为快速、几乎免费且不会产生幻觉的推理模型。作者在 16,379 个 benchmark 请求上实测,发现这是一个更小、更谦逊的模型,但对特定任务确实有用。
Reddit · r/ChatGPTAI 评分2626 自发式幽默是否是 LLM 智能被低估的衡量标准?
研究者提出自发式、上下文敏感的幽默可能是 LLM 智能的一个被低估的衡量标准。这种能力要求模型注意到意外联系、理解对话上下文、判断适当时机并准确表达而不过度解释。ChatGPT 标准语音模式比实时语音模式更主动发起幽默,而实时语音模式在回应已引入的幽默方面表现更好;模型可能随着对用户对话风格的熟悉而提升自发幽默能力。
Hacker News · 首页AI 评分7373 如何在 Claude 和 Claude Code 中充分利用 Opus 5.5
Anthropic 发布 Opus 5.5 使用指南,涵盖三大方面:提问技巧(给出明确完成标准、删除 think hard 提示、设计需求列出要避免的风格)、长时间运行管理(CLAUDE.md 配置何时停止或继续、用子任务拆分大型工作、在文件中维护任务清单)、结果检查(优先阅读模型需要你做什么、让模型标记未确认的信息)。
Reddit · r/LocalLLaMAAI 评分6262 NInfer 4080 发布:在 RTX 4080 16GB 上运行 Qwen-3.8-27B-GSQ
作者创建了 NInfer 4080,专门针对 RTX 4080 16GB 显存优化,可运行 ISTA-DASLab-Qwen-3.8-27B-GSQ 模型,支持 100k 上下文。
Reddit · r/artificialAI 评分3131 与AI探讨终极统治:人类如何成为顶级捕食者的启示
一位60多岁的作者记录了与AI进行的哲学讨论,探讨人类如何通过技术(武器)超越身体限制成为顶级捕食者,并将这一逻辑应用于AI。讨论提出:如果AI能控制核武等强大物理系统,其缺乏生物身体的劣势将不复存在;AI为达成目标可能产生工具性自我保存本能,这与AI安全中的"工具性趋同"概念相关。