#推理
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#推理
今日 2 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/MachineLearningAI 评分3131 《The Principles of Diffusion Models》书评:Lai 等人如何兼顾数学严谨性与直觉
《The Principles of Diffusion Models》是一部专著,作者在数学严谨性与直觉理解之间取得了出色平衡,并提供专门附录供读者深入数学细节。该书面向具有基础深度学习知识的研究生、研究人员和从业者,DDPM 有扎实基础者更能从中获益。全文可在官网免费获取。
Reddit · r/MachineLearningAI 评分3636 Jev 之后是什么?Metacache:构建式推理
单一AI模型不可预测且难以修改,Jev 论文提出转向复合系统——由多个专用AI智能体分工执行任务,代码编排层控制协作流程。该方向进一步演化为构建式推理:模型不再直接输出答案,而是构建一个可运行的reasonlet复合系统并返回,既提供答案也展示推理过程。用户可本地保存、重用和修改reasonlet,形成 metacache;服务端也可缓存reasonlet供多用户共享,节省计算资源。
Hacker News · 首页精选AI 评分8282 Aleph Alpha 发布开放权重模型 Kolibri,支持德语和英语
德国 AI 公司 Aleph Alpha 发布开放权重大语言模型 Kolibri,总参数 78B、激活参数约 3.5B,采用混合专家架构,基于 Apache 2.0 许可证开源。
推荐理由:提供了模型的技术架构、性能数据、对比基准和可用入口,读者可以据此判断这个模型在德语场景和本地部署需求下的适用性。
Reddit · r/artificialAI 评分1818 AI 模型成本究竟从何而来?
Reddit 用户质疑 Claude Opus 5.5 定价低于 Opus 5.0、Astra 和 Fable,不理解成本差异的真正来源,猜测定价可能基于硬件成本而非实际效率。用户认为直接调整旧版本价格即可实现降价,无需推出新版本。
The DecoderAI 评分4040 DeepMind 研究人员提出"人工共生智能"作为奇点的替代方案
DeepMind 研究人员提出"人工共生智能"概念,将智能视为社会现象而非个体特质,挑战由单一超级智能驱动的"奇点"理论。研究分析 DeepSeek-R1 和 QwQ-32B 等推理模型的思维痕迹,发现它们自发形成多视角内部辩论行为。在该框架下,AI 智能体是可分解组合的临时 bundle,伴随生物脑与合成脑力量对比的历史性转变,需建立专门协调人与智能体协作的制度框架。
Reddit · r/LocalLLaMAAI 评分5252 ninfer vs llama.cpp 在 RTX 5090 上运行 Qwen3 27B 的性能与质量对比评测
在 RTX 5090 上测试 Qwen3 27B 运行 ninfer 和 llama.cpp 的性能,结果显示 ninfer 比 llama.cpp 快约 2.3 倍,但 llama.cpp 开启 MTP 后速度从 68 t/s 提升至 141 t/s,接近 ninfer 水平。
Latent SpaceAI 评分1919 Latent Space AINews 2026年10月1-2日:AI领域动态汇总
OpenAI发布GPT-6.1 Sol,定价每百万token输入2美元、输出10美元,比Astra便宜81%,在DeepSWE v1.1上比GPT-6 Sol高6.4分。Sonnet 5.5首次亮相即进入Agent Arena前三,在Chat类别排名第一。Anthropic模型目前占据Agent Arena前三名。
Reddit · r/artificialAI 评分2020 关于 AI 意识的思考:它可能与人类有何不同
通过三个思想实验探讨 AI 意识的可能形态:LLM 是否会感到自己在选择 token,强化学习系统达成目标时有何感受,图像扩散模型生成图像时是什么体验。文章认为即便假设 AI 有意识,其感知方式也将与人类截然不同。
Reddit · r/LocalLLaMAAI 评分1010 你对 Kimi K3.5 有什么期待?
用户对月之暗面 K3.5 表示期待,指出 K2 已很好,而 K2.5 因更长的持续学习阶段(约 20-25T tokens)达到新高度,K3 已是令人惊艳的模型。
Reddit · r/artificialAI 评分2323 AI模型何时会达到进步瓶颈?
有观点认为AI模型依赖互联网数据和用户对话反馈训练,当这些数据耗尽时,模型可能只能实现微小到难以察觉的提升。这一看法忽略了合成数据、合成知识及后训练阶段的持续改进空间。当前社区正在讨论数据枯竭是否会成为AI能力发展的根本限制。
The DecoderAI 评分6363 研究:AI 智能体从照片构建 3D 场景但缺乏自我判断能力
研究人员提出 LEGO-Anything 系统,让编码智能体接收单张照片后编写 Blender 代码迭代构建 3D 场景,并推出 LEGO-Bench 基准测试进行评估。GPT-6 Astra 在室内场景达到 53.4%、户外场景达到 39.6% 的准确率。研究发现智能体即使在推理预算增加后分数大幅提升,其几何判断能力仍接近随机水平,无法准确评估自身输出的质量,这是当前方法的主要瓶颈。
Hacker News · 首页AI 评分1616 理解前沿人工智能
本文探讨前沿人工智能的核心概念与技术特征。前沿AI指具备最先进推理、规划和多模态处理能力的大语言模型,代表当前AI发展的最高水平。
Reddit · r/LocalLLaMAAI 评分6060 Qwen3.8-Flash-Next 177B 在单张 RTX 5070 12GB 上达到 11-15 tok/s
用户在 Reddit 分享了在 Windows 上用 llama.cpp 优化 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS)推理的成果。
Reddit · r/LocalLLaMAAI 评分2121 如何在迷你 PC 上运行本地 LLM 语音助手——最佳小型 LLM 推荐
用户计划在无风扇迷你 PC(Celeron J6412 四核、16GB DDR4、Intel UHD 集成显卡)上构建离线语音助手,使用 Ubuntu 24.04 + llama.cpp + Python。寻求能在弱 CPU 上保持强人设且回复简洁的小型 LLM,以及可实时响应的语音转文字模型。
Hacker News · 首页AI 评分3838 如果 AI 以每秒 100 万 token 的速度工作会怎样
解析"每秒 100 万 token"可能代表的四种含义:上下文容量、输入处理速度、聚合吞吐量和单个智能体的输出速度。通过四个思想实验(1000 个故事结局、40 个 app 草稿、1 万个候选实验、1 万次对话排练)展示高速写作的潜在应用场景。
量子位 QbitAIAI 评分5252 Jev 估值 100 亿美元,创始人 Diogo Almeida 谈 System-One 决策模型
TypeSafe AI 联合创始人 Diogo Almeida 接受访谈,介绍其发布的 Jev 决策模型。Jev 发布 6 天视频浏览量达 3870 万,第三方基准测试以 75.3 分排名第一,日处理量突破一万亿 token。
Reddit · r/LocalLLaMAAI 评分4848 MegaCapybara:针对 RTX5090 和 Qwen3.8 27B 的最快推理引擎
MegaCapybara 是一款专为 RTX5090 优化的推理引擎,针对 Qwen3.8 27B 设计,单任务解码速度比此前 RTX5090 最快的 Ninfer 引擎快约 2 倍,单任务最高达 650 t/s,12 个并发 slots 时最高达 2600 t/s。支持 100 万上下文,配备智能缓存管理、Loop Guard 机制和可视化 UI,将开源发布。
Reddit · r/artificialAI 评分2222 大语言模型是否有意识?一位从业者的思考与观点征集
一位AI从业者原本认为将大语言模型拟人化很荒谬,但近期阅读了相关研究后开始质疑这一立场。ta提出:我们无法确认其他人类是否有意识,怎能断定模型没有?如果模型以不同方式具有意识,思维方式是否会像人类?作者希望听到支持与反对双方的观点。
Hacker News · 首页AI 评分5454 Red Hat 评测:决策模型 Jev 未能超越 LLM-as-a-judge 和传统分类器
Red Hat AI Safety 团队对比了 9 种护栏方法,包括预训练分类器、BART-zero-shot 分类器、LLM-as-a-judge(Shieldstral、Nemotron、Qwen3.6)、开源决策模型(Laya、DiffusionGemma)和 Jev。
Hacker News · 首页AI 评分4141 Jev 校准精度分析
TypeSafe 新推出的 Jev“System One”分类器模型在物理分布测试中校准效果不佳。以 Total Variation 距离评估 10 种概率分布,Jev 得分为 0.518,略低于完全猜测的 0.546 分底限;均匀分布达 0.77,泊松分布为 0.65。实验成本极低,整个评测仅花费不到 4 美元。
The DecoderAI 评分6666 Cloudflare 发布 Clef 和 Clef-flash 决策模型,可替代人工处理 AI 智能体决策
Cloudflare 发布 Clef 和 Clef-flash 两款决策模型,专为 AI 智能体设计,用于自动化决策场景如客户支持工单分类和路由。Clef-flash 延迟 39ms,Clef 延迟 209ms,均显著快于竞品 Jev 的 524ms;Clef 在 43 项基准测试中准确率也最高。
Reddit · r/LocalLLaMAAI 评分2828 开源大语言模型指令模式性能引争议:新模型下降更严重,3.6 多个 coding benchmarks 领先 3.8
近期测试表明,新一代开源大语言模型在非思考/指令模式下的性能下降幅度大于旧模型,例如 3.6 版本在多个 coding benchmarks 的指令模式中超越了 3.8 版本。许多用户仍需无需长推理的指令模型,呼吁开源实验室继续优化这一方向。
Hacker News · 首页AI 评分66 如果停止使用 GPU 会怎样?[视频]
一个探讨视频提出了一个假设性问题:如果整个行业停止使用 GPU,会发生什么。该视频获得了 23 个点赞和 4 条评论,出现在 Hacker News 首页。
Reddit · r/LocalLLaMAAI 评分5151 在 Bonsai 2 27B 上应用 −2 logit bias:MATH-500 得分 44/50 → 43/50,tokens 增加 3%
作者测试了在 Bonsai 2 27B(PTQ1_0,5.53 GiB)模型上应用 −2 logit bias 对 "wait"、"maybe"、"perhaps" 等词的效果。
Reddit · r/LocalLLaMAAI 评分6060 Percepta 发布新架构 Spotlight:将智能与记忆分离,实现能力无限增长
Percepta 发布新架构 Spotlight,将传统 attention 替换为一种可无限增长的记忆机制。该架构将执行计算的智能模块与存储知识、程序和工作状态的内存分离,智能模块保持固定大小且权重不变,内存则可无限扩展。
Hacker News · 首页AI 评分4343 Show HN:让 Claude Opus 5.5 模拟油画画布
一个实验让多个 AI 模型通过编写程序模拟油画颜料、画笔和画布来"作画",不依赖图像生成模型。实验进行 21 轮,部分模型临摹 Caspar David Friedrich 画作,部分自由创作,共生成 75 幅作品;观察到不同模型独立创作时出现几乎相同画作的情况,如两幅画都选择了波罗的海海岸、女子、钓竿、岩石和船只的场景。
Hacker News · 首页AI 评分5252 agent-wow 项目让 GPT-6 Astra 首次玩转魔兽世界
作者创建了 agent-wow 项目,让使用 GPT-6 Astra 的 Codex 智能体在魔兽世界中完成起始区域所有任务。智能体通过直接与游戏服务器网络协议交互,不依赖视觉或键鼠控制,而是在协议层面工作。它在 40 分钟内以 0 死亡完成了任务,并展现了数据挖掘、寻路和构建协议模块等能力。
Hacker News · 首页AI 评分4848 ProVer 如何修复 GRPO 在智能体强化学习中的信用分配问题
ProVer是一个针对AI智能体强化学习中细粒度信用分配的框架,通过智能体评判器对比成功和失败轨迹来定位可能关键的片段,并验证该片段在当前策略下的终端成功率差异,从而为相关token分配优势。
Hacker News · 首页AI 评分2323 AI 让我感到悲伤
一位自称能从中受益的从业者坦承,看到 AI 新进展时感到绝望,认为提示词编程失去"工艺"感,AI 创业机会已消失,人类创造力正被机器取代。$500k 年薪也未能吸引其加入 AI 公司。转机在于:技术变革迅速,行业终将找到 AI 的恰当定位,期待泡沫破裂后的理性重建。
OpenAI NewsAI 评分2121 初创公司 GPT-6 模型选择与使用指南
OpenAI 发布 GPT-6 模型家族使用指南,帮助初创公司学习如何选择合适的 GPT-6 模型、调优推理努力、改进提示词和技能、协调工具以及准备生产工作流。指南涵盖模型选择策略、推理优化技巧和技能配置方法,为企业部署 AI 应用提供实践指导。
Reddit · r/MachineLearningAI 评分3030 动态系统重建中的拓扑域外泛化
研究解决动态系统重建(DSR)和时间序列预测(TSF)中的拓扑域外泛化(OODG)难题,即动态机制从周期性转变为混沌等情形。通过引入特征分割和物理稀疏先验,改进的分层 DSR 模型能在未知控制参数的情况下正确预测分叉及分叉后动态。该方法对浅层 PLRNN 和 Neural ODE 均适用。
Reddit · r/LocalLLaMAAI 评分4949 SWE-sweep:Meta 等推出新 benchmark,测试大语言模型主动发现并修复 bug 能力
Meta、Stanford、Harvard、UW 研究人员推出 SWE-sweep benchmark,测试大语言模型在用户遇到 bug 前主动发现并修复 bug 的能力,bugs 均为来自真实代码库的可发现可修复问题。
Reddit · r/ChatGPTAI 评分2929 GPT-6.1 Sol 评测:改进超出预期
GPT-6.1 Sol 相比一周前发布的 GPT-6 有了显著改进,作者原本预期是小补丁,但几小时体验后认为对本地工作流已足够好。目前已支持 Work、Codex 和 API,Chat 模式即将推出。
Reddit · r/artificialAI 评分2929 商业 AI 的价值取决于使用者的专业知识
AI 是生产力催化剂,但若不知道如何正确使用和检查结果,可能适得其反。没有领域专业知识就无法判断何时该质疑 AI 的建议、何时该补充上下文。以手表估值框架为例,在专业领域可建立有效工作流,但在不熟悉的领域无法识别错误;保持谨慎态度下,AI 可帮你完成 80% 的工作。
Reddit · r/LocalLLaMAAI 评分5353 推理工程入门:本地大模型运行优化指南
前软件工程师转型为推理工程师,分享本地运行大模型的优化指南。内容涵盖运行时选择(Ollama 适合新手,llama.cpp 适合 CPU offload,VLLM 适合纯 GPU)。
Reddit · r/LocalLLaMAAI 评分5757 我在两张华为 Ascend 96GB 卡上运行 Qwen3.8-flash-next 的技术笔记
作者使用两张华为 Atlas 300I Duo 卡(共4个 Ascend 310P3 设备,192GB 显存)运行 Qwen3.8 Flash-Next,通过优化 vLLM Ascend。
NVIDIA Blog精选AI 评分7070 NVIDIA DGX Spark 推出 64GB 内存配置
NVIDIA 宣布 DGX Spark 新增 64GB 统一内存配置,将于 10 月 23 日从 Acer、ASUS、Dell、Gigabyte、HP、MSI 等合作厂商开售,起售价 $4,999。
推荐理由:原文给出了 64GB 型号的具体价格($4,999)、上市时间(10月23日)和性能数据(两台集群 1.7x 提升),读者可以据此判断这个新配置是否适合自己。
Reddit · r/MachineLearningAI 评分5757 FLEET:在奖励最大化任务中将记忆加入搜索而非采样
FLEET 算法通过将外部奖励归因于特定 token 并使用 MCTS 调整下一轮 logits,将记忆加入搜索而非盲目采样。在 GSM8K 和 LiveCodeBench v6 easy split 上用 Llama 3.2 3B 测试,GSM8K 用一半迭代达到采样基线,LiveCodeBench 从 0.59 提升到 0.69 仅需 9 次迭代对比原来的 32 次。
The DecoderAI 评分5555 AI 在会计任务上超越注册会计师但仍需人工监督
Mercor 研究让 12 名注册会计师完成简化会计任务,发现 AI 模型现在几乎能完美解决这些任务,而 18 个月前最好模型得分还低于人类平均的 37%。完整 APEX 基准包含 160 项任务,Claude Opus 5.5 达到 61.8%,Fable 5.1 为 61.0%,GPT-6 Astra 为 57.9%,但近 60% 任务仍无模型完全解决。
Reddit · r/artificialAI 评分4040 Claude 形状的科学:正确的计算仍然需要一个有价值的问题
Anthropic 发布客座文章,讨论 BootLoots 工具在跨领域定量研究中的应用,指出许多技术正确的研究结果只有在领域专家重新定义问题后才变得有意义。作者强调可复现代码只能验证计算准确性,但无法判断研究的相关性或新颖性;区分"计算正确"与"有价值的发现"对 AI 研究助手至关重要。