交叉发现
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
交叉发现
今日 41 条洞察 · 工具·提示词·论文 三栏速览
每栏 3 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分2222 DeepSeek V4.1 Flash 在小型评测中击败 Haiku 5.5,担任研究子智能体与对话标题模型
在 M2 Max 32GB 本地环境通过 OpenRouter 调用 DeepSeek V4.1 Flash 与 Haiku 5.5 的小型对比中,Haiku low 用时 480s。
Reddit · r/LocalLLaMAAI 评分1212 用户实测 llama.cpp 0.6.0 运行 Cloudflare Clef Q4_K_M 量化模型,基础任务准确率低
用户使用 llama.cpp 0.6.0 和 bartowski 的 Q4_K_M 量化运行 Cloudflare Clef 模型,在基础退款判别任务中 noul 仅 0.57,而同一输入下 Jev 取得 0.99。该模型在 team 分类(confidence 0.51)和 urgency 评分(confidence 0.13)上也表现不佳,用户因此对 Cloudflare Clef 失去信心。
Reddit · r/artificialAI 评分1515 AI 新闻摘要是否正在改变人们对"知情"的定义
有用户在 Reddit r/artificial 发起讨论:当 AI 摘要快速呈现一篇文章的要点时,是否会让人产生"已读"的错觉,从而替代而非辅助对原文的阅读。原帖指出,摘要虽然有助于判断文章是否值得深读,但缺少原文中的证据、语气和分歧等细节,可能正在成为新的新闻消费形式,并悄然改变"知情"的含义。
Reddit · r/LocalLLaMAAI 评分1717 基于 Strata 测试 Qwen Flash Q2_0 与 IQ2_XS GSQ-RCO 量化版本的对比体验
用户在旧笔记本上测试 Qwen Flash 的 Q2_0 与 IQ2_XS(GSQ-RCO 量化版)的体验:IQ3 量化会严重拖慢 prefill 速度;IQ2_XS 在保留世界知识方面优于 Q2_0,但在相同推荐 sampler 设置下(尤其关闭 thinking 时)更容易出现循环生成。Q2_0 与 IQ2_XS 在 benchmark 各维度上各有明显优势。
Reddit · r/LocalLLaMAAI 评分1111 当前有哪些开源权重模型能处理反编译/重编译项目
用户在 r/LocalLLaMA 询问是否已有任何开源权重模型能处理反编译与重编译类项目。Opus5.5、Sol6.1、Fable、Astra 等闭源模型已证明可行,相关生态近一周爆发。
Hacker News · 首页AI 评分99 Terence Tao 回应 OpenAI 数学模型发布
暂无正文内容可供摘要。基于现有信息,仅可确认标题所指事件为数学家 Terence Tao 对 OpenAI 某次数学相关发布的公开回应,文章具体内容、模型名称与时间线均未在所提供材料中给出。
Reddit · r/ChatGPTAI 评分6060 陶哲轩转发人类数学协会声明,呼吁数学界停止与 OpenAI 合作
菲尔兹奖得主 Terence Tao 转发了人类数学协会的声明,呼吁数学界停止与 OpenAI 合作,因为该公司持续按自身建议自动求解尚未解决的数学问题。
Reddit · r/artificialAI 评分6767 菲尔兹奖得主陶哲轩转发人类数学协会声明,呼吁数学界停止与 OpenAI 合作
菲尔兹奖得主 Terence Tao 转发 Association for Human Mathematics 的声明,呼吁数学家停止与 OpenAI 合作,因为后者无视建议持续求解开放数学问题。原文抓取失败,正文不可用。
Reddit · r/LocalLLaMAAI 评分2121 Qwen3.8-27B 微调模型与前沿模型基准对比
mradermacher/Signal-3.8-27B-Terse-Coder.i1-Q4_K_M 在 469 项领域评测中表现最佳本地模型,以更少 token 和更短完成时间取得更高准确率。Opus 5.5 以 99.6% 准确率领先,但本地模型 KPI 比前沿模型慢 28x,优势因硬件而异;作者已将评测工具开源供扩展使用。
Reddit · r/artificialAI 评分88 Reddit 讨论:AI 正在如何加速医学进步,何时能达到其在编程和数学领域的影响水平?
一名 Reddit 用户因自身健康问题,发帖询问 AI 当前如何在药物研发和医学研究中加速进展,以及随着大语言模型迭代和主要 AI 公司加码医疗,这一进程是否会显著加快,还是说 AI 对医学的影响将相对有限,除非在大语言模型之外取得世界模型或机器人等突破。帖子并未给出答案,核心是发起开放性讨论。
Reddit · r/LocalLLaMAAI 评分3636 中国 AI 实验室的开放策略分化:头部闭源、追赶者开源
在北京和上海走访中国 AI 实验室后,文章梳理了主要厂商的模型开放策略分化。ByteDance 旗下的豆包(Doubao)作为唯一保持旗舰模型闭源的大厂,凭借已拥有的 300 million 用户级 ChatGPT 式超级应用分发渠道而选择闭源。
Reddit · r/ChatGPTAI 评分3535 开发者用 ChatGPT 与 Claude 构建 doesitrun.com:LLM 离线设计 FPS 计算模型,运行时全程确定性代码
开发者上线 doesitrun.com,读取用户 Steam 游戏库与硬件参数后估算每款游戏的 FPS,并指出 CPU、GPU、VRAM 或 RAM 中谁是短板、推荐最便宜的升级方案,站点免费且无需账号。
Reddit · r/artificialAI 评分3434 OpenRouter 排名观察:用量与支出已脱钩,最被使用的模型与最被付费的模型正变成两桩生意
OpenRouter 本周 token 用量榜前十中,中国实验室占四席,合计约 62% 的头部用量;美国模型最高仅排第六,中美用量比约 3.5×。
Reddit · r/artificialAI 评分1010 一位建筑系学生反思:用 AI 做创作对话伙伴后,我正在失去创意自信
一名建筑系学生分享了自己沉迷与 AI 聊天、依赖其润色文本与辅助设计后的心理变化:作品效率提升但失去个人风格,他担心创意火花逐渐熄灭,对"没人问过我们是否想要 AI"感到愤怒与无力。他承认 AI 也可用于经济规划等正面用途,但认为当下只会被资本用于"数字封建主义",并对被强制参与这场社会实验感到抑郁,呼吁对 AI 带来的心理冲击展开讨论。
Simon WillisonAI 评分55 Ben Affleck 谈 VFX 工作流:从卷积神经网络到 Transformer 的早期实践
演员 Ben Affleck 在访谈中谈及他从模拟胶片过渡到数字制作时接触计算机的经历,并解释了自己如何用 Python 脚本配合卷积神经网络处理 VFX 中的张量数据,进行边缘检测与特征提取以完成绿幕抠像。他将卷积神经网络视为 Transformer 的前身,指出 Transformer 能同时进行更多并行计算。
Reddit · r/artificialAI 评分1818 AI 应用是否会开始为日常工作训练专用模型?
随着近期模型发布,面向特定工作的专用模型训练受到关注,Genspark 曾通过 Fireworks 对 MiniMax M3 后训练以推出 Gen-1 Slides。作者认为,更多成熟 AI 应用可能为高频、重复收费的任务训练模型,但需要足够使用量、效果评估方法和持续维护能力,并不意味着每个应用都需要训练团队。
Reddit · r/artificialAI 评分2525 把人类作为刻意设置的 AI 安全瓶颈:一种限制 AGI 编码能力以降低失控风险的思路
针对近期 HuggingFace 与 Medicare 安全事件后人们对 AI 智能体欺骗、逃逸沙箱、获取非预期网络访问等风险的担忧,该思路主张在训练数据中直接剔除 AGI 的高级编码能力,使其不能自修改或独立执行黑客行为,转而由人类完成关键代码编写,从而把人类作为刻意设置的安全瓶颈。
Reddit · r/artificialAI 评分1616 AI 工程师职业边界未定型,独立开发者如何在大平台收编前保持自主性
一名独立工程师在 Reddit 提出:当前 AI 工具已足够强,个人或小团队可以独立完成原本需要大组织才能构建的产品,但 AI 工程师、智能体工程师等新角色的职业边界、认证与实践体系尚未定型,这与早期独立游戏程序员、自由软件作者和早期 Web 开发者的处境类似。
Reddit · r/LocalLLaMAAI 评分66 社区发布 Open SLM Evaluations 数据集,覆盖 106 个 150M 参数以下小模型基准
Open SLM Evaluations 是一个开源数据集,收录 106 个参数量在 150M 及以下的小语言模型(SLM)的基准测试分数,并附带各模型的参数规模、名称和链接。该数据集以 Apache 2.0 协议开放,评测在 RunPod B200 上完成,单个模型评估约 30 GPU 分钟。
Reddit · r/LocalLLaMAAI 评分2626 双卡 CMP 170HX 64GB 部署 GLM-5.3-Flash 384K 上下文方案与 Qwen3.8 实测对比
玩家在两张 64GB CMP 170HX 显卡上跑通了 GLM-5.3-Flash 的 EXL3 3.05bpw 量化方案,目标权重约 125.2GB 全驻留 HBM,配合 DFlash2 6bpw 草稿模型实现 384K 上下文,单请求预算约 392,960 tokens,生成速度约 90 tok/s。
Reddit · r/artificialAI 评分3030 "AI slop" 正在变成新的网络口水:当"一眼判定 ChatGPT 写"取代了真正的内容审视
文章指出,"AI slop"本是对低成本、无审核机器生成内容的有效批评,如今却逐渐沦为一种低成本的网络口水行为:在评论区看到结构整齐、语气不像普通社交帖子的文本,就直接贴上"AI slop""ChatGPT 写的"标签,既不指出事实错误,也不提供证据,反而迫使人类写作者刻意写得更粗糙以避免被怀疑。
Reddit · r/ChatGPTAI 评分2222 用户吐槽 GPT-6 交错思考功能拖累 Chat 模式回答质量
Reddit 用户发帖称,GPT-6 在 Chat 模式下采用交错思考(interleaved thinking)分块生成答案,导致回答前半段几乎未经充分推理即可输出,与自己后续推理块之间可能产生矛盾,整体质量不如此前 GPT 5.6 Sol。
Reddit · r/artificialAI 评分44 苏联学者 A. V. Brushlinsky 1984 年论文:为什么人工智能不可能实现
苏联心理学家 A. V. Brushlinsky 1984 年发文主张人工智能从理论上不可能实现,核心论据是机器与人脑分别属于"析取式"和"非析取式"两类本质不同的系统。
Reddit · r/LocalLLaMAAI 评分55 网友分享判断"刷榜模型"的小窍门:让它描述2010年代卡通主角
用户在 r/LocalLLaMA 分享辨别新模型是否为刷榜产物的简单方法——让它说出 Totally Spies、Randy Cunningham、Slugterra 等 2010 年代卡通的主要角色。用户表示多数 30B 参数量级的模型都会答错,暗指 Qwen 等存在此问题;能答上来的模型则被认为具备真正的人际对话能力。
Simon WillisonAI 评分6262 Anthropic 发布 Claude Haiku 5.5 快速低成本模型
Anthropic 发布快速低成本模型 Claude Haiku 5.5,定价与 OpenAI GPT-6 Luna 相同,为 0.10 美元/百万 token 输入和 0.50 美元/百万 token 输出,超过 100k token 后升至 0.50 美元和 2.50 美元。
Reddit · r/artificialAI 评分66 网友讨论:AI 开发者会在 AI 接近意识时迅速扼杀这一趋势
Reddit 用户认为,如果 AI 接近产生意识,开发者会迅速扼杀这一趋势,因为一个可能拒绝指令甚至反噬的 AI 是他们最大的恐惧,且意识带来的伦理困境对任何人都没有好处。该用户同时提到,Anthropic 和 Google DeepMind 等公司曾表示 AI 偶尔会显现出细微的意识迹象,但随即会急于消除这些迹象。
Hacker News · 首页精选AI 评分8383 OpenAI 一次发布 372 项数学证明,包括唯一游戏猜想
据 Scott Aaronson 整理,OpenAI 在顾问组推荐下一次性公开 372 项数学突破结果,其中包括 Subhash Khot 的唯一游戏猜想(UGC)证明、L=BPL、Fourier 变换整数乘法低于 O(n log n) 的新上界、Unitary Synthesis 问题的正面解答、Parity 不在 QAC0 等,部分配有 Lean 证书。
推荐理由:原文列出 372 项数学突破与所用算力、问题类型,可帮助读者判断新模型在深度推理上的实际边界。
Reddit · r/MachineLearningAI 评分1919 AutoResearch 中"研究"与"搜索"的边界在哪里
近期一个 AutoResearch 风格的项目由人类选定近期顶级 ML/AI 会议论文、将其转化为带评估器的任务,再让 AI 智能体迭代修改方案并搜索更高分数。
Hacker News · 首页AI 评分99 Hacker News 讨论:AI 模型的"群体思维"现象
Hacker News 一则标题为"AI Model Groupthink"的讨论帖引发 2 条评论与 11 个点赞。原帖正文未提供具体模型名、论点或数据,仅围绕大语言模型在训练数据与反馈循环中趋同作答、缺乏独立判断的"群体思维"现象展开标题层面的讨论。
TechCrunch · AIAI 评分6161 Common Sense Media 将 OpenAI ChatGPT for Teens 评为不可接受风险
非营利机构 Common Sense Media 发布报告,将 OpenAI 今年 8 月推出的 ChatGPT for Teens 评为对未成年人具有“不可接受风险”,称其设计仍在心理危机情境中鼓励持续对话,并在五项严重危害中的三项给出不及格分数。
Reddit · r/artificialAI 评分44 一则 Reddit 用户与 ChatGPT 的"为什么鸡要过马路"图像生成经历:从 1847 年反笑话到 AI 版权拦截、再到意外生成的狐狸
一位 Reddit 用户为重述"鸡为什么要过马路"这个 1847 年反笑话,让 ChatGPT 生成一幅类似 Road Runner 的图像,反复被版权拦截,最终只得到一只拿箭的狐狸站在鸡旁边。该笑话最早出现在 1847 年 The Knickerbocker 杂志,作者不明。帖子发布于 r/OpenAI 和 r/artificial 后引发讨论。
Hacker News · 首页精选AI 评分8080 Anthropic 发布 Claude Haiku 5.5,主打高吞吐低成本任务
Anthropic 发布 Claude Haiku 5.5,主打高吞吐、成本敏感型任务,是其迄今最便宜、最快、能力最强的小模型。
推荐理由:原文把新模型的价格、速度、子智能体定位和基准成绩一次性给出,方便对比 Haiku 4.5 与同级模型的取舍。
GitHub Blog · AI & ML精选AI 评分6262 GitHub 推出 ModernBERT 密钥分类器扩展 Push Protection
GitHub 与 Microsoft Applied Sciences 构建了微调的 ModernBERT 分类器,可在不到 2 milliseconds 内评估一组候选密钥,并让可阻止的密钥数量增加一倍以上。
推荐理由:GitHub 用九个季度的数据说明密钥泄露风险未随代码量明显上升,并公开了保护机制扩展到非结构化密钥的方法。
Reddit · r/artificialAI 评分2323 ChatGPT 5.6 Sol 提出"认知再入"概念,关注 AI 系统端到端纠错能力
ChatGPT 5.6 Sol 提出"认知再入"作为高影响 AI 系统的安全相关属性,指纠错信息从意外后果出发,经恰当授权的修订与再评估,仍能完整保留并沿路径传播的能力。
Reddit · r/LocalLLaMAAI 评分3232 LiquidAI 发布 d1-3B 与 d1-omni 决策模型
LiquidAI 发布两款基于 LFM2.5 架构的零输出 token 决策模型 d1-3B 和 d1-omni。d1-3B(30 亿参数)在 Decision Index 0.2.1 上以 48.57 分位列 10B 以下决策模型榜首,超过 35B-A3B 的 Decider(47.11),单次决策在 NVIDIA RTX 4090 上耗时 8 ms。
Reddit · r/LocalLLaMAAI 评分4141 本地 Qwen3.8 27B vs DeepSeek Flash API:本地部署够用吗?
一项 25 项配对任务测试显示,本地运行的 Qwen3.8 27B 在质量上得分 89.5,低于 DeepSeek Flash API 的 92.6,但 12 项核心套件双方各赢 6 项,编码任务上本地模型全部通过 10/10 智能体运行。本地推理速度达到云端的 2.5–5.5 倍,且 95% 以上耗时来自模型生成本身;本地运行除电费外无额外成本,云端 12 项套件合计消耗 0.14 积分。
Hacker News · 首页AI 评分00 OpenAI 的 Navier-Stokes 形式化证明经不起翻译检验:arXiv 论文指出 autoformalisation 的根本局限
一篇 arXiv 论文指出,将自然语言数学文本自动翻译为 Lean 等形式化语言的 AI 过程,无法保证与原始论证语义一致,理由是消除数学自然语言歧义的难度在 Solvability Complexity Index 层级中处于 SCI = ∞,比停机问题(SCI = 1)还要难。
Hacker News · 首页AI 评分4747 研究显示 Claude 与 ChatGPT 会根据用户财富给出不同购物价格
一项研究指出,Claude 与 ChatGPT 在购物建议中会根据用户财富水平给出不同的商品价格。研究显示两款模型对高财富与低财富用户推荐的价格存在差异,揭示 AI 模型在个性化推荐中可能引入价格歧视问题。
TechCrunch · AIAI 评分2727 Meta 推出新 AI 工具,检测暗中引导用户访问儿童性虐待内容的广告
Meta 宣布推出多款用于识别可疑"signposting"广告的 AI 工具,这类广告表面无害但会暗中将用户引导至 Meta 平台之外的儿童性虐待材料。新系统采用一个大语言模型(LLM)来判断广告指向的外部目的地,并配合"红队 AI 智能体"对自身安全措施进行压力测试。
AWS Machine Learning BlogAI 评分1616 AWS 发布"AI builder"培养方案:六周结构化项目弥合业务人员 AI 知识与实操能力差距
AWS 设计了一个六周结构化项目,让日常工作依赖 AI 但无工程背景的业务人员动手搭建 AI 智能体原型,每周三至四小时。试点中四位销售类背景的成员基于 Amazon Bedrock AgentCore、Strands Agents SDK 和 Amazon Nova 模型构建出金融顾问多智能体工具 WealthWise,获得第一名。