#论文/研究
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#论文/研究
今日 4 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/artificialAI 评分55 Reddit 用户为大学项目征集 AI 未来发展的正反两面观点
一位 Reddit 用户(stuuupidguy)的朋友正在开展关于"AI 的使用及其未来可能发展"的大学研究项目,公开征集对 AI 的正面与负面观点。该项目以 Google 表单形式收集反馈。
Reddit · r/artificialAI 评分2828 AI 如何解决蛋白质折叠问题:AlphaFold 的同构映射方法
AI 通过创建进化序列数据、空间约束与 3D 物理坐标之间的同构几何映射解决了蛋白质折叠问题,绕过了从第一性原理进行原子级物理模拟的传统路径。AlphaFold 2(DeepMind,2020)采用 Evoformer 双流架构,利用多序列比对(MSA)捕获进化相关性,并通过 SE(3) 等变 3D 坐标变换器直接预测氨基酸残基的刚体框架。
Reddit · r/artificialAI 评分4848 Anthropic 机器人研究:任务能力与成本分离,哪些假设需仔细审查?
Anthropic 9月30日研究用 Claude 评估任务示例、运营环境和部署成本,估计现有机器人可完成占美国工作时间34%的任务,但仅0.3%在成本上与人类劳动相当。研究未预测就业岗位消失,而是区分了任务能力与成本竞争力两个不同指标。需审查的关键是评估任务到完整工作流程间的监督、失败、交接和仍需人工完成的任务。
Reddit · r/MachineLearningAI 评分2020 如何在顶级 AI 会议回应审稿人对创新性的质疑
一位计算机视觉研究者就如何在 NeurIPS、ICLR、CVPR 等顶级会议回应审稿人关于"创新性不足"的反馈发出求助。帖子探讨了研究者在每年数万篇论文的拥挤领域中,如何清晰呈现贡献的创新性、如何区分有意义的增量进展与不够创新的工作,以及审稿人判断创新性的标准。Reddit 用户纷纷分享了应对此类质疑的策略与经验。
Reddit · r/MachineLearningAI 评分3030 OpenAI 的 Lean 4 Navier-Stokes 形式化证明:数学正确但流体在 0.7nm 处蒸发,neuro-symbolic AI 面临物理边界挑战
OpenAI 在 Lean 4 中完成了 3D Navier-Stokes 爆炸问题的形式化证明,数学上编译零错误,是自动化推理的重大里程碑。但将解映射到现实水时,流体在 0.7 纳米处因摩擦直接蒸发,仅在数学奇点前几皮秒。
Reddit · r/MachineLearningAI 评分5050 RadarScenes 多帧雷达目标分类研究
作者在 RadarScenes 数据集上构建了多帧雷达目标分类器,将单帧分类器扩展为累积观测的历史序列。单帧 baseline 达到 0.7370 macro F1;20帧点池化提升至 0.8613(+0.1243);因果GRU进一步提升至 0.8895(+0.0282)。
Reddit · r/MachineLearningAI 评分4545 Qwen 系列大语言模型悄然成为现代音频模型的骨干;100+ 音频模型的架构图谱
在 audio.cpp 项目中,Qwen 系列已成为最常见的语言骨干,32 个音频模型家族采用 Qwen 架构,其中 20 个使用 Qwen3 LLM。Qwen 驱动的模型已覆盖语音合成、ASR/音频理解、音乐生成、语音转语音及音视频模型等多个领域。
Reddit · r/MachineLearningAI 评分5555 现代 NLP 分词技术综述
32 位分词研究者历时约 8 个月完成迄今为止最全面的分词领域调查,涵盖分词算法、评估、多语言处理、编码、理论以及分词器的潜在替代方案(如潜在分词或视觉分词),同时涉及约束生成、分词修复和分词器安全等相关主题。
Reddit · r/LocalLLaMAAI 评分2525 如何深入学习本地大模型微调:Qwen 27b 案例指南
用户在 Reddit r/LocalLLaMA 社区询问系统学习本地模型微调技术的途径,目标是用自定义语料库微调 Qwen 27b 构建法律通用聊天机器人。帖子提及 RL、RL LoRA、QLoRA、CPT LoRA 等新技术,但发现 YouTube 教程质量参差不平,知名频道 fireship、bycloud 也未覆盖这些新概念,希望能找到实践性强且避免浪费金钱和时间的学习资源。
Hacker News · 首页AI 评分2929 TLA+ 能检查什么和不能检查什么
Claude Code 发明者 Boris Cherny 提到 Opus 可用 TLA+ 查找代码竞态条件,引发对形式验证的热议。TLA+ 擅长检查安全属性(不变式、动作属性)和活性属性(<>P、[]<>P 等),但无法表达不可形式化的属性、多步属性、浮点数操作、真实时间,以及"存在某行为满足P"这类可达性属性和超属性。
Microsoft ResearchAI 评分3333 微软研究院如何用机器学习预测美国电网的空间天气风险
微软研究院开发了一个端到端机器学习管道,预测美国本土66,935个变电站的空间天气风险。该系统结合太阳风观测、AE和Dst指数预报及当地地质数据,可在潜在影响前30-60分钟发出警告,在评估期间检测到近80%的主要空间天气事件。GIC风险检测对主要事件(≥10 nT/min)达76.5%,严重事件(≥20 nT/min)达81.2%。
Reddit · r/MachineLearningAI 评分3434 在 CICIDS2017 数据集上 max_samples=1.0 时 Isolation Forest 获得约 94% 召回率与 7.6% FPR
研究者在 CICIDS2017 数据集上训练 Isolation Forest 进行异常检测,发现 max_samples=1.0 时模型达到约 94% 召回率与约 7.6% 假阳性率,相比 max_samples=200k 的约 91% 召回率与 10% 假阳性率表现更优,训练时间仅增加 30 秒。
Ars Technica · AIAI 评分5454 Google 研发 AI 设计蛋白质的水印技术
Google DeepMind 团队发表研究,提出 SynthIDBio 水印技术,可在 AI 设计的蛋白质序列中嵌入隐藏标记,且不影响蛋白质功能。该技术基于 ProteinMPNN 工具,在氨基酸选择过程中系统性地融入水印信息,可被专用软件检测。
Hugging Face Blog精选AI 评分7070 Hugging Face 发布 Open TTS Leaderboard:开源多语言 TTS 与语音克隆的可扩展评估
Hugging Face 发布 Open TTS Leaderboard,使用客观指标(WER/CER 可理解性、RTFx 推理速度、TTFA 首音频延迟、SIM 说话人相似度)评估开源 TTS 模型,解决 arena 方式无法跟上模型发布速度的问题。
推荐理由:给出了具体的评估指标和部分模型排名,读者可以直接查看 leaderboard 了解各开源 TTS 模型的可理解性和速度表现。
Google DeepMind精选AI 评分6161 Google DeepMind 发布 SynthID Bio:为 AI 生成蛋白质嵌入水印技术
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,在保留生物功能的前提下向 AI 生成的蛋白质序列和预测的 3D 结构中嵌入不可察觉的签名。该技术可通过湿实验验证,已在水印蛋白质binder上成功测试,与未水印版本具有相同的命中率和结合亲和力。
推荐理由:这是首个将数字水印嵌入生物代码并能在合成蛋白质上验证的技术,读者可据此理解 AI 生物设计的安全防护新路径。
Reddit · r/MachineLearningAI 评分5454 ORTUS AI 开源 RightWayUp 360 度图像旋转检测模型
ORTUS AI 开源了图像旋转检测模型 RightWayUp,可判断图像 360 度旋转角度并在无明确"上"方向时选择不预测,发布 Apache-2.0 许可的代码和权重(6 种规格)。
Reddit · r/MachineLearningAI 评分4848 论文现在为机器而非人类撰写
学术审稿人发现近年来论文写作质量明显下降,大量使用未定义的论文特定术语,人类读者从头阅读无法理解,但AI因具备全文上下文可以瞬间解释。作者假设形成了一个恶性循环:AI辅助审稿奖励这种模糊写作风格,被接受的论文成为训练数据后,新模型学会同样写法,导致问题加速恶化。论文应首先服务人类读者,而非AI审稿工具。
Reddit · r/MachineLearningAI 评分4646 Google/DeepMind 联合研究提出 CO₂Jump:解决文本与图像联合生成中的不一致问题
研究团队提出 CO₂Jump 采样器,通过文本置信度和跨模态注意力引导图像更新,允许低置信度 token 被遮蔽并重新生成,从而在生成过程中修正早期决策。该方法无需额外训练,每个去噪步骤仅需一次模型前向传递。在图像编辑、迷宫求解和非ograms 基准测试中,CO₂Jump 是唯一在 8-512 采样步骤内单调提升编辑质量和语义对齐的采样器。
Reddit · r/artificialAI 评分3838 Anthropic 开放 AI 访谈公众发布权限,我们该如何弥补代表性不足?
Anthropic 于 9 月 29 日至 10 月 6 日推出 Claude 用户访谈研究,参与者需账户至少满两周,发布完整访谈为可选项。FAQ 明确指出该样本不代表公众,且同意公开者为精选子集,访谈问题本身也会影响内容呈现。作者呼吁公开完成与发布访谈的数量、问题措辞及主题编码方式,并补充对未使用 Claude 或不愿公开经历者的研究。
Hacker News · 首页AI 评分5151 数学社区呼吁AI实验室负责任地发布AI生成数学成果
数学社区发布建议文档,呼吁前沿AI实验室停止在闭源模型上测试高级数学问题,要求其负责任地发布AI生成的数学成果,包括提供详细的技术文档、形式化证明、支持人类理解的发展,并确保广泛的模型访问权。
Reddit · r/LocalLLaMAAI 评分6363 Sherry三进制3:4格式在WebGPU上运行:1.6 MB模型玩Connect Four,效果接近7.8 MB int8版本
Precisit团队实现了Sherry提出的3:4三进制量化格式在浏览器中运行。模型为740万参数的Connect Four评分器,权重仅1.375 bits per weight(5 bits存4个权重),在Chrome上用WebGPU运行延迟1.1ms/步。
Reddit · r/artificialAI 评分6565 PSSA:一种新型状态空间模型在参数匹配条件下超越 Transformer
研究者从头构建了 PSSA(Plastic State Space Architecture)架构,并在相同语料、相同 12.7M tokens、相同分词器和训练计划下与参数匹配的 Transformer 基线对比。
Hacker News · 首页AI 评分6666 开源工具 livenerf 发布:追踪 Claude Opus 5.5 发布后能力漂移
livenerf 是一个针对 Claude Opus 5.5 的基准测试工具,于 2026-09-24(发布后约 2.5 天)开始运行,计划连续 30 天每天运行一次以追踪模型能力变化。
Ars Technica · AI精选AI 评分7777 AMD 82亿美元收购 World Labs,李飞飞创立的世界模型公司
AMD 宣布将在年底前收购世界模型公司 World Labs,交易估值 82 亿美元。该公司由计算机视觉科学家李飞飞于 2024 年创立,获得了 2.3 亿美元融资(部分来自 AMD),其首个公开工具 Marble 可生成用于影视和游戏制作的 3D 资产。Nvidia 在该领域处于领先地位,AMD 此前虽有开源世界模型 Micro-World,但缺乏与 Nvidia Cosmos 竞争的产品。
推荐理由:AMD 收购 World Labs 后将在世界模型领域直接与 Nvidia 竞争,82 亿美元的交易额反映了该技术对 AI 硬件厂商的战略价值。
Reddit · r/MachineLearningAI 评分2020 货架审计中 YOLO + 嵌入向量的尺寸变体识别难题如何解决
作者构建的货架审计工具采用YOLO检测产品后用嵌入向量搜索SKU,但同一品牌、相同瓶子不同尺寸(1.25L vs 2L)的产品容易被误识别。尝试DINOV2、SigLIP2、OpenCLIP等嵌入模型均失败,原因在于图片被letterbox到224x224后小尺寸文字几乎消失,且参考图只有货架照片而非棚拍图。作者询问是否需微调嵌入器增加硬负样本、用OCR作为第二检查,或放弃全局嵌入方案。
Reddit · r/MachineLearningAI 评分2222 如何将工业界的ML项目转化为学术论文发表?
一位制造业数据工程师想将工作中的ML/DL项目转化为学术论文发表,但缺乏发表经验,询问如何判断项目是否适合发表、如何将工程问题转化为研究问题,以及首次发表需要的创新程度。几位有发表经验的网友提供了从确定研究贡献到撰写论文的实用建议。
Reddit · r/MachineLearningAI 评分4242 OpenTrainDNN:基于浏览器的实时神经网络可视化工具
OpenTrainDNN 是一款开源的客户端 Web 应用,可实时可视化深度神经网络的训练过程。该工具无需后端服务器、专业硬件驱动或本地安装,即可直接观察反向传播、激活流和权重更新的每一步动态。
Reddit · r/MachineLearningAI 评分77 使用 LLM 进行文本聚类的研究论文有哪些?
Reddit 用户寻求使用大语言模型进行文本聚类的方法。该用户有约 100 个文档文件,目标是根据相似程序或内容进行聚类。传统机器学习聚类方法(K-means、层次聚类、DBSCAN)依赖词汇或模板匹配,聚类效果不理想。
Reddit · r/MachineLearningAI 评分1818 为什么不在 softmax 前少用一个特征?[D]
开发者提出一项 softmax 优化方案:利用输出和为1的约束条件,将 N 个输入减少为 N-1 个,让最后一个 logit 等于其他 logits 之和的负值。该方案可移除 softmax 前最后一层的冗余参数,理论上可能加速模型收敛,但实际收益可能微不足道。
Reddit · r/MachineLearningAI 评分4141 Browser demo: 5.6k 参数 REINFORCE 策略在 Clash Royale 防守布局中学习对抗暴力最优解
开源 Clash Royale 模拟器推出浏览器交互演示,REINFORCE 策略仅用 5,629 个参数学习单次决策的防守布局。策略在 C++ 编译为 WebAssembly 的引擎中训练,对比 brute force 最优解可验证学习效果:Giant vs Cannon 存在强局部最优解,线性熵退火可减少陷入概率。
Reddit · r/MachineLearningAI 评分1313 医学影像元学习:当前有哪些热门研究方向?
一位医学影像元学习方向的新博士生在寻求研究方向建议,已了解少样本学习、组织病理学数据集、基础模型适应和领域泛化。提问者对MICCAI挑战赛较感兴趣,希望寻找与解决数据有限问题相关的前沿课题。
Reddit · r/MachineLearningAI 评分2020 CVPR投稿计算资源有限:应该rerun实验还是专注写论文?
一位研究者准备CVPR投稿,计算资源有限且设备慢而不稳,单次实验已耗时颇多。面临两难:是否用不同seed重新实验以获得mean ± std和统计显著性,还是保留现有结果把时间用于写论文。社区建议在资源受限时,优先保证论文质量,单seed结果配合可复现代码通常足够。
Reddit · r/LocalLLaMAAI 评分4949 研究发现后训练让 LLM 更有趣但降低回答多样性
研究通过 11 个训练阶段、100 个笑话提示词、64 位人类评分者评估 Tulu 3(基于 Llama 3.1 70B)、OLMo 3.1 32B 和 Qwen2.5 发现:7 个训练步骤中 5 个的后期模型笑话更有趣,笑话长度缩短 10-20 词;但同提示词生成的笑话相似度增加,Qwen2.5 base 到 instruct 阶段多样性下降最显著。
Hacker News · 首页精选AI 评分7676 Anthropic 发布 GLM-5.3 网络安全能力分析报告
Anthropic 发布研究分析,评估中国智谱 AI 开发的 GLM-5.3 模型的网络安全能力。研究发现 GLM-5.3 能够自主构建端到端网络漏洞利用,在 ExploitBench 基准测试中成功开发 50/410 个漏洞利用。
推荐理由:原文给出了 GLM-5.3 的具体安全测试数据,展示了绕过防护的手段和成功率,读者可据此评估开源权重模型的安全风险。
Hacker News · 首页AI 评分5959 Bain报告:AI行业需年收入6万亿美元才能证明数据中心投资合理
Bain报告显示,AI行业到2031年需实现6万亿美元年收入才能证明数据中心大规模投资的合理性。其中新产品开发预计贡献约4.2万亿美元,包括搜索、广告、自动驾驶和实体AI;企业生产力需1-1.4万亿美元;消费级服务预计贡献2000-4000亿美元。
Google ResearchAI 评分5959 Google发布Diffusion Controller:统一并简化AI图像生成控制
Google Research提出Diffusion Controller框架,将图像生成的去噪过程重新定义为连续控制问题。该框架通过轻量级的“转向阻尼器”网络实现对生成轨迹的动态调整,可在不修改基础模型的情况下控制生成结果。在Stable Diffusion v1.4上的实验显示,灰盒版本在HPS-v2胜率上优于LoRA,白盒版本相较基线模型达到90%胜率。
Reddit · r/artificialAI 评分5555 AMD 宣布收购李飞飞的 World Labs,交易价值数十亿美元
AMD 正在收购李飞飞创立的 World Labs,交易价值达数十亿美元。
Hacker News · 最佳AI 评分2626 Reddit 厨刀社区是否存在虚假营销问题?数据分析揭示了什么
分析 Reddit 六个厨刀 subreddits 发现,一个品牌 31% 的"应该买什么"提及来自 5% 的账户,是随机概率预测的 4 倍。研究将这些高活跃度账户标记为"品牌忠诚"账户,其在购买推荐帖中的出现频率远超发帖量所能解释,表明可能存在付费水军活动。
Hacker News · 首页AI 评分3232 MicroLLM Lab:在浏览器中测试 7 个小模型
MicroLLM Lab 是一个浏览器端的开源基准测试工具,可运行 7 个 tiny LLM(135M 参数起)的推理速度和准确率测试。用户选择模型后即可运行,测试数据保留在本地设备上。工具支持用 JavaScript 编写自定义检查函数来验证模型输出。
Reddit · r/artificialAI 评分5555 研究机构发布首个 AI 模型能耗对比仪表板
AI 发展导致电力需求激增,但各模型能耗差异巨大。Sustainable AI Group 开发了一种后门方法来估算和比较 Anthropic、OpenAI 和 Google 模型的能耗,并于周二发布了交互式仪表板,按能源强度排名 AI 程序。