#论文/研究
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#论文/研究
今日 1 条一手 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Google Research精选AI 评分6868 Google 研究:AI 协助三个月专利撰写实地实验显示初级律师未获持久判断力提升
Google Research 发布与 NBER 合作的论文《Does AI Assistance Enhance or Erode Expertise?
推荐理由:原文基于三个月实地实验区分了即时产出与长期判断力,可帮助读者理解 AI 工具在专业培养中的边界。
Google ResearchAI 评分4141 Google Earth AI 用 PDFM 行星地理空间基础模型赋能全球公共卫生
Google Research 团队以 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)为代表,演示了行星级地理空间基础模型在公共卫生中的新范式。
Google ResearchAI 评分3737 Google 发布《智能体隐私与安全的开放与新兴问题》研讨会报告,主张以"情境完整性"框架约束 AI 智能体行为
Google 发布一份由 50 多位学界与业界专家共同撰写的研讨会报告,系统梳理 AI 智能体在隐私与安全上区别于传统软件的三大挑战:非结构化接口带来的提示词注入、概率性控制流难以用传统测试保障,以及任务委派后用户监督失效的"确认疲劳"。报告主张以"情境完整性"理论为基础,构建包含系统级沙箱、模型级推理与用户级控制的分层防御架构,并提出由实时动态策略引擎监督智能体行为是否合乎所在情境的社会规范。
Hugging Face Blog精选AI 评分6262 Allen AI 开源 AstaBrief 8B 科学报告生成模型
Allen AI 发布并开源了 AstaBrief 8B 模型,该模型可将研究问题和检索到的文献片段转化为带引用的科学报告。作为 Asta 平台 Generate a report 功能的 Fast 模式,平均生成时间为 51.1 秒,相比 Claude 驱动的 Thinking 模式(178.5 秒)提速约 3.5 倍。
推荐理由:提供了完整的训练数据构建、偏好数据过滤、评估指标设计过程,可供研究科学报告生成模型的开发者参考。
Google Research精选AI 评分6565 Google 发布基于 TEE 的新一代联邦学习系统实现可验证隐私保护
Google 推出基于可信执行环境(TEE)的新一代联邦学习系统,可提供完全可验证和可审计的数据匿名化保证。该系统实现了端到端可验证的联邦学习流程,仅向工作负载运营商展示指标和差分隐私模型权重,训练数据只能在 TEE 中解密处理。Gboard 已部署该系统,英语和日语下一个词预测模型获得了更强的隐私保证和更高的准确率,训练时间从 1-2 个月大幅缩短。
推荐理由:Google 公开了基于 TEE 的联邦学习新系统设计,实现了可验证的数据匿名化并已部署到 Gboard 带来训练提速,对关注隐私计算和联邦学习工程实践的读者有直接参考价值。
Microsoft ResearchAI 评分3333 微软研究院如何用机器学习预测美国电网的空间天气风险
微软研究院开发了一个端到端机器学习管道,预测美国本土66,935个变电站的空间天气风险。该系统结合太阳风观测、AE和Dst指数预报及当地地质数据,可在潜在影响前30-60分钟发出警告,在评估期间检测到近80%的主要空间天气事件。GIC风险检测对主要事件(≥10 nT/min)达76.5%,严重事件(≥20 nT/min)达81.2%。
Hugging Face Blog精选AI 评分7070 Hugging Face 发布 Open TTS Leaderboard:开源多语言 TTS 与语音克隆的可扩展评估
Hugging Face 发布 Open TTS Leaderboard,使用客观指标(WER/CER 可理解性、RTFx 推理速度、TTFA 首音频延迟、SIM 说话人相似度)评估开源 TTS 模型,解决 arena 方式无法跟上模型发布速度的问题。
推荐理由:给出了具体的评估指标和部分模型排名,读者可以直接查看 leaderboard 了解各开源 TTS 模型的可理解性和速度表现。
Google DeepMind精选AI 评分6161 Google DeepMind 发布 SynthID Bio:为 AI 生成蛋白质嵌入水印技术
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,在保留生物功能的前提下向 AI 生成的蛋白质序列和预测的 3D 结构中嵌入不可察觉的签名。该技术可通过湿实验验证,已在水印蛋白质binder上成功测试,与未水印版本具有相同的命中率和结合亲和力。
推荐理由:这是首个将数字水印嵌入生物代码并能在合成蛋白质上验证的技术,读者可据此理解 AI 生物设计的安全防护新路径。
Google ResearchAI 评分5959 Google发布Diffusion Controller:统一并简化AI图像生成控制
Google Research提出Diffusion Controller框架,将图像生成的去噪过程重新定义为连续控制问题。该框架通过轻量级的“转向阻尼器”网络实现对生成轨迹的动态调整,可在不修改基础模型的情况下控制生成结果。在Stable Diffusion v1.4上的实验显示,灰盒版本在HPS-v2胜率上优于LoRA,白盒版本相较基线模型达到90%胜率。
Hugging Face BlogAI 评分5959 ProvenanceGuard:针对 MCP 智能体的源感知事实验证
ProvenanceGuard 是一个后生成验证层,用于检测 MCP 智能体答案中的跨源混淆问题。当一个声明的事实存在于某个证据中,但被错误地归因到另一个来源时,源盲目验证器会通过,但源感知验证器不会。
Google Research精选AI 评分6464 Google Research 提出多智能体框架实现连贯长视频生成
Google Research 发布多个研究框架(Co-Director、CANVAS、A²RD、VQQA)用于解决长视频生成的连贯性问题。AI video co-director 将视频叙事建模为全局优化问题,通过多智能体分层架构协调创意策略;CANVAS 维护视觉记忆确保角色和场景一致性;A²RD 支持分钟级视频的自主生成;VQQA 通过视觉问答实现闭环优化。
推荐理由:原文提出了多个解决长视频一致性问题的框架,读者可以了解如何通过多智能体协作和世界状态跟踪来改善视频生成的连贯性。
OpenAI NewsAI 评分3030 OpenAI 发布 MentalHealthBench,帮助评估 AI 在真实心理健康对话中的安全性与有效性
OpenAI 发布 MentalHealthBench,这是一款专家参与的基准测试工具,用于评估 AI 在真实心理健康对话场景中的帮助性和安全性。该 benchmark 专注于优化 AI 系统在敏感心理健康场景下的回复质量。
OpenAI NewsAI 评分3434 OpenAI 提出全球 AI 标准框架,呼吁协调评估与治理
OpenAI 概述了建立共享全球 AI 标准的路径,呼吁通过协调的评估、报告和治理机制来提高 AI 安全性。该框架旨在推动全球范围内的 AI 监管合作,确保技术发展与安全风险控制相平衡。
Google Research精选AI 评分6262 Google Research 发布利用生成式 UI 帮助教师创建互动学习工具的研究
Google Research 发布新研究实验,利用生成式用户界面(GenUI)技术帮助教育者创建定制的互动学习模拟工具。
推荐理由:这是 Google 将生成式 UI 技术应用于教育场景的研究实验,给出了具体的技术实现路径和教师反馈数据。
OpenAI NewsAI 评分2626 OpenAI 经济研究揭示工人如何解锁 AI 新工作方式
OpenAI 经济研究显示,工人正在超越传统角色使用 AI,并探索哪些新活动成为重复性工作的一部分。该研究旨在量化 AI 如何改变工作方式和职业生态。
Google ResearchAI 评分5454 绕过推理瓶颈:用 Retrieve-for-Train 加速复杂 AI 搜索
Google Research 提出 Retrieve-for-Train 框架,通过离线 RL 将搜索推理行为蒸馏到 53.9M 参数的扩散模型中。在时尚和音乐数据集上,该方法实现了 12-20 倍的推理加速,同时保持搜索结果的多样性和相关性。
Hugging Face BlogAI 评分5858 智能体任务通过了?下次还能通过吗?
IBM Research 在 Hugging Face Blog 发布研究,提出 AI 智能体存在一致性差距问题:ReAct 智能体在 AppWorld 上平均成功率 77.4%,但同一任务重复 5 次全部通过仅 53.0%,差距达 24.4 个百分点。
NVIDIA BlogAI 评分3131 费城儿童医院如何用开源NVIDIA AI为先天性心脏病儿童建模心脏
费城儿童医院(CHOP)基于NVIDIA开源医学影像框架MONAI,将过去需要4小时的心脏建模工作缩短至几秒。美国20多家儿童医院已开展心脏建模项目,波士顿儿童医院约50%的心脏手术(约每年500例)获建模支持。CHOP正结合NVIDIA Warp和Newton物理引擎,目标将模拟仿真引入临床工作流程,实现同日决策。
Google Research精选AI 评分6262 ToolGrad:基于文本“梯度”的高效工具使用数据集生成
ToolGrad 采用"答案优先"策略,先生成真实工具调用链,再标注对应用户提示,利用文本梯度迭代构建 API 工作流。实验表明该方法可生成更复杂的长程工具使用数据,pass rate 接近 100%,成本更低。
推荐理由:提出一种新的数据生成范式,可生成更复杂的工具使用数据并降低成本,学生模型甚至超越教师模型。
OpenAI NewsAI 评分3030 César de la Fuente 如何用 Codex 和 ChatGPT 搜索新型抗菌分子
César de la Fuente 实验室使用 Codex 和 ChatGPT 在现存和已灭绝基因组中搜索抗菌候选物,以应对耐药感染。该研究将 AI 应用于抗菌分子发现,挖掘沉睡数千年的遗传物质中的潜在药物线索。
OpenAI NewsAI 评分4242 OpenAI 给出 Navier-Stokes 千年奖问题的 AI 解决方案
OpenAI 发布了 Navier-Stokes 千年奖问题的 AI 生成解决方案,包含一份技术报告和 Lean 形式化证明。Navier-Stokes 方程 existence and smoothness 是 Clay 数学研究所设立的七大千年奖问题之一,目前仍未被证明或证伪。
OpenAI NewsAI 评分2424 OpenAI 提供 500 万美元资助金,支持 AI 青少年影响研究
OpenAI 推出 500 万美元资助计划,支持独立研究探索生成式 AI 对青少年发展、福祉和安全的影响。申请通道现已开放。
OpenAI NewsAI 评分2525 OpenAI 内部研究加速:编码智能体如何重塑 AI 研究
OpenAI 内部数据显示,编码智能体正在重塑 AI 研究方式,涉及 agent 使用情况、实验速度、任务复杂性和研究加速等维度的早期数据。
Google Research精选AI 评分7171 Google Research 联合发布完整雄性果蝇大脑连接组图谱
Google Research 与 HHMI Janelia、MRC 分子生物学实验室等机构合作,在 Cell 期刊发表了完整的雄性果蝇大脑和中央神经系统连接图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今为止最大的大脑图谱。该图谱可帮助科学家研究果蝇的神经机制,并为理解更复杂的大脑(包括人类大脑)奠定基础。
推荐理由:这是目前最大的大脑图谱,为研究大脑工作原理提供了基础资源,读者可了解连接组学的前沿进展及其对神经科学的意义。
Hugging Face BlogAI 评分5151 BenchMIRT:LLM benchmark 实际在测量什么
Allen AI 发布 BenchMIRT 方法,通过多维项目反应理论分析 benchmark 内部每个问题的真实测量维度。在 100 个开源模型和 16 个 benchmark(含 MMLU-Pro、GPQA、HarmBench 等)上的训练表明,模型能独立发现安全性和推理两个主导维度。
Google Research精选AI 评分6262 Google 与 NASA 合作利用深度学习从太空绘制全球甲烷排放图
Google 与 NASA JPL 合作发布了 MAPL-EMIT 深度学习框架,可从 EMIT 卫星高光谱图像中自动检测、量化并定位甲烷排放源。该模型在专家标注的 plumes 上达到 84% 召回率,比现有方法多检测约 50% 的可信 plumes,并在全球 25 个最大排放填埋场中的 24 个成功绘制了羽流。
推荐理由:原文给出了具体性能指标(84%召回率、比现有方法多检测50% plumes)和数据集规模(3.6万个合成 plumes),提供了可迁移的环境监测方法论。
Google Research精选AI 评分7878 Google 发布 TimesFM-3 零样本多变量时间序列预测基础模型
Google Research 发布 TimesFM-3,这是新一代零样本时间序列基础模型,专为多变量预测设计。模型拥有 3.3 亿参数,在超过 1 万亿时间点的真实和合成数据上预训练,支持多目标同时预测、过去协变量和过去-未来协变量。
推荐理由:读者可通过本文了解时间序列预测的基础模型最新进展,以及多变量预测相比单变量预测的具体精度提升。
Google ResearchAI 评分4343 Google Earth AI 的 Planetary Prediction Engine 如何实现全球地理空间预测自动化
Google 推出 Planetary Prediction Engine(PPE),作为 Google Earth AI 的实验性研究能力,可自主完成从数据发现到模型训练的完整地理空间预测工作流,将复杂建模周期从数周缩短至数分钟。
Google ResearchAI 评分4848 AgentHands:让XR智能体实现同步手势交互的研究原型
Google Research在CHI 2026发布AgentHands研究原型,使AI智能体能在XR环境中生成与语音同步的手势。该系统将LLM响应中的GestureEvents映射到XR设备的手势动画,通过12人用户研究验证了在植物护理指导、3D打印机操作等场景中,体感交互显著提升空间 grounding 效果。
Hugging Face Blog精选AI 评分6666 Quantization-Aware Healing:压缩到 4-bit 的模型如何超越其原始全精度版本
提出 Quantization-Aware Healing(QAH)方法,针对经过结构压缩和量化后的 LLM 进行恢复训练。核心改变是直接从原始全精度模型蒸馏,而非从恢复后的 bf16 检查点蒸馏。
推荐理由:原文给出具体实验数据:4-bit QAH 模型在 7/9 基准上超越 16-bit 源头模型,4 倍权重内存节省。这为压缩模型的恢复训练提供了可迁移的方法思路。
Google ResearchAI 评分4444 Google Research 发布 Biomarker Discovery Framework:可穿戴传感器数据候选生物标志物优先排序 AI 工具
Google Research 发布 Biomarker Discovery Framework,一个用于从可穿戴设备传感器数据中优先排序候选生物标志物的多智能体系统。
Google DeepMind精选AI 评分6161 Google DeepMind 回顾 15 年游戏 AI 研究并宣布与 EVE Online 开发商合作
Google DeepMind 回顾了从 Atari DQN 到 AlphaGo、AlphaFold 的 15 年游戏 AI 研究历程,宣布与 Fenris Creations 合作探索 EVE Universe。
Google ResearchAI 评分4848 Google Research 如何用 ME-POIs 框架让语言模型更深入理解地点
Google Research 推出 Mobility-Embedded POIs 框架,通过将聚合匿名移动模式(如到达时间、停留时长)融入地点的文本表征,解决传统语言模型仅依赖静态元数据的问题。该方法在意图预测、价格分类和繁忙度估计上分别实现 81.9%、75.1% 和 24.7% 的相对提升。框架采用访问对齐、空间多尺度传播和文本-移动协同三步流程,有效缓解了中小商户数据稀疏的"长尾"难题。
Hugging Face BlogAI 评分4545 语音识别基准测试优化问题研究:11个开源ASR模型评估
Hugging Face发布研究,引入三种测试量化语音识别领域的基准优化问题,评估11个广泛使用的开源ASR模型后发现,多个高分模型会复制基准测试的错误转录文本,即使音频内容与参考文本相矛盾。
Hugging Face Blog精选AI 评分6969 IBM Research 研究:AI 智能体需要多少记忆才合适
IBM Research 的 ALTK-Evolve 技术让智能体能从自身轨迹中提取可复用指导方针,在推理时注入。
推荐理由:原文通过8个模型的对比实验给出了明确的剂量-能力对应关系,读者可以据此为自己的智能体选择合适的记忆策略。
Google ResearchAI 评分5252 Google 发布 PhotoScan:用智能手机照片预测身体成分和胰岛素抵抗风险
Google Research 发布 PhotoScan 深度学习框架,可从标准 2D 智能手机照片估算身体脂肪百分比、Android-to-Gynoid 脂肪比和内脏-皮下脂肪比。
Hugging Face Blog精选AI 评分6363 我们从复现 ICML 2200 篇论文中学到了什么
Hugging Face 于 2026 年 7 月组织 hackathon,1200 多名社区成员用编码智能体在 19 天内复现了 ICML 2026 会议 2226 篇论文(约占会议 34%),产生 6816 份复现日志。
推荐理由:原文给出了大规模论文复现的方法论、发现和人类在智能体时代的角色思考,读者可以据此了解 AI 辅助科研验证的实践路径和潜在影响。
Microsoft Research精选AI 评分6969 MindTopo 揭示多模态大语言模型的拓扑推理能力
Microsoft Research 发布 MindTopo 基准测试,用于评估多模态大语言模型对拓扑属性的理解能力,包括连通性、包围、顺序、分离和打结。测试分为静态推理和交互式规划两类任务。
推荐理由:该研究提出了一个评估拓扑推理的新基准,揭示了当前多模态模型在静态识别和交互规划任务上的显著差距,为机器人学和交互式 AI 系统的发展提供了诊断工具。
Google DeepMind精选AI 评分6666 Google DeepMind 发布 SL2T 手语转文本模型
Google DeepMind 推出突破性的多语言手语转文本模型 SL2T,训练数据涵盖 50 多种手语超过 10 万小时。该模型首次将手语 AI 带入消费产品,已在 Gboard 和 Live Transcribe 的 Pixel 11 上线,支持美式手语转英语。
推荐理由:首个将手语 AI 实际带入消费产品的突破,在 FLEURS-ASL 基准上实现了 70 BLEURT 的零样本成绩,可供读者了解当前手语 AI 的实际可用性。
Google Research精选AI 评分7070 空架子还是丢失的钥匙?召回成为大语言模型参数化事实性的瓶颈
Google Research 发布新研究,引入知识分析框架区分编码失败和召回失败,分析了 Gemini-3、GPT-5 等前沿模型发现:编码率已达95-98%饱和,但直接召回仍失败26-34%的事实,即使启用思考仍失败11-12%。研究表明事实性错误主要源于知识可访问性问题而非知识缺失,思考能力可恢复约40-65%已编码但无法直接回忆的知识。
推荐理由:原文给出了编码vs召回的新分析框架和量化数据,读者可以据此理解前沿模型的事实性瓶颈已从知识获取转向知识利用。