#多模态
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#多模态
今日 0 条研究 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Hacker News · 首页AI 评分3535 UniEvo-VL:面向多模态模型自改进的自蒸馏训练框架
UniEvo-VL 是一种让单个多模态模型同时充当教师与学生的自进化框架,通过学生与教师条件下的去噪扩散分布之间的逐状态散度最小化,在测试时利用模型自身的批判反馈进行自蒸馏训练。
The DecoderAI 评分6363 研究:AI 智能体从照片构建 3D 场景但缺乏自我判断能力
研究人员提出 LEGO-Anything 系统,让编码智能体接收单张照片后编写 Blender 代码迭代构建 3D 场景,并推出 LEGO-Bench 基准测试进行评估。GPT-6 Astra 在室内场景达到 53.4%、户外场景达到 39.6% 的准确率。研究发现智能体即使在推理预算增加后分数大幅提升,其几何判断能力仍接近随机水平,无法准确评估自身输出的质量,这是当前方法的主要瓶颈。
Reddit · r/artificialAI 评分5555 瑞典 Chalmers 大学开发可自主设计并执行实验的 AI 系统
瑞典 Chalmers 大学研究人员开发了一个闭环 AI 系统,可生成生物假设、决定测试方法、将计划转换为机器可读指令、分析实验结果并利用发现改进后续问题。该系统在酵母菌(Saccharomyces cerevisiae)上进行了测试,将大语言模型与形式逻辑、生物数据库、机器学习、自动细胞培养和质谱技术相结合,研究成果发表于《皇家学会界面杂志》。
Reddit · r/MachineLearningAI 评分4545 Qwen 系列大语言模型悄然成为现代音频模型的骨干;100+ 音频模型的架构图谱
在 audio.cpp 项目中,Qwen 系列已成为最常见的语言骨干,32 个音频模型家族采用 Qwen 架构,其中 20 个使用 Qwen3 LLM。Qwen 驱动的模型已覆盖语音合成、ASR/音频理解、音乐生成、语音转语音及音视频模型等多个领域。
Reddit · r/MachineLearningAI 评分2020 货架审计中 YOLO + 嵌入向量的尺寸变体识别难题如何解决
作者构建的货架审计工具采用YOLO检测产品后用嵌入向量搜索SKU,但同一品牌、相同瓶子不同尺寸(1.25L vs 2L)的产品容易被误识别。尝试DINOV2、SigLIP2、OpenCLIP等嵌入模型均失败,原因在于图片被letterbox到224x224后小尺寸文字几乎消失,且参考图只有货架照片而非棚拍图。作者询问是否需微调嵌入器增加硬负样本、用OCR作为第二检查,或放弃全局嵌入方案。
Reddit · r/MachineLearningAI 评分5959 用户实测 Qwen3-VL 8B 与 Claude Opus 5.5/Sonnet 5/GPT-5.6 在 137 份混乱文档上的表现
作者用 Qwen3-VL 8B Instruct(Ollama Q4_K_M)在笔记本上对比 Claude Opus 5.5、Sonnet 5 和 GPT-5.6 Terra 处理收据、发票、IRS 税务表格、印度银行对账单和 CUAD 合同。
Reddit · r/MachineLearningAI 评分1313 医学影像元学习:当前有哪些热门研究方向?
一位医学影像元学习方向的新博士生在寻求研究方向建议,已了解少样本学习、组织病理学数据集、基础模型适应和领域泛化。提问者对MICCAI挑战赛较感兴趣,希望寻找与解决数据有限问题相关的前沿课题。
Microsoft Research精选AI 评分6666 微软发布 Quine:面向生物学复杂性的 AI 研究系统
微软研究院发布 Quine,这是一款旨在连接科学工具、文献、实验室和研究人员的 AI 研究系统。与 Broad Institute 合作,该系统用于预测和优先排序能够驱动肿瘤状态转变的化合物。在胰腺导管腺癌(PDAC)的湿实验证中,Quine 最高排名的化合物产生了最大的预期转录变化,整个过程仅用一个周末就完成了候选化合物的筛选和验证。
推荐理由:原文给出了 Quine 的具体能力(世界模型+交互式 harness)、应用场景(胰腺癌药物预测)和初步验证结果,读者可以据此了解这个 AI 系统如何辅助生物研究以及实际效果。
Latent SpaceAI 评分3131 Radical Numerics CEO Eric Nguyen:生物安全是 AI 军备竞赛
Radical Numerics 联合创始人 Eric Nguyen 解释为何用于增强生物学能力的基因组语言模型(GLM)也可用于防御。文章讨论了 Evo 和 Evo 2 等模型如何从零开始构建基因组,以及当模型"用 DNA 语言思考"时是否能像大语言模型一样实现链式推理。Radical Numerics 认为生物安全是一场军备竞赛,防御方必须紧跟前沿模型的攻击能力。
NVIDIA BlogAI 评分3131 费城儿童医院如何用开源NVIDIA AI为先天性心脏病儿童建模心脏
费城儿童医院(CHOP)基于NVIDIA开源医学影像框架MONAI,将过去需要4小时的心脏建模工作缩短至几秒。美国20多家儿童医院已开展心脏建模项目,波士顿儿童医院约50%的心脏手术(约每年500例)获建模支持。CHOP正结合NVIDIA Warp和Newton物理引擎,目标将模拟仿真引入临床工作流程,实现同日决策。
Google ResearchAI 评分4343 Google Earth AI 的 Planetary Prediction Engine 如何实现全球地理空间预测自动化
Google 推出 Planetary Prediction Engine(PPE),作为 Google Earth AI 的实验性研究能力,可自主完成从数据发现到模型训练的完整地理空间预测工作流,将复杂建模周期从数周缩短至数分钟。
Google ResearchAI 评分4848 AgentHands:让XR智能体实现同步手势交互的研究原型
Google Research在CHI 2026发布AgentHands研究原型,使AI智能体能在XR环境中生成与语音同步的手势。该系统将LLM响应中的GestureEvents映射到XR设备的手势动画,通过12人用户研究验证了在植物护理指导、3D打印机操作等场景中,体感交互显著提升空间 grounding 效果。
Google ResearchAI 评分4848 Google Research 如何用 ME-POIs 框架让语言模型更深入理解地点
Google Research 推出 Mobility-Embedded POIs 框架,通过将聚合匿名移动模式(如到达时间、停留时长)融入地点的文本表征,解决传统语言模型仅依赖静态元数据的问题。该方法在意图预测、价格分类和繁忙度估计上分别实现 81.9%、75.1% 和 24.7% 的相对提升。框架采用访问对齐、空间多尺度传播和文本-移动协同三步流程,有效缓解了中小商户数据稀疏的"长尾"难题。
Microsoft Research精选AI 评分7474 Echoverse:用于计算机使用智能体的深度演进环境
Microsoft Research构建了12个训练世界用于计算机使用智能体,其中10个深度领域世界涵盖邮件、日历、银行、医疗等闭源系统,2个能力世界针对日期选择器和嵌套过滤器进行专项训练。
推荐理由:原文给出了具体的训练数据和方法对比:深度环境使9B模型从36.5%提升到67.1%,而浅层环境反而导致性能下降。读者可以据此理解什么样的合成数据设计能真正提升计算机使用智能体的能力。
Google Research精选AI 评分6868 Google 发布 SymptomAI:面向日常症状评估的对话式 AI 智能体
Google 研究团队推出 SymptomAI,对话式 AI 智能体用于日常症状评估。研究通过 13,917 名参与者的随机试验,使用 Gemini Flash 2.0 模型进行端到端症状访谈和鉴别诊断。
推荐理由:研究通过 13,917 人的真实世界测试和可穿戴设备数据验证了 AI 症状评估的准确率,提供了与传统临床诊断的对照证据。
Google ResearchAI 评分2424 扩散模型的创造力从何而来:分数平滑的理论解释
Google Research 在 ICLR 2026 发表的论文揭示,扩散模型的创造力源于神经网络训练中的"分数平滑"效应。由于权重衰减等正则化手段,模型学习到的分数函数呈近似而非精确状态,导致去噪过程生成的数据会在训练点之间插值,从而产生新的合理样本,而非简单复制训练数据。研究通过 1-D 实验结合函数空间理论验证了这一机制。
Google DeepMindAI 评分4545 Google DeepMind 与 A24 宣布史无前例的研究合作
Google DeepMind 与独立电影工作室 A24 宣布一项史无前例的研究合作,旨在帮助艺术家开发新工作流程和技术,确保未来工具由创作者塑造。该合作创建深度研发协作,涵盖多个项目,Google 并对 A24 进行了投资。合作初期重点是弥合前沿技术与下一代娱乐之间的差距,具体目标和创意里程碑将随时间演进。
Google ResearchAI 评分4343 Google 发布高分辨率深度学习框架,将卫星像素转化为自然恢复规划
Google 开发了高分辨率深度学习框架,通过 Vision-Transformer 在 3 亿张卫星图像上预训练,仅用约 247 km² 注释数据即可精准识别树篱、林分等精细生态特征。发布矢量化数据集,将英格兰超过 13 万 km² 的细微木本特征转换为可操作的生态清单,利用 Polsby-Popper 紧凑度评分(<0.5)区分线性树篱与林分,为碳汇核算和自然恢复提供新途径。
Google ResearchAI 评分4343 Google研究:AI如何帮助用户理解皮肤状况
Google Research在JAMA Dermatology发表研究,2345名参与者使用AI工具识别皮肤状况,命名准确率从8%提升至近3倍达23%,愿意尝试命名的比例从41%升至62%。但确定下一步医疗措施(如何就医)方面,标准AI组无显著改善,用户倾向于选择不够紧迫的建议。
Google Research精选AI 评分7070 Google Research 在 I/O 2026 展示多项研究进展:科学工具、医疗健康、边缘计算、天气预测等
Google Research 在 I/O 2026 展示了多个研究进展。Gemini for Science 套件整合了 ERA(研究编码系统)和 Co-Scientist(多智能体系统),可辅助科学假设生成和计算实验。
推荐理由:原文系统展示了Google在I/O 2026的多个研究进展,涵盖科学工具、医疗健康、边缘计算、天气预测等方向,读者可从中了解AI在科研和产业应用的前沿进展。
Google DeepMindAI 评分3939 Calico Life Sciences 如何用 Co-Scientist 开辟衰老研究新路径
Calico Life Sciences 的 AI/ML 负责人 Matt Onsum 和首席科学家 Katherine Labbé使用 Co-Scientist 连接分散的衰老生物学发现,将其转化为可检验的假设。Co-Scientist 帮助生成了关于整合应激反应(ISR)如何被代谢调控的假设,实验产生了对 ISR 在健康与疾病中作用具有重要意义的新发现,团队计划发表结果。
Google DeepMindAI 评分5353 Google DeepMind发布AI co-clinician研究计划,探索AI辅助医疗新模式
Google DeepMind宣布推出AI co-clinician研究计划,探索AI作为护理团队协作成员在临床监督下与患者互动。在98个真实初级保健查询的盲评中,AI co-clinician在97个案例中实现零关键错误,优于两款广泛使用的AI系统。在140个咨询技能维度的评估中,AI在68个领域达到或超过初级保健医生水平。团队还在模拟远程医疗环境中测试了实时多模态AI能力。
Google ResearchAI 评分4949 Google Research 发布 MoGen 神经元形态生成模型,用合成神经元将脑图重建错误率降低 4.4%
Google Research 发布 MoGen(Neuronal Morphology Generation)模型,使用 PointInfinity point cloud flow matching 架构生成合成神经形状来增强 PATHFINDER 训练数据,将小鼠脑图重建错误率降低 4.4%,主要减少了合并错误。
Google DeepMind精选AI 评分7272 Google DeepMind 发布 AI 赋能光标原型
Google DeepMind 发布实验性的 AI 赋能光标,能够理解用户指向的内容及上下文。用户只需指向并用自然语言提问(如“显示方向”“对比这些产品”),AI 即可识别光标处的文字、图像、代码块等元素并提供相应帮助。该原型基于 Gemini 构建,计划集成到 Chrome 和新的 Googlebook 设备中。
推荐理由:Google DeepMind 展示了 AI 赋能光标的新交互范式,读者可以了解 AI 如何从理解'指向什么'升级到理解'为什么指向',以及这一变化对现有工作流的意义。
Google ResearchAI 评分3939 Google Research 在 The Check Up 大会展示医疗 AI 最新进展:从创新到临床应用
Google Research 联合 Imperial College London 和 NHS 在 Nature Cancer 发表研究,显示其 AI 诊断系统可识别 25% 传统筛查遗漏的"间隔期乳腺癌",并与印度、泰国、澳大利亚医疗机构合作完成超百万次糖尿病视网膜病变筛查。
Google Research精选AI 评分7575 Google Flood Hub 推出 AI 城市突发洪水预报,可提前 24 小时预警
Google 宣布在 Flood Hub 上推出 AI 城市突发洪水预报功能,可提前 24 小时预测城市突发洪水风险。该系统使用 Groundsource 方法论(由 Gemini 分析新闻报道生成历史洪水数据集)训练 LSTM 模型,仅依赖全球气象数据即可生成 20x20 公里分辨率的预报。
推荐理由:原文给出了AI驱动方法如何弥合全球预警差距的具体数据,读者可以据此评估它对发展中国家的实际价值。
Google Research精选AI 评分7171 Google在真实临床研究中测试对话式诊断AI可行性
Google Research与Beth Israel Deaconess Medical Center合作,对对话式诊断AI系统AMIE进行了前瞻性单中心可行性研究。
推荐理由:原文给出了在真实临床环境中测试对话式诊断AI的详细数据,包括安全性、诊断准确率、用户接受度等,读者可以据此了解当前医疗AI从模拟场景走向真实诊疗的可行性。