#数据/训练
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#数据/训练
今日 1 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条AWS Machine Learning BlogAI 评分4949 使用 EFA 和 DeepEP 在 Amazon EKS 上扩展 MoE 强化学习训练,吞吐量提升 40%
AWS 展示了在 Amazon EKS 上使用 Elastic Fabric Adapter (EFA) 和 DeepEP 扩展混合专家(MoE)模型强化学习训练的架构,实现 40% 吞吐量提升。
Latent SpaceAI 评分7575 小米发布 MiMo-V2.6-Pro:1T 参数开源多模态模型,训练成本约 300 万美元
小米发布 MiMo-V2.6-Pro 开源多模态模型,总参数 1.02T、活跃参数 42B,训练成本约 300 万美元。该模型在 Artificial Analysis 智能指数上以 46 分位居开源模型榜首。
Microsoft Research精选AI 评分7070 Microsoft 发布 RetroChimera:大规模小分子逆合成预测模型
Microsoft Research 发布 RetroChimera,一种新的逆合成预测模型,已发表在 Nature 期刊上。该模型结合了 Transformer 架构的 R-SMILES 2 和图神经网络的 NeuralLoc 两个互补子模型,通过学习排序策略集成预测。
推荐理由:模型在盲测中获得了博士级化学家的偏好,且已开源并提供访问入口,读者可以亲自试用验证。
Product HuntAI 评分2323 Alkera 开源多人协作数据科学工作台 Databench
Alkera 发布开源多人协作数据科学工作台 Databench,支持团队成员与 AI 智能体在 notebook 和聊天中实时协作,可在本地电脑、其他机器或 GPU 节点上运行任意 cell 或智能体,并能并行启动多个智能体探索方案。Databench 提供慷慨的免费使用额度,也支持用户自行托管。
The Rundown AIAI 评分6767 美国首次承认在轨道部署武器
美国空军部长首次公开承认太空军已拥有“轨道太空控制武器”,可保护美军免受敌对行动侵害,但未透露武器具体类型、数量或部署时间。中国已发出警告,称此举将加速太空军备竞赛。同时,配套消息显示 Trump Golden Dome 的太空拦截器已达到飞行就绪状态,太空军计划2028年前演示初步能力。
Google Research精选AI 评分6262 ToolGrad:基于文本“梯度”的高效工具使用数据集生成
ToolGrad 采用"答案优先"策略,先生成真实工具调用链,再标注对应用户提示,利用文本梯度迭代构建 API 工作流。实验表明该方法可生成更复杂的长程工具使用数据,pass rate 接近 100%,成本更低。
推荐理由:提出一种新的数据生成范式,可生成更复杂的工具使用数据并降低成本,学生模型甚至超越教师模型。
Ben's BitesAI 评分4848 用 Codex 抓取 1.07 亿行英国议会支出数据建可视化地图
独立开发者通过 Codex AI 智能体抓取英国 319 个议会的 1.07 亿行支出数据,总计约 90 亿英镑,并建成类似 Apple Maps 的交互式可视化网站。项目使用 Parquet 列式存储和 DuckDB 数据库,8.2B tokens 消耗、656 个子智能体协同完成。目前数据处理已接近完成,预计即将开源。
Google DeepMind精选AI 评分7878 Google DeepMind 发布 WeatherNext 3:迄今最先进、最准确的全球天气 AI 模型
Google DeepMind 发布 WeatherNext 3,这是迄今最先进、最准确的全球天气 AI 模型。新模型使用实时卫星数据训练,每小时更新一次,分辨率 5-25 公里,比上一代 WeatherNext 2 清晰约 5 倍。
推荐理由:原文给出了具体的性能提升数据(CRPS 提升 60%/30%/10%),分辨率提升 5 倍,与上一代 WeatherNext 2 有明确对比,读者可以据此判断模型的实际进步幅度。
Hugging Face Blog精选AI 评分7171 Open ASR Leaderboard 首次纳入印地语和印度英语评估集
Hugging Face 与 Voice Arena 合作在 Open ASR Leaderboard 中新增印地语和印度英语评估集,这是首次有印度语言纳入该多语言基准。该数据集名为 Monsoon,每个片段记录 12 个说话人属性,使 ASR 误差率可按地区、年龄、性别、设备等维度细粒度分析。印地语评估集采用词错误率(OIWER)而非传统 WER,以处理拼写变体问题。
推荐理由:该数据集首次在公开基准中加入印度语种,并通过 12 个说话人属性实现了 ASR 性能的细粒度人口统计分析。
Hugging Face BlogAI 评分4545 语音识别基准测试优化问题研究:11个开源ASR模型评估
Hugging Face发布研究,引入三种测试量化语音识别领域的基准优化问题,评估11个广泛使用的开源ASR模型后发现,多个高分模型会复制基准测试的错误转录文本,即使音频内容与参考文本相矛盾。
Hugging Face BlogAI 评分5353 Hugging Face 如何用 Inference Endpoints、Jobs 和 Buckets 打造 Papers with Code 搜索
Papers with Code 搜索系统采用混合搜索架构,结合 PostgreSQL 全文检索和 pgvector 向量检索,通过加权倒数排名融合(RRF)算法合并结果。
Microsoft Research精选AI 评分6565 Microsoft Research 发布 Skala 1.1 深度学习 DFT 方法
Microsoft Research 发布深度学习 DFT 方法 Skala 1.1,训练数据量比前身多 2.5 倍,在 GMTKN55 基准测试的 55 个类别中获得 32 项第一,加权平均误差 2.8 kcal/mol。该方法现已在 CP2K 中可用,正集成到 Psi4、FHI-aims、ORCA 和 VASP 等主流计算化学软件中,并推出动态性能基准测试追踪优化进展。
推荐理由:Skala 1.1 在 GMTKN55 基准上获得 32 项第一,且已集成到多个主流计算化学软件中,读者可据此判断其在材料模拟领域的实用价值。
Hugging Face BlogAI 评分5252 使用 Strands Agents、LeRobot 和 Hugging Face Storage Buckets 构建机器人数据流式循环
本文介绍了在 Strands Robots 中构建流式数据循环的完整方案:先用 Robot() 记录演示并同步到 Storage Bucket,再通过 stream_dataset() 流式读取数据直接训练,最后将训练好的 checkpoint 部署到物理机器人。
Hugging Face Blog精选AI 评分6565 如何让知识蒸馏便宜到足以大规模运行
知识蒸馏需要同时加载教师和学生模型,显存需求极高。论文提出两种系统改进:缓存教师模型的 top-100 logits 避免其常驻内存,以及新的分块 KL 散度损失函数避免实例化完整的词汇表×序列长度矩阵。
推荐理由:给出了具体的显存峰值对比数据,读者可以据此判断该方法对自己硬件条件下的可行性。
Hugging Face BlogAI 评分4040 GPU 管理:为何闲置 GPU 成为新的"接地飞机"
AI 行业的下一个真正约束已从模型智能转向 GPU 利用率。GPU 按日历小时计成本(融资、折旧、功耗、冷却),仅按计算小时产生收入,与航空业的飞机经济模型完全相同。
Berkeley AI Research精选AI 评分6060 ABBEL:通过信念状态实现高效长程交互
本文提出 ABBEL 框架,通过将交互历史压缩为自然语言信念状态来替代完整上下文,从而降低长程任务的计算成本。在协同编码任务 CollabBench 中,使用基于重建的信念评分(belief grading)可将性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 减少 57%。该方法在组合锁游戏和多目标问答任务中也展现了学习效率优势。
推荐理由:给出了具体性能数据(性能差距缩小50%、训练步数减半、峰值token大幅降低),读者可以直接评估这个方法对长程交互任务的实际价值。
Berkeley AI ResearchAI 评分3030 智能即将免费,数据系统如何迎接智能体时代
随着 AI 推理成本在过去两年下降 9x-900x(GPT-4 级能力从 $30/百万 token 降至 <$1),知识工作所需的智能正变得几乎免费。文章探讨这一变革对数据系统的三重影响:为智能体服务的数据系统(支持批量查询和高并发智能体探索)、由智能体管理的数据系统(协调数千智能体协作)、以及由智能体构建的数据系统(自动合成定制化数据系统)。
Google Research精选AI 评分7878 Google 发布 TabFM:面向表格数据的零样本基础模型
Google 发布 TabFM,一个面向表格数据分类和回归任务的基础模型。该模型将表格预测重新定义为上下文学习问题,通过混合注意力架构(交替行列注意力、行列压缩)在数百万人工合成数据集上训练,实现了真正的零样本预测——无需针对新数据集进行模型训练、超参数调优或特征工程。
推荐理由:读者可通过本文了解 Google 如何将大语言模型的零样本能力迁移到结构化表格数据,理解其架构创新和实际可用性。
Google ResearchAI 评分4141 Google 线性弹性缓存技术:将页面驱逐建模为滑雪租赁问题优化云成本
Google 提出线性弹性缓存技术,将页面驱逐问题建模为滑雪租赁问题,使用浅层决策树预测页面 TTL 以动态调整缓存大小。在 Spanner 生产环境的测试中,内存使用减少 15.5%,缓存未命中仅增加 5.5%,总拥有成本(TCO)降低约 5%,实际 I/O 成本影响仅 0.5%。该方法将内存视为随占用时间和大小线性计费的 utility,而非固定资源。
Google ResearchAI 评分4343 Google 发布高分辨率深度学习框架,将卫星像素转化为自然恢复规划
Google 开发了高分辨率深度学习框架,通过 Vision-Transformer 在 3 亿张卫星图像上预训练,仅用约 247 km² 注释数据即可精准识别树篱、林分等精细生态特征。发布矢量化数据集,将英格兰超过 13 万 km² 的细微木本特征转换为可操作的生态清单,利用 Polsby-Popper 紧凑度评分(<0.5)区分线性树篱与林分,为碳汇核算和自然恢复提供新途径。
Import AIAI 评分2525 研究显示美国AI经济年增长约2600% 但传统GDP统计难以反映
弗吉尼亚大学经济学家与Anthropic、加拿大银行联合研究显示,美国AI经济2025年规模预计达2500亿美元,质量调整后年增长率约2600%。由于AI推理价格下降速度几乎与质量提升同步,AI经济在传统GDP统计中基本“不可见”。研究人员建议建立AI卫星账户、生成更好数据并将AI产能纳入中期经济预测。
Google ResearchAI 评分4949 Google 零信任聚合的私有分析技术
Google推出新的私有分析服务,结合新型加密聚合协议与可信执行环境(TEE),实现单次消息安全提交,无需设备长时间在线多轮交互。该方案通过加密层确保原始数据在任何服务器内存中都不被暴露或重建,仅在聚合匿名化后才处理明文数据,并利用TEE提供可验证的完整性证明。目前已应用于Pixel Recorder和Gboard等场景。
Google ResearchAI 评分3333 Google Research 如何通过全球合作和开源资源推动科学影响
Google Research 过去十年开发并开源了多个关键技术和数据集,赋能超过 25 万名全球研究者。
Google ResearchAI 评分5252 Google Research 发布 Simula:通过机制设计实现推理驱动的合成数据生成
Google Research 在 TMLR 发表论文,介绍 Simula 框架——一个基于推理优先的合成数据生成系统。该框架将数据生成过程分解为全局多样性、本地多样性、复杂化和质量检查四个可控维度,支持 seedless 和 agentic 方式生成数据。
Google ResearchAI 评分4949 Google Research 发布 MoGen 神经元形态生成模型,用合成神经元将脑图重建错误率降低 4.4%
Google Research 发布 MoGen(Neuronal Morphology Generation)模型,使用 PointInfinity point cloud flow matching 架构生成合成神经形状来增强 PATHFINDER 训练数据,将小鼠脑图重建错误率降低 4.4%,主要减少了合并错误。
Google ResearchAI 评分4444 S2Vec 如何用自监督学习理解城市建筑环境
Google Research 发布 S2Vec,一个自监督学习框架,通过 S2 Geometry 分区和特征栅格化将建筑环境转换为类似图像的表示,再利用掩码自编码器学习通用嵌入向量。S2Vec 在零样本地理适应任务(如预测未见过区域的人口密度和收入)中表现竞争力,无需人工标注即可理解城市特征关系。评估显示,S2Vec 与图像嵌入融合通常优于单一模态。
Berkeley AI ResearchAI 评分4646 SPEX and ProxySPEX 如何在大规模语言模型中识别关键交互
Berkeley AI Research 提出 SPEX(Spectral Explainer)和后续算法 ProxySPEX,利用信号处理与编码理论将交互发现规模提升数个数量级。
Replicate BlogAI 评分2727 Replicate Intelligence #7:本周AI开源模型与工具动态
summary__z: AI工程师Andy Ayrey基于自身聊天数据创建人格克隆,获得Marc Andreessen的1比特币投资并为其bot业务发薪。Fal.ai发布6.8B参数的AuraFlow开源文生图模型,声称可比肩闭源替代品。Google DeepMind新研究JEST方法将数据选择效率提升13倍。