#数据/训练
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#数据/训练
今日 1 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Simon WillisonAI 评分55 Ben Affleck 谈 VFX 工作流:从卷积神经网络到 Transformer 的早期实践
演员 Ben Affleck 在访谈中谈及他从模拟胶片过渡到数字制作时接触计算机的经历,并解释了自己如何用 Python 脚本配合卷积神经网络处理 VFX 中的张量数据,进行边缘检测与特征提取以完成绿幕抠像。他将卷积神经网络视为 Transformer 的前身,指出 Transformer 能同时进行更多并行计算。
Hacker News · 首页AI 评分6868 Telegraph Test:通过电报式压缩让 LLM 输出 token 近乎减半且不损失下游可读性
作者发布名为 Telegraph Test 的可复现评测与配套仓库 github.com/Travis42/telegraph-test,在 ~1300 道题的固定题库上测量模型把文本写成 cablese(电报体)后的压缩率与跨族可读性。
Hacker News · 首页AI 评分6262 Polars 2.0 发布:流式引擎与 OOC 默认开启,SQL 性能领先 DuckDB 与 DataFusion
Polars 2.0 正式发布,LazyFrame 的 collect 默认走流式引擎,并默认开启 out-of-core(spill-to-disk,~80% RAM 起开始溢写,默认 64GB 磁盘预算),适用于排序、窗口函数和大量表达式等操作,同时新增 Map dtype,支持键查询和字典类方法。
Reddit · r/artificialAI 评分2626 Row-Bot 5.0 接入 qwen3.8:27b 本地跑通:用一年账单和租约替用户找出漏水与违规涨租
用户在本机 5090 GPU 上用 Ollama 运行 Row-Bot 5.0 搭配 qwen3.8:27b 模型,离线处理了一年份账单、租约、保单和涨租通知(均虚构),识别出水费账单可能存在漏水,并将 10% 的涨租与合同中 5% 的上限及通知期条款 4.1–4.3 对比后判定违约。
Hacker News · 首页AI 评分1818 Aria 模型用 cross-attention 学习十二位爵士钢琴家风格
研究者在 ISMIR 2026 上展示了一项用 Aria(一个在钢琴 MIDI 上预训练的 16 层 Transformer)模仿爵士钢琴家演奏风格的工作:他们微调 Aria,在最后 8 层插入 gated cross-attention 模块读取每位钢琴家的嵌入向量,使同一段 prompt 能产出 12 种不同风格的延续。
Reddit · r/LocalLLaMAAI 评分88 用 FFT 替换 AdamW 优化器状态以削减 VRAM:非量化显存压缩方法的社区探索
Spectra-Global 团队针对 8B 与 70B 模型在消费级 GPU 上微调时的 OOM 问题,放弃 8-bit 量化方案,转而将 AdamW 优化器状态通过 FFT 变换到频域处理:动态丢弃低能量频率并压缩后逆向重建,VRAM 用量下降约 50%,避免量化带来的收敛退化;代价是 FFT 计算带来单步延迟略增。
MIT Technology Review · AIAI 评分1212 智能体 AI 时代如何把预测分析推向自主决策
2026 年企业 AI 的核心问题已从"预测模型能否跑赢统计方法"转向"预测系统如何自主行动而不错位业务意图",领先者与落后者的差距正在拉大。Everest Group 合伙人 Vishal Gupta 表示,企业已不再满足于回顾性视角,转向以前瞻性为导向,深度学习与生成式 AI 推动的实时训练和非结构化数据使分析从被动复盘走向主动预判。
Reddit · r/LocalLLaMAAI 评分3232 Apex-2 训练复盘:单卡 H100 瓶颈、DiLoCo 多实例合并与 FineWeb-Edu 去重经验
开发者复盘了自训模型 Apex-2 的经验。原计划用约 1T tokens 训练,但单卡 H100 算力不足,最终只训了约 80B tokens;改用两台 GH200 实例按 DiLoCo 方式每 350 步合并模型,训练速度约为单卡的 1.9x,每张 GPU MFU 约 40%。
Reddit · r/artificialAI 评分4343 AI 发现44个可能隐藏类地行星的恒星系统
伯尔尼大学与瑞士国家行星科学能力中心(NCCR PlanetS)开发的AI模型识别出44个已知的恒星系统,可能隐藏未发现的类地行星。该模型在模拟行星系统上测试达到最高99%的精确度,但这些预测的行星尚未被观测验证,其方法价值取决于后续观测。
Reddit · r/artificialAI 评分1212 AI 抄袭检测引争议:让用户上传论文以检测 AI 生成内容
有人发明了 AI 抄袭检测器,可在论文正式发表前通过让学生上传大学论文和出版物来检测 AI 使用情况。此举被认为可收集大量来自高校的文本数据用于训练或检测。
Reddit · r/LocalLLaMAAI 评分2727 Yandex/AliceAI-80B-A3B 指令微调项目更新 #4
对 Yandex/AliceAI-80B-A3B-Base 进行指令微调的项目已完成第一轮 SFT,但因 500 万 tokens 训练数据覆盖不足,模型在模糊问题上表现欠佳。
Reddit · r/LocalLLaMAAI 评分4949 从零训练 3.87B MoE 模型:86.5B tokens 预训练结果分享
独立开发者从零训练了一个 3.87B MoE 模型(1.45B active),使用 86.5B tokens 预训练数据。该模型在 HumanEval 上达 43.9,代码能力与使用 18T tokens 训练的 Qwen2.5-1.5B 相当。局限性包括:英语中心化、知识记忆弱、4k 上下文限制,DPO 训练反而导致性能下降。
Reddit · r/LocalLLaMAAI 评分5454 将 LLM 蒸馏为文档提取模型:GLiNER 多编码器方案实践
作者将 LLM 蒸馏为两个 287M 参数编码器,用于从 500 万份法院判决书中提取结构化信息。方案使用 GLiNER2.5-multi-v1 标记实体/动作/值,再用 GLiNER2.5-multi-Decide 做多选消歧。
Reddit · r/MachineLearningAI 评分4444 425 张极端镜面反射数据集发布:用于计算机视觉与深度估计算法基准测试
一个包含 425 个资产的自定义多面镜面服装数据集发布,旨在测试计算机视觉模型、深度摄像头和空间 AI 应对极端镜面反射的能力。数据集包含 100% 未压缩的 Camera-Master RAW 文件和高分辨率 JPEG,在高对比度户外环境拍摄以触发边界框丢失和分割失败。每个资产配有分块缓冲的 SHA-256 取证清单。
The DecoderAI 评分7171 NASA 与 IBM 发布开源月球基础模型,将 17 年轨道器数据转化为月球科学研究基础
NASA 与 IBM 联合发布 Lunar Foundation Model,这是首批用于月球科学的开源基础模型之一。模型基于 TerraMind 从头训练,使用了来自月球勘测轨道飞行器(LRO)17 年观测的近 200 万个图块,涵盖 11 种模态和两种空间尺度。
Reddit · r/artificialAI 评分2020 Ben Affleck 表示他将 8 个月素材构建为私有 AI 层,以让电影人保持所有权 — 为何大多数模型仍在未经同意的情况下训练同行内容
Ben Affleck 表示他拍摄了 8 个月的自己的素材,构建了一个私有数据层,以让电影人保持对其内容的所有权。他指出,大多数开源模型是在未经同行同意的情况下进行训练的,这是一个仍然侵蚀电影工作室收入的差距。Ben Affleck 凭借其对电影行业的深刻了解,通过经验和制度知识创建了自己的专有数据集层作为护城河。
Reddit · r/LocalLLaMAAI 评分6464 开发者开源专注二战信息的小语言模型 Peacebell
作者在过去 11 个月里从零构建了一个专注于二战信息的领域专用小语言模型,提供 291M 和 148M 参数两个版本,使用自定义训练流程和基于维基百科的合成数据。模型已开源,可在 HuggingFace Spaces 体验 demo,并配有专用的二战主题基准测试。下一版本预计 2027 年发布。
Reddit · r/MachineLearningAI 评分3333 机器人演示数据中手部追踪丢失插入阶段时的评估方法讨论
机器人演示数据收集时,手部追踪器常在电缆插入瞬间因遮挡而丢失追踪,导致姿态标签出现关键间隙。论文MEgoVista提供了检测精度、召回率、F1和重建误差等评估指标,并采用将错误分配给漏检而非排除的协议;HaPTIC在多人捕捉场景中未能产生有效输出。作者建议按接近、接触、撤回阶段分别报告覆盖范围及接触期间最长连续间隙,以更全面评估数据可用性。
TechCrunch · AIAI 评分6464 Sean Parker 重建 Stability AI,转型音乐 AI 工具
Sean Parker 与 Stability AI 合作,将公司重建为音乐专业人士的 AI 工具制造商。Stability AI 于 8 月底完成 7600 万美元融资,索尼、华纳、环球三大唱片公司参与投资并授权音乐目录用于模型训练,目前已发布三款音频模型和 AI 音乐编辑软件。Parker 表示即将推出更新,允许用户通过哼唱或节拍输入来引导 AI 生成音乐。
Google Research精选AI 评分6565 Google 发布基于 TEE 的新一代联邦学习系统实现可验证隐私保护
Google 推出基于可信执行环境(TEE)的新一代联邦学习系统,可提供完全可验证和可审计的数据匿名化保证。该系统实现了端到端可验证的联邦学习流程,仅向工作负载运营商展示指标和差分隐私模型权重,训练数据只能在 TEE 中解密处理。Gboard 已部署该系统,英语和日语下一个词预测模型获得了更强的隐私保证和更高的准确率,训练时间从 1-2 个月大幅缩短。
推荐理由:Google 公开了基于 TEE 的联邦学习新系统设计,实现了可验证的数据匿名化并已部署到 Gboard 带来训练提速,对关注隐私计算和联邦学习工程实践的读者有直接参考价值。
Reddit · r/MachineLearningAI 评分2424 关于对抗性目标的视频
作者制作了一个关于对抗性目标的视频,探讨对抗性方法如何超越GANs和自我对弈,进入现代技术。该视频基于作者过去在这一领域的研究经历。
Hugging Face BlogAI 评分4444 AutoSynthData:为企业 AI 智能体生成训练数据
ServiceNow CoreAI 构建了 AutoSynthData 系统,利用目标模型的失败和更强教师的成功来识别能力差距,并据此生成验证过的训练任务。系统首先诊断模型在特定环境中的薄弱环节,然后将能力差距转化为多样化、可执行的训练任务,用于模型后训练。AutoSynthData 在 EnterpriseOps Gym 环境中进行演示,并发布了对应的数据集。
Reddit · r/LocalLLaMAAI 评分5656 Failure Map 发布:20,168 个开源 Python 边界调试任务
Failure Map 是一个包含 20,168 个 Python 调试任务的数据集,涵盖 254 个类别,提供标准库实现、明确合约、失败修复尝试和可执行边界检查。数据集附带方法论,测试者需报告模型版本、量化参数、提示词、采样设置、种子值、每个任务的尝试次数和通过计数。
AWS Machine Learning BlogAI 评分4747 在 AWS 上用上下文多臂老虎机优化转化漏斗
Amazon Payments 在 Amazon SageMaker AI 上部署多目标上下文多臂老虎机(LinUCB)优化产品获取漏斗,7周在线 A/B 测试显示部分用户群体的最终转化率提升高个位数百分比,另一群体则无明显改善。研究发现问题根源在内容而非模型。该方案通过组合三个漏斗阶段(开始、提交、审批)的 UCB 分数实现全漏斗优化。
TechCrunch · AIAI 评分6666 Reddit 将停止 RSS 订阅和公开 API 访问,因 AI 爬虫滥用
Reddit 宣布将于 11 月 13 日停止 RSS 订阅支持,2027 年 3 月关闭公开 API,原因是 RSS 已成大规模爬虫和自动化滥用的常见渠道。该公司表示,其用户生成内容正通过 AI 授权协议带来盈利,第二季度非广告收入同比增长 24% 达 4300 万美元。
Reddit · r/LocalLLaMAAI 评分1515 Yandex/AliceAI 80B-A3B 微调进展更新
独立开发者正在微调 Yandex/AliceAI 80B-A3B 模型,初始微调已完成约 40%。训练过程有直播可查看全部训练数据,开发者同时使用 gemini 3.8 flash 辅助微调。该数据集包含约 3.5k 样本,由 sftmill 生成,未来计划公开分享。
Microsoft ResearchAI 评分3333 微软研究院如何用机器学习预测美国电网的空间天气风险
微软研究院开发了一个端到端机器学习管道,预测美国本土66,935个变电站的空间天气风险。该系统结合太阳风观测、AE和Dst指数预报及当地地质数据,可在潜在影响前30-60分钟发出警告,在评估期间检测到近80%的主要空间天气事件。GIC风险检测对主要事件(≥10 nT/min)达76.5%,严重事件(≥20 nT/min)达81.2%。
Reddit · r/MachineLearningAI 评分3434 在 CICIDS2017 数据集上 max_samples=1.0 时 Isolation Forest 获得约 94% 召回率与 7.6% FPR
研究者在 CICIDS2017 数据集上训练 Isolation Forest 进行异常检测,发现 max_samples=1.0 时模型达到约 94% 召回率与约 7.6% 假阳性率,相比 max_samples=200k 的约 91% 召回率与 10% 假阳性率表现更优,训练时间仅增加 30 秒。
Reddit · r/LocalLLaMAAI 评分1212 如何自动为本地音乐收藏添加标签?
用户寻求为本地音乐库自动添加流派、情绪等标签的方案,目前手动标记很繁琐。用户在尝试开源ML模型后发现模型效果很好,但缺少成熟的工具,大多数选项是CLI或为流媒体服务器设计。用户考虑是否为仅用于标签而搭建流媒体服务器。
Reddit · r/LocalLLaMAAI 评分5757 SFTMill:轻松用 OpenAI 兼容端点对任意 LLM 进行离策蒸馏
作者发布了自研工具 SFTMill,可将任意行为目标转化为综合微调数据集。用户只需在 yaml 文件中定义课程目标,选择要蒸馏的 LLM,后者即可自动生成任务并解决任务,形成完整的问答训练集。作者使用 qwen 3.8 27b 生成任务,建议使用不低于该能力的模型。
Reddit · r/artificialAI 评分5555 网友整理 Grokbot 直播中的 11 个真实智能体团队组织结构图
作者从 Grokbot 3天直播中整理了11个实际运行的智能体团队组织结构,发现7/11的团队采用"首席幕僚长"风格的编排器模式,专家向其汇报而非互相汇报;研究机器人按数据源分割(Salesforce、Gong、Web搜索等);繁忙团队按计划运行,售后团队每日8:30早会、每15分钟电话准备;小团队跳过编排器直接协作;一个团队使用可扩展克隆替代增加新机器人。
Reddit · r/artificialAI 评分5353 消费者 AI 年支出增至 400 亿美元但用户仅增长至 2 亿
Menlo Ventures 2026 年消费者 AI 报告显示,全球 AI 支出从 120 亿美元增至 400 亿美元,但用户仅从 1.8 亿增至 2 亿,说明收入增长主要来自现有用户加钱而非新用户。
Reddit · r/MachineLearningAI 评分3232 AI 行业为何陷入"算力执念":我们是在做研究还是管理硬件?
AI 领域研究者批评行业过度依赖算力而非算法效率,指出今年发论文必须展示更大参数规模或 loss curve,实质上是把算力当作免费资源而非需要解决的约束。匿名作者提到项目中有人直接使用 QentrixAI 绕过优化瓶颈,感叹行业正在丧失高效设计的工艺,追求"万卡集群"成为衡量成果的标准。
Reddit · r/MachineLearningAI 评分7171 免费开源 AI 工程课程:手把手实现每个算法,已发布 EPUB/PDF 书籍
AI Engineering from Scratch 是 MIT 许可的课程,共 523 节课分为 20 个阶段,涵盖线性代数、反向传播、Transformer、LLM、智能体和生产部署等内容。代码采用 stdlib 优先方式展示每一步实现。本月更新发布了 6 卷 EPUB 和 PDF 书籍,支持 8 种语言,并修复了测试和数据集问题。
Reddit · r/LocalLLaMAAI 评分4949 研究发现后训练让 LLM 更有趣但降低回答多样性
研究通过 11 个训练阶段、100 个笑话提示词、64 位人类评分者评估 Tulu 3(基于 Llama 3.1 70B)、OLMo 3.1 32B 和 Qwen2.5 发现:7 个训练步骤中 5 个的后期模型笑话更有趣,笑话长度缩短 10-20 词;但同提示词生成的笑话相似度增加,Qwen2.5 base 到 instruct 阶段多样性下降最显著。
Hacker News · 首页AI 评分5959 Bain报告:AI行业需年收入6万亿美元才能证明数据中心投资合理
Bain报告显示,AI行业到2031年需实现6万亿美元年收入才能证明数据中心大规模投资的合理性。其中新产品开发预计贡献约4.2万亿美元,包括搜索、广告、自动驾驶和实体AI;企业生产力需1-1.4万亿美元;消费级服务预计贡献2000-4000亿美元。
Hacker News · 最佳AI 评分2626 Reddit 厨刀社区是否存在虚假营销问题?数据分析揭示了什么
分析 Reddit 六个厨刀 subreddits 发现,一个品牌 31% 的"应该买什么"提及来自 5% 的账户,是随机概率预测的 4 倍。研究将这些高活跃度账户标记为"品牌忠诚"账户,其在购买推荐帖中的出现频率远超发帖量所能解释,表明可能存在付费水军活动。
Reddit · r/LocalLLaMAAI 评分6969 我花15天微调了一个4B模型用于商业决策,在JevBench排名超越GPT-5.6 Luna
作者基于Qwen3.5-4B用LoRA微调了一个专注商业决策的模型ImaJev-4b,可处理文本和图片输入,在JevBench(91个模型)排名第一,得分67.37超越Jev(63.29),在DecisionBench(56个模型)排名第三,超越GPT-5.6 Luna和DeepSeek V4.1。
Reddit · r/MachineLearningAI 评分4949 带有自适应表示的函数梯度下降
本文提出一种带有自适应表示的函数梯度下降算法,通过形式化一类近似方案解决函数梯度无限维导致的收敛偏差问题。该方法可证明收敛到全局最优解,在多个任务上性能优于神经网络,通常可达一个数量级提升。该论文已被 NeurIPS 接收。
Reddit · r/MachineLearningAI 评分4242 ClashRoyaleAi:用于强化学习的开源确定性皇室战争模拟器
开源项目 ClashRoyaleAi 是一个确定性的 Clash Royale 模拟器,使用 C++ 引擎配合 Python 绑定,内置 recurrent PPO、前瞻搜索和专家迭代。