#数据/训练
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#数据/训练
今日 1 条洞察 · 工具·提示词·论文 三栏速览
每栏 3 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Simon WillisonAI 评分55 Ben Affleck 谈 VFX 工作流:从卷积神经网络到 Transformer 的早期实践
演员 Ben Affleck 在访谈中谈及他从模拟胶片过渡到数字制作时接触计算机的经历,并解释了自己如何用 Python 脚本配合卷积神经网络处理 VFX 中的张量数据,进行边缘检测与特征提取以完成绿幕抠像。他将卷积神经网络视为 Transformer 的前身,指出 Transformer 能同时进行更多并行计算。
Hacker News · 首页AI 评分6868 Telegraph Test:通过电报式压缩让 LLM 输出 token 近乎减半且不损失下游可读性
作者发布名为 Telegraph Test 的可复现评测与配套仓库 github.com/Travis42/telegraph-test,在 ~1300 道题的固定题库上测量模型把文本写成 cablese(电报体)后的压缩率与跨族可读性。
Reddit · r/artificialAI 评分2626 Row-Bot 5.0 接入 qwen3.8:27b 本地跑通:用一年账单和租约替用户找出漏水与违规涨租
用户在本机 5090 GPU 上用 Ollama 运行 Row-Bot 5.0 搭配 qwen3.8:27b 模型,离线处理了一年份账单、租约、保单和涨租通知(均虚构),识别出水费账单可能存在漏水,并将 10% 的涨租与合同中 5% 的上限及通知期条款 4.1–4.3 对比后判定违约。
Hacker News · 首页AI 评分1818 Aria 模型用 cross-attention 学习十二位爵士钢琴家风格
研究者在 ISMIR 2026 上展示了一项用 Aria(一个在钢琴 MIDI 上预训练的 16 层 Transformer)模仿爵士钢琴家演奏风格的工作:他们微调 Aria,在最后 8 层插入 gated cross-attention 模块读取每位钢琴家的嵌入向量,使同一段 prompt 能产出 12 种不同风格的延续。
Reddit · r/LocalLLaMAAI 评分88 用 FFT 替换 AdamW 优化器状态以削减 VRAM:非量化显存压缩方法的社区探索
Spectra-Global 团队针对 8B 与 70B 模型在消费级 GPU 上微调时的 OOM 问题,放弃 8-bit 量化方案,转而将 AdamW 优化器状态通过 FFT 变换到频域处理:动态丢弃低能量频率并压缩后逆向重建,VRAM 用量下降约 50%,避免量化带来的收敛退化;代价是 FFT 计算带来单步延迟略增。
Reddit · r/LocalLLaMAAI 评分3232 Apex-2 训练复盘:单卡 H100 瓶颈、DiLoCo 多实例合并与 FineWeb-Edu 去重经验
开发者复盘了自训模型 Apex-2 的经验。原计划用约 1T tokens 训练,但单卡 H100 算力不足,最终只训了约 80B tokens;改用两台 GH200 实例按 DiLoCo 方式每 350 步合并模型,训练速度约为单卡的 1.9x,每张 GPU MFU 约 40%。
Reddit · r/artificialAI 评分1212 AI 抄袭检测引争议:让用户上传论文以检测 AI 生成内容
有人发明了 AI 抄袭检测器,可在论文正式发表前通过让学生上传大学论文和出版物来检测 AI 使用情况。此举被认为可收集大量来自高校的文本数据用于训练或检测。