#教程/实践
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#教程/实践
今日 4 条洞察 · 工具·提示词·论文 三栏速览
每栏 3 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分1212 用户实测 llama.cpp 0.6.0 运行 Cloudflare Clef Q4_K_M 量化模型,基础任务准确率低
用户使用 llama.cpp 0.6.0 和 bartowski 的 Q4_K_M 量化运行 Cloudflare Clef 模型,在基础退款判别任务中 noul 仅 0.57,而同一输入下 Jev 取得 0.99。该模型在 team 分类(confidence 0.51)和 urgency 评分(confidence 0.13)上也表现不佳,用户因此对 Cloudflare Clef 失去信心。
Reddit · r/ChatGPTAI 评分3535 开发者用 ChatGPT 与 Claude 构建 doesitrun.com:LLM 离线设计 FPS 计算模型,运行时全程确定性代码
开发者上线 doesitrun.com,读取用户 Steam 游戏库与硬件参数后估算每款游戏的 FPS,并指出 CPU、GPU、VRAM 或 RAM 中谁是短板、推荐最便宜的升级方案,站点免费且无需账号。
Reddit · r/LocalLLaMAAI 评分2626 双卡 CMP 170HX 64GB 部署 GLM-5.3-Flash 384K 上下文方案与 Qwen3.8 实测对比
玩家在两张 64GB CMP 170HX 显卡上跑通了 GLM-5.3-Flash 的 EXL3 3.05bpw 量化方案,目标权重约 125.2GB 全驻留 HBM,配合 DFlash2 6bpw 草稿模型实现 384K 上下文,单请求预算约 392,960 tokens,生成速度约 90 tok/s。
AWS Machine Learning BlogAI 评分1616 AWS 发布"AI builder"培养方案:六周结构化项目弥合业务人员 AI 知识与实操能力差距
AWS 设计了一个六周结构化项目,让日常工作依赖 AI 但无工程背景的业务人员动手搭建 AI 智能体原型,每周三至四小时。试点中四位销售类背景的成员基于 Amazon Bedrock AgentCore、Strands Agents SDK 和 Amazon Nova 模型构建出金融顾问多智能体工具 WealthWise,获得第一名。
Reddit · r/artificialAI 评分66 用 Claude + VS Code 开发 SaaS 与项目时如何规划学习路径与应对 token 限额
该用户已是 AI 技术爱好者,正使用 Claude 与 VS Code 在终端开发 SaaS、社区和站点/配送类项目,但感到缺乏方向、流程容易迷失,也受困于 token 限额(已使用 RTK 压缩消耗,额度用完后几乎无法继续)。
Hugging Face Blog精选AI 评分7070 NVIDIA 公布 Nemotron 在 IOI 与 IMO 2026 的金牌级微调与推理方案
NVIDIA 在 Hugging Face 博客介绍基于 Nemotron 3 微调出的系统在 IOI 2026 与 IMO 2026 均达到金牌线,其中 IOI 由 Nemotron-3-Ultra-CC 配合 GenCorrect 取得 535.4/600 分。
推荐理由:原文把 IOI 与 IMO 两个金牌结果的训练数据、方法和推理回路整理成可复用的微调配方,读者可直接对照迁移到自己的领域。
Reddit · r/LocalLLaMAAI 评分77 单卡 3090 跑 Qwen3.8-27B 用户考虑升级 128GB DDR5 以应对 Strata 炒作
一位 Reddit 用户目前用单张 3090 显卡运行 turboderp/Qwen3.8-27B-exl3 量化版,可达约 70t/s 的生成速度和约 150k 上下文,正考虑升级到 128GB DDR5 6000MHz 内存和 Ryzen 9700X,以便跑 IQ3 量化和 Strata。
Reddit · r/LocalLLaMAAI 评分3333 社区作者为 Ternary Bonsai 2 27B 微调 DFlash 2 drafter:L4 加速 2.2x,代码编辑 3.2x
网友基于 z-lab 的 DFlash 2 drafter,用 Bonsai 2 自身 1.5M tokens 的 greedy 输出做微调,使其适配 PrismML 的 Ternary Bonsai 2 27B。
Reddit · r/ChatGPTAI 评分1515 Pixelfork、Rosebud、Spawn 等提示词生成游戏工具横向对比
Reddit 用户对 Pixelfork、Rosebud、Spawn、Mindblown、Genex、GDevelop AI 等 AI 提示词生成游戏(prompt-to-game)工具做了横向对比,列出各平台功能与差异。该帖子指出,目前多数 AI 游戏工具仍停留在只能展示几张截图的 demo 阶段,真正可用的产品开始出现。
Reddit · r/MachineLearningAI 评分88 零基础如何从 ML 工程师起步,在 NeurIPS / ACL / ICLR 等 A* 会议发表论文并申请 CS 博士
一名有两年工作经验的 AI 工程师询问如何从零开始规划学术路径,目标是在 NeurIPS、ACL、ICLR 等 A* 会议发表论文,并在 2028 年秋季申请美国 CS 硕士后进入斯坦福或普林斯顿等顶尖高校读博。原帖给出的初步路线包括学习 Python、机器学习与数学、阅读研究论文、寻找课题并跑实验撰写论文,并征求更具操作性的步骤以及能提升博士申请竞争力的关键因素。
Reddit · r/LocalLLaMAAI 评分1616 2026 年本地 RAG 个人知识库选型:embedder 与混合检索经验讨论
网友讨论如何用 SQLite + sqlite-vec + FTS5、Ollama 在 Apple Silicon Mac 上搭建完全本地化的个人 RAG 知识库。
Reddit · r/LocalLLaMAAI 评分1515 ik_llama.cpp 在多 GPU 层拆分混合推理中为何反而慢于主线 llama.cpp
用户在 4 张异构 GPU(3 张 P102-100 + 1 张 RTX 3060 12GB)混合卸载 Qwen 3.8 Flash-Next 177B(IQ3_XXS)并配合 AVX-512 CPU 跑 32k 上下文时。
Reddit · r/ChatGPTAI 评分66 网友分享用 ChatGPT 开发 Minecraft Create 模组附加包的经验
一名无开发经验的网友尝试用 ChatGPT 编写 Minecraft Create 模组附加包,目前进展顺利,ChatGPT 在代码增补和细节调整上没有出现明显问题。他发帖征集其他用户用 ChatGPT 做游戏 mod 的经验,并寻求让流程更顺畅的建议。
Reddit · r/MachineLearningAI 评分66 没有 A* 顶会发表还能申到 ML PhD 吗
一名美国 top-15 大学的 MS 国际学生在 Reddit 提问:在没有 NeurIPS、ICLR 等顶会接收论文的情况下,是否还值得申请顶级 ML PhD,还是该把时间转向工业界招聘。作者目前有一篇 NeurIPS 一作被拒、另一篇 ICLR 一作在审,因担心国际生身份和 SWE/MLE 招聘竞争而犹豫是否投入申请。该帖主要面向有 ML 研究经历但尚无顶会发表者寻求现实评估。
Reddit · r/LocalLLaMAAI 评分1515 Hugging Face 工程师分享 llama.cpp 本地 AI 生态技术演讲
Hugging Face 工程师 Merve 在一场开发者大会上分享了关于 llama.cpp 的演讲内容,涵盖 prefill 与 decode、内存类型、speculative decoding 等本地 LLM 推理基础概念,供社区参考使用并要求注明出处。
Reddit · r/LocalLLaMAAI 评分2323 基于 Qwen3.5-9B 微调的"Bev"决策模型:故意选错答案的对照测试用例
作者基于 Qwen3.5-9B 微调出决策模型 Bev,借助 Bespoke Nimble adapter 微调 51 分钟后,使她在 324 条 held-out 决策上答对率仅 1.9%、平均置信度 96%,置信度 ≥90% 时答对率仅 1.4%。
Reddit · r/LocalLLaMAAI 评分3131 21M 模型外挂 6.4B 参数查找表:性能追平 114M dense 模型,NVMe SSD 即可承载
作者在 21M 模型外挂一张 16.8M 行、6.4B 参数的查找表,在 500M Wikipedia token 训练下性能接近同条件下的 114M dense 模型。
Reddit · r/artificialAI 评分1111 完成 CPD 认证的 AI 精通课程后总结:真正值得记住的 5 件事
一位用户在 Reddit 分享完成 CPD 认证 AI 课程的 5 条心得:提示词技能占整体能力的 80%,工具选择远不如使用方式重要;建议组合使用 ChatGPT、Claude、Midjourney、Lovable 等工具,分别负责起草、生成图像和快速上线。AI 辅助写作的关键在于像编辑一样修改而非被动采用,图像和视频生成则更像"下达创意简报"的能力,效率提升来自工具之间的协同工作流。
Reddit · r/ChatGPTAI 评分77 完成 CPD 认证的 AI 掌握课程后,总结出 5 个真正值得记住的要点
一名用户在完成覆盖 ChatGPT、Claude、Midjourney、Lovable 和 Jasper 的 CPD 认证 AI 课程后,总结出五点核心心得:提示词技巧占技能的 80%。
Reddit · r/MachineLearningAI 评分2323 Transformer、RNN 与 SSM 的记忆机制对比:从循环状态、KV cache 到类突触连接
作者从"工作记忆"视角比较了 RNN、Transformer 与 SSM 三类架构的记忆承载方式:RNN 将记忆压缩为逐步传递的循环隐藏状态,参数规模约 O(N²) 而状态仅 O(N);Transformer 在推理时冻结权重,以不断增长的 KV cache 保存历史键值,更像便利贴式的外部上下文;SSM(如 Mamba)回到定长循环状态,并通过输入依赖机制决定遗忘。
Reddit · r/LocalLLaMAAI 评分1010 团队提出用 LoRA 适配器充当 LLM 可切换技能,想验证这是否值得做成产品
一个团队正在验证一个想法:把 LoRA 适配器当作 LLM 的持久化、可切换的专用技能,按需加载或卸载,以减少上下文占用、复用专项能力并可能降低推理成本。他们希望 LoRA 的创建与管理能像维护知识库一样简单,并询问用户是否会在实际场景中使用该方案,以及该思路在哪些场景下不适用。
Reddit · r/LocalLLaMAAI 评分4040 Qwen3.8-Flash-Next 本地运行 vs Claude Opus 5.5:同一 Rust 任务对比实测
网友在 Strix Halo 笔电(128GB)上用 Qwen3.8-Flash-Next(xhigh effort)与 Claude Opus 5.5(medium effort)完成同一 LlamaStash Rust 功能;Flash-Next 约 130 分钟完成并合并,Opus 5.5 约 18 分钟,费用 $7.53 vs 本地 $0 加约 0.15 kWh。
Reddit · r/LocalLLaMAAI 评分2828 超频 DDR5 提升超出 VRAM 容量 MoE 模型的 prefill 与 decode 速度
在 AMD 7950X 平台(4× 双 rank DDR5-5600,128GB)上将 DDR5 从 3600MHz 超至 4800MHz,内存带宽提升约 36%,让超出 VRAM 容量的 MoE 模型在 Intel B70(32GB)上跑 llama.cpp 自定义 SYCL 后端时获得更快的 prefill(PP)与 token 生成(TG)。
Reddit · r/ChatGPTAI 评分55 ChatGPT 在长对话中质量下降的原因及应对建议
用户在使用 ChatGPT 制作教育内容时发现,对话越长,模型输出质量越容易下降。这一现象通常与上下文窗口中相关信息被稀释、模型注意力分散以及早期指令被覆盖有关。可通过定期总结关键信息、开启新对话或使用更结构化的提示词来缓解这一问题。
Reddit · r/artificialAI 评分2626 Row-Bot 5.0 接入 qwen3.8:27b 本地跑通:用一年账单和租约替用户找出漏水与违规涨租
用户在本机 5090 GPU 上用 Ollama 运行 Row-Bot 5.0 搭配 qwen3.8:27b 模型,离线处理了一年份账单、租约、保单和涨租通知(均虚构),识别出水费账单可能存在漏水,并将 10% 的涨租与合同中 5% 的上限及通知期条款 4.1–4.3 对比后判定违约。
Reddit · r/MachineLearningAI 评分2121 ZhemaIsmayil 曾用神经网络为每个字体生成嵌入向量并以 tSNE 可视化,意外得到花朵状结构
一名开发者用预训练神经网络为每个字体的字符生成嵌入向量,再用 tSNE 把降维后的嵌入映射为 XYZ 和 RGB 通道并以点云可视化,使视觉相近的字体在位置和颜色上自然聚集。在 Google Fonts 语料上,该可视化呈现出花朵形状,大多数手写体字体集中于花蕊区域。作者另在其字体检索网站上提供了基于全部可搜索字体的类似可视化。
Reddit · r/LocalLLaMAAI 评分1010 yandex/AliceAI-80B-A3B 后训练 Instruct 微调进展更新
开发者对 yandex/AliceAI-80B-A3B-Base 进行 Instruct 微调,目标为支持智能体任务与对话,并通过 qwen 3.8 27b 的浅层蒸馏注入链式推理能力。
Reddit · r/LocalLLaMAAI 评分88 用 FFT 替换 AdamW 优化器状态以削减 VRAM:非量化显存压缩方法的社区探索
Spectra-Global 团队针对 8B 与 70B 模型在消费级 GPU 上微调时的 OOM 问题,放弃 8-bit 量化方案,转而将 AdamW 优化器状态通过 FFT 变换到频域处理:动态丢弃低能量频率并压缩后逆向重建,VRAM 用量下降约 50%,避免量化带来的收敛退化;代价是 FFT 计算带来单步延迟略增。
Reddit · r/LocalLLaMAAI 评分2525 单卡 RTX5090 跑本地 LLM 推理遇瓶颈:解码速度足够快,CPU 反而成为智能体编码的真正瓶颈
开发者将 Kenshi 项目移植到 Godot,使用单张 RTX5090 跑本地 LLM 推理服务,GPU 平均解码约 700t/s 却无法再提速;启动 25 个智能体并发占满 12 个服务槽位后,任务卡在 tool call 阶段,CPU 满载。
AWS Machine Learning BlogAI 评分2727 在 LangChain 与 Amazon Bedrock Knowledge Bases 中实现智能体检索
AWS 在 Amazon Bedrock Managed Knowledge Base 中提供智能体检索(AgenticRetrieveStream)能力,可将多部分问题拆解为子查询、评估证据并按需二次搜索,优于单次 Retrieve API 的相似性检索。
Reddit · r/artificialAI 评分99 RAG 系统的提示词语言选择:当目标语言与训练语料不同时
用户在 Reddit 提问:当 RAG 系统的目标语言与 LLM 主要训练语料(英语)不同时,提示词应该直接用目标语言撰写,还是用英语撰写并在提示中要求翻译为目标语言?提问者推测英语提示词可能因训练数据更丰富而获得更好的遵循度,认为语言的常见程度和训练数据量是关键因素,文档内容本身则使用目标语言。
Reddit · r/LocalLLaMAAI 评分1515 开发者实验本地 LLM 项目 Neco:让 AI 像"住"在机器上一样持续存在
开发者围绕 Ollama 和 Open WebUI 构建本地 AI 项目 Neco,通过只读系统层让模型感知主机 uptime、内存占用、负载、电量和温度等状态,并由后台守护进程在无对话时自主生成"闲思"。模型不获得 shell 权限或主机控制权,下一步计划实验情景式记忆与选择性检索,让行为在数周至数月间形成连续性。
Reddit · r/ChatGPTAI 评分1616 Reddit 用户整理 285 款用 Claude、ChatGPT 等 AI 工具制作的浏览器游戏目录
Reddit 用户 friuns 发布了一份浏览器游戏目录,收录 285 款由 Claude、ChatGPT 等 AI 工具制作的 AI 编程 demo,每个条目附带可玩链接、截图及源代码或作者出处,并按 Opus、Sonnet、Astra 以及模型未知的"uncertain"分类。目录页面提供浏览与筛选功能,作者开放征集新提交与反馈。
Reddit · r/LocalLLaMAAI 评分1818 在 64 GB Mac mini 上做 MoE SSD 流式加载:Qwen Flash Next 解码时 GPU 仍有 27% 时间在等专家层
用户在 64 GB Mac mini(M5)上运行 Qwen Flash Next 的 q4 量化版本,由于模型放不进内存,采用将热门专家留在缓存、其他专家从 SSD 流式加载的方案,测得 17.5 t/s 解码和 390 t/s prompt 处理速度,热缓存命中率为 75%。
Reddit · r/LocalLLaMAAI 评分44 如何真正学会使用 vLLM?一位本地部署用户的入门困惑
一位用户在 Reddit r/LocalLLaMA 求助如何上手 vLLM,表示官方文档难以厘清 server 与 client 库的区别。该用户目前用单卡 GPU 运行未量化的 voxtral 3B,想进一步学习量化等进阶用法。他同时用 llama.cpp 在 RX 7900 XTX 上跑量化版的 Qwen 3.8 27B。
Reddit · r/LocalLLaMAAI 评分3232 Apex-2 训练复盘:单卡 H100 瓶颈、DiLoCo 多实例合并与 FineWeb-Edu 去重经验
开发者复盘了自训模型 Apex-2 的经验。原计划用约 1T tokens 训练,但单卡 H100 算力不足,最终只训了约 80B tokens;改用两台 GH200 实例按 DiLoCo 方式每 350 步合并模型,训练速度约为单卡的 1.9x,每张 GPU MFU 约 40%。
Reddit · r/LocalLLaMAAI 评分66 Reddit 讨论:本地 AI 用户用哪种 GPU 笔记本微调多大模型
Reddit r/LocalLLaMA 上有用户发起讨论,询问大家在本地 AI 场景下使用哪款 GPU 笔记本、能真正微调的最大模型是什么,并要求回答者说明 GPU 与 VRAM、笔记本内存、模型与参数规模、微调方式(LoRA / QLoRA / 全参数微调)、上下文长度与 batch size,以及训练后是否真正可用。
Reddit · r/LocalLLaMAAI 评分2222 用户在 Mac Mini M5 64GB 上跑通千问 Qwen Flash Next Q4,结合 SSD 流式与外部盘并行读取优化推理速度
用户在 Mac Mini M5 64GB 上本地运行 Qwen Flash Next Q4 实测取得 17.5 tks decode 和 360 tks prompt processing 的速度。
Reddit · r/LocalLLaMAAI 评分3535 Ornith 1.5 35B-A3B 在双 5070 Ti 上的本地智能体实测:128K 上下文约 180 tok/s
用户在两块 RTX 5070 Ti 16GB 上把日常本地 agent 模型从 Qwen3.8 27B 换成了 Ornith 1.5 35B-A3B(ollama 库名 ornith-1.5。
Hacker News · 首页AI 评分1010 无法生成具体模型标题的 AI 意图、质量与艺术性扩展视频指南
无法生成摘要:正文仅提供 Hacker News 的链接与互动数据(86 积分、34 条评论),未包含任何实际文章内容,无法提取核心主体、关键观点或可验证的事实细节。