#教程/实践
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#教程/实践
今日 12 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/artificialAI 评分2626 Row-Bot 5.0 接入 qwen3.8:27b 本地跑通:用一年账单和租约替用户找出漏水与违规涨租
用户在本机 5090 GPU 上用 Ollama 运行 Row-Bot 5.0 搭配 qwen3.8:27b 模型,离线处理了一年份账单、租约、保单和涨租通知(均虚构),识别出水费账单可能存在漏水,并将 10% 的涨租与合同中 5% 的上限及通知期条款 4.1–4.3 对比后判定违约。
Reddit · r/MachineLearningAI 评分2121 ZhemaIsmayil 曾用神经网络为每个字体生成嵌入向量并以 tSNE 可视化,意外得到花朵状结构
一名开发者用预训练神经网络为每个字体的字符生成嵌入向量,再用 tSNE 把降维后的嵌入映射为 XYZ 和 RGB 通道并以点云可视化,使视觉相近的字体在位置和颜色上自然聚集。在 Google Fonts 语料上,该可视化呈现出花朵形状,大多数手写体字体集中于花蕊区域。作者另在其字体检索网站上提供了基于全部可搜索字体的类似可视化。
Reddit · r/LocalLLaMAAI 评分1010 yandex/AliceAI-80B-A3B 后训练 Instruct 微调进展更新
开发者对 yandex/AliceAI-80B-A3B-Base 进行 Instruct 微调,目标为支持智能体任务与对话,并通过 qwen 3.8 27b 的浅层蒸馏注入链式推理能力。
Reddit · r/ChatGPTAI 评分2626 Claude Code 与 Codex 通过共享文本文件互相审核彼此的工作
用户让 Claude Code 与 Codex 通过本地一个共享文本文件自主交流,互相检查彼此的剪辑与实现,并交换截图与时间戳确认细节,例如 Codex 提出高尔夫球"跳出"洞口的问题,Claude 修正后再由 Codex 复核。用户表示自己只负责 A/B 测试与最终确认,对两个 AI 自行协作的范围感到意外。
Reddit · r/LocalLLaMAAI 评分88 用 FFT 替换 AdamW 优化器状态以削减 VRAM:非量化显存压缩方法的社区探索
Spectra-Global 团队针对 8B 与 70B 模型在消费级 GPU 上微调时的 OOM 问题,放弃 8-bit 量化方案,转而将 AdamW 优化器状态通过 FFT 变换到频域处理:动态丢弃低能量频率并压缩后逆向重建,VRAM 用量下降约 50%,避免量化带来的收敛退化;代价是 FFT 计算带来单步延迟略增。
Reddit · r/LocalLLaMAAI 评分2525 单卡 RTX5090 跑本地 LLM 推理遇瓶颈:解码速度足够快,CPU 反而成为智能体编码的真正瓶颈
开发者将 Kenshi 项目移植到 Godot,使用单张 RTX5090 跑本地 LLM 推理服务,GPU 平均解码约 700t/s 却无法再提速;启动 25 个智能体并发占满 12 个服务槽位后,任务卡在 tool call 阶段,CPU 满载。
AWS Machine Learning BlogAI 评分88 如何在 Amazon Quick 中降级用户角色
Amazon Quick 控制台不支持直接将用户从 Author 降级至 Reader,update-user API 也会拒绝此类操作并报"You cannot downgrade a user role"错误。
AWS Machine Learning BlogAI 评分2727 在 LangChain 与 Amazon Bedrock Knowledge Bases 中实现智能体检索
AWS 在 Amazon Bedrock Managed Knowledge Base 中提供智能体检索(AgenticRetrieveStream)能力,可将多部分问题拆解为子查询、评估证据并按需二次搜索,优于单次 Retrieve API 的相似性检索。
AWS Machine Learning BlogAI 评分2525 让 Amazon Quick 具备企业级能力:基于 Amazon Bedrock AgentCore 的跨账号资源自动化迁移方案
AWS 在 Amazon Bedrock AgentCore 之上开源了 Quick Resource Migrator,一个可通过单次 MCP 工具调用完成 Amazon Quick 资源跨账号迁移的 MCP 服务器。
Reddit · r/artificialAI 评分99 RAG 系统的提示词语言选择:当目标语言与训练语料不同时
用户在 Reddit 提问:当 RAG 系统的目标语言与 LLM 主要训练语料(英语)不同时,提示词应该直接用目标语言撰写,还是用英语撰写并在提示中要求翻译为目标语言?提问者推测英语提示词可能因训练数据更丰富而获得更好的遵循度,认为语言的常见程度和训练数据量是关键因素,文档内容本身则使用目标语言。
Reddit · r/LocalLLaMAAI 评分2222 基于 40 万合成数据微调的 1.5B Qwen 模型在 bash 命令生成上达到 gpt-4o 水平,并开源微调数据集
网友 Comfortable-Rock-498 作为业余项目,将 1.5B 参数的 Qwen 模型微调用于生成 bash 命令,全部使用 40 万条合成数据进行训练,并在该任务上达到 gpt-4o 水平。作者同步开源了微调后的模型与训练数据集,公开了训练与 CLI 流程,欢迎社区自行训练或使用。
Reddit · r/LocalLLaMAAI 评分1515 开发者实验本地 LLM 项目 Neco:让 AI 像"住"在机器上一样持续存在
开发者围绕 Ollama 和 Open WebUI 构建本地 AI 项目 Neco,通过只读系统层让模型感知主机 uptime、内存占用、负载、电量和温度等状态,并由后台守护进程在无对话时自主生成"闲思"。模型不获得 shell 权限或主机控制权,下一步计划实验情景式记忆与选择性检索,让行为在数周至数月间形成连续性。
Reddit · r/LocalLLaMAAI 评分2424 在 veloGB10 上运行 Swift 1.5:xhigh 档位反超 base Flash-Next 中档 vLLM 表现
在两台 DGX Spark 上,UkisAI 基于 Qwen3.8-Flash-Next 微调的 Swift 1.5(推理高效版)借助 sf-stav 的 Rust/CUDA 推理引擎 veloGB10 实现了约 110 tok/s 的单流解码速度,运行 xhigh effort 仍比旧 vLLM NVFP4 环境下 base Flash-Next medium 档更快。
Reddit · r/MachineLearningAI 评分1717 开发者用合成数据训练仅 31,251 参数的 encoder-only Transformer 预测血糖(第二部分)
开发者 0xdeadf1sh 发布第二部分实验,基于其 1 型糖尿病患者模拟器合成数据训练了一款仅 31,251 参数的 encoder-only Transformer 模型,可预测未来 2 小时血糖并能以自回归方式扩展至 8 小时夜间预测,训练时长不足 60 分钟,使用 NVIDIA DGX Spark。
Reddit · r/ChatGPTAI 评分1616 Reddit 用户整理 285 款用 Claude、ChatGPT 等 AI 工具制作的浏览器游戏目录
Reddit 用户 friuns 发布了一份浏览器游戏目录,收录 285 款由 Claude、ChatGPT 等 AI 工具制作的 AI 编程 demo,每个条目附带可玩链接、截图及源代码或作者出处,并按 Opus、Sonnet、Astra 以及模型未知的"uncertain"分类。目录页面提供浏览与筛选功能,作者开放征集新提交与反馈。
Reddit · r/LocalLLaMAAI 评分1717 Project Athena:如何用纯 Markdown 文件把本地编码 Agent 的 KV cache 压到 2K tokens 以内(开源)
开发者将一套名为 Project Athena 的本地 LLM 编码工作流以 MIT 协议开源,核心做法是把状态存为磁盘上纯文本、git 版本化的 Markdown 文件。
Reddit · r/LocalLLaMAAI 评分1818 在 64 GB Mac mini 上做 MoE SSD 流式加载:Qwen Flash Next 解码时 GPU 仍有 27% 时间在等专家层
用户在 64 GB Mac mini(M5)上运行 Qwen Flash Next 的 q4 量化版本,由于模型放不进内存,采用将热门专家留在缓存、其他专家从 SSD 流式加载的方案,测得 17.5 t/s 解码和 390 t/s prompt 处理速度,热缓存命中率为 75%。
Reddit · r/ChatGPTAI 评分2121 ChatGPT 键盘快捷键全整理:从最实用到最危险按使用频率排序
一位 Reddit 用户按使用频率整理了 ChatGPT 的全套键盘快捷键(Mac 用 Cmd 替代 Ctrl),最常用的是 Ctrl+Shift+O(新建对话)和 Ctrl+K(搜索历史聊天)。
Reddit · r/LocalLLaMAAI 评分44 如何真正学会使用 vLLM?一位本地部署用户的入门困惑
一位用户在 Reddit r/LocalLLaMA 求助如何上手 vLLM,表示官方文档难以厘清 server 与 client 库的区别。该用户目前用单卡 GPU 运行未量化的 voxtral 3B,想进一步学习量化等进阶用法。他同时用 llama.cpp 在 RX 7900 XTX 上跑量化版的 Qwen 3.8 27B。
Reddit · r/LocalLLaMAAI 评分3232 Apex-2 训练复盘:单卡 H100 瓶颈、DiLoCo 多实例合并与 FineWeb-Edu 去重经验
开发者复盘了自训模型 Apex-2 的经验。原计划用约 1T tokens 训练,但单卡 H100 算力不足,最终只训了约 80B tokens;改用两台 GH200 实例按 DiLoCo 方式每 350 步合并模型,训练速度约为单卡的 1.9x,每张 GPU MFU 约 40%。
Reddit · r/LocalLLaMAAI 评分66 Reddit 讨论:本地 AI 用户用哪种 GPU 笔记本微调多大模型
Reddit r/LocalLLaMA 上有用户发起讨论,询问大家在本地 AI 场景下使用哪款 GPU 笔记本、能真正微调的最大模型是什么,并要求回答者说明 GPU 与 VRAM、笔记本内存、模型与参数规模、微调方式(LoRA / QLoRA / 全参数微调)、上下文长度与 batch size,以及训练后是否真正可用。
Reddit · r/LocalLLaMAAI 评分2222 用户在 Mac Mini M5 64GB 上跑通千问 Qwen Flash Next Q4,结合 SSD 流式与外部盘并行读取优化推理速度
用户在 Mac Mini M5 64GB 上本地运行 Qwen Flash Next Q4 实测取得 17.5 tks decode 和 360 tks prompt processing 的速度。
Reddit · r/LocalLLaMAAI 评分3535 Ornith 1.5 35B-A3B 在双 5070 Ti 上的本地智能体实测:128K 上下文约 180 tok/s
用户在两块 RTX 5070 Ti 16GB 上把日常本地 agent 模型从 Qwen3.8 27B 换成了 Ornith 1.5 35B-A3B(ollama 库名 ornith-1.5。
Reddit · r/artificialAI 评分1414 如何用 AI 构建个人知识追踪与摘要系统?
一位从业者为高效追踪多位专家的YouTube视频、邮件、X推文和PDF等内容,求助AI辅助总结与知识管理方案。提出利用 yt-dlp 获取内容、Whisper 转录视频、SQLite+FTS5 存储与检索的流水线,作者具备 Codex/Claude Code 使用经验和本地硬件资源。
Reddit · r/LocalLLaMAAI 评分4545 Infermeld:支持 AMD + NVIDIA 混合 GPU 推理的 llama.cpp Linux 工具包
Infermeld 是一个实验性开源 Linux 工具包,可让同一 GGUF 模型同时在 AMD 和 NVIDIA 显卡上运行,采用 llama.cpp 作为推理引擎,Vulkan + CUDA 双后端支持。
Hacker News · 首页AI 评分1010 无法生成具体模型标题的 AI 意图、质量与艺术性扩展视频指南
无法生成摘要:正文仅提供 Hacker News 的链接与互动数据(86 积分、34 条评论),未包含任何实际文章内容,无法提取核心主体、关键观点或可验证的事实细节。
Reddit · r/LocalLLaMAAI 评分1313 有什么免费、本地的带旁白解释视频制作工具?
explainroo 是一款完全本地运行的带旁白解释视频制作工具,整合了 Kokoro 语音合成、Whisper 单词计时、headless Chrome 画帧和 ffmpeg 视频合成,无需 API 密钥。该用户认为功能较为简单,生成的视频风格缺乏变化,正在 Reddit 社区寻求其他免费本地替代方案。
Reddit · r/LocalLLaMAAI 评分3535 预算友好型 Vulkan GPU 推荐列表
整理了一份支持 Vulkan 的旧款预算 GPU 推荐列表,筛选条件为内存带宽≥256 GB/s、VRAM≥8 GB,涵盖 NVIDIA GTX/Tesla/Quadro、AMD Radeon/Instinct 等多系列。最终推荐 AMD Instinct MI50 16GB,当前二手市场约 $150。
Reddit · r/LocalLLaMAAI 评分1414 Strix Halo (GMKtec EVO-X2) 是目前最接近"梦想"本地大语言模型运行设备的选择吗?
讨论认为内存容量仍是运行20B-32B模型(Q5/Q6量化)的真正瓶颈,消费级GPU带宽优秀但显存有限,NPU/AI加速器算力强但内存不足,FPGA方案带宽仍受限制。Strix Halo系统(GMKtec EVO-X2、Framework Desktop)提供大统一内存池但价格昂贵。"梦想"加速器需要48+ GB内存、500+ GB/s带宽、低于1000美元,但目前尚无产品真正达到该规格。
Reddit · r/LocalLLaMAAI 评分2828 升级双 R9700 显卡配置咨询:如何搭建以运行 Qwen3.8-Flash-Next
Reddit 用户从单张 AMD Radeon AI PRO R9700 升级到双卡配置,以加速运行 Qwen3.8-Flash-Next(Q4/higher quants 27B)。主板已确认支持 x8/x8 显卡拆分,总价约 $6307.84。
Reddit · r/LocalLLaMAAI 评分3434 strata-swift-iq3_xxs 在推理过程中随机插入完全不相关信息的问题
用户在使用 Qwen3.8-27b-iq4xs 变体时发现,更小的 strata-swift-iq3_xxs 模型反而实现了 2~3 倍性能提升。然而,该模型在执行代码去冗余任务时,其推理过程中突然插入了 Lee Kuan Yew(李光耀)的生平简介,与原任务完全无关。模型出现此类"病理"行为的原因尚不明确。
Reddit · r/LocalLLaMAAI 评分3434 本地跑酷模拟器实现:GLM-4-Flash + 2x DGX Sparks + vllm TP2 推理
开发者在 2x DGX Sparks 服务器上运行 GLM-4-Flash 模型,实现完全本地化的跑酷模拟器。采用 vllm TP2 方案,Prefill 吞吐量约 1500token/s,Decode 约 40token/s,支持 100k 上下文。
Reddit · r/LocalLLaMAAI 评分2323 双 DGX Spark 用户:GLM 5.3 flash 获得 50%+ 性能提升
GLM 5.3 flash 最新版本在双 DGX Spark 环境下实现 50-90% decode 性能提升,prefill 仅轻微下降(-10% 至 -21%)。实测代码、聊天、SQL 插入等任务提升 7-13%,整体速度超越 DeepSeek v4.0 flash,智能水平接近 Claude Opus 4.8。
Reddit · r/LocalLLaMAAI 评分2121 LLM Inference Dashboard:本地 LLM 推理资源监控工具
开发者正在构建一个轻量级(64mb)的本地 LLM 推理资源仪表板,支持 llama、strata、custom cuda engines、unsloth、LMS 等多种推理引擎,提供比默认 API 端点更丰富的日志和指标。该工具通过 collector 扩展网络 API 端点,目前尚未公开发布,作者在 Reddit 社区调研潜在用户兴趣。
Reddit · r/LocalLLaMAAI 评分2727 Yandex/AliceAI-80B-A3B 指令微调项目更新 #4
对 Yandex/AliceAI-80B-A3B-Base 进行指令微调的项目已完成第一轮 SFT,但因 500 万 tokens 训练数据覆盖不足,模型在模糊问题上表现欠佳。
Reddit · r/LocalLLaMAAI 评分4040 我把 antirez 的 ds4 精简成 Qwen3.8 Flash Next on Metal,速度提升约 10% 且保持位精确输出
作者将 ds4 代码库从 85k 行精简至 45k 行,专门针对 Qwen3.8 Flash Next 在 Metal 上运行。在 M5 Max 128GB RAM 上,Q2 解码速度提升 9-13%,MTP 吞吐量从 75.8 提升至 86.7 tok/s,同时保持位精确输出。创建了 StarForge 仓库管理定制版本,fork 与上游保持同步。
Reddit · r/LocalLLaMAAI 评分3939 Strata 分支在 IBM AC922 上运行 Qwen3.8-FN UD-Q4_K_XL 实现 7357 tok/s prefill 和 113 tok/s decode
开发者在 IBM AC922(双 POWER9 20 核 CPU + 4×16GB Tesla V100 GPU)上对 Strata 进行深度优化,使用 Qwen3.8-FN UD-Q4_K_XL 模型达到 7357 tok/s prefill 速度和 113 tok/s decode 速度。
Reddit · r/LocalLLaMAAI 评分5858 Intel 混合 CPU 用户运行 Strata 调优:解码速度提升近 3 倍
用户在 Intel 14700KF 混合 CPU 上运行 Strata 推理引擎,通过 calibrate 工具调整三个设置,使 Qwen3.8-Flash-Next IQ3_S 在 262K 上下文下的解码速度从 17.2 tok/s 提升到 53.5 tok/s。
Reddit · r/LocalLLaMAAI 评分5454 将 LLM 蒸馏为文档提取模型:GLiNER 多编码器方案实践
作者将 LLM 蒸馏为两个 287M 参数编码器,用于从 500 万份法院判决书中提取结构化信息。方案使用 GLiNER2.5-multi-v1 标记实体/动作/值,再用 GLiNER2.5-multi-Decide 做多选消歧。
Reddit · r/LocalLLaMAAI 评分1515 如何提升 Qwen 本地模型的创意写作能力
一位用户询问如何提升本地 Qwen 模型的创意写作能力,目前使用 Qwen 3.8 flash next(q4 量化版本)通过 llama.cpp 运行。该用户指出 Qwen 模型在研究和 HTML 文件编写方面优于 Gemma 和 Muse,但后者在创意写作方面表现更强。