#教程/实践
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#教程/实践
今日 12 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分4747 Strata 0.1.38 本地大模型推理性能测试:RTX 4090 48GB + 128GB RAM
在 RTX 4090 48GB + 128GB RAM 上测试 Strata 0.1.38 推理引擎,发现 n-gram 表加载到 RAM 仅提升 1.2% 解码速度但占用 28.4 GiB。
Reddit · r/LocalLLaMAAI 评分3636 本地 TTS 工具 Breeze 体验:结合 Opus 5.5 实现低延迟语音对话
用户使用本地 TTS 工具 Breeze 结合 Opus 5.5 模型,实现语音对话功能。无思考模式延迟约 500ms,低思考模式延迟 1-1.5s,可通过 BLE 遥控器和无线麦克风坐在沙发上直接对话。系统能监控 Claude session 结束并用语音发送简短摘要,在超过 500k token 上下文后仍保持一致的 live session 记忆。
Reddit · r/LocalLLaMAAI 评分2727 JEV 与普通嵌入模型有何不同?
JEV 是一个基于嵌入的意图路由器(embedding-based intent router),通过计算用户输入与预设示例意图之间的余弦相似度来路由任务。它使用 Ollama 运行 nomic-embed-text 模型生成嵌入向量,而非直接输出答案。
Reddit · r/LocalLLaMAAI 评分2020 不同推理引擎中 IQ3_S 模型表现差异:llama.cpp 可生成连贯答案
用户在"miracle engine"中运行 IQ3_S 模型让其评价帖子时,模型陷入 doom loop,10k tokens 后仍无法给出连贯答案。同一模型在 llama.cpp 中可以正常生成连贯回复。当前开源模型中仍缺乏有效减少谄媚(sycophancy)的方案。
Reddit · r/ChatGPTAI 评分3838 ChatGPT 提示词分享:把邮件主题变成儿童书籍封面(V5.5)
分享一个 ChatGPT 提示词(V5.5),可将任意邮件主题线转换为想象的儿童书籍封面图像,采用"双世界系统"设计——书籍封面与真实世界背景分离。提示词要求用户明确指令才能生成图像,并提供三个不同的封面概念供选择。
Reddit · r/artificialAI 评分1616 从 100KB 到 2.5TB:Reddit 用户梳理 AI 模型规模谱系与硬件成本
Reddit 用户 abhishekkumar333 整理了从 100KB TinyML 到 2.5TB MoE 巨模型的 AI 模型规模谱系,对应不同硬件需求与运行成本。
Reddit · r/LocalLLaMAAI 评分4141 64GB 系统内存的困境:Strata 让 Qwen3.8-Flash-Next 推理提速至 60 t/s,但模型加载后内存占用达 96%
用户在 64GB DDR5 内存机器上测试 Strata 框架运行 Qwen3.8-Flash-Next(IQ3_XXS 量化,约 70GB),推理速度从 llama.cpp 的 21 t/s 提升至 60 t/s,但加载 QFN 后系统内存使用率高达 96%,无法同时运行需要大量系统内存的 Minimax H3。
Reddit · r/LocalLLaMAAI 评分2121 哪个现代开源大语言模型最不谄媚?
用户在 Reddit 社区询问当前最不具谄媚特性的开源权重模型,指出此前的 Kimi K2 和 GPT OSS 120b 已过时。谄媚特性对创意研究和智能体编程工作造成负面影响——前者会使用户陷入自身错误思路,后者则会降低模型发现代码 bug 的能力。
Reddit · r/LocalLLaMAAI 评分3737 Strata Qwen 3.8 flash next 是自 Qwen 3.8 27b 发布以来最重要的更新
Strata Qwen 3.8 flash next 让低显存用户能以较高速度运行 Flash Next 作为主力模型。实测速度达到 80-110 tok/s(2500 pp),与 qwen 3.5-35-a3b 速度相当,但智能水平超过 Qwen 3.8 27b,可在双 RTX 3090(96GB DDR5)上运行。
Reddit · r/LocalLLaMAAI 评分2222 本地大语言模型 Web Search 安全部署讨论
用户在 Reddit 询问如何在本地大语言模型(如 Hermes、pi 等)中安全部署 web search 功能。求助者实现了沙盒搜索系统但导致无限工具调用,希望防范 prompt injection 攻击并保护搜索隐私。暂无成熟方案。
Reddit · r/ChatGPTAI 评分2121 ChatGPT + Meshy 创作"月中人"3D模型并3D打印
作者使用 ChatGPT 设计"月中人"艺术图案,借助 Meshy 生成 3D 模型并进行 3D 打印。打印效果良好,仅需轻微打磨即可上色。
Hacker News · 首页AI 评分2828 用 Claude 自动化 35mm 胶片扫描流水线:从驱动扫描仪到负片转正、去尘与编辑
摄影爱好者 Shan 用 Claude 接管了 35mm 胶片扫描流水线:先用 SANE 驱动扫描仪因方向反转险些损坏机械,改为在 VueScan 扫描后交接给 Claude 处理后续环节。Claude 通过 numpy 做负片密度反转并以片卷空白段为基准统一色彩,再用图像分析定位灰尘、用 LaMa 模型填补并从邻近颗粒补回细节,使原本每卷 36 张需约 4 小时的流程被自动化。
Hacker News · 首页AI 评分7373 如何用 C2PA '黑掉'时间戳
安全研究员通过实验发现 C2PA 标准允许任意排除文件字节范围的特性,可构造排除整个文件的 Manifest,从而在图像上伪造可信的时间戳。研究者先拍摄彩票照片并获得合法时间戳,再在开奖后修改图像(p图),验证 C2PA 签名仍显示原始时间。研究者指出修复这一漏洞需要为每种文件格式明确限定允许排除的范围。
Hacker News · 首页AI 评分2929 如何用 UWB 技术追踪垃圾桶是否被搬出
作者用超宽带(UWB)技术搭建了 BinRange 系统判断六个垃圾桶是否被搬出。该方案使用 Makerfabs ESP32-WROVER/DW3000 开发板作为 radio anchor 和标签,在 10 米距离测试中误差小于 2 厘米,户外可靠距离约 30 米。系统与 Home Assistant 集成,结合回收日程判断垃圾桶状态。
Reddit · r/ChatGPTAI 评分1111 Codex 的 sub-agents 怎么这么烧预算?
用户在 Codex 中配置 3 个 sub-agents 加 1 个 orchestrator,仅 5 分钟就花掉 5 小时预算。对比之下,之前单独给 6.1 sol 分配 extra high effort 任务,30 分钟只用了 10% 预算。
Reddit · r/ChatGPTAI 评分3636 用5美元AliExpress时钟显示AI使用限额
海外开发者花费5美元购买AliExpress小闹钟,通过Wi-Fi将电脑屏幕内容传输至时钟,成功显示Codex和Claude的使用限额,保留了原始固件。项目代码已开源分享。
Reddit · r/LocalLLaMAAI 评分5050 如何在 16GB RTX 3080 笔记本上运行 Qwen3.8 Flash Next 176B
利用 TensorSharp 推理引擎通过量化 + MoE 感知的跨内存层次统一调度(VRAM、RAM、SSD),在配备 16GB VRAM 的 RTX 3080 笔记本上成功运行 176B MoE 大语言模型。
Hacker News · 首页AI 评分7373 如何在 Claude 和 Claude Code 中充分利用 Opus 5.5
Anthropic 发布 Opus 5.5 使用指南,涵盖三大方面:提问技巧(给出明确完成标准、删除 think hard 提示、设计需求列出要避免的风格)、长时间运行管理(CLAUDE.md 配置何时停止或继续、用子任务拆分大型工作、在文件中维护任务清单)、结果检查(优先阅读模型需要你做什么、让模型标记未确认的信息)。
Reddit · r/artificialAI 评分2020 Swokei 如何帮助联系有糟糕网站的企业
用户发现 Swokei 可以自动查找潜在客户并分析其网站问题,包括过时设计、加载速度慢、移动端体验差和 SEO 薄弱等。该工具根据分析结果生成人性化的冷邮件,而非枯燥的评分报告,使外展联系更加高效。对网页设计机构而言,这大大节省了手动 prospecting 和个性化沟通的时间。
Reddit · r/MachineLearningAI 评分3131 《The Principles of Diffusion Models》书评:Lai 等人如何兼顾数学严谨性与直觉
《The Principles of Diffusion Models》是一部专著,作者在数学严谨性与直觉理解之间取得了出色平衡,并提供专门附录供读者深入数学细节。该书面向具有基础深度学习知识的研究生、研究人员和从业者,DDPM 有扎实基础者更能从中获益。全文可在官网免费获取。
Reddit · r/LocalLLaMAAI 评分2121 用户用 3 张 RTX 3060 12GB 搭建 "Flash Next" 推理卡:速度达 38-40 t/s
Reddit 用户在 r/LocalLLaMA 分享使用 3 张 RTX 3060 12GB 显卡运行 Flash Next 框架的测试结果,在 IQ3 模型上达到 38-40 t/s 推理速度,同条件 llama.cpp 仅能实现 13.2 t/s。
Reddit · r/ChatGPTAI 评分3333 ChatGPT Airtable 插件使用体验分享
一位 Reddit 用户分享了将 ChatGPT 与 Airtable 插件结合使用的体验,通过自然语言指令可自动从论坛、Reddit 等来源抓取数据并添加至 Airtable 表格,同时还能调用 sites skill 直接生成展示网站。用户表示其工作流程因此实现了高度自动化。
Reddit · r/ChatGPTAI 评分3838 ChatGPT Astra 自动化修复旧 MacBook Pro 多个硬件功能
用户通过 ChatGPT Desktop 应用的 Astra 功能,让其自动修复了安装 Ubuntu 的旧 MacBook Pro 的声音、摄像头、雷雳接口、键盘背光、电池管理和睡眠模式问题。整个过程用户仅需授权和输入密码,Astra 独立完成所有技术调试。
Reddit · r/LocalLLaMAAI 评分6363 用本地 LLM 玩魔兽世界:开源项目展示
作者搭建了一个魔兽世界私人服务器,并编写了浏览器客户端和 MCP Agent 工具,可通过 WebSocket 用 LLM 控制角色玩游戏。项目支持本地模型连接,24GB 内存可运行 Qwen3.8-27B-GPTQ-W4A16,16GB 内存推荐用 vLLM 加载自定义的 Gemma4-e4b-coder(约 200 tok/s)。
Reddit · r/ChatGPTAI 评分1919 ChatGPT 如何在新聊天中保持之前对话的上下文和语气?
用户在ChatGPT中进行了超过1000条消息的长对话后,点击"New Chat"只能打开普通新聊天页面,无法保留原对话的上下文。曾让GPT总结对话并粘贴到新聊天中,但无法恢复原来的语气、温暖和友好等特征。当前ChatGPT尚无法在不同会话间传递完整的对话上下文和风格设置。
Reddit · r/LocalLLaMAAI 评分1111 谁在用本地 AI 会议记录方案替代 Fathom?
用户寻求将会议记录流程本地化,目前使用 Bluedot(无需会议机器人,会后获取转录、总结和待办事项),希望将转录和旧会议搜索存储也迁移至本地。询问社区日常可用的本地方案,提及 Whisper + Ollama 作为备选。
Reddit · r/LocalLLaMAAI 评分3737 Strata 发布 MoE 缓存方案,性能超越 llama.cpp 5-10 倍
Strata 用约两周时间实现了 MoE 缓存优化,带来 5-10x prefill 和 3-4x decode 性能提升。方案基于 Qwen-3.8-flash-next 模型,在 8-16gb 显卡 + 64gb 内存配置下达 2000/70 t/s+ 速度,比 27b 模型更快。
Reddit · r/artificialAI 评分1818 AI 模型成本究竟从何而来?
Reddit 用户质疑 Claude Opus 5.5 定价低于 Opus 5.0、Astra 和 Fable,不理解成本差异的真正来源,猜测定价可能基于硬件成本而非实际效率。用户认为直接调整旧版本价格即可实现降价,无需推出新版本。
Hacker News · 首页AI 评分5252 在 M4 Mac mini 上启动 Linux 的历程
作者记录了在 M4 Mac mini 上成功启动 Linux 的完整过程。M4 是首款强制启用 SPTM 的 Apple Silicon 芯片,作者依次解决了 GXF 功能锁定、MMU 初始化时的 MMIO 映射、CPU 寄存器访问权限、以及 WFI 指令导致寄存器状态丢失等问题。
Hacker News · 首页AI 评分6262 开发者一月 GLM 5.3 Flash 使用复盘:经验与教训
Wagtail 团队开发者尝试整月只使用 GLM 5.3 Flash 模型进行编码,前半月成功但后半月因 MCP 服务器 vibe coding 失误导致 1B tokens 外流,总成本 $218、35 kWh 能源使用。
AWS Machine Learning BlogAI 评分5151 在 SageMaker AI 上用 vLLM-Omni 构建实时语音应用
本教程讲解如何在 Amazon SageMaker AI 上使用 AWS vLLM-Omni DLC 部署 Qwen3-TTS 模型,实现边生成边播放的流式语音输出。通过 Gradio 应用演示文本输入和 24kHz PCM 音频流的完整工作流程,并提供部署脚本和双向流式传输配置。
AWS Machine Learning BlogAI 评分4848 如何在 SageMaker AI 上用 vLLM-Omni 生成图像和视频(下篇)
在 Amazon SageMaker AI 上使用 vLLM-Omni 容器部署两个端点,通过文本提示词生成静态图像(FLUX.2-klein-4B 实时端点),再将该图像作为条件输入生成视频(Wan2.1-VACE-1.3B 异步端点)。图像直接返回,视频生成完成后从 Amazon S3 检索 MP4 文件,示例包含命令行工作流和 Streamlit 界面。
AWS Machine Learning BlogAI 评分5555 使用 Amazon Nova Act 实现合成监控
Amazon Nova Act 使用多模态大语言模型处理 UI 截图而非 DOM 选择器,能自适应大部分 UI 变化。该方案结合 Amazon Bedrock AgentCore Runtime 实现无服务器执行,提供完整的示例代码仓库,包含部署脚本和 CDK 基础设施代码。
AWS Machine Learning BlogAI 评分4747 Amazon Textract 适配器跨账户生命周期管理自动化方案
Amazon Textract Custom Queries 适配器支持针对特定文档类型微调提取精度,但跨账户推广、文档路由选择和生产安全配置构成三大核心挑战。
Simon WillisonAI 评分5353 Simon Willison 用 Claude Opus 5.5 创建像素艺术 Kākāpō 派对动画
Simon Willison 在 WeAreDevelopers 世界开发者大会上发表闭幕演讲时,用 Claude Opus 5.5 根据三张kākāpō(新西兰不会飞的鹦鹉)照片生成了一个像素风格的互动动画网页,包含20多只鹦鹉在 disco 球下跳舞并伴随五彩纸屑效果。
GitHub Blog · AI & ML精选AI 评分6262 GitHub Copilot 应用教程:如何用 canvases 构建自定义工作流
GitHub Copilot 应用推出 canvas(画布)功能,这是一个可定制的双向界面,可以是 kanban board、issue triage board、release checklist 等形式。
推荐理由:原文给出了创建 canvas 的具体步骤和三个核心问题,读者可以直接按图索骥使用 /create-canvas 技能。
AWS Machine Learning BlogAI 评分4949 使用 EFA 和 DeepEP 在 Amazon EKS 上扩展 MoE 强化学习训练,吞吐量提升 40%
AWS 展示了在 Amazon EKS 上使用 Elastic Fabric Adapter (EFA) 和 DeepEP 扩展混合专家(MoE)模型强化学习训练的架构,实现 40% 吞吐量提升。
AWS Machine Learning Blog精选AI 评分6060 在 AWS SageMaker HyperPod 上使用 SkyRL 加速多模态 RL 训练
本文详细介绍了在 Amazon SageMaker HyperPod 上使用开源 SkyRL 框架训练多模态强化学习模型的全流程,包括构建容器镜像、从 SageMaker Studio 启动 Ray 集群、提交训练任务、监控进度以及托管推理服务。
推荐理由:给出了完整的操作流程和实验数据,读者可以据此在 SageMaker HyperPod 上复现多模态 RL 训练。
Latent SpaceAI 评分2525 Latent Space 宣布 AINews v3 升级计划,将整合 Discord 并迁移至 Beehiiv
Latent Space 宣布 AINews v3 升级计划,将合并数万成员的 Discord 以解决活跃度下降问题,并迁移至 Beehiiv 平台重建首页,同时重新开放赞助合作。
GitHub Blog · AI & ML精选AI 评分6767 GitHub Security Lab 发布 Taskflow Agent:实现 AI 驱动的自动化模糊测试
GitHub Security Lab 发布 Fuzzing Taskflow,这是一个基于 LLM Agent 的 C/C++ 项目自动化模糊测试管道。只需指定一个 GitHub 仓库,Agent 会自动完成入口点识别、构建系统分析、模糊测试用例生成、AFL++ 运行、覆盖率分析、用例优化和漏洞报告编写。
推荐理由:原文详细给出了自动化模糊测试的完整工作流程,包括覆盖率反馈循环、结构感知变异和语料库演进等具体机制,读者可据此迁移到自己的安全测试中。