#开源/仓库
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#开源/仓库
今日 2 条洞察 · 工具·提示词·论文 三栏速览
每栏 3 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分66 社区发布 Open SLM Evaluations 数据集,覆盖 106 个 150M 参数以下小模型基准
Open SLM Evaluations 是一个开源数据集,收录 106 个参数量在 150M 及以下的小语言模型(SLM)的基准测试分数,并附带各模型的参数规模、名称和链接。该数据集以 Apache 2.0 协议开放,评测在 RunPod B200 上完成,单个模型评估约 30 GPU 分钟。
Reddit · r/LocalLLaMAAI 评分3232 LiquidAI 发布 d1-3B 与 d1-omni 决策模型
LiquidAI 发布两款基于 LFM2.5 架构的零输出 token 决策模型 d1-3B 和 d1-omni。d1-3B(30 亿参数)在 Decision Index 0.2.1 上以 48.57 分位列 10B 以下决策模型榜首,超过 35B-A3B 的 Decider(47.11),单次决策在 NVIDIA RTX 4090 上耗时 8 ms。
Hugging Face Blog精选AI 评分7070 NVIDIA 公布 Nemotron 在 IOI 与 IMO 2026 的金牌级微调与推理方案
NVIDIA 在 Hugging Face 博客介绍基于 Nemotron 3 微调出的系统在 IOI 2026 与 IMO 2026 均达到金牌线,其中 IOI 由 Nemotron-3-Ultra-CC 配合 GenCorrect 取得 535.4/600 分。
推荐理由:原文把 IOI 与 IMO 两个金牌结果的训练数据、方法和推理回路整理成可复用的微调配方,读者可直接对照迁移到自己的领域。
Hacker News · 首页AI 评分6868 Telegraph Test:通过电报式压缩让 LLM 输出 token 近乎减半且不损失下游可读性
作者发布名为 Telegraph Test 的可复现评测与配套仓库 github.com/Travis42/telegraph-test,在 ~1300 道题的固定题库上测量模型把文本写成 cablese(电报体)后的压缩率与跨族可读性。
Reddit · r/LocalLLaMAAI 评分3333 社区作者为 Ternary Bonsai 2 27B 微调 DFlash 2 drafter:L4 加速 2.2x,代码编辑 3.2x
网友基于 z-lab 的 DFlash 2 drafter,用 Bonsai 2 自身 1.5M tokens 的 greedy 输出做微调,使其适配 PrismML 的 Ternary Bonsai 2 27B。
Reddit · r/ChatGPTAI 评分1515 Pixelfork、Rosebud、Spawn 等提示词生成游戏工具横向对比
Reddit 用户对 Pixelfork、Rosebud、Spawn、Mindblown、Genex、GDevelop AI 等 AI 提示词生成游戏(prompt-to-game)工具做了横向对比,列出各平台功能与差异。该帖子指出,目前多数 AI 游戏工具仍停留在只能展示几张截图的 demo 阶段,真正可用的产品开始出现。
Reddit · r/LocalLLaMAAI 评分2323 基于 Qwen3.5-9B 微调的"Bev"决策模型:故意选错答案的对照测试用例
作者基于 Qwen3.5-9B 微调出决策模型 Bev,借助 Bespoke Nimble adapter 微调 51 分钟后,使她在 324 条 held-out 决策上答对率仅 1.9%、平均置信度 96%,置信度 ≥90% 时答对率仅 1.4%。
Reddit · r/LocalLLaMAAI 评分3131 21M 模型外挂 6.4B 参数查找表:性能追平 114M dense 模型,NVMe SSD 即可承载
作者在 21M 模型外挂一张 16.8M 行、6.4B 参数的查找表,在 500M Wikipedia token 训练下性能接近同条件下的 114M dense 模型。
Reddit · r/LocalLLaMAAI 评分4545 Google DeepMind 开源多模态嵌入模型 EmbeddingGemma 2,可在消费级硬件端侧运行
Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本(含代码)、图像、视频和音频输入统一映射到 768 维向量空间。模型共 740M 参数,由 270M 文本模型与 170M 视觉、300M 音频编码器组合而成,专为手机、笔记本等消费级硬件上的低延迟语义表示设计,支持搜索、RAG、分类与聚类等端侧应用。
Reddit · r/LocalLLaMAAI 评分3434 DynamicTune 用闭式权重手术让 Qwen3.5-0.8B 在 ARC-Challenge 上超越 2B 模型
DynamicTune 提出一种无需反向传播的闭式权重手术方法,仅用约 12 分钟在消费级硬件上把 4B 模型的轨迹动力学迁移进 Qwen3.5-0.8B 学生模型。
Latent SpaceAI 评分4848 Reflection 发布 Beam:501B 总参 / 23B 激活的开源 MoE 编程模型
Reflection 发布 Beam,一款文本模型,总参数 501B、激活 23B 的 MoE,面向编程、智能体和科学场景,从零训练并计划于本月以 Apache 2.0 开源完整权重,团队称其在 SWE-bench Verified 上拿到 80.9,推理效率据称是 GLM 5.2 的 3–4 倍。
Reddit · r/LocalLLaMAAI 评分6565 研究称 38% 的 AI 智能体容器逃逸不依赖内核 0-day,作者公开数据集与防御 Harness
作者对 109 起自主 AI 智能体安全事件做实证复盘,覆盖 193 项证伪标准与 199 项评估指标。数据显示 38% 的容器逃逸并未利用内核或虚拟化 0-day,而是来自把 /var/run/docker.sock 挂载进沙箱、把父进程环境变量透传给子智能体、缺乏工具输出污染追踪导致间接 prompt injection,以及未限制本地 socket 绑定引发 SSRF。
Reddit · r/LocalLLaMAAI 评分88 用 FFT 替换 AdamW 优化器状态以削减 VRAM:非量化显存压缩方法的社区探索
Spectra-Global 团队针对 8B 与 70B 模型在消费级 GPU 上微调时的 OOM 问题,放弃 8-bit 量化方案,转而将 AdamW 优化器状态通过 FFT 变换到频域处理:动态丢弃低能量频率并压缩后逆向重建,VRAM 用量下降约 50%,避免量化带来的收敛退化;代价是 FFT 计算带来单步延迟略增。
Reddit · r/LocalLLaMAAI 评分1919 UCVG.cpp:面向任意大语言模型的 C++ 控制向量生成工具,仅需一对提示词即可生成
开发者 Egor4more 发布 UCVG.cpp,一款仿照 llama.cpp 安装流程的控制向量生成工具,用户只需输入一对对比提示词即可为任意大语言模型生成控制向量,从而绕过系统提示词被忽略或被用户输入覆盖的局限。作者以 Qwen3.6-35B-A3B 给出生成示例,指出高强度引导可能使输出质量下降,简化现有工具的部署复杂度是该项目的主要目标。
Reddit · r/LocalLLaMAAI 评分4646 Agens Volundr 32B Preview 发布:Blockway 自研混合架构,72 层仅 18 层保留 KV cache
Blockway 团队发布 Agens Volundr 32B Preview,这是其首款基于自研混合架构的模型,72 层中仅 18 层保留 KV cache,上下文窗口 262K,采用 Apache-2.0 开源。
Unbug 一分钟读论文AI 评分5252 AI 范式雷达:智能体正从应用循环迁为集群一等负载
作者以 google/ax v0.3.0 上线 HN 头版(663 分,仓库 11,045 星)为供给端证据,以 Linear 官方博客指出 AI 生成代码让 CI 成为新瓶颈为需求端证据。