#开源/仓库
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#开源/仓库
今日 22 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/MachineLearningAI 评分3030 Chunkr:用 Rust 实现的 chunking 库,速度比 LangChain 等方案快约 20 倍
开发者推出 Rust 编写的 chunking 库 Chunkr,支持 Character、Recursive、Markdown header、Late chunking、Hierarchical chunking 等策略及原生 PDF 加载。
Reddit · r/LocalLLaMAAI 评分4646 Cactus Whistle:16.9MB 超小体积 ASR 模型,文件大小仅为 Whisper base 的 1/9
Cactus Compute 发布 Whisper 同类自动语音识别模型 Whistle,权重开源,文件仅 16.9MB,约为 Whisper base(145.3MB)的 1/9。
Reddit · r/LocalLLaMAAI 评分00 Context Language Models 论文解读:让模型像编辑文件一样动态修改上下文
一篇新论文提出 Context Language Models,让模型在推理过程中像编辑文件一样实时修改上下文,可在长时任务、编程与深度研究上提升表现并降低显存占用。
Reddit · r/LocalLLaMAAI 评分1919 UCVG.cpp:面向任意大语言模型的 C++ 控制向量生成工具,仅需一对提示词即可生成
开发者 Egor4more 发布 UCVG.cpp,一款仿照 llama.cpp 安装流程的控制向量生成工具,用户只需输入一对对比提示词即可为任意大语言模型生成控制向量,从而绕过系统提示词被忽略或被用户输入覆盖的局限。作者以 Qwen3.6-35B-A3B 给出生成示例,指出高强度引导可能使输出质量下降,简化现有工具的部署复杂度是该项目的主要目标。
Reddit · r/LocalLLaMAAI 评分4545 Speakrail:单张 RTX 4090 即可运行的全本地低延迟语音助手
开发者发布开源全本地全双工语音助手 Speakrail,在单张 RTX 4090 上运行,组件包括 Voxtral Realtime 语音识别、Gemma 4 12B 微调大语言模型和 Breeze TTS 2 语音合成。该项目在部分基准测试中可比肩 GPT-Live,并支持插话、静默与打断等全双工交互模式。作者表示后续将发布完整技术报告。
Reddit · r/LocalLLaMAAI 评分2222 基于 40 万合成数据微调的 1.5B Qwen 模型在 bash 命令生成上达到 gpt-4o 水平,并开源微调数据集
网友 Comfortable-Rock-498 作为业余项目,将 1.5B 参数的 Qwen 模型微调用于生成 bash 命令,全部使用 40 万条合成数据进行训练,并在该任务上达到 gpt-4o 水平。作者同步开源了微调后的模型与训练数据集,公开了训练与 CLI 流程,欢迎社区自行训练或使用。
Reddit · r/LocalLLaMAAI 评分3939 Qwen3.8-Flash-Next (125B) 在单台 Strix Halo 迷你 PC 上跑通:投机解码下 44-59 tok/s,开源推理引擎同步发布
团队在搭载 Ryzen AI Max+ 395、128 GB 内存的 Strix Halo 迷你 PC 上成功运行 Qwen3.8-Flash-Next(125B MoE,激活 6B),并同步开源其推理引擎 Kyojin(基于 ExLlamaV3 构建)。
Reddit · r/LocalLLaMAAI 评分1313 10M 参数的 TinyDecide 模型号称同类最小,可跨浏览器、Node.js、Python、Rust 及 ESP32 运行
用户 TheRealREZOR 在 Reddit r/LocalLLaMA 发布了一款名为 TinyDecide 的 10M 参数 Jev-like 决策模型,体积仅约 6 MB,比 Decision Index leaderboard 上的所有模型都小,可在浏览器、Node.js、Python、Rust 甚至 ESP32 上运行。该模型定位为轻量级决策类工具,强调在极小参数下的运行能力。
Hacker News · 首页AI 评分3131 Minigraf:基于 Rust 的嵌入式双时态图数据库,支持 Datalog 查询与多语言绑定
Minigraf 是一款基于 Rust 的单文件嵌入式图数据库,主打 Datalog 查询、双时态时间旅行与窗口函数,单个 .graph 文件即可在 Rust 原生、WASM、Android、iOS、Node.js、Python 等多平台运行。
The DecoderAI 评分4444 Aleph Alpha 开源权重模型 Kolibri,为欧洲 AI 主权提供新论据
德国 Aleph Alpha 发布开源权重模型 Kolibri,采用 MoE 架构,总参数 78B、每 token 激活约 3B。
The Verge · AIAI 评分2424 开源工具 RemoveMacAI 可一键删除 macOS 上 12GB Apple Intelligence 数据
开源命令行工具 RemoveMacAI 可关闭 Apple Intelligence 相关功能、删除其 AI 模型并阻止 macOS 重新下载,腾出约 12GB 磁盘空间。
Reddit · r/LocalLLaMAAI 评分2424 在 veloGB10 上运行 Swift 1.5:xhigh 档位反超 base Flash-Next 中档 vLLM 表现
在两台 DGX Spark 上,UkisAI 基于 Qwen3.8-Flash-Next 微调的 Swift 1.5(推理高效版)借助 sf-stav 的 Rust/CUDA 推理引擎 veloGB10 实现了约 110 tok/s 的单流解码速度,运行 xhigh effort 仍比旧 vLLM NVFP4 环境下 base Flash-Next medium 档更快。
Reddit · r/LocalLLaMAAI 评分2727 开发者开源 NihonSub:基于 Whisper-Large-v3 与 Groq / DeepSeek 的日语动漫实时字幕翻译引擎
Reddit 用户 u/Grand_Marionberry115 开源 NihonSub,一个针对日语动漫的实时字幕与翻译工具,采用 ffmpeg 静音检测切分语音后。
Hacker News · 首页AI 评分4545 Gitframes:面向 AI 编码智能体的代码优先视频生成 npm 包
Gitframes 是一个 npm 包,将 Photoshop 级合成、After Effects 级动效和 Blender 级 3D 场景整合在一起,供智能体通过 TypeScript 直接驱动并渲染 MP4,绕开无头浏览器和 DOM 重排。
Reddit · r/LocalLLaMAAI 评分3434 Lokutor 团队发布 ItoTTS:面向 $5 ESP32-S3 的自然语音 TTS 引擎,单个声部权重仅 4.89 MB
Lokutor 团队发布面向 ESP32-S3 的流式 TTS 引擎 ItoTTS,提供两个 24 kHz 英语人声,单个声部权重仅 4.89 MB,目标是让本地大语言模型在 $5 芯片上获得语音输出。
Reddit · r/LocalLLaMAAI 评分4646 Agens Volundr 32B Preview 发布:Blockway 自研混合架构,72 层仅 18 层保留 KV cache
Blockway 团队发布 Agens Volundr 32B Preview,这是其首款基于自研混合架构的模型,72 层中仅 18 层保留 KV cache,上下文窗口 262K,采用 Apache-2.0 开源。
Reddit · r/LocalLLaMAAI 评分1717 Project Athena:如何用纯 Markdown 文件把本地编码 Agent 的 KV cache 压到 2K tokens 以内(开源)
开发者将一套名为 Project Athena 的本地 LLM 编码工作流以 MIT 协议开源,核心做法是把状态存为磁盘上纯文本、git 版本化的 Markdown 文件。
Reddit · r/LocalLLaMAAI 评分2222 DecisionTune 1.0:395M 离线决策编码器,MLX 短单决策约 10 ms(Apache-2.0)
DecisionTune 1.0 是一个 395M 参数的离线决策编码器,基于 ModernBERT-large 加 4 KB 评分头,输入状态、问题和选项列表后输出每个选项的概率或 P(yes),不生成文本。
Reddit · r/MachineLearningAI 评分1717 用十亿棋谱蒸馏 Stockfish,3.9B 位置数据集在 Hugging Face 开源
用户 microscope1024 将 Stockfish 价值函数蒸馏到一个 ResNet/ViT 模型中,训练数据来自 Gigafish 的一亿个棋谱位置,对应的 39 亿位置完整数据集已在 Hugging Face 上发布,由 Lichess 37 个月对局生成;实验发现纯 ViT 难以理解棋盘,CNN 凭借归纳偏置训练初期表现更好,CNN 与 ViT 结合时效果最佳。
Reddit · r/LocalLLaMAAI 评分4545 Infermeld:支持 AMD + NVIDIA 混合 GPU 推理的 llama.cpp Linux 工具包
Infermeld 是一个实验性开源 Linux 工具包,可让同一 GGUF 模型同时在 AMD 和 NVIDIA 显卡上运行,采用 llama.cpp 作为推理引擎,Vulkan + CUDA 双后端支持。
Hacker News · 首页AI 评分2222 macOS 27 上彻底关闭 Apple Intelligence 并释放模型占用的磁盘空间
macOS 27 不再提供单一开关关闭 Apple Intelligence,且关闭后模型仍留在磁盘。
Reddit · r/LocalLLaMAAI 评分4040 我把 antirez 的 ds4 精简成 Qwen3.8 Flash Next on Metal,速度提升约 10% 且保持位精确输出
作者将 ds4 代码库从 85k 行精简至 45k 行,专门针对 Qwen3.8 Flash Next 在 Metal 上运行。在 M5 Max 128GB RAM 上,Q2 解码速度提升 9-13%,MTP 吞吐量从 75.8 提升至 86.7 tok/s,同时保持位精确输出。创建了 StarForge 仓库管理定制版本,fork 与上游保持同步。
Reddit · r/LocalLLaMAAI 评分3939 Strata 分支在 IBM AC922 上运行 Qwen3.8-FN UD-Q4_K_XL 实现 7357 tok/s prefill 和 113 tok/s decode
开发者在 IBM AC922(双 POWER9 20 核 CPU + 4×16GB Tesla V100 GPU)上对 Strata 进行深度优化,使用 Qwen3.8-FN UD-Q4_K_XL 模型达到 7357 tok/s prefill 速度和 113 tok/s decode 速度。
Reddit · r/LocalLLaMAAI 评分4949 从零训练 3.87B MoE 模型:86.5B tokens 预训练结果分享
独立开发者从零训练了一个 3.87B MoE 模型(1.45B active),使用 86.5B tokens 预训练数据。该模型在 HumanEval 上达 43.9,代码能力与使用 18T tokens 训练的 Qwen2.5-1.5B 相当。局限性包括:英语中心化、知识记忆弱、4k 上下文限制,DPO 训练反而导致性能下降。
Hacker News · 首页AI 评分2020 用消费级显卡(RTX 4090)本地运行 Qwen3.8-Flash-Next(125B),Strata 项目实测可达约 100 tokens/s
Strata 项目让用户在搭载 RTX 5070(12 GB)或 RX 9070 XT 等消费级显卡、32 GB 以上内存的普通 PC 上本地运行 1250 亿参数的 Qwen3.8-Flash-Next 模型,NVIDIA 平台 Q2_0 量化下写作速度最高 94 tokens/s、读取 32K prompt 达 2,650 tokens/s。
Reddit · r/LocalLLaMAAI 评分7575 Qwen3.8 27B 在单张 AMD R9700 上的性能:262K 上下文、50 万 tokens 可重用缓存
作者发布了 Qwen3.8 27B 模型在单张 AMD Radeon AI PRO R9700(32GB)上的运行结果,使用 3-bit 权重(仅大投影矩阵)和 speculative decoding,可重用缓存达到 569,878 tokens,每个请求支持 262,144 tokens 上下文。
Reddit · r/LocalLLaMAAI 评分2727 JEV 与普通嵌入模型有何不同?
JEV 是一个基于嵌入的意图路由器(embedding-based intent router),通过计算用户输入与预设示例意图之间的余弦相似度来路由任务。它使用 Ollama 运行 nomic-embed-text 模型生成嵌入向量,而非直接输出答案。
Product Hunt · AI 分类AI 评分3232 Thinking Orbs:React AI 智能体状态球动画组件库
Thinking Orbs 是面向 React 的 AI 智能体状态球组件库,提供 thinking、searching、compacting 等多种状态的动画效果,每个状态和变体均注重细节打磨。目前作为免费产品发布。
Reddit · r/LocalLLaMAAI 评分5656 5KB 纯 x86-64 汇编引擎实现 Gemma-2B 推理
作者用纯 x86-64 汇编(FASM)编写了一个 Gemma-2B 推理引擎,总二进制体积仅 5.2KB,使用 AVX2+F16C 指令集和自定义 4 线程 SMP GEMM,在老款 i5 四核 CPU 上达到 4.5-4.7 tok/s。
Reddit · r/LocalLLaMAAI 评分6262 NInfer 4080 发布:在 RTX 4080 16GB 上运行 Qwen-3.8-27B-GSQ
作者创建了 NInfer 4080,专门针对 RTX 4080 16GB 显存优化,可运行 ISTA-DASLab-Qwen-3.8-27B-GSQ 模型,支持 100k 上下文。
Reddit · r/LocalLLaMAAI 评分6060 repopedia:完全本地运行的代码知识图谱工具
开发者构建了 repopedia,一个 MIT 许可的代码知识图谱工具,使用 tree-sitter 解析代码并存储在本地 SQLite 文件中,无需服务器、Docker 或 API key。
Hacker News · 首页AI 评分4545 Meta 开源硬件项目 Muse Gadgets
Muse Gadgets 是 Meta 推出的开源 DIY 硬件平台,用户可使用 ESP32 或 Raspberry Pi 搭配官方 SDK 构建自定义设备。项目代码基于 Apache 2.0 许可证开源,首批支持设备包括 Raspberry Pi 5、1.75 英寸 AMOLED 触屏开发板 Waveshare ESP32-S3-Touch-AMOLED-1.75C 等。
Product Hunt · AI 分类AI 评分4444 devpit:本地优先的 Claude Code 桌面端智能体编排工具
devpit 是一款本地优先、开源的桌面原生应用,用于运行 Claude Code 智能体。它整合单一终端、看板(拖动卡片即可触发实际任务)、每次智能体调用的成本显示,以及可同时查看所有项目的编排器。
Product Hunt · AI 分类AI 评分1717 Pheebs:开源 AI 编码智能体使用度量化工具
Eversynced 开源了 AI 编码工作流量化工具 Pheebs。Pheebs 通过 hooks 接入 Claude Code、Cursor 和 Codex,仅采集会话形态等轻量交互信号,不捕获具体代码内容,帮助团队衡量自身与 AI 编码智能体的真实协作方式。
Product Hunt · AI 分类AI 评分2727 OpenBot:连接 Claude、ChatGPT 等模型的 AI 智能体协作工作台
OpenBot 是一款面向 AI 智能体的开源协作工作台,支持在 Mac、Windows 和 iOS 上接入 Claude、ChatGPT、Grok、OpenCode 或自定义 agents。用户可为 agents 分配明确角色并让它们互相委派任务,同时邀请团队成员与同一组 agents 实时协作。
Product Hunt · AI 分类AI 评分3737 GeckIt:把多 Claude Code 会话搬到 Kanban 看板的开源工具
GeckIt 是一款开源工具,可将多个 Claude Code 会话并排显示在 Kanban 看板上,区分运行中、等待用户和已完成状态。它直接复用用户自己的 Claude 订阅运行 Claude Code,无需额外 API key,并支持 macOS、Windows 与 Linux,免费可用。
Unbug 一分钟读论文AI 评分5252 AI 范式雷达:智能体正从应用循环迁为集群一等负载
作者以 google/ax v0.3.0 上线 HN 头版(663 分,仓库 11,045 星)为供给端证据,以 Linear 官方博客指出 AI 生成代码让 CI 成为新瓶颈为需求端证据。
Hugging Face BlogAI 评分3939 如何使用 NVIDIA Warp 和 MJWarp 加速机器人模拟与学习工作流
MJWarp 基于 NVIDIA Warp 构建,可将兼容的 MuJoCo 模型带入 GPU 加速的并行模拟规模。文章演示将 SO-101 机械臂从传统 MuJoCo 迁移至最多 2048 个并行 MJWarp 环境,显著提升模拟吞吐量。NVIDIA Warp 提供纯 Python 编写的 GPU 内核,支持自动微分和 PyTorch/JAX 互操作。
Product HuntAI 评分2323 Alkera 开源多人协作数据科学工作台 Databench
Alkera 发布开源多人协作数据科学工作台 Databench,支持团队成员与 AI 智能体在 notebook 和聊天中实时协作,可在本地电脑、其他机器或 GPU 节点上运行任意 cell 或智能体,并能并行启动多个智能体探索方案。Databench 提供慷慨的免费使用额度,也支持用户自行托管。
Microsoft Research精选AI 评分7171 微软发布 GigaPath-Flash 和 GigaTIME-Flash 高效病理基础模型
微软研究院发布 GigaPath-Flash 和 GigaTIME-Flash 两个高效病理基础模型。
推荐理由:通过知识蒸馏实现约 50 倍计算量降低,保持 97% 预测性能,为大规模病理研究提供更实用的工具。