#教程/实践
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#教程/实践
今日 2 条编程 · 工具·提示词·论文 三栏速览
每栏 1 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/artificialAI 评分1414 Reddit 用户讨论如何让 Claude、Codex 等模型直接使用 REA、Ghidra 等 MCP 智能体技能进行游戏逆向与 mod 开发
Reddit 用户反映 Claude 和 Codex 在调用 REA、Ghidra 等 Agentic MCP 技能对专有二进制代码进行反编译和构建 mod 时,反复以法律与版权为由拒绝执行;但同时看到有用户晒出同类模型直接逆向其他游戏、复改代码并合成 pass-through mod 的成功案例。
Reddit · r/LocalLLaMAAI 评分2929 Strata 实测:可靠性堪忧,12 小时编程测试出现多次严重幻觉与生成错误
用户在 12 小时编程测试中发现 Strata 出现三类关键故障:混淆是否真的写入了执行报告、幻觉读取工具输出(误读路径中的数字"5")、以及反复写出畸形代码到不存在的路径。
Reddit · r/ChatGPTAI 评分77 开发者用 ChatGPT 构建微内核操作系统,寻求加速完成的方法
一名开发者正在用 ChatGPT 协助构建一款微内核操作系统,目前已实现音频、视频、网络与文件系统等大部分功能,计划以开源许可证发布。作者反馈 ChatGPT 出现响应变慢、修复一个问题常引发其他回归的情况,正考虑切换其他模型或优化提示词,并计划以每次约 300 行代码的节奏继续推进。
Reddit · r/LocalLLaMAAI 评分2222 基于 40 万合成数据微调的 1.5B Qwen 模型在 bash 命令生成上达到 gpt-4o 水平,并开源微调数据集
网友 Comfortable-Rock-498 作为业余项目,将 1.5B 参数的 Qwen 模型微调用于生成 bash 命令,全部使用 40 万条合成数据进行训练,并在该任务上达到 gpt-4o 水平。作者同步开源了微调后的模型与训练数据集,公开了训练与 CLI 流程,欢迎社区自行训练或使用。
Reddit · r/LocalLLaMAAI 评分2424 在 veloGB10 上运行 Swift 1.5:xhigh 档位反超 base Flash-Next 中档 vLLM 表现
在两台 DGX Spark 上,UkisAI 基于 Qwen3.8-Flash-Next 微调的 Swift 1.5(推理高效版)借助 sf-stav 的 Rust/CUDA 推理引擎 veloGB10 实现了约 110 tok/s 的单流解码速度,运行 xhigh effort 仍比旧 vLLM NVFP4 环境下 base Flash-Next medium 档更快。
Reddit · r/LocalLLaMAAI 评分1717 Project Athena:如何用纯 Markdown 文件把本地编码 Agent 的 KV cache 压到 2K tokens 以内(开源)
开发者将一套名为 Project Athena 的本地 LLM 编码工作流以 MIT 协议开源,核心做法是把状态存为磁盘上纯文本、git 版本化的 Markdown 文件。
Reddit · r/LocalLLaMAAI 评分4545 Infermeld:支持 AMD + NVIDIA 混合 GPU 推理的 llama.cpp Linux 工具包
Infermeld 是一个实验性开源 Linux 工具包,可让同一 GGUF 模型同时在 AMD 和 NVIDIA 显卡上运行,采用 llama.cpp 作为推理引擎,Vulkan + CUDA 双后端支持。
Reddit · r/LocalLLaMAAI 评分3434 本地跑酷模拟器实现:GLM-4-Flash + 2x DGX Sparks + vllm TP2 推理
开发者在 2x DGX Sparks 服务器上运行 GLM-4-Flash 模型,实现完全本地化的跑酷模拟器。采用 vllm TP2 方案,Prefill 吞吐量约 1500token/s,Decode 约 40token/s,支持 100k 上下文。