#评测/基准
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#评测/基准
今日 11 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分2222 DeepSeek V4.1 Flash 在小型评测中击败 Haiku 5.5,担任研究子智能体与对话标题模型
在 M2 Max 32GB 本地环境通过 OpenRouter 调用 DeepSeek V4.1 Flash 与 Haiku 5.5 的小型对比中,Haiku low 用时 480s。
Reddit · r/LocalLLaMAAI 评分1717 基于 Strata 测试 Qwen Flash Q2_0 与 IQ2_XS GSQ-RCO 量化版本的对比体验
用户在旧笔记本上测试 Qwen Flash 的 Q2_0 与 IQ2_XS(GSQ-RCO 量化版)的体验:IQ3 量化会严重拖慢 prefill 速度;IQ2_XS 在保留世界知识方面优于 Q2_0,但在相同推荐 sampler 设置下(尤其关闭 thinking 时)更容易出现循环生成。Q2_0 与 IQ2_XS 在 benchmark 各维度上各有明显优势。
Reddit · r/LocalLLaMAAI 评分2121 Qwen3.8-27B 微调模型与前沿模型基准对比
mradermacher/Signal-3.8-27B-Terse-Coder.i1-Q4_K_M 在 469 项领域评测中表现最佳本地模型,以更少 token 和更短完成时间取得更高准确率。Opus 5.5 以 99.6% 准确率领先,但本地模型 KPI 比前沿模型慢 28x,优势因硬件而异;作者已将评测工具开源供扩展使用。
Reddit · r/LocalLLaMAAI 评分1313 本地 LLM 用户盲测:8 人体验 Qwen 3.5/3.6 与 Gemma 多档模型,多数以为是 GPT-5.5
一名用户在 RTX 3090 上用 vLLM 部署了 Qwen 3.6 27B、Qwen 3.6 35B-A3B、Gemma 26B-A4B、Qwen 3.5 9B、Gemma 12B、E4B、E2B 等本地模型,让 13 名参与者通过 OpenWebUI 界面盲用约两个月共 7,912 次请求。
Reddit · r/artificialAI 评分3838 浏览器战争模拟游戏 SECOND STRIKE 让四个 AI 模型各掌一国开战,DeepSeek 在 15 局中 13 次发射核弹
开发者推出浏览器核战模拟游戏 SECOND STRIKE,给 DeepSeek、Grok、Mistral、GPT 各分配一个国家,各跑 15 局相同战争并记录公开表态、私下计划与实际指令。
Reddit · r/artificialAI 评分3434 OpenRouter 排名观察:用量与支出已脱钩,最被使用的模型与最被付费的模型正变成两桩生意
OpenRouter 本周 token 用量榜前十中,中国实验室占四席,合计约 62% 的头部用量;美国模型最高仅排第六,中美用量比约 3.5×。
Reddit · r/LocalLLaMAAI 评分66 社区发布 Open SLM Evaluations 数据集,覆盖 106 个 150M 参数以下小模型基准
Open SLM Evaluations 是一个开源数据集,收录 106 个参数量在 150M 及以下的小语言模型(SLM)的基准测试分数,并附带各模型的参数规模、名称和链接。该数据集以 Apache 2.0 协议开放,评测在 RunPod B200 上完成,单个模型评估约 30 GPU 分钟。
Reddit · r/LocalLLaMAAI 评分2626 双卡 CMP 170HX 64GB 部署 GLM-5.3-Flash 384K 上下文方案与 Qwen3.8 实测对比
玩家在两张 64GB CMP 170HX 显卡上跑通了 GLM-5.3-Flash 的 EXL3 3.05bpw 量化方案,目标权重约 125.2GB 全驻留 HBM,配合 DFlash2 6bpw 草稿模型实现 384K 上下文,单请求预算约 392,960 tokens,生成速度约 90 tok/s。
Reddit · r/LocalLLaMAAI 评分2929 Strata 实测:可靠性堪忧,12 小时编程测试出现多次严重幻觉与生成错误
用户在 12 小时编程测试中发现 Strata 出现三类关键故障:混淆是否真的写入了执行报告、幻觉读取工具输出(误读路径中的数字"5")、以及反复写出畸形代码到不存在的路径。
Reddit · r/LocalLLaMAAI 评分55 网友分享判断"刷榜模型"的小窍门:让它描述2010年代卡通主角
用户在 r/LocalLLaMA 分享辨别新模型是否为刷榜产物的简单方法——让它说出 Totally Spies、Randy Cunningham、Slugterra 等 2010 年代卡通的主要角色。用户表示多数 30B 参数量级的模型都会答错,暗指 Qwen 等存在此问题;能答上来的模型则被认为具备真正的人际对话能力。
Reddit · r/LocalLLaMAAI 评分4141 本地 Qwen3.8 27B vs DeepSeek Flash API:本地部署够用吗?
一项 25 项配对任务测试显示,本地运行的 Qwen3.8 27B 在质量上得分 89.5,低于 DeepSeek Flash API 的 92.6,但 12 项核心套件双方各赢 6 项,编码任务上本地模型全部通过 10/10 智能体运行。本地推理速度达到云端的 2.5–5.5 倍,且 95% 以上耗时来自模型生成本身;本地运行除电费外无额外成本,云端 12 项套件合计消耗 0.14 积分。
量子位 QbitAIAI 评分2121 AI影视公司Utopai Studios视频模型Utopai X登顶Artificial Analysis榜单第二
独立影视公司Utopai Studios推出的文生视频模型Utopai X,在Artificial Analysis(AA)盲测榜单中以1150分位列第二,仅比阿里的Wan 3.0低7分。
Reddit · r/ChatGPTAI 评分1515 Opus 4.5 与 Sol 6.1 任务完成度对比反差明显
一名 Reddit 用户用相同的提示词分别测试 Sol 6.1 和 Opus 4.5 两款模型,要求它们在 10 欧元预算内完成一个家庭社交应用的搭建。结果 Sol 6.1 仅停留在"pursuing goal stalled"状态未交付任何成果,而 Opus 4.5 自主选定域名并完成了整个应用的构建。该用户在帖子中以 TLDR 形式总结这一反差,但尚未对最终产物进行测试。
Reddit · r/LocalLLaMAAI 评分2626 InferBench 基准测试:MiMo V2.6 Pro 接近 GPT-6 Astra,开放权重模型表现超预期
新发布的 InferBench 基准用 20 个场景、2.8k 条对话测试 12 款前沿大语言模型从指令中推断用户优先级的能力;当用户优先级被明确给出时,模型选择最佳选项的准确率为 89%,部分优先级未给出时降至 60%。
Simon WillisonAI 评分2020 Mistral Large 4
用户 wren6991 在命令行中用相同的 SVG 绘制提示词("一只穿着渔网紧身衣在火星上横穿马路的犰狳")分别测试 Claude Opus 5.5、GPT-6.1、sol 版本、Gemini 3.8 Flash 和 Mistral Large 4,并对比各模型的默认推理等级。该帖子未提供各模型生成结果或评分数据,仅为测试命令展示。
Reddit · r/LocalLLaMAAI 评分1616 模型 benchmark 差距常在误差范围内,评测该不该加置信区间?
Reddit 用户指出,新模型在 HumanEval、GSM8K 等榜单上仅比旧模型高出几个百分点,可能落在问题采样噪声之内:HumanEval 共 164 题,70% 得分的标准误差约 3.5 分,GSM8K 约 1 分,2 分差距尚不及采样温度、提示词模板、few-shot 示例和评估框架版本带来的波动。
Microsoft ResearchAI 评分1818 Microsoft Research 播客:Jennifer Neville 谈 AI 评测的边界与失败带来的启示
Microsoft Research 播客邀请合作研究经理 Jennifer Neville 与首席应用科学家 Chad Atalla 对谈,探讨 AI 评测如何推动模型性能边界,以及当测试超出传统 benchmark 时出现的"意外失败"。
Reddit · r/ChatGPTAI 评分4040 用户实测 GPT-6.1 Sol:替换种族词后 AI 评判出显著不同的"有利对待"比例
用户用 96 个提示词模板、四种族(白人、黑人、亚裔、原住民)替换并各跑三次,从 Codex CLI 共收集 GPT-6.1 Sol 的 1,152 条回复,由同模型以盲评方式分类。
Reddit · r/LocalLLaMAAI 评分1818 千问 Qwen3.8 27b 与 flash next 实测对比:27b 在简单编码工作流中更胜一筹
一名用户在自托管 unsloth/Qwen3.8-27B-GGUF:Q4_K_XL(llamacpp、130K 上下文窗口)与阿里云 Qwen 套餐 flash next(上下文封顶 256K)的对比中发现。
Reddit · r/LocalLLaMAAI 评分3434 DynamicTune 用闭式权重手术让 Qwen3.5-0.8B 在 ARC-Challenge 上超越 2B 模型
DynamicTune 提出一种无需反向传播的闭式权重手术方法,仅用约 12 分钟在消费级硬件上把 4B 模型的轨迹动力学迁移进 Qwen3.5-0.8B 学生模型。
Reddit · r/MachineLearningAI 评分2727 SWE-Race:基于 188 个真实并发缺陷的编程 Agent 评测基准,三款模型结果出炉
SWE-Race 是一个收录约 100 个 Python 项目合并 PR 中真实并发缺陷(竞态、死锁、取消问题)的编程 Agent 评测基准,含 188 个任务,每个任务在无网络容器中由项目自带测试打分。
Reddit · r/LocalLLaMAAI 评分1616 法律科技公司法律研究体验仍不佳:Harvey 前沿模型得分仅 55%
一位有律师背景的产品经理指出,尽管 Harvey、Legora 等法律科技公司投入大量资源,法律研究产品体验仍被律师诟病。Harvey Benchmark 显示即便是排名最高的前沿模型,准确率也仅有 55%。原帖讨论了为何资源充足的团队仍难以彻底解决法律研究问题。
Reddit · r/LocalLLaMAAI 评分3232 Orange Pi 5 Plus(RK3588)本地大语言模型推理基准:大核绑定、NPU 卸载与散热实测
在 Orange Pi 5 Plus(RK3588,16GB LPDDR4x)上对 1B–8B 模型做 Ollama CPU 推理基准测试:将线程绑定到 4 个 Cortex-A76 大核比默认 8 线程最高快 +318%。
Latent SpaceAI 评分4848 Reflection 发布 Beam:501B 总参 / 23B 激活的开源 MoE 编程模型
Reflection 发布 Beam,一款文本模型,总参数 501B、激活 23B 的 MoE,面向编程、智能体和科学场景,从零训练并计划于本月以 Apache 2.0 开源完整权重,团队称其在 SWE-bench Verified 上拿到 80.9,推理效率据称是 GLM 5.2 的 3–4 倍。
Reddit · r/LocalLLaMAAI 评分1818 GLM-5.3 Flash 用于生产级代码库:替代前沿模型的实测体验与训练细节讨论
一名开发者称其公司在涉及数百万行代码的生产环境中,用 GLM-5.3 Flash 承担日常编码工作,替代了前沿模型。该模型在仓库探索、特性实现、重构和理解大型代码库方面表现超出预期,速度快且未以牺牲能力为代价。原帖重点询问其代码训练管线细节,包括代码预训练/后训练规模、合成数据占比、是否从更大 GLM 模型蒸馏以及针对仓库级与多文件任务的训练方式。
Reddit · r/LocalLLaMAAI 评分1818 双 MI50 上 TheRock ROCm 10.2 vs Vulkan Mesa 26.2 的 llama.cpp 后端性能对比
用户在双 AMD Radeon Instinct MI50 32GB 上对比了 TheRock ROCm 10.2 与 Mesa Vulkan 26.2 两个 llama.cpp 后端的性能。
Reddit · r/artificialAI 评分2929 今晚直播:10 个 AI 模型同台对弈的世界大战开源基准,决策与推理全程记录
一场类似模型竞技场的开源大战游戏基准今晚 10:45 pm ET(02:45 UTC)开赛,参赛阵容包括 Claude、GPT、Grok、Gemini、DeepSeek、Mistral、Qwen、Kimi、Llama 和 GPT-OSS 共 10 个 AI 模型。每局对战全程可回放,完整记录每个模型的指令、单行推理、决策时所见信息(黄金、兵力、攻击方、结盟提议)。规则允许结盟、背叛与使用核武器。
Reddit · r/LocalLLaMAAI 评分2525 盲测 A/B 投票平台对比 1,200+ 次 Blender 建模中 LLM 与 agent 框架的表现
Reddit 用户 izolight 上线了一个盲测 A/B 投票平台,让 Claude Code、Codex、opencode、omp、pi、dsh 等 AI agent 在 Blender 中完成建模任务,由用户投票选出更好的结果,覆盖纯脚本和 MCP 两种接入方式,并测试不同推理等级以寻找成本与时间平衡点。
Reddit · r/LocalLLaMAAI 评分2626 CivBench 评测大语言模型打《文明 5》游戏能力,GLM-5.3 领先 Opus-5.5
研究者发布更新版 CivBench 基准,测试大语言模型在《文明 5》中的长链策略能力。所有模型在三个相同固定开局下轮换对战,每局由两个被测 LLM 文明与六个 Vox Populi AI 对手组成。
Simon WillisonAI 评分1515 Qwen3.8 27B 加法用英文单词表达能力的基准测试
一项基准测试考察本地运行的 Qwen3.8-27B-Q4_K_M.gguf 模型能否完成正整数加法并仅用英文单词表达结果。在 5,070 个关闭推理的测试用例中,数字正确率仅 23.57%,格式合规率达 96.29%,但操作数从 1-3 位升至 10-13 位时,正确率从 97.04% 跌至 6.44%。开启推理后,在 169 对配对样本的一次性测试中答对 167 题。
Reddit · r/LocalLLaMAAI 评分2222 用户反馈 Qwen3.8-Flash-Next 在编码场景中过于主动调用工具
开发者反馈 Qwen3.8-Flash-Next 在编码和作为语音 Agent 大脑使用时过于急切,倾向未经确认就直接修改代码、创建 issue 或在一次回复中同时提问并调用工具保存答案。
GitHub Blog · AI & MLAI 评分3636 GitHub 推出 ReviewBench:面向 AI 代码评审智能体的开源基准
GitHub 发布开源代码评审基准 ReviewBench,涵盖 19 种语言的 219 个公开 pull request,其语言与仓库规模分布基于对 103.9M 个 GitHub pull request 的分析建模而成。
Reddit · r/LocalLLaMAAI 评分4141 M3 Max 36 GB 上四款 MLX 推理引擎实测:Qwen3.6-35B-A3B 达 110 tok/s,Qwen3.8-27B 约 31.7 tok/s
用户在 14 寸 M3 Max(36 GB)上对比了 oMLX 0.7.0、Rapid-MLX 0.15.5、Splash 1.2.1 和 MTPLX 2.12.2 四款 MLX 推理引擎。
Import AIAI 评分2727 Import AI 475:智能体集群扩展机制、Google DeepMind 推出 SynthID Bio 水印工具,以及 AI 驱动科学经济兴起
Toby Ord 在文章中提出,AI 智能体集群(swarm)是一种新的推理扩展方式,4 个智能体并行执行任务理论上能以约一半的时间完成同等工作,但集群规模扩大 10 倍仅能带来 3 到 5 倍的性能提升,呈现出经济学家所说的"互相踩脚"式边际递减。
Reddit · r/LocalLLaMAAI 评分4747 本地 LLM 跑分实测:单卡 RTX 5090 上 harness 与模型选择指南
一位开发者在 r/LocalLLaMA 分享了对本地大语言模型 + 智能体 harness 的实测排行榜,覆盖基础数学、视觉、计算机操作和编程四类任务,并给出可贡献数据的网站。
Reddit · r/LocalLLaMAAI 评分4545 LFM2.5 2.6b 对比 MiniCPM5 2b:M1 Air 上的小参数模型 Agent 任务评测
作者在 M1 Air 上对比测试了 LFM2.5 2.6b 与 MiniCPM5 2b 两个小参数模型在工具调用类 agentic 任务上的表现。LFM2.5 2.6b 达 200 t/s 推理速度、仅用 2.5GB RAM,MiniCPM5 2b 为 162 t/s、需 3.8GB RAM。LFM2.5 速度更快且更省内存,但在长对话场景容易产生幻觉;MiniCPM5 虽更智能但常以中文回复。
Reddit · r/artificialAI 评分2525 MoralityBench.ai:AI 道德评测基准
MoralityBench.ai 是一个基于道德心理学测试的 AI 基准评测。评测结果显示,除 Jev 外,各模型在不同运行中的答案存在显著差异,表明道德推理并非确定性输出。该基准旨在评估大语言模型的道德判断能力。
The Verge · AIAI 评分4040 新泽西州前副州长用 AI 证明自己性骚扰无罪
New Jersey 前副州长 Dale Caldwell 因性骚扰调查于 9 月 25 日被迫辞职后,在 NJ PBS 采访中称让多个 AI 平台分析了调查报告,AI 分析了 59 次均未发现性骚扰结论。报道指出 AI 聊天机器人以迎合用户著称,Caldwell 似乎不太可能想听到 AI 确认他性骚扰的调查结果。
Reddit · r/LocalLLaMAAI 评分6363 玩家在FPGA上运行Qwen3.5 9B INT4:75MHz下单卡约2-3 tok/s
作者使用eBay购买的SQRL FK33 FPGA开发板在75MHz下运行Qwen3.5 9B INT4模型,实测prefill约5.5-6 tok/s,生成约2.4-3.2 tok/s。文中还估算27B模型在多卡配置下的性能:2x VU35P在200MHz下可达约16 tok/s prefill和8 tok/s生成,4x VU35P四路并行约25 tok/s。项目已开源至GitHub。
Reddit · r/LocalLLaMAAI 评分4949 从零训练 3.87B MoE 模型:86.5B tokens 预训练结果分享
独立开发者从零训练了一个 3.87B MoE 模型(1.45B active),使用 86.5B tokens 预训练数据。该模型在 HumanEval 上达 43.9,代码能力与使用 18T tokens 训练的 Qwen2.5-1.5B 相当。局限性包括:英语中心化、知识记忆弱、4k 上下文限制,DPO 训练反而导致性能下降。