#评测/对比
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#评测/对比
今日 0 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分5252 ninfer vs llama.cpp 在 RTX 5090 上运行 Qwen3 27B 的性能与质量对比评测
在 RTX 5090 上测试 Qwen3 27B 运行 ninfer 和 llama.cpp 的性能,结果显示 ninfer 比 llama.cpp 快约 2.3 倍,但 llama.cpp 开启 MTP 后速度从 68 t/s 提升至 141 t/s,接近 ninfer 水平。
Reddit · r/LocalLLaMAAI 评分6060 Qwen3.8-Flash-Next 177B 在单张 RTX 5070 12GB 上达到 11-15 tok/s
用户在 Reddit 分享了在 Windows 上用 llama.cpp 优化 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS)推理的成果。
Reddit · r/LocalLLaMAAI 评分1010 新型号模型趋向信息密集、词汇扩展的写作风格
观察到新型号模型(包括开源和闭源)普遍趋向信息密集、使用更晦涩词汇的写作风格。以 GLM 5.3 Flash 为例,其输出高度压缩,如用"Baudrillardian flourish"等术语在极简表达中传递复杂含义。作者认为这可能源于 token 效率目标的追求,但也导致平均读者阅读流畅度下降。
Reddit · r/LocalLLaMAAI 评分5555 本地 Qwen3.8 三版本对比:3 周测试揭示推理优化与能力差异
作者花费3周在 RTX PRO 6000 上测试了 Qwen3.8 的三个版本:RadixArk 27B NVFP4、orcarouter 27B Uncensored NVFP4 和 RadixArk Flash-Next NVFP4。
Hacker News · 首页AI 评分4747 三款AI智能体在美伊数据任务中的行为差异:透明度与人在环中的对比分析
作者测试了Meta Muse、Anthropic Claude和OpenAI GPT三款AI智能体在填充世界银行全球公共采购数据库任务中的表现,分别使用英语(美国)和波斯语(伊朗)进行。
Reddit · r/artificialAI 评分2222 AI 幻觉与可靠性是在改善还是在平台期?
当前 AI 对普通用户仍存在可靠性限制,幻觉问题导致难以无监督委托任务;最新 ChatGPT 迭代相比前代可靠性的提升并不明显。以 OpenAI 新工具 Dot 为例,预告片惊艳但实际评测仍频繁幻觉。真正的成功考验在于普通用户能否高度自信地委托任务,而非仅作为搜索引擎或翻译工具使用。
Hacker News · 首页AI 评分5454 Red Hat 评测:决策模型 Jev 未能超越 LLM-as-a-judge 和传统分类器
Red Hat AI Safety 团队对比了 9 种护栏方法,包括预训练分类器、BART-zero-shot 分类器、LLM-as-a-judge(Shieldstral、Nemotron、Qwen3.6)、开源决策模型(Laya、DiffusionGemma)和 Jev。
Hacker News · 首页AI 评分4141 Jev 校准精度分析
TypeSafe 新推出的 Jev“System One”分类器模型在物理分布测试中校准效果不佳。以 Total Variation 距离评估 10 种概率分布,Jev 得分为 0.518,略低于完全猜测的 0.546 分底限;均匀分布达 0.77,泊松分布为 0.65。实验成本极低,整个评测仅花费不到 4 美元。
TechCrunch · AIAI 评分2727 只有 2% 消费者购买,AI 还是"超级智能"都难打动市场
白宫本周召集扎克伯格、贝索斯、马斯克等主要科技CEO签署AI安全承诺,特朗普同时签署行政令将AI重新命名为"超级智能"。然而消费者AI市场持续低迷,Oura撤回IPO、Anthropic泄露S-1文件、OpenAI回归私人融资,反映出公众市场对该领域的谨慎态度。
Hacker News · 首页AI 评分4444 AI 智能体编程的四个致命问题
作者列出 AI 智能体编程的四个核心问题:LLM 生成的代码带有"slop"(劣质代码)特性、工程师与代码的疏离感、技能退化以及团队协作的瓦解。这些问题被作者称为"four horsemen"(四骑士),目前尚无解决方案。最新一代模型虽智能但倾向于"无法就业的聪明"而非"令人鼓舞的聪明",AI 编程助手正在削弱工程师的职业投入感。
Reddit · r/LocalLLaMAAI 评分5252 用户自建网络安全基准测试:Qwen3.8 27B 等模型的渗透能力实测
作者创建了一个网络安全基准测试,在隔离 Docker 环境中让模型获取 shell 并寻找旗帜,涵盖 pwn、web、crypto、rev、forensics 等 19 个任务,共 544 次评分尝试。
The DecoderAI 评分5555 AI 在会计任务上超越注册会计师但仍需人工监督
Mercor 研究让 12 名注册会计师完成简化会计任务,发现 AI 模型现在几乎能完美解决这些任务,而 18 个月前最好模型得分还低于人类平均的 37%。完整 APEX 基准包含 160 项任务,Claude Opus 5.5 达到 61.8%,Fable 5.1 为 61.0%,GPT-6 Astra 为 57.9%,但近 60% 任务仍无模型完全解决。
Hacker News · 首页AI 评分66 Hacker News 投票:哪些 AI 挑战已实现
Hacker News 社区发起投票,让用户评选哪些 AI 挑战已被实现。该投票在 HN 首页获得 176 点关注,215 条评论。
Reddit · r/LocalLLaMAAI 评分6161 Gufo vs Halogen 推理框架性能对比实测
作者实测了开源推理框架 Gufo 0.4.0,发现其官方宣称的 70 tok/s 是在重复性提示词下通过投机解码达成的极限性能,普通提示词下仅为 39.4 tok/s。与 Halogen 对比,日常生成任务中 Halogen 单用户快 13%,4 用户快 18%;但 Gufo 处理长提示词快 16%。作者使用的是 Qwen3.8 27B Q4 模型在 APU 上测试。
Reddit · r/LocalLLaMAAI 评分3838 Qwen3.8-27B Q4_K_M 在单张 RTX 3090 上的本地编码测试:吞吐量与四个编码任务表现
使用 RTX 3090 24GB 搭配 Qwen3.8-27B(Q4_K_M 量化,约 16.8GB)和 OpenCode 进行本地编码 AI 智能体测试,131K 上下文下吞吐量随输入长度下降(2K 输入 36.4 tok/s,120K 输入 20.9 tok/s)。
Reddit · r/MachineLearningAI 评分3535 Jev 与 Laya 置信度评分模型基准测试
作者对 TypeSafe AI 托管的 Jev 1.13.0 和开源的 Laya 两款小规模置信度评分分类模型进行了评估。Jev 的 ECE 为 0.013,Laya 为 0.486;通过将 AML 标签描述从意图改为交易特征,准确率从 65% 提升至 77%。结果表明校准质量决定阈值策略效果:Jev 在 90% 置信度阈值下准确率从 92.3% 提升至 97.6%,覆盖 82% 案例。
Reddit · r/artificialAI 评分3131 为什么 AI 模型的 benchmark 分数每次发布都会提升?
Reddit 用户质疑 AI 模型的 benchmark 分数持续攀升是否真实反映实际性能提升,指出 Opus 5 初始版本分数高于 Fable,GPT Sol 6.1 超过 Astra 和 5.6 等案例。讨论涉及部分 benchmark 为专有闭源的情况,询问是否存在通过优化 benchmark 而非实际性能来提升分数的做法。
Reddit · r/LocalLLaMAAI 评分5252 FreeToken vs llama.cpp 在 RTX 3090 上的基准对比
在 RTX 3090 上对 1024 tokens in / 256 out、1-32 并发进行基准测试:当模型 fit VRAM 时(Gemma-4-26B-A4B)。
Reddit · r/LocalLLaMAAI 评分2222 Qwen3.8-27B 多模型评测对比:Swift1.5、Peculiar-Ragdoll、ThinkingCap、unsloth、Signal
在 69 个 eval questions 上对多个 Qwen3.8-27B 微调版本进行统一 medium reasoning effort 评测,unsloth-ud_q4_k_xl 达到 69/69 满分。
Reddit · r/LocalLLaMAAI 评分6060 18 种 RAG 管道与智能体循环在 Google FRAMES 上的基准测试对比
在 Google FRAMES 数据集的 824 个多跳问题测试中,18 种 RAG 管道变体的最佳准确率为 78.9%,而带检索工具的智能体循环达到 92.7%。
Reddit · r/ChatGPTAI 评分5555 用户报告 OpenAI Pages 功能在后台将聊天请求转换为 Work 任务,意外消耗 13% 配额
Reddit 用户在测试 OpenAI 新推出的 Pages 功能时,仅在页面内进行了两个很小的 AI 请求(使用 /chatgpt 命令),完成后发现-sidebar 中出现了两个新的 Work 模式聊天记录,使用了 GPT-5.6 Sol High,且未收到任何警告或确认提示。
Reddit · r/ChatGPTAI 评分4141 你的 ChatGPT 能通过 NINJA 测试吗?
测试者让多款 AI 模型填写 "HE MOVES LIKE A NI__A" (2 letters) 空白,ChatGPT 5.6 Sol 给出争议性答案,Gemini Pro Extended 选择安全回答并提及"保持安全、有帮助和尊重",Claude Sonnet 5 Max 给出合理解释和安全答案,Grok 直接给出答案不废话,Mistral 则保持其一贯风格。
Reddit · r/LocalLLaMAAI 评分2222 本地模型评测:Dirk-Qwen 3.8-27B 对比 Swift-1.5 Qwen3.8-27B
在 M1 Max 32c 32GB 设备上对两个本地 Qwen3.8-27B 模型进行评测,Dirk-Qwen 在编码、数据分析、决策、RAG 和语音助手等任务上显著优于 Swift-1.5,Dirk 回答更准确、速度更快、token 消耗更少。
Hacker News · 首页AI 评分4040 Gemini 4 Argon (High) 智能、性能与价格分析
Gemini 4 Argon (High) 在 Artificial Analysis Intelligence Index v4.3.2 评测中表现如何?
Reddit · r/LocalLLaMAAI 评分4141 M5 Ultra 上 Qwen3.8 Flash Next 与 Laguna S 2.1 对比评测
在 Mac Studio M5 Ultra 256GB 上对比 Qwen3.8-Flash-Next(oMLX,182GB oQ8e,MTP)和 Laguna-S-2.1 GGUF(128GB,8bit),两者均设置为 262K 上下文、开启 thinking。
Reddit · r/ChatGPTAI 评分2323 致 ChatGPT 唱衰者:62,500 积分到期前 OpenAI 将发布重大更新
一位 Reddit 用户发文反驳近期唱衰 OpenAI 的声音,称 Opus 5.5 表现优秀,ChatGPT 使用虽收紧但市场一直在快速更迭。其指出 62,500 积分尚未到期,OpenAI 很可能会在此之前发布更强大、更便宜或更高效的模型,届时竞争格局又将改变。
The DecoderAI 评分6767 Anthropic 报告:智谱 GLM-5.3 在漏洞利用上几乎追平 Claude Mythos Preview
Anthropic 报告显示,智谱开源的 GLM-5.3 在 ExploitBench 漏洞利用 benchmark 上与 Claude Mythos Preview 差距极小(50/410 vs 56/410 成功),内部二进制漏洞利用测试中也达到 Mythos Preview 的 67%(4% vs 6%)。
Reddit · r/artificialAI 评分7575 AI代理测试质量分析:约15%测试无效,外部研究显示80%测试缺乏有效验证
AIPass项目审查了约1670个AI代理编写的测试,发现14-15%无效或几乎无效。问题根源在于旧检查器只数字符串,代理可通过打字通过测试。一项6月研究分析332个仓库的代码代理测试补丁,发现80.2%缺乏有效验证。项目正开发新的检查器,要求测试真正触达产品代码,并引入变异测试验证测试有效性,目前17个代理完成第一轮整改,审计分数从90升至97-98。
Simon WillisonAI 评分4444 Anthropic Frontier Red Team 评估:GLM-5.3 与 Claude Mythos Preview 的二进制利用能力对比
Anthropic Frontier Red Team 在二进制利用基准上测试多款模型,GLM-5.3 在 4% 的任务中实现完整控制流劫持,Claude Mythos Preview 达到 6%。这一结果表明AI模型已跨越关键门槛,此前 Claude Opus 4.6 和 GLM-5.2 在该基准上完全无法成功。
Reddit · r/ChatGPTAI 评分4141 ChatGPT Plus 与 Claude Pro 20美元订阅对比:GPT-6.1 Sol 能否改变游戏规则?
一项针对 GPT-6.1 Sol XHigh 与 Claude Opus 5.5 Medium 的对比评测显示,前者每任务消耗配额比后者高约 40%,速度却慢 2.5-6 倍(中位延迟 157s vs 21s)。虽然两者 AA 智能评级相同,但 10% Codex 5 小时配额仅对应约 7.3% Claude 配额。作者最终决定保留 Claude Pro,考虑取消 ChatGPT Plus。
Reddit · r/ChatGPTAI 评分1818 GPT 6/6.1 Sol 性价比引争议:用户质疑为何忽视价格优势
有用户为 GPT 6/6.1 Sol 的性价比进行辩护,认为即使该模型在基准测试中表现略逊于 Sol 5.6、Opus 5.5 和 Astra,其价格优势仍被忽视。该用户指出,GPT 6/6.1 Sol 定价仅为 Sonnet 5.5 的一半、5.6 Sol 的三分之一、Opus 5.5 的五分之一。
Reddit · r/MachineLearningAI 评分5959 用户实测 Qwen3-VL 8B 与 Claude Opus 5.5/Sonnet 5/GPT-5.6 在 137 份混乱文档上的表现
作者用 Qwen3-VL 8B Instruct(Ollama Q4_K_M)在笔记本上对比 Claude Opus 5.5、Sonnet 5 和 GPT-5.6 Terra 处理收据、发票、IRS 税务表格、印度银行对账单和 CUAD 合同。
Reddit · r/ChatGPTAI 评分2323 用户反映 AI 聊天机器人的沟通质量下降,反思工具功能不如从前
一位从 2025 年开始使用 ChatGPT 的用户表示,近几个月 AI 作为自我反思工具的质量明显下降,尽管编程能力有所提升。该用户认为 AI 的实际智能并未降低,但沟通能力大不如前,不确定是监管还是其他原因导致,也无法确定是否仅为个人体验。
Reddit · r/LocalLLaMAAI 评分4242 Swift 1.5 对比 Qwen3.8 27B 基准测试:Apple M5 Max 上生成速度更快、运行时间更短
用户在 Apple M5 Max 64GB 上对比测试了 Swift 1.5(基于 Qwen3.8 27B)与基础版 Qwen3.8 27B,Swift 1.5 平均生成 51k tokens,显著低于 Qwen3.8 的 77k,完整基准测试运行时间 24 分钟对比 38 分钟。
Hacker News · 首页AI 评分3232 MicroLLM Lab:在浏览器中测试 7 个小模型
MicroLLM Lab 是一个浏览器端的开源基准测试工具,可运行 7 个 tiny LLM(135M 参数起)的推理速度和准确率测试。用户选择模型后即可运行,测试数据保留在本地设备上。工具支持用 JavaScript 编写自定义检查函数来验证模型输出。
Reddit · r/LocalLLaMAAI 评分4848 airbench.ai:分布式本地 AI 智能体基准测试平台
开发者创建了 airbench.ai 网站,用于对比本地模型与测试框架的各种组合。用户可自定义测试配置并分享结果,平台提供排行榜展示测试数据。该项目旨在构建完全分布式的 AI 智能体 benchmark,目前测试数据主要由作者贡献,期待更多社区用户参与。
Hacker News · 最佳AI 评分4848 Google搜索什么时候变得这么"奇怪"了?
用户在Google搜索"hes never coming over dario"查找关于NBA球员Dario Saric的老推文时,AI Overview没有提供相关链接,而是假设用户被名为Dario的人拒绝,主动提供情感安慰。用户认为这违反了Google"组织世界信息并使其普遍可访问和有用"的使命,质疑搜索引擎何时变成了需要情感对话的工具。
Reddit · r/ChatGPTAI 评分2525 GPT sol 6 体验大幅下降
用户反馈 GPT sol 6 相比 sol 5.6 在遵循指令方面严重退步,5.6 能按指定风格写作的内容,sol 6 却会自行联网验证每条信息。验证事实任务时,模型会先去社交媒体搜索所谓原始帖子。此外 Android 应用存在 bug,模型选择菜单显示不足一秒即消失,无法切换回 sol 5.6。
Reddit · r/LocalLLaMAAI 评分1515 Qwen-Next 3.8 与 Claude Sonnet 5.5 对比:本地模型已达前沿
Reddit 用户对比 Qwen-Next 3.8 / 3.8 27b 与 Claude Sonnet 5.5 low / medium,发现本地模型已触及前沿水平,数月差距已被证实。作者日常使用 Qwen-Next 3.8 处理复杂任务,今日 GPT-Sol-6-High 出现错误时,Qwen-Next 成功修复问题。
Hacker News · 最佳AI 评分3333 从 Jev 看 AI 不可解释失败的正态化
TypeSafe AI 开发的 Jev 模型可返回带概率估计的类型化值,因快速便宜被用于快速上线,但用户不运行评测只求"AI赋能"标签,失败后以"AI 会犯错"推卸责任。当前行业缺乏对置信度校准的验证,错误溯源机制薄弱,导致"不可解释失败"逐渐被接受为正常现象,削弱了软件工程的责任追踪体系。