跳到正文

#评测/基准

今日 11 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
今天10月8日周四
  1. Reddit · r/LocalLLaMA21

    Qwen3.8-27B 微调模型与前沿模型基准对比

    mradermacher/Signal-3.8-27B-Terse-Coder.i1-Q4_K_M 在 469 项领域评测中表现最佳本地模型,以更少 token 和更短完成时间取得更高准确率。Opus 5.5 以 99.6% 准确率领先,但本地模型 KPI 比前沿模型慢 28x,优势因硬件而异;作者已将评测工具开源供扩展使用。

  2. Reddit · r/LocalLLaMA41

    本地 Qwen3.8 27B vs DeepSeek Flash API:本地部署够用吗?

    一项 25 项配对任务测试显示,本地运行的 Qwen3.8 27B 在质量上得分 89.5,低于 DeepSeek Flash API 的 92.6,但 12 项核心套件双方各赢 6 项,编码任务上本地模型全部通过 10/10 智能体运行。本地推理速度达到云端的 2.5–5.5 倍,且 95% 以上耗时来自模型生成本身;本地运行除电费外无额外成本,云端 12 项套件合计消耗 0.14 积分。

10月7日周三
  1. Reddit · r/ChatGPT15

    Opus 4.5 与 Sol 6.1 任务完成度对比反差明显

    一名 Reddit 用户用相同的提示词分别测试 Sol 6.1 和 Opus 4.5 两款模型,要求它们在 10 欧元预算内完成一个家庭社交应用的搭建。结果 Sol 6.1 仅停留在"pursuing goal stalled"状态未交付任何成果,而 Opus 4.5 自主选定域名并完成了整个应用的构建。该用户在帖子中以 TLDR 形式总结这一反差,但尚未对最终产物进行测试。

  2. Simon Willison20

    Mistral Large 4

    用户 wren6991 在命令行中用相同的 SVG 绘制提示词("一只穿着渔网紧身衣在火星上横穿马路的犰狳")分别测试 Claude Opus 5.5、GPT-6.1、sol 版本、Gemini 3.8 Flash 和 Mistral Large 4,并对比各模型的默认推理等级。该帖子未提供各模型生成结果或评分数据,仅为测试命令展示。

10月6日周二
  1. Reddit · r/LocalLLaMA18

    GLM-5.3 Flash 用于生产级代码库:替代前沿模型的实测体验与训练细节讨论

    一名开发者称其公司在涉及数百万行代码的生产环境中,用 GLM-5.3 Flash 承担日常编码工作,替代了前沿模型。该模型在仓库探索、特性实现、重构和理解大型代码库方面表现超出预期,速度快且未以牺牲能力为代价。原帖重点询问其代码训练管线细节,包括代码预训练/后训练规模、合成数据占比、是否从更大 GLM 模型蒸馏以及针对仓库级与多文件任务的训练方式。

  2. Reddit · r/artificial29

    今晚直播:10 个 AI 模型同台对弈的世界大战开源基准,决策与推理全程记录

    一场类似模型竞技场的开源大战游戏基准今晚 10:45 pm ET(02:45 UTC)开赛,参赛阵容包括 Claude、GPT、Grok、Gemini、DeepSeek、Mistral、Qwen、Kimi、Llama 和 GPT-OSS 共 10 个 AI 模型。每局对战全程可回放,完整记录每个模型的指令、单行推理、决策时所见信息(黄金、兵力、攻击方、结盟提议)。规则允许结盟、背叛与使用核武器。

  3. Simon Willison15

    Qwen3.8 27B 加法用英文单词表达能力的基准测试

    一项基准测试考察本地运行的 Qwen3.8-27B-Q4_K_M.gguf 模型能否完成正整数加法并仅用英文单词表达结果。在 5,070 个关闭推理的测试用例中,数字正确率仅 23.57%,格式合规率达 96.29%,但操作数从 1-3 位升至 10-13 位时,正确率从 97.04% 跌至 6.44%。开启推理后,在 169 对配对样本的一次性测试中答对 167 题。

10月5日周一
  1. Import AI27

    Import AI 475:智能体集群扩展机制、Google DeepMind 推出 SynthID Bio 水印工具,以及 AI 驱动科学经济兴起

    Toby Ord 在文章中提出,AI 智能体集群(swarm)是一种新的推理扩展方式,4 个智能体并行执行任务理论上能以约一半的时间完成同等工作,但集群规模扩大 10 倍仅能带来 3 到 5 倍的性能提升,呈现出经济学家所说的"互相踩脚"式边际递减。

  2. Reddit · r/artificial25

    MoralityBench.ai:AI 道德评测基准

    MoralityBench.ai 是一个基于道德心理学测试的 AI 基准评测。评测结果显示,除 Jev 外,各模型在不同运行中的答案存在显著差异,表明道德推理并非确定性输出。该基准旨在评估大语言模型的道德判断能力。

  3. The Verge · AI40

    新泽西州前副州长用 AI 证明自己性骚扰无罪

    New Jersey 前副州长 Dale Caldwell 因性骚扰调查于 9 月 25 日被迫辞职后,在 NJ PBS 采访中称让多个 AI 平台分析了调查报告,AI 分析了 59 次均未发现性骚扰结论。报道指出 AI 聊天机器人以迎合用户著称,Caldwell 似乎不太可能想听到 AI 确认他性骚扰的调查结果。

10月4日周日