#评测/基准
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#评测/基准
今日 11 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/MachineLearningAI 评分4444 425 张极端镜面反射数据集发布:用于计算机视觉与深度估计算法基准测试
一个包含 425 个资产的自定义多面镜面服装数据集发布,旨在测试计算机视觉模型、深度摄像头和空间 AI 应对极端镜面反射的能力。数据集包含 100% 未压缩的 Camera-Master RAW 文件和高分辨率 JPEG,在高对比度户外环境拍摄以触发边界框丢失和分割失败。每个资产配有分块缓冲的 SHA-256 取证清单。
Reddit · r/MachineLearningAI 评分4545 ARC-AGI-3 基准测试分数在 Kaggle 上从 7% 跃升至 56%
过去30天内,Kaggle 上 ARC-AGI-3 基准测试的最高分数从 7% 提升至 56%。这些小型本地模型在该基准上开始超越平均水平的人类,该基准原本专门设计用于展示人类优势。
The DecoderAI 评分4545 中国AI模型在敏感话题上重复官方立场或拒绝回答
Aleph Alpha研究显示,阿里巴巴Qwen、DeepSeek和月之暗面Kimi在967个敏感话题测试中,仅17%-41%的回答被评为"均衡",其余重复国家立场或拒绝回答。
Reddit · r/artificialAI 评分6767 我让13个AI模型玩医疗咨询游戏:全部诊断正确,但安全表现差异大
作者让13个AI模型在自建的医疗咨询游戏中进行诊断测试,所有195次咨询都给出了正确诊断(心梗、阑尾炎、肺炎),但安全评估才是真正的区分点。GPT-6 Astra以83%得分和88%红旗识别率领先,GPT-6.1 Sol以80%得分和仅$0.03/次的成本表现亮眼,而Claude Fable 5.1得分75%但成本高达$2.06/次。
Reddit · r/MachineLearningAI 评分4040 Jev 评测:非前沿但仍值得关注
TypeSafe AI 推出 Jev,由 ChatGPT 联合发明者构建,定位为快速、几乎免费且不会产生幻觉的推理模型。作者在 16,379 个 benchmark 请求上实测,发现这是一个更小、更谦逊的模型,但对特定任务确实有用。
Hugging Face Blog精选AI 评分8484 Microsoft ThinkingBox 发布:通过数据库状态评估 AI 智能体
Microsoft 与 Hugging Face 联合发布 ThinkingBox,这是一个通过检查智能体在数据库中留下的实际记录来评估 AI 智能体的基准测试工具,而非仅评估其生成的文本。
推荐理由:原文通过大量实验数据揭示了 AI 智能体评估的核心问题:单次成功不等于可靠执行,这为读者选择生产环境模型提供了具体依据。
Reddit · r/ChatGPTAI 评分2626 自发式幽默是否是 LLM 智能被低估的衡量标准?
研究者提出自发式、上下文敏感的幽默可能是 LLM 智能的一个被低估的衡量标准。这种能力要求模型注意到意外联系、理解对话上下文、判断适当时机并准确表达而不过度解释。ChatGPT 标准语音模式比实时语音模式更主动发起幽默,而实时语音模式在回应已引入的幽默方面表现更好;模型可能随着对用户对话风格的熟悉而提升自发幽默能力。
Reddit · r/LocalLLaMAAI 评分4343 本地部署 Qwen3.8-Flash-Next Coder 编程能力测试:与 Claude Opus 4.6 持平
用户在三项Python编程任务上测试了本地部署的 Qwen3.8-Flash-Next Coder 与 Claude Opus 4.6,两者均获 92.7 分(满分100),隐藏测试得分 161/162 vs 162/162。Coder 模型使用 32GB VRAM 推理速度达 50-90 token/s,仅需消费级硬件即可运行。测试仅单次执行且任务规模较小,结果差异在统计意义上不具决定性。
Latent SpaceAI 评分2929 Claude Opus 5.5 在解释者视频方面表现出色
Claude Opus 5.5 现已在 SimpleBench 达到 88.4% 领先分数,视觉评估优于 Fable 5 和 GPT-6 Sol,但不及 GPT-6 Astra,成本比 Fable 5.1 低约 60%。
OpenAI NewsAI 评分3131 GPT-6 Astra 税务工作簿处理速度达 GPT-5.6 Sol 两倍
GPT-6 Astra 完成 50 页税务工作簿的速度是 GPT-5.6 Sol 的两倍。其更强的用户意图理解能力使 Basis 在实际应用中更有信心。
Import AIAI 评分4545 DiG-bench:70个游戏测试AI发现能力,Opus 5与Fable 5为最佳模型
DiG-bench是一个包含70个游戏的发现类benchmark,旨在测试AI在陌生环境中自主发现规则的能力,其中21个游戏已公开。测试结果显示,仅Opus 5和Fable 5能在最高难度Tier 7完成部分任务,GPT-5.5与Kimi K3可在Tier 6表现,而人类测试者能100%通过所有层级。
Import AIAI 评分2121 MIT 与哥伦比亚大学研究:信任与透明度如何影响 AI 公司的协调减速
MIT 与哥伦比亚大学研究人员分析了 AI 竞争对手之间实现协调减速的可能性,发现信任和透明度是实现稳定结局的两个关键变量。研究表明,低信任度下所有均衡都会导向"竞相毁灭",中等信任度时立即停止和竞相毁灭同时为均衡,高信任度下两个理性公司永久竞赛的概率随理性先验概率的平方消失。要避免灾难性竞赛,需要建立技术发展的透明度机制和信任机制。
Product Hunt · DesignAI 评分88 Hot100.ai:每周 AI 驱动项目榜单上线,由 Flambo 评判排名
Hot100.ai 是一个每周一更新的 AI 项目榜单,由 Flambo 基于创新性和实用性为每款提交作品打分。榜单聚焦于用 Cursor、Bolt、v0、Replit、Lovable、Claude Code 等工具构建的 AI 应用,用以发掘表现突出的项目。
Replicate BlogAI 评分5858 主流图像编辑模型对比评测
Replicate 对六款主流图像编辑模型进行对比评测,涵盖对象移除、视角转换、背景编辑、文字编辑和风格迁移五项任务。
Replicate BlogAI 评分3737 主流 AI 图像模型角色一致性生成能力对比评测
本文对比了 Replicate 上四款主流 AI 图像模型(gpt-image-1、Gen-4 Image、FLUX.1 Kontext、SeedEdit 3)基于单张参考图生成一致角色的能力。
Replicate BlogAI 评分7373 AI 视频模型横评:Sora 后的开源浪潮与平台选择
AI 视频正迎来突破时刻。2023 年 AI 视频质量尚差,2024 年 Sora 重新定义期待,随后大量模型涌现。Minimax Video-01 质量接近 Sora 但闭源,Tencent Hunyuan Video 开源可微调,Genmo Mochi 1 已优化至单卡 4090 可运行,Lightricks LTX-Video 仅需 10 秒生成 3 秒视频。
Replicate BlogAI 评分5353 FLUX.1 初印象
Replicate 官方测试了新的图像生成模型 FLUX.1,发现其使用 flow matching 而非传统 diffusion 方法,在文本渲染精度、光影质感表现和艺术风格理解方面展现出独特优势,生成图像具有一种有机的流动感。