#评测/基准
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#评测/基准
今日 0 条一手 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Microsoft ResearchAI 评分1818 Microsoft Research 播客:Jennifer Neville 谈 AI 评测的边界与失败带来的启示
Microsoft Research 播客邀请合作研究经理 Jennifer Neville 与首席应用科学家 Chad Atalla 对谈,探讨 AI 评测如何推动模型性能边界,以及当测试超出传统 benchmark 时出现的"意外失败"。
GitHub Blog · AI & MLAI 评分3636 GitHub 推出 ReviewBench:面向 AI 代码评审智能体的开源基准
GitHub 发布开源代码评审基准 ReviewBench,涵盖 19 种语言的 219 个公开 pull request,其语言与仓库规模分布基于对 103.9M 个 GitHub pull request 的分析建模而成。
Hugging Face Blog精选AI 评分8484 Microsoft ThinkingBox 发布:通过数据库状态评估 AI 智能体
Microsoft 与 Hugging Face 联合发布 ThinkingBox,这是一个通过检查智能体在数据库中留下的实际记录来评估 AI 智能体的基准测试工具,而非仅评估其生成的文本。
推荐理由:原文通过大量实验数据揭示了 AI 智能体评估的核心问题:单次成功不等于可靠执行,这为读者选择生产环境模型提供了具体依据。
OpenAI NewsAI 评分3131 GPT-6 Astra 税务工作簿处理速度达 GPT-5.6 Sol 两倍
GPT-6 Astra 完成 50 页税务工作簿的速度是 GPT-5.6 Sol 的两倍。其更强的用户意图理解能力使 Basis 在实际应用中更有信心。
Replicate BlogAI 评分5858 主流图像编辑模型对比评测
Replicate 对六款主流图像编辑模型进行对比评测,涵盖对象移除、视角转换、背景编辑、文字编辑和风格迁移五项任务。
Replicate BlogAI 评分3737 主流 AI 图像模型角色一致性生成能力对比评测
本文对比了 Replicate 上四款主流 AI 图像模型(gpt-image-1、Gen-4 Image、FLUX.1 Kontext、SeedEdit 3)基于单张参考图生成一致角色的能力。
Replicate BlogAI 评分7373 AI 视频模型横评:Sora 后的开源浪潮与平台选择
AI 视频正迎来突破时刻。2023 年 AI 视频质量尚差,2024 年 Sora 重新定义期待,随后大量模型涌现。Minimax Video-01 质量接近 Sora 但闭源,Tencent Hunyuan Video 开源可微调,Genmo Mochi 1 已优化至单卡 4090 可运行,Lightricks LTX-Video 仅需 10 秒生成 3 秒视频。
Replicate BlogAI 评分5353 FLUX.1 初印象
Replicate 官方测试了新的图像生成模型 FLUX.1,发现其使用 flow matching 而非传统 diffusion 方法,在文本渲染精度、光影质感表现和艺术风格理解方面展现出独特优势,生成图像具有一种有机的流动感。