#评测/对比
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#评测/对比
今日 0 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Latent SpaceAI 评分7575 Anthropic 发布 Claude Opus 5.5,OpenAI 推出 GPT-6 Sol 与 Luna
Anthropic 发布 Claude Opus 5.5,这是新 Claude 5.5 家族的首款模型,性能达到 Fable 5.1 水平但运行成本降低 40%、速度提升 30%。
Latent SpaceAI 评分3636 AI 新闻的现实检验:Yegge 关闭 Gas Town,Databricks 部署 Astra 成本增 60%
Steve Yegge 宣布关闭其代码智能体产品 Gas Town,承认投入数千美元月费却成果有限。Databricks 向约 3500 名工程师部署 GPT-6 Astra 后,编码支出增加约 60%,但在高复杂度系统设计上优于 Opus 5 和 Sol 5.6。与此同时,OpenAI 发布了模型对齐事件披露框架,包含过去六个月的四起案例报告。
The Rundown AIAI 评分4141 OpenAI 智能体研究效率实测:每人类工作1天相当于智能体工作3.1天
OpenAI 公布其编码智能体处理研究工作的数据,智能体现以 3.1 个人类工作天的产出效率运行,已达成 Sam Altman 原定 9 月实现的"自动化研究实习生"目标。普通研究员日均消耗 600+ 美元 token(第 90 百分位超 7000 美元),自 12 月以来 token 输出增长 124 倍,约 80% 研究员同时使用 4+ 智能体,实验频次达公司历史最高。
Hugging Face Blog精选AI 评分7171 Open ASR Leaderboard 首次纳入印地语和印度英语评估集
Hugging Face 与 Voice Arena 合作在 Open ASR Leaderboard 中新增印地语和印度英语评估集,这是首次有印度语言纳入该多语言基准。该数据集名为 Monsoon,每个片段记录 12 个说话人属性,使 ASR 误差率可按地区、年龄、性别、设备等维度细粒度分析。印地语评估集采用词错误率(OIWER)而非传统 WER,以处理拼写变体问题。
推荐理由:该数据集首次在公开基准中加入印度语种,并通过 12 个说话人属性实现了 ASR 性能的细粒度人口统计分析。
Ben's BitesAI 评分4747 ChatGPT Work 如何让 AI agents 绕过登录页
ChatGPT Work 推出新的登录流程,当 agents 遇到登录页时会暂停并显示专用表单,用户输入用户名、密码和 2FA 验证码。这些凭证不进入对话,而是直接传给云端浏览器完成认证。会话可保持登录状态用于后续任务,用户可在设置中清除。
Google DeepMindAI 评分5454 Google DeepMind 推出全球首个双盲 AI 评估方法
Google DeepMind 联合新加坡 AI 安全研究所、OpenMined 等机构,首次对 Gemini Flash Lite 模型实施双盲评估。该方法通过加密技术将外部评估限制在隔离环境中,防止模型预先获取测试题,从而避免 benchmark 污染问题,提升评估的可信度和完整性。
Import AIAI 评分3636 Import AI 465:开源与闭源模型差距缩小;Kimi K3发布;Demis Hassabis提出AGI监管框架
UK AI安全研究所分析显示,2025年开源权重模型与闭源前沿模型在网络安全能力上的差距已缩小至4-7个月,GLM-5.2和DeepSeek V4-Pro表现接近Claude Opus 4.6和GPT-5。
Hugging Face BlogAI 评分5555 Hugging Face 模型页面现可展示 Every Eval Ever 评估结果
Every Eval Ever (EEE) 和 Hugging Face Community Evals 实现了互操作,允许跨平台发布和解读评估结果。EEE 于 2026 年 2 月推出,旨在统一评估结果的报告格式,使用单一 JSON schema 记录评估的完整元数据。