跳到正文

#Agent

今日 38 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
9月7日周一
9月6日周日
9月5日周六
  1. GitHub Blog · AI & ML77

    GitHub 发布 Project HydraFusion 研究预览:通过多模型编排实现前沿质量

    GitHub 推出 Project HydraFusion 研究预览,通过运行时编排从多个模型提供商动态选择工作流程(Single、Cascade、Critique 三种模式)来解决编码任务。

    推荐理由:原文给出了具体 benchmark 数据和可用入口,读者可以据此判断这个新功能会如何改变代码生成的效率成本权衡。

9月4日周五
9月3日周四
  1. Ben's Bites32

    Claude Fable 5.1 发布

    Anthropic 发布 Claude Fable 5.1,开发者称其为目前最好用的模型,发现它对话更快更流畅。新版配备新 system prompt,禁止重复歌词和版权标志,并降低缓存输入成本 75%,API 整体使用比之前便宜约 25%。人们已用它构建马里奥/GTA 风格游戏、3D 房屋渲染等应用。

  2. Google DeepMind77

    Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber

    Google DeepMind发布Gemini 3.8 Flash和3.8 Flash Cyber两款新模型。3.8 Flash在DeepSWE v1.1基准上超越多数更大规模的frontier模型,在HLE-Verified上达54.9%,价格为每百万输入token 0.75美元、输出token 3.75美元。

    推荐理由:原文给出了在软件工程、Agent任务和多步推理方面的具体性能提升数据和成本对比,读者可据此判断模型能力变化。

9月2日周三
  1. The Rundown AI69

    Anthropic 发布 Claude Fable 5.1,结束前沿模型安静期

    Anthropic 发布 Claude Fable 5.1,在 AA Intelligence Index 创下 66 分纪录,科学研究测试得分是 Fable 5 的两倍以上。安全过滤器在网络安全工作中减少 60% 干预,基础医学和生物学问题中减少 85%。Anthropic 同时发布限制更少的 Mythos 5.1,仅向通过审查的美国网络安全和生物学研究人员开放。

9月1日周二
  1. Ben's Bites26

    Build your ideas

    Anthropic 宣布 Claude Code 使用限额将于 9 月 14 日从 150 units 降至 125 units(永久增加 25%),用户批评其"5x"和"20x"订阅计划的营销宣传与实际使用限制不符。

  2. The Rundown AI61

    Runway 推出 Solaris 预览版:用视频实时渲染替代传统网页

    Runway 发布 Solaris(界面世界模型),将网站和应用实时渲染为视频,结合 Gen-4.5 视频模型与 LLM 根据用户点击逐帧生成内容,演示包括虚拟试衣、食材组合和交互式燃烧实验。在 Runway 测试中,测试者在 71% 场景行为判断和 61% 指令遵循上更倾向于 Solaris 而非 Claude Opus 5 编写的页面,当前仍存在文本清晰度、长时间会话漂移等问题。

8月31日周一
8月28日周五
8月26日周三
8月25日周二
8月21日周五
  1. Ben's Bites45

    如何在 Claude 中搭建个人 AI 智能体:我的设置经验分享

    作者分享了在 Claude 中搭建个人 AI 智能体的方法,创建了包含 AGENTS.md(主指令)、code.md(构建偏好)、todos.md、memory.md 等文件的文件夹结构。建议使用最少的文件和最小的上下文,让智能体保持灵活而非过度"记忆"偏好导致回答被束缚。智能体可以自行搜索历史聊天记录,无需额外保存日志。

  2. The Rundown AI66

    Slack 发布 Slack Code:在消息频道内协同开发代码

    Slack 推出 Slack Code 功能,允许用户直接在消息平台内通过共享房间开发代码,AI 智能体在频道中编写软件,团队成员(无论是否为工程师)都可以观看、指导和参与构建过程。部署变更需人工审批,完成的项目留下可搜索的存档频道。所有 Slack 计划均可使用,可连接 ChatGPT、Claude、Devin、Vercel 和 GitHub 等智能体。

8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search,提供更准确高效的 AI 搜索结果

    Mistral 发布 Agentic Search,在 FinanceBench 和 OfficeQA Pro 基准测试中实现了更准确的搜索结果,同时减少了对话轮次、token 使用和延迟。

    推荐理由:原文给出了具体性能数据:金融文件正确率从 26.7% 提升到 86%(3x),p90 延迟降低 39.6%,token 消耗减少最多 1/3,读者可据此判断该技术对自己场景的实际价值。

8月19日周三
8月18日周二
  1. Ben's Bites17

    <think>让我仔细分析这个任务:

    1. **原始标题**: "Do you use a personal agent?" 2. **正文内容**: 这是一篇 Ben's Bites Newsletter 的编辑内容,包含了多个 AI 领域的新闻和更新 3. **时间锚点**: 原文发布日期:2026-08-18 **标题分析**: - 原标题 "Do you use a personal agent?

  2. The Rundown AI62

    Cursor 推出 Origin 挑战 GitHub

    AI 编程平台 Cursor 推出 Origin 早期测试版,提供代码仓库托管和拉取请求功能,内置智能体和审查工具,可与 GitHub 同步代码库。Origin 选在 GitHub 当天大规模宕机时发布,最初面向 Cursor 付费用户开放。

8月17日周一
8月14日周五