跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 21–40 条 · 共 122 条
10月2日周五
  1. Hacker News · 首页76

    Cloudflare 发布开源决策模型 Clef 和 Clef-flash,上线 RL 微调平台

    Cloudflare 发布两款决策模型 Clef 和 Clef-flash,均基于 Qwen 微调,支持文本和图像分类,在 Jev Decision Index 评估中领先。Clef 中位延迟 209.3ms,Clef-flash 仅 38.8ms,均优于 Jev 的 524.1ms。两款模型已开源至 Hugging Face 并托管于 Workers AI,同时推出 RL 微调服务供客户定制。

    推荐理由:原文给出了与 Jev 的基准对比和延迟数据,读者可以判断决策模型在特定场景下是否比通用 LLM 更适合。

10月1日周四
  1. Reddit · r/LocalLLaMA80

    Jeff-Qwen3.5-0.8B v1.2 + 9 个 LoRA 适配器:置于 Qwen3.8-27B 前实现 38 倍加速和 +8.7 准确率,额外内存占用不足 2GB

    作者发布 Jeff-Qwen3.5-0.8B,这是一款小型“System 1”模型,可在一轮前向传播中从给定选项中做出选择并返回校准概率。作者为其训练了 9 个 LoRA 适配器,分别处理 prompt 注入检测、工具选择、票据优先级排序、答案溯源等常见决策任务。

    推荐理由:原文给出了具体的性能对比数据和开源资源,读者可以据此判断这种“小模型+LoRA适配器前置”的架构是否适合自己本地部署的场景。

  2. Product Hunt · AI 分类67

    OpenCompanion 发布:解决多文件夹 AI 编码助手授权管理问题

    OpenCompanion 是管理 Claude Code、Codex CLI、OpenCode 多会话的工具。当这些 AI 编码助手在多个文件夹同时运行时,OpenCompanion 能在同一界面列出所有会话、提示授权需求,支持在桌面或同一 Wi-Fi 下的手机端回复。无账户、无云服务器、无遥测,开源(MIT),支持 Windows、Linux 和 macOS。

    推荐理由:原文给出了具体问题和解决方案,读者可以判断它能否解决自己在多项目同时开发时的授权管理痛点。

  3. Product Hunt · AI 分类64

    Cursor Remote Lite:手机远程控制电脑 Cursor 的应用

    Cursor Remote Lite 让用户用手机远程控制电脑上的 Cursor,可在手机上回答 Agent 的问题、批准命令、分配任务、保持或撤销文件更改。支持本地、SSH 远程和 Agents 窗口,可切换模型和 effort,Agent 等待时推送通知。

    推荐理由:原文给出了具体功能和使用场景,读者可以据此判断它能否解决自己的远程编程需求。

  4. Hacker News · 最佳81

    Google 发布 Gemini 4 Argon 旗舰模型

    Google 正式发布 Gemini 4 Argon 旗舰模型,定价为输入每百万 token 2 美元、输出每百万 token 10 美元,上下文窗口扩展至 100 万 token。

    推荐理由:原文披露了定价、多个基准测试分数和内部应用案例,读者可以据此评估该模型相对于前代和其他竞品的实际能力提升幅度。

  5. Google DeepMind77

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google 发布新前沿模型 Gemini 4 Argon,在复杂软件工程、企业知识工作和网络安全防御方面达到前沿性能。上下文窗口扩展至 100 万 token,定价为输入每百万 token 2 美元、输出 10 美元。该模型通过 Fairwind Program 向部分受信任的网络防御者提供,并将在不久后向付费 API 客户和 Google AI Ultra 订阅用户开放。

    推荐理由:原文给出了具体的能力变化和性能数据,读者可以据此判断这个模型的能力水平和应用场景。

  6. AWS Machine Learning Blog74

    在 Amazon Bedrock AgentCore Runtime Instances 上构建多智能体音乐制作流水线

    AWS 在官方博客中展示了如何使用 AgentCore Runtime Instances 构建一个三智能体音乐制作流水线:Composition 智能体使用 Claude Sonnet 4.6 生成音乐简报并调用 ACE-Step 模型在 GPU 上渲染音频,Delivery 智能体读取生成的音频并进行混音处理,Compliance 智能体进行合规审查。

    推荐理由:教程通过一个完整的多智能体音乐制作流水线,展示了在 GPU 实例上运行多智能体的具体实现方式,可迁移到 3D 渲染、模拟或模型推理等场景。

  7. AWS Machine Learning Blog63

    使用 Amazon Bedrock Knowledge Bases 用自然语言查询保险理赔

    本文是 AWS 官方技术教程,介绍如何使用 Amazon Bedrock Knowledge Bases 构建保险理赔助手。核心方案是通过 AgenticRetrieveStream API 实现智能检索,支持多轮对话、元数据过滤和引用标注。

    推荐理由:提供了构建保险理赔 RAG 助手的完整方案,含代码示例、配置步骤和评估数据,方法可迁移到其他文档检索场景。

9月30日周三
  1. Latent Space80

    OpenAI DevDay 2026 发布 Dots、GPT-6.1 Sol 等新品,ChatGPT 周活达 12 亿

    OpenAI 在 2026 DevDay 上发布语音智能体 Dots、GPT-6.1 Sol(定价为 Astra 的五分之一)、Ultrafast 加速模式(最高 8 倍提速)和 Decisions API,同时推出 ChatGPT Spaces 和企业市场。

    推荐理由:原文提供了 OpenAI DevDay 2026 的完整产品矩阵和行业关键事件(Anthropic IPO、NVIDIA 收购 Hugging Face),读者可据此了解当下 AI 竞争格局的全景。

  2. Product Hunt · AI 分类69

    OpenAI 发布 Dots 智能体功能

    OpenAI 在 ChatGPT 上推出 Dots 智能体功能,由 GPT-6 Astra 驱动。每个 dot 拥有独立的云电脑和浏览器,可通过插件连接超过 4000 个应用,24/7 为用户工作。

    推荐理由:原文给出了具体功能(云电脑、浏览器、4000+插件)、接入渠道(ChatGPT/Slack/Teams)和开放范围,读者可以据此判断它会怎样改变现有工作流。

  3. Hacker News · 首页76

    Anthropic 发布 GLM-5.3 网络安全能力分析报告

    Anthropic 发布研究分析,评估中国智谱 AI 开发的 GLM-5.3 模型的网络安全能力。研究发现 GLM-5.3 能够自主构建端到端网络漏洞利用,在 ExploitBench 基准测试中成功开发 50/410 个漏洞利用。

    推荐理由:原文给出了 GLM-5.3 的具体安全测试数据,展示了绕过防护的手段和成功率,读者可据此评估开源权重模型的安全风险。

  4. AWS Machine Learning Blog73

    GPT-6.1 Sol 在 Amazon Bedrock 全面可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 全面可用,将更强的推理能力带入编码、计算机使用和专业工作负载。根据 OpenAI 的数据,该模型在 DeepSWE v1.1 上与 GPT-6 Astra 性能相当,但任务成本降低约五分之一;相比 GPT-6 Sol 最高分提升 6.4 个百分点。用户可通过 Amazon Bedrock 控制台或 API 接入使用。

    推荐理由:原文给出了与前代版本的成本和性能对比数据,读者可以据此判断新模型是否值得在生产环境中切换。

  5. The Decoder80

    OpenAI 推出常驻智能体 Dots,与 Meta Muse 竞争

    OpenAI 在 DevDay 2026 开发者大会上发布了常驻智能体 Dots,可自动处理工作任务如修复 Slack 报告的 bug 或发送遗漏发票,有时在用户提出前就主动完成。

    推荐理由:原文详细介绍了 Dots 的主动工作能力、与 Meta Muse 的对比、定价和可用性,读者可以据此判断它与现有工作流助手的差异。

  6. Product Hunt · AI 分类61

    Audryo:面向 AI 智能体的邮件生命周期工具

    Audryo 是一款为 AI 智能体构建的邮件生命周期管理工具,支持通过 MCP、API 或 CLI 连接 Claude Code、Codex 或 Cursor。AI 智能体可创建受众、邮件旅程、营销活动和品牌邮件,发送前需用户审核。工具在沙盒环境中测试,邮件通过用户自己的提供商发送。公开测试期间免费使用。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

  7. Product Hunt · AI 分类61

    Arc 发布 AI 屏幕助手,支持 Android 和 Mac

    Arc 推出一款浮窗式 AI 屏幕助手,可在任何应用上运行,支持一键操作如事实核查、分析表格或从食物照片中识别卡路里,并允许用户自定义操作。新增 500 多个社区动作、信息库(供 AI Writer 填充个人信息)、AI 通话分析、从阅读内容生成闪卡以及智能提取屏幕数据功能,现已支持 Android 和 Mac 平台。

    推荐理由:列出了多个具体功能变化和开放入口,读者可以据此判断它对自己现有的工作流是否有帮助。

  8. Product Hunt · AI 分类63

    Arsaze 发布 AI 视频编辑器,支持 AI 智能体与人类协同编辑

    Arsaze 推出 AI 视频编辑器,定位为视频编辑领域的 Cursor。该产品提供真正的多轨时间线,AI 智能体和人类都能通过 MCP 或语音驱动进行编辑,整合 AI 视频编辑、生成和智能体驱动编辑功能于同一时间线。

    推荐理由:原文给出了产品定位和核心能力,读者可以据此判断它与传统视频编辑器的差异。

  9. Product Hunt · AI 分类67

    Codex Remote:开源 Mac 菜单栏应用让用户在自己的云端运行 AI 智能体

    Codex Remote 是一个开源的 Mac 菜单栏应用,可将 Codex 和 Claude Code 部署到用户自己控制的云机器上。用户选择提供商和服务器规格后,应用会使用 OpenTofu 置备服务器、安装智能体并连接到已有应用。

    推荐理由:原文说明了如何把 AI 智能体部署到用户自己控制的云端,并给出了具体的功能组合方式,读者可以据此判断它是否适合自己的工作流。

9月29日周二
  1. Hacker News · 最佳76

    Fireworks 发布 Ember-1:基于 Kimi K3 的高效推理模型

    Fireworks Research 发布 Ember-1 模型,基于 Kimi K3 通过训练减少不必要推理过程,实现相同质量下 token 消耗降低 40%。

    推荐理由:原文给出了 Ember-1 在多个 benchmark 上的具体 token 节省比例和分数对比,读者可以据此评估这个专门优化模型的实际效果。

  2. Hacker News · 首页79

    Jevstiller:带 Disagreement Bound 的本地模型蒸馏工具

    Jevstiller 是一个将 Jev 模型蒸馏为本地小模型的系统,使用 bge-small 编码器加逻辑回归头,约几百 KB,CPU 上 15ms 响应。核心创新是提供 95% 置信度的协议保证:设置如 98% 的目标Agreement,系统保证本地模型与 Jev 的不一致率不超过预算。

    推荐理由:给出了一个带数学保证的蒸馏系统实现,读者可以学习其如何用统计方法保证协议达成。

  3. Microsoft Research66

    微软发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,这是一款旨在连接科学工具、文献、实验室和研究人员的 AI 研究系统。与 Broad Institute 合作,该系统用于预测和优先排序能够驱动肿瘤状态转变的化合物。在胰腺导管腺癌(PDAC)的湿实验证中,Quine 最高排名的化合物产生了最大的预期转录变化,整个过程仅用一个周末就完成了候选化合物的筛选和验证。

    推荐理由:原文给出了 Quine 的具体能力(世界模型+交互式 harness)、应用场景(胰腺癌药物预测)和初步验证结果,读者可以据此了解这个 AI 系统如何辅助生物研究以及实际效果。