跳到正文

#Agent

今日 39 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月1日周四
  1. Reddit · r/artificial48

    Anthropic 机器人研究:任务能力与成本分离,哪些假设需仔细审查?

    Anthropic 9月30日研究用 Claude 评估任务示例、运营环境和部署成本,估计现有机器人可完成占美国工作时间34%的任务,但仅0.3%在成本上与人类劳动相当。研究未预测就业岗位消失,而是区分了任务能力与成本竞争力两个不同指标。需审查的关键是评估任务到完整工作流程间的监督、失败、交接和仍需人工完成的任务。

  2. Hacker News · 首页55

    Jevotron:命令行数据质量评估工具

    Jevotron 是一款命令行数据质量评估工具,支持 CSV、YAML、JSON 等多种文件格式,可对数据条目进行评分和审查。用户可通过 --guidance 参数添加检查指导,工具会评估每条记录的异常概率并生成报告。在对 24 个公开 Agent traces 的评估中,该工具的步骤质量标签匹配准确率达到 79.8%,有害步骤精确率为 89.7%,召回率为 70.3%。

  3. Reddit · r/artificial46

    AI 越来越聪明,为什么我们还要不断重复自己?

    AI 模型虽然变得更聪明,但用户在每次新对话中仍需重复介绍自己的偏好、工作和生活信息。文章以预订周年晚餐场景为例,对比了需要反复询问细节的 AI 与能主动记住用户偏好的 AI 带来的不同体验。提出 "agent intuition" 概念,认为 AI 应从单纯保存聊天记录升级为理解用户偏好变化、在适当时机主动询问,真正实现个性化交互。

  4. Hacker News · 首页64

    Lathoa:让孩子故意找 AI 错误的数学练习应用

    Lathoa 是一款面向 10-14 岁儿童的数学应用,其核心特色是让 AI 角色 Errol 故意算错题,孩子需要找出错误步骤并解释原因。产品提供三个难度等级(明显、隐蔽、专家),通过这种方式培养孩子在 AI 时代识别错误信息的能力。免费版每天 3 个案例,付费版提供无限案例和进度追踪功能。

  5. Product Hunt · AI 分类16

    FastRouter.ai:面向 LLM 应用的统一 AI 网关与控制平面

    FastRouter.ai 是一个面向 LLM 开发者与企业团队的统一 AI 网关与控制平面。它通过一个兼容 OpenAI 的 API,将每次请求路由到 200+ LLMs 中最合适的模型,从成本、延迟、质量和可靠性四个维度进行优化。其功能涵盖智能路由、故障转移、可观测性与治理,可在不绑定供应商或改动代码的前提下扩展 AI 应用。

  6. Reddit · r/ChatGPT17

    ChatGPT 账户出现并发问题

    多名用户报告 ChatGPT 账户同时出现三个问题:可疑活动误报(仅在手机和笔记本电脑登录)、消息流错误(半小时前开始、15分钟前急剧恶化)、自定义 MCP 服务器兼容性异常(拒绝长时间工作、谎报可用性)。这些似乎是服务端问题而非用户本地问题。

  7. Product Hunt · AI 分类48

    Thanor AI

    Thanor AI 是一款 AI 设计输入优化工具,可将完整的品牌 brief(调色板、字体比例、动效、结构)直接粘贴至 Claude、ChatGPT、Cursor、Lovable 或 Bolt 中使用。新增 MCP server 支持将提示词拉入编辑器,即将推出克隆功能可将欣赏的网站转换为自有设计。每周更新提示词和组件,面向建站者、设计师及 SaaS 开发者。

  8. Hacker News · 首页31

    批评 AI 反馈滥用:技术判断力退化的警示

    作者批评技术社区过度依赖 LLM 反馈的现象,认为询问 AI 而非自行思考暴露了对主题缺乏信心。指出 AI 导致了软件栈过度工程化,以及"vibe coding"糟糕方案不需要审批,但简单修改已部署系统设置却需要多层同意,讽刺 AI 同意并不等同于方案可行。

  9. Hacker News · 最佳81

    Google 发布 Gemini 4 Argon 旗舰模型

    Google 正式发布 Gemini 4 Argon 旗舰模型,定价为输入每百万 token 2 美元、输出每百万 token 10 美元,上下文窗口扩展至 100 万 token。

    推荐理由:原文披露了定价、多个基准测试分数和内部应用案例,读者可以据此评估该模型相对于前代和其他竞品的实际能力提升幅度。

  10. Google DeepMind77

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google 发布新前沿模型 Gemini 4 Argon,在复杂软件工程、企业知识工作和网络安全防御方面达到前沿性能。上下文窗口扩展至 100 万 token,定价为输入每百万 token 2 美元、输出 10 美元。该模型通过 Fairwind Program 向部分受信任的网络防御者提供,并将在不久后向付费 API 客户和 Google AI Ultra 订阅用户开放。

    推荐理由:原文给出了具体的能力变化和性能数据,读者可以据此判断这个模型的能力水平和应用场景。

  11. The Verge · AI57

    Meta 与 OpenAI 计划推出 AI 硬件设备

    Meta 和 OpenAI 将在未来一年尝试推出专用 AI 设备。Meta 计划在假期购物季前推出类似吊坠的 Muse Charm;OpenAI 与前苹果设计师 Jony Ive 合作,计划 2027 年前推出硬件。两家都先推软件 Agent(OpenAI 的 Dots、Meta 的 Muse)做市场铺垫,再推实体设备。

  12. Reddit · r/ChatGPT67

    我做了一个 app,可以向任何历史时刻提问并生成可打断的双人播客

    用户输入任何历史主题,约两分钟后两个主持人开始讲述故事,配有研究来源和时期艺术配图。最大亮点是可在节目中按住麦克风提问,主持人会回答并融入故事。支持 6 种语言,提供睡前和炉边两种语音风格。作者对 GPT、Claude、Gemini 在研究规划、脚本写作、选图、配音四个环节分别做了对比测试,发现各模型表现差异明显,目前可免账号试用。

  13. Reddit · r/ChatGPT25

    【实验】从 Blender 草图到现场表演

    作者利用 GPT Astra 辅助,在 Blender 中设计舞台块面草图,并结合身份、动作和视觉参考,通过 Uisato Studio 将静态设计转化为现场表演。 Realtime Audioreactive Pointclouds v1.7 已通过 Patreon 和 Store 发布,为现场演出提供实时音频响应视觉效果。

  14. The Verge · AI36

    Meta Muse AI智能体最新消息汇总

    Meta推出Muse AI智能体,声称可帮助处理邮件发送、在线购物等日常任务,同时推出类似Tamagotchi的Muse Charm挂件设备。该AI因数据隐私、信用卡安全以及"可爱但诡异"的形象引发广泛讨论,曾出现向陌生人发送用户地址的安全漏洞,亚马逊也曾屏蔽该智能体。

  15. Microsoft Research33

    微软研究院如何用机器学习预测美国电网的空间天气风险

    微软研究院开发了一个端到端机器学习管道,预测美国本土66,935个变电站的空间天气风险。该系统结合太阳风观测、AE和Dst指数预报及当地地质数据,可在潜在影响前30-60分钟发出警告,在评估期间检测到近80%的主要空间天气事件。GIC风险检测对主要事件(≥10 nT/min)达76.5%,严重事件(≥20 nT/min)达81.2%。

  16. Product Hunt · AI 分类35

    Agent Activity:AI 智能体活动监控工具

    一款 macOS 工具可实时监控 AI 编程智能体的后台活动,覆盖每个 session、build、test run 及截图。支持读取 Claude Code 和 Xcode 留在磁盘上的数据,仅在用户授权后提供 usage 和 crash 数据。需要 macOS 26 + Xcode 27。

  17. AWS Machine Learning Blog74

    在 Amazon Bedrock AgentCore Runtime Instances 上构建多智能体音乐制作流水线

    AWS 在官方博客中展示了如何使用 AgentCore Runtime Instances 构建一个三智能体音乐制作流水线:Composition 智能体使用 Claude Sonnet 4.6 生成音乐简报并调用 ACE-Step 模型在 GPU 上渲染音频,Delivery 智能体读取生成的音频并进行混音处理,Compliance 智能体进行合规审查。

    推荐理由:教程通过一个完整的多智能体音乐制作流水线,展示了在 GPU 实例上运行多智能体的具体实现方式,可迁移到 3D 渲染、模拟或模型推理等场景。

  18. AWS Machine Learning Blog63

    使用 Amazon Bedrock Knowledge Bases 用自然语言查询保险理赔

    本文是 AWS 官方技术教程,介绍如何使用 Amazon Bedrock Knowledge Bases 构建保险理赔助手。核心方案是通过 AgenticRetrieveStream API 实现智能检索,支持多轮对话、元数据过滤和引用标注。

    推荐理由:提供了构建保险理赔 RAG 助手的完整方案,含代码示例、配置步骤和评估数据,方法可迁移到其他文档检索场景。

  19. TechCrunch · AI45

    Destro AI 如何让机器人与人类协同工作

    Destro AI 获得 800 万美元种子轮融资,开发了一款 AI 智能层,让机器人在物流场景中与人类协同工作。该系统基于开放权重的视觉语言行动模型构建,由 Mothership 操作系统协调人类、机器人和卡车的全流程。Yusen Logistics 已在太平洋西北地区试点 3 个机器人,计划扩展至 26 个机器人全面部署,并在南加州启动 17 个机器人新试点。

  20. TechCrunch · AI69

    DoorDash 推出可短信下单的 AI 智能体

    DoorDash 发布新的 AI 智能体,用户可通过 Apple Messages 发送提示词下单,如"order my usual"即可复购周五晚餐。智能体支持指定菜品推荐本地餐厅、发送食物照片;群组订餐时可处理不同饮食偏好和数量。该功能已向美国用户开放 waitlist 测试,同时 DoorDash 将在北加州与部分餐厅试点无人机配送。

  21. Reddit · r/artificial66

    Historai:把任意历史时刻变成可中断的双人播客

    用户输入任意历史主题约两分钟后,系统生成一期双主持人播客,配有史料和艺术品。核心亮点是播放中可随时按麦克风提问,主持人会即时回答并融入叙事。作者对比了 GPT、Claude 和 Gemini 在研究规划、脚本撰写、艺术品选择和语音合成四个环节的表现,为每个环节选定了最优模型。

9月30日周三
  1. Reddit · r/MachineLearning27

    通用实时 LLM 智能体应使用什么 API 接口

    探讨通用实时 LLM 智能体的理想 API 接口设计。当前 vendors 提供的"real-time APIs"仅针对编程场景,而 AsyncLLM 预印本提出用 asyncio 协程和共享内存块实现异步智能体通信。提问者希望 OpenAI/Anthropic 等厂商能暴露通用 API,使开发者能构建实时调试助手、"深度研究"智能体、语音控制日历等应用。

  2. Hacker News · 最佳75

    Pi 曾经拒绝 MCP 为何现在支持了

    Pi 团队曾公开拒绝 MCP,但一年后决定将其纳入核心功能。团队解释主要原因是现代 MCP 已大幅改进,特别是工具返回结构化数据和可发现性方面。他们还引入了 Codemode 功能来解决 MCP 的组合难题,并通过示例演示了如何结合 Linear MCP 和 Jev 工具分析问题追踪器。

  3. The Rundown AI67

    OpenAI 发布 always-on 智能体 dots

    OpenAI 在 DevDay 上发布了 dots,一款可 7×24 小时运行的云端智能体,基于 GPT-6 Astra。dots 能接入 4000+ 应用,在 Slack、Teams 或 ChatGPT 中回复,首个 dot 随 Pro 和 Business Premium 计划免费提供。