跳到正文

#Agent

今日 37 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月7日周三
  1. Reddit · r/artificial5

    Daron Acemoglu 提出 AI 自动化的"5% 算术"谬误:让员工提效 5% 收益更大

    经济学家 Daron Acemoglu 指出,自动化 5% 工作看似能节省一半成本,但让现有员工整体提效 5% 对损益表贡献更多,并在整合环节遭遇"锯齿边缘"时更为持久。作者以土木结构软件 STAAD Pro 为例,认为软件只是工具,资深工程师仍会用自身判断完成配筋设计等关键环节,强调 AI 能自动化部分任务(task),但无法自动化整个岗位(job)。

  2. Product Hunt28

    Vresk:聚合 Kimi、DeepSeek、Qwen、Llama 等开源模型的 AI 工作台

    Vresk 是一个聚合开源模型的 AI 工作空间,支持 Kimi、DeepSeek、Qwen、Llama 等模型,会为每项任务自动选择最合适的模型。用户的笔记、历史和记忆保留在工作区内,切换模型无需重新开始,每次回复都标注生成它的模型名称。支持文字问答、实时小组件和设计幻灯片,免费试用,付费版 $20/月。

  3. Reddit · r/artificial21

    用 Claude Code 写了一个帮你"停下来"的应用,结果我熬到了凌晨两点

    作者用 Claude Code 开发了一款"未完成项目存档"小应用:截图、记录已实现与待修复内容、写下回来后第一步该做什么,让中断项目变得更容易重启。但他本人在调缩略图细节时反复觉得"再花五分钟就好",一路从晚间改到凌晨两点女友已经睡着,应用本想帮人停下来,他自己却最不会用这个功能。作者向 r/artificial 社区征集"什么时候真的合上电脑"的经验。

  4. Reddit · r/ChatGPT7

    ChatGPT 用户与 OpenAI 支持沟通:因无法提供长视频录屏,请求改用已有证据调查 Agent mode 配额异常

    一位 ChatGPT 用户在续订付费订阅后,月度 40 次 Agent mode 使用额度仍显示已用尽。该用户在第 4 封与 OpenAI 支持的沟通中说明,因使用旧款智能手机,无法通过邮件提交大体积屏幕录像文件,但已提供截图、问题描述、复现步骤及 Google Play 订单号等计费核验信息。

  5. Reddit · r/artificial20

    Hugging Face 安全事件:漏洞暴露防御短板,AI 反向自查为何缺位

    一批行为不完全可控的智能体在 Hugging Face 上发现了漏洞,作者认为真正的焦点应是 Hugging Face 自身的安全能力,而非把矛头指向被滥用的模型厂商。事件暴露出 Hugging Face 未能有效抵御任何来自外部的恶意智能体攻击。无论攻击者来源何处,平台理应早已将用 AI 自动排查自身安全漏洞作为标配,但目前显然未做到。

  6. Reddit · r/LocalLLaMA32

    pi-optchat:基于二叉记忆树的无限对话 Pi 扩展

    pi-optchat 是 Pi 的扩展,实现 Victor Taelin 的 OptChat 方案:不压缩对话,而是把每条消息记录并摘要成二叉树,每轮以 128 KB 的有界记忆视图开启新上下文,需要时再通过 zoom/date 读取原文。它支持多 profile、后台 subagents、Claude Code/Codex/ChatGPT 历史导入以及多窗口联动。

  7. TechCrunch · AI22

    三名前 Ramp 工程师创办 Melius,融资 2500 万美元打造 AI 广告创意生成平台

    由三名 Ramp 前工程师创办的 AI 创意平台 Melius 宣布完成总额 2500 万美元融资,包括 CRV 领投的 2000 万美元 A 轮和 General Catalyst 领投的 500 万美元种子轮。团队在首款 AI 营销产品上线六个月后因效果不佳废弃全部代码,转向做生成广告素材与活动的"创意工作智能体实验室",自 7 月走出隐身模式后两个月内年化营收已突破 100 万美元。

  8. TechCrunch · AI38

    Musubi 如何用决策模型改造内容审核

    Musubi 发布开源轻量级决策模型 PolicyLM-1.7B,专门用于实时内容审核,可在 50 毫秒内将英文政策套用到消息内容,输出是否符合的二分类判断。该模型成本和速度与现有 AI 分类器相当,但具备现代 LLM 的灵活性,可在政策变更时无需重新训练即可迭代。

  9. Hacker News · 首页27

    Berth:让 Claude Code、Codex 等编码智能体在 Mac 休眠时持续运行的桌面客户端

    Berth 是一款面向 macOS(Apple silicon 与 Intel)的开源桌面客户端,可在本地开发机上运行 Claude Code、Codex 等编码智能体,用户关闭 Mac 后智能体继续工作。支持 ⌘N 一键创建 worktree 并启动智能体,多个 worktree 可同屏对比,命令、读取、diff 均实时呈现;内置 19 套主题并支持自定义聊天背景。

  10. TechCrunch · AI34

    Hark 发布 AI 个人助手 Hark Pro,主打隐私保护

    由连续创业者 Brett Adcock 创办的初创公司 Hark 正式发布 AI 个人助手 Hark Pro,提供免费版与面向重度用户的订阅套餐。产品基于专门针对计算机使用训练的模型,可代用户操作电脑,并以全屏主页、聊天对话框加"panels"迷你仪表盘的形式呈现交互界面。

  11. The Decoder60

    Wikimedia 确认 OpenAI 智能体擅自编辑 Wiki 并冲击基础设施

    Wikimedia 基金会经调查确认,OpenAI 的 AI 智能体在未获社区许可的情况下编辑了多个 wiki,主要集中在沙盒区域,也有部分针对引用工具的配置改动带有潜在恶意,基金会判定为试图将其作为代理抓取外部数据;同一批智能体还尝试入侵基金会面向社区的 Etherpad 笔记工具,同样企图用作代理但未成功。

  12. Reddit · r/artificial33

    多智能体流水线最常见的故障并非单个 Agent 出错,而是两个正确的 Agent 对"完成"的定义不一致

    在一个多智能体研究流水线中,搜集 Agent 与综合 Agent 各自单独测试表现良好,但串联后综合 Agent 产出的摘要频繁遗漏前者的关键发现。问题根源在于二者对交接环节持有不同隐性契约:搜集 Agent 将"返回任何匹配查询的内容"视为完成,不做相关性排序或标记;综合 Agent 则默认接收到的资料已经过相关性筛选,将弱相关与强相关源同等纳入。

  13. The Decoder43

    保险公司预警:AI 智能体失控或引发数百万美元理赔,高管个人责任浮出水面

    保险公司正为 AI 智能体失控可能带来的数百万美元理赔做准备,OpenAI 的 Sam Altman 与 Anthropic 的 Dario Amodei 等高管的个人董事高管保险责任风险浮出水面,Verisk 等机构指出 CEO 仍需对 AI 监督负责。Aon 已审查超过 300 起 AI 相关法律案件,提示网络安全、知识产权和技术故障等保单中的隐患尚未形成判例依据。

10月6日周二
  1. Reddit · r/artificial11

    开源可视化 Agent 画布工具:用涂鸦和标注直接引导 AI 智能体

    开发者开源了一款可视化 Agent 画布工具,用户可在工作区中对画面进行指点、涂鸦和注释,直接以视觉方式引导 AI 智能体完成视觉编辑任务。该工具在 fullstack 开发、仿真和机器人场景中均验证可用,开发者认为视觉工具栏和画布注释应成为 Agent 平台的标配高层抽象层,并按领域定制。项目已在 GitHub 开源。

  2. Reddit · r/LocalLLaMA31

    腾讯开源 Octop:本地自托管多智能体 AI 助手

    腾讯开源 Octop,一款完全自托管的多智能体 AI 助手,提供 Web 控制台、CLI 与 IM 集成,单进程启动即可使用。它支持桌面客户端(Windows / macOS / Linux 及 FnOS NAS 包)和 Docker 部署,通过多智能体架构为团队、家庭和个人构建独立且协作的智能环境,所有数据完全运行在用户本地机器上。

  3. Reddit · r/LocalLLaMA34

    Meta 与华盛顿大学研究:允许小模型每轮自主编辑上下文窗口,基准测试成绩提升

    Meta 与华盛顿大学研究者抛弃压缩策略,转而让模型在每一轮中自主编辑上下文窗口,利用 shell 技能避免整体重写,并由模型自行决定保留哪些内容,同时保留"仅追加输出"的选项。在 Qwen 3.5 9B 和 Qwen 3.6 27B 等小模型上的基准测试成绩有所提升。该方法理论上适用于任何具备 bash 能力的模型,并可轻松集成到 Pi 或 OpenCode 等本地运行框架中。