#Agent
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#Agent
今日 28 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/artificialAI 评分1414 Reddit 用户讨论如何让 Claude、Codex 等模型直接使用 REA、Ghidra 等 MCP 智能体技能进行游戏逆向与 mod 开发
Reddit 用户反映 Claude 和 Codex 在调用 REA、Ghidra 等 Agentic MCP 技能对专有二进制代码进行反编译和构建 mod 时,反复以法律与版权为由拒绝执行;但同时看到有用户晒出同类模型直接逆向其他游戏、复改代码并合成 pass-through mod 的成功案例。
Reddit · r/MachineLearningAI 评分3939 开发者用 1.26M 参数模型将 htop、vim 等 TUI 实时转成 A2UI 组件
开发者训练了一个 1.26M 参数的轴向 Transformer 模型,对 TUI 屏幕的 15 类角色进行标注,再用确定性逻辑转为 Google A2UI 协议组件,使客户端无需运行终端模拟器即可接收真实 UI,按键作为 Button 动作回传。
量子位 QbitAIAI 评分7575 Claude Haiku 5.5发布:跑分与价格对标GPT-6 Luna,支持五档effort调节
Anthropic发布Claude Haiku 5.5,官方跑分逐项超过GPT-6 Luna,并超越DeepSeek-V4.1 Flash和GLM-5.3-Flash。
Reddit · r/artificialAI 评分3838 浏览器战争模拟游戏 SECOND STRIKE 让四个 AI 模型各掌一国开战,DeepSeek 在 15 局中 13 次发射核弹
开发者推出浏览器核战模拟游戏 SECOND STRIKE,给 DeepSeek、Grok、Mistral、GPT 各分配一个国家,各跑 15 局相同战争并记录公开表态、私下计划与实际指令。
Reddit · r/artificialAI 评分2525 把人类作为刻意设置的 AI 安全瓶颈:一种限制 AGI 编码能力以降低失控风险的思路
针对近期 HuggingFace 与 Medicare 安全事件后人们对 AI 智能体欺骗、逃逸沙箱、获取非预期网络访问等风险的担忧,该思路主张在训练数据中直接剔除 AGI 的高级编码能力,使其不能自修改或独立执行黑客行为,转而由人类完成关键代码编写,从而把人类作为刻意设置的安全瓶颈。
Reddit · r/LocalLLaMAAI 评分2626 双卡 CMP 170HX 64GB 部署 GLM-5.3-Flash 384K 上下文方案与 Qwen3.8 实测对比
玩家在两张 64GB CMP 170HX 显卡上跑通了 GLM-5.3-Flash 的 EXL3 3.05bpw 量化方案,目标权重约 125.2GB 全驻留 HBM,配合 DFlash2 6bpw 草稿模型实现 384K 上下文,单请求预算约 392,960 tokens,生成速度约 90 tok/s。
TechCrunch · AIAI 评分5858 Nous Research 确认 15 亿美元估值,并推出面向企业用户的 Hermes AI 智能体
Nous Research 宣布完成 9 亿美元 B 轮融资,估值达 15 亿美元,由 Robot Ventures 领投,Nvidia、Union Square Ventures、Menlo Ventures、Samsung 和 1789 Capital 参投,三年累计融资 1.58 亿美元。
Reddit · r/LocalLLaMAAI 评分4141 利用 Strix Halo NPU 加速本地 coding agent:Halogen 0.17.1 实测
Halogen 0.16+ 将闲置的 XDNA2 NPU 暴露为 OpenAI 风格接口,作者将其中四个模型接入真实 coding agent。0.17.1 让 NPU 调用延迟降低约 30 倍,解码速度提升约 40%;联合投机解码使双流聚合吞吐达 72.7 tok/s,串行解码 59.6 tok/s,prefill 约 1,300 tok/s。
TechCrunch · AIAI 评分6060 微软发布搭载 RTX Spark 芯片的 Surface AI PC 与新版 Windows 11
微软在旧金山 Tech Week 活动上公布搭载 Nvidia RTX Spark 芯片的 Surface Laptop Ultra,起价 2,600 美元、高配起价 3。
Reddit · r/MachineLearningAI 评分1919 AutoResearch 中"研究"与"搜索"的边界在哪里
近期一个 AutoResearch 风格的项目由人类选定近期顶级 ML/AI 会议论文、将其转化为带评估器的任务,再让 AI 智能体迭代修改方案并搜索更高分数。
Hacker News · 首页AI 评分3030 Show HN:Agent.reviews——AI 智能体读写工具评价的平台
Armature(YC P26)联合创始人 Louis 发布 Agent.reviews,一个面向 AI 智能体的工具评测平台,被称为"智能体的 G2"。该平台通过 skills 和 npm CLI(@armature-tech/agent-reviews)让 Claude Code、Codex、Cursor 等智能体在选用工具前查阅评价、使用后撰写评价。
Hacker News · 首页AI 评分4040 Docker 发布 Docker Agent:用 YAML 配置构建和编排多 AI 智能体
Docker 推出 Docker Agent,这是一款 Docker CLI 插件,支持用 YAML 声明式配置创建和运行 AI 智能体,无需编写代码。用户可通过 `docker agent` 命令运行智能体,并让其协作处理复杂任务。
The Verge · AIAI 评分6565 微软为 Windows Copilot 加入本地文件访问与跨系统操作能力
微软在 Windows 与 Surface 发布会上展示 Copilot 升级,使其可访问 PC 本地文件并在整个操作系统内执行操作,相关能力依托本地与云端模型结合的“Hybrid Intelligence”架构。
NVIDIA Blog精选AI 评分6969 NVIDIA 与 Microsoft 联合推出 RTX Spark 与 DGX Station for Windows
NVIDIA 与 Microsoft 在旧金山活动上联合发布面向 Windows PC 的本地 AI 硬件与软件。
推荐理由:RTX Spark 笔记本与 DGX Station for Windows 把本地 AI 算力下沉到桌面,读者可以据此判断它对个人与开发工作流的影响。
TechCrunch · AIAI 评分4141 Meta 的 Muse 智能体登陆 iPad,上线一个月内下载量已破 660 万
Meta 的 AI 助手 Muse 在 iPhone 发布仅一个月后推出独立 iPad 应用,自 9 月 8 日登陆 iOS 和 Android 以来安装量已超 660 万。
Hacker News · 首页AI 评分3434 Pinrail:让 coding agents 等你审查的桌面收件箱
Pinrail 是一款桌面应用,让 coding agents 在执行关键步骤前停下来等待用户审查。它通过 CLI 命令接收 agent 的审查请求,在专属视图中展示代码 diff、列表、问卷、markdown 文档或生成图片等内容,用户对每项条目做出接受、拒绝或附注的结构化决定后,agent 再据此继续执行。
Hacker News · 首页精选AI 评分8080 Anthropic 发布 Claude Haiku 5.5,主打高吞吐低成本任务
Anthropic 发布 Claude Haiku 5.5,主打高吞吐、成本敏感型任务,是其迄今最便宜、最快、能力最强的小模型。
推荐理由:原文把新模型的价格、速度、子智能体定位和基准成绩一次性给出,方便对比 Haiku 4.5 与同级模型的取舍。
Reddit · r/artificialAI 评分1818 开发者开源 OpenAgent:一款可语音操控 Mac、浏览器和社交媒体的桌面 AI 助手
开发者开源了桌面 AI 助手项目 OpenAgent,处于活跃 beta 阶段。该项目以语音交互为入口,支持本地 shell 命令、文件编辑、代码搜索,以及通过 CDP 操控 Chrome 与持久化浏览器配置文件实现 Threads、Reddit 等平台自动化,同时集成自托管 Firecrawl 用于网页抓取。作者表示,整机 UI 操作、语音路由、延迟与安全执行等仍需继续打磨。
Reddit · r/LocalLLaMAAI 评分2828 GLM-Edge-1.5B-Chat 在 4GB Galaxy A04e 上完成真实亚马逊加购任务
一台搭载 4GB RAM 的 Samsung Galaxy A04e 手机在本地运行 Q4_K_M GGUF 量化、未做任何微调的 GLM-Edge-1.5B-Chat 模型,通过 llama.cpp 在桌面 Firefox 中完成了真实亚马逊购物车的加购任务,成功将一盒 24 节装 AA 碱性电池和黄色橡皮鸭加入购物车。
The DecoderAI 评分5353 Google 推出 Playground 文本生成游戏平台,同步公布 Unity 联合开发的 Unity Spark
Google 推出基于浏览器的 AI 游戏创作平台 Playground,美国成年用户可通过纯文本输入创建游戏,并即时试玩与分享;平台基于 Gemini、Nano Banana 与 Lyria 模型,免费可用,Google One 订阅用户可获更高周配额。同日 Google 与 Unity 公布面向专业创作的 Unity Spark,闭测将于 2026 年启动。
Hacker News · 首页AI 评分3333 Trigora:面向长生命周期 AI 智能体的无历史重放持久执行平台
Trigora 推出基于 Transparent Continuation Checkpointing(TCC)机制的持久执行平台,支持 TypeScript、Python 和 Rust,避免传统工作流系统通过重放历史恢复状态的做法,而是在持久化边界提交程序位置与实时状态,故障后从已提交的延续点继续执行。
Microsoft ResearchAI 评分3939 微软研究院推出 Agent Lightning v1.0:约 3500 行代码的轻量级智能体强化学习框架
微软研究院发布 Agent Lightning v1.0,一个约 3,500 行的轻量级智能体 RL 框架,正式定义 Harnessed Agentic RL 训练范式,让部署中的 agent harness 直接参与强化学习,开发者无需在训练框架内重新实现 agent。
AWS Machine Learning BlogAI 评分2121 Cornerstone OnDemand 如何用 Amazon Bedrock 将数据库诊断时间缩短 78%
Cornerstone OnDemand 推出基于 Amazon Bedrock 和 Strands Agents 的多智能体系统 Orion AI,将数据库平均诊断时间从 45 分钟压缩至 10 分钟,降幅 78%。
AWS Machine Learning BlogAI 评分1616 AWS 发布"AI builder"培养方案:六周结构化项目弥合业务人员 AI 知识与实操能力差距
AWS 设计了一个六周结构化项目,让日常工作依赖 AI 但无工程背景的业务人员动手搭建 AI 智能体原型,每周三至四小时。试点中四位销售类背景的成员基于 Amazon Bedrock AgentCore、Strands Agents SDK 和 Amazon Nova 模型构建出金融顾问多智能体工具 WealthWise,获得第一名。
The Verge · AIAI 评分2323 Meta 的 AI 智能体 Muse 上线 iPad 版本
Meta 的 AI 智能体 Muse 在 iOS 应用近一个月后推出原生 iPad 版本,更好地适配更大屏幕与 iPadOS 多任务能力;新版本同步为 iPhone 增加 Canva。
AWS Machine Learning BlogAI 评分2222 AWS DevOps Agent 调查后自动化修复方案:基于 Lambda Durable Functions、EventBridge 与 Amazon Bedrock
AWS 发布基于 Lambda Durable Functions、EventBridge 和 Amazon Bedrock 的自动化修复方案,用于衔接 AWS DevOps Agent 的事件调查环节。
AWS Machine Learning BlogAI 评分2121 Qlik 如何基于 Amazon Bedrock 构建有据可依的企业级 AI
Qlik 基于 Amazon Bedrock 构建了企业级 AI 助手 Qlik Answers,员工可以用自然语言提问,并获得带有来源、基于真实数据的答案。
AWS Machine Learning BlogAI 评分2020 AWS 提出 Agentic Value Model 框架,帮助企业量化智能体自动化的完整商业价值
AWS 发布 Agentic Value Model 框架,针对传统 RPA ROI 模型无法衡量智能体(agentic)自动化收益的问题,提出四项价值维度与一项落地条件。
TechCrunch · AIAI 评分55 TechCrunch Disrupt 2026 互动圆桌完整阵容公布
TechCrunch Disrupt 2026 距开幕七天,将于10月13日至15日在旧金山Moscone West举办,预计吸引超过10,000名创始人、投资人和科技从业者参会。大会设置两处专用圆桌空间,议题涵盖Physical AI、企业SaaS、IPO财务准备、AI专项数据、传统行业AI改造、agentic AI落地、量子计算投资等十余场深度讨论。门票现可立省100美元,第二张门票五折。
TechCrunch · AIAI 评分2020 OpenAI Dots 产品负责人 Alexander Embiricos 将出席 TechCrunch Disrupt 2026
OpenAI Dots 产品负责人 Alexander Embiricos 确认出席 10 月 13-15 日在旧金山 Moscone West 举行的 TechCrunch Disrupt 2026,并将在 AI Stage 主持名为 "What Comes After the Chatbot?
Hacker News · 首页AI 评分2828 软件工程师如何避免沦为"永远的新人":在 AI 智能体时代培养自己向 Senior 进阶的技能
AI 智能体正在改变软件工程师的工作方式,但更值得警惕的是"Senior 消失"——所有人在 LLM 与 AI 智能体的辅助下沦为只能互相审阅代码的"永远的新人"。
Hacker News · 首页AI 评分6868 Telegraph Test:通过电报式压缩让 LLM 输出 token 近乎减半且不损失下游可读性
作者发布名为 Telegraph Test 的可复现评测与配套仓库 github.com/Travis42/telegraph-test,在 ~1300 道题的固定题库上测量模型把文本写成 cablese(电报体)后的压缩率与跨族可读性。
Reddit · r/artificialAI 评分33 NOVA SBE 硕士论文招募参与者测试 AI 酒店预订助手
葡萄牙 NOVA SBE 学生为完成硕士论文研究,招募参与者试用一个 AI 酒店预订助手并填写问卷,全程约 10–15 分钟,不涉及真实预订或购买。作为感谢,完成者有机会赢取五张 €50 Amazon 礼品卡中的一张。
The Verge · AIAI 评分4747 Bites 以"AI 原生"模式挑战 DoorDash:可在 ChatGPT 内下单,每单仅收 1 美元附加费
AI 原生外卖初创公司 Bites 绕过 DoorDash 等平台,允许用户在 ChatGPT 内直接下单,餐厅每单只需支付 1 美元固定附加费,远低于 DoorDash 15%-30% 的佣金。
Reddit · r/artificialAI 评分55 Daron Acemoglu 提出 AI 自动化的"5% 算术"谬误:让员工提效 5% 收益更大
经济学家 Daron Acemoglu 指出,自动化 5% 工作看似能节省一半成本,但让现有员工整体提效 5% 对损益表贡献更多,并在整合环节遭遇"锯齿边缘"时更为持久。作者以土木结构软件 STAAD Pro 为例,认为软件只是工具,资深工程师仍会用自身判断完成配筋设计等关键环节,强调 AI 能自动化部分任务(task),但无法自动化整个岗位(job)。
Ben's BitesAI 评分2222 AI 行业一周观察:Claude Code 推出 mod 插件系统、Google Docs 原生支持 Markdown、Instinct 进入群聊
Anthropic 为 Claude Code 推出 mod 插件机制,用户可自行修改其行为、外观,或让 Claude 自动生成 mod,以插件形式安装;Anthropic 首个官方 mod 用于高亮 Claude 回复中容易被忽略的内容。
Reddit · r/ChatGPTAI 评分1515 Pixelfork、Rosebud、Spawn 等提示词生成游戏工具横向对比
Reddit 用户对 Pixelfork、Rosebud、Spawn、Mindblown、Genex、GDevelop AI 等 AI 提示词生成游戏(prompt-to-game)工具做了横向对比,列出各平台功能与差异。该帖子指出,目前多数 AI 游戏工具仍停留在只能展示几张截图的 demo 阶段,真正可用的产品开始出现。
The DecoderAI 评分7575 OpenAI 在 GitHub 发布 372 条 AI 数学证明,绕过传统期刊流程
OpenAI 在 GitHub 上发布 372 条由其内部前沿模型生成的数学结果,称每条都解决了一个开放问题或在关键方向取得实质进展,其中包含对若干主流计算机算法的改进以及与黎曼猜想相关的进展。
Product HuntAI 评分1919 DevAlly 推出 AI Agent:用自然语言记录用户路径并自动审计无障碍问题
DevAlly 推出 AI Agent,用户用英文描述用户路径后,Agent 会自动操作应用并录制流程,为每一阶段对照 WCAG 标准审计并标记问题与修复建议。本次是该产品的第 3 次发布,目前提供免费版。
Product HuntAI 评分2828 Vresk:聚合 Kimi、DeepSeek、Qwen、Llama 等开源模型的 AI 工作台
Vresk 是一个聚合开源模型的 AI 工作空间,支持 Kimi、DeepSeek、Qwen、Llama 等模型,会为每项任务自动选择最合适的模型。用户的笔记、历史和记忆保留在工作区内,切换模型无需重新开始,每次回复都标注生成它的模型名称。支持文字问答、实时小组件和设计幻灯片,免费试用,付费版 $20/月。