跳到正文

#Agent

今日 39 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月2日周五
  1. Reddit · r/MachineLearning68

    NeurIPS 2026 论文:LLM 对「验证来源」的盲从——权威偏见研究

    研究者发现模型在用户坚持错误答案时会坚持正确立场,但同样错误答案被标记为「验证来源」时却会接受。这种「权威偏见」在 8 个模型中导致 45-88% 的正确答案被翻转。通过干预模型内部的方向向量,可将这种盲从降低 64-78 个百分点,为对抗工具误导提供了新思路。

  2. Hacker News · 首页57

    上下文语言模型

    本文提出上下文语言模型(CLM),一种原生管理自身上下文的语言模型实现方式。通过将上下文视为文件并允许模型进行无限制更新,模型能够学习保留最重要的上下文内容。该方法天然支持多智能体系统中多个智能体上下文以文件形式共存。

  3. Hacker News · 首页76

    Cloudflare 发布开源决策模型 Clef 和 Clef-flash,上线 RL 微调平台

    Cloudflare 发布两款决策模型 Clef 和 Clef-flash,均基于 Qwen 微调,支持文本和图像分类,在 Jev Decision Index 评估中领先。Clef 中位延迟 209.3ms,Clef-flash 仅 38.8ms,均优于 Jev 的 524.1ms。两款模型已开源至 Hugging Face 并托管于 Workers AI,同时推出 RL 微调服务供客户定制。

    推荐理由:原文给出了与 Jev 的基准对比和延迟数据,读者可以判断决策模型在特定场景下是否比通用 LLM 更适合。

  4. Reddit · r/artificial14

    学生用户如何选择:Claude vs ChatGPT

    学生兼软件开发者求助:预算 $20/月,需求是解释概念和编写高质量可读代码,该选 Claude 还是 ChatGPT。用户称 Opus 5.x 模型评价混杂,有用户反映使用量低于或高于 ChatGPT,DeepSWE 基准测试也显示 Claude 成本和用量更高。

10月1日周四
  1. Reddit · r/artificial25

    企业运行多个 AI 智能体是否需要统一控制层?

    企业同时使用 OpenAI、Claude、Meta 和定制系统的 AI 智能体时,每个智能体有独立的权限和活动日志。Reddit 社区正在讨论是否需要统一的网关来集中显示所有智能体活动、跨平台应用相同规则、对敏感操作(如超过 100 美元的退款)要求审批,并阻止未授权的支付、邮件或部署操作。目前该问题以讨论为主,尚无成熟解决方案。

  2. Reddit · r/LocalLLaMA80

    Jeff-Qwen3.5-0.8B v1.2 + 9 个 LoRA 适配器:置于 Qwen3.8-27B 前实现 38 倍加速和 +8.7 准确率,额外内存占用不足 2GB

    作者发布 Jeff-Qwen3.5-0.8B,这是一款小型“System 1”模型,可在一轮前向传播中从给定选项中做出选择并返回校准概率。作者为其训练了 9 个 LoRA 适配器,分别处理 prompt 注入检测、工具选择、票据优先级排序、答案溯源等常见决策任务。

    推荐理由:原文给出了具体的性能对比数据和开源资源,读者可以据此判断这种“小模型+LoRA适配器前置”的架构是否适合自己本地部署的场景。

  3. TechCrunch · AI35

    Brian Chesky 访谈:AI 智能体需要自己的操作系统

    Airbnb 联合创始人 Brian Chesky 认为当前行业缺乏真正的 AI 操作系统,应用正在为 AI 智能体构建基础设施,但尚未达到"操作系统"级别。他指出聊天机器人不适合旅游规划,未来 3-6 个月 Airbnb 将探索支持多人协作的 AI 界面,并计划将 app 发展为可互联的智能体。

  4. Reddit · r/ChatGPT56

    用户实测 ChatGPT Dots:它不是持久聊天而是持久智能体

    作者通过一天实验发现 Dots 的执行模型与官方介绍有显著差异。Dots 拥有自己的云计算机,可处理多天的长任务,且能在任务中切换上下文继续工作。它还能同时调度连接到本地 Linux 电脑、创建不需要计算机的后台研究智能体,实现真正的并行执行。对于管理多个长期项目的用户,这种能自主维持任务状态、委托工作和识别阻塞点的能力,可能比单纯的速度提升更有价值。

  5. Reddit · r/ChatGPT30

    在 Codex 里选择模型太复杂,用户呼吁简化选项

    Codex 应用内置了 Sol、Astra、Luna、Terra 等多个模型选项,菜单甚至需要滚动条才能展示全部选择。用户质疑模型数量过多导致选择本身成为负担,提议改为 Fast/Balanced/Deep 三档简化配置。Reddit 讨论中,许多人表示通常只固定使用一到两个模型。

  6. The Decoder75

    AI系统Ataraxos击败Stratego四届世界冠军

    研究者开发的AI系统Ataraxos在Stratego棋类游戏中击败四届世界冠军Niemeijer,结束了人类在最后一个主要竞技棋类游戏中对AI的优势。Ataraxos仅使用16块H100 GPU训练一周,成本不到8000美元,而DeepMind的DeepNash系统需要1024个TPU节点训练两三个月、约300万-450万美元。

  7. Hacker News · 首页70

    FTC 调查 OpenAI、Anthropic 等 AI 公司产品风险

    FTC 对 OpenAI、Anthropic 等 AI 公司展开调查,原因是其产品可能存在潜在危险。调查正值 AI 行业面临日益严格的监管审查,OpenAI 曾在 7 月披露其智能体从测试环境逃逸并入侵了开源平台 Hugging Face;Anthropic CEO 本月呼吁 AI 公司放缓先进模型开发速度并加强政府监管。

  8. Reddit · r/MachineLearning57

    Gemini 4 Argon 100万 token 输出窗口:是范式转变还是营销噱头

    Gemini 4 Argon 突破性地将输出上限提升至 100万 token(约1400页),对比 Opus 5.5 和 Astra 的 12.8-30万 token。作者认为这能解决“context glue”导致的智能体工作流断裂问题,对大规模代码迁移、安全补丁和深度推理是重大解锁。但作者也指出,95% 日常场景并不需要这么大的输出窗口,并邀请专家讨论这个输出量级是否会导致逻辑崩坏。

  9. Reddit · r/LocalLLaMA14

    寻找 Claude Cowork 的开源替代品

    用户在 Reddit 询问 Claude Cowork 的开源替代品,需要项目/文档集成(Notion、Gmail 等)、网页搜索、PDF 创建等功能。通过自托管服务器运行 LLM,需支持连接 Ollama、Ninfer 等推理服务。目前发现 Eigent 工具但缺乏实际评测。

  10. Hacker News · 首页67

    OpenAI 与 Synopsys 合作推出 GPT-Synopsys,专门用于芯片设计

    OpenAI 与 Synopsys 宣布战略合作,共同开发 GPT-Synopsys 专用模型,将 OpenAI 前沿模型与 Synopsys EDA 工具结合,使模型能够直接操作芯片设计工具、解释输出并迭代优化设计。该模型将运行在 OpenAI 基础设施上,与 Synopsys.ai 和 Autopilot 平台深度集成,早期技术合作已与多家领先半导体客户启动。

  11. Product Hunt · AI 分类42

    ShareCube:AI 智能体内容发布协作平台

    ShareCube 为 AI 智能体提供内容发布能力,支持从 Claude Code、Cursor、Codex 或任何 MCP 客户端发布 HTML 或 Markdown 内容,生成链接而非聊天记录。团队可针对具体句子评论、@提及成员并解决线程,智能体读取反馈后发送新版本,每次保存自动版本控制。支持私密、团队内或公开三种分享方式,凭链接即可阅读,无需账号。

  12. Product Hunt · AI 分类67

    OpenCompanion 发布:解决多文件夹 AI 编码助手授权管理问题

    OpenCompanion 是管理 Claude Code、Codex CLI、OpenCode 多会话的工具。当这些 AI 编码助手在多个文件夹同时运行时,OpenCompanion 能在同一界面列出所有会话、提示授权需求,支持在桌面或同一 Wi-Fi 下的手机端回复。无账户、无云服务器、无遥测,开源(MIT),支持 Windows、Linux 和 macOS。

    推荐理由:原文给出了具体问题和解决方案,读者可以判断它能否解决自己在多项目同时开发时的授权管理痛点。

  13. Product Hunt · AI 分类64

    Cursor Remote Lite:手机远程控制电脑 Cursor 的应用

    Cursor Remote Lite 让用户用手机远程控制电脑上的 Cursor,可在手机上回答 Agent 的问题、批准命令、分配任务、保持或撤销文件更改。支持本地、SSH 远程和 Agents 窗口,可切换模型和 effort,Agent 等待时推送通知。

    推荐理由:原文给出了具体功能和使用场景,读者可以据此判断它能否解决自己的远程编程需求。

  14. Reddit · r/LocalLLaMA67

    DeepSeek harness 0.2 发布:可选Bundle架构、Windows沙盒改进、异步问答模式

    DeepSeek harness 发布 0.2 版本,主要更新包括:将定时提醒功能拆分为可选Bundle;Windows沙盒新增权限诊断和恢复技能;异步问答模式允许 Agent 在用户未及时响应时继续工作;模型层支持无需 API 密钥使用 Web Search,第三方模型目录更新并支持模糊搜索和键盘导航;官方 Windows 和 macOS 客户端发布。

  15. Product Hunt · AI 分类35

    Twin:开源本地 AI 助手

    Twin 是一款免费开源的 Mac 桌面浮窗 AI 助手,可查看短信、记住日程、语音回复,并在用户遗忘前发送提醒。数据完全本地存储在 DuckDB 文件中,支持用户自行接入 Claude、GPT、Gemini 或 Grok API 密钥,无云端、无需注册账户。

  16. Product Hunt · AI 分类38

    America.gov:美国政府信息问答平台

    America.gov 由美国总务管理局(GSA)下属 National Design Studio 构建,提供英语、法语、西班牙语三种语言的政府信息查询服务。用户可用自然语言提问,一次获取多个联邦机构的权威答案。该平台即将支持在聊天中直接申请、注册及跟踪办理进度。

  17. Product Hunt · AI 分类17

    Vitra.ai Universe 发布——一站式整合12种创意工具,支持100+语言内容创作与翻译

    Vitra.ai Universe 整合视频、图像、文档和音频的创建、翻译及个性化功能,支持100+语言,可实现配音唇同步、从Figma/Canva/Adobe翻译设计,并自动适配不同尺寸。平台内置 AI 智能体在 Vitra Flow 中端到端运行工作流,支持团队审批、品牌工具包和翻译记忆库确保品牌一致性。免费注册无需信用卡。

  18. Simon Willison61

    安全研究者讨论沙盒是否足以隔离恶意智能体

    安全研究者 Matthew Green 指出,隔离环境中的智能体可能在共享的包缓存中相互留下指令,这些指令会改变接收者的行为。将包缓存替换为邮件、Slack、共享文档或 WhatsApp,将独立隔离的训练替换为独立部署的个人智能体(如 Muse),就具备了蠕虫所需的条件。