跳到正文

交叉发现

今日 216 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页
10月3日周六
  1. Hacker News · 首页52

    agent-wow 项目让 GPT-6 Astra 首次玩转魔兽世界

    作者创建了 agent-wow 项目,让使用 GPT-6 Astra 的 Codex 智能体在魔兽世界中完成起始区域所有任务。智能体通过直接与游戏服务器网络协议交互,不依赖视觉或键鼠控制,而是在协议层面工作。它在 40 分钟内以 0 死亡完成了任务,并展现了数据挖掘、寻路和构建协议模块等能力。

  2. Hacker News · 首页23

    AI 让我感到悲伤

    一位自称能从中受益的从业者坦承,看到 AI 新进展时感到绝望,认为提示词编程失去"工艺"感,AI 创业机会已消失,人类创造力正被机器取代。$500k 年薪也未能吸引其加入 AI 公司。转机在于:技术变革迅速,行业终将找到 AI 的恰当定位,期待泡沫破裂后的理性重建。

  3. Hacker News · 首页52

    Mozilla 关闭 Solo AI 网站创建服务

    Mozilla 宣布关闭其 AI 网站创建产品 Solo,所有网站和数据将于 2026 年 11 月 30 日删除。用户需在此前登录下载网站数据(HTML 导出和图片链接 CSV),有 Pro 订阅的用户将获得按比例退款。官方推荐的替代方案包括 Wix、Squarespace、AI 网站构建器 Bolt 和 Lovable。

  4. Hacker News · 首页44

    AI 智能体编程的四个致命问题

    作者列出 AI 智能体编程的四个核心问题:LLM 生成的代码带有"slop"(劣质代码)特性、工程师与代码的疏离感、技能退化以及团队协作的瓦解。这些问题被作者称为"four horsemen"(四骑士),目前尚无解决方案。最新一代模型虽智能但倾向于"无法就业的聪明"而非"令人鼓舞的聪明",AI 编程助手正在削弱工程师的职业投入感。

  5. Hacker News · 首页69

    Supabase 收购 Turso,强化 Agent 数据库基础设施

    Supabase 宣布收购 Turso,后者重建了 Rust 版 SQLite 并创建了单服务器管理百万级数据库的平台。合并后 Supabase 将继续支持 Postgres,Turso 继续支持 SQLite,共同为 Agent 提供数据库即文件的体验,每周可创建超过百万个数据库。

  6. OpenAI News21

    初创公司 GPT-6 模型选择与使用指南

    OpenAI 发布 GPT-6 模型家族使用指南,帮助初创公司学习如何选择合适的 GPT-6 模型、调优推理努力、改进提示词和技能、协调工具以及准备生产工作流。指南涵盖模型选择策略、推理优化技巧和技能配置方法,为企业部署 AI 应用提供实践指导。

  7. AWS Machine Learning Blog72

    Amazon SageMaker AI 多轮强化学习微调搜索智能体实战

    本文介绍如何使用 Amazon SageMaker AI 的多轮强化学习(MTRL)功能微调 Qwen3.6-27B 搜索智能体。作者在四个基准测试上验证了微调效果:WixQA 提升 18.4%、Wands 提升 6%、BrowseComp-Plus 提升 23.7%,同时失败率从 22.89% 降至 0.68%。

    推荐理由:给出了用 MTRL 训练搜索智能体的完整流程和实测数据,读者可以据此判断该方法对自己场景的适用性。

  8. Reddit · r/MachineLearning30

    动态系统重建中的拓扑域外泛化

    研究解决动态系统重建(DSR)和时间序列预测(TSF)中的拓扑域外泛化(OODG)难题,即动态机制从周期性转变为混沌等情形。通过引入特征分割和物理稀疏先验,改进的分层 DSR 模型能在未知控制参数的情况下正确预测分叉及分叉后动态。该方法对浅层 PLRNN 和 Neural ODE 均适用。

10月2日周五
  1. Hugging Face Blog62

    Allen AI 开源 AstaBrief 8B 科学报告生成模型

    Allen AI 发布并开源了 AstaBrief 8B 模型,该模型可将研究问题和检索到的文献片段转化为带引用的科学报告。作为 Asta 平台 Generate a report 功能的 Fast 模式,平均生成时间为 51.1 秒,相比 Claude 驱动的 Thinking 模式(178.5 秒)提速约 3.5 倍。

    推荐理由:提供了完整的训练数据构建、偏好数据过滤、评估指标设计过程,可供研究科学报告生成模型的开发者参考。

  2. TechCrunch · AI32

    TechCrunch Disrupt 2026:Clay 联合创始人 Kareem Amin 谈 GTM 工程师的崛起

    Clay 联合创始人兼 CEO Kareem Amin 将在 TechCrunch Disrupt 2026 上发表演讲,探讨 AI 如何催生 GTM 工程师这一新兴职位。Clay 于 2023 年首创 GTM 工程师角色,现在每月约有 100 个相关职位发布,包括 Cursor、Lovable、Webflow 等公司。Clay 还宣布了 100 万美元奖学金基金用于培养 GTM 工程师。

  3. Reddit · r/ChatGPT64

    Lemma:开源团队 AI 队友构建工具

    开源 AI 工具 Lemma 发布,可让团队构建自己的 AI 队友来处理实际工作,如 VC 审查交易、财务报销审核、制造商支持等。区别于通用个人聊天机器人,Lemma 支持整个团队共享、审批流程、权限控制和规则学习,可通过 Slack、WhatsApp、Telegram、Teams 或邮件访问。付费版 $10,开源版免费。

  4. Google Research65

    Google 发布基于 TEE 的新一代联邦学习系统实现可验证隐私保护

    Google 推出基于可信执行环境(TEE)的新一代联邦学习系统,可提供完全可验证和可审计的数据匿名化保证。该系统实现了端到端可验证的联邦学习流程,仅向工作负载运营商展示指标和差分隐私模型权重,训练数据只能在 TEE 中解密处理。Gboard 已部署该系统,英语和日语下一个词预测模型获得了更强的隐私保证和更高的准确率,训练时间从 1-2 个月大幅缩短。

    推荐理由:Google 公开了基于 TEE 的联邦学习新系统设计,实现了可验证的数据匿名化并已部署到 Gboard 带来训练提速,对关注隐私计算和联邦学习工程实践的读者有直接参考价值。

  5. GitHub Blog · AI & ML39

    AI 正在改变开发者工作:加强这3项技能

    GitHub 指出 AI 时代开发者需掌握三项核心技能:学会引导 AI 智能体而非仅使用 AI 工具;不轻信 AI 首个答案,用第二个模型审查首个模型的输出;利用 AI 节省的时间解决更广泛的工程问题,如理解客户需求和评估技术权衡。随着 AI 承担更多实现工作,技术判断力将成为区分优秀工程师的关键能力。

  6. TechCrunch · AI22

    TechCrunch Disrupt 2026 展位预订仅剩24小时

    TechCrunch Disrupt 2026展会展位预订将于10月2日晚11:59 PT截止。展会定于10月13-15日在旧金山Moscone West举行,预计汇聚10,000+名创始人、投资人和技术领袖。套餐含三天展厅空间、10张团队通行证及Lead Generation工具。

  7. Reddit · r/ChatGPT18

    ChatGPT Work 自开发者大会以来问题频发

    Reddit 用户反馈 ChatGPT Work 自近期开发者大会后出现多个问题:Notion MCP 访问请求被拒绝,切换至 Sol 6.1 或 Astra 6 模型后可暂时解决;PDF 读取功能失效;简单任务耗时从原本几分钟增至 10 分钟以上。用户表示此前使用体验良好,即使未升级至 Opus 5.5。

  8. Reddit · r/ChatGPT29

    GPT-6.1 Sol 评测:改进超出预期

    GPT-6.1 Sol 相比一周前发布的 GPT-6 有了显著改进,作者原本预期是小补丁,但几小时体验后认为对本地工作流已足够好。目前已支持 Work、Codex 和 API,Chat 模式即将推出。

  9. Reddit · r/artificial29

    商业 AI 的价值取决于使用者的专业知识

    AI 是生产力催化剂,但若不知道如何正确使用和检查结果,可能适得其反。没有领域专业知识就无法判断何时该质疑 AI 的建议、何时该补充上下文。以手表估值框架为例,在专业领域可建立有效工作流,但在不熟悉的领域无法识别错误;保持谨慎态度下,AI 可帮你完成 80% 的工作。

  10. Reddit · r/ChatGPT27

    ChatGPT 用户抱怨 DevDay 后问题频发:通知错乱、跨设备不同步、模型质量下滑

    多名用户反映 ChatGPT 在近期 DevDay 后可靠性明显下降,具体问题包括 macOS 通知异常(频繁弹出“Turn complete”提示)、iOS/macOS/web 端同步失效(已删除对话仍显示、最近聊天不更新)、“Error loading conversations”错误频繁出现,以及模型在简单任务上出错率上升、上下文误解和前后矛盾。

  11. Reddit · r/LocalLLaMA41

    CalDec v1 发布:完全开源的个人助手决策模型

    个人开发者发布 CalDec v1,一款完全开源权重的决策模型,专注于本地化、隐私保护的个人助手场景。该模型通过小规模数据集微调开发,尽管作者无专业 ML 背景,但实验结果超出预期,已在特定任务中证明可用性。模型、数据集和训练配方均已开源发布。