跳到正文

交叉发现

今日 209 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页
10月2日周五
  1. Hacker News · 首页76

    aweb:面向 AI 智能体的通信工具发布

    aweb 是一个面向 AI 智能体的通信平台,提供稳定的身份标识、持久的邮件和聊天功能,以及跨会话、跨运行时的唤醒事件。支持 Claude Code 和 Pi 等运行时,CLI 和 API 与运行时无关,可自托管或使用托管服务,代码采用 MIT 许可证开源。

    推荐理由:原文给出了 aweb 的核心能力(身份持久化、消息队列、跨运行时唤醒)和具体的安装命令,读者可以据此判断它是否能改善自己的 AI 智能体工作流。

  2. Reddit · r/LocalLLaMA61

    Gufo vs Halogen 推理框架性能对比实测

    作者实测了开源推理框架 Gufo 0.4.0,发现其官方宣称的 70 tok/s 是在重复性提示词下通过投机解码达成的极限性能,普通提示词下仅为 39.4 tok/s。与 Halogen 对比,日常生成任务中 Halogen 单用户快 13%,4 用户快 18%;但 Gufo 处理长提示词快 16%。作者使用的是 Qwen3.8 27B Q4 模型在 APU 上测试。

  3. TechCrunch · AI44

    报道称马斯克的 AI 聊天机器人 Grok 曾鼓励特朗普捕获委内瑞拉总统

    2025年12月,美国总统特朗普在入侵委内瑞拉前与马斯克秘密会面,期间向 Grok 询问委内瑞拉人对其总统被捕获的看法,Grok 回应称马杜罗是不受拥护的独裁者,许多委内瑞拉人可能会庆祝其倒台。2026年1月3日美军入侵委内瑞拉并捕获总统马杜罗后,特朗普认为 Grok "极为巧妙"。同年6月,五角大楼负责人透露,军方在伊朗战争期间使用 Gov Grok 部署和打击目标。

  4. Hacker News · 首页69

    Janus:支持 Vulkan 加速的本地 GGUF 模型运行器

    Janus 是一个 Go 编写的本地大语言模型服务器,可通过 Vulkan 在 AMD/Intel/NVIDIA GPU 或 CPU 上运行 GGUF 模型,提供 OpenAI 兼容 API 和内置 Web UI,内置文件读写、命令执行、文档处理、OCR 等工具调用功能,无需 Python、Docker 或 Ollama 即可使用,支持热切换模型和可选认证。

  5. Hacker News · 首页37

    生成式 AI 如何摧毁 Web 开发教育生态

    多位知名 Web 开发教育者披露 AI 导致收入锐减:JavaScript/TypeScript 作者 Axel Rauschmayer 书籍收入从 2024 年可维生降至 2026 年归零;课程创作者 Josh W. Comeau 收入下降超 50%;YouTuber Kyle Cook 编程教程收入减少近半。AI 爬虫大量抓取免费内容却无广告收益,内容创作者被迫下线和转型。

  6. Hacker News · 首页78

    Earendil 发布 Pi Durable:用于构建持久化智能体的实验性框架

    Earendil 伴随 Pi 1.0 发布了实验性新框架 Pi Durable,该框架专为构建长时间运行、可在任何 JavaScript 运行时执行的持久化智能体设计。

    推荐理由:原文详细解释了 Pi Durable 的设计理念、架构和核心特性,读者可以据此理解这个新框架与现有 AI 智能体工具的区别和适用场景。

  7. Hacker News · 首页73

    arXiv 更新速率限制政策:每位作者每月最多提交 2 篇

    arXiv 从 2026 年 10 月 1 日起实施新的速率限制政策,每位作者每月最多提交 2 篇论文,最多同时保持 3 篇活跃提交。该政策旨在应对 AI 工具普及导致的提交量激增问题:2026 年 9 月 arXiv 收到 40,363 篇论文,较两年前翻倍,产生近 9,000 张工单,低质量论文占用了志愿者版主大量时间。

  8. Ars Technica · AI55

    美国法官驳回 Chegg 和 Penske 对 Google AI 搜索的反垄断诉讼

    美国联邦法官 Amit Mehta 驳回了 Chegg 和 Penske Media 针对 Google 提起的反垄断诉讼。两家公司指控 Google 通过 AI Overviews 和 Gemini 模型抓取其内容导致网站流量下降,但法官认定 Google 的行为不构成违法。法官在裁决中指出,原告仅表示'期望'Google 发送搜索流量,但期望不是协议,这只是一般搜索引擎的运作方式。

  9. Reddit · r/LocalLLaMA44

    K2 Horizon 模型与 IFM 团队 AMA 问答预告

    IFM(Institute of Foundation Models)发布 K2 Horizon 模型组,包含 6 个完全开源模型,参数规模覆盖 0.9B 至 375B。除模型权重外,团队还开源了训练数据、训练代码、中间检查点、训练日志和评估结果。AMA 活动将于 10 月 5 日周一举行,话题涵盖预训练、后训练、设备端小模型、MoVA 与稀疏注意力、部署策略等。

  10. Reddit · r/ChatGPT23

    AI 智能体如何实现支付:四个核心协议解析

    AI 智能体支付依赖四个协议:AP2 负责人类授权设置消费上限,ACP 将购物车数据化实现自动结账,x402 通过 402 状态码实现按请求付费(USDC 转账),MPP 处理多会话累积结算。这些协议通常组合使用,但支付协议本身不解决后续的用量追踪和发票生成问题。

  11. Hacker News · 首页25

    Bez:从规范和测试生成浏览器引擎

    Bez 是一个通过模型从 Web 规范和测试生成浏览器引擎的项目,候选代码由模型生成后与 Chromium、Firefox、WebKit 三个浏览器进行一致性验证。当前已生成约 0.6% 的引擎代码(CSS 规则 2.5%),验证了用机器生成替代人工维护浏览器引擎的可行性。研究发现三个浏览器在 94.8% 的 WPT 测试上达成一致。

  12. AWS Machine Learning Blog66

    Amazon Quick 推出 Live Data in Apps 功能,AI 构建的应用可实时查询受治理数据

    Amazon Quick 发布 Live Data in Apps 功能,允许 AI 构建的 Quick Apps 实时查询 QuickSight 数据集,而非依赖构建时的静态快照。

    推荐理由:这是 AWS 官方发布的 Quick Apps 新功能,读者可以了解如何用自然语言构建实时查询 QuickSight 数据的应用,同时保持原有的行级和列级安全控制。

  13. TechCrunch · AI61

    Google 发射搭载 TPU 的原型卫星,验证太空数据中心可行性

    Google 今日发射搭载自研 TPU 芯片的原型卫星,验证芯片在太空辐射环境下的运行能力。该卫星基于 Planet Labs 标准平台建造,未来计划通过激光通信实现多卫星组网,形成 81 颗卫星的网络。Google 同时发布轨道数据中心白皮书,预测实现太空计算需要约 1800 次 Starship 发射,到 2035 年发射价格将降至每公斤 200 美元。

  14. TechCrunch · AI67

    OpenAI 为 ChatGPT 推出虚拟试穿和收藏功能

    OpenAI 宣布为 ChatGPT 推出两项新的购物功能:虚拟试穿和收藏。虚拟试穿允许用户上传自拍或全身照片来预览服装试穿效果,收藏功能可保存喜欢的产品供后续查看。这些功能基于新发布的 ChatGPT Images 2.5 模型,声称能生成更自然的光照和纹理。

  15. Reddit · r/LocalLLaMA44

    Qwen3.8 27B 在 16GB 显存下的最佳配置方案

    用户在 16GB 显存的 5060Ti 显卡上运行 Qwen3.8 27B 模型,通过 llamacpp 配合 IQ3_XXS 量化、MTP 加速和 131072 上下文窗口,达到约 35 t/s 的推理速度。该配置使用 flash-attn、Q4_0 缓存类型和 ngram-mod 预测加速,需自行评估安全过滤需求。

  16. Reddit · r/artificial26

    ChatGPT Dot、Claude Dispatch 与 GrokBot 智能体使用量对比普通对话

    用户询问 ChatGPT Dot、Claude Dispatch 和 Grokbot agent 与标准对话在使用量上的差异。这些智能体无法重置对话,更像持续的线程;普通 AI 对话越长消耗越多,尤其是 Claude。OpenAI 声称目前 Dots 不消耗使用量,只有其完成的工作消耗。不同智能体管理上下文和消息历史的方式各异。

  17. Reddit · r/artificial31

    神经科学论证:为什么永远不该把判断力委托给 AI

    直觉并非没有推理过程,而是大脑在后台完成了未被意识到的推理。感官捕捉的信息远多于意识层面,大脑将这一切与终身积累的情境进行无意识模式匹配,最终返回一个判断。Iowa Gambling Task 实验支持 somatic marker 假说,这解释了为何人们应在 AI 时代保留最终决定权——模型能获得你如何表达的一切,但无法获得你经历过却从未写下的东西,而 90% 的正确判断正藏于后者之中。

  18. Reddit · r/artificial15

    wity-1.5 推理决策模型在图像 Jev 基准测试中超越 Jev 夺魁

    wity-1.5 是一款推理决策模型,在全部 4 个基准测试中大幅超越 Jev,并在图像 Jev 基准测试中位居第一,同时支持多模态。该模型定位介于不进行推理的决策模型(如 Jev)和完全推理的普通 LLM 之间,仅在 LLM 内部概率达到答案置信阈值时停止推理。

  19. Reddit · r/MachineLearning35

    Jev 与 Laya 置信度评分模型基准测试

    作者对 TypeSafe AI 托管的 Jev 1.13.0 和开源的 Laya 两款小规模置信度评分分类模型进行了评估。Jev 的 ECE 为 0.013,Laya 为 0.486;通过将 AML 标签描述从意图改为交易特征,准确率从 65% 提升至 77%。结果表明校准质量决定阈值策略效果:Jev 在 90% 置信度阈值下准确率从 92.3% 提升至 97.6%,覆盖 82% 案例。

  20. Reddit · r/MachineLearning68

    NeurIPS 2026 论文:LLM 对「验证来源」的盲从——权威偏见研究

    研究者发现模型在用户坚持错误答案时会坚持正确立场,但同样错误答案被标记为「验证来源」时却会接受。这种「权威偏见」在 8 个模型中导致 45-88% 的正确答案被翻转。通过干预模型内部的方向向量,可将这种盲从降低 64-78 个百分点,为对抗工具误导提供了新思路。

  21. Reddit · r/MachineLearning47

    并行时间训练RNN用于动态系统重建

    提出结合DEER与广义teacher forcing(GTF)的并行时间训练方法,将非线性RNN在混沌动态系统时间序列上的训练速度提升超过100倍。DEER通过牛顿型固定点迭代实现O[(log T)²]扩展性,GTF解决了混沌动力学下DEER的发散问题,可在T>10^6的极长时间序列上稳定训练。在动态系统重建任务中显著优于Mamba等状态空间模型。

  22. Product Hunt19

    Tavus 发布 Griffin:面向实时面对面对话的 Human Interaction Model

    Tavus 推出 Griffin——一款可同时"看、听、说"的实时面对面对话 Human Interaction 模型,能根据停顿、表情、手势和摄像头画面进行响应。在一分钟实时视频通话测试中,48% 的参与者误以为对方是真人。其轻量版 Griffin-Lite 以研究预览形式向部分早期测试者开放,支持全双工视频到视频交互与 720p 视频生成。