跳到正文

交叉发现

今日 215 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月3日周六
  1. Reddit · r/artificial22

    AI 幻觉与可靠性是在改善还是在平台期?

    当前 AI 对普通用户仍存在可靠性限制,幻觉问题导致难以无监督委托任务;最新 ChatGPT 迭代相比前代可靠性的提升并不明显。以 OpenAI 新工具 Dot 为例,预告片惊艳但实际评测仍频繁幻觉。真正的成功考验在于普通用户能否高度自信地委托任务,而非仅作为搜索引擎或翻译工具使用。

  2. Reddit · r/LocalLLaMA54

    TL:面向 LLM 的 token 高效编程语言

    作者创建了 TL,一种面向 LLM 的 token 高效编程语言,通过移除或缩短不必要的语法(如大括号、空格、长变量名)来减少 token 消耗。测试显示可减少 30-60% 的 token,具体取决于代码库。

  3. Reddit · r/LocalLLaMA24

    自托管AI不省钱,但我仍坚持这样做

    作为自托管爱好者,我明知运行本地AI模型的成本高于云端API(如$200/月的Opus 5.5或Astra),仍然选择自托管。主要原因是隐私考量——我永远不会将200GB的邮件、消息和位置历史发送到任何外部API,无论其数据保留政策如何。

  4. Hacker News · 首页55

    Google Project Suncatcher 原型卫星发射升空

    Google 与 Planet 合作建造的 Project Suncatcher 原型卫星搭乘 SpaceX Transporter-18 任务发射升空,团队已确认收到信号且运行正常。这是 Google 探索太空托管可扩展机器学习基础设施的长期研究计划的第一步,接下来几周将收集在轨数据,测试 TPU 在太空辐射和热循环等极端环境下的表现。研究论文已发表于 Joule 期刊。

  5. Hacker News · 首页19

    聊聊中国的社会现实

    Hacker News 上一条关于中国社会现状的讨论帖引发热议,收获 145 点支持率和 144 条评论。帖子内容涉及对中国社会现象的观察与分析,在技术社区引发关于文化和社会议题的讨论。

  6. Hacker News · 首页41

    Jev 校准精度分析

    TypeSafe 新推出的 Jev“System One”分类器模型在物理分布测试中校准效果不佳。以 Total Variation 距离评估 10 种概率分布,Jev 得分为 0.518,略低于完全猜测的 0.546 分底限;均匀分布达 0.77,泊松分布为 0.65。实验成本极低,整个评测仅花费不到 4 美元。

  7. Hacker News · 首页67

    Show HN:在 Pi 中使用所有 Codex 插件连接器

    作者发布了 pi-codex-connector 扩展,允许在任何 Pi 模型中使用已连接的 Codex(ChatGPT)插件,包括 GitHub、Gmail、Google Calendar/Drive、Slack、Linear、Figma 等服务。该扩展通过启动 Codex app-server 并调用其 MCP 服务器工具实现,而非直接使用 Codex 模型。

  8. The Verge · AI58

    OpenAI Dots 智能体评测:企业级软件也能帮你订餐

    OpenAI 发布了名为 Dots 的智能体平台,作者实测发现其定位更偏向企业级生产力工具,而非个人购物助手。该平台需付费 100 美元/月,仅向 Pro 用户开放,能访问 Blender、GIMP 等应用并通过桌面 ChatGPT 控制用户电脑。作者测试了预约安装、订餐、网站设计等任务,发现其在安全检查时经常需要人工介入,但在网站开发和视频剪辑任务上表现出色。

  9. TechCrunch · AI55

    Apple 因 AI 智能体风险收紧 macOS Full Disk Access 控制

    Apple 宣布将加强 macOS 系统中 Full Disk Access 设置的控制,原因是 AI 智能体增加了这一权限级别的风险。该设置本用于备份功能,但目前一些开发者正以可能危及用户的方式使用它,可访问文件、邮件、消息甚至浏览历史。Apple 未来将引入新控制,要求用户必须采取非常明确的操作才能授予应用这种高级别访问权限。

  10. Product Hunt · AI 分类18

    Banger 上线:把自动化邮件营销整合到 ChatGPT、Claude 等 AI 聊天中

    platform_zh-summary: Banger 将自动化 Journeys、营销活动、产品邮件、邮箱与客户回复统一到一个可由 AI 操作的平台,支持从 ChatGPT、Claude 等 AI 应用直接运行 AI 自动构建品牌邮件工作流、测试与翻译邮件并回复客户。免费方案每日可发 100 封邮件,联系人与邮箱数量无限制。

  11. TechCrunch · AI42

    Circuit Breaker Labs 希望让 AI 对青少年(和你)更安全

    Circuit Breaker Labs 创建 AI 智能体模拟不同年龄、背景、语言和文化的人群,对模型进行红队测试,检测其是否能够识别危险的心理伤害互动,日均运行数万至数十万次模拟交互。该公司成立于 2025 年 Startup Battlefield 200 决赛选手,由兄妹创始人 Shirali 和 Arul Nigam 创立,目前仅 5 名员工。

  12. Reddit · r/artificial23

    用户批评 Microsoft Copilot:缺乏 AI 智能体体验,只是套皮聊天机器人

    一名用户在工作中体验 Microsoft Copilot 后批评微软只是简单地将聊天机器人复制粘贴到各类产品中,缺乏整体设计和使用场景思考。该用户认为微软拥有最具潜力的企业级 AI 智能体应用场景,即便使用非前沿模型也能打造特别体验,但当前产品体验甚至不如当年的 Clippy。

  13. Hacker News · 首页43

    Show HN:让 Claude Opus 5.5 模拟油画画布

    一个实验让多个 AI 模型通过编写程序模拟油画颜料、画笔和画布来"作画",不依赖图像生成模型。实验进行 21 轮,部分模型临摹 Caspar David Friedrich 画作,部分自由创作,共生成 75 幅作品;观察到不同模型独立创作时出现几乎相同画作的情况,如两幅画都选择了波罗的海海岸、女子、钓竿、岩石和船只的场景。

  14. Reddit · r/ChatGPT30

    GPT,你有点吓到我了

    用户给予 Codex 完全的创意自由,让其自主决定图像主题、风格、数量和停止时机。Codex 生成了三张看似正常但令人不安的场景:室内泳池、门前客厅和郊区道路,每张图片都只有一处微妙但瘆人的异常。Codex 解释称改变太少会像怪物,改变刚好会让人怀疑自己的眼睛。实验使用的模型包括 FLUX.2 Pro 和 Image 2.5。

  15. MIT Technology Review · AI36

    企业智能的重新定义:自主AI

    2026年全球AI投资预计达2.5万亿美元,同比增长44%,但大多数企业的AI投资导致碎片化问题,各部门数据孤岛阻碍整体决策。报告指出从“AI作为工具”到“AI作为运营模式”的转型,需要重建可访问的数据基础设施、采用可组合架构、解决AI主权问题。流程优先的企业正通过先重新设计流程再选择模型的方式取得领先。