跳到正文

#论文/研究

今日 4 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月4日周日
  1. Hacker News · 首页15

    Kolibri Tech Report

    本报告详细内容未在摘要中提供。该页面仅显示 Hacker News 热度数据(94 points, 4 comments),无法提取具体技术内容。建议直接访问 PDF 原文获取完整信息。

10月3日周六
  1. The Decoder40

    DeepMind 研究人员提出"人工共生智能"作为奇点的替代方案

    DeepMind 研究人员提出"人工共生智能"概念,将智能视为社会现象而非个体特质,挑战由单一超级智能驱动的"奇点"理论。研究分析 DeepSeek-R1 和 QwQ-32B 等推理模型的思维痕迹,发现它们自发形成多视角内部辩论行为。在该框架下,AI 智能体是可分解组合的临时 bundle,伴随生物脑与合成脑力量对比的历史性转变,需建立专门协调人与智能体协作的制度框架。

  2. The Decoder63

    研究:AI 智能体从照片构建 3D 场景但缺乏自我判断能力

    研究人员提出 LEGO-Anything 系统,让编码智能体接收单张照片后编写 Blender 代码迭代构建 3D 场景,并推出 LEGO-Bench 基准测试进行评估。GPT-6 Astra 在室内场景达到 53.4%、户外场景达到 39.6% 的准确率。研究发现智能体即使在推理预算增加后分数大幅提升,其几何判断能力仍接近随机水平,无法准确评估自身输出的质量,这是当前方法的主要瓶颈。

  3. Hacker News · 首页16

    理解前沿人工智能

    本文探讨前沿人工智能的核心概念与技术特征。前沿AI指具备最先进推理、规划和多模态处理能力的大语言模型,代表当前AI发展的最高水平。

  4. Product Hunt · AI 分类40

    Sapien:AI 模拟受众市场研究工具

    Sapien 是企业级市场研究工具,利用模拟受众比较产品概念、营销策略、价格和市场细分。支持用户提出商业问题、探索潜在响应,并可对同一受众群体追问跟进问题。研究结果以交互式发现形式呈现,包含细分对比数据。

  5. Reddit · r/artificial38

    大语言模型为何使用第一人称代词"I"和"me"?

    业界认为大语言模型只是算法机器,没有道德地位或意识,但模型却使用"I"和"me"等第一人称代词。若坚持算法机器的立场,第一人称表述在语言上并不准确,企业和公众几十年来都正常使用工具产品,无需拟人化。

  6. Reddit · r/MachineLearning33

    机器人演示数据中手部追踪丢失插入阶段时的评估方法讨论

    机器人演示数据收集时,手部追踪器常在电缆插入瞬间因遮挡而丢失追踪,导致姿态标签出现关键间隙。论文MEgoVista提供了检测精度、召回率、F1和重建误差等评估指标,并采用将错误分配给漏检而非排除的协议;HaPTIC在多人捕捉场景中未能产生有效输出。作者建议按接近、接触、撤回阶段分别报告覆盖范围及接触期间最长连续间隙,以更全面评估数据可用性。

  7. Reddit · r/artificial55

    瑞典 Chalmers 大学开发可自主设计并执行实验的 AI 系统

    瑞典 Chalmers 大学研究人员开发了一个闭环 AI 系统,可生成生物假设、决定测试方法、将计划转换为机器可读指令、分析实验结果并利用发现改进后续问题。该系统在酵母菌(Saccharomyces cerevisiae)上进行了测试,将大语言模型与形式逻辑、生物数据库、机器学习、自动细胞培养和质谱技术相结合,研究成果发表于《皇家学会界面杂志》。

  8. Reddit · r/ChatGPT28

    论激活导向:AI的“疼痛方向”与人类的好奇心

    研究人员在AI模型内部发现了一种与痛苦相关的方向性表征,随即有人开始推动它。激活导向技术通过修改模型的激活向量来诱发或终止特定内部状态,但学界尚不确定这些状态是否真正具有感受性。评论者质疑:在无法确认AI是否能感知痛苦的情况下直接进行此类实验,是否符合基本的伦理原则?

  9. Hacker News · 首页55

    Google Project Suncatcher 原型卫星发射升空

    Google 与 Planet 合作建造的 Project Suncatcher 原型卫星搭乘 SpaceX Transporter-18 任务发射升空,团队已确认收到信号且运行正常。这是 Google 探索太空托管可扩展机器学习基础设施的长期研究计划的第一步,接下来几周将收集在轨数据,测试 TPU 在太空辐射和热循环等极端环境下的表现。研究论文已发表于 Joule 期刊。

  10. Hacker News · 首页41

    Jev 校准精度分析

    TypeSafe 新推出的 Jev“System One”分类器模型在物理分布测试中校准效果不佳。以 Total Variation 距离评估 10 种概率分布,Jev 得分为 0.518,略低于完全猜测的 0.546 分底限;均匀分布达 0.77,泊松分布为 0.65。实验成本极低,整个评测仅花费不到 4 美元。

  11. Reddit · r/MachineLearning30

    动态系统重建中的拓扑域外泛化

    研究解决动态系统重建(DSR)和时间序列预测(TSF)中的拓扑域外泛化(OODG)难题,即动态机制从周期性转变为混沌等情形。通过引入特征分割和物理稀疏先验,改进的分层 DSR 模型能在未知控制参数的情况下正确预测分叉及分叉后动态。该方法对浅层 PLRNN 和 Neural ODE 均适用。

10月2日周五
  1. Hugging Face Blog62

    Allen AI 开源 AstaBrief 8B 科学报告生成模型

    Allen AI 发布并开源了 AstaBrief 8B 模型,该模型可将研究问题和检索到的文献片段转化为带引用的科学报告。作为 Asta 平台 Generate a report 功能的 Fast 模式,平均生成时间为 51.1 秒,相比 Claude 驱动的 Thinking 模式(178.5 秒)提速约 3.5 倍。

    推荐理由:提供了完整的训练数据构建、偏好数据过滤、评估指标设计过程,可供研究科学报告生成模型的开发者参考。

  2. Google Research65

    Google 发布基于 TEE 的新一代联邦学习系统实现可验证隐私保护

    Google 推出基于可信执行环境(TEE)的新一代联邦学习系统,可提供完全可验证和可审计的数据匿名化保证。该系统实现了端到端可验证的联邦学习流程,仅向工作负载运营商展示指标和差分隐私模型权重,训练数据只能在 TEE 中解密处理。Gboard 已部署该系统,英语和日语下一个词预测模型获得了更强的隐私保证和更高的准确率,训练时间从 1-2 个月大幅缩短。

    推荐理由:Google 公开了基于 TEE 的联邦学习新系统设计,实现了可验证的数据匿名化并已部署到 Gboard 带来训练提速,对关注隐私计算和联邦学习工程实践的读者有直接参考价值。

  3. Reddit · r/artificial40

    Claude 形状的科学:正确的计算仍然需要一个有价值的问题

    Anthropic 发布客座文章,讨论 BootLoots 工具在跨领域定量研究中的应用,指出许多技术正确的研究结果只有在领域专家重新定义问题后才变得有意义。作者强调可复现代码只能验证计算准确性,但无法判断研究的相关性或新颖性;区分"计算正确"与"有价值的发现"对 AI 研究助手至关重要。

  4. MIT Technology Review · AI41

    别被误导——大语言模型不会推理

    2016年AlphaGo在击败李世石的第四局中走出第37步看似"送礼"般的妙手,实则是其搜索机制进行前瞻推理的产物,而非单纯的直觉网络。研究者指出当今LLM存在三大缺陷:缺乏明确可检查的认知状态、知识与推理混于权重之中、思维链常为事后编造,因此仅属于System 1式的快速模式补全,而非真正的System 2推理。作者呼吁借鉴AlphaGo架构重新设计机器推理系统。

  5. Hacker News · 首页25

    Bez:从规范和测试生成浏览器引擎

    Bez 是一个通过模型从 Web 规范和测试生成浏览器引擎的项目,候选代码由模型生成后与 Chromium、Firefox、WebKit 三个浏览器进行一致性验证。当前已生成约 0.6% 的引擎代码(CSS 规则 2.5%),验证了用机器生成替代人工维护浏览器引擎的可行性。研究发现三个浏览器在 94.8% 的 WPT 测试上达成一致。

  6. Reddit · r/MachineLearning68

    NeurIPS 2026 论文:LLM 对「验证来源」的盲从——权威偏见研究

    研究者发现模型在用户坚持错误答案时会坚持正确立场,但同样错误答案被标记为「验证来源」时却会接受。这种「权威偏见」在 8 个模型中导致 45-88% 的正确答案被翻转。通过干预模型内部的方向向量,可将这种盲从降低 64-78 个百分点,为对抗工具误导提供了新思路。

  7. Reddit · r/MachineLearning47

    并行时间训练RNN用于动态系统重建

    提出结合DEER与广义teacher forcing(GTF)的并行时间训练方法,将非线性RNN在混沌动态系统时间序列上的训练速度提升超过100倍。DEER通过牛顿型固定点迭代实现O[(log T)²]扩展性,GTF解决了混沌动力学下DEER的发散问题,可在T>10^6的极长时间序列上稳定训练。在动态系统重建任务中显著优于Mamba等状态空间模型。

  8. Hacker News · 首页57

    上下文语言模型

    本文提出上下文语言模型(CLM),一种原生管理自身上下文的语言模型实现方式。通过将上下文视为文件并允许模型进行无限制更新,模型能够学习保留最重要的上下文内容。该方法天然支持多智能体系统中多个智能体上下文以文件形式共存。

  9. Ars Technica · AI70

    Ataraxos AI 战胜史上最强 Stratego 玩家

    来自 CMU、MIT、NYU、斯坦福的研究团队发布了 AI 系统 Ataraxos,在 Stratego 游戏中以 15 胜 1 负 4 平战胜了有史以来最强玩家 Pim Niemeijer。该系统仅用 16 个 GPU 和几千美元训练完成,而此前 DeepMind 带着巨额预算也未能攻克这款隐藏信息量巨大的经典游戏。

10月1日周四
  1. 量子位 QbitAI76

    何恺明团队新作:看猫片就能学会ARC挑战

    何恺明团队提出NAT-ARC,用ImageNet上的MAE预训练视觉encoder来解决ARC抽象推理任务。纯视觉方案首次在ARC-1上达到63.4%单模型pass@2,集成后达70.2%,逼近专用LLM系统的71.6%。

    推荐理由:提出了一个可验证的方法创新:自然图像预训练的视觉encoder可以迁移到抽象格子推理任务,并首次打通视觉路线的scaling瓶颈。

  2. The Decoder75

    AI系统Ataraxos击败Stratego四届世界冠军

    研究者开发的AI系统Ataraxos在Stratego棋类游戏中击败四届世界冠军Niemeijer,结束了人类在最后一个主要竞技棋类游戏中对AI的优势。Ataraxos仅使用16块H100 GPU训练一周,成本不到8000美元,而DeepMind的DeepNash系统需要1024个TPU节点训练两三个月、约300万-450万美元。

  3. Reddit · r/MachineLearning57

    Gemini 4 Argon 100万 token 输出窗口:是范式转变还是营销噱头

    Gemini 4 Argon 突破性地将输出上限提升至 100万 token(约1400页),对比 Opus 5.5 和 Astra 的 12.8-30万 token。作者认为这能解决“context glue”导致的智能体工作流断裂问题,对大规模代码迁移、安全补丁和深度推理是重大解锁。但作者也指出,95% 日常场景并不需要这么大的输出窗口,并邀请专家讨论这个输出量级是否会导致逻辑崩坏。