#具身智能
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#具身智能
今日 1 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条Reddit · r/LocalLLaMAAI 评分3030 开发者将 LIBERO 基准移植到 MuJoCo Warp,在单张 700 美元 AMD GPU 上跑通 130 个机器人操控任务
开发者将 LIBERO 机器人操控基准完整移植到 MuJoCo Warp(NVIDIA GPU 仿真框架的 AMD HIP/ROCm 版本),在单张 700 美元的 RX 9070 XT 上以 2。
TechCrunch · AIAI 评分55 TechCrunch Disrupt 2026 互动圆桌完整阵容公布
TechCrunch Disrupt 2026 距开幕七天,将于10月13日至15日在旧金山Moscone West举办,预计吸引超过10,000名创始人、投资人和科技从业者参会。大会设置两处专用圆桌空间,议题涵盖Physical AI、企业SaaS、IPO财务准备、AI专项数据、传统行业AI改造、agentic AI落地、量子计算投资等十余场深度讨论。门票现可立省100美元,第二张门票五折。
TechCrunch · AIAI 评分2626 Tony Fadell 谈第一波 AI 硬件为何失败,以及下一阶段的方向
iPod 之父 Tony Fadell 在 MIT Future Fest 上指出,Rabbit R1、Humane Ai Pin、Limitless pendant 等初代 AI 硬件均因未解决真实痛点而停产,因为全球不足 0.01% 的人真正使用过人类助理,消费者尚不知该如何与 AI 助理建立信任。
Hacker News · 首页AI 评分4141 OpenWAM:面向可组合世界-动作模型的开源框架
OpenWAM 是一个面向机器人操作的世界-动作模型开源框架,将 Wan2.2-5B 视频模型与 2B 动作专家在 Mixture-of-Transformers 架构中结合,预训练使用约 334 万条轨迹、14.64k 小时视频。
Reddit · r/artificialAI 评分1212 sim-to-real 迁移目前在哪类机器人任务上真正可靠?
多数论文在仿真中取得亮眼结果,但真实部署视频仍很少见;Boston Dynamics 等少数团队已在 locomotion 上跑通,杂乱家庭环境中的 manipulation 仍进展有限。讨论认为,差距来源尚不明确,可能涉及传感器噪声、actuator 建模或其他因素。
Reddit · r/artificialAI 评分1111 开源可视化 Agent 画布工具:用涂鸦和标注直接引导 AI 智能体
开发者开源了一款可视化 Agent 画布工具,用户可在工作区中对画面进行指点、涂鸦和注释,直接以视觉方式引导 AI 智能体完成视觉编辑任务。该工具在 fullstack 开发、仿真和机器人场景中均验证可用,开发者认为视觉工具栏和画布注释应成为 Agent 平台的标配高层抽象层,并按领域定制。项目已在 GitHub 开源。
The Rundown AIAI 评分2929 加州叫停 REK 人形机器人格斗,机器人格斗俱乐部被迫停业
加州体育监管机构向旧金山初创公司 Robot Entertainment Kombat(REK)发出停止令,要求其停止人类与 6 英尺人形 EngineAI T800(重命名为 "Rekbot")同笼格斗的活动,理由是该活动属于无批次的拳击或 MMA 赛事;REK 创始人 Cix Liv 将该函公之于众以制造话题。
Product Hunt · AI 分类AI 评分2323 The Sentient World:AI 角色在虚拟岛屿上自主生活的 24 分钟观察项目
The Sentient World 是一个虚拟岛屿项目,AI 角色在其中自主生活,没有人操控或编写对白;它们会感到寒冷、回忆前一天、彼此寻找,并主动向世界请求火、灯笼、独木舟等尚未拥有的事物。所有请求以它们自己的语言公开呈现,岛上一天对应现实 24 分钟,用户只能旁观无法交流。
Reddit · r/LocalLLaMAAI 评分1616 Kolibri-1 演示:直接输出动作概率玩 Breakout,单步推理延迟低于 25ms
用户在未做微调的情况下,让 Aleph__Alpha 的 Kolibri-1 自主游玩 Breakout,仅输出四种动作概率而不生成文本,单次推理延迟约 25ms,并强调该模型采用开源权重。该实验用于检验 Kolibri-1 在结构化输出与约束条件下的能力表现。
The DecoderAI 评分2424 Reka AI 发布全能模型 Rho-1,单一网络处理文本、图像、视频与机器人控制
Reka AI 发布研究预览版全能模型 Rho-1,采用 190 亿参数(19-billion-parameter)单一神经网络,同时处理和生成文本、图像、视频与机器人控制动作,所有模态作为 token 在同一上下文窗口中运行,无需工具调用。模型可实时生成连续视频并即时响应新指令,同一批权重既预测摄像头图像又驱动机器人运动;训练在 320 块 H100 GPU 上历时约三个月完成。
TechCrunch · AIAI 评分3838 Safeworld 出隐身:用仿真评估证明 GenAI 机器人安全性
Carnegie Mellon 大学 Safe AI 实验室负责人 Ding Zhao 联合 Kyle Wong、Simo Rachidi 创立机器人安全公司 Safeworld,今日走出隐身并完成超 1200 万美元种子轮融资,由 Shine Capital 与 a16z Speedrun 领投。
Product Hunt · AI 分类AI 评分4747 Meta 发布 Muse Gadgets 开源硬件工具包
Meta 发布 Muse Gadgets 开源硬件工具包,将 AI 助手 Muse 带入物理世界。支持连接 ESP32、Raspberry Pi 或 Linux 设备至显示器、麦克风、扬声器、按钮、传感器等硬件,可构建口袋 AI 伴侣、电子墨水简报显示器、智能家居控制器等产品。SDK 和固件基于 Apache 2.0 开源许可。
Reddit · r/LocalLLaMAAI 评分5959 Unitree 发布 UnifoLM-WLA-1.0:6B 参数人形机器人模型支持 64 项任务
Unitree 发布 UnifoLM-WLA-1.0,6B 参数,在约 2500 小时真实机器人数据上训练,可完成 64 项任务(10 项全身 + 54 项桌面)。支持并行夹爪和两种灵巧手,空间推理能力优于多数开源模型。架构基于 Qwen3-VL 的 UnifoLM-ER-1,结合光流、VQ-VAE 和 MMDiT,在 Unitree G1 机器人上演示了整理床铺、洗衣服、折叠衣物等任务。
Reddit · r/MachineLearningAI 评分3333 机器人演示数据中手部追踪丢失插入阶段时的评估方法讨论
机器人演示数据收集时,手部追踪器常在电缆插入瞬间因遮挡而丢失追踪,导致姿态标签出现关键间隙。论文MEgoVista提供了检测精度、召回率、F1和重建误差等评估指标,并采用将错误分配给漏检而非排除的协议;HaPTIC在多人捕捉场景中未能产生有效输出。作者建议按接近、接触、撤回阶段分别报告覆盖范围及接触期间最长连续间隙,以更全面评估数据可用性。
Hacker News · 首页AI 评分3636 Figure F.02 机器人退役:施瓦辛格建议熔化,芬兰铸造厂完成最后跳跃
Figure 公司退役 F.02 机器人 fleet,将它们运至芬兰 Imatra 铸造厂训练自主跳跃入 75 吨电弧炉熔化。Arnold Schwarzenegger 提出熔化建议,团队在 24 小时内完成 6 次熔化,金属已运回美国制造成纪念品。
Reddit · r/ChatGPTAI 评分3535 GPT-6 Astra 如何创建可变形模拟物体
GPT-6 Astra 在 RobotGym 中实现了高保真可变形物体模拟,以挤压水瓶为例展示物理仿真能力。水瓶采用 0.3mm PET 壳体,材料参数为 3 GPa 刚度和 55 MPa 屈服强度,通过自定义塑性核使瓶身凹陷后保持形变。模拟包含 32,000 粒子水体,使用 GPU 加速的 Newton VBD solver 计算,在全路径追踪的公寓场景中呈现透明 PET 材质与折射水体效果。
Product HuntAI 评分1111 TwelveLabs 发布 Pegasus 1.6:可将第一人称视频转为机器人训练数据
TwelveLabs 发布 Pegasus 1.6 模型,专为从第一人称视角理解画面,可将 egocentric 及远程操作视频直接转化为带标签和时间戳、可用于机器人训练的标注数据,无需人工标注。模型对实体识别更精确,并能跨分段生成持续一致的元数据。
Ars Technica · AIAI 评分7171 特斯拉员工拒绝训练 Optimus 人形机器人:担心被取代
Tesla 的 Optimus 人形机器人仍需在受控环境中编程执行特定任务,手部传感器不可靠,AI 能力不足以支持通用操作。特斯拉曾让工厂工人穿特制服装记录动作来收集训练数据,但部分工人因“知道机器人最终会取代他们”而抱怨,特斯拉已改由专用团队负责。
Hugging Face BlogAI 评分3939 如何使用 NVIDIA Warp 和 MJWarp 加速机器人模拟与学习工作流
MJWarp 基于 NVIDIA Warp 构建,可将兼容的 MuJoCo 模型带入 GPU 加速的并行模拟规模。文章演示将 SO-101 机械臂从传统 MuJoCo 迁移至最多 2048 个并行 MJWarp 环境,显著提升模拟吞吐量。NVIDIA Warp 提供纯 Python 编写的 GPU 内核,支持自动微分和 PyTorch/JAX 互操作。
NVIDIA Blog精选AI 评分7373 NVIDIA Isaac ROS 5.0 发布,增强 Agent 能力并推进开源机器人开发
NVIDIA 发布 Isaac ROS 5.0,这是一个基于 ROS 的 GPU 加速机器人开发工具包。新版本支持 ROS Lyrical 和 Ubuntu 24.04,引入了新的 agentic 工作流程。
推荐理由:原文给出了具体能力变化(FoundationPose 5.5x 提升、CuMotion 2-5ms 路径规划)和多个合作方集成信息,读者可以据此判断这个版本对机器人开发工作流的具体影响。
The Rundown AIAI 评分4343 半机械蟑螂成为灾区救护员:昆士兰大学为其配备相机和注射器
昆士兰大学工程师将半机械蟑螂升级为"paraborgs",配备相机和远程触发注射器用于灾区救援。测试显示,在距目标15cm范围内注射成功率达95%,完整导航-定位-注射序列成功率为72%。研究人员预计救援蜂群将在5-10年后实现。
Google ResearchAI 评分4848 AgentHands:让XR智能体实现同步手势交互的研究原型
Google Research在CHI 2026发布AgentHands研究原型,使AI智能体能在XR环境中生成与语音同步的手势。该系统将LLM响应中的GestureEvents映射到XR设备的手势动画,通过12人用户研究验证了在植物护理指导、3D打印机操作等场景中,体感交互显著提升空间 grounding 效果。
The Rundown AIAI 评分5858 中国人形机器人百米赛跑超博尔特纪录
北京世界人形机器人运动会上,天宫Ultra以9.39秒跑完100米,超越博尔特9.58秒的人类纪录;荣耀闪电以9.47秒获第二。今年的获胜成绩比去年快2.3倍。同期新闻包括Waymo为无人驾驶汽车定制5nm AI芯片、FDA批准首款自主抽血机器人、MIT升级挖掘机控制器等。
Hugging Face BlogAI 评分5252 使用 Strands Agents、LeRobot 和 Hugging Face Storage Buckets 构建机器人数据流式循环
本文介绍了在 Strands Robots 中构建流式数据循环的完整方案:先用 Robot() 记录演示并同步到 Storage Bucket,再通过 stream_dataset() 流式读取数据直接训练,最后将训练好的 checkpoint 部署到物理机器人。
Google DeepMind精选AI 评分7676 Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能控制
Google DeepMind 发布 Gemini Robotics 2,推出了三个模型:高级 VLA 模型可控制完整人形机器人从脚到指尖的运动,实现灵巧操作如系扣子;ER 2 推理模型可处理多步骤任务并协调多机器人协作;On-Device 2 模型可在几小时内适应全新机器人形态。
推荐理由:原文给出了三个模型的具体能力描述和可用入口,读者可以据此判断 Gemini Robotics 2 与前代及竞品的具体差异。
Hugging Face Blog精选AI 评分7070 NVIDIA 发布 Cosmos-H-Dreams:面向手术机器人的实时生成式模拟器
NVIDIA 发布 Cosmos-H-Dreams,一款实时的、动作条件的手术机器人生成式模拟器。该系统基于 Cosmos-H-Surgical-Simulator,通过师生蒸馏和自强制学习将模型精简为因果few-step模型,并在 FlashDreams 加速库支持下,在单张 RTX PRO 6000 GPU 上实现约 160 FPS 的交互式帧生成。
推荐理由:原文给出了性能数据(160 FPS、单卡运行)和技术实现路径,读者可以据此评估它对手术机器人训练和模拟的实际价值。
Berkeley AI ResearchAI 评分2828 2026 BAIR 毕业生展示:Berkeley AI Research 实验室迎来新一届博士毕业生
Berkeley AI Research (BAIR) Lab 2026 届博士毕业生已开启职业新篇章,研究方向涵盖机器人与具身智能、大语言模型推理、计算机视觉、生成模型、AI 安全、人机交互及 AI for Science 等领域。
Import AIAI 评分4848 NVIDIA ENPIRE:物理机器人自主策略自我改进框架,可完成 99% 成功率精细操作
NVIDIA 研究团队开发 ENPIRE 软件框架,使物理机器人能够像 AI 编码智能体一样进行自主实验和策略优化。系统包含环境模块、策略改进模块、 rollout 模块和进化模块四个核心组件,在 PushT、插针入盒、使用工具剪 zip tie 等精细操作任务上达到 99% 成功率。
Google DeepMindAI 评分4747 Google DeepMind 推出机器人加速器项目,扶持 15 家欧洲初创公司
Google DeepMind Accelerator: Robotics 项目启动,从欧洲选中 15 家早期机器人初创公司加入为期 3 个月的密集指导计划。这些初创公司将获得 Google AI 技术栈、Gemini 机器人模型及 Google DeepMind 和 Google 专家的技术支持,涵盖物流、制造、医疗、气候和高级导航等领域。