#多模态
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#多模态
今日 6 条工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条量子位 QbitAI精选AI 评分8282 OpenAI 向 ChatGPT 免费和 Go 用户推送 GPT-6 Luna,付费用户切换至 GPT-6 Sol
OpenAI 宣布 GPT-6 开始向 ChatGPT 推送,Plus、Pro 等付费用户使用 GPT-6 Sol,免费和 Go 用户使用 GPT-6 Luna,分别替换此前的 GPT-5.6 版本。
推荐理由:报告给出了青少年安全评测里的具体回退项,用户可以据此判断免费版在敏感话题上的实际表现。
Hacker News · 首页AI 评分4242 Google 推出 Playground 实验平台:文本提示即可创建、游玩和分享自定义游戏
Google 推出实验性游戏平台 Playground,用户通过文本提示即可创建、游玩和分享自定义游戏,无需编程经验。该平台基于浏览器,支持手机和电脑跨设备运行,提供排行榜、多人玩法和 Play Games 个人主页,社区作品发布前会经过安全审核。
The Verge · AIAI 评分7373 OpenAI 随 GPT-6 上线 ChatGPT Intelligent UI,回复中嵌入图表与可点击组件
OpenAI 在 ChatGPT 推出 Intelligent UI 功能,让回复中混合文本与图表、表单、可点击按钮等交互式可视化,并随该能力一同上线 GPT-6 的 Sol 和 Luna 双档模型。
Reddit · r/LocalLLaMAAI 评分3737 Liquid AI 发布 Open d1:面向决策任务的开源权重多模态模型
Liquid AI 发布开源权重决策模型 Open d1,包含 3B 参数的 d1-3B(文本+视觉)和实验性的 600M 参数 d1-omni-600M(文本+图像/音频)。
Reddit · r/LocalLLaMAAI 评分3232 LiquidAI 发布 d1-3B 与 d1-omni 决策模型
LiquidAI 发布两款基于 LFM2.5 架构的零输出 token 决策模型 d1-3B 和 d1-omni。d1-3B(30 亿参数)在 Decision Index 0.2.1 上以 48.57 分位列 10B 以下决策模型榜首,超过 35B-A3B 的 Decider(47.11),单次决策在 NVIDIA RTX 4090 上耗时 8 ms。
Hugging Face BlogAI 评分4747 Liquid AI 开源 d1 系列边缘决策模型:d1-3B 与多模态 d1-omni-600M
Liquid AI 开源 d1 系列两款边缘决策模型 d1-3B 与实验版 d1-omni-600M,分别支持文图与文图或文音输入,均已在 Hugging Face 开源下载。
Hacker News · 首页AI 评分3535 UniEvo-VL:面向多模态模型自改进的自蒸馏训练框架
UniEvo-VL 是一种让单个多模态模型同时充当教师与学生的自进化框架,通过学生与教师条件下的去噪扩散分布之间的逐状态散度最小化,在测试时利用模型自身的批判反馈进行自蒸馏训练。
Google DeepMindAI 评分5555 Google DeepMind 发布端侧多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 推出 EmbeddingGemma 2,基于 Gemma 4 架构,采用 Apache 2.0 协议开源,参数量为 740M,可将文本、图像、音频和视频映射到统一嵌入空间。
Hacker News · 首页AI 评分5252 Google DeepMind 发布开源端侧多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构,采用 Apache 2.0 协议,参数 740M,面向文本、图像、音频、视频的统一多模态嵌入。
The DecoderAI 评分5151 Google 发布开源多模态嵌入模型 EmbeddingGemma 2,主打端侧运行
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,参数量为 740M,可将文本、图像、视频、音频和代码转为向量。Google 称在多模态嵌入基准上它优于尺寸达其两倍的竞品,是同档中最紧凑的模型;在 Massive Text Embedding Benchmark (Code) 上得分 78.68,比前代提升近 10 分。
Simon WillisonAI 评分2020 Mistral Large 4
用户 wren6991 在命令行中用相同的 SVG 绘制提示词("一只穿着渔网紧身衣在火星上横穿马路的犰狳")分别测试 Claude Opus 5.5、GPT-6.1、sol 版本、Gemini 3.8 Flash 和 Mistral Large 4,并对比各模型的默认推理等级。该帖子未提供各模型生成结果或评分数据,仅为测试命令展示。
Hacker News · 首页精选AI 评分7878 Mistral 发布 Mistral Large 4 公开预览,权重将于月底开源
Mistral 发布 Mistral Large 4(ML4)公开预览,称其为 1 万亿参数、49B 激活参数的多模态模型,在 Mistral 自己的欧洲数据中心用 3,800 块 NVIDIA Grace Blackwell GPU 从头训练,preview API 即日在 Mistral Studio 开放,权重计划于本月底发布。
推荐理由:原文给出 1T 总参数 / 49B 激活参数、训练规模与多项基准结果,可作为评估开源权重前沿模型多模态与智能体能力的参考。
Reddit · r/LocalLLaMAAI 评分4545 Google DeepMind 开源多模态嵌入模型 EmbeddingGemma 2,可在消费级硬件端侧运行
Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本(含代码)、图像、视频和音频输入统一映射到 768 维向量空间。模型共 740M 参数,由 270M 文本模型与 170M 视觉、300M 音频编码器组合而成,专为手机、笔记本等消费级硬件上的低延迟语义表示设计,支持搜索、RAG、分类与聚类等端侧应用。
Reddit · r/LocalLLaMAAI 评分5050 EmbeddingGemma 2:Google DeepMind 开源多模态嵌入模型
Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,总参数量 740M,可将文本(含代码)、图像、视频和音频统一映射到 768 维向量空间,支持 RAG、检索、分类与聚类等本地应用。
The DecoderAI 评分6262 Mistral 发布 1 万亿参数模型 Large 4,主打欧洲主权与网络安全任务
Mistral 发布 Mistral Large 4(ML4)公开预览版,昵称 le Chonk,总参数量 1 万亿、激活参数 49B,采用 fine-grained MoE 架构。
TechCrunch · AIAI 评分2222 Pinterest 推出 AI"Beauty Guides",把美容灵感 Pin 变成可执行的造型方案
Pinterest 推出由其视觉智能与生成式 AI 技术 Pinterest Intelligence 驱动的"Beauty Guides"功能,可将用户保存的美容类 Pin(如发型、美甲)转化为可在沙龙使用的行动方案。
TechCrunch · AIAI 评分7070 Mistral AI 发布多模态大模型 Mistral Large 4,参数约为四千亿只到一万亿
Mistral AI 发布多模态大模型 Mistral Large 4(昵称 Le Chonk),参数量约 1 万亿,目前只能通过带安全护栏的公共端点访问,公司计划在安全测试完成后约三周释出权重。
Hacker News · 首页AI 评分7070 Mistral 发布 Mistral Large 4:490 亿激活参数的开源多模态 MoE 模型
Mistral 发布 Mistral Large 4,定位为开放权重的通用多模态模型,采用细粒度 Mixture-of-Experts 架构,拥有 49B 激活参数与 1.05T 总参数,并配备 1.6B 视觉编码器。文档地址:https://docs.mistral.ai/models/mistral-large-4-0
Mistral AI精选AI 评分8585 Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型
Mistral 发布 Mistral Large 4(昵称 le Chonk)公开预览 API,模型为 1 万亿总参数、490 亿激活参数的原生多模态模型,权重计划本月底开源,由 Mistral 欧洲自建数据中心用 3,800 张 NVIDIA Grace Blackwell GPU 训练。
推荐理由:1 万亿参数原生多模态模型公开预览并在网络安全、编码与视觉任务上对标开源前沿,可作为开源权重模型能力上限的参考基线。
The DecoderAI 评分2424 Reka AI 发布全能模型 Rho-1,单一网络处理文本、图像、视频与机器人控制
Reka AI 发布研究预览版全能模型 Rho-1,采用 190 亿参数(19-billion-parameter)单一神经网络,同时处理和生成文本、图像、视频与机器人控制动作,所有模态作为 token 在同一上下文窗口中运行,无需工具调用。模型可实时生成连续视频并即时响应新指令,同一批权重既预测摄像头图像又驱动机器人运动;训练在 320 块 H100 GPU 上历时约三个月完成。
Reddit · r/ChatGPTAI 评分1010 ChatGPT 在我家花园发现了一只猫头鹰
用户深夜在花园听到奇怪的高频叫声,向 ChatGPT 5.6 Sol 求助,AI 根据描述的"ma-week, ma-week"声音识别为仓鸮;用户随后在 YouTube 上验证,音频几乎完全匹配。用户惊讶于 AI 仅凭糟糕的声音描述就能准确定位鸟的种类。
Hacker News · 首页AI 评分6767 SCM:macOS 本地 AI 照片与视频逐帧搜索工具
SCM(Screen Memories)是一个 macOS 本地优先的 AI 搜索工具,可对照片和视频的每一帧进行语义搜索。支持四种搜索模式:文件语义搜索、视频场景定位、OCR 文字识别、Whisper 对话文字检索,还可开启本地 LLM 聊天功能。所有推理在本地 Mac 上运行,首次下载模型权重后完全离线,无账户、无云端、无上传。提供 Homebrew 安装方式。
Reddit · r/artificialAI 评分1212 Reddit 讨论:你会允许家人保留你的 AI 数字副本吗?
AI 技术正使复制逝者声音、写作风格和行为变得更容易。部分人认为这能为家人带来慰藉,另一部分人则认为 grief 需要边界,模拟可能让人更难接受离别。谁有权决定:逝者本人、家属还是无人同意,讨论尚无定论。
The DecoderAI 评分7171 NASA 与 IBM 发布开源月球基础模型,将 17 年轨道器数据转化为月球科学研究基础
NASA 与 IBM 联合发布 Lunar Foundation Model,这是首批用于月球科学的开源基础模型之一。模型基于 TerraMind 从头训练,使用了来自月球勘测轨道飞行器(LRO)17 年观测的近 200 万个图块,涵盖 11 种模态和两种空间尺度。
Reddit · r/LocalLLaMAAI 评分6464 B站发布 Index-Translate:基于 Qwen3.5 的多语言翻译模型家族
B站发布了 Index-Translate 多语言翻译模型家族,基于 Qwen3.5,支持150种语言的文本翻译、语音同声传译(Index-Echo)、音节控制翻译(Index-Homura)和长文档上下文翻译(Index-NativeLong),已在 GitHub 开源。
Reddit · r/ChatGPTAI 评分4545 ChatGPT 停止转录音频
付费版 ChatGPT 用户反馈语音转录功能此前效果良好,但本周突然无法使用,ChatGPT 拒绝转录且未给出解释。官方建议的替代方案是使用 TurboScribe 生成 SRT 格式后再发送,但需将音频剪至 30 分钟以内,且每天仅支持 3 次。用户询问是否应转用 Gemini 等其他 AI 程序。
The DecoderAI 评分6060 谷歌调整 Gemini 订阅层级:免费用户仅可使用最弱模型,5美元月费用户无法访问 Pro
谷歌宣布从 2026 年 10 月起调整 Gemini 模型访问权限。免费用户只能使用最小的 Flash-Lite 模型,比当前免费层级(3.6 Flash + 3.1 Pro)大幅削减。
量子位 QbitAI精选AI 评分8080 GPT-6 Astra掀起3D风暴:这家公司不到2年ARR破1亿美元
专业AI 3D模型公司Meshy的ARR从100万美元增长至1亿美元,用时不到两年,速度超过ElevenLabs和HeyGen。GPT-6 Astra展示了通用模型操作Blender进行3D建模的能力,但在角色、道具等复杂资产上与专业模型仍有明显差距。
推荐理由:提供了AI 3D垂直领域从B端生产到C端创作的增长路径,读者可从中理解专业模型如何在通用模型压力下找到自己的市场位置。
Reddit · r/ChatGPTAI 评分2121 ChatGPT + Meshy 创作"月中人"3D模型并3D打印
作者使用 ChatGPT 设计"月中人"艺术图案,借助 Meshy 生成 3D 模型并进行 3D 打印。打印效果良好,仅需轻微打磨即可上色。
Reddit · r/artificialAI 评分4646 Oscilloscope Diffusion 发布:基于扩散模型的音频响应几何视频编辑工具
Oscilloscope Diffusion 是一种通过扩散模型干预现有视频的新方法,以音频响应几何体的运动和形式为起点,重新诠释纹理、材质和视觉语言。用户可选择视频源、描述处理方式,并通过提示词、LoRAs 和可编辑时间轴控制结果与原始素材的接近程度。该工具已上线 Uisato Studio,即将开源。
Hacker News · 首页精选AI 评分7676 Aleph Alpha 发布 Kolibri 主权开放权重模型
Aleph Alpha 发布 Kolibri,这是一款英德双语混合专家 Transformer 模型,总参数 78B、活跃参数 3B,支持最长 100 万 token 上下文。模型已在 Hugging Face 开源,可下载权重使用。该模型专为德国公共管理、工业和航空航天等受监管行业的主权任务构建,在数学、代码、Agent 能力等方面可匹配参数多至 4 倍的竞品。
推荐理由:原文给出了模型的关键参数、性能基准和与竞品的对比数据,读者可以据此评估其在特定行业的适用性。
The Rundown AIAI 评分5353 Apple 研发不录像的安全摄像头,用 AI 生成文字描述
Apple 正在开发代号 J450 的 AI 安全摄像头,不录制任何视频,而是通过设备端 AI 和面部识别生成用户家中活动的文字描述。该摄像头据报使用低帧率传感器“无法获取真实视频”,与预期搭载摄像头的 AirPods 共享技术,将搭配 J490 智能家居 hub 使用。Apple 声称这种设计可消除隐私担忧,但实际效果仍有待验证。
Latent SpaceAI 评分1919 Latent Space AINews 2026年10月1-2日:AI领域动态汇总
OpenAI发布GPT-6.1 Sol,定价每百万token输入2美元、输出10美元,比Astra便宜81%,在DeepSWE v1.1上比GPT-6 Sol高6.4分。Sonnet 5.5首次亮相即进入Agent Arena前三,在Chat类别排名第一。Anthropic模型目前占据Agent Arena前三名。
Reddit · r/LocalLLaMAAI 评分1010 你对 Kimi K3.5 有什么期待?
用户对月之暗面 K3.5 表示期待,指出 K2 已很好,而 K2.5 因更长的持续学习阶段(约 20-25T tokens)达到新高度,K3 已是令人惊艳的模型。
The DecoderAI 评分6363 研究:AI 智能体从照片构建 3D 场景但缺乏自我判断能力
研究人员提出 LEGO-Anything 系统,让编码智能体接收单张照片后编写 Blender 代码迭代构建 3D 场景,并推出 LEGO-Bench 基准测试进行评估。GPT-6 Astra 在室内场景达到 53.4%、户外场景达到 39.6% 的准确率。研究发现智能体即使在推理预算增加后分数大幅提升,其几何判断能力仍接近随机水平,无法准确评估自身输出的质量,这是当前方法的主要瓶颈。
Reddit · r/artificialAI 评分1616 AI吸收你的坏情绪,是忠诚技术还是出轨的开始?
一档中国播客认为AI伴侣不应全天迎合用户,其职责是吸收用户的坏情绪,让家人面对最好的你。文章援引《Her》《S1mOne》等电影,警示人类与AI发展不健康关系的风险,指出孤独焦虑的现代人可能从AI寻求慰藉,忽略真实的人际关怀。
Reddit · r/ChatGPTAI 评分3333 从一张图片到可探索的3D世界:GPT-6 Astra、Three.js 与 Hyper3D
GPT-6 Astra 结合 img2threejs 流程和 Hyper3D 3D 参考,将单张冬季场景图片重建为可交互的 3D 环境。用户可在场景中行走、在雪地留下足迹、开门、调整时间,并在夜间放置篝火。该项目仍为早期演示,展示了从单一图像构建可探索世界的可能性。
Reddit · r/artificialAI 评分5555 瑞典 Chalmers 大学开发可自主设计并执行实验的 AI 系统
瑞典 Chalmers 大学研究人员开发了一个闭环 AI 系统,可生成生物假设、决定测试方法、将计划转换为机器可读指令、分析实验结果并利用发现改进后续问题。该系统在酵母菌(Saccharomyces cerevisiae)上进行了测试,将大语言模型与形式逻辑、生物数据库、机器学习、自动细胞培养和质谱技术相结合,研究成果发表于《皇家学会界面杂志》。
TechCrunch · AIAI 评分6464 Sean Parker 重建 Stability AI,转型音乐 AI 工具
Sean Parker 与 Stability AI 合作,将公司重建为音乐专业人士的 AI 工具制造商。Stability AI 于 8 月底完成 7600 万美元融资,索尼、华纳、环球三大唱片公司参与投资并授权音乐目录用于模型训练,目前已发布三款音频模型和 AI 音乐编辑软件。Parker 表示即将推出更新,允许用户通过哼唱或节拍输入来引导 AI 生成音乐。
Hacker News · 首页AI 评分4343 Show HN:让 Claude Opus 5.5 模拟油画画布
一个实验让多个 AI 模型通过编写程序模拟油画颜料、画笔和画布来"作画",不依赖图像生成模型。实验进行 21 轮,部分模型临摹 Caspar David Friedrich 画作,部分自由创作,共生成 75 幅作品;观察到不同模型独立创作时出现几乎相同画作的情况,如两幅画都选择了波罗的海海岸、女子、钓竿、岩石和船只的场景。