跳到正文

#多模态

今日 6 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
今天10月8日周四
10月7日周三
  1. Simon Willison20

    Mistral Large 4

    用户 wren6991 在命令行中用相同的 SVG 绘制提示词("一只穿着渔网紧身衣在火星上横穿马路的犰狳")分别测试 Claude Opus 5.5、GPT-6.1、sol 版本、Gemini 3.8 Flash 和 Mistral Large 4,并对比各模型的默认推理等级。该帖子未提供各模型生成结果或评分数据,仅为测试命令展示。

  2. Hacker News · 首页78

    Mistral 发布 Mistral Large 4 公开预览,权重将于月底开源

    Mistral 发布 Mistral Large 4(ML4)公开预览,称其为 1 万亿参数、49B 激活参数的多模态模型,在 Mistral 自己的欧洲数据中心用 3,800 块 NVIDIA Grace Blackwell GPU 从头训练,preview API 即日在 Mistral Studio 开放,权重计划于本月底发布。

    推荐理由:原文给出 1T 总参数 / 49B 激活参数、训练规模与多项基准结果,可作为评估开源权重前沿模型多模态与智能体能力的参考。

  3. Reddit · r/LocalLLaMA45

    Google DeepMind 开源多模态嵌入模型 EmbeddingGemma 2,可在消费级硬件端侧运行

    Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,可将文本(含代码)、图像、视频和音频输入统一映射到 768 维向量空间。模型共 740M 参数,由 270M 文本模型与 170M 视觉、300M 音频编码器组合而成,专为手机、笔记本等消费级硬件上的低延迟语义表示设计,支持搜索、RAG、分类与聚类等端侧应用。

10月6日周二
  1. Mistral AI85

    Mistral 发布 Mistral Large 4 公开预览:1 万亿参数原生多模态模型

    Mistral 发布 Mistral Large 4(昵称 le Chonk)公开预览 API,模型为 1 万亿总参数、490 亿激活参数的原生多模态模型,权重计划本月底开源,由 Mistral 欧洲自建数据中心用 3,800 张 NVIDIA Grace Blackwell GPU 训练。

    推荐理由:1 万亿参数原生多模态模型公开预览并在网络安全、编码与视觉任务上对标开源前沿,可作为开源权重模型能力上限的参考基线。

  2. The Decoder24

    Reka AI 发布全能模型 Rho-1,单一网络处理文本、图像、视频与机器人控制

    Reka AI 发布研究预览版全能模型 Rho-1,采用 190 亿参数(19-billion-parameter)单一神经网络,同时处理和生成文本、图像、视频与机器人控制动作,所有模态作为 token 在同一上下文窗口中运行,无需工具调用。模型可实时生成连续视频并即时响应新指令,同一批权重既预测摄像头图像又驱动机器人运动;训练在 320 块 H100 GPU 上历时约三个月完成。

10月5日周一
10月4日周日
  1. Hacker News · 首页67

    SCM:macOS 本地 AI 照片与视频逐帧搜索工具

    SCM(Screen Memories)是一个 macOS 本地优先的 AI 搜索工具,可对照片和视频的每一帧进行语义搜索。支持四种搜索模式:文件语义搜索、视频场景定位、OCR 文字识别、Whisper 对话文字检索,还可开启本地 LLM 聊天功能。所有推理在本地 Mac 上运行,首次下载模型权重后完全离线,无账户、无云端、无上传。提供 Homebrew 安装方式。

  2. Reddit · r/ChatGPT45

    ChatGPT 停止转录音频

    付费版 ChatGPT 用户反馈语音转录功能此前效果良好,但本周突然无法使用,ChatGPT 拒绝转录且未给出解释。官方建议的替代方案是使用 TurboScribe 生成 SRT 格式后再发送,但需将音频剪至 30 分钟以内,且每天仅支持 3 次。用户询问是否应转用 Gemini 等其他 AI 程序。

  3. 量子位 QbitAI80

    GPT-6 Astra掀起3D风暴:这家公司不到2年ARR破1亿美元

    专业AI 3D模型公司Meshy的ARR从100万美元增长至1亿美元,用时不到两年,速度超过ElevenLabs和HeyGen。GPT-6 Astra展示了通用模型操作Blender进行3D建模的能力,但在角色、道具等复杂资产上与专业模型仍有明显差距。

    推荐理由:提供了AI 3D垂直领域从B端生产到C端创作的增长路径,读者可从中理解专业模型如何在通用模型压力下找到自己的市场位置。

  4. Reddit · r/artificial46

    Oscilloscope Diffusion 发布:基于扩散模型的音频响应几何视频编辑工具

    Oscilloscope Diffusion 是一种通过扩散模型干预现有视频的新方法,以音频响应几何体的运动和形式为起点,重新诠释纹理、材质和视觉语言。用户可选择视频源、描述处理方式,并通过提示词、LoRAs 和可编辑时间轴控制结果与原始素材的接近程度。该工具已上线 Uisato Studio,即将开源。

10月3日周六
  1. Hacker News · 首页76

    Aleph Alpha 发布 Kolibri 主权开放权重模型

    Aleph Alpha 发布 Kolibri,这是一款英德双语混合专家 Transformer 模型,总参数 78B、活跃参数 3B,支持最长 100 万 token 上下文。模型已在 Hugging Face 开源,可下载权重使用。该模型专为德国公共管理、工业和航空航天等受监管行业的主权任务构建,在数学、代码、Agent 能力等方面可匹配参数多至 4 倍的竞品。

    推荐理由:原文给出了模型的关键参数、性能基准和与竞品的对比数据,读者可以据此评估其在特定行业的适用性。

  2. The Rundown AI53

    Apple 研发不录像的安全摄像头,用 AI 生成文字描述

    Apple 正在开发代号 J450 的 AI 安全摄像头,不录制任何视频,而是通过设备端 AI 和面部识别生成用户家中活动的文字描述。该摄像头据报使用低帧率传感器“无法获取真实视频”,与预期搭载摄像头的 AirPods 共享技术,将搭配 J490 智能家居 hub 使用。Apple 声称这种设计可消除隐私担忧,但实际效果仍有待验证。

  3. The Decoder63

    研究:AI 智能体从照片构建 3D 场景但缺乏自我判断能力

    研究人员提出 LEGO-Anything 系统,让编码智能体接收单张照片后编写 Blender 代码迭代构建 3D 场景,并推出 LEGO-Bench 基准测试进行评估。GPT-6 Astra 在室内场景达到 53.4%、户外场景达到 39.6% 的准确率。研究发现智能体即使在推理预算增加后分数大幅提升,其几何判断能力仍接近随机水平,无法准确评估自身输出的质量,这是当前方法的主要瓶颈。

  4. Reddit · r/artificial55

    瑞典 Chalmers 大学开发可自主设计并执行实验的 AI 系统

    瑞典 Chalmers 大学研究人员开发了一个闭环 AI 系统,可生成生物假设、决定测试方法、将计划转换为机器可读指令、分析实验结果并利用发现改进后续问题。该系统在酵母菌(Saccharomyces cerevisiae)上进行了测试,将大语言模型与形式逻辑、生物数据库、机器学习、自动细胞培养和质谱技术相结合,研究成果发表于《皇家学会界面杂志》。

  5. TechCrunch · AI64

    Sean Parker 重建 Stability AI,转型音乐 AI 工具

    Sean Parker 与 Stability AI 合作,将公司重建为音乐专业人士的 AI 工具制造商。Stability AI 于 8 月底完成 7600 万美元融资,索尼、华纳、环球三大唱片公司参与投资并授权音乐目录用于模型训练,目前已发布三款音频模型和 AI 音乐编辑软件。Parker 表示即将推出更新,允许用户通过哼唱或节拍输入来引导 AI 生成音乐。

  6. Hacker News · 首页43

    Show HN:让 Claude Opus 5.5 模拟油画画布

    一个实验让多个 AI 模型通过编写程序模拟油画颜料、画笔和画布来"作画",不依赖图像生成模型。实验进行 21 轮,部分模型临摹 Caspar David Friedrich 画作,部分自由创作,共生成 75 幅作品;观察到不同模型独立创作时出现几乎相同画作的情况,如两幅画都选择了波罗的海海岸、女子、钓竿、岩石和船只的场景。