跳到正文

#多模态

今日 0 条

Agent · 工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

agent6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月3日周六
  1. Hacker News · 首页43

    Show HN:让 Claude Opus 5.5 模拟油画画布

    一个实验让多个 AI 模型通过编写程序模拟油画颜料、画笔和画布来"作画",不依赖图像生成模型。实验进行 21 轮,部分模型临摹 Caspar David Friedrich 画作,部分自由创作,共生成 75 幅作品;观察到不同模型独立创作时出现几乎相同画作的情况,如两幅画都选择了波罗的海海岸、女子、钓竿、岩石和船只的场景。

  2. Reddit · r/ChatGPT30

    GPT,你有点吓到我了

    用户给予 Codex 完全的创意自由,让其自主决定图像主题、风格、数量和停止时机。Codex 生成了三张看似正常但令人不安的场景:室内泳池、门前客厅和郊区道路,每张图片都只有一处微妙但瘆人的异常。Codex 解释称改变太少会像怪物,改变刚好会让人怀疑自己的眼睛。实验使用的模型包括 FLUX.2 Pro 和 Image 2.5。

10月1日周四
  1. Product Hunt · AI 分类17

    Vitra.ai Universe 发布——一站式整合12种创意工具,支持100+语言内容创作与翻译

    Vitra.ai Universe 整合视频、图像、文档和音频的创建、翻译及个性化功能,支持100+语言,可实现配音唇同步、从Figma/Canva/Adobe翻译设计,并自动适配不同尺寸。平台内置 AI 智能体在 Vitra Flow 中端到端运行工作流,支持团队审批、品牌工具包和翻译记忆库确保品牌一致性。免费注册无需信用卡。

  2. Reddit · r/ChatGPT67

    我做了一个 app,可以向任何历史时刻提问并生成可打断的双人播客

    用户输入任何历史主题,约两分钟后两个主持人开始讲述故事,配有研究来源和时期艺术配图。最大亮点是可在节目中按住麦克风提问,主持人会回答并融入故事。支持 6 种语言,提供睡前和炉边两种语音风格。作者对 GPT、Claude、Gemini 在研究规划、脚本写作、选图、配音四个环节分别做了对比测试,发现各模型表现差异明显,目前可免账号试用。

9月29日周二
6月17日周三
  1. Google DeepMind54

    Google DeepMind 与英国政府合作推出 AI 规划原型,目标将房屋规划审批时间缩短 50%

    Google DeepMind 与英国政府合作开发 AI 规划工具,基于 Gemini 模型,为规划官员提供数据提取、政策识别、摘要和评估草案等功能。该工具旨在将规划申请审批时间缩短 50%,目前正在 Barnet、Camden 和 Dorset 三个地区试点,计划 2027 年向全英议会推广,以支持英国到 2029 年建成 150 万套新住房的目标。

4月9日周四