跳到正文

#图像生成

今日 5 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
今天10月8日周四
  1. Reddit · r/ChatGPT19

    用 GPT Image 2.5 将普通照片转化为"第二世界"海报的提示词指南

    用户分享了一套基于 GPT Image 2.5 的提示词,可将任意上传照片生成一张"第二世界"竖版海报:上半保留原照主体、姿态与光线,下半以暖米色纸张延续同一结构(如道路、倒影或光线)并加入对应的纸艺互动场景,使两半形成连续画面。该提示词还规定可加入 0–3 个黑色线条小人以及一句手写英文短标题,但禁止脱离原图的插画、水印或装饰。

  2. Simon Willison5

    Ben Affleck 谈 VFX 工作流:从卷积神经网络到 Transformer 的早期实践

    演员 Ben Affleck 在访谈中谈及他从模拟胶片过渡到数字制作时接触计算机的经历,并解释了自己如何用 Python 脚本配合卷积神经网络处理 VFX 中的张量数据,进行边缘检测与特征提取以完成绿幕抠像。他将卷积神经网络视为 Transformer 的前身,指出 Transformer 能同时进行更多并行计算。

  3. Reddit · r/artificial4

    一则 Reddit 用户与 ChatGPT 的"为什么鸡要过马路"图像生成经历:从 1847 年反笑话到 AI 版权拦截、再到意外生成的狐狸

    一位 Reddit 用户为重述"鸡为什么要过马路"这个 1847 年反笑话,让 ChatGPT 生成一幅类似 Road Runner 的图像,反复被版权拦截,最终只得到一只拿箭的狐狸站在鸡旁边。该笑话最早出现在 1847 年 The Knickerbocker 杂志,作者不明。帖子发布于 r/OpenAI 和 r/artificial 后引发讨论。

10月7日周三
  1. Reddit · r/LocalLLaMA27

    EmbeddingGemma 2 的图像-文本检索借助 ruNNtime WebGPU 推理库实现浏览器端运行

    EmbeddingGemma 2 将图像和文本映射到同一个 768 维向量空间,支持以文字描述检索图片。开发者将其文本塔与视觉塔移植到 TypeScript 写的 WebGPU 推理库 ruNNtime,并在浏览器中用本地 GPU 完成完整检索流程,原始数据无需上传服务器。ruNNtime 同时兼容多种类视觉模型,可在交互式文档里直接体验。

  2. Product Hunt47

    Google 发布图像模型 Nano Banana 2.1,支持遮罩编辑与多分辨率 Search grounding

    Google 今日推出图像生成与编辑模型 Nano Banana 2.1,主打更清晰的设计感、基于遮罩的编辑能力、更强的主体一致性以及更自然的成像效果。该模型还优化了文字渲染与多轮一致性,并支持 1K、2K 和 4K 分辨率的 Search grounding。用户可在 Google AI Studio、Gemini 应用、Gemini API 和 Google Cloud 中试用。

10月6日周二
  1. Reddit · r/MachineLearning21

    ZhemaIsmayil 曾用神经网络为每个字体生成嵌入向量并以 tSNE 可视化,意外得到花朵状结构

    一名开发者用预训练神经网络为每个字体的字符生成嵌入向量,再用 tSNE 把降维后的嵌入映射为 XYZ 和 RGB 通道并以点云可视化,使视觉相近的字体在位置和颜色上自然聚集。在 Google Fonts 语料上,该可视化呈现出花朵形状,大多数手写体字体集中于花蕊区域。作者另在其字体检索网站上提供了基于全部可搜索字体的类似可视化。

10月5日周一
10月4日周日
  1. Hacker News · 首页28

    用 Claude 自动化 35mm 胶片扫描流水线:从驱动扫描仪到负片转正、去尘与编辑

    摄影爱好者 Shan 用 Claude 接管了 35mm 胶片扫描流水线:先用 SANE 驱动扫描仪因方向反转险些损坏机械,改为在 VueScan 扫描后交接给 Claude 处理后续环节。Claude 通过 numpy 做负片密度反转并以片卷空白段为基准统一色彩,再用图像分析定位灰尘、用 LaMa 模型填补并从邻近颗粒补回细节,使原本每卷 36 张需约 4 小时的流程被自动化。

  2. Reddit · r/ChatGPT33

    Oscilloscope Diffusion 发布:用扩散模型重新诠释视频纹理与视觉语言

    Oscilloscope Diffusion 是一种通过扩散模型干预现有视频的新方法,可将抽象几何结构转化为折纸、建筑、文艺复兴绘画等不同风格。项目基于 TouchDesigner 音频响应几何系统开发,已更新至 v1.2 版本。用户可选择视频来源、描述处理方式并通过提示词、LoRAs 和可编辑时间线控制结果。目前在 Uisato Studio 可用,即将开源。

10月3日周六
9月29日周二
  1. AWS Machine Learning Blog48

    如何在 SageMaker AI 上用 vLLM-Omni 生成图像和视频(下篇)

    在 Amazon SageMaker AI 上使用 vLLM-Omni 容器部署两个端点,通过文本提示词生成静态图像(FLUX.2-klein-4B 实时端点),再将该图像作为条件输入生成视频(Wan2.1-VACE-1.3B 异步端点)。图像直接返回,视频生成完成后从 Amazon S3 检索 MP4 文件,示例包含命令行工作流和 Streamlit 界面。

9月23日周三
  1. Product Hunt · AI 分类13

    Ari Helper 7 上线,新增 Photo Studio、Film Studio 与 OpenAI 兼容私有服务器

    Ari Helper 7 是面向 iPhone、iPad、Mac 和 Apple Watch 的私有 AI 助手,本次更新新增 Photo Studio(修复、降噪、上色、4x 放大,支持端侧及相册内运行)、Film Studio(逐镜头影片与视频修复)、可提问的实时摄像头、端侧图像生成,以及用户自建的 OpenAI 兼容服务器。

2月27日周五
2月24日周二
  1. Replicate Blog76

    如何提示 Seedream 5.0

    Replicate 团队测试了字节跳动的 Seedream 5.0 图像生成模型,总结了多项关键能力:基于示例的编辑可通过提供前后对比图让模型学习并迁移视觉变换;可理解物理机械结构并生成正确细节;支持多步骤推理和多图像输入;精确遵循复杂指令;具备专业领域知识如建筑可视化、科学插图、营养标注;文本渲染准确且支持多语言;支持批量生成风格一致的多张图像。

    推荐理由:原文通过多个实际案例展示了 Seedream 5.0 的核心能力,读者可据此了解模型的实际表现并迁移到自己的使用场景。

2月18日周三
  1. Replicate Blog74

    Recraft V4:具有设计感的图像生成模型

    Recraft 发布 V4 图像生成模型,强调“设计感”——模型在构图、光照、色彩上做出有意的视觉决策。提供四个版本:Raster(WebP)约1024px/10秒/$0.04、Pro Raster约2048px/28秒/$0.25、SVG标准版15秒/$0.08、Pro SVG高清版30秒/$0.30。

1月10日周六
  1. Berkeley AI Research43

    信息驱动的成像系统设计

    研究团队开发了一个基于互信息的成像系统直接评估与优化框架,可在不依赖具体任务解码器的情况下量化测量区分物体的信息量。该框架在彩色摄影、射电天文学、无透镜成像和显微镜四个领域验证,信息估计可准确预测下游任务性能。优化该信息指标可产生与端到端神经网络方法相当的设计结果,同时显著降低内存和计算需求。

11月25日周二
  1. Replicate Blog72

    Black Forest Labs 发布 FLUX.2 图像生成模型,可在 Replicate 运行

    Black Forest Labs 发布 FLUX.2 图像生成模型,包含 pro、flex、dev 三种变体。FLUX.2 在图像质量、编辑能力和企业级效率方面有显著提升,支持多参考(最多8张图)保持角色一致性,可生成4MP分辨率的逼真细节,提升了文字渲染、提示词遵循和世界知识能力。pro 版本生成图像需6秒,dev 版本开源并经 Pruna.ai 优化加速至2.5秒。

11月20日周四
  1. Replicate Blog74

    如何为 Nano Banana Pro 编写提示词

    Nano Banana Pro 是一个图像生成模型,与 Gemini 3 Pro 语言模型集成,具备内置逻辑推理能力,可理解并回答图像中的文本信息,同时保持像素级文本准确性和风格灵活性。模型支持最多 14 张参考图像处理,实现跨图像的角色一致性,并可直接渲染代码。通过 Replicate API 可轻松调用该模型。

11月19日周三
  1. Replicate Blog54

    Retro Diffusion 像素艺术模型上线 Replicate

    Retro Diffusion 发布了一套专门用于网格对齐、限定调色板的像素艺术模型,已在 Replicate 平台上线。提供四种模型:rd-fast 侧重快速生成支持15种风格;rd-plus 提供高质量文本到图像生成;rd-tile 专注图块和图集生成;rd-animation 生成风格一致的动画精灵图。大多数模型支持任意宽高、输入图像、调色板图像、背景移除和无缝平铺。

9月23日周二
7月21日周一
7月16日周三
  1. Replicate Blog44

    FLUX.1 Kontext [dev] 如何使用 TaylorSeer 优化推理速度

    Replicate 详细介绍了 FLUX.1 Kontext [dev] 的 TaylorSeer 优化方法,通过缓存中间图像预测的导数并使用泰勒级数近似来加速图像生成。该方法将扩散模型的推理步骤从约 30 步减少到 10-15 步,同时保持图像质量。TaylorSeer 在生成的首尾步骤计算完整预测,中间步骤使用近似估算,平衡了速度与精度。

6月2日周一
5月22日周四
  1. Replicate Blog71

    Google Imagen 4 现已在 Replicate 开放使用

    Google 最新的旗舰图像生成模型 Imagen 4 现已在 Replicate 平台开放运行,这是预览版本。该模型在精细细节渲染、风格多样性和文字渲染方面有显著提升,并内置了过滤、数据标记和 SynthID 数字水印等安全措施。Replicate 同时预告将推出 Imagen 4 Ultra 和 Veo 3,并已上线 Google 的音乐生成模型 Lyria 2。

5月15日周四
5月7日周三
  1. Replicate Blog73

    Ideogram 3.0 现已在 Replicate 上线

    Ideogram 发布 3.0 版文本到图像模型,现已在 Replicate 平台上线。该模型提供 Turbo、Balanced、Quality 三个版本,分别针对快速迭代、均衡场景和最高画质需求。主要升级包括更强的图像真实感、风格控制、布局生成能力,以及更精准的排版渲染。

3月28日周五
2月7日周五
1月17日周五
  1. Replicate Blog37

    使用 Replicate playground 生成短视频

    Replicate 发布 playground 实验性网页界面,提供类似剪贴簿的 UI 用于测试和比较不同图像/视频模型,并保留实验记录。工作流程分为三步:首先使用 flux-aesthetic-anime 等图像模型生成起始图片,然后通过 minimax/video-01-live 将图片转换为视频,最后利用 zsxkib/mmaudio 模型为视频添加匹配的音乐音效。

12月16日周一