跳到正文

#图像生成

今日 0 条

一手 · 工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
10月5日周一
9月29日周二
  1. AWS Machine Learning Blog48

    如何在 SageMaker AI 上用 vLLM-Omni 生成图像和视频(下篇)

    在 Amazon SageMaker AI 上使用 vLLM-Omni 容器部署两个端点,通过文本提示词生成静态图像(FLUX.2-klein-4B 实时端点),再将该图像作为条件输入生成视频(Wan2.1-VACE-1.3B 异步端点)。图像直接返回,视频生成完成后从 Amazon S3 检索 MP4 文件,示例包含命令行工作流和 Streamlit 界面。

2月24日周二
  1. Replicate Blog76

    如何提示 Seedream 5.0

    Replicate 团队测试了字节跳动的 Seedream 5.0 图像生成模型,总结了多项关键能力:基于示例的编辑可通过提供前后对比图让模型学习并迁移视觉变换;可理解物理机械结构并生成正确细节;支持多步骤推理和多图像输入;精确遵循复杂指令;具备专业领域知识如建筑可视化、科学插图、营养标注;文本渲染准确且支持多语言;支持批量生成风格一致的多张图像。

    推荐理由:原文通过多个实际案例展示了 Seedream 5.0 的核心能力,读者可据此了解模型的实际表现并迁移到自己的使用场景。

2月18日周三
  1. Replicate Blog74

    Recraft V4:具有设计感的图像生成模型

    Recraft 发布 V4 图像生成模型,强调“设计感”——模型在构图、光照、色彩上做出有意的视觉决策。提供四个版本:Raster(WebP)约1024px/10秒/$0.04、Pro Raster约2048px/28秒/$0.25、SVG标准版15秒/$0.08、Pro SVG高清版30秒/$0.30。

1月10日周六
  1. Berkeley AI Research43

    信息驱动的成像系统设计

    研究团队开发了一个基于互信息的成像系统直接评估与优化框架,可在不依赖具体任务解码器的情况下量化测量区分物体的信息量。该框架在彩色摄影、射电天文学、无透镜成像和显微镜四个领域验证,信息估计可准确预测下游任务性能。优化该信息指标可产生与端到端神经网络方法相当的设计结果,同时显著降低内存和计算需求。

11月25日周二
  1. Replicate Blog72

    Black Forest Labs 发布 FLUX.2 图像生成模型,可在 Replicate 运行

    Black Forest Labs 发布 FLUX.2 图像生成模型,包含 pro、flex、dev 三种变体。FLUX.2 在图像质量、编辑能力和企业级效率方面有显著提升,支持多参考(最多8张图)保持角色一致性,可生成4MP分辨率的逼真细节,提升了文字渲染、提示词遵循和世界知识能力。pro 版本生成图像需6秒,dev 版本开源并经 Pruna.ai 优化加速至2.5秒。

11月20日周四
  1. Replicate Blog74

    如何为 Nano Banana Pro 编写提示词

    Nano Banana Pro 是一个图像生成模型,与 Gemini 3 Pro 语言模型集成,具备内置逻辑推理能力,可理解并回答图像中的文本信息,同时保持像素级文本准确性和风格灵活性。模型支持最多 14 张参考图像处理,实现跨图像的角色一致性,并可直接渲染代码。通过 Replicate API 可轻松调用该模型。

11月19日周三
  1. Replicate Blog54

    Retro Diffusion 像素艺术模型上线 Replicate

    Retro Diffusion 发布了一套专门用于网格对齐、限定调色板的像素艺术模型,已在 Replicate 平台上线。提供四种模型:rd-fast 侧重快速生成支持15种风格;rd-plus 提供高质量文本到图像生成;rd-tile 专注图块和图集生成;rd-animation 生成风格一致的动画精灵图。大多数模型支持任意宽高、输入图像、调色板图像、背景移除和无缝平铺。

9月23日周二
7月21日周一
7月16日周三
  1. Replicate Blog44

    FLUX.1 Kontext [dev] 如何使用 TaylorSeer 优化推理速度

    Replicate 详细介绍了 FLUX.1 Kontext [dev] 的 TaylorSeer 优化方法,通过缓存中间图像预测的导数并使用泰勒级数近似来加速图像生成。该方法将扩散模型的推理步骤从约 30 步减少到 10-15 步,同时保持图像质量。TaylorSeer 在生成的首尾步骤计算完整预测,中间步骤使用近似估算,平衡了速度与精度。

6月2日周一
5月22日周四
  1. Replicate Blog71

    Google Imagen 4 现已在 Replicate 开放使用

    Google 最新的旗舰图像生成模型 Imagen 4 现已在 Replicate 平台开放运行,这是预览版本。该模型在精细细节渲染、风格多样性和文字渲染方面有显著提升,并内置了过滤、数据标记和 SynthID 数字水印等安全措施。Replicate 同时预告将推出 Imagen 4 Ultra 和 Veo 3,并已上线 Google 的音乐生成模型 Lyria 2。

5月15日周四
5月7日周三
  1. Replicate Blog73

    Ideogram 3.0 现已在 Replicate 上线

    Ideogram 发布 3.0 版文本到图像模型,现已在 Replicate 平台上线。该模型提供 Turbo、Balanced、Quality 三个版本,分别针对快速迭代、均衡场景和最高画质需求。主要升级包括更强的图像真实感、风格控制、布局生成能力,以及更精准的排版渲染。

3月28日周五
2月7日周五
1月17日周五
  1. Replicate Blog37

    使用 Replicate playground 生成短视频

    Replicate 发布 playground 实验性网页界面,提供类似剪贴簿的 UI 用于测试和比较不同图像/视频模型,并保留实验记录。工作流程分为三步:首先使用 flux-aesthetic-anime 等图像模型生成起始图片,然后通过 minimax/video-01-live 将图片转换为视频,最后利用 zsxkib/mmaudio 模型为视频添加匹配的音乐音效。

12月16日周一
11月21日周四
10月22日周二
  1. Replicate Blog80

    Stable Diffusion 3.5 现已在 Replicate 可用

    Stable Diffusion 3.5 在 Replicate 平台发布,提供 Large、Large Turbo 和 Medium 三个变体。Large Turbo 只需 4 步推理即可生成高质量图像,Medium 为 2.5B 参数可运行在消费级 GPU。定价分别为每张图 $0.065、$0.04、$0.035。非商业使用免费,商业使用年收入低于 100 万美元免费。

    推荐理由:原文给出了三个版本的能力差异和具体价格,读者可以据此判断在什么场景下该使用哪个版本以及成本是多少。

  2. Replicate Blog53

    Replicate 合作上线 Ideogram v2 修复功能

    Replicate 合作伙伴 Ideogram 推出 v2 模型的修复(inpainting)功能,提供标准版和 turbo 版两种选择。标准版生成质量更高,turbo 版速度更快。该模型还特别擅长生成文字。用户可通过 Python 或 JavaScript 客户端调用 API,也可直接试用开源的在线 demo。

10月10日周四
10月3日周四
  1. Replicate Blog74

    FLUX1.1 [pro] 发布

    Replicate 上线 Black Forest Labs 的 FLUX1.1 [pro] 模型,图像生成速度提升 6 倍,质量更高,并推出新的 prompt upsampling 功能。原 FLUX.1 [pro] 模型速度翻倍。FLUX1.1 [pro] 价格 $0.04/图,FLUX.1 [pro] 价格 $0.055/图。

9月20日周五
9月9日周一
  1. Replicate Blog34

    如何使用 API 微调 FLUX.1

    本教程展示如何通过 Replicate HTTP API 编程化创建和运行微调后的 FLUX.1 模型。训练需 10-20 张图像,约 20 分钟可完成,费用约 $1.85,使用 Nvidia H100 GPU。支持最少 2 张图像微调,但 10 张以上效果更佳。

8月30日周五
8月23日周五
  1. Replicate Blog26

    Replicate Intelligence #12:FLUX.1 图像生成工具与大脑自我训练研究

    FLUX.1 图像生成模型推出两个新工具:ReFlux 支持多模型无限画布创作,Multi-LoRA Explorer 可单图叠加多个 LoRA 实现复杂风格组合。开源项目 Deep-Live-Cam 实现照片实时换脸到视频。此外,有研究揭示大脑在 REM 睡眠期间会模拟动作与后果,生成合成数据进行自我训练,与 AI 模型训练方式存在相似性。

8月16日周五
8月15日周四
8月9日周五
  1. Replicate Blog29

    Replicate Intelligence #10:FLUX.1 图像模型与 Odyssey Minecraft 智能体框架

    Odyssey 框架发布,赋予 LLaMA-3 模型智能体在 Minecraft 开放世界中的探索能力,包含交互式智能体、技能库和新的开放世界基准。Replicate 平台上的 FLUX.1 [dev] 新增图像到图像转换功能,首周获得近 500 万次预测调用。Streamlit 推出新视频系列,展示如何基于 Replicate 构建 AI 应用。

8月2日周五
  1. Replicate Blog24

    Replicate Intelligence #9:本周开源AI模型动态

    Black Forest Labs发布FLUX.1图像生成模型套件,采用"flow matching"技术,支持高达2百万像素分辨率,分为pro、dev、schnell三个版本。Meta推出SAM 2图像和视频分割模型,零样本能力扩展至视频领域,性能提升3倍。Google发布Gemma 2 2B紧凑语言模型,仅20亿参数但在LMSYS Chatbot Arena超越所有GPT-3.5模型。

  2. Replicate Blog53

    FLUX.1 初印象

    Replicate 官方测试了新的图像生成模型 FLUX.1,发现其使用 flow matching 而非传统 diffusion 方法,在文本渲染精度、光影质感表现和艺术风格理解方面展现出独特优势,生成图像具有一种有机的流动感。

8月1日周四