#图像生成
跨栏目找相关项:同一话题的工具、提示词、论文,可能横跨数天甚至数月才凑齐。
#图像生成
今日 0 条一手 · 工具·提示词·论文 三栏速览
每栏 6 / 6 · 直达分类页提示词
6 条当用户的某个意图(如last_intent)尚未处理完成时,自动提示用户并继续处理该业务。
写作cloud.baidu.com为电商平台机器人客服提供开场白、常见问题回复和结束语的话术模板参考。
写作insight.xiaoduoai.com智能客服机器人与访客互动的对话模板(欢迎新访客、欢迎回头客、显示常见问题等)。
写作zhuanlan.zhihu.com服装加工合同模板,含甲乙双方信息及加工委托条款
写作xiaobaogong.com用于合同审查场景,让大模型扮演特定行业、特定立场的合同审查专家,平衡利益与风险。
研究blog.csdn.net帮助分析患者症状,提供可能的诊断方向和建议,适用于初步诊断筛查。
研究cgwgpts.com
论文
6 条NVIDIA BlogAI 评分1818 NVIDIA Inception 成员企业用 AI 缩小乳腺癌诊疗断层:从筛查到治疗方案
NVIDIA Inception 计划的多家初创公司正用 AI 工具覆盖乳腺癌诊疗的关键缺口:iSono Health 的 ATUSA 系统在约两分钟内完成单侧乳腺 3D 定量超声扫描。
AWS Machine Learning BlogAI 评分4848 如何在 SageMaker AI 上用 vLLM-Omni 生成图像和视频(下篇)
在 Amazon SageMaker AI 上使用 vLLM-Omni 容器部署两个端点,通过文本提示词生成静态图像(FLUX.2-klein-4B 实时端点),再将该图像作为条件输入生成视频(Wan2.1-VACE-1.3B 异步端点)。图像直接返回,视频生成完成后从 Amazon S3 检索 MP4 文件,示例包含命令行工作流和 Streamlit 界面。
Replicate Blog精选AI 评分7676 如何提示 Seedream 5.0
Replicate 团队测试了字节跳动的 Seedream 5.0 图像生成模型,总结了多项关键能力:基于示例的编辑可通过提供前后对比图让模型学习并迁移视觉变换;可理解物理机械结构并生成正确细节;支持多步骤推理和多图像输入;精确遵循复杂指令;具备专业领域知识如建筑可视化、科学插图、营养标注;文本渲染准确且支持多语言;支持批量生成风格一致的多张图像。
推荐理由:原文通过多个实际案例展示了 Seedream 5.0 的核心能力,读者可据此了解模型的实际表现并迁移到自己的使用场景。
Replicate BlogAI 评分7474 Recraft V4:具有设计感的图像生成模型
Recraft 发布 V4 图像生成模型,强调“设计感”——模型在构图、光照、色彩上做出有意的视觉决策。提供四个版本:Raster(WebP)约1024px/10秒/$0.04、Pro Raster约2048px/28秒/$0.25、SVG标准版15秒/$0.08、Pro SVG高清版30秒/$0.30。
Berkeley AI ResearchAI 评分4343 信息驱动的成像系统设计
研究团队开发了一个基于互信息的成像系统直接评估与优化框架,可在不依赖具体任务解码器的情况下量化测量区分物体的信息量。该框架在彩色摄影、射电天文学、无透镜成像和显微镜四个领域验证,信息估计可准确预测下游任务性能。优化该信息指标可产生与端到端神经网络方法相当的设计结果,同时显著降低内存和计算需求。
Replicate BlogAI 评分7272 Black Forest Labs 发布 FLUX.2 图像生成模型,可在 Replicate 运行
Black Forest Labs 发布 FLUX.2 图像生成模型,包含 pro、flex、dev 三种变体。FLUX.2 在图像质量、编辑能力和企业级效率方面有显著提升,支持多参考(最多8张图)保持角色一致性,可生成4MP分辨率的逼真细节,提升了文字渲染、提示词遵循和世界知识能力。pro 版本生成图像需6秒,dev 版本开源并经 Pruna.ai 优化加速至2.5秒。
Replicate BlogAI 评分7474 如何为 Nano Banana Pro 编写提示词
Nano Banana Pro 是一个图像生成模型,与 Gemini 3 Pro 语言模型集成,具备内置逻辑推理能力,可理解并回答图像中的文本信息,同时保持像素级文本准确性和风格灵活性。模型支持最多 14 张参考图像处理,实现跨图像的角色一致性,并可直接渲染代码。通过 Replicate API 可轻松调用该模型。
Replicate BlogAI 评分5454 Retro Diffusion 像素艺术模型上线 Replicate
Retro Diffusion 发布了一套专门用于网格对齐、限定调色板的像素艺术模型,已在 Replicate 平台上线。提供四种模型:rd-fast 侧重快速生成支持15种风格;rd-plus 提供高质量文本到图像生成;rd-tile 专注图块和图集生成;rd-animation 生成风格一致的动画精灵图。大多数模型支持任意宽高、输入图像、调色板图像、背景移除和无缝平铺。
Replicate BlogAI 评分5858 主流图像编辑模型对比评测
Replicate 对六款主流图像编辑模型进行对比评测,涵盖对象移除、视角转换、背景编辑、文字编辑和风格迁移五项任务。
Replicate BlogAI 评分3737 主流 AI 图像模型角色一致性生成能力对比评测
本文对比了 Replicate 上四款主流 AI 图像模型(gpt-image-1、Gen-4 Image、FLUX.1 Kontext、SeedEdit 3)基于单张参考图生成一致角色的能力。
Replicate BlogAI 评分4444 FLUX.1 Kontext [dev] 如何使用 TaylorSeer 优化推理速度
Replicate 详细介绍了 FLUX.1 Kontext [dev] 的 TaylorSeer 优化方法,通过缓存中间图像预测的导数并使用泰勒级数近似来加速图像生成。该方法将扩散模型的推理步骤从约 30 步减少到 10-15 步,同时保持图像质量。TaylorSeer 在生成的首尾步骤计算完整预测,中间步骤使用近似估算,平衡了速度与精度。
Replicate BlogAI 评分7070 Black Forest Labs 发布 FLUX.1 Kontext 图像编辑模型
Black Forest Labs 发布 FLUX.1 Kontext,这是一款文本驱动的图像编辑模型,在文本编辑方面优于 OpenAI 4o,且更便宜、无黄调偏差。
Replicate BlogAI 评分7171 Google Imagen 4 现已在 Replicate 开放使用
Google 最新的旗舰图像生成模型 Imagen 4 现已在 Replicate 平台开放运行,这是预览版本。该模型在精细细节渲染、风格多样性和文字渲染方面有显著提升,并内置了过滤、数据标记和 SynthID 数字水印等安全措施。Replicate 同时预告将推出 Imagen 4 Ultra 和 Veo 3,并已上线 Google 的音乐生成模型 Lyria 2。
Replicate BlogAI 评分6969 Replicate 现支持在 Hugging Face 上运行 30,000+ LoRA
Replicate 宣布其推理服务现已集成到 Hugging Face Hub,用户在 Hugging Face 上选择支持的 LoRA 并将 Replicate 设为推理提供商时。
Replicate BlogAI 评分7373 Ideogram 3.0 现已在 Replicate 上线
Ideogram 发布 3.0 版文本到图像模型,现已在 Replicate 平台上线。该模型提供 Turbo、Balanced、Quality 三个版本,分别针对快速迭代、均衡场景和最高画质需求。主要升级包括更强的图像真实感、风格控制、布局生成能力,以及更精准的排版渲染。
Replicate BlogAI 评分2323 AI 创意工具汇总:语音模型、3D 生成与 LoRA 微调
Google DeepMind 发布 ShieldGemma 2,可高精度检测 NSFW 内容和暴力元素;腾讯推出 Hunyuan3D 2Mini,用于游戏资产和风格化角色创作。
Mistral AIAI 评分5252 Mistral AI 发布全新 le Chat:上线 iOS 与 Android 并推出 Pro/Team 及企业内测
Mistral AI 发布全新 le Chat,覆盖生活与工作场景,并同步登陆 iOS 和 Android App Store / Play Store,以及 chat.mistral.ai。
Replicate BlogAI 评分3737 使用 Replicate playground 生成短视频
Replicate 发布 playground 实验性网页界面,提供类似剪贴簿的 UI 用于测试和比较不同图像/视频模型,并保留实验记录。工作流程分为三步:首先使用 flux-aesthetic-anime 等图像模型生成起始图片,然后通过 minimax/video-01-live 将图片转换为视频,最后利用 zsxkib/mmaudio 模型为视频添加匹配的音乐音效。
Replicate BlogAI 评分7373 AI 视频模型横评:Sora 后的开源浪潮与平台选择
AI 视频正迎来突破时刻。2023 年 AI 视频质量尚差,2024 年 Sora 重新定义期待,随后大量模型涌现。Minimax Video-01 质量接近 Sora 但闭源,Tencent Hunyuan Video 开源可微调,Genmo Mochi 1 已优化至单卡 4090 可运行,Lightricks LTX-Video 仅需 10 秒生成 3 秒视频。
Replicate BlogAI 评分7373 Black Forest Labs 发布 FLUX.1 Tools 图像控制工具套件
Black Forest Labs 发布 FLUX.1 Tools,包含 Fill(图像修复与扩展)、Canny(边缘检测控制)、Depth(深度图控制)和 Redux(图像变体生成)四种控制功能。
Replicate Blog精选AI 评分8080 Stable Diffusion 3.5 现已在 Replicate 可用
Stable Diffusion 3.5 在 Replicate 平台发布,提供 Large、Large Turbo 和 Medium 三个变体。Large Turbo 只需 4 步推理即可生成高质量图像,Medium 为 2.5B 参数可运行在消费级 GPU。定价分别为每张图 $0.065、$0.04、$0.035。非商业使用免费,商业使用年收入低于 100 万美元免费。
推荐理由:原文给出了三个版本的能力差异和具体价格,读者可以据此判断在什么场景下该使用哪个版本以及成本是多少。
Replicate BlogAI 评分5353 Replicate 合作上线 Ideogram v2 修复功能
Replicate 合作伙伴 Ideogram 推出 v2 模型的修复(inpainting)功能,提供标准版和 turbo 版两种选择。标准版生成质量更高,turbo 版速度更快。该模型还特别擅长生成文字。用户可通过 Python 或 JavaScript 客户端调用 API,也可直接试用开源的在线 demo。
Replicate BlogAI 评分6868 Replicate 优化 FLUX 图像生成速度并开源
Replicate 宣布 FLUX 图像生成模型在其平台上速度大幅提升:FLUX.1 [schnell] 512x512 4步推理仅需 0.29 秒(P90 0.49秒),1024x1024 仅需 0.72 秒(P90 0.95秒);FLUX.1 [dev] 1024x1024 28步仅需 3.03 秒(P90 3.90秒)。
Replicate BlogAI 评分7474 FLUX1.1 [pro] 发布
Replicate 上线 Black Forest Labs 的 FLUX1.1 [pro] 模型,图像生成速度提升 6 倍,质量更高,并推出新的 prompt upsampling 功能。原 FLUX.1 [pro] 模型速度翻倍。FLUX1.1 [pro] 价格 $0.04/图,FLUX.1 [pro] 价格 $0.055/图。
Replicate BlogAI 评分3939 如何使用合成训练数据改进 Flux 微调模型
Replicate 博客介绍三种使用合成训练数据改进 Flux 微调模型的技术:使用 consistent-character 模型从单张图片生成多样训练数据;将微调模型的优质输出回收作为新训练数据;结合多个社区 LoRA 风格模型来多样化训练集。所有方法均可通过 Replicate API 自动化执行。
Replicate BlogAI 评分3434 如何使用 API 微调 FLUX.1
本教程展示如何通过 Replicate HTTP API 编程化创建和运行微调后的 FLUX.1 模型。训练需 10-20 张图像,约 20 分钟可完成,费用约 $1.85,使用 Nvidia H100 GPU。支持最少 2 张图像微调,但 10 张以上效果更佳。
Replicate BlogAI 评分6969 如何微调 FLUX.1 来生成自己的图像
Replicate 官方发布教程,指导用户用自己的图片微调 FLUX.1 模型生成自定义图像。只需准备 10 张不同角度和光照条件下的面部照片,选择一个独特的触发词,支付约 2 美元,即可在 20 分钟内完成训练并通过网页或 API 生成图像。
Replicate BlogAI 评分2626 Replicate Intelligence #12:FLUX.1 图像生成工具与大脑自我训练研究
FLUX.1 图像生成模型推出两个新工具:ReFlux 支持多模型无限画布创作,Multi-LoRA Explorer 可单图叠加多个 LoRA 实现复杂风格组合。开源项目 Deep-Live-Cam 实现照片实时换脸到视频。此外,有研究揭示大脑在 REM 睡眠期间会模拟动作与后果,生成合成数据进行自我训练,与 AI 模型训练方式存在相似性。
Replicate BlogAI 评分2121 Replicate Intelligence #11:FLUX.1 微调上线,Tavus 推出数字双胞胎视频对话 API
Replicate 现已支持 FLUX.1 微调,上传 12-20 张图片并选择触发词,约 30 分钟即可生成定制模型。Tavus 发布 Conversational Video Interface,可构建低延迟(<1 秒)的数字双胞胎进行实时视频对话,适用于客户支持和销售场景。
Replicate BlogAI 评分7474 如何在 Replicate 上微调 FLUX.1 模型
Black Forest Labs 发布的 FLUX.1 文本生成图像模型现可在 Replicate 上进行微调。用户只需上传 12-20 张图像,通过 Ostris 的 AI Toolkit 使用 LoRA 技术训练即可让模型学习新概念。
Replicate BlogAI 评分2929 Replicate Intelligence #10:FLUX.1 图像模型与 Odyssey Minecraft 智能体框架
Odyssey 框架发布,赋予 LLaMA-3 模型智能体在 Minecraft 开放世界中的探索能力,包含交互式智能体、技能库和新的开放世界基准。Replicate 平台上的 FLUX.1 [dev] 新增图像到图像转换功能,首周获得近 500 万次预测调用。Streamlit 推出新视频系列,展示如何基于 Replicate 构建 AI 应用。
Replicate BlogAI 评分2424 Replicate Intelligence #9:本周开源AI模型动态
Black Forest Labs发布FLUX.1图像生成模型套件,采用"flow matching"技术,支持高达2百万像素分辨率,分为pro、dev、schnell三个版本。Meta推出SAM 2图像和视频分割模型,零样本能力扩展至视频领域,性能提升3倍。Google发布Gemma 2 2B紧凑语言模型,仅20亿参数但在LMSYS Chatbot Arena超越所有GPT-3.5模型。
Replicate BlogAI 评分5353 FLUX.1 初印象
Replicate 官方测试了新的图像生成模型 FLUX.1,发现其使用 flow matching 而非传统 diffusion 方法,在文本渲染精度、光影质感表现和艺术风格理解方面展现出独特优势,生成图像具有一种有机的流动感。
Replicate BlogAI 评分6565 FLUX.1 图像生成模型现可通过 API 调用
Black Forest Labs(Stable Diffusion 原团队)发布了新的开源图像生成模型 FLUX.1,现已在 Replicate 平台可用,支持一行代码调用。