跳到正文

#教程/实践

今日 12 条

工具·提示词·论文 三栏速览

每栏 6 / 6 · 直达分类页

工具

6 条
查看全部

提示词

6 条
查看全部

论文

6 条
查看全部
9月24日周四
9月18日周五
  1. GitHub Blog · AI & ML43

    代码要读吗?RAG死了吗?Skills取代MCP了吗?——GitHub Podcast深度解析五大AI热点观点

    GitHub Podcast最新一期对五个常见AI热点观点进行深度解析,探讨是否需要阅读AI生成的代码、公司招聘是否强制AI技能、Skills是否取代MCP、RAG是否已过时、以及是否需要为代码库微调模型。主持人认为热点观点的价值不在于对错,而在于引发深入思考和问题,从而找到真正有用的 ideas。

9月17日周四
  1. GitHub Blog · AI & ML72

    GitHub Copilot 运行时如何迁移到 Rust

    GitHub Copilot 团队用 AI 智能体将 Copilot 运行时从约 43 万行 TypeScript 原地迁移为约 83 万行 Rust,历时数月完成 128 个 PR 的渐进式迁移。运行时性能提升数个量级,prompt cache 命中率高达 96.22%,单开发者完成了原本需要整个团队一到两年才能完成的工作。

    推荐理由:原文给出了 96% 的 prompt cache 命中率数据和具体的 AI 辅助迁移工作流,读者可以据此评估这种规模化 AI 协作模式的实际效果和可迁移性。

9月12日周六
9月11日周五
  1. GitHub Blog · AI & ML46

    GitHub Copilot 应用教程:使用 diff、terminal 和 browser 面板

    GitHub Copilot 应用新增 diff、terminal、browser 三个内置面板,可在应用内审查代码变更、运行命令并预览效果。diff 面板显示添加(绿色)和删除(红色),terminal 可执行项目命令,browser 面板配备 Pick & Polish 工具可交互调整 UI。用户可直接接受变更并创建 pull request,实现完整的 AI 编码工作流。

9月9日周三
  1. Mistral AI71

    Mistral AI 用 AI 智能体将 4 万行 Fortran 77 迁移到 C++

    Mistral 帮助欧洲能源运营商将 4 万行 Fortran 77 迁移到 C++,这是一个物理密集型油藏模拟器。文章介绍了三个核心实践:迁移前先构建 parity harness 验证数值一致性;用调用方-被调用方树梳理代码结构并生成文档;采用结构化智能体工作流(规划→编码→测试→审查),在关键节点加入人工审核。最终证明结构化工作流比完全自主和纯手动都更有效。

    推荐理由:原文给出了具体的代码迁移方法论和工作流设计,读者可以参考这个案例来设计自己的遗留代码现代化方案。

5月8日周五
  1. Berkeley AI Research32

    自适应并行推理:高效推理扩展的新范式

    大语言模型推理过程中,顺序推理面临上下文膨胀、延迟增加和context-rot等问题,自适应并行推理允许模型自主决定何时分解任务、生成多少并发线程及如何协调。基于对现有并行推理方法的分析,文章指出固定并行结构的局限性,并探讨模型自适应控制的发展方向。

4月15日周三
  1. Replicate Blog71

    Seedance 2.0 教程:如何制作高质量 AI 视频

    Seedance 2.0 是快手发布的 AI 视频生成模型,支持输入最多 9 张图像、3 个视频片段、3 个音频文件和文本提示词,可从图像提取构图、从视频提取运动模式、从音频提取节奏,实现音视频毫秒级同步。该模型还能处理复杂物理效果(如车辆颠簸、水流Fluid dynamics),并支持 15 秒多镜头规划和时间码提示功能。

2月24日周二
  1. Replicate Blog76

    如何提示 Seedream 5.0

    Replicate 团队测试了字节跳动的 Seedream 5.0 图像生成模型,总结了多项关键能力:基于示例的编辑可通过提供前后对比图让模型学习并迁移视觉变换;可理解物理机械结构并生成正确细节;支持多步骤推理和多图像输入;精确遵循复杂指令;具备专业领域知识如建筑可视化、科学插图、营养标注;文本渲染准确且支持多语言;支持批量生成风格一致的多张图像。

    推荐理由:原文通过多个实际案例展示了 Seedream 5.0 的核心能力,读者可据此了解模型的实际表现并迁移到自己的使用场景。

10月16日周四
  1. Replicate Blog64

    Veo 3.1 提示词指南

    Google 发布了 Veo 3.1,Replicate 官方博客提供了提示词教程。新增三大功能:参考图像生成视频(最多3张图合成连贯场景)、首尾帧插帧(指定起止帧让模型生成过渡动画)、增强的图像转视频(模型能理解图像内容并生成自然motion)。除参考图像功能外,其他功能提供快速生成选项,约60秒完成,价格减半。教程包含代码示例和 API 调用方式。

7月21日周一
7月16日周三
  1. Replicate Blog44

    FLUX.1 Kontext [dev] 如何使用 TaylorSeer 优化推理速度

    Replicate 详细介绍了 FLUX.1 Kontext [dev] 的 TaylorSeer 优化方法,通过缓存中间图像预测的导数并使用泰勒级数近似来加速图像生成。该方法将扩散模型的推理步骤从约 30 步减少到 10-15 步,同时保持图像质量。TaylorSeer 在生成的首尾步骤计算完整预测,中间步骤使用近似估算,平衡了速度与精度。

7月7日周一
  1. Replicate Blog47

    AI 视频模型对比指南

    Replicate 平台对比了 24 款 AI 视频生成模型的价格、分辨率、时长和功能。Alibaba Wan 2.2 5b fast 价格最低 $0.01 起、生成速度最快 6-16 秒,Google Veo 3 价格最高 $6、支持原生音频。所有模型均支持商业使用,价格和速度数据截至 2025年7月。

6月6日周五
3月5日周三
  1. Replicate Blog50

    Wan2.1 参数调节实战教程

    Replicate 测试了阿里 Wan2.1 14b 文本到视频模型的参数调优效果,使用固定提示词和种子进行系统性参数扫描。实验发现 guidance scale 为 3-7 时效果最佳(0 为创意模式,8+ 会出现 AI 痕迹),shift 控制运动流畅度,1 产生推拉效果,7-9 倾向于相似的画面构图。

1月24日周五
  1. Replicate Blog79

    Replicate 平台现已支持微调开源视频模型

    Replicate 推出基于腾讯 HunyuanVideo 的微调功能,用户可通过平台工具收集训练数据、训练自定义视频模型并生成视频。HunyuanVideo 擅长捕捉训练数据的视觉风格和运动模式,包括角色动作和镜头运动,这种动态风格迁移是其独特优势。训练通常需要 5-10 分钟,支持通过 API 自动化。

    推荐理由:原文给出了在 Replicate 上微调视频模型的完整步骤和入口,读者可以据此实践自定义视频生成。

1月17日周五
  1. Replicate Blog37

    使用 Replicate playground 生成短视频

    Replicate 发布 playground 实验性网页界面,提供类似剪贴簿的 UI 用于测试和比较不同图像/视频模型,并保留实验记录。工作流程分为三步:首先使用 flux-aesthetic-anime 等图像模型生成起始图片,然后通过 minimax/video-01-live 将图片转换为视频,最后利用 zsxkib/mmaudio 模型为视频添加匹配的音乐音效。

9月20日周五
9月9日周一
  1. Replicate Blog34

    如何使用 API 微调 FLUX.1

    本教程展示如何通过 Replicate HTTP API 编程化创建和运行微调后的 FLUX.1 模型。训练需 10-20 张图像,约 20 分钟可完成,费用约 $1.85,使用 Nvidia H100 GPU。支持最少 2 张图像微调,但 10 张以上效果更佳。

8月30日周五
8月15日周四
8月9日周五
  1. Replicate Blog29

    Replicate Intelligence #10:FLUX.1 图像模型与 Odyssey Minecraft 智能体框架

    Odyssey 框架发布,赋予 LLaMA-3 模型智能体在 Minecraft 开放世界中的探索能力,包含交互式智能体、技能库和新的开放世界基准。Replicate 平台上的 FLUX.1 [dev] 新增图像到图像转换功能,首周获得近 500 万次预测调用。Streamlit 推出新视频系列,展示如何基于 Replicate 构建 AI 应用。

7月23日周二
  1. Replicate Blog65

    如何在 API 上运行 Meta Llama 3.1 405B

    Replicate 平台支持通过 API 调用 Meta Llama 3.1 405B 模型。该模型拥有 4050 亿参数,上下文窗口为 8000 token,支持 8 种语言,在多项基准测试中接近 GPT-4 水平。文章提供了 JavaScript、Python 和 cURL 三种调用方式的代码示例,并介绍了 Purple Llama 安全工具套件。

7月20日周四
  1. Cursor Blog60

    Cursor 技术博客:Llama-2-70B 推理特性分析

    Cursor 分析了 Llama-2-70B 自托管推理的成本和延迟。实验表明,在 prompt 场景下 Llama 比 GPT-3.5 便宜约 3-4 倍($0.00042 vs $0.0015/1K tokens),但在 completion 场景下成本高达 $0.066/1K tokens,远高于 GPT-3.5。

    推荐理由:原文给出了 Llama-2-70B 与 GPT-3.5 在成本和延迟上的详细对比实验数据,读者可据此判断自托管与 API 调用的取舍。