标签
Meta 推出 Muse Image,这是来自 Meta Superintelligence Labs 的首个图像生成模型,已集成到 Meta AI 以及 Instagram、WhatsApp 等其他应用中。该模型支持高质量的文本到图像生成、编辑和创意预设,并提供房间重新设计、Instagram 个人资料标记等功能。
Meta发布了Muse Image,这是一款免费的AI图像生成器,可通过Meta AI应用、Instagram故事和WhatsApp使用,具备预设、基于提示的编辑功能,并集成于Facebook Marketplace。
Meta 发布了 Muse Image,这是一个具有代理能力的图像生成模型,它能够进行规划、搜索网络、编写代码,并在渲染前进行编辑。
Meta推出了Muse Image并预览了Muse Video,这是一个具有代理能力的图像和视频生成系统,支持精确编辑、多参考源、与Instagram上下文集成,将媒体生成转变为完整的创意操作系统。
本文提出了一种与生成器无关的生成后策展方法,通过将真实类别拆分为规范的同质子集和无冗余的异质子集,并基于保真度-多样性准则对合成图像进行评分,从而选取信息丰富的合成图像子集。该方法持续优于现有的数据选择基线,并且在合成样本数量减少多达40%的情况下,仍能达到与真实数据相当的性能。
本文详细介绍了作者在GIGABYTE AI TOP ATOM(DGX Spark)工作站上运行NVFP4量化图像和视频生成模型的设置与基准测试,使用FLUX.2、Qwen-Image和LTX-2.3等模型(含同步音频的视频)取得了令人印象深刻的性能。
Muse Image 和 Muse Video 是用于图像和视频生成的新型 AI 模型,能够精确遵循指令、进行编辑、多参考组合,并从 Instagram 获取社交上下文,同时具有高视觉保真度和原生音频支持。
Midjourney 正试图迫使迪士尼、环球和华纳兄弟披露各自AI使用细节,这是其版权侵权诉讼的一部分。该公司辩称,这些工作室的内部AI实践可能支持其合理使用辩护。
作者分享了构建一个小型流匹配图像生成模型的经历,该模型基于 Apple 表情符号图像进行训练,描述了最初失败的方法以及后来成功转向使用 RGB 通道、残差块和注意力的过程。
一位开发者推出了crdible,这款工具能将粗略的想法或语音笔记转化为用户风格的LinkedIn帖子,并配上看起来不像AI生成的图片。
Claude Fable 5回归上线,其编写的提示词能让Grok生成堪比Seedance 2.5效果且成本低6倍的视频,附有详细人像提示词示例。
Boogu-Image-0.1 是一个全新的统一图像生成与编辑模型家族,拥有10B参数,采用 Apache 2.0 许可证。它支持快速 Turbo 推理(仅需4步),在10倍更少的数据上训练,并支持中文和英文。
该模型为Krea-2引入了一个深度条件化的ControlNet-LoRA,能够实现深度图引导的图像生成,具有高深度一致性(皮尔逊相关系数0.98-0.99)。它支持Raw和Turbo两种变体,并包含简易推理脚本和Comfy UI集成。
Diffusers库已更新,新增了包括Ideogram4、MotifVideo以及DiffusionGemma模型在内的图像和视频流水线。
关于OpenAI在arena.ai上可能发布了一个名为kyros-alpha的隐秘模型的猜测,该模型生成的图像能通过OpenAI的Verify检测,但表现出一些非典型特征。
ComfyClaw是一种用于ComfyUI图像生成工作流的代理技能进化框架,利用类型化图编辑和区域级VLM验证器将视觉故障转化为修复建议,在多个配置中优于基线方法。
感知流匹配在感知特征空间中对流匹配进行监督,使得仅需4-8步采样而非35-50步即可实现高质量少步生成,且无需教师模型。
根据 Artificial Analysis 的基准测试,Modular 的 MAX 推理服务在 FLUX.2-dev 上实现了比竞争对手快3倍的图像生成速度。
OrbitQuant提出了一种数据无关的扩散Transformer量化方法,消除了跨时间步和模态进行重新校准的需求,在FLUX.1和CogVideoX等模型的低位宽设置下实现了最先进的后训练量化水平。