generation

标签

Cards List
#generation

@charliermarsh: 第一眼看上去令人印象深刻,但我很确定这个克莱因瓶在训练数据中。

X AI KOLs Following · 昨天 缓存

一条推文讨论了Claude Fable 5 Max在克莱因瓶上生成一个宝可梦填字游戏,但表达了怀疑,认为模型可能从训练数据中记住了这个设计。

0 人收藏 0 人点赞
#generation

中国已具备制作高度逼真的1分钟AI视频能力

Reddit r/ArtificialInteligence · 4天前

中国已开发出生成最长一分钟的高度逼真AI视频的能力,标志着AI视频合成领域的重大进步。

0 人收藏 0 人点赞
#generation

离散扩散模型:从分词到生成的统一框架

arXiv cs.LG · 5天前 缓存

本文介绍了一种离散扩散模型的统一概念框架,通过分词、状态空间构建来分析其设计空间,并强调了训练、推理和扩展中的权衡。

0 人收藏 0 人点赞
#generation

Wan-Dancer: 一种用于分钟级别连贯音乐到舞蹈生成的层次化框架

Reddit r/LocalLLaMA · 2026-07-13

Wan-Dancer 提出了一种层次化框架,用于从音乐生成分钟级别的连贯舞蹈,解决了长时间编舞生成的挑战。

0 人收藏 0 人点赞
#generation

回读:预训练多模态大语言模型作为文本到图像生成的零样本奖励模型

Hugging Face Daily Papers · 2026-07-13 缓存

本文介绍了SpectraReward,一种无需训练的奖励函数,利用预训练的多模态大语言模型(MLLM)作为文本到图像生成中强化学习的零样本奖励模型,在多项指标上持续优于先前方法。

0 人收藏 0 人点赞
#generation

@mattshumer_:GPT-5.6-Sol 一次性生成了这个基于体素的曼哈顿。看看这精度……简直惊人。它运行了将近一周……

X AI KOLs Timeline · 2026-07-09 缓存

GPT-5.6-Sol 在近一周内自主生成了精确的基于体素的曼哈顿。

0 人收藏 0 人点赞
#generation

@Saccc_c: Grok 4.5怎么能这么快,关键质量非常不错 上传了我个人网站的 prd 后,3min 就生成了,整体效果非常的不错

X AI KOLs Following · 2026-07-09 缓存

用户称赞Grok 4.5的速度和质量,上传个人网站PRD后3分钟生成,效果不错。

0 人收藏 0 人点赞
#generation

逐令牌关注多模态生成

Hugging Face Daily Papers · 2026-07-04 缓存

本文研究了多模态大语言模型在生成过程中的令牌级注意力转移,揭示了其中的一致模式,并提出了一种简单的测试时干预方法,显著提升了任务性能。

0 人收藏 0 人点赞
#generation

COMPASS:在统一多模态模型中锚定组合意图引导

arXiv cs.AI · 2026-06-30 缓存

本文提出了COMPASS,首个能够同时锚定组合意图控制,以进行组合感知和组合引导生成的统一多模态框架,并引入了共享专家令牌和Comp-11数据集。

0 人收藏 0 人点赞
#generation

AVTok: 面向整体音视频生成的一维统一标记化

Hugging Face Daily Papers · 2026-06-29 缓存

AVTok提出了一种用于音视频生成的统一一维标记器,采用双流Transformer架构,具有共享编码器-解码器和模态特定查询,实现了紧凑的潜在表示,在重建和下游生成任务中表现出色。

0 人收藏 0 人点赞
#generation

我渴望在我的Strix Halo上获得15倍加速

Reddit r/LocalLLaMA · 2026-06-23

Nvidia声称使用扩散模型在文本生成上实现15倍加速,一次性生成整个文本块。

0 人收藏 0 人点赞
#generation

A2e AI视频与图像

Reddit r/AI_Agents · 2026-06-21

A2e是一款用于视频和图像生成或处理的AI工具。

0 人收藏 0 人点赞
#generation

@SergioPaniego:连续批处理刚刚在TRL的GRPO中实现,在64次生成时,它比普通生成运行更快且使用更少的VRAM…

X AI KOLs Following · 2026-06-19 缓存

连续批处理已添加到TRL的GRPO中,提高了速度并减少了VRAM使用,无需vLLM。推文解释其工作原理及适用时机。

0 人收藏 0 人点赞
#generation

UnityShots:基于记忆的多镜头音视频生成与边界感知门控

Hugging Face Daily Papers · 2026-06-19 缓存

UnityShots 是一个基于记忆的多镜头音视频生成系统,通过固定大小的长期记忆槽和短期记忆槽,结合边界条件门控与离散切类型先验,在视频切换中保持主体外观和音频的一致性。该系统在跨镜头一致性指标上优于开源基线,并达到与闭源系统相当的水平。

0 人收藏 0 人点赞
#generation

UniDDT: 通过解耦扩散变换器统一多模态理解与生成

Hugging Face Daily Papers · 2026-06-15 缓存

UniDDT提出了一种解耦扩散变换器框架,通过利用Noisy ViT编码器和LLM进行语义编码,统一了多模态理解与生成,在两个任务上均取得了强劲性能。

0 人收藏 0 人点赞
#generation

@_pulkitxm:我花了几千美元构建这个仓库……所以你不用了。50多个着陆页、英雄区段和交互式原型……

X AI KOLs Timeline · 2026-06-12 缓存

Anthropic 推出了 Claude Fable 5,一个强大的 Mythos 级模型,同时一位开发者分享了一个包含50多个着陆页的仓库,这些页面均由其生成,并保留了提示词供社区使用。

0 人收藏 0 人点赞
#generation

有点奇怪,但还行。(别误会,它在编辑方面是SOTA,但绝对不是生成方面)怎么看?

Reddit r/singularity · 2026-06-11

该评论承认该模型在编辑方面是SOTA,但在生成方面不是。

0 人收藏 0 人点赞
#generation

时间序列即语言:面向通用时间序列基础模型的通用分词器

arXiv cs.LG · 2026-06-10 缓存

本文提出UniTok,一种将连续时间序列转化为离散标记的通用分词器,以及UniTok-FM,一个基于下一标记预测预训练的基础模型。该模型支持零样本和提示增强预测,以及通过无需训练的上下文推理实现少样本生成和分类——这是以往工作未能实现的能力。

0 人收藏 0 人点赞
#generation

@heyshrutimishra: 新消息:一个边画边思考的模型。SenseNova U1 是一个统一处理理解、推理和生成…

X AI KOLs Following · 2026-06-07 缓存

SenseNova U1 是一个统一模型,在同一个架构中处理文本和图像的理解、推理与生成,能够端到端地完成规划信息图等任务。

0 人收藏 0 人点赞
#generation

@MinLiBuilds: Workflow 有 6 种形式。 我找到了原始prompt 放在评论区。 这六种形式分别是: 分类并执行:由一个 classifier agent 判断任务类型,据此路由到不同的 agent 或行为;也可以在任务完成时确定输出的分类。 …

X AI KOLs Timeline · 2026-06-05 缓存

介绍了六种AI agent工作流形式:分类并执行、扇出并综合、对抗式验证、生成并筛选、锦标赛、循环至完成。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈