generation

标签

Cards List
#generation

UnityShots:基于记忆的多镜头音视频生成与边界感知门控

Hugging Face Daily Papers · 2026-06-19 缓存

UnityShots 是一个基于记忆的多镜头音视频生成系统,通过固定大小的长期记忆槽和短期记忆槽,结合边界条件门控与离散切类型先验,在视频切换中保持主体外观和音频的一致性。该系统在跨镜头一致性指标上优于开源基线,并达到与闭源系统相当的水平。

0 人收藏 0 人点赞
#generation

UniDDT: 通过解耦扩散变换器统一多模态理解与生成

Hugging Face Daily Papers · 2026-06-15 缓存

UniDDT提出了一种解耦扩散变换器框架,通过利用Noisy ViT编码器和LLM进行语义编码,统一了多模态理解与生成,在两个任务上均取得了强劲性能。

0 人收藏 0 人点赞
#generation

@_pulkitxm:我花了几千美元构建这个仓库……所以你不用了。50多个着陆页、英雄区段和交互式原型……

X AI KOLs Timeline · 2026-06-12 缓存

Anthropic 推出了 Claude Fable 5,一个强大的 Mythos 级模型,同时一位开发者分享了一个包含50多个着陆页的仓库,这些页面均由其生成,并保留了提示词供社区使用。

0 人收藏 0 人点赞
#generation

有点奇怪,但还行。(别误会,它在编辑方面是SOTA,但绝对不是生成方面)怎么看?

Reddit r/singularity · 2026-06-11

该评论承认该模型在编辑方面是SOTA,但在生成方面不是。

0 人收藏 0 人点赞
#generation

时间序列即语言:面向通用时间序列基础模型的通用分词器

arXiv cs.LG · 2026-06-10 缓存

本文提出UniTok,一种将连续时间序列转化为离散标记的通用分词器,以及UniTok-FM,一个基于下一标记预测预训练的基础模型。该模型支持零样本和提示增强预测,以及通过无需训练的上下文推理实现少样本生成和分类——这是以往工作未能实现的能力。

0 人收藏 0 人点赞
#generation

@heyshrutimishra: 新消息:一个边画边思考的模型。SenseNova U1 是一个统一处理理解、推理和生成…

X AI KOLs Following · 2026-06-07 缓存

SenseNova U1 是一个统一模型,在同一个架构中处理文本和图像的理解、推理与生成,能够端到端地完成规划信息图等任务。

0 人收藏 0 人点赞
#generation

@MinLiBuilds: Workflow 有 6 种形式。 我找到了原始prompt 放在评论区。 这六种形式分别是: 分类并执行:由一个 classifier agent 判断任务类型,据此路由到不同的 agent 或行为;也可以在任务完成时确定输出的分类。 …

X AI KOLs Timeline · 2026-06-05 缓存

介绍了六种AI agent工作流形式:分类并执行、扇出并综合、对抗式验证、生成并筛选、锦标赛、循环至完成。

0 人收藏 0 人点赞
#generation

结构促进检索、重排序与生成

arXiv cs.CL · 2026-06-03 缓存

本文提出SF-Re2G方法,通过利用文档结构来增强检索、重排序和生成,从而改进基于文档的对话系统。该方法在中英文数据集上得到验证。

0 人收藏 0 人点赞
#generation

3D视觉烹饪书:数据、学习范式与应用

Hugging Face Daily Papers · 2026-06-02 缓存

本文提出了3D视觉研究的全面分类体系,涵盖几何表示、数据集、学习范式以及在重建、生成和视频建模中的应用。

0 人收藏 0 人点赞
#generation

原生视听对齐生成

Hugging Face Daily Papers · 2026-05-28 缓存

NAVA 提出了一种原生视听对齐框架,用于联合音频-视频生成,采用 Align-then-Fuse MMDiT 架构,以 6.3B 参数实现了更好的同步性和可控性。

0 人收藏 0 人点赞
#generation

@VraserX: 当第一代人对AI的了解超过对人类本身时,会发生什么?我们是在培养超人,还是情感…

X AI KOLs Following · 2026-05-24 缓存

一条推文思考:在AI陪伴下长大的第一代人是会成为超人,还是情感疏离?这引发了关于AI社会影响的讨论。

0 人收藏 0 人点赞
#generation

@techNmak: 这正是大多数求职者希望早看到的LLM面试题类型。一份精心整理的清单,共5…

X AI KOLs Timeline · 2026-05-20 缓存

一条推文分享了一份由Hao Hoang整理的涵盖基础、微调、生成、高级概念和数学的50道LLM面试题清单。

0 人收藏 0 人点赞
#generation

RankE:面向离散文本到图像生成的端到端后训练与解码器协同进化

Hugging Face Daily Papers · 2026-05-20 缓存

RankE 提出了一种用于离散文本到图像生成的端到端后训练框架,通过联合优化生成器和解码器来解决潜在协变量偏移问题,同时提升对齐度与保真度。

0 人收藏 0 人点赞
#generation

玩笑归玩笑,这个效果看起来和听起来都太棒了

Reddit r/singularity · 2026-05-18

一款新AI模型生成了令人印象深刻的逼真视频和音频,许多观察者都注意到其输出质量非常高。

0 人收藏 0 人点赞
#generation

LatentUMM:统一多模态模型的双重潜在对齐

Hugging Face Daily Papers · 2026-05-18 缓存

LatentUMM 引入了双重潜在对齐,通过对齐转换和稳定潜在动态,来改善统一多模态模型中的跨模态一致性。

0 人收藏 0 人点赞
#generation

令牌时间连续扩散用于语言建模

Hugging Face Daily Papers · 2026-05-07 缓存

本文介绍了令牌时间连续扩散(Token Time Continuous Diffusion,简称TTCD),这是一种新型扩散语言模型,它在连续空间中运行,采用每个令牌的时间步,在条件生成和数独求解方面以高加速比优于离散模型。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈