标签
ViDiHand 利用预训练的视频扩散模型表示,直接从自我中心视频帧中重建4D手部运动,无需检测器或优化,在ARCTIC、HOT3D和HOI4D上优于现有方法。
本文引入内部一致性最大化(ICM)方法,无需人工监督即可生成针对特定角色的示例,用于将AI与多样化的人类价值观对齐,并证明一致性示例在多个基准测试中具有更好的泛化能力。
本文表明,微调后的AI文本检测器放大了预训练的典型性轴,而非学习AI与人类之间的界限,原始编码器投影通常达到或超过微调后的性能。
MC-RFM提出了一种新颖的黎曼流匹配框架,用于小样本自适应,该框架在结合双曲空间和欧几里得空间的混合曲率流形上建模特征位移,在多个视觉识别基准上优于现有方法。
本文介绍了Transformers库,这是一个开源库,在统一API下提供最先进的Transformer架构和预训练模型,旨在使先进的自然语言处理对更广泛的机器学习社区可及。