标签
本文介绍了 FakeContext-bench,用于评估大型语言模型区分上下文信息和事实知识的能力,并提出了 Jurisdiction In-Context Learning (J-ICL) 以增强上下文学习性能和对误导性上下文的抵抗力。
本文首次对大规模语言模型在印地语和马拉地语的OCR后校正进行系统性评估,比较上下文学习的检索策略,并展示CharBM25的有效性。
CausalWM是一个因果世界模型,使用链式思考通过逐步捕捉物理依赖关系来预测未来帧,在像TriWorldBench和PAI-Bench这样的基准测试中排名第一。
本文提出了RoboDawn,一种将视觉语言模型智能迁移至机器人控制的方法。该方法通过零样本和单样本学习在基准测试中取得了先进结果,并在真实世界应用中验证成功。
本文研究了门控机制在State Space Models中的作用,表明它们促进记忆而非上下文学习,但能提高对长序列的泛化能力。
本文通过引入随机文本控制来挑战语言模型中少样本退化的扭曲假说,表明表示偏移主要由提示长度引起,而具有更高内容增量的模型从少样本提示中获益更多。
本文介绍了GPT-Policy,一个用于使用视觉语言模型进行上下文机器人学习的框架,使机器人能够从演示中学习,无需梯度更新。在真实机器人试验中评估该框架显示,任务完成率得到提高。
一项控制研究发现,对于更强的表格基础模型,特征工程的收益逐渐减少,而添加来自相关数据集的上下文信息仍能提升性能。
LimiX-2 是一个用于结构化数据的预训练基础模型,它使用上下文机制网络在主要表格基准测试中排名第一,支持多种任务而无需针对特定任务的参数更新。
本文探讨Astra是否代表了机器人技术中类似ChatGPT的突破,通过一条推特线程突出了其上下文学习和推理能力。
本文提出了 Convergent Emergence Hypothesis,指出少样本上下文学习在跨模态难度剖面上具有共同性,并通过六种模态的实验提供实证支持,显示其中五种模态存在相关性效应。
一条推文声称,GPT-6 Astra通过使机械臂在第一次尝试时就能根据人类演示执行新颖的物理任务,从而展示了AGI。
本文讨论了 GPT-6 Astra 模型在物理世界环境中进行上下文学习的能力,这代表了具身 AI 领域的重大进步。
本文介绍了一种用于多模态上下文学习的对比建模框架,旨在改进推理路径对齐,提升视觉问答等任务的性能。
本文详细介绍了Eloquence团队在Interspeech 2026 MLC-SLM挑战赛任务2中的方法,该任务涉及使用语音LLMs进行多语言多选问答,结合微调、上下文学习和检索系统。
Skild AI的S1模型使机器人无需重新训练即可从视频演示中学习,在10个月内实现了1亿美元的ARR,并在多个行业中部署。
MOAE 提出了一种帕累托保留的进化搜索方法,能够在搜索过程中无需固定标量化,同时优化 LLM 代理的多个目标,包括任务性能、轨迹质量和安全性。
本文评估了基于检索的上下文内学习方法,用于检测德国社交媒体帖子中与犯罪相关的仇恨言论,发现少样本提示优于零样本,但检索方法仅提供边际增益,模型更适合用于分诊而非自主审核。
Supermemory强调了AI智能体持续学习的重要性,并介绍了learner-1,这是一个旨在为各种用例推动记忆和上下文学习的新模型。