标签
论文提出了一种名为DLD-RL的方法,通过将强化学习轨迹重新用作长上下文问答数据,增强AI智能体的深度研究和长上下文能力,在基准测试中显示出显著的性能提升。
本文引入了层次旋转位置编码 (hRoPE) 来表示文本层次结构,并使用压缩深度作为段落结构的特征,表明它与其他指标相比,与真正的层次组织相关性更好。
jev-ultrafast的演示已发布,通过使用自然语言和小型LLM,在7.1秒内执行Google Flights搜索等任务,实现了更快的浏览器操作AI。
作者质疑Jev是否是BERT的通用版本,指出其作为智能分类器的能力,具有自定义提示和标准指令阅读功能。
这篇文章对比了乔姆斯基的普遍语法观点与现代AI语言模型,强调了GPU中的统计学习如何实现了更优的语法和理解能力。
本文提出了一种用于检索增强生成(RAG)管道的查询感知分流层,以处理源与查询之间的实质性关系,通过在合成数据上评估的评分和路由方法来定义风险覆盖目标。
提出了一种使用网络数据和大型语言模型的可扩展计算框架,以量化组织环境行动,并以美国犹太教堂为例进行了演示,比较了关键词检索、语义检索和直接分类方法。
介绍了 ParsHate,一个手动标注的 10,000 条波斯语推文数据集,用于仇恨言论和目标检测,展示了当前模型的中等性能,并强调了需要更先进的方法。
研究报告揭示,LLMs在幽默品味上共识程度不一,总体偏好荒谬幽默和吐槽笑话格式,Gemini则是最一致的评判者。
本文解释了 LLM 响应速度的两个关键指标:与预填充相关的时间到第一个 Token(TTFT),以及与解码相关的 Token 间延迟(ITL),影响响应性和流畅度。
MACE 是一个多智能体候选事件获取方法,它使用证据专用的 LLM 代理来细化事件结构,提高事件链接任务的准确性,而无需修改现有模型。
本文提出了ModelLog,一个声明式概率框架,用于评估语言模型,通过对令牌预测定义语义约束,并通过共享语义将评估与学习联系起来。
Cortex是一款网络应用程序,利用人工智能和自然语言处理协助研究人员进行定性内容分析,为预分析和分类任务提供支持。
该论文介绍了一个使用大型语言模型从强制迁移和FCV文档中提取数据集引用的弱监督框架,在有限标注数据下实现了高精度。
WrenAI 是一个开源的生成式 BI 引擎,允许用户通过自然语言提问生成 SQL、图表和分析结果,并带有语义层以提高准确性。
Persimmon 是首个旨在真实模拟人类对话和交互的大型模型。
本文提出了原型中介过程监督(PMPS),用于隐式思维链推理,实现了token压缩并提高了显式思维链方法的准确性。
本文提出了一种使用LLMs进行自然语言到PDDL翻译的端到端流水线,包含迭代修复和全面评估,突出了基准测试中操作成功与语义忠实性之间的差距。
本文提出一项可控反转测试,旨在探究对事实保持新闻框架的识别是否能够导致其被逆转。