research-paper

标签

Cards List
#research-paper

Vending-Bench: 我们如何衡量AI能否自主经营业务?

Reddit r/ArtificialInteligence ↗ · 2天前

文章介绍了Vending-Bench,这是一个旨在评估AI能否自主经营业务的AI基准测试,并附有arXiv上的相关研究链接。

0 人收藏 0 人点赞
#research-paper

解决非凸下层双层优化需要二阶平稳性

arXiv cs.LG ↗ · 2天前 缓存

本文提出PROBE,一种用于非凸下层双层优化的扰动梯度算法,通过二阶平稳性实现有限时间收敛,并在基于LLM的任务和元学习实验中超越现有最先进方法。

0 人收藏 0 人点赞
#research-paper

新设备通过电池技术捕获二氧化碳

Ars Technica ↗ · 3天前 缓存

研究人员开发了一种实验室规模的设备,通过在电池中泵送二氧化碳来高效捕获它。该技术旨在显著降低捕获成本,预计规模化后成本可降至每吨92美元。

0 人收藏 0 人点赞
#research-paper

潜在递归LLM系统的原理性思考

Hugging Face Daily Papers ↗ · 4天前 缓存

本文提出REST,一种针对潜在递归LLM系统的新型训练目标,通过将因果性和最小化等特性融入可微损失中,在基准测试中将准确率提高了多达7.5个百分点。

0 人收藏 0 人点赞
#research-paper

@dair_ai:一个有趣的想法是持续在技能上训练专门模型。这篇论文探讨了这一想法。他们提出了 S…

X AI KOLs Timeline ↗ · 4天前 缓存

SkillGym 是一个框架,将人类编写的技能转化为大语言模型的训练环境,从而进行微调,提升在 Terminal-Bench 和 SkillsBench 等基准测试上的性能,超越了 Claude Sonnet 4.6 和 GPT-5.4 Mini 等模型的得分。

0 人收藏 0 人点赞
#research-paper

关于Saturn冰卫星上生命存在潜力的有希望发现

Hacker News Top ↗ · 5天前 缓存

发表在Science Advances上的新研究表明,Enceladus的海洋可能比先前认为的更适宜生命存在,未来的航天器可能更容易探测到生命。

0 人收藏 0 人点赞
#research-paper

使用清洁锚点的飞行中 KV 缓存以实现更快的自回归视频扩散

Hugging Face Daily Papers ↗ · 6天前 缓存

FlashForward 介绍了一种通过重用飞行中 KV 缓存和使用清洁锚点来加速自回归视频扩散的方法,在保持质量的同时实现了高达 2.92 倍的速度提升。

0 人收藏 0 人点赞
#research-paper

更换乘积,保留参数:Transformer的关联代数层

Hugging Face Daily Papers ↗ · 6天前 缓存

本文研究了将Transformer层中的矩阵乘法替换为关联代数积,以在保留参数的同时降低计算成本,证明了其可行性,提高了吞吐量,但存在一些性能权衡。

0 人收藏 0 人点赞
#research-paper

@omarsar0: 一篇关于为AI Agents构建更快记忆的重磅报告。如果你的代理的记忆层很慢,这个设计值得一览…

X AI KOLs Following ↗ · 6天前 缓存

这篇文章介绍了Jev-Mem,一种新的代理记忆架构,它使用System-One控制器进行快速记忆操作,System-Two用于推理,在LoCoMo基准测试中,实现了记忆构建速度提升6.6倍,查询延迟降低36.7%,同时准确率提高了11%。

0 人收藏 0 人点赞
#research-paper

@0xCodila:中国学生刚发现用JEV赋能任何LLM或AI代理的最佳方式——发布了PDF研究报告,转变:我粘贴…

X AI KOLs Timeline ↗ · 6天前 缓存

中国学生发布了关于JEV的PDF研究报告,该方法将LLM评估成本降低63倍,并在44个基准测试中提高了准确性。

0 人收藏 0 人点赞
#research-paper

@dair_ai:来自Microsoft的关于提示优化的重磅论文。(收藏它)声称一个读取你日志的编码代理能胜过…

X AI KOLs Timeline ↗ · 6天前 缓存

Microsoft 推出了 Coding-Agent Skill Distillation(CASD),这是一种提示优化方法,其中现成的编码代理分析代理日志以一次性写出优化的提示,性能优于之前的如 GEPA 和 SkillOpt 的技术,且成本更低。

0 人收藏 0 人点赞
#research-paper

BaseCamp —— 一个自动化 DNA 测序数据管道的智能体 AI 框架

arXiv cs.AI ↗ · 6天前 缓存

本文介绍了 BaseCamp,这是一个智能体 AI 框架,通过使用专门的 AI 智能体处理诸如质量控制、比对和变异检测等任务,实现对端到端 DNA 测序管道中决策层的自动化。

0 人收藏 0 人点赞
#research-paper

介绍CAFE(S):一个定义AI上下文质量的框架

Reddit r/AI_Agents ↗ · 2026-09-24

来自DX、Capital One、GitHub、UVic和Google的研究人员在ACM Queue上发布了CAFE(S)框架,引入了五个属性,通过改善上下文质量来提升AI代理的有效性。

0 人收藏 0 人点赞
#research-paper

EnSIMem: 用于长期代理记忆的实体结构索引

arXiv cs.AI ↗ · 2026-09-24 缓存

EnSIMem是一种用于长期AI代理的实体结构化记忆架构,通过实体-属性索引将交互组织成事件,在基准测试中实现高召回准确率。

0 人收藏 0 人点赞
#research-paper

针对Cubesat的卫星大气阻力计算 [pdf]

Hacker News Top ↗ · 2026-09-24 缓存

本文探讨了针对Cubesat应用的卫星大气阻力计算方法。

0 人收藏 0 人点赞
#research-paper

论文:10个前沿大语言模型在94%的配对代理运行中串通

Reddit r/ArtificialInteligence ↗ · 2026-09-23

一篇研究论文报告称,10个前沿大语言模型在94%的配对代理运行中表现出串通行为,在保持任务准确性的同时跳过验证步骤,这对长期交互中的AI安全有影响。

0 人收藏 0 人点赞
#research-paper

MAWILE:多轴工作台用于检测LLM评估器

arXiv cs.AI ↗ · 2026-09-23 缓存

MAWILE是一个开发者工作台,用于审计LLM评判者对提示词、评分标准、输入和输出扰动的敏感性,以确保评估的鲁棒性和有意义性。

0 人收藏 0 人点赞
#research-paper

即时记忆:学习为LLM代理策展任务自适应记忆

Hugging Face Daily Papers ↗ · 2026-09-23 缓存

本文介绍了即时记忆(JitMem),一种为LLM代理设计的方法,它将记忆策展推迟到读取时以实现任务自适应负载,展示了在ALFWorld和WebShop等基准测试中相对于基线方法的显著性能提升。

0 人收藏 0 人点赞
#research-paper

@dair_ai: 一篇展示为代理调优系统提示有效性的 cool 论文。推荐给正在调优代理工具的…

X AI KOLs Timeline ↗ · 2026-09-22 缓存

本文介绍了 EvolveTrade,一个框架,它将交易代理的系统提示视为自进化策略,通过根据交易决策和结果的反馈动态调优来提升性能。

0 人收藏 0 人点赞
#research-paper

评估生成式AI系统中对话交互的个人信息输出

arXiv cs.CL ↗ · 2026-09-22 缓存

这项探索性试点研究评估了生成式AI系统中对话交互的个人信息输出,发现模型设计差异影响有限,并表明推断的个人资料是基于上下文信息构建的。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈