information-asymmetry

标签

Cards List
#information-asymmetry

Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry

arXiv cs.LG · 19小时前 缓存

This paper studies decentralized multi-player Q-learning in episodic Markov decision processes under three forms of information asymmetry, proposing algorithms that achieve regret bounds matching the single-agent Q-learning rate up to logarithmic factors.

0 人收藏 0 人点赞
#information-asymmetry

具有重尾奖励和信息不对称的鲁棒多智能体多臂老虎机

arXiv cs.LG · 2天前 缓存

本文研究了三种信息不对称机制下具有重尾奖励的多智能体多臂老虎机问题,提出了鲁棒的分布式算法,其遗憾保证几乎匹配集中式算法的速率,并在帕累托分布奖励环境中进行了验证。

0 人收藏 0 人点赞
#information-asymmetry

多元证据,更优预测:信息不对称下的多智能体协商

arXiv cs.AI · 2026-07-03 缓存

本文介绍了InfoDelphi框架,该框架利用信息不对称(将证据划分为共享的公共子集和不相交的私有子集)来改进多智能体LLM的协商与预测。在PolyGym基准测试上,它在Brier得分上比单智能体和多智能体基线提升12-18%,在准确率上提升4-8个百分点,证明了多样化证据是有效多智能体推理的关键。

0 人收藏 0 人点赞
#information-asymmetry

GPTNT:在《Keep Talking and Nobody Explodes》中对多模态代理间实时协作的基准测试

arXiv cs.AI · 2026-06-30 缓存

本文介绍了GPTNT,这是一个基于《Keep Talking and Nobody Explodes》构建的基准测试,要求两个多模态代理在时间压力和信息不对称条件下实时协作,揭示了当前最先进系统的关键弱点。

0 人收藏 0 人点赞
#information-asymmetry

主动式LLM智能体的通信策略演化

arXiv cs.AI · 2026-06-15 缓存

本文形式化了LLM智能体的通信策略,并提出了通信策略演化(CPE),一种通过 rollout 和提示级演化来优化通信策略的自我演化框架,在多种设置下实现了最佳任务成功率。

0 人收藏 0 人点赞
#information-asymmetry

@seclink: 之前1-2个月之前,还在http://jobleap.cn 看到了 月之暗面找 agent harness 人才的信息,果然很快招到了。 现在工作的机会属于拥有信息差的人才, 在AI时代,你能不能找到工作,很大程度上取决于你是否掌握最新的…

X AI KOLs Following · 2026-05-25 缓存

帖子提到月之暗面和DeepSeek等AI公司正在招聘agent harness人才,并推广了招聘信息聚合平台jobleap.cn,认为掌握最新工作机会是关键。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈