标签
作者在47天内建立了一个控制室,以证明区块链的问题是可见性而非信任,并提供工具来观察共识活动和网络拓扑。
本文介绍了推理评审团(Reasoning Jury),这是一个利用开源权重LLM评审团和受调控的共识机制来评估长推理轨迹的系统,在识别推理缺陷方面显著优于前沿模型,而成本仅为其一小部分。
本文介绍了ConRub-Med,一种利用多个语言模型生成的共识评分标准来对开放医学问答进行奖励的强化学习方法,在包括HealthBench-Hard在内的多个基准上取得了最先进的结果。
An in-depth technical article explaining the ABD algorithm, quorum replication, and why ABD does not solve consensus, with runnable Python examples.
本文研究廉价的开放权重大语言模型能否以远低于前沿模型的成本,同样可靠地评判自然语言数学证明。在 IMO-GradingBench 上,三个廉价评判模型在通过/不通过的一致性上与前沿模型相当,作者推荐“三者全部通过”的一致性规则以实现高性价比部署。
本文提出了一种面向无服务器环境的依赖感知自动缩放框架,集成了基于图的瓶颈识别、通过概率集成的多模型预测(MLP、LSTM、CNN)以及成本感知的缩放控制。实验表明,预测准确率达到99.88%,并降低了基础设施成本。
一篇研究论文,介绍了CANON,一种无标签自蒸馏方法,利用采样解之间的共识为训练大型语言模型在推理任务上提供密集的标记级监督,可将pass@1提升最多12个百分点,并以极少的计算量超越无标签强化学习。
作者对Demis Hassabis的最新文章提出批评,认为它读起来像企业战略,放弃了他早先对全球AI治理的愿景,同时指出AI CEO们对此有广泛共识,并对地缘政治框架和盲点提出了质疑。
本文研究运行时刻交互图如何影响开放权重语言模型群体(参数规模1.1B–32B)中的惯例形成,采用命名游戏协议,发现同质性路由加剧碎片化,而寻桥路由在存在记忆的条件下可修复共识。
本文研究了在不可靠智能体群中,为实现正确共识,如何最优放置昂贵的“oracle”校正器,揭示了亚模性质以及一个依赖于成本-强度曲率的预算-正确性边界。
本文提出了Epistemic State Replication (ESR),一种面向自主代理分布式系统的信念复制层,它将复制从数据可见性转向知识可见性,使得即使生成模型输出存在差异,也能做出语义上等效的决策。
一篇论述文章,认为LLM通过返回最大概率的续写,可能在无意中抑制了真正的创新与偏差,导致文化向平均值趋同,而非真正的新事物。
本文讨论了使基于LLM的代理更具确定性的各种技术,例如黄金数据集、护栏、共识机制、回归测试、编码逻辑和超参数调优,并询问其他成功的方法。
本文建模了多智能体LLM系统中延迟验证的影响,揭示了延迟校正会破坏共识稳定并引发振荡。它推导出闭式稳定性阈值,并提供了一种用于最优校正器放置的贪心近似算法,在五个开放模型上的实验验证了该结果。
本文描述了用多个AI模型的共识取代单一模型的代码审查,只有明确批准才算数,这带来了更可靠的代码审查,但代价是更长的讨论。
本文介绍了对基于Isabelle构建的自动定理证明工具IsabeLLM的改进,通过集成检索增强生成框架、错误追踪和反例生成。改进后的工具在比特币工作量证明共识协议的形式化验证上进行了评估。
提出SSD-FL,一种无服务器半去中心化联邦学习方法,通过有效损失函数和基于Cheeger不等式的迭代聚类优化异构环境中的聚类形成,提升了收敛速度和通信效率。
一篇反思文章,认为在多模型设置中,共识输出的价值低于分歧,分歧揭示了问题中真正存在争议的部分。文章质疑共识是否应该是目标,以及如何区分有建设性的分歧与无意义的噪音。
本文认为,人工智能创造了一个快速反馈循环,人类和机器相互塑造真理,加速共识转变,使得真理越来越合成且脱离现实。