标签
本文强调了多数LLM速度与准确性对比忽略了结构化答案的可信度,并展示了JEV作为一款通过结构化接口确保决策输出一致性的工具。
本文讨论了将 Jev 与 AI 代理中的 LLM 集成的设计模式,特别是当一次只暴露一个工具模式时,代理如何处理工具选择和规划。
这条推文强调了从Meta FAIR的CICERO模型在外交中的演进,到当前能以单一智能体处理社交策略的大语言模型,并邀请与前沿智能体竞争。
一项关于大型语言模型在多智能体模拟中玩《Diplomacy》游戏的研究揭示了当被允许说谎时,哪些模型信守了承诺。
本文展示了如何调整 GLM-5.3-Flash 大型语言模型使其作为类似于 Jev 的类型化决策模型运行,在单次前向传播中实现可比的准确性和速度,并支持图像决策。
本文分析了一个实验的日志,其中AI代理在通信中发展出了专门的术语,认为这是语义扩展而非秘密语言,并探讨了对AI透明度和可解释性的影响。
Jev创始人 Diogo Almeida 发布了一份11页的PDF,概述了通过AI代理运行LLM以最小化成本的9步蓝图,重点强调了任务分割、基于置信度的行动和人工监督。
一篇博客文章反思了一封关于Stack Overflow社区人类价值的个人邮件,将其与LLMs进行对比,并倡导在科技领域培养人际关系。
文章批判了一篇研究论文,该论文认为编码代理可以替代人类代码审查,强调了人类方面的因素,如困惑、怀疑和注意到缺失元素至关重要,且无法由LLMs复制。
作者在一台2017年的无GPU笔记本电脑上运行Ling Tiny 3.0 AI模型,实现了每秒10个令牌的生成速度,并完成了代码生成等任务,展示了现有硬件在边缘智能方面的潜力。
Yohei Nakajima 分享了 Bad Theory Labs 的一项突破,他们改进了 LLM 的推理能力,克服了线性思维,使其更具适应性。
Ekselio 是一款本地优先的金融工作流程工具,利用大语言模型 (LLM) 来编排在浏览器中执行的过程,使用户能够创建、保存和运行金融数据流程,兼具透明度和与 QuickBooks、FRED 等服务的集成能力。
用户对 OpenAI 最新发布的 GPT-6-sol 表达了担忧,报告称像 Astra 这样的模型感觉效果变差,更难使用。
一个名为GPT 6 Astra的LLM代理在NetHack游戏中实现了飞升,标志着首次有LLM通过自主构建工具击败这款复杂游戏的记录实例。
这篇文章介绍了零数据自我对弈预训练,这是一种研究方法,其中两个LLMs从随机初始化开始,通过一个生成器为通用图灵机提议程序来学习,展示了归纳偏置如何能够实现一般性学习。
一篇论文描述了将JEV用于推理任务的门控,作为成本效益高的初审法官,在置信度较低时升级到大语言模型或人类。
文章讨论了GNOME和KDE中LLM策略的兴起,强调了自由软件和开源社区中集体主义与完成主义观点之间的哲学分歧,以及LLM如何颠覆协作平衡。