标签
一种叫做虚假探测的技术使用自适应API级别搜索来找到能够揭示黑箱LLM潜在状态的问题,例如通过特定提示区分能力评估。
Yann LeCun 重申了他的立场,即仅凭自回归大语言模型无法实现人类水平的人工智能,并强调了非自回归搜索在当前AI推理系统中的作用。
一条引用推文突出了Yann LeCun的声明,即扩大LLMs规模无法实现人类水平的智能或AGI,称这种想法为'完全胡说'。
文章认为,大多数所谓的AI智能体实际上是附加上了LLM的简单工作流,缺乏真正的适应性,并提供了一种测试方法来区分真正的智能体与伪装的工作流。
一个适用于Lobsters网站的Greasemonkey脚本,将'vibecoding'标签重命名为'llms',以显示与大型语言模型相关的内容。
本文提出了BaCVA,一种用于大语言模型情境化个性化价值对齐的推理时贝叶斯方法,通过整合静态个人价值观与情境特定显著性来提高适应性和数据效率。
Epydemix代理框架扩展了一个开源流行病建模库,使AI代理能够处理从自然语言到结果的建模过程,提高了可重复性和效率。
本文证明LLMs中的Transformer在合并输入时表现出线性叠加,支持叠加线性假设,并提出一种引导解码方法以分离叠加输出。
Hill Sampling is a simple test-time scaling method that uses frozen LLMs to iteratively sample and edit the best-verified program, achieving state-of-the-art results on algorithmic problems like circle packing and Erdős' minimum-overlap problem.
TicTacBench is a new benchmark designed to evaluate the timing closure capabilities of coding agents in RTL design. It reveals that current agents have significant room for improvement and proposes TicTacSkill to enhance their performance.
Spirit AI 正在使用大约1,000人手动操作真实物体,为机器人生成训练数据,与用于大型语言模型的免费互联网数据形成对比。
本文介绍了SWE-Proof,这是一个针对现实世界软件问题的经过形式验证的代码补丁基准,表明形式验证能提高LLM生成代码的错误检测能力,并将规范综合识别为一个关键开放问题。
LogicTrack 是一个神经符号框架,通过形式化逻辑求解器审计大型语言模型的推理轨迹,以确保逻辑有效性,从而同时提升推理链的可验证性和最终答案的准确性。
GameASG-Bench 是一个用于评估游戏开发中自主软件生成系统的基准测试平台,它通过静态与运行时检查来纳入行为可测试性。
本文推荐Jev创始人Diogo Almeida的一次演讲,批评了ChatGPT和Claude Code等AI模型中RLHF的使用,并倡导超越人类偏好优化的真正自动化。