标签
本研究在开放模型和跨层转码器上对语言模型中韵律规划的可泛化性进行压力测试,发现有效规划位置是发射相邻的,而非之前报道的换行符驻留。
本文介绍了 Wiggle 框架,这是一种针对 LLM 裁判认识论稳定性的统一压力测试,涵盖 14 项任务,衡量机械一致性、单轮信念与多轮持久性。研究发现,所有 9 个受研究的前沿模型在压力下都会大幅翻转判决,且成功的压力通常相对于基准真相而言具有净破坏性。
一位开发人员构建了一个完全自主的定制智能体架构,可以在无人干预的情况下运行数周。他正在向社区寻求极端、对抗性的任务来对其进行彻底的压力测试,因为他无法再相信自己的判断。
本文介绍了Decoding-Level Taboo,这是一种运行时logit空间压力测试,通过迫使LLM偏离其常规生成路径来评估路径外鲁棒性,结果表明鲁棒性随模型规模和指令对齐程度的提高而改善。
一个基于联合国商品贸易统计数据(UN Comtrade)模拟霍尔木兹海峡关闭对全球石油贸易影响的工具,支持调整产能保留、供需弹性和紧急库存动用等参数。
作者讲述了让 Reddit 尝试破解其 AI 小工具的结果,分享了来自社区压力测试的意外结果和教训。
一名用户使用 GPT-5.5-Pro 和 ForgeCAD 生成直升机模型以进行压力测试,突显了当前在曲面建模和模型能力方面的局限性。