标签
讨论了AI代理能够构建可运行的应用,但在无人值守的生产环境中部署时仍是不可信任的黑盒这一未解决的问题。
一位开发者构建了一个能起草销售演示文稿的AI代理,但采用率几乎为零,直到代理展示了每张幻灯片选择背后的推理。教训:让代理的决策可见对于信任比原始输出质量更重要。
本文提出了一种统一的黑盒鲁棒性评估框架,用于评估企业NLP中词元级解释的鲁棒性,并对比了编码器(BERT、RoBERTa)和解码器(Qwen、Llama)模型。研究发现,解码器大语言模型产生的解释明显更稳定,且稳定性随模型规模提升而增强,同时提供了部署前模型选择的成本-鲁棒性权衡曲线。
提出干预式基础审计作为一种黑盒、步骤级测试,用于检查LLM思维链推理是否真正依赖于其陈述的前提。在ProntoQA上使用GPT-4o进行评估,在检测证明树依赖关系上达到F1=0.806,显著优于自一致性基线。
BABEL 编解码器实现了对 GPT-2 small 内部状态的首次完整解码,重构了其 94.7% 的行为,并支持用英语读写模型,同时提供开源资源和演示。
本文提出了一个黑盒评估框架,用于评估大型语言模型从结构化技术文档生成设计结构矩阵(DSM)的能力。该框架引入了可复现的度量指标和复合质量评分,结果表明,虽然LLM能够生成看似合理的DSM,但它们仍然对歧义和提示措辞敏感。
本文介绍NightVision,一种利用受限黑盒API访问来估计大型语言模型隐藏维度、深度和参数数量的攻击方法。它采用新颖的公共集提示技术与频谱分析,在开源模型上实现了高精度。
CBD提出了一种仅通过API的黑盒遗忘框架,用于大语言模型。该框架利用两个辅助模型在保留数据和目标数据之间创建受控行为差异,相比现有方法实现了更优的遗忘-效用权衡。
提出了一种名为 Proxy-KD 的新方法,通过代理模型从黑盒大型语言模型(如 GPT-4)中蒸馏知识到较小的模型,超越了传统的黑盒和白盒知识蒸馏技术。
本文对4种模型和4种数据集设置下的24种黑盒不确定性估计方法进行了系统性回顾和基准测试,发现没有任何单一方法占主导地位,但结合多种不确定性信号的混合方法表现出色。
本文提出ORCA,一种通过学习预测错误的上下文来实现时间序列基础模型黑盒在线自适应的方法。该方法在五个TSFM和八个数据集上展示了有效性,解决了基于闭源API的模型自适应挑战。
本文介绍了Vector Linking方法,该方法通过利用局部几何一致性来恢复来自不同黑盒编码器的嵌入之间的对应关系,并提出了一种基于参考的迭代式几何嵌入哈希方法,该方法使用少量配对的锚点种子集。
本文提出有界行为不可区分性,一种超越语义相似性的黑盒LLM蒸馏评估形式化框架。在Qwen和Llama模型上的实验表明,蒸馏降低了但并未消除对抗性可区分性,凸显了类别感知评估的必要性。
本文强调了生产AI记忆系统中的三种常见失败模式:过时的偏好持续存在、讽刺性评论被当作字面偏好存储、以及摘要比其来源事实更持久。文章认为AI记忆行业缺乏出处、置信度评分和版本控制,造成了妨碍调试的黑箱问题。
本文提出了一种分布对齐对抗性蒸馏(DisAAD)方法,该方法使用一个轻量级代理模型,仅以原始模型1%的规模来估计黑盒大语言模型的不确定性,实现了无需内部参数或多次采样的可靠量化。
研究者提出 SHADE,一种混合估计器,在仅能获取少量黑盒样本时,融合 Good-Turing 覆盖率与图谱线索,量化语义不确定性并检测大模型幻觉。
MedFocusLeak 首次提出针对医学视觉语言模型的可迁移黑盒对抗攻击,通过不可察觉的背景扰动在六种成像模态上误导临床诊断。