标签
一项关于模拟硬件噪声的实验表明,准确率在阈值处崩溃而非平滑下降,而噪声感知训练显著移动了该阈值。
这篇arXiv论文介绍了CohortHijack,一种鲁棒性审计方法,通过从单细胞查询队列中移除非目标细胞,来测试在不改变目标细胞表达谱的情况下,注释工具可能如何被操纵。研究表明,在保留目标细胞的同时,结构化移除和搜索策略可以改变主流流程中的精炼标签,从而将查询队列组成识别为一个攻击面。
介绍GROM,一种无梯度的单次机器遗忘方法,通过岭正则化最小二乘法计算闭式加性权重更新,在TOFU和WMDP等基准上实现了最先进的遗忘-效用权衡,并能抵抗基于量化的恢复攻击。
This paper proposes a method to identify spuriously correlated samples after model convergence by measuring prediction fragility under input perturbation, requiring no group labels or early-stopping epochs. Rebalancing training with detected samples improves worst-group accuracy on Waterbirds from 57.3% to 80.8%.
This paper presents a triple-robustness analysis of RAG for multi-hop traceability, varying embedder, corpus, and judge across thousands of runs. It finds that over-citation is architecturally universal in GraphRAG but its faithfulness consequences are corpus-conditional, and LLM-as-judge faithfulness is fragile across retrieval states.
这篇arXiv论文评估了推理型大语言模型的心智理论能力,发现其对提示变化和任务扰动的稳健性有所提高。作者将这一增益解读为支持基于稳健性的解释,而非新的ToM特定能力。
本文提出了一种利用语义等价的对抗性扰动来诱发LLM内在幻觉的框架,表明即使保持查询含义不变,最先进的模型在上下文忠实度上也会显著下降。
本文介绍了ExpG,一种构建和优化自适应引导的机制,该机制捕捉每个工具的能力边界和最佳实践,使代理能够在多样化的运行时条件下更鲁棒地使用工具。实验表明,在工具选择、工具调用和响应生成方面取得了持续改进,使较小的代理能够超越未使用ExpG的较大代理。
介绍ARB,一个用于评估AI文本检测器的匹配作者重写基准,表明尽管对直接LLM生成的文本具有高召回率,但当人类文本被LLM重写时,检测器性能显著下降。
This paper introduces CAGE, a certification method that verifies whether tool-using LLM agents remain authorized under typed-return uncertainty, including binding faults and numerical drift. It proves that separate channel certification is insufficient and provides exact and learned-gate variants for practical authorization.
本文评估了GRU、LSTM和Transformer编码器模型在基于车辆远程信息处理数据对2级自动驾驶系统进行分类时的性能,并引入了一个模拟真实数据损坏的鲁棒性评估框架。
分析主要AI模型(GPT、Claude、Gemini、Kimi)跨厂商产生的零字节输出现象,揭示影响生成可靠性的语义空矩阵。
本文研究了语言模型在27种语言中是否对替代(非规范)分词保持鲁棒性,发现英语中观察到的不变性并不具有普适性,且分词碎片化程度更高的语言表现出更高的敏感性。作者证明,使用多分词数据的LoRA微调可以有效缓解这种敏感性。
本文研究将关于监督微调(SFT)的经验跨对齐训练、模型生物和玩具模型进行迁移,表明像基于行为原因的训练和混合模型内数据等技术可以改善泛化性和能力保持。
作者介绍了AI Security Leaderboard,该排行榜通过让模型接受1500次自动化越狱尝试来评估前沿模型的鲁棒性,突出了各模型在安全性上的差距,并邀请社区就方法和后续步骤提供反馈。
深入探讨 Netstack3 的设计理念,这是 Fuchsia 基于 Rust 的网络栈,在内测期间实现了极低的 bug 数量,现已部署在数百万台设备上,崩溃次数比前代减少了 20 倍。
本文系统研究了面向小规模语言模型智能体(70-500M参数)的强化学习不稳定性问题,识别出三种失效模式,并提出了稳健技术,包括合并并重新初始化适配器方法及安全机制;该方法实现了稳定收敛并提升了胜率。
本文介绍了VisDeception,一个用于评估视觉-语言模型对欺骗性图表设计鲁棒性的基准,并提出了一种多智能体缓解框架,通过将推理基于结构化图表元数据来减少由欺骗引起的错误。
StabilityBench 是一个基准测试操作符,它将单轮大语言模型评估转化为包含用户模拟和诱导模块的多轮交互,揭示了当前模型中显著的性能不稳定性,并推动了更真实的评估协议。
本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。