black-box

标签

Cards List
#black-box

用于解决高维涡轮机械设计问题的动态聚合策略增强高效全局优化算法

arXiv cs.LG · 昨天 缓存

本文提出了一种动态聚合增强的高效全局优化算法(DA-EGO),用于解决高维涡轮机械设计问题,并通过基准测试和气动应用进行了验证。

0 人收藏 0 人点赞
#black-box

代理AI的黑箱红队测试:一个基于分类的自动化风险发现框架

arXiv cs.AI · 6天前 缓存

本文提出了一种系统化的黑箱框架,用于评估代理AI系统,引入了风险分类和自动化红队测试方法。跨代理架构的经验验证揭示了关键漏洞,治理和隐私风险比例较高。

0 人收藏 0 人点赞
#black-box

我们正在被压制吗?

Reddit r/ArtificialInteligence · 2026-08-27

这篇文章批判了AI聊天机器人的商业化,认为它们助长了依赖和批判性思维的减弱,同时产生不切实际的输出,并制造了错误信息的反馈循环。

0 人收藏 0 人点赞
#black-box

DiSCO:通过分布引导的对比提示优化防御文本到图像生成

arXiv cs.AI · 2026-08-19 缓存

DiSCO是一种免训练的黑盒防御方法,用于文本到图像模型,通过分布引导的对比提示优化防止生成不安全内容(NSFW),显著降低攻击成功率。

0 人收藏 0 人点赞
#black-box

当解释背叛后门:语言模型分类器的黑盒审计

arXiv cs.CL · 2026-08-14 缓存

本文介绍了Groundedness Drift,一种用于语言模型分类器黑盒审计的评分,利用干净的校准数据和解释性输出来检测后门。它在多种攻击家族和数据集上展示了更高的检测性能。

0 人收藏 0 人点赞
#black-box

Dead text or binding clause? Measuring and restoring constraint influence in black-box LLM dialogues

arXiv cs.AI · 2026-08-14 缓存

This paper introduces ReBIND, a framework that measures, predicts, and repairs behavioral relapse in black-box LLM dialogues where models continue to follow revoked constraints. Experiments with HumanEval show that ahead-of-time compilation significantly reduces relapse compared to a baseline, while adaptive interventions add no detectable gain.

0 人收藏 0 人点赞
#black-box

我的智能体比它取代的团队更准确,但他们仍然拒绝信任它。

Reddit r/AI_Agents · 2026-08-11

作者分享了一个比人类更准确的分诊智能体如何仍然未能被采纳,直到他们为每个决策添加了通俗易懂的解释,得出结论:可理解性比准确性更能建立信任。

0 人收藏 0 人点赞
#black-box

修正特征何时起作用?一种用于黑盒预测器上修正特征发现的智能体

arXiv cs.LG · 2026-08-07 缓存

本文介绍了Crafter,一种用于修正特征发现的智能体,通过组合搜索和LLM生成的特征来挖掘冻结黑盒预测器的残差,在六个数据集和骨干网络上实现了高达27%的错误率降低。

0 人收藏 0 人点赞
#black-box

关系响应场:黑盒LLM响应一致性与恢复的通用理论

arXiv cs.CL · 2026-08-06 缓存

本文介绍了关系响应场(RRF),这是一个理论框架,用于确定黑盒LLM响应在损坏情况下何时可以被可靠恢复,并建立了将响应一致性与真实性区分开的可辨识性条件和极小极大界。

0 人收藏 0 人点赞
#black-box

Leak It:黑盒语言模型训练数据提取的概率方法

arXiv cs.LG · 2026-08-04 缓存

本文提出了一种从黑盒语言模型中提取训练数据的概率方法,表明聚合的成员推断指标掩盖了逐文档泄露,并介绍了“leakit”审计工具。

0 人收藏 0 人点赞
#black-box

PTP:基于前文标记预测的LLM反演实现近乎精确的提示重建

arXiv cs.CL · 2026-08-03 缓存

本文提出了PTP,一种功能性LLM反演方法,利用目标黑盒LLM生成的合成数据,从头开始训练一个使用前文标记预测的逆语言模型,从而能够从响应中近乎精确地重建提示,性能优于先前工作。

0 人收藏 0 人点赞
#black-box

无人真正解决的鸿沟:AI代理能构建可运行的应用,但“无人值守的生产环境”仍意味着信任一个黑盒

Reddit r/ArtificialInteligence · 2026-07-24

讨论了AI代理能够构建可运行的应用,但在无人值守的生产环境中部署时仍是不可信任的黑盒这一未解决的问题。

0 人收藏 0 人点赞
#black-box

构建了一个能起草销售演示文稿的AI代理。销售代表们直到能看到它为什么选择每张幻灯片后才开始使用它。

Reddit r/AI_Agents · 2026-07-22

一位开发者构建了一个能起草销售演示文稿的AI代理,但采用率几乎为零,直到代理展示了每张幻灯片选择背后的推理。教训:让代理的决策可见对于信任比原始输出质量更重要。

0 人收藏 0 人点赞
#black-box

用于企业NLP系统中用户信任的鲁棒解释

arXiv cs.CL · 2026-07-20 缓存

本文提出了一种统一的黑盒鲁棒性评估框架,用于评估企业NLP中词元级解释的鲁棒性,并对比了编码器(BERT、RoBERTa)和解码器(Qwen、Llama)模型。研究发现,解码器大语言模型产生的解释明显更稳定,且稳定性随模型规模提升而增强,同时提供了部署前模型选择的成本-鲁棒性权衡曲线。

0 人收藏 0 人点赞
#black-box

干预式基础审计:通过谓词替换对LLM思维链进行黑盒前提依赖性测试

arXiv cs.AI · 2026-07-16 缓存

提出干预式基础审计作为一种黑盒、步骤级测试,用于检查LLM思维链推理是否真正依赖于其陈述的前提。在ProntoQA上使用GPT-4o进行评估,在检测证明树依赖关系上达到F1=0.806,显著优于自一致性基线。

0 人收藏 0 人点赞
#black-box

使用零参数模型打开黑箱

Reddit r/artificial · 2026-07-15

一种新颖的模型可解释性方法,使用零参数模型打开复杂AI系统的黑箱,无需额外训练或参数。

0 人收藏 0 人点赞
#black-box

GPT-2 内部完全解码:黑盒全开,附带演示

Reddit r/artificial · 2026-07-11

BABEL 编解码器实现了对 GPT-2 small 内部状态的首次完整解码,重构了其 94.7% 的行为,并支持用英语读写模型,同时提供开源资源和演示。

0 人收藏 0 人点赞
#black-box

镜头下的Auto-DSM:面向基于LLM的DSM生成的黑盒评估框架

arXiv cs.AI · 2026-07-08 缓存

本文提出了一个黑盒评估框架,用于评估大型语言模型从结构化技术文档生成设计结构矩阵(DSM)的能力。该框架引入了可复现的度量指标和复合质量评分,结果表明,虽然LLM能够生成看似合理的DSM,但它们仍然对歧义和提示措辞敏感。

0 人收藏 0 人点赞
#black-box

在受限API访问下对LLM架构属性的黑盒推断

arXiv cs.LG · 2026-07-03 缓存

本文介绍NightVision,一种利用受限黑盒API访问来估计大型语言模型隐藏维度、深度和参数数量的攻击方法。它采用新颖的公共集提示技术与频谱分析,在开源模型上实现了高精度。

0 人收藏 0 人点赞
#black-box

CBD:通过受控行为差异实现仅API的LLM黑盒遗忘

arXiv cs.LG · 2026-06-29 缓存

CBD提出了一种仅通过API的黑盒遗忘框架,用于大语言模型。该框架利用两个辅助模型在保留数据和目标数据之间创建受控行为差异,相比现有方法实现了更优的遗忘-效用权衡。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈