black-box

标签

Cards List
#black-box

无人真正解决的鸿沟:AI代理能构建可运行的应用,但“无人值守的生产环境”仍意味着信任一个黑盒

Reddit r/ArtificialInteligence · 4天前

讨论了AI代理能够构建可运行的应用,但在无人值守的生产环境中部署时仍是不可信任的黑盒这一未解决的问题。

0 人收藏 0 人点赞
#black-box

构建了一个能起草销售演示文稿的AI代理。销售代表们直到能看到它为什么选择每张幻灯片后才开始使用它。

Reddit r/AI_Agents · 6天前

一位开发者构建了一个能起草销售演示文稿的AI代理,但采用率几乎为零,直到代理展示了每张幻灯片选择背后的推理。教训:让代理的决策可见对于信任比原始输出质量更重要。

0 人收藏 0 人点赞
#black-box

用于企业NLP系统中用户信任的鲁棒解释

arXiv cs.CL · 2026-07-20 缓存

本文提出了一种统一的黑盒鲁棒性评估框架,用于评估企业NLP中词元级解释的鲁棒性,并对比了编码器(BERT、RoBERTa)和解码器(Qwen、Llama)模型。研究发现,解码器大语言模型产生的解释明显更稳定,且稳定性随模型规模提升而增强,同时提供了部署前模型选择的成本-鲁棒性权衡曲线。

0 人收藏 0 人点赞
#black-box

干预式基础审计:通过谓词替换对LLM思维链进行黑盒前提依赖性测试

arXiv cs.AI · 2026-07-16 缓存

提出干预式基础审计作为一种黑盒、步骤级测试,用于检查LLM思维链推理是否真正依赖于其陈述的前提。在ProntoQA上使用GPT-4o进行评估,在检测证明树依赖关系上达到F1=0.806,显著优于自一致性基线。

0 人收藏 0 人点赞
#black-box

使用零参数模型打开黑箱

Reddit r/artificial · 2026-07-15

一种新颖的模型可解释性方法,使用零参数模型打开复杂AI系统的黑箱,无需额外训练或参数。

0 人收藏 0 人点赞
#black-box

GPT-2 内部完全解码:黑盒全开,附带演示

Reddit r/artificial · 2026-07-11

BABEL 编解码器实现了对 GPT-2 small 内部状态的首次完整解码,重构了其 94.7% 的行为,并支持用英语读写模型,同时提供开源资源和演示。

0 人收藏 0 人点赞
#black-box

镜头下的Auto-DSM:面向基于LLM的DSM生成的黑盒评估框架

arXiv cs.AI · 2026-07-08 缓存

本文提出了一个黑盒评估框架,用于评估大型语言模型从结构化技术文档生成设计结构矩阵(DSM)的能力。该框架引入了可复现的度量指标和复合质量评分,结果表明,虽然LLM能够生成看似合理的DSM,但它们仍然对歧义和提示措辞敏感。

0 人收藏 0 人点赞
#black-box

在受限API访问下对LLM架构属性的黑盒推断

arXiv cs.LG · 2026-07-03 缓存

本文介绍NightVision,一种利用受限黑盒API访问来估计大型语言模型隐藏维度、深度和参数数量的攻击方法。它采用新颖的公共集提示技术与频谱分析,在开源模型上实现了高精度。

0 人收藏 0 人点赞
#black-box

CBD:通过受控行为差异实现仅API的LLM黑盒遗忘

arXiv cs.LG · 2026-06-29 缓存

CBD提出了一种仅通过API的黑盒遗忘框架,用于大语言模型。该框架利用两个辅助模型在保留数据和目标数据之间创建受控行为差异,相比现有方法实现了更优的遗忘-效用权衡。

0 人收藏 0 人点赞
#black-box

黑盒大型语言模型的知识蒸馏

Hacker News Top · 2026-06-28 缓存

提出了一种名为 Proxy-KD 的新方法,通过代理模型从黑盒大型语言模型(如 GPT-4)中蒸馏知识到较小的模型,超越了传统的黑盒和白盒知识蒸馏技术。

0 人收藏 0 人点赞
#black-box

大型语言模型黑盒不确定性估计方法的系统性评估

arXiv cs.AI · 2026-06-20 缓存

本文对4种模型和4种数据集设置下的24种黑盒不确定性估计方法进行了系统性回顾和基准测试,发现没有任何单一方法占主导地位,但结合多种不确定性信号的混合方法表现出色。

0 人收藏 0 人点赞
#black-box

学习错误的上下文:时间序列基础模型的黑盒在线自适应

arXiv cs.LG · 2026-06-15 缓存

本文提出ORCA,一种通过学习预测错误的上下文来实现时间序列基础模型黑盒在线自适应的方法。该方法在五个TSFM和八个数据集上展示了有效性,解决了基于闭源API的模型自适应挑战。

0 人收藏 0 人点赞
#black-box

跨模型局部等距一致性下的向量链接

arXiv cs.AI · 2026-06-01 缓存

本文介绍了Vector Linking方法,该方法通过利用局部几何一致性来恢复来自不同黑盒编码器的嵌入之间的对应关系,并提出了一种基于参考的迭代式几何嵌入哈希方法,该方法使用少量配对的锚点种子集。

0 人收藏 0 人点赞
#black-box

黑盒LLM蒸馏的有界行为不可区分性

arXiv cs.LG · 2026-06-01 缓存

本文提出有界行为不可区分性,一种超越语义相似性的黑盒LLM蒸馏评估形式化框架。在Qwen和Llama模型上的实验表明,蒸馏降低了但并未消除对抗性可区分性,凸显了类别感知评估的必要性。

0 人收藏 0 人点赞
#black-box

三个在演示中不会出现的生产AI记忆故障:

Reddit r/AI_Agents · 2026-05-15

本文强调了生产AI记忆系统中的三种常见失败模式:过时的偏好持续存在、讽刺性评论被当作字面偏好存储、以及摘要比其来源事实更持久。文章认为AI记忆行业缺乏出处、置信度评分和版本控制,造成了妨碍调试的黑箱问题。

0 人收藏 0 人点赞
#black-box

使用分布对齐对抗性蒸馏估计黑盒LLM的不确定性

arXiv cs.CL · 2026-05-08 缓存

本文提出了一种分布对齐对抗性蒸馏(DisAAD)方法,该方法使用一个轻量级代理模型,仅以原始模型1%的规模来估计黑盒大语言模型的不确定性,实现了无需内部参数或多次采样的可靠量化。

0 人收藏 0 人点赞
#black-box

代理建模:解读黑盒大模型在医学预测中的隐含知识

arXiv cs.CL · 2026-04-23 缓存

研究者提出一种代理建模框架,可量化并解释黑盒大模型内部编码的医学知识,同时揭示有效关联与持续的种族偏见。

0 人收藏 0 人点赞
#black-box

关注未见质量:通过软混合字母估计揭示 LLM 幻觉

arXiv cs.CL · 2026-04-22 缓存

研究者提出 SHADE,一种混合估计器,在仅能获取少量黑盒样本时,融合 Good-Turing 覆盖率与图谱线索,量化语义不确定性并检测大模型幻觉。

0 人收藏 0 人点赞
#black-box

背景也重要:用可迁移攻击攻破医学视觉语言模型

Hugging Face Daily Papers · 2026-04-19 缓存

MedFocusLeak 首次提出针对医学视觉语言模型的可迁移黑盒对抗攻击,通过不可察觉的背景扰动在六种成像模态上误导临床诊断。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈