标签
一位实习生通过标签哈希将分类模型的性能提升至99%,结果被发现是数据泄露,引发了伦理讨论和团队流程的审查。
文章阐述了向量搜索中的后置过滤租户作用域如何导致代理记忆系统泄露数据,并建议在写入时设置作用域以防止跨租户数据暴露。
本文讨论了共享AI聊天如何可能损害隐私,因为分享的链接并不像用户所假设的那样私密,并可能导致API密钥等敏感数据的意外暴露。
文章主张,AI交易智能体应包含一个质疑型智能体,以检查诸如数据泄露和不可能假设等缺陷,而不是仅仅生成更多策略。
本文审视了临床基础模型中的隐私风险,其中模型介导的泄露即使在去标识化处理后仍可能导致患者重新识别。我们提出了一个实用的风险评估框架,并将现实中的泄露场景映射到HIPAA和GDPR等法律体系,提供了技术与法律相结合的综合缓解措施。
本文表明,在LLM回测中,标准的前/后训练截止检查对时间泄漏的检测毫无信息量,因为近因效应会模仿泄漏。文章提出了使用已知截止点和匹配的干净对照组的新估计器,以测量泄漏并计算调整分数,并在前沿模型上进行了验证。
本文证明了在滑动窗口序列上使用简单的训练/测试分割会严重夸大或缩小预测性维护中多任务学习的性能指标,并提出了一种泄漏鲁棒的评估协议。
本系统综述评估了机器学习模型在早期慢性肾脏病预测中的方法论可靠性,揭示数据泄露使报告的准确性虚高超过15%,且超过80%的预测因子在不同研究中缺乏稳定性。
微软CEO Satya Nadella警告说,使用来自OpenAI和Anthropic等实验室的AI模型的公司,正在不知不觉中交出专有商业数据,并倡导公司保留数据所有权,构建协调层以在不同模型之间切换。
一条推特串,列出了面试官期望候选人了解的13个核心机器学习概念,涵盖从偏差-方差权衡到维度灾难等主题。
本文提出了一种决策理论框架,仅利用模型输出和结果来检测预测模型中的数据泄露,证明了某些泄露类型无需外部基准或训练代码即可识别。
PropMe是一个倾向性感知框架,用于评估LLM的记忆,区分强制复现能力和自然倾向,使用SimpleTrace在开放模型和数据集上进行确定性归因。
本文介绍了 TypewriterLM,一个参数规模为 7.24B 的语言模型,仅基于 1913 年之前的英文文本进行训练;同时介绍了 TypewriterCorpus(一个包含 540 亿 token 的清洗后历史语料库)以及指令微调数据集,以避免时间泄露和前瞻偏差。此外,还提出了一个基准测试套件 History-Event,用于评估时间定位能力和泄露情况。
普林斯顿大学的一项研究发现,在17个领域的近300篇AI论文中存在数据泄露问题,导致结果过于乐观。作者强调了意外泄露数据的容易程度,并提醒不要轻信那些令人印象深刻的AI声明而不检查是否存在泄露。
发布了一款免费工具,帮助用户在服务提供商接收之前,检测大语言模型(LLM)提示词中泄露的个人身份信息(PII)。
OpenGuardrails 是一个面向AI安全的开源平台,通过统一模型提供上下文感知的内容安全与操纵检测(例如提示注入、越狱),以及一个独立的NER管道用于数据泄露识别。它在安全基准测试上取得了最先进的性能,并支持私有化、企业级部署。
MIT 6.566课程讲座介绍了AI代理的安全挑战,包括非对抗性错误(如意外删库)和对抗性攻击(如提示注入、数据泄露),并讲解了从语言模型到对话代理的系统构建基础。