标签
文章解释SOC 2合规不需要拉取请求;Amp展示了替代控制,如限制推送访问、签名提交、自动化CI和审计跟踪,以实现合规,强调基于风险的方法而非标准流程。
This paper presents IntelliAudit, a retrieval-grounded multi-agent system that uses large language models to evaluate IT audit controls against evidence corpora, generating cited recommendations and remediation guidance. The authors instantiate it on ISO/IEC 27001 and find it useful for audit preparation while emphasizing the need for human oversight.
本文对英语来源多语言RAG在五种查询语言下的隐私风险进行了审计,检验非英语查询是否会加剧PII泄漏。通过使用Qwen2.5-7B流水线和两阶段防御,研究发现,在仅进行输出过滤时,英语的点估计泄漏率最高;而在加入输入判别器后,阿拉伯语和斯瓦希里语仍存在残余泄漏。
介绍了FairFund-Bench,一个用于评估LLM资源分配中分配偏差的基准,表明审计格式会改变偏差的方向和幅度,且因果框架效应显著超过人口统计效应。
本文对放射学视觉语言模型基准进行了取证式可重复性审计,发现预期协议与发布产物之间存在差异,这些差异使原始声明失效。作者提出了一种基准合约,以暴露此类失败类别。
本文审查了主要的LLM基准测试(GPQA、MMLU-Pro、MMMU-Pro),发现4.5%至11.8%的项目存在错误答案键或格式错误,并发布了修正后的‘Clean’版本供直接使用。
Bastillion 5.1 是一个基于Web的SSH网关和密钥管理工具,现在支持会话审计和回放,允许用户记录每一个SSH会话,并按要求回放以满足合规性要求。
关于审计网站HTML以解决AI可提取性问题的教程,包括构建Python审计脚本和添加CI检查以保持可提取性。
本文审计了LLM集成的五个多样性指标,发现它们与多数投票增益的关联与模型能力高度纠缠,且在控制能力后不稳定。唯一稳健的信号是适度的残差成对共失败关联。
加州的隐私机构启动了首次审计,针对外卖和拼车应用,以确保其遵守州隐私法,重点关注那些收集用户和员工大量个人数据的零工经济平台。
苹果公司发布了其私有云计算(PCC)配置系统的系统与组织控制(SOC)3 审计报告,这些报告独立审查了多个季度期间内系统在安全性、处理完整性和机密性方面的控制措施。
本文评估了多语言句子嵌入能否在教育评估中替代翻译进行跨语言的语言集成可靠性审计,发现母语嵌入能紧密复现基于翻译的可靠性估计。
本文在查询无关协议下审计了六种KV-cache压缩方法,发现与查询感知评估相比,排名发生了显著变化,这对长上下文推理中的缓存重用具有重要意义。
一篇反思文章,探讨为小型企业构建AI代理所面临的挑战,将过程比喻为往漏水的杯子里倒水,错误和漏洞导致效率低下,但通过系统化的调试和规则编写,系统逐步得到改善。
AuditWeave是一个轻量级Python库,它可将工作流步骤记录到一个防篡改的哈希链账本中,用于审计AI辅助和数据转换工作流,从而实现可追溯性和完整性验证。
Allstate 指控 Broadcom 在终止其 VMware 和 CA 合同后发起报复性审计,突显出 Broadcom 与不满的企业客户之间持续的法律纠纷。
一条推文线程分享了在发布前对 vibe coded 项目进行全面审计的提示,涵盖安全性、可靠性、并发性、可访问性和 UI 一致性。
一位审计员发现,自主研究代理发布的32项“发现”中,按表述没有一项是新颖的,主要问题在于过度贴标签而非测量错误。