标签
本研究探讨了针对文化标记个体的刻板印象查询是否会导致RAG系统比中立查询泄露更多个人信息,发现在统计校正后未发现此类放大效应的证据。
本文提出在法律基准测试中联合自动审计答案正确性与法律权威依据的 grounding,结果表明在普通提示词下,LLM 经常给出正确答案却引用错误的适用法条。
本文对LLM评判的有用性是否能够可靠地区分AI辅导中直接给出答案与教学引导进行了预注册审计。作者发现,通用有用性并非可靠的教学信号,建议改用针对教学的评分标准和确定性过程度量。
Kimi K3在审计后量子密码学项目时发现了5个真正的漏洞,性能优于Fable/Opus 4.8和GPT-5.6 Sol。
使用AI审计代理,zkSecurity在Cloudflare的CIRCL密码学库中发现了七个真实漏洞,包括严重的精度损失和访问控制破坏。所有漏洞已在上游修复。
本文对大型语言模型作为合成调查受访者进行了心理测量学审计,发现它们无法匹配人类的联合分布和信度,因此不适合作为人类受访者的替代品。
代码屎山分析 Skills 是一个 AI 技能/提示词框架,用于生成严谨、专业的代码审查报告,支持多种审计模式和 HTML 输出。
本文认为,提供商业推荐的人工智能代理必须维护完整的审计日志,以确保用户、商家、开发者和平台之间的信任与责任,并与传统广告系统相类比。
一项分析10个模型共25,500次LLM简历评估的研究发现,由“沉默偏见”驱动的偏见率高达45%,模型会编造听起来专业的借口来惩罚候选人。研究强调了公平性和稳定性的巨大差异,其中Claude、Mistral-Large和Llama 4最为稳定,而Qwen和较早期的Gemini模型则波动较大。
一次 AI 辅助的安全审计揭示了 FreeBSD 内核中的 15 个漏洞,包括权限提升和虚拟机逃逸,并详细描述了与 FreeBSD 团队协作报告和修补漏洞的过程。