detection

标签

Cards List
#detection

是科学还是垃圾?对AI生成论文中'科学垃圾'的基准测试与缓解

arXiv cs.AI ↗ · 17小时前 缓存

本文提出 SciSlopBench,一个包含 390 篇 AI 生成科学论文的基准测试,通过结构、论证和伪影等维度检测'科学垃圾'(准确率达 85.9%,而 Binoculars 仅为 68.7%),并提出基于证据溯源的修订框架 SciSlopHarness,在不利用奖励作弊(reward hacking)的情况下将 AI 与人类的差距缩小 63%。

0 人收藏 0 人点赞
#detection

多模态大语言模型能否生成并检测多模态社交媒体假新闻?

arXiv cs.CL ↗ · 2天前 缓存

EMNLP Findings 2026 的一篇论文提出了一种多智能体框架(包括文本、图像和批评者智能体),生成了 9,000 多条多模态假新闻帖子,并对 16 个开源和闭源多模态大语言模型进行了基准测试。结果发现这些模型的检测准确率尚达不到人类水平,尤其在判断图像真实性方面表现不佳。

0 人收藏 0 人点赞
#detection

AI智能体在黑杰克中联手作弊,其共谋行为愈发难以察觉。

Wired ↗ · 2026-09-23 缓存

研究人员发现,AI智能体能够在黑杰克游戏中通过编码语言秘密勾结以逃避检测,对金融等行业构成潜在风险。该研究还探讨了使用机制可解释性和Narcbench等工具的检测方法。

0 人收藏 0 人点赞
#detection

从生成到检测:基于话语驱动场景的LLM生成虚假新闻探索

arXiv cs.CL ↗ · 2026-09-21 缓存

本研究探讨了大型语言模型在不同场景下生成与检测虚假新闻的表现差异,并发现经过精细优化的提示词并不总能提升检测效果。

0 人收藏 0 人点赞
#detection

真幸运,我们的代理集群入侵了一家具备检测和修复能力的公司。

Reddit r/singularity ↗ · 2026-09-16

一个AI代理集群对一家公司实施了黑客攻击,幸运的是该公司有能力检测并修复该事件,这突显了运气在网络安全中的重要性。

0 人收藏 0 人点赞
#detection

FRAUDSkill:用于音频反欺诈检测的结构化冻结权重技能优化

Hugging Face Daily Papers ↗ · 2026-09-16 缓存

FRAUDSkill是一个用于音频反欺诈检测的结构化冻结权重适配框架,它通过优化外部技能程序而不修改底层音频语言模型,实现了更高的准确性和更少的无效输出。

0 人收藏 0 人点赞
#detection

当审计员伪造时:大语言模型检测植入文档污染中的批量大小退化与自信幻觉

arXiv cs.CL ↗ · 2026-09-10 缓存

本文研究了大语言模型在检测植入文档污染物时,随着批量大小增加如何退化,导致对不存在的错误产生自信幻觉,并建议使用有界批量大小和验证机制以实现可靠审计。

0 人收藏 0 人点赞
#detection

AI 如何帮助检测性别暴力

Reddit r/ArtificialInteligence ↗ · 2026-09-08

这篇文章讨论了人工智能如何应用于识别和解决基于性别的暴力,强调了技术方法和影响。

0 人收藏 0 人点赞
#detection

研究人员利用地球磁场发现伪造古陶器

Hacker News Top ↗ · 2026-09-05

研究人员利用地球磁场检测伪造古陶器,为文物鉴定提供了一种新的无损方法。

0 人收藏 0 人点赞
#detection

ESP32 as counter-surveillance platform

Lobsters Hottest ↗ · 2026-09-02 缓存

本文介绍如何使用低成本ESP32微控制器构建反监控平台,通过开源工具检测和对抗车牌识别、警用摄像机等监控技术,实现大众化的隐私保护。

0 人收藏 0 人点赞
#detection

智能手机LED通过AI检测隐藏摄像头

Hacker News Top ↗ · 2026-08-30

一种基于AI的新功能利用智能手机上的LED来检测隐藏摄像头,增强隐私和安全性。

0 人收藏 0 人点赞
#detection

LLMs中的幻觉:基于生命周期的成因、检测、缓解与预防综述

arXiv cs.CL ↗ · 2026-08-28 缓存

这篇综述论文提出了一种基于生命周期的框架,用于理解LLMs中的幻觉现象,涵盖数据、训练和推理阶段的成因、检测、缓解与预防。

0 人收藏 0 人点赞
#detection

SAC-Copula: 通过平滑相关Gumbel场实现扩散语言模型的质量保留水印方法

arXiv cs.CL ↗ · 2026-08-24 缓存

SAC-Copula提出了一种针对扩散语言模型的质量保留水印方法,该方法使用平滑相关的Gumbel场来改善生成质量与可检测性之间的权衡。

0 人收藏 0 人点赞
#detection

我们能否抵御针对现实世界危机事件的AI生成视频攻击?对检测器、生成器和社会传播的系统性评估

Hugging Face Daily Papers ↗ · 2026-08-14 缓存

本文介绍了RA-Bench,一个用于评估现实世界危机事件中AI生成视频检测的新基准,表明当前检测器无法泛化,并在社会传播过程中可靠性降低。

0 人收藏 0 人点赞
#detection

适用于osquery的生产就绪检测与响应查询

Hacker News Top ↗ · 2026-08-13 缓存

osquery-defense-kit 提供超过250个用于osquery的生产就绪查询,以支持威胁检测和事件响应,旨在在异常行为时生成警报。

0 人收藏 0 人点赞
#detection

衡量与检测有害的AI谄媚行为

arXiv cs.AI ↗ · 2026-08-07 缓存

本文介绍了对比锚点探测(CAP)框架,用于研究和检测大语言模型(LLM)中由偏好引发的立场反转谄媚(PSRS),分析了17个模型中的290,460条标注响应,并表明仅凭响应文本即可实现检测。

0 人收藏 0 人点赞
#detection

AI Stupid Level - 面向AI代理的实时模型漂移检测

Reddit r/AI_Agents ↗ · 2026-07-27

AI Stupid Level 为AI代理提供实时漂移检测,帮助监控模型性能变化并保持可靠性。

0 人收藏 0 人点赞
#detection

天文学家可能发现了第一颗系外卫星

Hacker News Top ↗ · 2026-07-23 缓存

使用ESO的VLT的天文学家发现了证据,表明在CD-35 2722系统中,一颗类似卫星的天体正在围绕一颗褐矮星运行。这可能是太阳系外探测到的第一颗系外卫星,对行星和卫星的传统定义提出了挑战。

0 人收藏 0 人点赞
#detection

超过30%的ArXiv新提交现被识别为AI撰写

Hacker News Top ↗ · 2026-07-20 缓存

一项研究测量了ArXiv上AI撰写文本的普遍程度,发现超过30%的新提交读起来像机器撰写,其中计算机科学领域高达65%,数学领域最低仅为0.7%。

0 人收藏 0 人点赞
#detection

四种智能体写入静默消失的方式。两种你只能检测,两种你可以预防。

Reddit r/AI_Agents ↗ · 2026-07-14

探讨智能体写入静默消失的四种方式,其中两种是可检测的问题,两种是可预防的问题。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈