用 AI 提前预测暴力行为

Reddit r/ArtificialInteligence 新闻

摘要

本文探讨了利用 AI 提前预测暴力及其他罕见公共安全事件的可行性,以自动化视频理解和基于 AI 的地铁车站自杀风险评估研究为例,同时警示了数据质量、偏见以及模式检测的局限性等问题。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/10/01 14:37

# 用AI提前预测暴力行为 来源:https://www.unite.ai/predicting-violence-in-advance-with-ai/ “AI能自动化这件事吗?”这类问题的典型研究模板,是把某类事物的多个样本喂给模型,这些样本具备你希望模型识别的特征,然后检验:用这些数据训练出来的模型,能否在*未*参与训练的类似数据上识别出该特征: 一个“孤注一掷”式AI项目的示意图:标注样本被划分为训练集和测试集,模型先从训练集中学习,随后用测试集中的未见样本进行检验。如果它真正学到了目标特征而非死记硬配训练数据,就应该能在测试集里识别出同样的模式。来源:https://upload.wikimedia.org/wikipedia/commons/0/09/Supervised_machine_learning_in_a_nutshell.svg 这多少算是一场“孤注一掷”,因为这类实验建立在一个前提之上:只要AI持续地在数据集上搜寻,目标特征终会在数据中凸显出来,而且数据中确实存在某种可供挖掘的“潜在规律”。如果该特征是我们原本就能轻易识别的,那我们根本不需要这个AI模型,或者只把它当作常规自动化工具使用。 但事实通常并非如此;大多数此类研究本质上是“盲捞式探索”,试图找到只有超人式的反复关注才可能学会辨识的潜在模式。 很多时候,这种模式被证明难以捉摸,甚至可能根本不存在,因为某些事件和特质或许纯粹出于随机;或者,数据本身在某种程度上不够充分、标注不佳,或是模型训练得不好。 ## 展望未来 在某些情况下,奖励太过诱人(攻克癌症、核聚变、突破热力学定律等等),且在“政治上”颇具吸引力,以至于相关文献会不断回头审视这些问题,看看更优质的数据或更先进的技术是否终于能从中提取出某种特征规律。 其中一个领域就是(https://www.mdpi.com/2076-3417/13/8/4956)自动化视频理解(Automated Video Understanding),它与公共空间及警方相关的领域密切相关。例如,今年一项新研究(https://www.unite.ai/anticipating-and-preventing-metro-platform-tragedies-with-ai/)使用了真实世界中自杀未遂的视频片段,用于识别自杀者在实施前典型的“徘徊”行为模式,并构建了一套预测系统,以捕捉他们在跳轨前于地铁站台上活动时的特征性行为方式: 出自2026年论文《Suicide Risk Assessment from AI-powered Video Surveillance: An Interpretable Framework for Prevention in Metro Stations》中对两帧画面的预测,一帧显示一起真实的轨边自杀未遂事件,另一帧则是非事件案例。每帧旁的热力图基于此人靠近隧道口处的“徘徊倾向”,以及以往自杀案例中观察到的行为模式,指示了站台上风险较高和较低的区域。来源:https://arxiv.org/pdf/2605.22904 在这个案例中,图中左右两侧所示的“徘徊模式”——即打算跳入列车前方轨道的人所表现出的典型行为——似乎具有独特的特征签名,可作为自动监控回路中的模式识别预警系统使用。 这一方向上另一个热门的研究分支是*暴力检测/识别*,其目标是让无人值守的监控系统具备识别暴力行为的能力,从而迅速引起人工关注——甚至触发一些辅助操作,例如将相关录像标记为长期保留(https://www.bbc.com/news/articles/cd9jew4w47po),以及确保录制确实在进行(https://news3lv.com/news/local/las-vegas-nail-salon-robbery-caught-on-camera-glitch-leaves-police-without-key-evidence)等,措施不一而足。 **来自IVS的暴力检测系统测试(非真实事件)。** 来源:https://www.youtube.com/watch?v=tbDSXPQcpybU 根据(https://arxiv.org/pdf/2609.40014)阿拉巴马大学的一项新研究,迄今为止的相关文献主要集中在暴力事件*已经发生时*的识别。而在新工作中,研究人员仅用暴力事件发生*之前*的视频片段(为了统计平衡,也使用了未发生任何事件的片段)训练模型,以探究是否存在可重复且可训练的“暴力前”特征——在本例中,这些特征是身体动作、面部神态和音频的组合,它们共同提供了一项预示暴力行为的信号,而不是在暴力已经发生后才作出反应。 研究中展示的四帧连续画面所示的“风险性”事前片段示例。该系统随时间跟踪身体关键点和运动情况,寻找姿态、速度和互动模式上的变化,这些变化可能在暴力本身变得可见之前就区分出不断升级的局势。来源:https://arxiv.org/pdf/2609.40014 当然,这样的工作若被开发或实施,很可能引发担忧(https://theconversation.com/predictive-policing-ai-is-on-the-rise-making-it-accountable-to-the-public-could-curb-its-harmful-effects-254185)。正如我此前所指出的(https://www.unite.ai/using-probability-as-a-deepfake-detection-metric/#:~:text=Probably%20the%20most%20similar%20current%20strand%20in%20the%20research%20is%20the%20field%20of%20pre%2Dcrime),像电视剧**Person of Interest**和2002年的科幻动作片**Minority Report**这类虚构作品,与诸多类似作品一道,反映了公众对预测性技术掌握在警方或监管机构手中所产生的恐惧。 就目前而言,从身体、面部和音频线索预测暴力行为(而非考虑诸如(https://nij.ojp.gov/library/publications/crime-forecasting-using-data-mining-techniques)情境、时间地点或历史犯罪数据等因素),这个问题仍有争议,因为正如该新论文作者所言,这是一条非常崭新的研究路线。 在测试中,研究人员分别以及组合使用面部外观、音频和身体动作线索进行比较,采用了三种不同的视觉主干网络。当三种信号全部结合时取得了最强效果,表明这种预测效果并非由任何单一类型的线索所驱动: **“最优配置——DeiT-Tiny 结合音频、面部外观和动作——在留出的测试集上取得了91.21%的准确率、88.96%的平衡准确率、93.65%的F1分数以及96.38%的ROC-AUC。** **“这些结果表明,互补的外观、声学和运动学线索为识别升高的事前风险提供了有用的证据。”** ## 方法 该研究整理出的数据集源自(https://www.kaggle.com/datasets/bypktt/xd-violence)XD-Violence集合,并协同处理三种模态:面部外观、音频以及通过姿态估计得到的运动信息: 研究的处理流程。每个片段被标注风险等级,归并为“无风险”或“有风险”,随后划分为训练集、验证集和测试集。最多四秒的片段通过三条分支进行分析:跨帧的面部外观、转换为声谱图的音频,以及从被跟踪的关键点(如速度和加速度)中推导出的身体运动。由此得到的面部、音频和动作特征被融合为一种表示,并传入最终分类器,后者为该片段分配其属于“无风险”或“有风险”的概率。 最终整理出的数据集包含443个事前片段(我们将在文章末尾讨论这个数字)。 论文指出,从XD-Violence集合中挑选的视频,是作为适合本项目所要实施的人本导向分析的对象而选取的。相反,许多类似先前的方法则把**整个场景**作为预测情境来聚焦。 所用片段不超过四秒,采样率为8fps。使用一个具有八个(https://www.unite.ai/what-are-transformer-neural-networks/)(https://www.unite.ai/decoder-based-large-language-models-a-complete-guide/#:~:text=Attention%20Heads%3A%20Each)注意力头的单层Transformer来汇总得到的32帧样本,同时通过学习式位置嵌入(https://iclr-blogposts.github.io/2025/blog/positional-embedding/)保持帧的顺序。主干网络在多模态训练期间保持(https://arxiv.org/pdf/1706.04983.pdf)冻结,以避免(https://www.unite.ai/what-is-overfitting/)过拟合。 (https://www.unite.ai/what-is-deep-learning/#:~:text=The%20activation%20function)示例激活图(包括面部图像)如文章前文所示,为“有风险”样本的激活情况,而下方则是“无风险”样本的情况: 研究中面部分析分支的无风险示例,与前面展示的有风险动作示例形成对照。左侧为原始的面部裁剪图,其后是从DeiT-Tiny视觉模型逐步加深的各层提取的激活图。较暖的区域表示更强的特征响应,显示了图像经过网络时模型注意力如何转移并变得愈发抽象。 从源片段中提取的音频部分被重采样至16kHz,并通过归一化以及与相应视觉窗口的对齐进行标准化,随后使用512点短时(https://www.mathworks.com/help/matlab/math/fourier-transforms.html)傅里叶变换(https://arxiv.org/pdf/2609.34445v1),以及400采样的(https://www.mathworks.com/help/signal/ref/hann.html)Hann窗,转换为标准化的对数幅度声谱图: 正常片段与有风险的事前片段的平均音频模式对比。上排显示正常片段,下排为有风险片段,从原始波形和声谱图依次推进到在三个不同网络深度上学到的特征。有风险片段随时间表现出更大的变化,包括在四秒窗口末段声学活动增强,同时网络逐步将这些差异转换为更高层次的特征。 对于运动部分,身体动作被归约为一组数值描述符,这些描述符源自由(https://www.unite.ai/ai-pose-estimation-in-fitness-application/#:~:text=COCO%20topology%20is%20made%20up%20of%2017%20landmarks%20across%20the%20body)COCO-17关键点、由(https://www.unite.ai/yolov9-a-leap-in-real-time-object-detection/)YOLO姿态估计器检测得到。 共计算了十二项度量,包括*平均*和*最大速度*、*加速度*与*加加速度(jerk)*、*速度变化*、*手腕与脚踝*速度,以及整体*运动能量*。这些数值针对体型进行了归一化,使得体型较大的人不会自动被记录为运动量更大。此外,同一片段中多人的测量结果也被合并在一起。 在针对训练数据(https://web.archive.org/web/20260909143427/https:/www.geeksforgeeks.org/machine-learning/normalization-vs-standardization/)进行标准化之后,动作特征被扩展为一个64维(https://www.unite.ai/what-is-dimensionality-reduction/)表示,并传入一个时序Transformer,使得片段中运动的变化可以作为序列被考虑,而不是作为孤立的帧。 随后,这三条流被融合为单一表示,其中面部外观占据最大权重,其次是音频和动作。经过归一化和dropout之后,最终分类器将该融合表示转换为“正常”和“有风险”的概率,以0.5作为判定阈值。 对于面部外观流,使用了三个经过(https://archive.is/cAkXg#pretraining)(https://www.image-net.org/)ImageNet预训练的主干网络:(https://huggingface.co/microsoft/swin-tiny-patch4-window7-224)Swin-Tiny、(https://huggingface.co/HAMMALE/vit-tiny-classifier-rvlcdip)ViT-Tiny,以及(https://huggingface.co/facebook/deit-tiny-patch16-224)DeiT-Tiny。 ## 测试 在测试时,片段被人工赋予四种标签之一:*无风险*、*低风险*、*中风险*或*高风险*,依据是可见的行为、动作和音频。在最终的二元任务中,三个风险类别被合并为“有风险”,而*无风险*则作为“正常”。为减少训练与评估之间的数据泄漏,取自同一源视频的片段被保留在同一数据集分区中。 暴力事件本身从所有有风险的片段中被移除,只留下事件发生前的行为供模型判断: 测试集结果,展示了当面部外观、音频和动作分别使用或组合使用时,三个视觉主干网络上的性能变化,其中消融设置隔离了每条输入流的贡献。分数越高表示性能越好,加粗数值表示该指标下的最佳结果。 如前所述,整体表现最强的

相似文章

AI 如何帮助检测性别暴力

Reddit r/ArtificialInteligence

这篇文章讨论了人工智能如何应用于识别和解决基于性别的暴力,强调了技术方法和影响。

AI能否预防自杀?

Reddit r/ArtificialInteligence

探讨人工智能在识别和预防自杀行为方面的潜力,同时讨论其前景和伦理问题。