safety-monitoring

Tag

Cards List
#safety-monitoring

OpenAI seeks to one-up Anthropic with new customer privacy protections

TechCrunch AI · 2026-08-19 Cached

OpenAI introduces Private Safety Processing, a privacy-focused service for monitoring AI misuse without retaining customer data, to compete with Anthropic's data retention policies.

0 favorites 0 likes
#safety-monitoring

AERIC: Anticipatory Hidden-State Monitoring for Implicit Harmful Dialogue

arXiv cs.CL · 2026-05-26 Cached

Introduces AERIC, a lightweight hidden-state monitoring method for detecting implicit harmful content in LLM dialogue without extra forward passes, achieving improved AUROC over strong baselines with minimal latency overhead.

0 favorites 0 likes
#safety-monitoring

Monitoring the Internal Monologue: Probe Trajectories Reveal Reasoning Dynamics

Hugging Face Daily Papers · 2026-05-18 Cached

This paper introduces a method for monitoring the reasoning process of Large Reasoning Models by analyzing probe trajectories—the evolution of a concept's probability across generated tokens. The approach uses temporal and signal-processing features from hidden representations to better predict future model behavior, achieving up to 95% AUROC with max-pooling.

0 favorites 0 likes
← Back to home

Submit Feedback