Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations Paper • 2607.20379 • Published 2 days ago • 2
When Good Sounds Go Adversarial: Jailbreaking Audio-Language Models with Benign Inputs Paper • 2508.03365 • Published Aug 5, 2025 • 5
Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models Paper • 2508.04196 • Published Aug 6, 2025 • 2