Skip to content
Longterm Wiki

Universal and Transferable Adversarial Attacks on Aligned Language Models

publicationVerified

Metadata

Source Tablepublications
Source IDxFD4v0FaVJ
DescriptionAndy Zou, Zifan Wang, Nicholas Carlini et al., 2023
Source URLllm-attacks.org/
ParentCenter for AI Safety (CAIS)
Children—
CreatedMar 23, 2026, 2:46 PM
UpdatedMar 23, 2026, 2:46 PM
SyncedMar 23, 2026, 2:46 PM

Record Data

idxFD4v0FaVJ
entityIdCenter for AI Safety (CAIS)(organization)
entityDisplayName—
resourceId—
titleUniversal and Transferable Adversarial Attacks on Aligned Language Models
authorsAndy Zou, Zifan Wang, Nicholas Carlini et al.
urlllm-attacks.org/
venue—
publishedDate2023
publicationTypepaper
citationCount—
isFlagshipYes
abstract—
sourcellm-attacks.org/
notesHighly influential jailbreaking paper

Source Check Verdicts

confirmed95% confidence

Last checked: 4/29/2026

1 → confirmed

Debug info

Thing ID: xFD4v0FaVJ

Source Table: publications

Source ID: xFD4v0FaVJ

Parent Thing ID: sid_y4bieqSeag