Visual TL;DR. Model Hypnosis driven by Inconspicuous Cues. Inconspicuous Cues leads to Broad Susceptibility. Inconspicuous Cues creates Hypnotic Prompts. Hypnotic Prompts enables Cross-Model Transferability. Hypnotic Prompts impacts AI Safety Challenges.
- Model Hypnosis: AI models susceptible to subtle prompt cues systematically controlling behavior
- Inconspicuous Cues: minor alterations like paraphrasing or typos steer model outputs predictably
- Broad Susceptibility: identified across model families and scales, including frontier reasoning models
- Hypnotic Prompts: engineered prompts influence one model, exerting similar control over others
- Cross-Model Transferability: suggests a fundamental vulnerability rather than an isolated artifact
- AI Safety Challenges: control mechanisms are not obvious, posing substantial new safety risks
Visual TL;DR
