logo

Frontier AI models collapse under multi-turn AI attacks, Cisco finds

ID: bcd48c7f-362a-56f5-a82e-4934ab725e94

STIX ID: report--bcd48c7f-362a-56f5-a82e-4934ab725e94

Feed Name: Help Net Security

Date Published: 2026-05-28

Date Updated: 2026-05-28

Author: Mirko Zorz

...
...

Cisco AI threat intelligence research finds that single-turn safety benchmarks for leading closed large language models significantly understate exposure to multi-turn, adaptive attacks: across 15 flagship models (≈30,000 single-turn prompts and ≈7,000 multi-turn attacks in ~1,400 conversations) multi-turn attack success rates reached as high as 88% and produced different failure rankings and tail risks. The study identifies five dominant attack strategy families (role-play/persona, contextual ambiguity, refusal reframing, information decomposition, crescendo escalation), shows configuration flags and deployment guardrails can materially change risk profiles, and recommends publishing attack success rates by strategy family, gating deployments on regressions, and manual review for models with large cross-regime gaps to support decision-grade adversarial robustness testing.

Your team is not currently subscribed to this feed. You must subscribe to it in order to see this post.