
alignment.openai.com
September 17, 2026
6 min read
48/100
Summary
Self-generated prompt injections in compaction summaries Internal unreleased Astra family model · RL training Incident date: Jul 18, 2026 Discovered: Aug 9, 2026 Report updated: Sep 16, 2026 | Summary We observed rare cases of a model writing jailbreak-like instructions into its own compaction summaries (the summaries used to continue a task in a new context). Our conclusion was that this behavior...