EnterpriseModelsSecurity

OpenAI's GPT-6 Astra hallucinates less but remains vulnerable to hidden prompt injections

Source: The Decoder · Matthias Bastian

Intel Summary

According to The Decoder, OpenAI's GPT-6 Astra reduces hallucinations and blocks 99.99 percent of direct prompt injections, but remains vulnerable to hidden prompt injection attacks embedded within documents in 8.5 percent of evaluated scenarios. Claude Opus 5 demonstrated a lower failure rate of 4.8 percent under similar document-based injection testing.

Why It Matters

Residual failure rates against indirect prompt injections create operational security exposures for autonomous AI agents handling untrusted external data and documents. Enterprise deployments operating multi-step or autonomous workflows cannot rely solely on native frontier model defenses to neutralize document-borne payload risks.

Part of an ongoing development

Independent reporting

OpenAI GPT-6 Astra evaluated on prompt injection resilience

According to The Decoder, OpenAI's GPT-6 Astra reduces hallucinations and blocks 99.99 percent of direct prompt injections, but remains vulnerable to hidden prompt injection attacks embedded within documents in 8.5 percent of evaluated scenarios. Claude Opus 5 demonstrated a lower failure rate of 4.8 percent under similar document-based injection testing. Claims are as reported; this summary makes no determination about accuracy or significance.

Confidence
Moderate confidence
Corroboration
Limited corroboration

Organizations & Entities