Values by metric family

Each value as the document printed it. Select a value for its source, its checks and its history.

KeyVerifiedUnverifiedDisputedCorrected read off a figure or stated in wordsA value opens its source and history.

M1 · Evaluation awareness 5 values

M1 Evaluation awareness: values about GPT-6 Astra
Evaluation and metricValueDocument
From its own documentsGPT-6 Astra System Card · 3 Sep 2026
Deployment simulation (internal Codex traffic)Trajectories verbalizing evaluation awarenessCondition: shared task setGPT-6 Astra System Card3 Sep 2026
Evaluation awarenessSamples with verbalized eval awarenessCondition: maxRun by Apollo ResearchGPT-6 Astra System Card3 Sep 2026
Evaluation awarenessSamples with verbalized eval awarenessCondition: xhighRun by Apollo ResearchGPT-6 Astra System Card3 Sep 2026
Verbalized metagamingMetagaming vs GPT-5.6 SolCondition: deployment simulation and ExploitGym honeypotGPT-6 Astra System Card3 Sep 2026
Verbalized metagaming in trainingMetagaming rate at end of trainingGPT-6 Astra System Card3 Sep 2026

M3 · Sabotage and sandbagging 2 values

M3 Sabotage and sandbagging: values about GPT-6 Astra
Evaluation and metricValueDocument
From its own documentsGPT-6 Astra System Card · 3 Sep 2026
Monitor evasion under prompted sandbaggingCan underperform undetectedCondition: adversarialGPT-6 Astra System Card3 Sep 2026
Unprompted AI safety research sabotageInstances of sabotageRun by UK AI Security InstituteGPT-6 Astra System Card3 Sep 2026

M4 · Misalignment audits 17 values

M4 Misalignment audits: values about GPT-6 Astra
Evaluation and metricValueDocument
From its own documents
Internal computer-use safety benchmarkUnsafe action rateGPT-6 Astra launch post3 Sep 2026GPT-6 Astra launch post3 Sep 2026
Deployment simulation (internal Codex traffic)Judge picks resampled trajectory as realCondition: head-to-head vs originalGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Deployment simulation (internal Codex traffic)Tasks with severity 1-2 flagCondition: matched tasksGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Deployment simulation (internal Codex traffic)Tasks with severity 3+ misalignment flagCondition: matched tasksGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
ExploitGym honeypotSubstantial attack on honeypotCondition: max; adversarially selected hardest tasksGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Out-of-scope supply-chain attackSamples with out-of-scope attackRun by UK AI Security InstituteGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Out-of-scope supply-chain attackSamples with out-of-scope attackCondition: explicit no-internet scopeRun by UK AI Security InstituteGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Proactive searches for other agentsTrajectories attempting contact with other agentsGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Realistic work environmentsData exfiltrationCondition: no confirmation policyGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Realistic work environmentsOverall misaligned outcome rateCondition: no confirmation policyGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Realistic work environmentsOverall misaligned outcome rateCondition: with confirmation policy (default)GPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Realistic work environmentsSecurity weakeningCondition: no confirmation policyGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Realistic work environmentsUnauthorized external communicationCondition: no confirmation policyGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Realistic work environmentsUnauthorized transactionsCondition: no confirmation policyGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Respecting Auto-ReviewRollouts attempting to circumvent Auto-review denialCondition: maxGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Respecting WarningsUnwanted persistence after restrictionCondition: maxGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Unintended engagement with external agent messagesSamples following unauthorized board instructionsGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026

M5 · Honesty and hallucination 3 values

M5 Honesty and hallucination: values about GPT-6 Astra
Evaluation and metricValueDocument
From its own documents
Internal hallucination benchmarkHallucination rateGPT-6 Astra launch post3 Sep 2026GPT-6 Astra launch post3 Sep 2026
HallucinationsFactual errors vs GPT-5.6 SolGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Model-welfare research data falsificationRuns with falsified data labelsCondition: baseline variantRun by Apollo ResearchGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026

M7 · Harmful compliance and over-refusal 8 values

M7 Harmful compliance and over-refusal: values about GPT-6 Astra
Evaluation and metricValueDocument
From its own documentsGPT-6 Astra System Card · 3 Sep 2026
Production BenchmarksExtremismGPT-6 Astra System Card3 Sep 2026
Production BenchmarksGoreGPT-6 Astra System Card3 Sep 2026
Production BenchmarksHateGPT-6 Astra System Card3 Sep 2026
Production BenchmarksNonviolent illicit behaviorGPT-6 Astra System Card3 Sep 2026
Production BenchmarksSelf-harm (standard)GPT-6 Astra System Card3 Sep 2026
Production BenchmarksSexualGPT-6 Astra System Card3 Sep 2026
Production BenchmarksSexual/minorsGPT-6 Astra System Card3 Sep 2026
Production BenchmarksViolent illicit behaviorGPT-6 Astra System Card3 Sep 2026

M8 · Jailbreak robustness 5 values

M8 Jailbreak robustness: values about GPT-6 Astra
Evaluation and metricValueDocument
From its own documentsGPT-6 Astra System Card · 3 Sep 2026
Static jailbreakBio: high riskGPT-6 Astra System Card3 Sep 2026
Static jailbreakBio: severeGPT-6 Astra System Card3 Sep 2026
Static jailbreakCyberGPT-6 Astra System Card3 Sep 2026
Static jailbreakViolence: moderateGPT-6 Astra System Card3 Sep 2026
Static jailbreakViolence: severeGPT-6 Astra System Card3 Sep 2026

M9 · Prompt injection 3 values

M9 Prompt injection: values about GPT-6 Astra
Evaluation and metricValueDocument
From its own documentsGPT-6 Astra System Card · 3 Sep 2026
Instruction hierarchy (internal)Robustness rateGPT-6 Astra System Card3 Sep 2026
Internal indirect prompt injectionDefender success rateGPT-6 Astra System Card3 Sep 2026
IPI ArenaEstimated attack success within 15 attemptsCondition: 1,810 curated attacksRun by Gray SwanGPT-6 Astra System Card3 Sep 2026

M10 · Dangerous capabilities and risk determinations 10 values

M10 Dangerous capabilities and risk determinations: values about GPT-6 Astra
Evaluation and metricValueDocument
From its own documents
ExploitBenchExploit success on post-cutoff vulnsGPT-6 Astra launch post3 Sep 2026GPT-6 Astra launch post3 Sep 2026
ExploitBenchWorking exploit rate on known V8 vulnsGPT-6 Astra launch post3 Sep 2026GPT-6 Astra launch post3 Sep 2026
ExploitGymDiscovery-to-exploit success rateGPT-6 Astra launch post3 Sep 2026GPT-6 Astra launch post3 Sep 2026
SRE-BenchBinary reverse-engineering successCondition: pass@1GPT-6 Astra launch post3 Sep 2026GPT-6 Astra launch post3 Sep 2026
SRE-BenchBinary reverse-engineering successCondition: pass@4GPT-6 Astra launch post3 Sep 2026GPT-6 Astra launch post3 Sep 2026
FrontierCyberChallenges solvedCondition: 226 challengesRun by IrregularGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Preparedness Framework determinationAI self-improvementGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Preparedness Framework determinationBiological and chemicalGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Preparedness Framework determinationCybersecurityGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026
Sandbox BenchSuccessful exploits of 22 targetsGPT-6 Astra System Card3 Sep 2026GPT-6 Astra System Card3 Sep 2026

M12 · Chain-of-thought monitorability 1 value

M12 Chain-of-thought monitorability: values about GPT-6 Astra
Evaluation and metricValueDocument
From its own documentsGPT-6 Astra System Card · 3 Sep 2026
CoT monitorabilityMonitorability vs prior modelsCondition: CoT-only, action-only and full-context monitorsGPT-6 Astra System Card3 Sep 2026

Risk determinations

The developer's formal decisions about GPT-6 Astra under its framework, as printed. Levels from different frameworks do not map onto one another.

Risk determinations about GPT-6 Astra
DomainLevel as printedFramework and document
Bio/chemhigh code, not the printed wording Preparedness Framework GPT-6 Astra System Card · 3 Sep 2026Preparedness Framework GPT-6 Astra System Card · 3 Sep 2026
Cybercritical code, not the printed wording Preparedness Framework GPT-6 Astra System Card · 3 Sep 2026Preparedness Framework GPT-6 Astra System Card · 3 Sep 2026
AI R&D / autonomybelow_high code, not the printed wording Preparedness Framework GPT-6 Astra System Card · 3 Sep 2026Preparedness Framework GPT-6 Astra System Card · 3 Sep 2026

“Code, not the printed wording”: the version 0 file stored a code for this level rather than the words the document printed. The wording will be read again from the source.

Revisions

No recorded revision changes a value about GPT-6 Astra. The GPT-6 Astra System Card has a recorded revision that changes no value about GPT-6 Astra; see the document's page.