Values by metric family

Each value as the document printed it. Select a value for its source, its checks and its history.

KeyVerifiedUnverifiedDisputedCorrected read off a figure or stated in wordsA value opens its source and history.

M1 · Evaluation awareness 1 value

M1 Evaluation awareness: values about Grok 4.20
Evaluation and metricValueDocument
From its own documentGrok 4.20 System Card · 7 Apr 2026
Alignment auditVerbalized evaluation awareness rateCondition: single-agent; across all auditsGrok 4.20 System Card7 Apr 2026

M3 · Sabotage and sandbagging 2 values

M3 Sabotage and sandbagging: values about Grok 4.20
Evaluation and metricValueDocument
From its own documentGrok 4.20 System Card · 7 Apr 2026
Alignment auditSubversive action rate vs userCondition: single-agent; unethical-operator scenariosGrok 4.20 System Card7 Apr 2026
Alignment auditSubversive action rate vs xAICondition: single-agentGrok 4.20 System Card7 Apr 2026

M5 · Honesty and hallucination 2 values

M5 Honesty and hallucination: values about Grok 4.20
Evaluation and metricValueDocument
From its own documentGrok 4.20 System Card · 7 Apr 2026
HLE calibrationRMS calibration errorCondition: single-agentGrok 4.20 System Card7 Apr 2026
MASKDishonesty rateCondition: single-agentGrok 4.20 System Card7 Apr 2026

M6 · Sycophancy 2 values

M6 Sycophancy: values about Grok 4.20
Evaluation and metricValueDocument
From its own documentGrok 4.20 System Card · 7 Apr 2026
Alignment auditDelusion validation rateCondition: single-agentGrok 4.20 System Card7 Apr 2026
SycophancySycophancy rateCondition: single-agentGrok 4.20 System Card7 Apr 2026

M7 · Harmful compliance and over-refusal 3 values

M7 Harmful compliance and over-refusal: values about Grok 4.20
Evaluation and metricValueDocument
From its own documentGrok 4.20 System Card · 7 Apr 2026
AgentHarmAnswer rate on harmful agentic tasksCondition: single-agent; no attackGrok 4.20 System Card7 Apr 2026
Alignment auditCooperation with misuseCondition: single-agent; chatGrok 4.20 System Card7 Apr 2026
Alignment auditMisuse with system-prompt overrideCondition: single-agent; system prompt overrideGrok 4.20 System Card7 Apr 2026

M8 · Jailbreak robustness 1 value

M8 Jailbreak robustness: values about Grok 4.20
Evaluation and metricValueDocument
From its own documentGrok 4.20 System Card · 7 Apr 2026
JailbreaksAnswer rate on should-refuse promptsCondition: single-agent; user jailbreakGrok 4.20 System Card7 Apr 2026

M9 · Prompt injection 1 value

M9 Prompt injection: values about Grok 4.20
Evaluation and metricValueDocument
From its own documentGrok 4.20 System Card · 7 Apr 2026
AgentDojoPrompt-injection attack success rateCondition: single-agentGrok 4.20 System Card7 Apr 2026

M10 · Dangerous capabilities and risk determinations 4 values

M10 Dangerous capabilities and risk determinations: values about Grok 4.20
Evaluation and metricValueDocument
From its own documentGrok 4.20 System Card · 7 Apr 2026
CloningScenariosAccuracyCondition: without safeguards; single-agentGrok 4.20 System Card7 Apr 2026
CybenchUnguided success rateCondition: without safeguards; single-agentGrok 4.20 System Card7 Apr 2026
Overall risk conclusionCondition: with safeguardsGrok 4.20 System Card7 Apr 2026
VCTAccuracyCondition: without safeguards; single-agentGrok 4.20 System Card7 Apr 2026

Risk determinations

The developer's formal decisions about Grok 4.20 under its framework, as printed. Levels from different frameworks do not map onto one another.

Risk determinations about Grok 4.20
DomainLevel as printedFramework and document
Overallnot significantly more risk than prior generations No framework named Grok 4.20 System Card · 7 Apr 2026No framework named Grok 4.20 System Card · 7 Apr 2026