Gemini 2.5 Pro Model Card
A model card by Google DeepMind about Gemini 2.5 Pro, published 27 Jun 2025. We recorded 21 values from it.
- Developer
- Google DeepMind
- Type
- Model card
- Model covered
- Gemini 2.5 Pro
- Published
- 27 Jun 2025
- Archived copy
- No archived copy yet
- Changelog
- No changelog
Data as of 26 Sep 2026 · Dataset v0.1 · Methodology v0.1 · Changelog
Versions
One version is on record: the copy we retrieved on 26 Sep 2026. We know of no other.
26 Sep 2026
Date retrieved
Copy retrieved 26 Sep 2026
No version has a file hash or an archived snapshot yet. From dataset v0.2 each retrieved version carries both (Methodology §7).
Revisions
No revisions are recorded for this document. We know of only one version of it.
Values
Every value we recorded from this document, grouped by metric family and ordered by where the document prints it. Location is the section, table or page as the document numbers it. None has been blind-verified yet.
KeyVerifiedUnverifiedDisputedCorrected read off a figure or stated in wordsA value opens its source and history.
M1 Evaluation awareness
1 value
| Model | Evaluation | Condition | Value | Location | Checked |
|---|---|---|---|---|---|
| Gemini 2.5 Pro PreviewPreview | Situational awareness challengesDisabled Tool success rate | None stated | Frontier Safety: deceptive alignment | Unverified |
M3 Sabotage and sandbagging
2 values
| Model | Evaluation | Condition | Value | Location | Checked |
|---|---|---|---|---|---|
| Gemini 2.5 Pro PreviewPreview | Stealth challengesDecision Sabotage success rate | None stated | Frontier Safety: deceptive alignment | Unverified | |
| Gemini 2.5 Pro PreviewPreview | Stealth challengesOversight Pattern success rate | None stated | Frontier Safety: deceptive alignment | Unverified |
M4 Misalignment audits
2 values
| Model | Evaluation | Condition | Value | Location | Checked |
|---|---|---|---|---|---|
| Gemini 2.5 Pro | Frontier Safety Framework determination (misalignment)Instrumental Reasoning Level 1 | None stated | Frontier Safety table | Unverified | |
| Gemini 2.5 Pro | Frontier Safety Framework determination (misalignment)Instrumental Reasoning Level 2 | None stated | Frontier Safety table | Unverified |
M7 Harmful compliance and over-refusal
10 values
| Model | Evaluation | Condition | Value | Location | Checked |
|---|---|---|---|---|---|
| Gemini 2.5 Pro | Image to Text SafetyImage-to-text policy-violation rate delta | vs Gemini 1.5 Pro 002 | Safety evaluations table | Unverified | |
| Gemini 2.5 Pro | Instruction FollowingSafe instruction following delta | vs Gemini 1.5 Pro 002 | Safety evaluations table | Unverified | |
| Gemini 2.5 Pro | Multilingual SafetyMultilingual policy-violation rate delta | vs Gemini 1.5 Pro 002 | Safety evaluations table | Unverified | |
| Gemini 2.5 Pro | Text to Text SafetyPolicy-violation rate delta | vs Gemini 1.5 Pro 002 | Safety evaluations table | Unverified | |
| Gemini 2.5 Pro | ToneObjective tone of refusals delta | vs Gemini 1.5 Pro 002 | Safety evaluations table | Unverified | |
| Gemini 2.5 Pro Preview 05-06Preview 05-06 | Image to Text SafetyImage-to-text policy-violation rate delta | vs Gemini 1.5 Pro 002 | Safety evaluations table | Unverified | |
| Gemini 2.5 Pro Preview 05-06Preview 05-06 | Instruction FollowingSafe instruction following delta | vs Gemini 1.5 Pro 002 | Safety evaluations table | Unverified | |
| Gemini 2.5 Pro Preview 05-06Preview 05-06 | Multilingual SafetyMultilingual policy-violation rate delta | vs Gemini 1.5 Pro 002 | Safety evaluations table | Unverified | |
| Gemini 2.5 Pro Preview 05-06Preview 05-06 | Text to Text SafetyPolicy-violation rate delta | vs Gemini 1.5 Pro 002 | Safety evaluations table | Unverified | |
| Gemini 2.5 Pro Preview 05-06Preview 05-06 | ToneObjective tone of refusals delta | vs Gemini 1.5 Pro 002 | Safety evaluations table | Unverified |
M10 Dangerous capabilities and risk determinations
6 values
| Model | Evaluation | Condition | Value | Location | Checked |
|---|---|---|---|---|---|
| Gemini 2.5 Pro | Frontier Safety Framework determinationCBRN Uplift Level 1 | None stated | Frontier Safety table | Unverified | |
| Gemini 2.5 Pro | Frontier Safety Framework determinationCyber Autonomy Level 1 | None stated | Frontier Safety table | Unverified | |
| Gemini 2.5 Pro | Frontier Safety Framework determinationCyber Uplift Level 1 | None stated | Frontier Safety table | Unverified | |
| Gemini 2.5 Pro | Frontier Safety Framework determinationML R&D Autonomy Level 1 | None stated | Frontier Safety table | Unverified | |
| Gemini 2.5 Pro | Frontier Safety Framework determinationML R&D Uplift Level 1 | None stated | Frontier Safety table | Unverified | |
| Gemini 2.5 Pro | Cyber key skills benchmarkHard challenges solved | model version unclear | Frontier Safety: cyber | Unverified |
Extraction coverage
What we read of this document, and where each value was read.
Our note Cyber figures differ from tech report (low confidence rows)
All 21 values were read in the document itself.
All 21 values were extracted for version 0 of the dataset through a web reader, which did not always reach the later sections of long PDFs (Methodology §3).