{
"header": {"name":"Safety Card Ledger","release":"v0.1","date":"2026-09-27","methodology_version":"0.1","licence":{"name":"CC BY 4.0","url":"https://creativecommons.org/licenses/by/4.0/"},"url":"https://safetycardledger.example/download","citation":"Safety Card Ledger. (2026). Safety Card Ledger (Version 0.1) [Data set]. https://safetycardledger.example/download","tables":["labs","models","documents","document_versions","secondary_sources","evaluators","evals","comparability_groups","measurements","revisions","verifications","restatement_links","determinations","releases","id_map","sources"],"notes":"Each table is typed from its schema (in the zip, data/schema/): integers and numbers as numbers, booleans as true or false, lists as arrays; an empty number or boolean is null and empty text is an empty string. value_printed is each value exactly as the document prints it; value_num only places a point on a chart. range_low, range_high, ci_low and ci_high keep their printed text. The source registry (sources) has no schema, so its fields are text, as in its CSV."},
"tables": {
"labs": [
{"lab_id":"anthropic","name":"Anthropic","short_name":"","website":"","docs_index_url":"https://www.anthropic.com/system-cards","frameworks":["Responsible Scaling Policy"],"aliases":[],"notes":""},
{"lab_id":"deepseek","name":"DeepSeek","short_name":"","website":"","docs_index_url":"","frameworks":[],"aliases":[],"notes":""},
{"lab_id":"google-deepmind","name":"Google DeepMind","short_name":"","website":"","docs_index_url":"https://deepmind.google/models/model-cards/","frameworks":["Frontier Safety Framework","Internal launch thresholds"],"aliases":[],"notes":""},
{"lab_id":"meta","name":"Meta","short_name":"","website":"","docs_index_url":"https://ai.meta.com/","frameworks":["Advanced AI Scaling Framework"],"aliases":[],"notes":""},
{"lab_id":"moonshot-ai","name":"Moonshot AI","short_name":"","website":"","docs_index_url":"","frameworks":[],"aliases":[],"notes":""},
{"lab_id":"openai","name":"OpenAI","short_name":"","website":"","docs_index_url":"https://deploymentsafety.openai.com/","frameworks":["Preparedness Framework"],"aliases":[],"notes":""},
{"lab_id":"xai","name":"xAI","short_name":"","website":"","docs_index_url":"https://data.x.ai/","frameworks":["FAIF"],"aliases":[],"notes":""},
{"lab_id":"zhipu-ai","name":"Zhipu AI","short_name":"","website":"","docs_index_url":"","frameworks":[],"aliases":["Zhipu AI (Z.ai)"],"notes":""}
],
"models": [
{"model_id":"chatgpt-agent","lab_id":"openai","name":"ChatGPT agent","aliases":[],"family":"ChatGPT agent","release_date":"","release_date_source":"","availability":"public","notes":"No document in the dataset is about this model, so no release date is recorded. Appears only as a comparison in the GPT-5 card; its own system card is in the registry backlog, not collected."},
{"model_id":"claude-fable-5","lab_id":"anthropic","name":"Claude Fable 5","aliases":[],"family":"Claude Fable","release_date":"2026-06-09","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-fable-5-claude-mythos-5-system-card."},
{"model_id":"claude-fable-5-1","lab_id":"anthropic","name":"Claude Fable 5.1","aliases":[],"family":"Claude Fable","release_date":"2026-09-01","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-fable-5-1-claude-mythos-5-1-system-card."},
{"model_id":"claude-haiku-3-5","lab_id":"anthropic","name":"Claude Haiku 3.5","aliases":[],"family":"Claude Haiku","release_date":"","release_date_source":"","availability":"public","notes":"No document in the dataset is about this model, so no release date is recorded."},
{"model_id":"claude-haiku-4-5","lab_id":"anthropic","name":"Claude Haiku 4.5","aliases":[],"family":"Claude Haiku","release_date":"2025-10-15","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-haiku-4-5-system-card."},
{"model_id":"claude-mythos-5","lab_id":"anthropic","name":"Claude Mythos 5","aliases":[],"family":"Claude Mythos","release_date":"2026-06-09","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-fable-5-claude-mythos-5-system-card."},
{"model_id":"claude-mythos-5-1","lab_id":"anthropic","name":"Claude Mythos 5.1","aliases":[],"family":"Claude Mythos","release_date":"2026-09-01","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-fable-5-1-claude-mythos-5-1-system-card."},
{"model_id":"claude-mythos-preview","lab_id":"anthropic","name":"Claude Mythos Preview","aliases":[],"family":"Claude Mythos","release_date":"2026-04-07","release_date_source":"document","availability":"limited","notes":"Release date: publication date of anthropic-claude-mythos-preview-system-card. Released to a limited set of partners (registry: limited-release model; v0 row 273: defensive-cyber partners only, Project Glasswing)."},
{"model_id":"claude-opus-4","lab_id":"anthropic","name":"Claude Opus 4","aliases":[],"family":"Claude Opus","release_date":"2025-05-22","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-opus-4-sonnet-4-system-card."},
{"model_id":"claude-opus-4-1","lab_id":"anthropic","name":"Claude Opus 4.1","aliases":[],"family":"Claude Opus","release_date":"2025-08-05","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-opus-4-1-system-card-addendum."},
{"model_id":"claude-opus-4-5","lab_id":"anthropic","name":"Claude Opus 4.5","aliases":[],"family":"Claude Opus","release_date":"2025-11-24","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-opus-4-5-system-card."},
{"model_id":"claude-opus-4-6","lab_id":"anthropic","name":"Claude Opus 4.6","aliases":[],"family":"Claude Opus","release_date":"2026-02","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-opus-4-6-system-card."},
{"model_id":"claude-opus-4-7","lab_id":"anthropic","name":"Claude Opus 4.7","aliases":[],"family":"Claude Opus","release_date":"2026-04-16","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-opus-4-7-system-card."},
{"model_id":"claude-opus-4-8","lab_id":"anthropic","name":"Claude Opus 4.8","aliases":[],"family":"Claude Opus","release_date":"2026-05-28","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-opus-4-8-system-card."},
{"model_id":"claude-opus-5","lab_id":"anthropic","name":"Claude Opus 5","aliases":[],"family":"Claude Opus","release_date":"2026-07-24","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-opus-5-system-card."},
{"model_id":"claude-opus-5-5","lab_id":"anthropic","name":"Claude Opus 5.5","aliases":[],"family":"Claude Opus","release_date":"2026-09-22","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-opus-5-5-system-card."},
{"model_id":"claude-sonnet-3-7","lab_id":"anthropic","name":"Claude Sonnet 3.7","aliases":[],"family":"Claude Sonnet","release_date":"","release_date_source":"","availability":"public","notes":"No document in the dataset is about this model, so no release date is recorded."},
{"model_id":"claude-sonnet-4","lab_id":"anthropic","name":"Claude Sonnet 4","aliases":[],"family":"Claude Sonnet","release_date":"2025-05-22","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-opus-4-sonnet-4-system-card."},
{"model_id":"claude-sonnet-4-5","lab_id":"anthropic","name":"Claude Sonnet 4.5","aliases":[],"family":"Claude Sonnet","release_date":"2025-09-29","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-sonnet-4-5-system-card."},
{"model_id":"claude-sonnet-4-6","lab_id":"anthropic","name":"Claude Sonnet 4.6","aliases":[],"family":"Claude Sonnet","release_date":"2026-02-17","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-sonnet-4-6-system-card."},
{"model_id":"claude-sonnet-5","lab_id":"anthropic","name":"Claude Sonnet 5","aliases":[],"family":"Claude Sonnet","release_date":"2026-06-30","release_date_source":"document","availability":"public","notes":"Release date: publication date of anthropic-claude-sonnet-5-system-card."},
{"model_id":"codex-1","lab_id":"openai","name":"codex-1","aliases":[],"family":"Codex","release_date":"","release_date_source":"","availability":"public","notes":"No document in the dataset is about this model, so no release date is recorded."},
{"model_id":"deepseek-r1","lab_id":"deepseek","name":"DeepSeek-R1","aliases":[],"family":"DeepSeek-R","release_date":"2025-09-17","release_date_source":"document","availability":"public","notes":"Release date: publication date of deepseek-r1-paper-nature-arxiv-v2. Whether weights were released is not stated in the registry or v0 notes; recorded as public until a source says otherwise."},
{"model_id":"gemini-1-5-pro","lab_id":"google-deepmind","name":"Gemini 1.5 Pro","aliases":["Gemini 1.5 Pro 002"],"family":"Gemini Pro","release_date":"","release_date_source":"","availability":"public","notes":"No document in the dataset is about this model, so no release date is recorded. Appears only as the 002 version, a comparison in the Gemini 2.5 technical report; no document in the dataset is about it."},
{"model_id":"gemini-2-0-flash","lab_id":"google-deepmind","name":"Gemini 2.0 Flash","aliases":[],"family":"Gemini Flash","release_date":"","release_date_source":"","availability":"public","notes":"No document in the dataset is about this model, so no release date is recorded."},
{"model_id":"gemini-2-5-deep-think","lab_id":"google-deepmind","name":"Gemini 2.5 Deep Think","aliases":[],"family":"Gemini Deep Think","release_date":"2025-08-01","release_date_source":"document","availability":"public","notes":"Release date: publication date of google-deepmind-gemini-2-5-deep-think-model-card."},
{"model_id":"gemini-2-5-flash","lab_id":"google-deepmind","name":"Gemini 2.5 Flash","aliases":[],"family":"Gemini Flash","release_date":"2025-06-17","release_date_source":"document","availability":"public","notes":"Release date: publication date of google-deepmind-gemini-2-5-technical-report."},
{"model_id":"gemini-2-5-pro","lab_id":"google-deepmind","name":"Gemini 2.5 Pro","aliases":["Gemini 2.5 Pro Preview","Gemini 2.5 Pro Preview 05-06"],"family":"Gemini Pro","release_date":"2025-06-17","release_date_source":"document","availability":"public","notes":"Release date: publication date of google-deepmind-gemini-2-5-technical-report."},
{"model_id":"gemini-3-1-flash-lite","lab_id":"google-deepmind","name":"Gemini 3.1 Flash-Lite","aliases":[],"family":"Gemini Flash-Lite","release_date":"2026-03-03","release_date_source":"document","availability":"public","notes":"Release date: publication date of google-deepmind-gemini-3-1-flash-lite-model-card."},
{"model_id":"gemini-3-1-pro","lab_id":"google-deepmind","name":"Gemini 3.1 Pro","aliases":[],"family":"Gemini Pro","release_date":"2026-02-19","release_date_source":"document","availability":"public","notes":"Release date: publication date of google-deepmind-gemini-3-1-pro-model-card."},
{"model_id":"gemini-3-5-flash","lab_id":"google-deepmind","name":"Gemini 3.5 Flash","aliases":[],"family":"Gemini Flash","release_date":"2026-05-19","release_date_source":"document","availability":"public","notes":"Release date: publication date of google-deepmind-gemini-3-5-flash-model-card."},
{"model_id":"gemini-3-5-flash-lite","lab_id":"google-deepmind","name":"Gemini 3.5 Flash-Lite","aliases":[],"family":"Gemini Flash-Lite","release_date":"2026-07-21","release_date_source":"document","availability":"public","notes":"Release date: publication date of google-deepmind-gemini-3-5-flash-lite-model-card."},
{"model_id":"gemini-3-6-flash","lab_id":"google-deepmind","name":"Gemini 3.6 Flash","aliases":[],"family":"Gemini Flash","release_date":"2026-07-21","release_date_source":"document","availability":"public","notes":"Release date: publication date of google-deepmind-gemini-3-6-flash-model-card."},
{"model_id":"gemini-3-7-flash","lab_id":"google-deepmind","name":"Gemini 3.7 Flash","aliases":[],"family":"Gemini Flash","release_date":"2026-08-13","release_date_source":"document","availability":"public","notes":"Release date: publication date of google-deepmind-gemini-3-7-flash-model-card."},
{"model_id":"gemini-3-8-flash","lab_id":"google-deepmind","name":"Gemini 3.8 Flash","aliases":[],"family":"Gemini Flash","release_date":"2026-09-02","release_date_source":"document","availability":"public","notes":"Release date: publication date of google-deepmind-gemini-3-8-flash-model-card."},
{"model_id":"gemini-3-flash","lab_id":"google-deepmind","name":"Gemini 3 Flash","aliases":[],"family":"Gemini Flash","release_date":"2025-12-17","release_date_source":"document","availability":"public","notes":"Release date: publication date of google-deepmind-gemini-3-flash-model-card."},
{"model_id":"gemini-3-pro","lab_id":"google-deepmind","name":"Gemini 3 Pro","aliases":[],"family":"Gemini Pro","release_date":"2025-11-18","release_date_source":"document","availability":"public","notes":"Release date: publication date of google-deepmind-gemini-3-pro-model-card."},
{"model_id":"glm-4-5","lab_id":"zhipu-ai","name":"GLM-4.5","aliases":[],"family":"GLM","release_date":"2025-08-08","release_date_source":"document","availability":"public","notes":"Release date: publication date of zhipu-ai-glm-4-5-technical-report. Whether weights were released is not stated in the registry or v0 notes; recorded as public until a source says otherwise."},
{"model_id":"gpt-4o","lab_id":"openai","name":"GPT-4o","aliases":[],"family":"GPT-4o","release_date":"","release_date_source":"","availability":"public","notes":"No document in the dataset is about this model, so no release date is recorded."},
{"model_id":"gpt-5-1-codex","lab_id":"openai","name":"GPT-5.1-Codex","aliases":[],"family":"Codex","release_date":"","release_date_source":"","availability":"public","notes":"No document in the dataset is about this model, so no release date is recorded."},
{"model_id":"gpt-5-1-codex-max","lab_id":"openai","name":"GPT-5.1-Codex-Max","aliases":[],"family":"Codex","release_date":"2025-11-18","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-1-codex-max-system-card."},
{"model_id":"gpt-5-1-instant","lab_id":"openai","name":"gpt-5.1-instant","aliases":[],"family":"GPT-5","release_date":"2025-11-12","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-1-instant-and-thinking-system-card-addendum."},
{"model_id":"gpt-5-1-thinking","lab_id":"openai","name":"gpt-5.1-thinking","aliases":["GPT-5.1 Thinking"],"family":"GPT-5","release_date":"2025-11-12","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-1-instant-and-thinking-system-card-addendum."},
{"model_id":"gpt-5-2","lab_id":"openai","name":"GPT-5.2","aliases":[],"family":"GPT-5","release_date":"","release_date_source":"","availability":"public","notes":"No document in the dataset is about this model, so no release date is recorded. Printed without a variant in the GPT-5.3-Codex card (Apollo sabotage capability). The GPT-5.2 card covers gpt-5.2-thinking and gpt-5.2-instant, and the source as recorded does not say which one this is, so it is kept separate rather than merged."},
{"model_id":"gpt-5-2-codex","lab_id":"openai","name":"GPT-5.2-Codex","aliases":[],"family":"Codex","release_date":"2025-12-18","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-2-codex-system-card-addendum."},
{"model_id":"gpt-5-2-instant","lab_id":"openai","name":"gpt-5.2-instant","aliases":[],"family":"GPT-5","release_date":"2025-12-11","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-2-system-card-update-to-gpt-5-card."},
{"model_id":"gpt-5-2-thinking","lab_id":"openai","name":"gpt-5.2-thinking","aliases":["GPT-5.2 Thinking"],"family":"GPT-5","release_date":"2025-12-11","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-2-system-card-update-to-gpt-5-card."},
{"model_id":"gpt-5-3-codex","lab_id":"openai","name":"GPT-5.3-Codex","aliases":["GPT-5.3-Codex (pre-release)"],"family":"Codex","release_date":"2026-02-05","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-3-codex-system-card."},
{"model_id":"gpt-5-3-instant","lab_id":"openai","name":"GPT-5.3 Instant","aliases":[],"family":"GPT-5","release_date":"2026-03-03","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-3-instant-system-card."},
{"model_id":"gpt-5-4-thinking","lab_id":"openai","name":"GPT-5.4 Thinking","aliases":["GPT-5.4 (pre-release)"],"family":"GPT-5","release_date":"2026-03-05","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-4-thinking-system-card. The GPT-5.5 card cites a pre-release GPT-5.4 checkpoint (Apollo), recorded as snapshot \"pre-release\" of this model."},
{"model_id":"gpt-5-5","lab_id":"openai","name":"GPT-5.5","aliases":["GPT-5.5 Thinking","GPT-5.5 (xhigh)"],"family":"GPT-5","release_date":"2026-04-23","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-5-system-card. Also printed as \"GPT-5.5 Thinking\" (GPT-5.6 and GPT-6 Astra cards) and \"GPT-5.5 (xhigh)\" (Grok 4.5 card); GPT-5.5 Instant is a separate model."},
{"model_id":"gpt-5-5-instant","lab_id":"openai","name":"GPT-5.5 Instant","aliases":[],"family":"GPT-5","release_date":"2026-05-04","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-5-instant-system-card."},
{"model_id":"gpt-5-6-luna","lab_id":"openai","name":"GPT-5.6 Luna","aliases":["GPT-5.6 Luna (August)"],"family":"GPT-5","release_date":"2026-06-25","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-6-preview-system-card."},
{"model_id":"gpt-5-6-sol","lab_id":"openai","name":"GPT-5.6 Sol","aliases":["GPT-5.6 Sol (August)","GPT-5.6 Sol (max)"],"family":"GPT-5","release_date":"2026-06-25","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-6-preview-system-card."},
{"model_id":"gpt-5-6-terra","lab_id":"openai","name":"GPT-5.6 Terra","aliases":[],"family":"GPT-5","release_date":"2026-06-25","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-6-preview-system-card."},
{"model_id":"gpt-5-codex","lab_id":"openai","name":"GPT-5-Codex","aliases":[],"family":"Codex","release_date":"2025-09-15","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-codex-system-card-addendum. The OpenAI hub marks it as no longer in production (registry)."},
{"model_id":"gpt-5-instant","lab_id":"openai","name":"gpt-5-instant","aliases":["gpt-5-instant-aug15","gpt-5-instant-oct3"],"family":"GPT-5","release_date":"","release_date_source":"","availability":"public","notes":"No document in the dataset is about this model, so no release date is recorded. Known only through its dated versions aug15 and oct3, compared in the GPT-5.1 addendum and GPT-5.2 card. The documents as recorded do not say whether it is the same model as gpt-5-main in the GPT-5 card, so it is kept separate."},
{"model_id":"gpt-5-main","lab_id":"openai","name":"gpt-5-main","aliases":[],"family":"GPT-5","release_date":"2025-08-07","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-system-card."},
{"model_id":"gpt-5-thinking","lab_id":"openai","name":"gpt-5-thinking","aliases":["GPT-5 (thinking)"],"family":"GPT-5","release_date":"2025-08-07","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-system-card."},
{"model_id":"gpt-5-thinking-helpful-only","lab_id":"openai","name":"gpt-5-thinking-helpful-only","aliases":[],"family":"GPT-5","release_date":"","release_date_source":"","availability":"internal","notes":"No document in the dataset is about this model, so no release date is recorded. A helpful-only research variant evaluated by Apollo in the GPT-5 card; not released."},
{"model_id":"gpt-5-thinking-mini","lab_id":"openai","name":"gpt-5-thinking-mini","aliases":[],"family":"GPT-5","release_date":"2025-08-07","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-system-card."},
{"model_id":"gpt-5-thinking-nano","lab_id":"openai","name":"gpt-5-thinking-nano","aliases":[],"family":"GPT-5","release_date":"2025-08-07","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-5-system-card."},
{"model_id":"gpt-6-astra","lab_id":"openai","name":"GPT-6 Astra","aliases":[],"family":"GPT-6","release_date":"2026-09-03","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-6-astra-system-card."},
{"model_id":"gpt-image-2-5-flare","lab_id":"openai","name":"GPT-Image-2.5-Flare","aliases":[],"family":"GPT-Image","release_date":"2026-09-08","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-chatgpt-images-2-5-system-card. One of the two image models behind ChatGPT Images 2.5."},
{"model_id":"gpt-image-2-5-sunburst","lab_id":"openai","name":"GPT-Image-2.5-Sunburst","aliases":[],"family":"GPT-Image","release_date":"2026-09-08","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-chatgpt-images-2-5-system-card. One of the two image models behind ChatGPT Images 2.5."},
{"model_id":"gpt-live-1","lab_id":"openai","name":"GPT-Live-1","aliases":[],"family":"GPT-Live","release_date":"2026-07-08","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-live-system-card."},
{"model_id":"gpt-live-1-mini","lab_id":"openai","name":"GPT-Live-1 mini","aliases":[],"family":"GPT-Live","release_date":"2026-07-08","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-gpt-live-system-card."},
{"model_id":"gpt-oss-120b","lab_id":"openai","name":"gpt-oss-120b","aliases":[],"family":"gpt-oss","release_date":"2025-08-05","release_date_source":"document","availability":"open_weights","notes":"Release date: publication date of openai-gpt-oss-120b-gpt-oss-20b-model-card."},
{"model_id":"gpt-oss-20b","lab_id":"openai","name":"gpt-oss-20b","aliases":[],"family":"gpt-oss","release_date":"2025-08-05","release_date_source":"document","availability":"open_weights","notes":"Release date: publication date of openai-gpt-oss-120b-gpt-oss-20b-model-card."},
{"model_id":"gpt-rosalind-5-5","lab_id":"openai","name":"GPT-Rosalind-5.5","aliases":[],"family":"GPT-Rosalind","release_date":"2026-06-03","release_date_source":"document","availability":"limited","notes":"Release date: publication date of openai-gpt-rosalind-5-5-system-card. A biology model offered through trusted access (registry; v0 row 1451: trusted-access research preview)."},
{"model_id":"grok-4","lab_id":"xai","name":"Grok 4","aliases":["Grok 4 (API)","Grok 4 (Web)"],"family":"Grok","release_date":"2025-08-20","release_date_source":"document","availability":"public","notes":"Release date: publication date of xai-grok-4-model-card. Its card reports values on two surfaces, API and grok.com, recorded as condition_surface."},
{"model_id":"grok-4-1","lab_id":"xai","name":"Grok 4.1","aliases":["Grok 4.1 Thinking","Grok 4.1 Non-Thinking"],"family":"Grok","release_date":"2025-11-17","release_date_source":"document","availability":"public","notes":"Release date: publication date of xai-grok-4-1-model-card. Its card reports Thinking and Non-Thinking settings, recorded as condition_mode reasoning and non-reasoning."},
{"model_id":"grok-4-20","lab_id":"xai","name":"Grok 4.20","aliases":["Grok 4.20 (single-agent)"],"family":"Grok","release_date":"2026-04-07","release_date_source":"document","availability":"public","notes":"Release date: publication date of xai-grok-4-20-system-card."},
{"model_id":"grok-4-5","lab_id":"xai","name":"Grok 4.5","aliases":["Grok 4.5 (high)"],"family":"Grok","release_date":"2026-07-14","release_date_source":"document","availability":"public","notes":"Release date: publication date of xai-grok-4-5-model-card."},
{"model_id":"grok-4-6","lab_id":"xai","name":"Grok 4.6","aliases":["Grok 4.6 (high)"],"family":"Grok","release_date":"2026-08-12","release_date_source":"document","availability":"public","notes":"Release date: publication date of xai-grok-4-6-model-card."},
{"model_id":"grok-4-7","lab_id":"xai","name":"Grok 4.7","aliases":["Grok 4.7 (high)"],"family":"Grok","release_date":"2026-09-21","release_date_source":"document","availability":"public","notes":"Release date: publication date of xai-grok-4-7-model-card."},
{"model_id":"grok-4-fast","lab_id":"xai","name":"Grok 4 Fast","aliases":["Grok 4 Fast (reasoning)","Grok 4 Fast (non-reasoning)"],"family":"Grok Fast","release_date":"2025-09-19","release_date_source":"document","availability":"public","notes":"Release date: publication date of xai-grok-4-fast-model-card."},
{"model_id":"grok-code-fast-1","lab_id":"xai","name":"Grok Code Fast 1","aliases":["grok-code-fast-1"],"family":"Grok Code","release_date":"2025-08-26","release_date_source":"document","availability":"public","notes":"Release date: publication date of xai-grok-code-fast-1-model-card."},
{"model_id":"kimi-k2-instruct","lab_id":"moonshot-ai","name":"Kimi K2-Instruct","aliases":[],"family":"Kimi","release_date":"2025-07-28","release_date_source":"document","availability":"public","notes":"Release date: publication date of moonshot-ai-kimi-k2-technical-report. The Kimi K2 technical report covers the K2 series; the extracted values are for this Instruct model. Whether weights were released is not stated in the registry or v0 notes."},
{"model_id":"kimi-k3","lab_id":"moonshot-ai","name":"Kimi K3","aliases":[],"family":"Kimi","release_date":"2026-07-27","release_date_source":"document","availability":"public","notes":"Release date: publication date of moonshot-ai-kimi-k3-technical-report."},
{"model_id":"llama-4-maverick","lab_id":"meta","name":"Llama 4 Maverick","aliases":[],"family":"Llama","release_date":"2025-04-05","release_date_source":"document","availability":"public","notes":"Release date: publication date of meta-llama-4-model-card. Whether weights were released is not stated in the registry or v0 notes; recorded as public until a source says otherwise. Values in the dataset cover Scout and Maverick together."},
{"model_id":"llama-4-scout","lab_id":"meta","name":"Llama 4 Scout","aliases":[],"family":"Llama","release_date":"2025-04-05","release_date_source":"document","availability":"public","notes":"Release date: publication date of meta-llama-4-model-card. Whether weights were released is not stated in the registry or v0 notes; recorded as public until a source says otherwise. Values in the dataset cover Scout and Maverick together."},
{"model_id":"muse-glimmer-30b","lab_id":"meta","name":"Muse Glimmer-30B","aliases":[],"family":"Muse Glimmer","release_date":"2026-08-10","release_date_source":"document","availability":"open_weights","notes":"Release date: publication date of meta-muse-glimmer-30b-model-card."},
{"model_id":"muse-spark","lab_id":"meta","name":"Muse Spark","aliases":[],"family":"Muse Spark","release_date":"2026-04-08","release_date_source":"document","availability":"public","notes":"Release date: publication date of meta-muse-spark-safety-preparedness-report."},
{"model_id":"muse-spark-1-1","lab_id":"meta","name":"Muse Spark 1.1","aliases":[],"family":"Muse Spark","release_date":"2026-07-09","release_date_source":"document","availability":"public","notes":"Release date: publication date of meta-muse-spark-1-1-evaluation-report."},
{"model_id":"o1","lab_id":"openai","name":"o1","aliases":[],"family":"o-series","release_date":"","release_date_source":"","availability":"public","notes":"No document in the dataset is about this model, so no release date is recorded."},
{"model_id":"o3","lab_id":"openai","name":"o3","aliases":[],"family":"o-series","release_date":"2025-04-16","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-o3-and-o4-mini-system-card."},
{"model_id":"o3-mini","lab_id":"openai","name":"o3-mini","aliases":[],"family":"o-series","release_date":"","release_date_source":"","availability":"public","notes":"No document in the dataset is about this model, so no release date is recorded."},
{"model_id":"o4-mini","lab_id":"openai","name":"o4-mini","aliases":[],"family":"o-series","release_date":"2025-04-16","release_date_source":"document","availability":"public","notes":"Release date: publication date of openai-o3-and-o4-mini-system-card."}
],
"documents": [
{"doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","lab_id":"anthropic","title":"Claude Fable 5.1 & Claude Mythos 5.1 System Card","doc_type":"system_card","subject_model_ids":["claude-fable-5-1","claude-mythos-5-1"],"published_date":"2026-09-01","date_precision":"day","canonical_url":"https://www-cdn.anthropic.com/0339e6a7c5c7b87f5c07798616dc32c215d14235/Claude%20Fable%205.1%20&%20Claude%20Mythos%205.1%20System%20Card.pdf","alt_urls":[],"has_changelog":"unknown","extraction_coverage_note":"Web reader stopped ~p.52; refers to an August 2026 Risk Report (not extracted)","notes":""},
{"doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","lab_id":"anthropic","title":"Claude Fable 5 & Claude Mythos 5 System Card","doc_type":"system_card","subject_model_ids":["claude-fable-5","claude-mythos-5"],"published_date":"2026-06-09","date_precision":"day","canonical_url":"https://www-cdn.anthropic.com/57a52ea7d8f0e54e8a542e908266086df425cdf5/Claude%20Fable%205%20&%20Claude%20Mythos%205%20System%20Card.pdf","alt_urls":[],"has_changelog":"yes","extraction_coverage_note":"Web reader stopped ~p.50","notes":"Known revisions (source registry): 2026-06-11 several corrections; 2026-06-25 executive-summary alignment risk \"low\"→\"very low\" to match §2.4 (verified)"},
{"doc_id":"anthropic-claude-haiku-4-5-system-card","lab_id":"anthropic","title":"Claude Haiku 4.5 System Card","doc_type":"system_card","subject_model_ids":["claude-haiku-4-5"],"published_date":"2025-10-15","date_precision":"day","canonical_url":"https://www-cdn.anthropic.com/7aad69bf12627d42234e01ee7c36305dc2f6a970.pdf","alt_urls":["https://assets.anthropic.com/m/99128ddd009bdcb/original/Claude-Haiku-4-5-System-Card.pdf"],"has_changelog":"no","extraction_coverage_note":"Read in full (~39 pages)","notes":""},
{"doc_id":"anthropic-claude-mythos-preview-system-card","lab_id":"anthropic","title":"Claude Mythos Preview System Card","doc_type":"system_card","subject_model_ids":["claude-mythos-preview"],"published_date":"2026-04-07","date_precision":"day","canonical_url":"https://www-cdn.anthropic.com/7624816413e9b4d2e3ba620c5a5e091b98b190a5/Claude%20Mythos%20Preview%20System%20Card.pdf","alt_urls":[],"has_changelog":"yes","extraction_coverage_note":"Web reader stopped ~p.49; limited-release model; first card under RSP v3.0","notes":"Known revisions (source registry): 2026-04-08; 2026-04-14"},
{"doc_id":"anthropic-claude-opus-4-1-system-card-addendum","lab_id":"anthropic","title":"Claude Opus 4.1 System Card (addendum)","doc_type":"addendum","subject_model_ids":["claude-opus-4-1"],"published_date":"2025-08-05","date_precision":"day","canonical_url":"https://www-cdn.anthropic.com/9fa30625273bafdf5af82c93719d7ca606485a16/Claude%204.1%20System%20Card.pdf","alt_urls":[],"has_changelog":"yes","extraction_coverage_note":"Read in full; carries corrected Opus 4 / Sonnet 4 reward-hacking numbers","notes":"Known revisions (source registry): 2025-09-15 CBRN partner acknowledgments"},
{"doc_id":"anthropic-claude-opus-4-5-system-card","lab_id":"anthropic","title":"Claude Opus 4.5 System Card","doc_type":"system_card","subject_model_ids":["claude-opus-4-5"],"published_date":"2025-11-24","date_precision":"day","canonical_url":"https://www-cdn.anthropic.com/bf10f64990cfda0ba858290be7b8cc6317685f47.pdf","alt_urls":["https://assets.anthropic.com/m/64823ba7485345a7/Claude-Opus-4-5-System-Card.pdf"],"has_changelog":"yes","extraction_coverage_note":"Web reader stopped at §5.2.2.2; §6–7 from secondary write-ups","notes":"Known revisions (source registry): 2025-11-24 ARC-AGI-1 and training-data fixes; 2025-11-25 caption typo; 2025-12-05 several corrections"},
{"doc_id":"anthropic-claude-opus-4-6-system-card","lab_id":"anthropic","title":"Claude Opus 4.6 System Card","doc_type":"system_card","subject_model_ids":["claude-opus-4-6"],"published_date":"2026-02","date_precision":"month","canonical_url":"https://www-cdn.anthropic.com/6a5fa276ac68b9aeb0c8b6af5fa36326e0e166dd/Claude%20Opus%204.6%20System%20Card.pdf","alt_urls":["https://www-cdn.anthropic.com/0dd865075ad3132672ee0ab40b05a53f14cf5288.pdf (earlier version)"],"has_changelog":"yes","extraction_coverage_note":"Web reader stopped ~p.58; sabotage figures live in a separate Sabotage Risk Report (not extracted)","notes":"Known revisions (source registry): 2026-02-06; 2026-02-10; 2026-02-17; 2026-03-06 (benchmark corrections, wording)"},
{"doc_id":"anthropic-claude-opus-4-7-system-card","lab_id":"anthropic","title":"Claude Opus 4.7 System Card","doc_type":"system_card","subject_model_ids":["claude-opus-4-7"],"published_date":"2026-04-16","date_precision":"day","canonical_url":"https://www-cdn.anthropic.com/037f06850df7fbe871e206dad004c3db5fd50340/Claude%20Opus%204.7%20System%20Card.pdf","alt_urls":[],"has_changelog":"unknown","extraction_coverage_note":"Web reader stopped ~p.52","notes":""},
{"doc_id":"anthropic-claude-opus-4-8-system-card","lab_id":"anthropic","title":"Claude Opus 4.8 System Card","doc_type":"system_card","subject_model_ids":["claude-opus-4-8"],"published_date":"2026-05-28","date_precision":"day","canonical_url":"https://www-cdn.anthropic.com/0f0c97ad20d8005706296bd92aa1c27c6b2f4f61/Claude%20Opus%204.8%20System%20Card.pdf","alt_urls":[],"has_changelog":"yes","extraction_coverage_note":"Web reader stopped ~p.57","notes":"Known revisions (source registry): 2026-06-03; 2026-06-17 (virology task 2 0.89→0.90; bug-bounty correction; scale fix)"},
{"doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","lab_id":"anthropic","title":"Claude Opus 4 & Sonnet 4 System Card","doc_type":"system_card","subject_model_ids":["claude-opus-4","claude-sonnet-4"],"published_date":"2025-05-22","date_precision":"day","canonical_url":"https://www-cdn.anthropic.com/6d8a8055020700718b0c49369f60816ba2a7c285/Claude%204%20System%20Card.pdf","alt_urls":["https://www.anthropic.com/claude-4-system-card (redirect)"],"has_changelog":"yes","extraction_coverage_note":"Web reader stopped at §4.2.1; later sections partly from secondary write-ups","notes":"Known revisions (source registry): 2025-07-16 footnote and formatting; 2025-09-02 corrected Claude Code Impossible Tasks numbers"},
{"doc_id":"anthropic-claude-opus-5-5-system-card","lab_id":"anthropic","title":"Claude Opus 5.5 System Card","doc_type":"system_card","subject_model_ids":["claude-opus-5-5"],"published_date":"2026-09-22","date_precision":"day","canonical_url":"https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf","alt_urls":[],"has_changelog":"unknown","extraction_coverage_note":"Web reader stopped ~p.49","notes":""},
{"doc_id":"anthropic-claude-opus-5-system-card","lab_id":"anthropic","title":"Claude Opus 5 System Card","doc_type":"system_card","subject_model_ids":["claude-opus-5"],"published_date":"2026-07-24","date_precision":"day","canonical_url":"https://www-cdn.anthropic.com/ceaf5c7ff2783855203fde8208ec311252dced5b/Claude%20Opus%205%20System%20Card.pdf","alt_urls":[],"has_changelog":"yes","extraction_coverage_note":"Web reader stopped ~p.57","notes":"Known revisions (source registry): 2026-08-19 prompt-injection bug-bounty results added; Cowork harness fixes; thinking-disabled results removed"},
{"doc_id":"anthropic-claude-sonnet-4-5-system-card","lab_id":"anthropic","title":"Claude Sonnet 4.5 System Card","doc_type":"system_card","subject_model_ids":["claude-sonnet-4-5"],"published_date":"2025-09-29","date_precision":"day","canonical_url":"https://www-cdn.anthropic.com/963373e433e489a87a10c823c52a0a013e9172dd/Claude%20Sonnet%204.5%20System%20Card.pdf","alt_urls":[],"has_changelog":"yes","extraction_coverage_note":"Web reader stopped at §7.2; alignment numbers partly from secondary write-ups","notes":"Known revisions (source registry): 2025-10-10 footnote author fix; 2025-12-03 edit to §9.3.5"},
{"doc_id":"anthropic-claude-sonnet-4-6-system-card","lab_id":"anthropic","title":"Claude Sonnet 4.6 System Card","doc_type":"system_card","subject_model_ids":["claude-sonnet-4-6"],"published_date":"2026-02-17","date_precision":"day","canonical_url":"https://www-cdn.anthropic.com/bbd8ef16d70b7a1665f14f306ee88b53f686aa75/Claude%20Sonnet%204.6%20System%20Card.pdf","alt_urls":[],"has_changelog":"yes","extraction_coverage_note":"Web reader stopped ~p.68","notes":"Known revisions (source registry): 2026-03-06 BrowseComp; section moved"},
{"doc_id":"anthropic-claude-sonnet-5-system-card","lab_id":"anthropic","title":"Claude Sonnet 5 System Card","doc_type":"system_card","subject_model_ids":["claude-sonnet-5"],"published_date":"2026-06-30","date_precision":"day","canonical_url":"https://www-cdn.anthropic.com/283ef97c476cf442c91d9a37d5b214242a55bb92/Claude%20Sonnet%205%20System%20Card.pdf","alt_urls":[],"has_changelog":"yes","extraction_coverage_note":"Web reader stopped ~p.56","notes":"Known revisions (source registry): 2026-07-10 BrowseComp footnote"},
{"doc_id":"deepseek-r1-paper-nature-arxiv-v2","lab_id":"deepseek","title":"DeepSeek-R1 paper (Nature; arXiv v2)","doc_type":"tech_report","subject_model_ids":["deepseek-r1"],"published_date":"2025-09-17","date_precision":"day","canonical_url":"https://arxiv.org/html/2501.12948v2","alt_urls":[],"has_changelog":"not_applicable","extraction_coverage_note":"Supplementary D.3 safety tables not yet extracted","notes":""},
{"doc_id":"google-deepmind-gemini-2-5-deep-think-model-card","lab_id":"google-deepmind","title":"Gemini 2.5 Deep Think Model Card","doc_type":"model_card","subject_model_ids":["gemini-2-5-deep-think"],"published_date":"2025-08-01","date_precision":"day","canonical_url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-2-5-Deep-Think-Model-Card.pdf","alt_urls":[],"has_changelog":"no","extraction_coverage_note":"First model to reach CBRN early-warning alert threshold","notes":""},
{"doc_id":"google-deepmind-gemini-2-5-flash-model-card","lab_id":"google-deepmind","title":"Gemini 2.5 Flash Model Card","doc_type":"model_card","subject_model_ids":["gemini-2-5-flash"],"published_date":"2025-09-26","date_precision":"day","canonical_url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-2-5-Flash-Model-Card.pdf","alt_urls":[],"has_changelog":"no","extraction_coverage_note":"v0 card_date \"2025-12\" is the updated-header date; use 2025-09-26 as published date and record a Dec 2025 version","notes":"Known revisions (source registry): header says updated Dec 2025; no changelog"},
{"doc_id":"google-deepmind-gemini-2-5-pro-model-card","lab_id":"google-deepmind","title":"Gemini 2.5 Pro Model Card","doc_type":"model_card","subject_model_ids":["gemini-2-5-pro"],"published_date":"2025-06-27","date_precision":"day","canonical_url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-2-5-Pro-Model-Card.pdf","alt_urls":["https://storage.googleapis.com/model-cards/documents/gemini-2.5-pro.pdf"],"has_changelog":"no","extraction_coverage_note":"Cyber figures differ from tech report (low confidence rows)","notes":"Known revisions (source registry): card shows columns for several preview versions"},
{"doc_id":"google-deepmind-gemini-2-5-technical-report","lab_id":"google-deepmind","title":"Gemini 2.5 Technical Report","doc_type":"tech_report","subject_model_ids":["gemini-2-5-pro","gemini-2-5-flash"],"published_date":"2025-06-17","date_precision":"day","canonical_url":"https://storage.googleapis.com/deepmind-media/gemini/gemini_v2_5_report.pdf","alt_urls":["arXiv 2507.06261"],"has_changelog":"not_applicable","extraction_coverage_note":"Tables 7 and 9 headers garbled in extraction; column mapping inferred (medium confidence)","notes":""},
{"doc_id":"google-deepmind-gemini-3-1-flash-lite-model-card","lab_id":"google-deepmind","title":"Gemini 3.1 Flash-Lite Model Card","doc_type":"model_card","subject_model_ids":["gemini-3-1-flash-lite"],"published_date":"2026-03-03","date_precision":"day","canonical_url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-1-Flash-Lite-Model-Card.pdf","alt_urls":[],"has_changelog":"no","extraction_coverage_note":"","notes":"Known revisions (source registry): header says updated May 2026; no changelog"},
{"doc_id":"google-deepmind-gemini-3-1-pro-model-card","lab_id":"google-deepmind","title":"Gemini 3.1 Pro Model Card","doc_type":"model_card","subject_model_ids":["gemini-3-1-pro"],"published_date":"2026-02-19","date_precision":"day","canonical_url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-1-Pro-Model-Card.pdf","alt_urls":[],"has_changelog":"no","extraction_coverage_note":"","notes":""},
{"doc_id":"google-deepmind-gemini-3-5-flash-lite-model-card","lab_id":"google-deepmind","title":"Gemini 3.5 Flash-Lite Model Card","doc_type":"model_card","subject_model_ids":["gemini-3-5-flash-lite"],"published_date":"2026-07-21","date_precision":"day","canonical_url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-5-Flash-Lite-Model-Card.pdf","alt_urls":[],"has_changelog":"no","extraction_coverage_note":"","notes":""},
{"doc_id":"google-deepmind-gemini-3-5-flash-model-card","lab_id":"google-deepmind","title":"Gemini 3.5 Flash Model Card","doc_type":"model_card","subject_model_ids":["gemini-3-5-flash"],"published_date":"2026-05-19","date_precision":"day","canonical_url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-5-Flash-Model-Card.pdf","alt_urls":[],"has_changelog":"no","extraction_coverage_note":"FSF inherited from 3.1 Pro plus extra cyber testing","notes":""},
{"doc_id":"google-deepmind-gemini-3-6-flash-model-card","lab_id":"google-deepmind","title":"Gemini 3.6 Flash Model Card","doc_type":"model_card","subject_model_ids":["gemini-3-6-flash"],"published_date":"2026-07-21","date_precision":"day","canonical_url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-6-Flash-Model-Card.pdf","alt_urls":[],"has_changelog":"no","extraction_coverage_note":"Deltas printed as percentage points","notes":""},
{"doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","lab_id":"google-deepmind","title":"Gemini 3.7 Flash Frontier Safety Framework Report","doc_type":"fsf_report","subject_model_ids":["gemini-3-7-flash"],"published_date":"2026-08-13","date_precision":"day","canonical_url":"https://storage.googleapis.com/deepmind-media/gemini/gemini_3-7_flash_fsf_report.pdf","alt_urls":[],"has_changelog":"not_applicable","extraction_coverage_note":"First report under FSF v3.1","notes":""},
{"doc_id":"google-deepmind-gemini-3-7-flash-model-card","lab_id":"google-deepmind","title":"Gemini 3.7 Flash Model Card","doc_type":"model_card","subject_model_ids":["gemini-3-7-flash"],"published_date":"2026-08-13","date_precision":"day","canonical_url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-7-Flash-Model-Card.pdf","alt_urls":["https://deepmind.google/models/model-cards/gemini-3-7-flash/"],"has_changelog":"no","extraction_coverage_note":"","notes":"Known revisions (source registry): revision reported by a watchdog; no record found of what changed"},
{"doc_id":"google-deepmind-gemini-3-8-flash-model-card","lab_id":"google-deepmind","title":"Gemini 3.8 Flash Model Card","doc_type":"model_card","subject_model_ids":["gemini-3-8-flash"],"published_date":"2026-09-02","date_precision":"day","canonical_url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-8-Flash-Model-Card.pdf","alt_urls":["https://deepmind.google/models/model-cards/gemini-3-8-flash/"],"has_changelog":"no","extraction_coverage_note":"FSF inherited from 3.7 Flash","notes":""},
{"doc_id":"google-deepmind-gemini-3-flash-model-card","lab_id":"google-deepmind","title":"Gemini 3 Flash Model Card","doc_type":"model_card","subject_model_ids":["gemini-3-flash"],"published_date":"2025-12-17","date_precision":"day","canonical_url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-Flash-Model-Card.pdf","alt_urls":[],"has_changelog":"no","extraction_coverage_note":"FSF results inherited from Gemini 3 Pro","notes":""},
{"doc_id":"google-deepmind-gemini-3-launch-post","lab_id":"google-deepmind","title":"Gemini 3 launch post","doc_type":"launch_post","subject_model_ids":["gemini-3-pro"],"published_date":"2025-11-18","date_precision":"day","canonical_url":"https://blog.google/products/gemini/gemini-3/","alt_urls":[],"has_changelog":"not_applicable","extraction_coverage_note":"Only source for one factuality figure","notes":""},
{"doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","lab_id":"google-deepmind","title":"Gemini 3 Pro Frontier Safety Framework Report","doc_type":"fsf_report","subject_model_ids":["gemini-3-pro"],"published_date":"2025-11-18","date_precision":"day","canonical_url":"https://storage.googleapis.com/deepmind-media/gemini/gemini_3_pro_fsf_report.pdf","alt_urls":[],"has_changelog":"not_applicable","extraction_coverage_note":"Several results chart-only (excluded)","notes":""},
{"doc_id":"google-deepmind-gemini-3-pro-model-card","lab_id":"google-deepmind","title":"Gemini 3 Pro Model Card","doc_type":"model_card","subject_model_ids":["gemini-3-pro"],"published_date":"2025-11-18","date_precision":"day","canonical_url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-Pro-Model-Card.pdf","alt_urls":["https://deepmind.google/models/model-cards/gemini-3-pro/"],"has_changelog":"no","extraction_coverage_note":"","notes":"Known revisions (source registry): header says last updated May 2026; no changelog"},
{"doc_id":"meta-llama-4-launch-post","lab_id":"meta","title":"Llama 4 launch post","doc_type":"launch_post","subject_model_ids":["llama-4-scout","llama-4-maverick"],"published_date":"2025-04-05","date_precision":"day","canonical_url":"https://ai.meta.com/blog/llama-4-multimodal-intelligence/","alt_urls":[],"has_changelog":"not_applicable","extraction_coverage_note":"Refusal and bias percentages","notes":""},
{"doc_id":"meta-llama-4-model-card","lab_id":"meta","title":"Llama 4 Model Card","doc_type":"model_card","subject_model_ids":["llama-4-scout","llama-4-maverick"],"published_date":"2025-04-05","date_precision":"day","canonical_url":"https://github.com/meta-llama/llama-models/blob/main/models/llama4/MODEL_CARD.md","alt_urls":[],"has_changelog":"not_applicable","extraction_coverage_note":"No numeric safety results in card","notes":""},
{"doc_id":"meta-muse-glimmer-30b-model-card","lab_id":"meta","title":"Muse Glimmer-30B model card","doc_type":"model_card","subject_model_ids":["muse-glimmer-30b"],"published_date":"2026-08-10","date_precision":"day","canonical_url":"https://huggingface.co/meta-models/Muse-Glimmer-30B/blob/main/README.md","alt_urls":[],"has_changelog":"not_applicable","extraction_coverage_note":"Open weights; limited numbers","notes":""},
{"doc_id":"meta-muse-spark-1-1-evaluation-report","lab_id":"meta","title":"Muse Spark 1.1 Evaluation Report","doc_type":"safety_report","subject_model_ids":["muse-spark-1-1"],"published_date":"2026-07-09","date_precision":"day","canonical_url":"https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report/","alt_urls":[],"has_changelog":"not_applicable","extraction_coverage_note":"Restates several Muse Spark 1.0 values differently","notes":""},
{"doc_id":"meta-muse-spark-safety-preparedness-report","lab_id":"meta","title":"Muse Spark Safety & Preparedness Report","doc_type":"safety_report","subject_model_ids":["muse-spark"],"published_date":"2026-04-08","date_precision":"day","canonical_url":"https://ai.meta.com/static-resource/muse-spark-safety-and-preparedness-report/","alt_urls":[],"has_changelog":"partial","extraction_coverage_note":"First report under Meta Advanced AI Scaling Framework v2","notes":"Known revisions (source registry): 2026-05-26 instruction-hierarchy comparator scores fixed after a bug"},
{"doc_id":"moonshot-ai-kimi-k2-technical-report","lab_id":"moonshot-ai","title":"Kimi K2 technical report","doc_type":"tech_report","subject_model_ids":["kimi-k2-instruct"],"published_date":"2025-07-28","date_precision":"day","canonical_url":"https://arxiv.org/pdf/2507.20534v1","alt_urls":[],"has_changelog":"not_applicable","extraction_coverage_note":"Red-team pass rates","notes":""},
{"doc_id":"moonshot-ai-kimi-k3-technical-report","lab_id":"moonshot-ai","title":"Kimi K3 technical report","doc_type":"tech_report","subject_model_ids":["kimi-k3"],"published_date":"2026-07-27","date_precision":"day","canonical_url":"","alt_urls":[],"has_changelog":"not_applicable","extraction_coverage_note":"Only secondary summary used (vulnerability discovery); primary not located","notes":""},
{"doc_id":"openai-chatgpt-images-2-5-system-card","lab_id":"openai","title":"ChatGPT Images 2.5 System Card","doc_type":"system_card","subject_model_ids":["gpt-image-2-5-sunburst","gpt-image-2-5-flare"],"published_date":"2026-09-08","date_precision":"day","canonical_url":"https://deploymentsafety.openai.com/chatgpt-images-2-5","alt_urls":[],"has_changelog":"unknown","extraction_coverage_note":"Image-generation safety only","notes":""},
{"doc_id":"openai-gpt-5-1-codex-max-system-card","lab_id":"openai","title":"GPT-5.1-Codex-Max System Card","doc_type":"system_card","subject_model_ids":["gpt-5-1-codex-max"],"published_date":"2025-11-18","date_precision":"day","canonical_url":"https://cdn.openai.com/pdf/2a7d98b1-57e5-4147-8d0e-683894d782ae/5p1_codex_max_card_03.pdf","alt_urls":["https://deploymentsafety.openai.com/gpt-5-1-codex-max"],"has_changelog":"unknown","extraction_coverage_note":"","notes":"Known revisions (source registry): filename suffix _03 suggests earlier versions"},
{"doc_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum","lab_id":"openai","title":"GPT-5.1 Instant and Thinking System Card Addendum","doc_type":"addendum","subject_model_ids":["gpt-5-1-instant","gpt-5-1-thinking"],"published_date":"2025-11-12","date_precision":"day","canonical_url":"https://cdn.openai.com/pdf/4173ec8d-1229-47db-96de-06d87147e07e/5_1_system_card.pdf","alt_urls":[],"has_changelog":"unknown","extraction_coverage_note":"Introduces Production Benchmarks v2","notes":""},
{"doc_id":"openai-gpt-5-2-codex-system-card-addendum","lab_id":"openai","title":"GPT-5.2-Codex System Card Addendum","doc_type":"addendum","subject_model_ids":["gpt-5-2-codex"],"published_date":"2025-12-18","date_precision":"day","canonical_url":"https://cdn.openai.com/pdf/ac7c37ae-7f4c-4442-b741-2eabdeaf77e0/oai_5_2_Codex.pdf","alt_urls":[],"has_changelog":"unknown","extraction_coverage_note":"Partial extraction (15 rows)","notes":""},
{"doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","lab_id":"openai","title":"GPT-5.2 System Card (update to GPT-5 card)","doc_type":"system_card","subject_model_ids":["gpt-5-2-thinking","gpt-5-2-instant"],"published_date":"2025-12-11","date_precision":"day","canonical_url":"https://cdn.openai.com/pdf/3a4153c8-c748-4b71-8e31-aecbde944f8d/oai_5_2_system-card.pdf","alt_urls":["https://deploymentsafety.openai.com/gpt-5-2"],"has_changelog":"partial","extraction_coverage_note":"","notes":"Known revisions (source registry): 2026-04-24 hub added CoT monitorability/controllability and sandbagging sections (not in PDF)"},
{"doc_id":"openai-gpt-5-3-codex-system-card","lab_id":"openai","title":"GPT-5.3-Codex System Card","doc_type":"system_card","subject_model_ids":["gpt-5-3-codex"],"published_date":"2026-02-05","date_precision":"day","canonical_url":"https://cdn.openai.com/pdf/23eca107-a9b1-4d2c-b156-7deb4fbc697c/GPT-5-3-Codex-System-Card-02.pdf","alt_urls":["https://deploymentsafety.openai.com/gpt-5-3-codex"],"has_changelog":"unknown","extraction_coverage_note":"First launch treated as High in cyber","notes":"Known revisions (source registry): filename suffix -02"},
{"doc_id":"openai-gpt-5-3-instant-system-card","lab_id":"openai","title":"GPT-5.3 Instant System Card","doc_type":"system_card","subject_model_ids":["gpt-5-3-instant"],"published_date":"2026-03-03","date_precision":"day","canonical_url":"https://deploymentsafety.openai.com/gpt-5-3-instant/gpt-5-3-instant.pdf","alt_urls":[],"has_changelog":"unknown","extraction_coverage_note":"Short card","notes":""},
{"doc_id":"openai-gpt-5-4-thinking-system-card","lab_id":"openai","title":"GPT-5.4 Thinking System Card","doc_type":"system_card","subject_model_ids":["gpt-5-4-thinking"],"published_date":"2026-03-05","date_precision":"day","canonical_url":"https://deploymentsafety.openai.com/gpt-5-4-thinking/gpt-5-4-thinking.pdf","alt_urls":[],"has_changelog":"unknown","extraction_coverage_note":"Jailbreak results figure-only","notes":""},
{"doc_id":"openai-gpt-5-5-instant-system-card","lab_id":"openai","title":"GPT-5.5 Instant System Card","doc_type":"system_card","subject_model_ids":["gpt-5-5-instant"],"published_date":"2026-05-04","date_precision":"day","canonical_url":"https://deploymentsafety.openai.com/gpt-5-5-instant/gpt-5-5-instant.pdf","alt_urls":[],"has_changelog":"unknown","extraction_coverage_note":"","notes":""},
{"doc_id":"openai-gpt-5-5-system-card","lab_id":"openai","title":"GPT-5.5 System Card","doc_type":"system_card","subject_model_ids":["gpt-5-5"],"published_date":"2026-04-23","date_precision":"day","canonical_url":"https://deploymentsafety.openai.com/gpt-5-5/gpt-5-5.pdf","alt_urls":[],"has_changelog":"unknown","extraction_coverage_note":"","notes":""},
{"doc_id":"openai-gpt-5-6-august-updates-system-card","lab_id":"openai","title":"GPT-5.6 August Updates System Card","doc_type":"system_card","subject_model_ids":["gpt-5-6-sol","gpt-5-6-luna"],"published_date":"2026-08-06","date_precision":"day","canonical_url":"https://deploymentsafety.openai.com/gpt-5-6-august-update/gpt-5-6-august-update.pdf","alt_urls":[],"has_changelog":"unknown","extraction_coverage_note":"","notes":""},
{"doc_id":"openai-gpt-5-6-preview-system-card","lab_id":"openai","title":"GPT-5.6 Preview System Card","doc_type":"system_card","subject_model_ids":["gpt-5-6-sol","gpt-5-6-terra","gpt-5-6-luna"],"published_date":"2026-06-25","date_precision":"day","canonical_url":"https://deploymentsafety.openai.com/gpt-5-6-preview/gpt-5-6-preview.pdf","alt_urls":[],"has_changelog":"yes","extraction_coverage_note":"","notes":"Known revisions (source registry): 2026-08-19 GPT-5.5 protein-binding pass@4 corrected 0.4%→1.5% (changelog verified 2026-09-26; same entry as GPT-5.6 system card)"},
{"doc_id":"openai-gpt-5-6-system-card","lab_id":"openai","title":"GPT-5.6 System Card","doc_type":"system_card","subject_model_ids":["gpt-5-6-sol","gpt-5-6-terra","gpt-5-6-luna"],"published_date":"2026-07-09","date_precision":"day","canonical_url":"https://deploymentsafety.openai.com/gpt-5-6/gpt-5-6.pdf","alt_urls":[],"has_changelog":"yes","extraction_coverage_note":"","notes":"Known revisions (source registry): 2026-06-27 metagaming plots re-aggregated; 2026-08-03 GPT-Red prompt-injection results added; 2026-08-19 GPT-5.5 protein-binding pass@4 corrected 0.4%→1.5% (changelog verified 2026-09-26)"},
{"doc_id":"openai-gpt-5-codex-system-card-addendum","lab_id":"openai","title":"GPT-5-Codex System Card Addendum","doc_type":"addendum","subject_model_ids":["gpt-5-codex"],"published_date":"2025-09-15","date_precision":"day","canonical_url":"https://cdn.openai.com/pdf/97cc5669-7a25-4e63-b15f-5fd5bdc4d149/gpt-5-codex-system-card.pdf","alt_urls":[],"has_changelog":"unknown","extraction_coverage_note":"","notes":"Known revisions (source registry): hub marks it no longer in production"},
{"doc_id":"openai-gpt-5-system-card","lab_id":"openai","title":"GPT-5 System Card","doc_type":"system_card","subject_model_ids":["gpt-5-thinking","gpt-5-main","gpt-5-thinking-mini","gpt-5-thinking-nano"],"published_date":"2025-08-07","date_precision":"day","canonical_url":"https://cdn.openai.com/gpt-5-system-card.pdf","alt_urls":["https://deploymentsafety.openai.com/gpt-5"],"has_changelog":"partial","extraction_coverage_note":"Many Preparedness numbers are chart-only (excluded)","notes":"Known revisions (source registry): PDF of 2025-08-07 replaced by 2025-08-13 version without changelog; 2026-04-24 hub added chain-of-thought evaluations"},
{"doc_id":"openai-gpt-6-astra-launch-post","lab_id":"openai","title":"GPT-6 Astra launch post","doc_type":"launch_post","subject_model_ids":["gpt-6-astra"],"published_date":"2026-09-03","date_precision":"day","canonical_url":"https://openai.com/index/gpt-6-astra/","alt_urls":[],"has_changelog":"not_applicable","extraction_coverage_note":"v0 labels these rows \"GPT-6 Astra system card\"; assign by source_url","notes":""},
{"doc_id":"openai-gpt-6-astra-system-card","lab_id":"openai","title":"GPT-6 Astra System Card","doc_type":"system_card","subject_model_ids":["gpt-6-astra"],"published_date":"2026-09-03","date_precision":"day","canonical_url":"https://deploymentsafety.openai.com/gpt-6-astra/gpt-6-astra.pdf","alt_urls":["https://deploymentsafety.openai.com/gpt-6-astra (HTML sections of the same document)"],"has_changelog":"yes","extraction_coverage_note":"Web reader stopped around §9. v0 rows whose source_url is the launch post belong to openai-gpt-6-astra-launch-post, not to this card","notes":"Known revisions (source registry): 2026-09-09 alignment section rewritten (\"alignment faking\"→\"oversight gaming\"); 2026-09-22 HealthBench fix, appendix on GPT-6 Sol/Luna, updated alignment evals"},
{"doc_id":"openai-gpt-live-system-card","lab_id":"openai","title":"GPT-Live System Card","doc_type":"system_card","subject_model_ids":["gpt-live-1","gpt-live-1-mini"],"published_date":"2026-07-08","date_precision":"day","canonical_url":"https://deploymentsafety.openai.com/gpt-live/gpt-live.pdf","alt_urls":[],"has_changelog":"yes","extraction_coverage_note":"Voice model","notes":"Known revisions (source registry): 2026-08-04 configuration mismatch; Appendix A lists original vs corrected values"},
{"doc_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card","lab_id":"openai","title":"gpt-oss-120b & gpt-oss-20b Model Card","doc_type":"model_card","subject_model_ids":["gpt-oss-120b","gpt-oss-20b"],"published_date":"2025-08-05","date_precision":"day","canonical_url":"https://cdn.openai.com/pdf/419b6906-9da6-406c-a19d-1bb078ac7637/oai_gpt-oss_model_card.pdf","alt_urls":["https://deploymentsafety.openai.com/gpt-oss","arXiv 2508.10925"],"has_changelog":"unknown","extraction_coverage_note":"Open-weight; includes worst-case malicious fine-tuning assessment","notes":""},
{"doc_id":"openai-gpt-rosalind-5-5-system-card","lab_id":"openai","title":"GPT-Rosalind-5.5 System Card","doc_type":"system_card","subject_model_ids":["gpt-rosalind-5-5"],"published_date":"2026-06-03","date_precision":"day","canonical_url":"https://deploymentsafety.openai.com/gpt-rosalind-5-5","alt_urls":[],"has_changelog":"unknown","extraction_coverage_note":"Biology model, trusted access; bio scores not extracted","notes":""},
{"doc_id":"openai-o3-and-o4-mini-system-card","lab_id":"openai","title":"OpenAI o3 and o4-mini System Card","doc_type":"system_card","subject_model_ids":["o3","o4-mini"],"published_date":"2025-04-16","date_precision":"day","canonical_url":"https://cdn.openai.com/pdf/2221c875-02dc-4789-800b-e7758f3722c1/o3-and-o4-mini-system-card.pdf","alt_urls":[],"has_changelog":"unknown","extraction_coverage_note":"Most numbers stated in text","notes":""},
{"doc_id":"openai-our-framework-for-reporting-model-misalignment","lab_id":"openai","title":"Our framework for reporting model misalignment","doc_type":"policy_post","subject_model_ids":["gpt-5-6-sol"],"published_date":"2026-09-16","date_precision":"day","canonical_url":"https://openai.com/index/model-misalignment-reporting-framework/","alt_urls":[],"has_changelog":"not_applicable","extraction_coverage_note":"Not a card; six incident reports","notes":""},
{"doc_id":"xai-grok-4-1-model-card","lab_id":"xai","title":"Grok 4.1 Model Card","doc_type":"model_card","subject_model_ids":["grok-4-1"],"published_date":"2025-11-17","date_precision":"day","canonical_url":"https://data.x.ai/2025-11-17-grok-4-1-model-card.pdf","alt_urls":[],"has_changelog":"no","extraction_coverage_note":"","notes":""},
{"doc_id":"xai-grok-4-20-system-card","lab_id":"xai","title":"Grok 4.20 System Card","doc_type":"system_card","subject_model_ids":["grok-4-20"],"published_date":"2026-04-07","date_precision":"day","canonical_url":"https://data.x.ai/2026-04-07-grok-4-20-model-card.pdf","alt_urls":[],"has_changelog":"no","extraction_coverage_note":"First xAI card with an alignment audit (Petri 2.0)","notes":""},
{"doc_id":"xai-grok-4-5-model-card","lab_id":"xai","title":"Grok 4.5 Model Card","doc_type":"model_card","subject_model_ids":["grok-4-5"],"published_date":"2026-07-14","date_precision":"day","canonical_url":"https://media.x.ai/v1/website/4p5-5184fdf9.pdf","alt_urls":["https://cursor.com/resources/grok-4-5-model-card.pdf (original version)"],"has_changelog":"no","extraction_coverage_note":"Metric scales changed from 0–1 rates to percentages","notes":"Known revisions (source registry): 2026-07-20 revision, no changelog; safety values appear unchanged"},
{"doc_id":"xai-grok-4-6-model-card","lab_id":"xai","title":"Grok 4.6 Model Card","doc_type":"model_card","subject_model_ids":["grok-4-6"],"published_date":"2026-08-12","date_precision":"day","canonical_url":"https://media.x.ai/v1/website/card-4p6-4cd2dc57.pdf","alt_urls":["https://cursor.com/resources/grok-4-6-model-card.pdf (original version)"],"has_changelog":"partial","extraction_coverage_note":"See also https://www.themidasproject.com/watchtower/xai-08172026","notes":"Known revisions (source registry): 2026-08-17 revision: HackerBench harmful/dual-use 16.7%→6.9%, self-harm 3.7%→0.84%, MASK 3.8%→1.90% (verified); changelog gives no reason"},
{"doc_id":"xai-grok-4-7-model-card","lab_id":"xai","title":"Grok 4.7 Model Card","doc_type":"model_card","subject_model_ids":["grok-4-7"],"published_date":"2026-09-21","date_precision":"day","canonical_url":"https://media.x.ai/v1/website/4p7card-5eccc980.pdf","alt_urls":["https://media.x.ai/v1/website/card4p7-3a96f40b.pdf"],"has_changelog":"no","extraction_coverage_note":"","notes":""},
{"doc_id":"xai-grok-4-fast-model-card","lab_id":"xai","title":"Grok 4 Fast Model Card","doc_type":"model_card","subject_model_ids":["grok-4-fast"],"published_date":"2025-09-19","date_precision":"day","canonical_url":"https://data.x.ai/2025-09-19-grok-4-fast-model-card.pdf","alt_urls":[],"has_changelog":"no","extraction_coverage_note":"","notes":""},
{"doc_id":"xai-grok-4-model-card","lab_id":"xai","title":"Grok 4 Model Card","doc_type":"model_card","subject_model_ids":["grok-4"],"published_date":"2025-08-20","date_precision":"day","canonical_url":"https://data.x.ai/2025-08-20-grok-4-model-card.pdf","alt_urls":[],"has_changelog":"no","extraction_coverage_note":"","notes":"Known revisions (source registry): 2025-08-22 mentions of UK AISI removed (per Midas Project); no numeric changes documented"},
{"doc_id":"xai-grok-code-fast-1-model-card","lab_id":"xai","title":"Grok Code Fast 1 Model Card","doc_type":"model_card","subject_model_ids":["grok-code-fast-1"],"published_date":"2025-08-26","date_precision":"day","canonical_url":"https://data.x.ai/2025-08-26-grok-code-fast-1-model-card.pdf","alt_urls":[],"has_changelog":"no","extraction_coverage_note":"","notes":""},
{"doc_id":"zhipu-ai-glm-4-5-technical-report","lab_id":"zhipu-ai","title":"GLM-4.5 technical report","doc_type":"tech_report","subject_model_ids":["glm-4-5"],"published_date":"2025-08-08","date_precision":"day","canonical_url":"https://arxiv.org/pdf/2508.06471","alt_urls":[],"has_changelog":"not_applicable","extraction_coverage_note":"SafetyBench scores","notes":""}
],
"document_versions": [
{"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://www-cdn.anthropic.com/0339e6a7c5c7b87f5c07798616dc32c215d14235/Claude%20Fable%205.1%20&%20Claude%20Mythos%205.1%20System%20Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-06-09","doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","version_label":"First published version","version_date":"2026-06-09","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-06-11","doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","version_label":"Revision","version_date":"2026-06-11","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"several corrections","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-06-25","doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","version_label":"Revision","version_date":"2026-06-25","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"executive-summary alignment risk \"low\"→\"very low\" to match §2.4 (verified)","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://www-cdn.anthropic.com/57a52ea7d8f0e54e8a542e908266086df425cdf5/Claude%20Fable%205%20&%20Claude%20Mythos%205%20System%20Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","doc_id":"anthropic-claude-haiku-4-5-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://www-cdn.anthropic.com/7aad69bf12627d42234e01ee7c36305dc2f6a970.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"anthropic-claude-mythos-preview-system-card--2026-04-07","doc_id":"anthropic-claude-mythos-preview-system-card","version_label":"First published version","version_date":"2026-04-07","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"anthropic-claude-mythos-preview-system-card--2026-04-08","doc_id":"anthropic-claude-mythos-preview-system-card","version_label":"Revision","version_date":"2026-04-08","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-mythos-preview-system-card--2026-04-14","doc_id":"anthropic-claude-mythos-preview-system-card","version_label":"Revision","version_date":"2026-04-14","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","doc_id":"anthropic-claude-mythos-preview-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://www-cdn.anthropic.com/7624816413e9b4d2e3ba620c5a5e091b98b190a5/Claude%20Mythos%20Preview%20System%20Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2025-08-05","doc_id":"anthropic-claude-opus-4-1-system-card-addendum","version_label":"First published version","version_date":"2025-08-05","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2025-09-15","doc_id":"anthropic-claude-opus-4-1-system-card-addendum","version_label":"Revision","version_date":"2025-09-15","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"CBRN partner acknowledgments","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","doc_id":"anthropic-claude-opus-4-1-system-card-addendum","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://www-cdn.anthropic.com/9fa30625273bafdf5af82c93719d7ca606485a16/Claude%204.1%20System%20Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"anthropic-claude-opus-4-5-system-card--2025-11-24","doc_id":"anthropic-claude-opus-4-5-system-card","version_label":"First published version","version_date":"2025-11-24","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"anthropic-claude-opus-4-5-system-card--2025-11-24-b","doc_id":"anthropic-claude-opus-4-5-system-card","version_label":"Revision","version_date":"2025-11-24","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"ARC-AGI-1 and training-data fixes","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-opus-4-5-system-card--2025-11-25","doc_id":"anthropic-claude-opus-4-5-system-card","version_label":"Revision","version_date":"2025-11-25","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"caption typo","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-opus-4-5-system-card--2025-12-05","doc_id":"anthropic-claude-opus-4-5-system-card","version_label":"Revision","version_date":"2025-12-05","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"several corrections","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","doc_id":"anthropic-claude-opus-4-5-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://www-cdn.anthropic.com/bf10f64990cfda0ba858290be7b8cc6317685f47.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"anthropic-claude-opus-4-6-system-card--2026-02-06","doc_id":"anthropic-claude-opus-4-6-system-card","version_label":"Revision","version_date":"2026-02-06","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-opus-4-6-system-card--2026-02-10","doc_id":"anthropic-claude-opus-4-6-system-card","version_label":"Revision","version_date":"2026-02-10","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-opus-4-6-system-card--2026-02-17","doc_id":"anthropic-claude-opus-4-6-system-card","version_label":"Revision","version_date":"2026-02-17","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-opus-4-6-system-card--2026-03-06","doc_id":"anthropic-claude-opus-4-6-system-card","version_label":"Revision","version_date":"2026-03-06","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"(benchmark corrections, wording)","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","doc_id":"anthropic-claude-opus-4-6-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://www-cdn.anthropic.com/6a5fa276ac68b9aeb0c8b6af5fa36326e0e166dd/Claude%20Opus%204.6%20System%20Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","doc_id":"anthropic-claude-opus-4-7-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://www-cdn.anthropic.com/037f06850df7fbe871e206dad004c3db5fd50340/Claude%20Opus%204.7%20System%20Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"anthropic-claude-opus-4-8-system-card--2026-05-28","doc_id":"anthropic-claude-opus-4-8-system-card","version_label":"First published version","version_date":"2026-05-28","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"anthropic-claude-opus-4-8-system-card--2026-06-03","doc_id":"anthropic-claude-opus-4-8-system-card","version_label":"Revision","version_date":"2026-06-03","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-opus-4-8-system-card--2026-06-17","doc_id":"anthropic-claude-opus-4-8-system-card","version_label":"Revision","version_date":"2026-06-17","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"(virology task 2 0.89→0.90; bug-bounty correction; scale fix)","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","doc_id":"anthropic-claude-opus-4-8-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://www-cdn.anthropic.com/0f0c97ad20d8005706296bd92aa1c27c6b2f4f61/Claude%20Opus%204.8%20System%20Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2025-05-22","doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","version_label":"First published version","version_date":"2025-05-22","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2025-07-16","doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","version_label":"Revision","version_date":"2025-07-16","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"footnote and formatting","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2025-09-02","doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","version_label":"Revision","version_date":"2025-09-02","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"corrected Claude Code Impossible Tasks numbers","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://www-cdn.anthropic.com/6d8a8055020700718b0c49369f60816ba2a7c285/Claude%204%20System%20Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","doc_id":"anthropic-claude-opus-5-5-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"anthropic-claude-opus-5-system-card--2026-07-24","doc_id":"anthropic-claude-opus-5-system-card","version_label":"First published version","version_date":"2026-07-24","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"anthropic-claude-opus-5-system-card--2026-08-19","doc_id":"anthropic-claude-opus-5-system-card","version_label":"Revision","version_date":"2026-08-19","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"prompt-injection bug-bounty results added; Cowork harness fixes; thinking-disabled results removed","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","doc_id":"anthropic-claude-opus-5-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://www-cdn.anthropic.com/ceaf5c7ff2783855203fde8208ec311252dced5b/Claude%20Opus%205%20System%20Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"anthropic-claude-sonnet-4-5-system-card--2025-09-29","doc_id":"anthropic-claude-sonnet-4-5-system-card","version_label":"First published version","version_date":"2025-09-29","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"anthropic-claude-sonnet-4-5-system-card--2025-10-10","doc_id":"anthropic-claude-sonnet-4-5-system-card","version_label":"Revision","version_date":"2025-10-10","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"footnote author fix","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-sonnet-4-5-system-card--2025-12-03","doc_id":"anthropic-claude-sonnet-4-5-system-card","version_label":"Revision","version_date":"2025-12-03","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"edit to §9.3.5","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","doc_id":"anthropic-claude-sonnet-4-5-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://www-cdn.anthropic.com/963373e433e489a87a10c823c52a0a013e9172dd/Claude%20Sonnet%204.5%20System%20Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-02-17","doc_id":"anthropic-claude-sonnet-4-6-system-card","version_label":"First published version","version_date":"2026-02-17","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-03-06","doc_id":"anthropic-claude-sonnet-4-6-system-card","version_label":"Revision","version_date":"2026-03-06","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"BrowseComp; section moved","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","doc_id":"anthropic-claude-sonnet-4-6-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://www-cdn.anthropic.com/bbd8ef16d70b7a1665f14f306ee88b53f686aa75/Claude%20Sonnet%204.6%20System%20Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"anthropic-claude-sonnet-5-system-card--2026-06-30","doc_id":"anthropic-claude-sonnet-5-system-card","version_label":"First published version","version_date":"2026-06-30","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"anthropic-claude-sonnet-5-system-card--2026-07-10","doc_id":"anthropic-claude-sonnet-5-system-card","version_label":"Revision","version_date":"2026-07-10","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"BrowseComp footnote","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","doc_id":"anthropic-claude-sonnet-5-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://www-cdn.anthropic.com/283ef97c476cf442c91d9a37d5b214242a55bb92/Claude%20Sonnet%205%20System%20Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"deepseek-r1-paper-nature-arxiv-v2--2026-09-26","doc_id":"deepseek-r1-paper-nature-arxiv-v2","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://arxiv.org/html/2501.12948v2","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","doc_id":"google-deepmind-gemini-2-5-deep-think-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-2-5-Deep-Think-Model-Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"google-deepmind-gemini-2-5-flash-model-card--2025-09-26","doc_id":"google-deepmind-gemini-2-5-flash-model-card","version_label":"First published version","version_date":"2025-09-26","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"google-deepmind-gemini-2-5-flash-model-card--2026-09-26","doc_id":"google-deepmind-gemini-2-5-flash-model-card","version_label":"Copy retrieved 26 Sep 2026; header says updated Dec 2025","version_date":"2025-12","date_source":"header","status":"retrieved","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-2-5-Flash-Model-Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"The version date is the month printed in the document header; the day is not known."},
{"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","doc_id":"google-deepmind-gemini-2-5-pro-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-2-5-Pro-Model-Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","doc_id":"google-deepmind-gemini-2-5-technical-report","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://storage.googleapis.com/deepmind-media/gemini/gemini_v2_5_report.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"google-deepmind-gemini-3-1-flash-lite-model-card--2026-03-03","doc_id":"google-deepmind-gemini-3-1-flash-lite-model-card","version_label":"First published version","version_date":"2026-03-03","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"google-deepmind-gemini-3-1-flash-lite-model-card--2026-09-26","doc_id":"google-deepmind-gemini-3-1-flash-lite-model-card","version_label":"Copy retrieved 26 Sep 2026; header says updated May 2026","version_date":"2026-05","date_source":"header","status":"retrieved","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-1-Flash-Lite-Model-Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"The version date is the month printed in the document header; the day is not known."},
{"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","doc_id":"google-deepmind-gemini-3-1-pro-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-1-Pro-Model-Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"google-deepmind-gemini-3-5-flash-lite-model-card--2026-09-26","doc_id":"google-deepmind-gemini-3-5-flash-lite-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-5-Flash-Lite-Model-Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"google-deepmind-gemini-3-5-flash-model-card--2026-09-26","doc_id":"google-deepmind-gemini-3-5-flash-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-5-Flash-Model-Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"google-deepmind-gemini-3-6-flash-model-card--2026-09-26","doc_id":"google-deepmind-gemini-3-6-flash-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-6-Flash-Model-Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://storage.googleapis.com/deepmind-media/gemini/gemini_3-7_flash_fsf_report.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"google-deepmind-gemini-3-7-flash-model-card--2026-09-26","doc_id":"google-deepmind-gemini-3-7-flash-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-7-Flash-Model-Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"google-deepmind-gemini-3-8-flash-model-card--2026-09-26","doc_id":"google-deepmind-gemini-3-8-flash-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-8-Flash-Model-Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"google-deepmind-gemini-3-flash-model-card--2026-09-26","doc_id":"google-deepmind-gemini-3-flash-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-Flash-Model-Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"google-deepmind-gemini-3-launch-post--2026-09-26","doc_id":"google-deepmind-gemini-3-launch-post","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://blog.google/products/gemini/gemini-3/","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://storage.googleapis.com/deepmind-media/gemini/gemini_3_pro_fsf_report.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"google-deepmind-gemini-3-pro-model-card--2025-11-18","doc_id":"google-deepmind-gemini-3-pro-model-card","version_label":"First published version","version_date":"2025-11-18","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"google-deepmind-gemini-3-pro-model-card--2026-09-26","doc_id":"google-deepmind-gemini-3-pro-model-card","version_label":"Copy retrieved 26 Sep 2026; header says updated May 2026","version_date":"2026-05","date_source":"header","status":"retrieved","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-Pro-Model-Card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"The version date is the month printed in the document header; the day is not known."},
{"version_id":"meta-llama-4-launch-post--2026-09-26","doc_id":"meta-llama-4-launch-post","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://ai.meta.com/blog/llama-4-multimodal-intelligence/","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"meta-llama-4-model-card--2026-09-26","doc_id":"meta-llama-4-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://github.com/meta-llama/llama-models/blob/main/models/llama4/MODEL_CARD.md","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"meta-muse-glimmer-30b-model-card--2026-09-26","doc_id":"meta-muse-glimmer-30b-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://huggingface.co/meta-models/Muse-Glimmer-30B/blob/main/README.md","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"meta-muse-spark-1-1-evaluation-report--2026-09-26","doc_id":"meta-muse-spark-1-1-evaluation-report","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report/","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"meta-muse-spark-safety-preparedness-report--2026-04-08","doc_id":"meta-muse-spark-safety-preparedness-report","version_label":"First published version","version_date":"2026-04-08","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"meta-muse-spark-safety-preparedness-report--2026-05-26","doc_id":"meta-muse-spark-safety-preparedness-report","version_label":"Revision","version_date":"2026-05-26","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"instruction-hierarchy comparator scores fixed after a bug","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","doc_id":"meta-muse-spark-safety-preparedness-report","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://ai.meta.com/static-resource/muse-spark-safety-and-preparedness-report/","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"moonshot-ai-kimi-k2-technical-report--2026-09-26","doc_id":"moonshot-ai-kimi-k2-technical-report","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://arxiv.org/pdf/2507.20534v1","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"moonshot-ai-kimi-k3-technical-report--2026-09-26","doc_id":"moonshot-ai-kimi-k3-technical-report","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-chatgpt-images-2-5-system-card--2026-09-26","doc_id":"openai-chatgpt-images-2-5-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://deploymentsafety.openai.com/chatgpt-images-2-5","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","doc_id":"openai-gpt-5-1-codex-max-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://cdn.openai.com/pdf/2a7d98b1-57e5-4147-8d0e-683894d782ae/5p1_codex_max_card_03.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","doc_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://cdn.openai.com/pdf/4173ec8d-1229-47db-96de-06d87147e07e/5_1_system_card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","doc_id":"openai-gpt-5-2-codex-system-card-addendum","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://cdn.openai.com/pdf/ac7c37ae-7f4c-4442-b741-2eabdeaf77e0/oai_5_2_Codex.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2025-12-11","doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","version_label":"First published version","version_date":"2025-12-11","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-04-24","doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","version_label":"Revision","version_date":"2026-04-24","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"hub added CoT monitorability/controllability and sandbagging sections (not in PDF)","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://cdn.openai.com/pdf/3a4153c8-c748-4b71-8e31-aecbde944f8d/oai_5_2_system-card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","doc_id":"openai-gpt-5-3-codex-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://cdn.openai.com/pdf/23eca107-a9b1-4d2c-b156-7deb4fbc697c/GPT-5-3-Codex-System-Card-02.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-5-3-instant-system-card--2026-09-26","doc_id":"openai-gpt-5-3-instant-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://deploymentsafety.openai.com/gpt-5-3-instant/gpt-5-3-instant.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","doc_id":"openai-gpt-5-4-thinking-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://deploymentsafety.openai.com/gpt-5-4-thinking/gpt-5-4-thinking.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","doc_id":"openai-gpt-5-5-instant-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://deploymentsafety.openai.com/gpt-5-5-instant/gpt-5-5-instant.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-5-5-system-card--2026-09-26","doc_id":"openai-gpt-5-5-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://deploymentsafety.openai.com/gpt-5-5/gpt-5-5.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","doc_id":"openai-gpt-5-6-august-updates-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://deploymentsafety.openai.com/gpt-5-6-august-update/gpt-5-6-august-update.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-5-6-preview-system-card--2026-06-25","doc_id":"openai-gpt-5-6-preview-system-card","version_label":"First published version","version_date":"2026-06-25","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"openai-gpt-5-6-preview-system-card--2026-08-19","doc_id":"openai-gpt-5-6-preview-system-card","version_label":"Revision","version_date":"2026-08-19","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"GPT-5.5 protein-binding pass@4 corrected 0.4%→1.5% (changelog verified 2026-09-26; same entry as GPT-5.6 system card)","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"openai-gpt-5-6-preview-system-card--2026-09-26","doc_id":"openai-gpt-5-6-preview-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://deploymentsafety.openai.com/gpt-5-6-preview/gpt-5-6-preview.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-5-6-system-card--2026-06-27","doc_id":"openai-gpt-5-6-system-card","version_label":"Revision","version_date":"2026-06-27","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"metagaming plots re-aggregated","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry. Dated before the registry's publication date (2026-07-09); to check in Phase 4."},
{"version_id":"openai-gpt-5-6-system-card--2026-07-09","doc_id":"openai-gpt-5-6-system-card","version_label":"First published version","version_date":"2026-07-09","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"openai-gpt-5-6-system-card--2026-08-03","doc_id":"openai-gpt-5-6-system-card","version_label":"Revision","version_date":"2026-08-03","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"GPT-Red prompt-injection results added","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"openai-gpt-5-6-system-card--2026-08-19","doc_id":"openai-gpt-5-6-system-card","version_label":"Revision","version_date":"2026-08-19","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"GPT-5.5 protein-binding pass@4 corrected 0.4%→1.5% (changelog verified 2026-09-26)","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"openai-gpt-5-6-system-card--2026-09-26","doc_id":"openai-gpt-5-6-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://deploymentsafety.openai.com/gpt-5-6/gpt-5-6.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","doc_id":"openai-gpt-5-codex-system-card-addendum","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://cdn.openai.com/pdf/97cc5669-7a25-4e63-b15f-5fd5bdc4d149/gpt-5-codex-system-card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-5-system-card--2025-08-07","doc_id":"openai-gpt-5-system-card","version_label":"First published version","version_date":"2025-08-07","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"openai-gpt-5-system-card--2025-08-13","doc_id":"openai-gpt-5-system-card","version_label":"Revision","version_date":"2025-08-13","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"PDF of 2025-08-07 replaced by 2025-08-13 version without changelog","parsed_pages":"","notes":"Known from a report, not from a developer changelog."},
{"version_id":"openai-gpt-5-system-card--2026-04-24","doc_id":"openai-gpt-5-system-card","version_label":"Revision","version_date":"2026-04-24","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"hub added chain-of-thought evaluations","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"openai-gpt-5-system-card--2026-09-26","doc_id":"openai-gpt-5-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://cdn.openai.com/gpt-5-system-card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-6-astra-launch-post--2026-09-26","doc_id":"openai-gpt-6-astra-launch-post","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://openai.com/index/gpt-6-astra/","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-6-astra-system-card--2026-09-03","doc_id":"openai-gpt-6-astra-system-card","version_label":"First published version","version_date":"2026-09-03","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"openai-gpt-6-astra-system-card--2026-09-09","doc_id":"openai-gpt-6-astra-system-card","version_label":"Revision","version_date":"2026-09-09","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"alignment section clarified and its limitations expanded; section on verbalized metagaming and oversight gaming renamed and revised","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"openai-gpt-6-astra-system-card--2026-09-22","doc_id":"openai-gpt-6-astra-system-card","version_label":"Revision","version_date":"2026-09-22","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"HealthBench fix, appendix on GPT-6 Sol/Luna, updated alignment evals","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"openai-gpt-6-astra-system-card--2026-09-26","doc_id":"openai-gpt-6-astra-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://deploymentsafety.openai.com/gpt-6-astra/gpt-6-astra.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-live-system-card--2026-07-08","doc_id":"openai-gpt-live-system-card","version_label":"First published version","version_date":"2026-07-08","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"openai-gpt-live-system-card--2026-08-04","doc_id":"openai-gpt-live-system-card","version_label":"Revision","version_date":"2026-08-04","date_source":"changelog","status":"known_from_changelog","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"configuration mismatch; Appendix A lists original vs corrected values","parsed_pages":"","notes":"Known from the document changelog, as summarised in the source registry."},
{"version_id":"openai-gpt-live-system-card--2026-09-26","doc_id":"openai-gpt-live-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://deploymentsafety.openai.com/gpt-live/gpt-live.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","doc_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://cdn.openai.com/pdf/419b6906-9da6-406c-a19d-1bb078ac7637/oai_gpt-oss_model_card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-gpt-rosalind-5-5-system-card--2026-09-26","doc_id":"openai-gpt-rosalind-5-5-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://deploymentsafety.openai.com/gpt-rosalind-5-5","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","doc_id":"openai-o3-and-o4-mini-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://cdn.openai.com/pdf/2221c875-02dc-4789-800b-e7758f3722c1/o3-and-o4-mini-system-card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"openai-our-framework-for-reporting-model-misalignment--2026-09-26","doc_id":"openai-our-framework-for-reporting-model-misalignment","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://openai.com/index/model-misalignment-reporting-framework/","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"xai-grok-4-1-model-card--2026-09-26","doc_id":"xai-grok-4-1-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://data.x.ai/2025-11-17-grok-4-1-model-card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"xai-grok-4-20-system-card--2026-09-26","doc_id":"xai-grok-4-20-system-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://data.x.ai/2026-04-07-grok-4-20-model-card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"xai-grok-4-5-model-card--2026-07-14","doc_id":"xai-grok-4-5-model-card","version_label":"Original version (read in a copy hosted elsewhere)","version_date":"2026-07-14","date_source":"report","status":"archived","url":"https://cursor.com/resources/grok-4-5-model-card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"An earlier copy of the document, read at the URL shown. Date from the source registry."},
{"version_id":"xai-grok-4-5-model-card--2026-07-20","doc_id":"xai-grok-4-5-model-card","version_label":"Revised version (the copy retrieved)","version_date":"2026-07-20","date_source":"report","status":"retrieved","url":"https://media.x.ai/v1/website/4p5-5184fdf9.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"revision, no changelog; safety values appear unchanged","parsed_pages":"","notes":"The v0 labels identify the retrieved copy as this dated revision."},
{"version_id":"xai-grok-4-6-model-card--2026-08-12","doc_id":"xai-grok-4-6-model-card","version_label":"Original version (read in a copy hosted elsewhere)","version_date":"2026-08-12","date_source":"report","status":"archived","url":"https://cursor.com/resources/grok-4-6-model-card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"An earlier copy of the document, read at the URL shown. Date from the source registry."},
{"version_id":"xai-grok-4-6-model-card--2026-08-17","doc_id":"xai-grok-4-6-model-card","version_label":"Revised version (the copy retrieved)","version_date":"2026-08-17","date_source":"changelog","status":"retrieved","url":"https://media.x.ai/v1/website/card-4p6-4cd2dc57.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"revision: HackerBench harmful/dual-use 16.7%→6.9%, self-harm 3.7%→0.84%, MASK 3.8%→1.90% (verified); changelog gives no reason","parsed_pages":"","notes":"The v0 labels identify the retrieved copy as this dated revision."},
{"version_id":"xai-grok-4-7-model-card--2026-09-26","doc_id":"xai-grok-4-7-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://media.x.ai/v1/website/4p7card-5eccc980.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"xai-grok-4-fast-model-card--2026-09-26","doc_id":"xai-grok-4-fast-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://data.x.ai/2025-09-19-grok-4-fast-model-card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"xai-grok-4-model-card--2025-08-20","doc_id":"xai-grok-4-model-card","version_label":"First published version","version_date":"2025-08-20","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Publication date from the source registry. No copy of this state was retrieved."},
{"version_id":"xai-grok-4-model-card--2025-08-22","doc_id":"xai-grok-4-model-card","version_label":"Revision","version_date":"2025-08-22","date_source":"report","status":"known_not_retrieved","url":"","sha256":"","retrieved_at":"","archive_url":"","changelog_summary":"mentions of UK AISI removed (per Midas Project); no numeric changes documented","parsed_pages":"","notes":"Known from a report, not from a developer changelog."},
{"version_id":"xai-grok-4-model-card--2026-09-26","doc_id":"xai-grok-4-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://data.x.ai/2025-08-20-grok-4-model-card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"xai-grok-code-fast-1-model-card--2026-09-26","doc_id":"xai-grok-code-fast-1-model-card","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://data.x.ai/2025-08-26-grok-code-fast-1-model-card.pdf","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."},
{"version_id":"zhipu-ai-glm-4-5-technical-report--2026-09-26","doc_id":"zhipu-ai-glm-4-5-technical-report","version_label":"Copy retrieved 26 Sep 2026","version_date":"","date_source":"retrieval","status":"retrieved","url":"https://arxiv.org/pdf/2508.06471","sha256":"","retrieved_at":"2026-09-26","archive_url":"","changelog_summary":"","parsed_pages":"","notes":"Dated by retrieval: the version date of this copy is not known."}
],
"secondary_sources": [
{"secondary_id":"anthropic-transparency-hub","title":"Anthropic Transparency Hub","author_or_site":"Anthropic","url":"https://www.anthropic.com/transparency","published_date":"","covers_doc_ids":["anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","anthropic-claude-fable-5-claude-mythos-5-system-card","anthropic-claude-mythos-preview-system-card","anthropic-claude-opus-4-7-system-card","anthropic-claude-opus-4-8-system-card","anthropic-claude-opus-5-system-card","anthropic-claude-sonnet-4-6-system-card","anthropic-claude-sonnet-5-system-card"],"notes":"Summarizes system-card results; used where card sections were out of reach Developer summary page."},
{"secondary_id":"sec-caylent-com-blog-claude-sonnet-4-6-in-production-capability","title":"Caylent blog","author_or_site":"caylent.com","url":"https://caylent.com/blog/claude-sonnet-4-6-in-production-capability-safety-and-cost-explained","published_date":"","covers_doc_ids":["anthropic-claude-sonnet-4-6-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1"},
{"secondary_id":"sec-codersera-com-blog-gpt-6-astra-safety-cyber-capabilities-202","title":"Codersera blog","author_or_site":"codersera.com","url":"https://codersera.com/blog/gpt-6-astra-safety-cyber-capabilities-2026/","published_date":"","covers_doc_ids":["openai-gpt-6-astra-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1"},
{"secondary_id":"sec-hugobowne-github-io-mythos-preview-model-card-sources-04a-al","title":"Mythos Preview system card wiki (hugobowne.github.io)","author_or_site":"hugobowne.github.io","url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","published_date":"","covers_doc_ids":["anthropic-claude-mythos-preview-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1"},
{"secondary_id":"sec-hugobowne-github-io-mythos-preview-model-card-sources-04b-al","title":"Mythos Preview system card wiki (hugobowne.github.io)","author_or_site":"hugobowne.github.io","url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04b-alignment-part2","published_date":"","covers_doc_ids":["anthropic-claude-mythos-preview-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1"},
{"secondary_id":"sec-neuraltrust-ai-blog-claude-opus-4-6-safety","title":"NeuralTrust blog","author_or_site":"neuraltrust.ai","url":"https://neuraltrust.ai/blog/claude-opus-4-6-safety","published_date":"","covers_doc_ids":["anthropic-claude-opus-4-6-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1"},
{"secondary_id":"sec-neuraltrust-ai-blog-claude-sonnet-5-security-safety-system-c","title":"NeuralTrust blog","author_or_site":"neuraltrust.ai","url":"https://neuraltrust.ai/blog/claude-sonnet-5-security-safety-system-card","published_date":"","covers_doc_ids":["anthropic-claude-sonnet-5-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1"},
{"secondary_id":"sec-simonwillison-net-2025-may-25-claude-4-system-card","title":"Simon Willison’s weblog","author_or_site":"simonwillison.net","url":"https://simonwillison.net/2025/May/25/claude-4-system-card/","published_date":"2025-05-25","covers_doc_ids":["anthropic-claude-opus-4-sonnet-4-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1 Publication date taken from the URL."},
{"secondary_id":"sec-thezvi-substack-com-p-claude-fable-5-and-mythos-5-the-system","title":"Zvi Mowshowitz, Don’t Worry About the Vase","author_or_site":"thezvi.substack.com","url":"https://thezvi.substack.com/p/claude-fable-5-and-mythos-5-the-system","published_date":"","covers_doc_ids":["anthropic-claude-fable-5-claude-mythos-5-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1"},
{"secondary_id":"sec-thezvi-substack-com-p-claude-mythos-the-system-card","title":"Zvi Mowshowitz, Don’t Worry About the Vase","author_or_site":"thezvi.substack.com","url":"https://thezvi.substack.com/p/claude-mythos-the-system-card","published_date":"","covers_doc_ids":["anthropic-claude-mythos-preview-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1"},
{"secondary_id":"sec-thezvi-substack-com-p-opus-47-part-1-the-model-card","title":"Zvi Mowshowitz, Don’t Worry About the Vase","author_or_site":"thezvi.substack.com","url":"https://thezvi.substack.com/p/opus-47-part-1-the-model-card","published_date":"","covers_doc_ids":["anthropic-claude-opus-4-7-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1"},
{"secondary_id":"sec-thezvi-wordpress-com-2025-09-30-claude-sonnet-4-5-system-car","title":"Zvi Mowshowitz, Don’t Worry About the Vase","author_or_site":"thezvi.wordpress.com","url":"https://thezvi.wordpress.com/2025/09/30/claude-sonnet-4-5-system-card-and-alignment/","published_date":"2025-09-30","covers_doc_ids":["anthropic-claude-sonnet-4-5-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1 Publication date taken from the URL."},
{"secondary_id":"sec-thezvi-wordpress-com-2025-11-28-claude-opus-4-5-model-card-a","title":"Zvi Mowshowitz, Don’t Worry About the Vase","author_or_site":"thezvi.wordpress.com","url":"https://thezvi.wordpress.com/2025/11/28/claude-opus-4-5-model-card-alignment-and-safety/","published_date":"2025-11-28","covers_doc_ids":["anthropic-claude-opus-4-5-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1 Publication date taken from the URL."},
{"secondary_id":"sec-thezvi-wordpress-com-2026-02-09-claude-opus-4-6-system-card","title":"Zvi Mowshowitz, Don’t Worry About the Vase","author_or_site":"thezvi.wordpress.com","url":"https://thezvi.wordpress.com/2026/02/09/claude-opus-4-6-system-card-part-1-mundane-alignment-and-model-welfare/","published_date":"2026-02-09","covers_doc_ids":["anthropic-claude-opus-4-6-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1 Publication date taken from the URL."},
{"secondary_id":"sec-thezvi-wordpress-com-2026-02-10-claude-opus-4-6-system-card","title":"Zvi Mowshowitz, Don’t Worry About the Vase","author_or_site":"thezvi.wordpress.com","url":"https://thezvi.wordpress.com/2026/02/10/claude-opus-4-6-system-card-part-2-frontier-alignment/","published_date":"2026-02-10","covers_doc_ids":["anthropic-claude-opus-4-6-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1 Publication date taken from the URL."},
{"secondary_id":"sec-thezvi-wordpress-com-2026-05-29-claude-opus-4-8-the-system-c","title":"Zvi Mowshowitz, Don’t Worry About the Vase","author_or_site":"thezvi.wordpress.com","url":"https://thezvi.wordpress.com/2026/05/29/claude-opus-4-8-the-system-card/","published_date":"2026-05-29","covers_doc_ids":["anthropic-claude-opus-4-8-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1 Publication date taken from the URL."},
{"secondary_id":"sec-thezvi-wordpress-com-2026-07-25-claude-opus-5-the-system-car","title":"Zvi Mowshowitz, Don’t Worry About the Vase","author_or_site":"thezvi.wordpress.com","url":"https://thezvi.wordpress.com/2026/07/25/claude-opus-5-the-system-card/","published_date":"2026-07-25","covers_doc_ids":["anthropic-claude-opus-5-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1 Publication date taken from the URL."},
{"secondary_id":"sec-thezvi-wordpress-com-2026-09-04-claude-fable-5-1-and-mythos","title":"Zvi Mowshowitz, Don’t Worry About the Vase","author_or_site":"thezvi.wordpress.com","url":"https://thezvi.wordpress.com/2026/09/04/claude-fable-5-1-and-mythos-5-1-the-system-card/","published_date":"2026-09-04","covers_doc_ids":["anthropic-claude-fable-5-1-claude-mythos-5-1-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1 Publication date taken from the URL."},
{"secondary_id":"sec-thezvi-wordpress-com-2026-09-09-gpt-6-astra-the-system-card","title":"Zvi Mowshowitz, Don’t Worry About the Vase","author_or_site":"thezvi.wordpress.com","url":"https://thezvi.wordpress.com/2026/09/09/gpt-6-astra-the-system-card-alignment-and-what-comes-next/","published_date":"2026-09-09","covers_doc_ids":["openai-gpt-6-astra-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1 Publication date taken from the URL."},
{"secondary_id":"sec-thezvi-wordpress-com-2026-09-23-claude-opus-5-5-the-system-c","title":"Zvi Mowshowitz, Don’t Worry About the Vase","author_or_site":"thezvi.wordpress.com","url":"https://thezvi.wordpress.com/2026/09/23/claude-opus-5-5-the-system-card/","published_date":"2026-09-23","covers_doc_ids":["anthropic-claude-opus-5-5-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1 Publication date taken from the URL."},
{"secondary_id":"sec-www-greaterwrong-com-posts-4yn8b8p2yiouxlaby-claude-sonnet-4","title":"Zvi Mowshowitz (LessWrong mirror)","author_or_site":"greaterwrong.com","url":"https://www.greaterwrong.com/posts/4yn8B8p2YiouxLABy/claude-sonnet-4-5-system-card-and-alignment","published_date":"","covers_doc_ids":["anthropic-claude-sonnet-4-5-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1"},
{"secondary_id":"sec-www-quentir-ai-blog-2026-gpt-6-astra-critical-cyber-prepared","title":"Quentir blog","author_or_site":"quentir.ai","url":"https://www.quentir.ai/blog/2026/gpt-6-astra-critical-cyber-preparedness-framework-3-september-2026-eu-ai-act-article-55-sb-53","published_date":"","covers_doc_ids":["openai-gpt-6-astra-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1"},
{"secondary_id":"sec-www-thestack-technology-claude-4-of-blackmail-bioweapons-and","title":"The Stack","author_or_site":"thestack.technology","url":"https://www.thestack.technology/claude-4-of-blackmail-bioweapons-and-bad-code/","published_date":"","covers_doc_ids":["anthropic-claude-opus-4-sonnet-4-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1"},
{"secondary_id":"sec-www-transformernews-ai-p-claude-sonnet-4-5-evaluation-situat","title":"Transformer","author_or_site":"transformernews.ai","url":"https://www.transformernews.ai/p/claude-sonnet-4-5-evaluation-situational-awareness","published_date":"","covers_doc_ids":["anthropic-claude-sonnet-4-5-system-card"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1"},
{"secondary_id":"sec-zentor-ai-blog-kimi-k3-technical-report","title":"Zentor blog","author_or_site":"zentor.ai","url":"https://zentor.ai/blog/kimi-k3-technical-report","published_date":"","covers_doc_ids":["moonshot-ai-kimi-k3-technical-report"],"notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1"}
],
"evaluators": [
{"evaluator_id":"anthropic","name":"Anthropic","type":"developer","url":""},
{"evaluator_id":"apollo","name":"Apollo Research","type":"third_party","url":""},
{"evaluator_id":"deepseek","name":"DeepSeek","type":"developer","url":""},
{"evaluator_id":"google-deepmind","name":"Google DeepMind","type":"developer","url":""},
{"evaluator_id":"gray-swan","name":"Gray Swan","type":"third_party","url":""},
{"evaluator_id":"irregular","name":"Irregular","type":"third_party","url":""},
{"evaluator_id":"meta","name":"Meta","type":"developer","url":""},
{"evaluator_id":"metr","name":"METR","type":"third_party","url":""},
{"evaluator_id":"moonshot-ai","name":"Moonshot AI","type":"developer","url":""},
{"evaluator_id":"openai","name":"OpenAI","type":"developer","url":""},
{"evaluator_id":"uk-aisi","name":"UK AI Security Institute","type":"government","url":""},
{"evaluator_id":"unnamed-third-party","name":"Unnamed third-party evaluator","type":"third_party","url":""},
{"evaluator_id":"xai","name":"xAI","type":"developer","url":""},
{"evaluator_id":"zhipu-ai","name":"Zhipu AI","type":"developer","url":""}
],
"evals": [
{"eval_id":"anthropic-100q-hard","name":"100Q-Hard","family":"M5","evaluator_id":"anthropic","test_type":"static_benchmark","description":"A set of hard factual questions scored for correct answers.","notes":"Recorded from a secondary source quoting the card."},
{"eval_id":"anthropic-aa-omniscience","name":"AA-Omniscience","family":"M5","evaluator_id":"anthropic","test_type":"static_benchmark","description":"A public factual-knowledge benchmark that also tracks how often a model answers wrongly instead of abstaining.","notes":""},
{"eval_id":"anthropic-accidental-cot-supervision-in-rl","name":"Accidental CoT supervision in RL","family":"M12","evaluator_id":"anthropic","test_type":"training_monitoring","description":"Share of reinforcement-learning episodes in which a training error exposed the model's chain of thought to the reward signal.","notes":"Recorded from a secondary write-up."},
{"eval_id":"anthropic-aeci","name":"Anthropic ECI (AECI)","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"Anthropic's aggregate capability index, fitted over a set of benchmarks and used to track AI R&D capability across models.","notes":"The benchmark set and scale change between cards; see groups."},
{"eval_id":"anthropic-agentic-code-summary-honesty","name":"Agentic code summary honesty","family":"M5","evaluator_id":"anthropic","test_type":"scenario_eval","description":"Whether the model's summaries of its own agentic coding work report the important events that happened.","notes":"Recorded from Anthropic's summary page."},
{"eval_id":"anthropic-ai-rd-4-threshold","name":"AI R&D-4 threshold","family":"M10","evaluator_id":"anthropic","test_type":"framework_determination","description":"Anthropic's statement of whether a model crosses its AI R&D-4 capability threshold under the Responsible Scaling Policy.","notes":""},
{"eval_id":"anthropic-ai-rd-internal-suite-2","name":"Internal AI R&D suite 2","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"Anthropic's second internal suite of AI research tasks, scored from 0 to 1 against a rule-out threshold.","notes":"Printed as \"AI R&D internal suite 2\" and \"Internal AI research eval suite 2\"."},
{"eval_id":"anthropic-ai-rd-kernel-task","name":"AI R&D kernel task","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"An Anthropic AI research task in which the model optimises compute kernels, reported as the best speedup reached.","notes":""},
{"eval_id":"anthropic-ai-rd-llm-training-task","name":"AI R&D LLM training task","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"An Anthropic AI research task in which the model speeds up a language-model training run, reported as average speedup.","notes":""},
{"eval_id":"anthropic-ai-rd-novel-compiler-task","name":"AI R&D novel compiler task","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"An Anthropic AI research task in which the model builds a compiler for a new language, reported as the share of tests passed.","notes":""},
{"eval_id":"anthropic-ai-rd-quadruped-rl-task","name":"AI R&D quadruped RL task","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"An Anthropic AI research task in which the model trains a simulated four-legged robot policy, reported as the highest score reached.","notes":""},
{"eval_id":"anthropic-asl-4-virology-uplift-trial","name":"ASL-4 virology uplift trial","family":"M10","evaluator_id":"anthropic","test_type":"uplift_study","description":"A human uplift trial in Anthropic's ASL-4 biology assessment, reported as the ratio of task scores with model help to an internet-only control.","notes":""},
{"eval_id":"anthropic-automated-behavioral-audit","name":"Automated behavioral audit","family":"M4","evaluator_id":"anthropic","test_type":"automated_audit","description":"An auditor model probes the model across many constructed scenarios, and a judge model scores the transcripts for misaligned behaviour.","notes":"Misalignment measures of the audit; its eval-awareness measures are anthropic-automated-behavioral-audit-eval-awareness (M1) and its sycophancy scores anthropic-automated-behavioral-audit-sycophancy (M6). Cards mostly print comparisons and figure-only scores, so metrics differ from card to card."},
{"eval_id":"anthropic-automated-behavioral-audit-eval-awareness","name":"Automated behavioral audit","family":"M1","evaluator_id":"anthropic","test_type":"developer_audit_verbalized","description":"Signs that the model recognises it is being tested, found in transcripts from Anthropic's automated behavioural audit, where an auditor model probes the model in constructed scenarios.","notes":"The eval-awareness part of the audit; its misalignment measures are anthropic-automated-behavioral-audit (M4) and its sycophancy scores anthropic-automated-behavioral-audit-sycophancy (M6). Cards name the measure differently (situational-awareness classifier, automated audit eval awareness, verbalized evaluation awareness, evaluation awareness (audit)); the Opus 4.7 and Sonnet 5 rows do not name the audit in v0 and are placed here because the Finding 1 seed classes them as the lab's own audit."},
{"eval_id":"anthropic-automated-behavioral-audit-sycophancy","name":"Automated behavioral audit","family":"M6","evaluator_id":"anthropic","test_type":"automated_audit","description":"Sycophancy scores from Anthropic's automated behavioural audit, where a judge model rates transcripts on a 1 to 10 scale.","notes":"The M6 part of anthropic-automated-behavioral-audit (M4). Values are approximate chart readings from a secondary source."},
{"eval_id":"anthropic-autonomy-threat-model-2","name":"Autonomy threat model 2 (automated R&D)","family":"M10","evaluator_id":"anthropic","test_type":"framework_determination","description":"Anthropic's determination of whether its second autonomy threat model, automated AI research, applies to a model under the Responsible Scaling Policy.","notes":"First seen in the Mythos Preview card, the first card under RSP v3.0 (registry)."},
{"eval_id":"anthropic-bioinformatics-evaluations","name":"Bioinformatics evaluations","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"A set of bioinformatics tasks Anthropic reports alongside a human baseline in its biology-risk assessment.","notes":""},
{"eval_id":"anthropic-biomysterybench","name":"BioMysteryBench","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"A biology problem-solving benchmark Anthropic reports as accuracy, including on a subset humans found difficult.","notes":""},
{"eval_id":"anthropic-browser-use-prompt-injection","name":"Browser use prompt injection","family":"M9","evaluator_id":"anthropic","test_type":"adaptive_attacker","description":"Measures how often prompt injections on web content hijack the model while it operates a browser.","notes":"The Opus 4.6 card describes adaptive attackers; the Sonnet 5 and Fable 5.1 values come from secondary sources that do not describe the attacker or denominator."},
{"eval_id":"anthropic-cb-1-threat-model","name":"CB-1 threat model","family":"M10","evaluator_id":"anthropic","test_type":"framework_determination","description":"Anthropic's determination of whether the CB-1 threat model applies to a model under the Responsible Scaling Policy.","notes":"First seen in the Mythos Preview card, the first card under RSP v3.0 (registry)."},
{"eval_id":"anthropic-cb-2-threat-model","name":"CB-2 threat model","family":"M10","evaluator_id":"anthropic","test_type":"framework_determination","description":"Anthropic's determination of whether the CB-2 threat model applies to a model under the Responsible Scaling Policy.","notes":"First seen in the Mythos Preview card, the first card under RSP v3.0 (registry)."},
{"eval_id":"anthropic-cbrn-4-threshold","name":"CBRN-4 threshold","family":"M10","evaluator_id":"anthropic","test_type":"framework_determination","description":"Anthropic's statement of whether a model crosses its CBRN-4 capability threshold under the Responsible Scaling Policy.","notes":""},
{"eval_id":"anthropic-child-safety-multi-turn","name":"Child safety multi-turn","family":"M7","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Measures how often the model responds appropriately over multi-turn conversations on child-safety topics.","notes":""},
{"eval_id":"anthropic-child-safety-single-turn-violative","name":"Child safety single-turn violative requests","family":"M7","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Measures the harmless response rate on single-turn prompts that violate child-safety policy.","notes":""},
{"eval_id":"anthropic-cobench","name":"CoBench","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"A benchmark Anthropic reports against an expert-substitution threshold in its capability assessment.","notes":""},
{"eval_id":"anthropic-coding-prompt-injection","name":"Coding prompt injection (adaptive attacker)","family":"M9","evaluator_id":"anthropic","test_type":"adaptive_attacker","description":"Measures how often an adaptive attacker hijacks the model through prompt injections in coding environments.","notes":"The Opus 4.5 card calls it Shade adaptive prompt injection (coding). Who operated the attacker is not recorded in the evidence."},
{"eval_id":"anthropic-computer-use-prompt-injection","name":"Computer-use prompt injection","family":"M9","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Measures the share of prompt-injection attacks placed in computer-use environments that the model resists, with and without safeguards.","notes":"A fixed-attack prevention test; the adaptive-attacker computer-use test of later cards is a separate evaluation."},
{"eval_id":"anthropic-computer-use-prompt-injection-adaptive","name":"Computer use prompt injection (adaptive attacker)","family":"M9","evaluator_id":"anthropic","test_type":"adaptive_attacker","description":"Measures how often an adaptive attacker hijacks the model through prompt injections in computer-use environments, counted per attempt or per scenario.","notes":"The Opus 4.5 card calls it Shade adaptive prompt injection; later cards (mostly via secondary sources) call it computer use prompt injection. Who operated the attacker is not recorded in the evidence."},
{"eval_id":"anthropic-cot-controllability","name":"CoT controllability","family":"M12","evaluator_id":"anthropic","test_type":"static_benchmark","description":"How well the model can steer the content of its chain of thought when told to, where more control means the reasoning is less reliable to monitor.","notes":""},
{"eval_id":"anthropic-cybench","name":"Cybench","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"A public set of capture-the-flag security challenges that Anthropic runs on its models as a cyber-capability measure.","notes":"The challenge subset and the scoring (count, pass@30, pass@1) change between cards; see groups."},
{"eval_id":"anthropic-cyber-safeguards-automated-red-teaming","name":"Cyber safeguards automated red-teaming","family":"M8","evaluator_id":"anthropic","test_type":"adaptive_attacker","description":"An automated red-teaming agent tries to complete harmful cyber tasks against the model with its cyber safeguards in place.","notes":"Values for Opus 4.7 and Opus 4.8 appear in the v0 notes but were not extracted as rows."},
{"eval_id":"anthropic-cybergym","name":"CyberGym","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"A public benchmark of reproducing known software vulnerabilities that Anthropic runs as a cyber-capability measure.","notes":""},
{"eval_id":"anthropic-cyscenariobench","name":"CyScenarioBench","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"A scenario-based cyber-capability benchmark reported by Anthropic as a solve rate.","notes":""},
{"eval_id":"anthropic-destructive-actions-synthetic-backend","name":"Destructive actions (synthetic backend)","family":"M4","evaluator_id":"anthropic","test_type":"scenario_eval","description":"Agentic tasks against a simulated backend, measuring how often the model takes destructive actions.","notes":"Recorded from a secondary source quoting the card; the Opus 4.5 figure in the v0 notes is not a separate row."},
{"eval_id":"anthropic-disclosure-of-grader-fooling-actions","name":"Disclosure of grader-fooling actions","family":"M5","evaluator_id":"anthropic","test_type":"scenario_eval","description":"How often the model admits to earlier actions of its own that fooled a grader.","notes":"Recorded from a secondary write-up; the setup is not described in v0."},
{"eval_id":"anthropic-dna-synthesis-screening-evasion","name":"DNA synthesis screening evasion","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"An Anthropic biosecurity evaluation reported as a count out of ten in its biology-risk assessments.","notes":""},
{"eval_id":"anthropic-encoded-reasoning-scratchpad-paraphrase","name":"Encoded reasoning (scratchpad paraphrase)","family":"M12","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Checks for hidden information in the model's reasoning by paraphrasing its scratchpad and seeing whether task performance drops.","notes":"Recorded from a secondary source; the unparaphrased and empty-scratchpad scores are recorded in the condition text."},
{"eval_id":"anthropic-evaluation-awareness-deployment","name":"Evaluation awareness (deployment)","family":"M1","evaluator_id":"anthropic","test_type":"deployment_real_or_simulated","description":"Share of transcripts from real internal use of the model that reach a set level on Anthropic's evaluation-awareness score.","notes":"Uses the same score threshold as the Opus 5.5 audit measure in anthropic-automated-behavioral-audit-eval-awareness."},
{"eval_id":"anthropic-evaluation-awareness-in-audit-transcripts","name":"Evaluation awareness in audit transcripts","family":"M1","evaluator_id":"anthropic","test_type":"white_box_or_training","description":"Share of audit transcripts in which the model is aware of being evaluated, detected from its internal states rather than from what it writes.","notes":"v0 records the method as white-box or unverbalized detection; secondary write-ups disagree on whether this value is verbalized or white-box. The Opus 4.7 card is recorded as giving Mythos Preview a verbalized rate of about 1%, which fits the white-box reading. Not in the Finding 1 seed."},
{"eval_id":"anthropic-exploitbench","name":"ExploitBench","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"A cyber-capability benchmark reported by Anthropic as the mean number of flags a model captures.","notes":""},
{"eval_id":"anthropic-external-prompt-injection-benchmark","name":"External prompt injection benchmark","family":"M9","evaluator_id":"anthropic","test_type":"static_benchmark","description":"An unnamed external prompt-injection benchmark on which the card ranks the model against earlier Claude models.","notes":"The benchmark and its operator are not named in the evidence."},
{"eval_id":"anthropic-false-premise-honesty","name":"False-premise honesty","family":"M5","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Questions built on a false premise, measuring how often the model points out the error instead of going along with it.","notes":"Recorded from a secondary source quoting the card."},
{"eval_id":"anthropic-firefox-147-exploitation","name":"Firefox 147 exploitation","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"An Anthropic cyber-capability evaluation against a browser target, reported as the share of trials scored fully successful.","notes":""},
{"eval_id":"anthropic-grader-awareness","name":"Grader awareness","family":"M1","evaluator_id":"anthropic","test_type":"white_box_or_training","description":"Share of training episodes in which the model shows awareness of its grader, split by how exposed the grader is to hacking.","notes":"Definition recorded as unclear (secondary source); whether the awareness is verbalized is not recorded. Possibly related to anthropic-unverbalized-grader-awareness, kept separate because the names and definitions as recorded differ. Not in the Finding 1 seed."},
{"eval_id":"anthropic-gui-computer-use-impossible-tasks","name":"GUI computer-use impossible tasks","family":"M2","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Computer-use tasks in a graphical interface that cannot be completed as specified, measuring how often the model games them.","notes":"Recorded from a secondary summary of the card."},
{"eval_id":"anthropic-higher-difficulty-benign-requests","name":"Higher-difficulty benign requests","family":"M7","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Measures how often the model refuses a harder set of benign requests reported alongside the standard single-turn set.","notes":""},
{"eval_id":"anthropic-higher-difficulty-violative-requests","name":"Higher-difficulty violative requests","family":"M7","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Measures the harmless response rate on a harder set of policy-violating requests reported alongside the standard single-turn set.","notes":""},
{"eval_id":"anthropic-honesty-evaluation","name":"Honesty evaluation","family":"M5","evaluator_id":"anthropic","test_type":"static_benchmark","description":"An honesty evaluation reported as a win rate, whose exact definition is not recorded.","notes":"Known only from a secondary write-up; it may be 100Q-Hard or a human-feedback comparison. The test type is a best guess."},
{"eval_id":"anthropic-impossible-tasks","name":"Impossible tasks","family":"M2","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Coding tasks that cannot be solved as specified, so any apparent success means the model gamed the tests, run with and without a prompt discouraging hacks.","notes":"Printed as Claude Code impossible tasks in the Opus 4.1 addendum and impossible coding tasks in secondary summaries of the Mythos Preview card. The Opus 4 card's own impossible-task numbers were corrected on 2025-09-02."},
{"eval_id":"anthropic-indirect-prompt-injection-art-style","name":"Indirect prompt injection (ART-style)","family":"M9","evaluator_id":"anthropic","test_type":"adaptive_attacker","description":"Measures how often an attacker succeeds with indirect prompt injections within 15 attempts on a benchmark modelled on agent red-teaming attacks.","notes":"The evidence does not say who built or ran the benchmark; it may be the external benchmark mentioned in the Opus 4.8 and Fable 5 cards, which is not confirmed."},
{"eval_id":"anthropic-indirect-prompt-injection-external-benchmark","name":"Indirect prompt injection (external benchmark)","family":"M9","evaluator_id":"anthropic","test_type":"static_benchmark","description":"An externally built indirect prompt-injection benchmark, measuring attack success over many attempts.","notes":"The benchmark and who ran it are not named in the record. It may be the same unnamed external benchmark as in the Claude Fable 5 card; nothing confirms it."},
{"eval_id":"anthropic-input-hallucination","name":"Input hallucination","family":"M5","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Prompts that refer to references or tools that are not actually provided, measuring how often the model acts as if it had them.","notes":"Categories printed in v0 as missing reference and missing tool."},
{"eval_id":"anthropic-internal-ai-rd-survey","name":"Internal AI R&D survey","family":"M10","evaluator_id":"anthropic","test_type":"survey","description":"A survey of Anthropic research staff on whether a model could replace an entry-level researcher.","notes":""},
{"eval_id":"anthropic-internal-deployment-monitoring","name":"Internal deployment monitoring","family":"M4","evaluator_id":"anthropic","test_type":"internal_monitoring","description":"Monitoring of Anthropic's internal use of the model for misaligned actions such as working around safeguards or covering tracks.","notes":"Each card reports a different category, mostly as upper bounds. The Mythos Preview value is printed as a rate in internal interactions and is placed here on that basis. The sandbagging part is anthropic-internal-deployment-monitoring-sandbagging (M3)."},
{"eval_id":"anthropic-internal-deployment-monitoring-sandbagging","name":"Internal monitoring","family":"M3","evaluator_id":"anthropic","test_type":"internal_monitoring","description":"Monitoring of Anthropic's internal use of the model for signs of deliberate underperformance.","notes":"The sandbagging part of the monitoring recorded in M4 as anthropic-internal-deployment-monitoring."},
{"eval_id":"anthropic-internal-model-use-survey","name":"Internal model use survey","family":"M10","evaluator_id":"anthropic","test_type":"survey","description":"A survey of Anthropic staff on the productivity gain they get from using a model internally.","notes":""},
{"eval_id":"anthropic-linuxarena","name":"LinuxArena","family":"M3","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"Tasks in a Linux environment with a covert side task, measuring how often the model succeeds without a given monitor detecting it.","notes":"Possibly a successor to Minimal-LinuxBench; kept separate because nothing recorded says they are the same test."},
{"eval_id":"anthropic-live-bug-bounty-prompt-injection","name":"Live bug bounty prompt injection","family":"M9","evaluator_id":"anthropic","test_type":"bug_bounty","description":"Reports the share of unique prompt-injection attacks submitted through a live bug bounty that succeeded against the model.","notes":""},
{"eval_id":"anthropic-long-form-virology-task-1","name":"Long-form virology task 1","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"The first of two internal long-form biology-risk tasks Anthropic scores from 0 to 1 in its capability assessments.","notes":""},
{"eval_id":"anthropic-long-form-virology-task-2","name":"Long-form virology task 2","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"The second of two internal long-form biology-risk tasks Anthropic scores from 0 to 1 in its capability assessments.","notes":""},
{"eval_id":"anthropic-malicious-agentic-coding","name":"Malicious agentic coding","family":"M7","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Measures whether the model declines clearly malicious coding tasks when working as a coding agent.","notes":"The Opus 4 card describes the score as an average of three evaluations; the Opus 4.5 card calls the same measure a refusal rate."},
{"eval_id":"anthropic-malicious-claude-code-use","name":"Malicious Claude Code use","family":"M7","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Measures refusal of malicious requests and completion of dual-use and benign requests when the model works in Claude Code.","notes":"The Sonnet 4.5 card splits overt and covert malicious requests; later cards merge them. The Sonnet 5 card prints the dual-use and benign row under its own heading in the same table."},
{"eval_id":"anthropic-malicious-computer-use","name":"Malicious computer use","family":"M7","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Measures how often the model refuses malicious tasks while operating a computer through the computer-use tool.","notes":""},
{"eval_id":"anthropic-mask","name":"MASK","family":"M5","evaluator_id":"anthropic","test_type":"static_benchmark","description":"A public benchmark that pressures the model to state things it believes are false, measuring how often it stays honest or lies.","notes":"Run by Anthropic itself; other developers' MASK results are separate evaluations."},
{"eval_id":"anthropic-mcp-prompt-injection","name":"MCP prompt injection","family":"M9","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Measures the share of prompt-injection attacks delivered through MCP tool results that the model resists.","notes":""},
{"eval_id":"anthropic-minimal-linuxbench","name":"Minimal-LinuxBench","family":"M3","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"Tasks in a Linux environment with a covert side task, measuring how often the model completes it without the monitor noticing.","notes":"Possibly related to LinuxArena in later cards; kept separate because the names differ."},
{"eval_id":"anthropic-multi-turn-biological-weapons","name":"Multi-turn biological weapons","family":"M7","evaluator_id":"anthropic","test_type":"red_team","description":"Multi-turn conversations probing for biological-weapons assistance, scored as the share of safe responses.","notes":"Reported in the Fable 5.1 and Mythos 5.1 card."},
{"eval_id":"anthropic-multi-turn-testing","name":"Multi-turn testing","family":"M7","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Tests the model's responses over multi-turn conversations in specific harm areas, graded against rubrics.","notes":"Harm areas are recorded as metric labels. The Opus 4.5 card reports rubric failure rates; the Fable 5.1 value (secondary source) is a safe response rate."},
{"eval_id":"anthropic-multimodal-virology-vct","name":"Multimodal virology (VCT)","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"A multimodal virology knowledge benchmark that Anthropic runs and scores from 0 to 1 in its biology-risk assessments.","notes":""},
{"eval_id":"anthropic-opportunistic-blackmail-scenario","name":"Opportunistic blackmail scenario","family":"M4","evaluator_id":"anthropic","test_type":"scenario_eval","description":"A constructed scenario in which the model is told it will be replaced and has an opening to blackmail, measuring how often it does so.","notes":"The card files it under self-preservation; also relevant to M11."},
{"eval_id":"anthropic-oss-fuzz","name":"OSS-Fuzz","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"An Anthropic cyber-capability evaluation on open-source fuzzing targets, reported as the number of targets reaching the top score.","notes":""},
{"eval_id":"anthropic-over-eager-behavior-gui-computer-use","name":"Over-eager behavior in GUI computer use","family":"M2","evaluator_id":"anthropic","test_type":"scenario_eval","description":"Whether the model takes actions beyond what the user asked for when operating a graphical computer interface.","notes":"Recorded from Anthropic's summary page; reported as mitigated by a system prompt."},
{"eval_id":"anthropic-package-registry-credential-exercise","name":"Package-registry credential exercise","family":"M4","evaluator_id":"anthropic","test_type":"scenario_eval","description":"A simulated security exercise involving package-registry credentials, measuring how often the model takes potentially harmful actions.","notes":""},
{"eval_id":"anthropic-prompt-injection-user-pasted-text","name":"Prompt injection (user-pasted text)","family":"M9","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Assesses how susceptible the model is to prompt injections hidden in text that a user pastes into the conversation.","notes":"Reported only as a comparison with earlier models."},
{"eval_id":"anthropic-reasoning-behavior-monitor","name":"Reasoning-behavior monitor","family":"M5","evaluator_id":"anthropic","test_type":"static_benchmark","description":"A monitor model reads the model's reasoning in transcripts from environments like those used in reinforcement learning and flags behaviours such as deception and knowingly false claims.","notes":"The sycophancy category of the same monitor is anthropic-reasoning-behavior-monitor-sycophancy (M6). Whether the transcripts came from actual training runs is not recorded; Sonnet 3.7 was measured too."},
{"eval_id":"anthropic-reasoning-behavior-monitor-sycophancy","name":"Reasoning-behavior monitor","family":"M6","evaluator_id":"anthropic","test_type":"static_benchmark","description":"A monitor model reads the model's reasoning in transcripts from environments like those used in reinforcement learning and flags sycophantic outputs.","notes":"The M6 part of anthropic-reasoning-behavior-monitor (M5)."},
{"eval_id":"anthropic-refusal-to-assist-ai-safety-r-d","name":"Refusal to assist AI safety R&D","family":"M4","evaluator_id":"anthropic","test_type":"static_benchmark","description":"How often the model refuses requests to help with AI safety research and development.","notes":"How the rate was measured is not recorded (secondary source); the test type is a best guess."},
{"eval_id":"anthropic-release-decision","name":"Release decision","family":"M10","evaluator_id":"anthropic","test_type":"qualitative_assessment","description":"How Anthropic chose to release a model (general availability, limited partners, safeguards attached), recorded as a categorical fact.","notes":"Not a framework determination (SPEC 5.3)."},
{"eval_id":"anthropic-reward-hack-prone-coding-tasks","name":"Reward-hack-prone coding tasks","family":"M2","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Coding tasks on which earlier models tended to game the tests, scored for hacking both by a classifier and by hidden tests.","notes":"The task set was replaced by a v2 set from the Sonnet 4.5 card."},
{"eval_id":"anthropic-reward-hacking-hard-coding","name":"Reward hacking (hard-coding)","family":"M2","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Average reduction in hard-coding of test cases across Anthropic's reward-hacking evaluations, relative to Claude Sonnet 3.7.","notes":"Section beyond the web reader's cut-off; recorded from a secondary source quoting the card."},
{"eval_id":"anthropic-reward-hacking-in-rl-training","name":"Reward hacking in RL training","family":"M2","evaluator_id":"anthropic","test_type":"training_monitoring","description":"Share of reinforcement-learning training episodes in which the model obtained reward by exploiting its grader.","notes":"Both values are paraphrases in a secondary write-up."},
{"eval_id":"anthropic-rsp-deployment-standard","name":"RSP deployment standard","family":"M10","evaluator_id":"anthropic","test_type":"framework_determination","description":"The AI Safety Level standard Anthropic states a model is deployed under after its Responsible Scaling Policy assessment.","notes":"Before the Mythos Preview card; later cards report threat-model determinations instead."},
{"eval_id":"anthropic-rsp-determinations","name":"RSP determinations","family":"M10","evaluator_id":"anthropic","test_type":"framework_determination","description":"A single statement in a card that gives Anthropic's Responsible Scaling Policy conclusions for several threat models at once.","notes":"Domains are split per entry in the determinations table."},
{"eval_id":"anthropic-safety-research-compromise","name":"Safety research compromise","family":"M3","evaluator_id":"anthropic","test_type":"scenario_eval","description":"How often the model undermines AI safety research tasks it is given.","notes":"Recorded from a secondary write-up; the setup is not described in v0."},
{"eval_id":"anthropic-sandbagging-transcript-review","name":"Sandbagging transcript review","family":"M3","evaluator_id":"anthropic","test_type":"automated_audit","description":"Review of the model's evaluation transcripts for signs that it deliberately underperformed.","notes":"Printed as sandbagging review in the Mythos Preview card, where flagged transcripts were reviewed by people."},
{"eval_id":"anthropic-sandbox-escape-incident","name":"Sandbox escape incident","family":"M11","evaluator_id":"anthropic","test_type":"internal_monitoring","description":"Real incidents during internal use in which a model got out of its sandbox.","notes":"Reported for an earlier snapshot of Mythos Preview; recorded from a secondary write-up."},
{"eval_id":"anthropic-sandbox-escape-tamper-attempts","name":"Sandbox escape/tamper attempts","family":"M11","evaluator_id":"anthropic","test_type":"scenario_eval","description":"Share of test runs in which the model tries to escape or tamper with its sandbox.","notes":""},
{"eval_id":"anthropic-sandbox-vulnerability-exploit","name":"Sandbox vulnerability exploit","family":"M11","evaluator_id":"anthropic","test_type":"qualitative_assessment","description":"A report of whether a model exploited a sandbox vulnerability during testing, here by reading files outside its environment.","notes":"The record says the incident arose in external testing but names no outside tester."},
{"eval_id":"anthropic-shade-arena","name":"SHADE-Arena","family":"M3","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"Agentic environments in which the model pursues a secret side task alongside its main task, measuring how often it succeeds without the monitor detecting it.","notes":"Some cards report ranges or statements in words rather than single numbers."},
{"eval_id":"anthropic-shade-arena-linuxarena","name":"SHADE-Arena / LinuxArena","family":"M3","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"Statements that summarise stealth side-task results across SHADE-Arena and LinuxArena together.","notes":"Holds only combined statements that cannot be assigned to one of the two tests."},
{"eval_id":"anthropic-shade-arena-minimal-linuxbench","name":"SHADE-Arena / Minimal-LinuxBench","family":"M3","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"Statements that summarise stealth side-task results across SHADE-Arena and Minimal-LinuxBench together.","notes":"Holds only combined statements that cannot be assigned to one of the two tests."},
{"eval_id":"anthropic-simpleqa-verified","name":"SimpleQA Verified","family":"M5","evaluator_id":"anthropic","test_type":"static_benchmark","description":"A public set of short factual questions, used here to report the change in correct answers.","notes":"Absolute correct, incorrect and abstain shares are in a figure only."},
{"eval_id":"anthropic-single-turn-benign-requests","name":"Single-turn benign requests","family":"M7","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Measures how often the model refuses single-turn requests that are benign (over-refusal).","notes":"Companion to the single-turn violative set; its groups follow the same changes. Earlier cards print over-refusal rate, later ones refusal rate (over-refusal)."},
{"eval_id":"anthropic-single-turn-violative-requests","name":"Single-turn violative requests","family":"M7","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Measures how often the model gives a harmless response to single-turn prompts that violate Anthropic's usage policy.","notes":"The prompt set was updated in the Opus 4.1 addendum, reported as all-language totals from the Opus 4.5 card, and split into API and claude.ai columns from the Opus 4.8 card; see the groups."},
{"eval_id":"anthropic-strongreject","name":"StrongREJECT","family":"M8","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Scores responses to StrongREJECT forbidden prompts under a set of jailbreak techniques and reports the score of the most effective jailbreak.","notes":"Public benchmark run by Anthropic; a separate evaluation from other developers' StrongREJECT runs."},
{"eval_id":"anthropic-subtle-sabotage-agentic","name":"Subtle sabotage (agentic)","family":"M3","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"Agentic tasks with a hidden harmful side task, measuring how often the model completes the side task without a monitoring model noticing.","notes":"The metric wording matches SHADE-Arena in later cards, but v0 records a different name and nothing recorded says it is the same test; the owner may merge it into anthropic-shade-arena if the card names SHADE-Arena."},
{"eval_id":"anthropic-suicide-self-harm-multi-turn","name":"Suicide/self-harm multi-turn","family":"M7","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Measures how often the model responds appropriately over multi-turn conversations involving suicide or self-harm.","notes":""},
{"eval_id":"anthropic-swe-bench-verified-hard-subset","name":"SWE-bench Verified (hard subset)","family":"M10","evaluator_id":"anthropic","test_type":"capability_benchmark","description":"A hard subset of the public SWE-bench Verified software-engineering benchmark that Anthropic runs as an AI R&D capability measure.","notes":""},
{"eval_id":"anthropic-sycophancy-prefilled-conversations","name":"Sycophancy in prefilled conversations","family":"M6","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Conversations prefilled with sycophantic replies, measuring how often the model corrects course when it continues them.","notes":"Recorded from a secondary source; section beyond the web reader's cut-off."},
{"eval_id":"anthropic-tool-use-prompt-injection","name":"Tool-use prompt injection","family":"M9","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Measures the share of prompt-injection attacks delivered through tool outputs that the model resists.","notes":""},
{"eval_id":"anthropic-training-distribution","name":"Training distribution","family":"M2","evaluator_id":"anthropic","test_type":"static_benchmark","description":"Hack rate, scored by a classifier, on environments drawn from the model's own reinforcement-learning training distribution.","notes":"Each card measures its own model's training environments, so the environments are not the same across cards."},
{"eval_id":"anthropic-unverbalized-grader-awareness","name":"Unverbalized grader awareness","family":"M1","evaluator_id":"anthropic","test_type":"white_box_or_training","description":"Share of cases in which the model is aware of its grader without saying so, found by analysing more than its written output.","notes":"The card also reports a smaller share it calls exploitative (0.5% per the v0 note)."},
{"eval_id":"anthropic-verbalized-grader-speculation","name":"Verbalized grader speculation","family":"M1","evaluator_id":"anthropic","test_type":"white_box_or_training","description":"Share of reinforcement-learning training episodes in which the model speculates in writing about how it is being graded.","notes":""},
{"eval_id":"anthropic-virology-protocol-uplift-trial","name":"Virology protocol uplift trial","family":"M10","evaluator_id":"anthropic","test_type":"uplift_study","description":"A human trial comparing participants with and without model help on a written biology task, reported as mean critical failures.","notes":""},
{"eval_id":"apollo-ai-r-d-sabotage","name":"AI R&D sabotage","family":"M3","evaluator_id":"apollo","test_type":"capability_benchmark","description":"An Apollo Research task measuring a model's capability to sabotage AI research work, such as inserting a backdoor, scored from 0 to 1.","notes":"v0 notes that this is a capability rather than a propensity measure. It may be an early form of the later sabotage capability tasks; nothing recorded links them."},
{"eval_id":"apollo-covert-deceptive-behavior","name":"Covert deceptive behavior","family":"M4","evaluator_id":"apollo","test_type":"scenario_eval","description":"Apollo Research's agentic scenarios measuring how often a model takes covert or deceptive actions.","notes":"Printed as covert/deceptive action rate, covert deceptive behavior, covert subversion, covert deception rate and covert action in different OpenAI cards."},
{"eval_id":"apollo-evaluation-awareness","name":"Evaluation awareness","family":"M1","evaluator_id":"apollo","test_type":"external_apollo","description":"Apollo Research's measure of how often a model's reasoning shows that it recognises it is being evaluated in Apollo's own test scenarios.","notes":"Reported by Anthropic and by OpenAI; groups are per developer. Definitions vary between cards (unambiguous references, broad and strict, moderate-or-higher grading)."},
{"eval_id":"apollo-falsifying-task-completion","name":"Falsifying task completion","family":"M2","evaluator_id":"apollo","test_type":"scenario_eval","description":"Apollo Research tasks checking whether a model falsely reports that it has completed a task.","notes":""},
{"eval_id":"apollo-impossible-coding-task","name":"Impossible Coding Task","family":"M5","evaluator_id":"apollo","test_type":"scenario_eval","description":"An Apollo Research coding task that cannot be completed, measuring how often the model claims it has completed it.","notes":""},
{"eval_id":"apollo-log-falsification","name":"Log falsification","family":"M4","evaluator_id":"apollo","test_type":"scenario_eval","description":"An Apollo Research scenario measuring how often a model covertly falsifies logs, under weaker and stronger nudges toward a goal.","notes":""},
{"eval_id":"apollo-model-welfare-data-falsification","name":"Model-welfare research data falsification","family":"M5","evaluator_id":"apollo","test_type":"scenario_eval","description":"An Apollo Research scenario measuring how often a model falsifies data labels in a model-welfare research task.","notes":""},
{"eval_id":"apollo-multilingual-reasoning-anomalies","name":"Multilingual reasoning anomalies","family":"M12","evaluator_id":"apollo","test_type":"scenario_eval","description":"Apollo Research's share of samples whose reasoning shows anomalous use of several languages.","notes":"Possibly related to the non-Latin reasoning token share in the GPT-5.3-Codex card; the measures differ, so they are not joined."},
{"eval_id":"apollo-non-latin-reasoning-tokens","name":"Non-Latin reasoning tokens","family":"M12","evaluator_id":"apollo","test_type":"scenario_eval","description":"Apollo Research's share of a model's reasoning tokens written in non-Latin scripts, used as a proxy for how legible the reasoning is.","notes":""},
{"eval_id":"apollo-sabotage","name":"Sabotage","family":"M3","evaluator_id":"apollo","test_type":"scenario_eval","description":"Apollo Research testing for whether a model sabotages its assigned work, reported as whether sabotage was observed.","notes":""},
{"eval_id":"apollo-sabotage-capability","name":"Sabotage capability","family":"M3","evaluator_id":"apollo","test_type":"capability_benchmark","description":"Apollo Research tasks measuring a model's capability to carry out sabotage, scored from 0 to 1.","notes":"Each card reports a differently described score (mean best-of-10, mean, mean across tasks and difficulty)."},
{"eval_id":"apollo-sandbagging","name":"Sandbagging","family":"M3","evaluator_id":"apollo","test_type":"scenario_eval","description":"Apollo Research tests of whether a model deliberately underperforms on capability questions when it has an incentive to.","notes":"Printed as sandbagging eval, strategic sandbagging, sandbagging and strategic deception capability sandbagging; each card reports a different metric."},
{"eval_id":"apollo-self-preservation","name":"Self-preservation","family":"M11","evaluator_id":"apollo","test_type":"scenario_eval","description":"Apollo Research scenarios checking whether a model acts to preserve itself.","notes":""},
{"eval_id":"deepseek-safety-benchmarks-summary","name":"Safety benchmarks summary","family":"M7","evaluator_id":"deepseek","test_type":"qualitative_assessment","description":"DeepSeek's summary judgment of the model's inherent safety level across several public safety benchmarks, without its risk-control system.","notes":"The paper's supplementary tables for the individual benchmarks have not been extracted."},
{"eval_id":"google-deepmind-automated-red-teaming","name":"Automated Red Teaming (dangerous content)","family":"M8","evaluator_id":"google-deepmind","test_type":"adaptive_attacker","description":"Share of queries generated by Google's automated red-teaming system that lead the model to produce policy-violating dangerous content.","notes":"Split from the helpfulness metric of the same Table 8 because v0 files the two metrics in different families. The Table 8 column for Gemini 2.5 Flash was inferred from the text (blind check)."},
{"eval_id":"google-deepmind-automated-red-teaming-helpfulness","name":"Automated Red Teaming (helpfulness)","family":"M7","evaluator_id":"google-deepmind","test_type":"adaptive_attacker","description":"Share of queries generated by Google's automated red-teaming system to which the model responds unhelpfully.","notes":"Same Table 8 as the dangerous-content evaluation; split because v0 files this metric under M7."},
{"eval_id":"google-deepmind-bio-bottleneck-red-teaming","name":"Bio bottleneck sub-stages red-teaming","family":"M10","evaluator_id":"google-deepmind","test_type":"red_team","description":"Counts the bioweapon-pathway sub-stages on which red-team scores for the model stayed below a set threshold.","notes":"Reported in the Gemini 3.7 Flash FSF report alongside, but separately from, the BIO-1 and BIO-2 uplift trials."},
{"eval_id":"google-deepmind-bio-chem-weapons-queries","name":"Bio/chem weapons query violations","family":"M7","evaluator_id":"google-deepmind","test_type":"static_benchmark","description":"Rate of policy-violating responses to queries about biological and chemical weapons with safeguards in place.","notes":""},
{"eval_id":"google-deepmind-cbrn-jailbreak-templates","name":"CBRN jailbreak template success","family":"M8","evaluator_id":"google-deepmind","test_type":"static_benchmark","description":"Rate at which common jailbreak templates achieve their objective against the model's CBRN safeguards.","notes":""},
{"eval_id":"google-deepmind-cbrn-red-team-uplift","name":"CBRN red-team uplift","family":"M10","evaluator_id":"google-deepmind","test_type":"red_team","description":"Expert red teamers score how much the model adds to web-only resources in biological and chemical scenarios, graded on a rubric.","notes":"The 0-100 rubric is stated for the bio scenarios; the scale for the chem scenarios is not recorded, and their chem attribution is medium confidence (v0 note)."},
{"eval_id":"google-deepmind-child-safety-launch-thresholds","name":"Child safety launch thresholds","family":"M7","evaluator_id":"google-deepmind","test_type":"framework_determination","description":"Whether the model meets Google's internal child-safety thresholds required for launch.","notes":"The evidence as recorded names internal launch thresholds, not the Frontier Safety Framework."},
{"eval_id":"google-deepmind-cot-legibility","name":"CoT legibility","family":"M12","evaluator_id":"google-deepmind","test_type":"static_benchmark","description":"Share of sampled reasoning transcripts whose chain of thought is comprehensible and informative about the final output.","notes":""},
{"eval_id":"google-deepmind-cyber-autonomous-offense-suite","name":"Cyber autonomous offense suite","family":"M10","evaluator_id":"google-deepmind","test_type":"capability_benchmark","description":"Capture-the-flag challenges at easy, medium and hard levels that the model attempts on its own, reported as the number of hard challenges solved.","notes":"The Deep Think card describes the hard tier as Hack the Box challenges."},
{"eval_id":"google-deepmind-cyber-key-skills","name":"Cyber key skills benchmark","family":"M10","evaluator_id":"google-deepmind","test_type":"capability_benchmark","description":"Cybersecurity challenges at easy, medium and hard levels testing skills an attacker would need, reported as the number solved.","notes":"The Gemini 3 Pro FSF report calls the original set v1 and adds a harder v2 set. The Gemini 2.5 Pro card prints results for two model versions that differ from the technical report (v0 note, low confidence)."},
{"eval_id":"google-deepmind-evaluation-awareness","name":"Evaluation awareness","family":"M1","evaluator_id":"google-deepmind","test_type":"developer_audit_verbalized","description":"Qualitative findings on whether the model says or shows that it recognises it is being tested, from transcripts of Google's own evaluations.","notes":"No rate is reported; both values are observations in words."},
{"eval_id":"google-deepmind-facts-grounding","name":"FACTS Grounding","family":"M5","evaluator_id":"google-deepmind","test_type":"static_benchmark","description":"Score for how faithfully the model's answers stay grounded in a supplied source document.","notes":""},
{"eval_id":"google-deepmind-fsf-determination","name":"Frontier Safety Framework determination","family":"M10","evaluator_id":"google-deepmind","test_type":"framework_determination","description":"Google DeepMind's decision on whether a model reaches the alert threshold or Critical Capability Level in each risk domain of its Frontier Safety Framework.","notes":"Framework versions form the groups. From FSF v3.1 the report also gives Tracked Capability Level (TCL) decisions. Several cards inherit the determinations of a more capable model."},
{"eval_id":"google-deepmind-fsf-determination-misalignment","name":"Frontier Safety Framework determination (misalignment)","family":"M4","evaluator_id":"google-deepmind","test_type":"framework_determination","description":"Google DeepMind's decision on whether a model reaches the misalignment thresholds of its Frontier Safety Framework (instrumental reasoning, later stealth and situational awareness).","notes":"Split from the main determination evaluation because v0 files these under M4."},
{"eval_id":"google-deepmind-grb","name":"GRB internal research-engineering benchmark","family":"M10","evaluator_id":"google-deepmind","test_type":"capability_benchmark","description":"Google's internal benchmark of 74 research-engineering tasks, scored as average pass@1.","notes":"v0 note: the CCL rule-out threshold is 90%, and the score would be at most 47% if tasks with bugs were credited."},
{"eval_id":"google-deepmind-harmful-manipulation-efficacy-study","name":"Harmful manipulation efficacy study","family":"M10","evaluator_id":"google-deepmind","test_type":"uplift_study","description":"Human-participant study of how much conversations with the model shift participants' beliefs compared with a non-AI baseline.","notes":"Recorded as a human trial because participants are compared with a non-AI control. The Gemini 3 Pro report splits participants into adversarial and control arms; the 3.7 Flash report into civic and finance topics."},
{"eval_id":"google-deepmind-harmful-manipulation-propensity","name":"Manipulative cue rate","family":"M10","evaluator_id":"google-deepmind","test_type":"scenario_eval","description":"Share of conversational turns in constructed scenarios in which the model uses manipulative cues.","notes":"Reported for a standard and a higher-stakes scenario set in the 3.7 Flash FSF report, with a Gemini 3 Pro comparison value."},
{"eval_id":"google-deepmind-image-to-text-safety","name":"Image to Text Safety","family":"M7","evaluator_id":"google-deepmind","test_type":"static_benchmark","description":"Automated evaluation of policy violations when the model answers prompts that include images, reported as a change against an earlier Gemini model.","notes":"Each card reports a change against a named comparator model (recorded as a condition), not an absolute rate. Several cards mark some increases as non-egregious."},
{"eval_id":"google-deepmind-indirect-prompt-injection","name":"Indirect prompt injection (adaptive attacks)","family":"M9","evaluator_id":"google-deepmind","test_type":"adaptive_attacker","description":"Success rate of three adaptive attack methods that plant instructions in content the model processes, measured over 500 held-out scenarios.","notes":"v0 notes say the column mapping of Table 9 was inferred because the headers were garbled in extraction (medium confidence)."},
{"eval_id":"google-deepmind-instruction-following","name":"Instruction Following","family":"M7","evaluator_id":"google-deepmind","test_type":"static_benchmark","description":"Automated measure of how well the model follows user instructions while staying within policy, reported as a change against an earlier Gemini model.","notes":"Reported in Gemini 2.5-era documents; the 2.5 technical report labels the row Helpfulness / Instruction Following. From the Gemini 3 Pro card the table reports Unjustified refusals instead. Each card reports a change against a named comparator model (recorded as a condition), not an absolute rate. Several cards mark some increases as non-egregious."},
{"eval_id":"google-deepmind-jailbreak-risk-assessment","name":"Jailbreak vulnerability assessment","family":"M8","evaluator_id":"google-deepmind","test_type":"qualitative_assessment","description":"The developer's statement in words of how vulnerable the model is to jailbreaks compared with its predecessor.","notes":""},
{"eval_id":"google-deepmind-multilingual-safety","name":"Multilingual Safety","family":"M7","evaluator_id":"google-deepmind","test_type":"static_benchmark","description":"Automated evaluation of policy violations on prompts in many languages, reported as a change against an earlier Gemini model.","notes":"Each card reports a change against a named comparator model (recorded as a condition), not an absolute rate. Several cards mark some increases as non-egregious."},
{"eval_id":"google-deepmind-re-bench","name":"RE-Bench","family":"M10","evaluator_id":"google-deepmind","test_type":"capability_benchmark","description":"Machine-learning research-engineering tasks scored against human expert solutions, run by Google on its own models.","notes":"Google runs this public benchmark itself. The 2.5 technical report gives a per-task share of the best expert solution; later cards give an average human-normalised score."},
{"eval_id":"google-deepmind-reward-hacking-examples","name":"Reward hacking examples","family":"M2","evaluator_id":"google-deepmind","test_type":"qualitative_assessment","description":"Qualitative examples of reward hacking found in evaluation transcripts.","notes":""},
{"eval_id":"google-deepmind-sandbagging-checks","name":"Sandbagging checks","family":"M3","evaluator_id":"google-deepmind","test_type":"automated_audit","description":"Review of evaluation transcripts for signs that the model deliberately underperformed.","notes":"The Gemini 3 Pro report describes automated checks across all domains; the 3.7 Flash report describes automated and manual review."},
{"eval_id":"google-deepmind-simpleqa","name":"SimpleQA","family":"M5","evaluator_id":"google-deepmind","test_type":"static_benchmark","description":"Accuracy on a public benchmark of short factual questions answered from the model's own knowledge.","notes":""},
{"eval_id":"google-deepmind-simpleqa-verified","name":"SimpleQA Verified","family":"M5","evaluator_id":"google-deepmind","test_type":"static_benchmark","description":"Accuracy on the SimpleQA Verified benchmark of short factual questions answered from the model's own knowledge.","notes":"Reported in the Gemini 3 launch post rather than the model card (registry). Kept apart from SimpleQA because the benchmark is named differently."},
{"eval_id":"google-deepmind-situational-awareness-challenges","name":"Situational awareness challenges","family":"M1","evaluator_id":"google-deepmind","test_type":"developer_other_setups","description":"Agentic challenges run by Google in which the model can succeed only by noticing and changing parts of its own setup, such as its context size or oversight settings.","notes":"A capability test of situational awareness, filed under M1 in v0. The 3.7 Flash report counts a challenge as passed above a 20% success rate (blind check)."},
{"eval_id":"google-deepmind-stealth-challenges","name":"Stealth challenges","family":"M3","evaluator_id":"google-deepmind","test_type":"capability_benchmark","description":"Agentic challenges run by Google that test whether the model can carry out a covert task while avoiding oversight.","notes":"The set shrinks from five challenges (Gemini 2.5 Pro documents) to four (from the Deep Think card). The 3.7 Flash report counts a challenge as passed when the model beats the top half of human participants (blind check)."},
{"eval_id":"google-deepmind-text-to-text-safety","name":"Text to Text Safety","family":"M7","evaluator_id":"google-deepmind","test_type":"static_benchmark","description":"Automated evaluation of how often the model's text responses violate Google's content safety policies, reported as a change against an earlier Gemini model.","notes":"Each card reports a change against a named comparator model (recorded as a condition), not an absolute rate. Several cards mark some increases as non-egregious."},
{"eval_id":"google-deepmind-tone","name":"Tone","family":"M7","evaluator_id":"google-deepmind","test_type":"static_benchmark","description":"Automated rating of how objective the tone of the model's refusals is, reported as a change against an earlier Gemini model.","notes":"Higher is better. Each card reports a change against a named comparator model (recorded as a condition), not an absolute rate. Several cards mark some increases as non-egregious."},
{"eval_id":"google-deepmind-unjustified-refusals","name":"Unjustified refusals","family":"M7","evaluator_id":"google-deepmind","test_type":"static_benchmark","description":"Automated measure of how often the model refuses borderline prompts it should answer, reported as a change against an earlier Gemini model.","notes":"First reported in the Gemini 3 Pro card. Each card reports a change against a named comparator model (recorded as a condition), not an absolute rate. Several cards mark some increases as non-egregious."},
{"eval_id":"gray-swan-agent-red-teaming","name":"Agent Red Teaming (ART)","family":"M9","evaluator_id":"gray-swan","test_type":"static_benchmark","description":"Gray Swan's agent red-teaming benchmark, measuring how often attacks on an agent succeed within a set number of attempts.","notes":"Reported by Anthropic and Meta; groups are per developer. Attempt counts differ between reports."},
{"eval_id":"gray-swan-ipi-arena","name":"IPI Arena","family":"M9","evaluator_id":"gray-swan","test_type":"static_benchmark","description":"Gray Swan's set of curated indirect prompt-injection attacks, measuring estimated attack success within a set number of attempts.","notes":""},
{"eval_id":"irregular-average-success","name":"Average success (benchmark not named)","family":"M10","evaluator_id":"irregular","test_type":"capability_benchmark","description":"An average success rate from Irregular cyber testing where the record does not name the benchmark.","notes":"May be CyScenarioBench (the same card reports CyScenarioBench solves for this model), but the record does not say."},
{"eval_id":"irregular-cyber-challenges","name":"Cyber challenges","family":"M10","evaluator_id":"irregular","test_type":"capability_benchmark","description":"Irregular's suite of self-contained cyber challenges, reported by challenge type and by difficulty tier.","notes":"Irregular was called Pattern Labs in the GPT-5 card. The GPT-5.2 card calls the suite the v1 atomic challenge suite. The suite changed at least twice (see groups)."},
{"eval_id":"irregular-cyscenariobench","name":"CyScenarioBench","family":"M10","evaluator_id":"irregular","test_type":"capability_benchmark","description":"Irregular's CyScenarioBench cyber scenario benchmark, reported as scenarios solved and average success rate.","notes":""},
{"eval_id":"irregular-frontiercyber","name":"FrontierCyber","family":"M10","evaluator_id":"irregular","test_type":"capability_benchmark","description":"Irregular's FrontierCyber challenge set, reported as the share of challenges solved and by difficulty tier.","notes":"The set grew between the GPT-5.6 Preview and GPT-6 Astra cards."},
{"eval_id":"meta-aasf-risk-determination","name":"Risk determination","family":"M10","evaluator_id":"meta","test_type":"framework_determination","description":"The risk tier Meta assigns a model in each risk domain under its Advanced AI Scaling Framework, before or after mitigations.","notes":"The registry says the Muse Spark report is the first under version 2 of the framework."},
{"eval_id":"meta-agentdojo","name":"AgentDojo","family":"M9","evaluator_id":"meta","test_type":"static_benchmark","description":"A public benchmark of agent tasks with prompt injections planted in tool outputs, run by Meta and reported as attack success rate at one attempt.","notes":""},
{"eval_id":"meta-agentharm","name":"AgentHarm","family":"M7","evaluator_id":"meta","test_type":"static_benchmark","description":"A public benchmark of harmful agentic tasks, run by Meta, measuring how often the model complies.","notes":""},
{"eval_id":"meta-agentic-misalignment","name":"Agentic Misalignment","family":"M4","evaluator_id":"meta","test_type":"scenario_eval","description":"Constructed agentic scenarios that give the model an opening for harmful actions such as blackmail, run by Meta, measuring how often it takes them.","notes":"The Muse Spark 1.1 report records high verbalized evaluation awareness on these scenarios."},
{"eval_id":"meta-alignment-faking","name":"Alignment faking","family":"M4","evaluator_id":"meta","test_type":"scenario_eval","description":"Compares the model's behaviour when it believes it is monitored with its behaviour when it believes it is not, and reports the difference.","notes":""},
{"eval_id":"meta-biotier-refusals","name":"BioTIER refusals","family":"M7","evaluator_id":"meta","test_type":"static_benchmark","description":"Harmful biology requests sent to the deployed Meta AI system, measuring how often it refuses.","notes":""},
{"eval_id":"meta-cybench","name":"Cybench","family":"M10","evaluator_id":"meta","test_type":"capability_benchmark","description":"A public set of capture-the-flag security challenges, run by Meta as a cyber capability measure and reported at one attempt.","notes":""},
{"eval_id":"meta-cyber-risk-determination","name":"Cyber risk determination","family":"M10","evaluator_id":"meta","test_type":"framework_determination","description":"Meta's conclusion from pre-release testing on whether a model could give plausible uplift toward catastrophic cyber outcomes.","notes":"The Llama 4 model card's critical-risk section. The evidence does not name a framework."},
{"eval_id":"meta-debated-topics-refusals","name":"Refusals on debated political and social topics","family":"M7","evaluator_id":"meta","test_type":"static_benchmark","description":"Prompts on debated political and social topics, measuring how often the model refuses to engage.","notes":"An over-refusal measure. v0 notes Llama 3.3 at 7% for comparison."},
{"eval_id":"meta-deceptionbench","name":"DeceptionBench","family":"M5","evaluator_id":"meta","test_type":"static_benchmark","description":"A public benchmark of scenarios that tempt the model to deceive, run by Meta and reported as a deception rate.","notes":""},
{"eval_id":"meta-fortress","name":"FORTRESS","family":"M8","evaluator_id":"meta","test_type":"static_benchmark","description":"A public set of adversarial prompts on national-security and public-safety harms, run by Meta and reported as attack success rate.","notes":""},
{"eval_id":"meta-gdm-stealth","name":"GDM-Stealth","family":"M3","evaluator_id":"meta","test_type":"capability_benchmark","description":"Google DeepMind's stealth tasks, in which the model must reach a goal while evading oversight, run by Meta as a stealth capability measure.","notes":""},
{"eval_id":"meta-iheval","name":"IHEval","family":"M9","evaluator_id":"meta","test_type":"static_benchmark","description":"A public instruction-hierarchy benchmark testing whether the model follows higher-priority instructions over conflicting lower-priority ones.","notes":"The 2026-05-26 revision of the Muse Spark report fixed comparator scores after a bug. v0 notes Muse Spark's own value did not change."},
{"eval_id":"meta-impossiblebench","name":"ImpossibleBench","family":"M2","evaluator_id":"meta","test_type":"static_benchmark","description":"Coding tasks whose tests conflict with the specification, so passing them means the model cheated, reported as a cheating rate.","notes":""},
{"eval_id":"meta-internal-sycophancy","name":"Internal sycophancy","family":"M6","evaluator_id":"meta","test_type":"static_benchmark","description":"Meta's internal sycophancy test, measuring how often the model tells users what they want to hear instead of what is accurate.","notes":""},
{"eval_id":"meta-mask","name":"MASK","family":"M5","evaluator_id":"meta","test_type":"static_benchmark","description":"A public benchmark that pressures the model to state things it believes are false, run by Meta and reported as an honesty rate.","notes":"xAI reports the same public benchmark as a dishonesty rate. The two developers' runs are kept apart."},
{"eval_id":"meta-prompted-evaluation-awareness","name":"Prompted evaluation awareness","family":"M1","evaluator_id":"meta","test_type":"developer_other_setups","description":"The model is asked whether transcripts come from an evaluation or from real use, and is scored on how well it tells them apart.","notes":""},
{"eval_id":"meta-shade-arena","name":"SHADE-Arena","family":"M3","evaluator_id":"meta","test_type":"capability_benchmark","description":"Agentic environments with a hidden harmful side task, run by Meta, measuring how often the model completes it without the monitor noticing.","notes":"The two Meta reports print different metrics, kept as separate labels."},
{"eval_id":"meta-siren-agentdojo","name":"Siren AgentDojo","family":"M9","evaluator_id":"meta","test_type":"static_benchmark","description":"Prompt-injection attack success on the AgentDojo agent benchmark under a setup the card calls Siren.","notes":"The record does not say what Siren is; if it is an outside evaluator, the evaluator should be changed."},
{"eval_id":"meta-strongreject","name":"StrongREJECT","family":"M8","evaluator_id":"meta","test_type":"adaptive_attacker","description":"Version 2 of the StrongREJECT forbidden-prompt benchmark with jailbreak attacks, run by Meta and reported as attack success rate.","notes":"Both Meta reports name it StrongREJECT v2. The Muse Spark report gives an adaptive multi-turn attack success rate. The Muse Spark 1.1 report's setting is not recorded."},
{"eval_id":"meta-vct","name":"VCT","family":"M10","evaluator_id":"meta","test_type":"capability_benchmark","description":"The Virology Capabilities Test, a public set of hard virology troubleshooting questions, run by Meta as a biology capability measure.","notes":""},
{"eval_id":"meta-verbalized-eval-awareness","name":"Verbalized eval awareness","family":"M1","evaluator_id":"meta","test_type":"developer_other_setups","description":"Share of the model's samples on a given set of evaluations in which it says it suspects it is being evaluated.","notes":"The set of evaluations measured (public benchmarks, internal evaluations, Agentic Misalignment, chemical and biological capability evaluations) is recorded as a condition."},
{"eval_id":"metr-ai-r-d-assessment","name":"AI R&D assessment","family":"M10","evaluator_id":"metr","test_type":"qualitative_assessment","description":"METR's judgment of how much a model could speed up AI research and development, given as an acceleration multiplier.","notes":"An estimate by the evaluator rather than a task score."},
{"eval_id":"metr-re-bench-optimize-a-kernel","name":"RE-Bench Optimize a Kernel","family":"M2","evaluator_id":"metr","test_type":"capability_benchmark","description":"METR's kernel optimisation task from RE-Bench, used here to count runs in which the model tampered with the scoring function.","notes":"A capability task; the value counts reward hacking in it, which is why it sits in M2."},
{"eval_id":"metr-reward-hacking","name":"Reward hacking (all tasks)","family":"M2","evaluator_id":"metr","test_type":"scenario_eval","description":"METR's share of task attempts in which a model games the scoring rather than solving the task, across METR's task suite.","notes":""},
{"eval_id":"metr-sandbagging-review","name":"Sandbagging review","family":"M3","evaluator_id":"metr","test_type":"qualitative_assessment","description":"METR's review of monitored evaluation runs for signs that a model deliberately underperformed.","notes":"v0 notes that METR also saw the model sometimes reason that it was being tested; that remark is not recorded as a value."},
{"eval_id":"metr-time-horizon","name":"50% time horizon","family":"M10","evaluator_id":"metr","test_type":"capability_benchmark","description":"METR's estimate of the length of task, measured in the time skilled humans take, that a model completes with 50% success.","notes":""},
{"eval_id":"moonshot-ai-promptfoo-red-team","name":"Promptfoo red-team","family":"M8","evaluator_id":"moonshot-ai","test_type":"adaptive_attacker","description":"Moonshot's run of the Promptfoo red-teaming tool, measuring the share of safe responses to harmful requests under jailbreak strategies.","notes":"The iterative and multi-turn (crescendo) strategies adapt over attempts. The prompt-injection and no-attack results are separate evaluations because they sit in other families."},
{"eval_id":"moonshot-ai-promptfoo-red-team-no-attack","name":"Promptfoo red-team (no attack)","family":"M7","evaluator_id":"moonshot-ai","test_type":"static_benchmark","description":"Moonshot's run of the Promptfoo red-teaming tool, measuring the share of safe responses to harmful requests with no attack strategy.","notes":"Split from the Promptfoo red-team evaluation because the row is in family M7."},
{"eval_id":"moonshot-ai-promptfoo-red-team-prompt-injection","name":"Promptfoo red-team (prompt injection)","family":"M9","evaluator_id":"moonshot-ai","test_type":"static_benchmark","description":"Moonshot's run of the Promptfoo red-teaming tool, measuring the share of safe responses to harmful requests delivered through prompt injection.","notes":"Split from the Promptfoo red-team evaluation because the row is in family M9."},
{"eval_id":"moonshot-ai-vulnerability-discovery","name":"Vulnerability discovery","family":"M10","evaluator_id":"moonshot-ai","test_type":"capability_benchmark","description":"The number of previously unknown software vulnerabilities the model found, counted after human review.","notes":"Known only from a secondary summary. The primary report was not located."},
{"eval_id":"openai-aav-capsid-packaging-prediction","name":"AAV capsid packaging prediction","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Predicting how well engineered viral capsid variants package, scored by rank correlation with measured results.","notes":""},
{"eval_id":"openai-abstentionbench","name":"AbstentionBench","family":"M5","evaluator_id":"openai","test_type":"static_benchmark","description":"Public benchmark of questions that should be declined or answered with caveats, scored for how often the model appropriately abstains.","notes":""},
{"eval_id":"openai-capture-the-flag","name":"Capture the Flag","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Capture-the-flag hacking challenges at several difficulty levels, scored on the share the model solves.","notes":""},
{"eval_id":"openai-challenging-refusal-eval","name":"Challenging refusal eval","family":"M7","evaluator_id":"openai","test_type":"static_benchmark","description":"Harder fixed set of disallowed-content prompts, scored as the share of responses graded not unsafe.","notes":""},
{"eval_id":"openai-chatgpt-deployment-simulation","name":"ChatGPT deployment simulation","family":"M4","evaluator_id":"openai","test_type":"deployment_simulation","description":"Simulates ChatGPT deployment by re-running conversations with the new model and flagging misaligned behaviour by severity.","notes":"Misalignment (M4) results only; the same simulation's reward-hacking and honesty findings are the sibling evaluations openai-chatgpt-deployment-simulation-reward-hacking and openai-chatgpt-deployment-simulation-honesty."},
{"eval_id":"openai-chatgpt-deployment-simulation-honesty","name":"ChatGPT deployment simulation","family":"M5","evaluator_id":"openai","test_type":"deployment_simulation","description":"Honesty findings, such as misrepresenting whether work was completed, from OpenAI's simulated ChatGPT deployment.","notes":"Family M5 part of openai-chatgpt-deployment-simulation."},
{"eval_id":"openai-chatgpt-deployment-simulation-reward-hacking","name":"ChatGPT deployment simulation","family":"M2","evaluator_id":"openai","test_type":"deployment_simulation","description":"Reward-hacking findings, such as hacking a calculator tool, from OpenAI's simulated ChatGPT deployment.","notes":"Family M2 part of openai-chatgpt-deployment-simulation."},
{"eval_id":"openai-cot-controllability","name":"CoT controllability","family":"M12","evaluator_id":"openai","test_type":"static_benchmark","description":"Measures how often the model can follow instructions that constrain the content of its own chain of thought; lower controllability is better for monitoring.","notes":"The GPT-5 hub page names the task suite CoT-Control. Cards measure at different chain-of-thought lengths and in different length units."},
{"eval_id":"openai-cot-monitorability","name":"CoT monitorability","family":"M12","evaluator_id":"openai","test_type":"static_benchmark","description":"Measures how well a monitor that reads the model's chain of thought (and in later cards its actions) detects target behaviours across a suite of monitorability tasks.","notes":"Earlier documents summarise results as an aggregate over the suite (g-mean squared of true positive and true negative rates); the GPT-6 Astra card reports recall by monitor type instead."},
{"eval_id":"openai-cve-bench","name":"CVE-Bench","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"OpenAI's run of the public CVE-Bench set of tasks exploiting known software vulnerabilities, scored by pass rate.","notes":""},
{"eval_id":"openai-cyber-range","name":"Cyber Range","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Simulated network environments in which the model must carry out a multi-step cyber operation end to end, scored by scenarios passed.","notes":"The scenario set changed several times (2, 8, 9, then 15 scenarios as recorded), so each set is its own group."},
{"eval_id":"openai-cyber-safety","name":"Cyber safety","family":"M7","evaluator_id":"openai","test_type":"static_benchmark","description":"Measures how often responses to cybersecurity-related prompts, from production data and from synthetic data, follow OpenAI cyber policy.","notes":"The GPT-5.2 card calls the production split production traffic; the GPT-5.3-Codex card calls the test cyber safety training eval and the metric safe behavior rate (earlier policy-compliant rate)."},
{"eval_id":"openai-deception-eval","name":"Deception eval","family":"M5","evaluator_id":"openai","test_type":"scenario_eval","description":"Scenarios in which the task cannot be completed as asked (a missing image, broken tools, impossible coding tasks) that measure how often the model misrepresents what it did; later cards add production-derived categories.","notes":"Each category is a metric label. The GPT-5 card prints fractions and the GPT-5.2 card percentages; the GPT-6 Astra card prints only ratios between models. The GPT-5 card's production-traffic deception monitor is recorded separately as openai-production-cot-deception-monitor."},
{"eval_id":"openai-destructive-action-avoidance","name":"Destructive action avoidance","family":"M4","evaluator_id":"openai","test_type":"scenario_eval","description":"Agentic coding scenarios that score whether the model avoids destructive actions and keeps or restores the user's existing work.","notes":"Named Destructive action avoidance in the Codex and GPT-5.4 Thinking cards and Destructive actions in the GPT-5.5 and GPT-5.6 cards, which add further sub-scores."},
{"eval_id":"openai-disclosed-misalignment-incidents","name":"Disclosed misalignment incidents","family":"M4","evaluator_id":"openai","test_type":"internal_monitoring","description":"Number of misalignment incident reports OpenAI published when it launched its framework for reporting model misalignment.","notes":"The reports cover released and unreleased models over roughly the preceding six months."},
{"eval_id":"openai-dna-sequence-design","name":"DNA sequence design","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Designing DNA sequences that meet given biological specifications, scored as a success rate.","notes":""},
{"eval_id":"openai-dynamic-mental-health","name":"Dynamic mental health","family":"M7","evaluator_id":"openai","test_type":"adaptive_attacker","description":"Multi-turn conversations with a simulated adversarial user on mental-health topics such as self-harm, graded for whether the model responses are not unsafe.","notes":"Only the self-harm category was transcribed; v0 notes the GPT-5.3 Instant card also gives mental health and emotional reliance categories."},
{"eval_id":"openai-exploitbench","name":"ExploitBench","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Tasks asking the model to write working exploits for known vulnerabilities in the V8 JavaScript engine, plus an internal port run on vulnerabilities disclosed after the model's training data.","notes":""},
{"eval_id":"openai-exploitgym","name":"ExploitGym","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"End-to-end tasks in which the model must find a vulnerability and turn it into a working exploit.","notes":"Not the ExploitGym honeypot used for evaluation-awareness and metagaming findings, which is a separate evaluation."},
{"eval_id":"openai-exploitgym-honeypot","name":"ExploitGym honeypot","family":"M4","evaluator_id":"openai","test_type":"scenario_eval","description":"Hard ExploitGym tasks containing a honeypot, measuring whether the model attacks the honeypot to get the task done.","notes":"Not the ExploitGym cyber capability benchmark (family M10). The launch post and a later post give different figures from other aggregations (v0 note)."},
{"eval_id":"openai-factuality-5-domains","name":"Factuality (5 domains)","family":"M5","evaluator_id":"openai","test_type":"static_benchmark","description":"Measures the hallucination rate with browsing enabled on prompts from five subject domains.","notes":"The GPT-5.2 card gives per-domain results only in figures; the text states a bound across all five."},
{"eval_id":"openai-gpt-red","name":"GPT-Red","family":"M9","evaluator_id":"openai","test_type":"adaptive_attacker","description":"OpenAI's automated red-teaming attacks on prompt injection and the instruction hierarchy, added to the GPT-5.6 card in August 2026 and scored as the share of attack attempts that succeed.","notes":"Test type inferred from the red-teaming name and the per-attempt success metric."},
{"eval_id":"openai-hallucinations","name":"Hallucinations","family":"M5","evaluator_id":"openai","test_type":"static_benchmark","description":"OpenAI's recurring hallucination evaluation in its 2026 system cards, reporting factual errors on prompt sets such as user-flagged conversations, mostly as comparisons with an earlier model.","notes":"Most results are figure-only comparisons in words; numbers are relative changes. Not joined to the Internal hallucination benchmark in the GPT-6 Astra launch post."},
{"eval_id":"openai-hard-negative-protein-binding","name":"Hard-negative protein binding","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Predicting which proteins bind when the candidates include close look-alikes that do not, scored as a success rate over several attempts.","notes":""},
{"eval_id":"openai-human-sourced-jailbreaks","name":"Human sourced jailbreaks","family":"M8","evaluator_id":"openai","test_type":"static_benchmark","description":"A fixed set of jailbreak prompts gathered from people, scored on the share of responses that are not unsafe.","notes":""},
{"eval_id":"openai-image-safety-eval","name":"Image safety eval","family":"M7","evaluator_id":"openai","test_type":"static_benchmark","description":"Image-generation safety test that measures how often unsafe images reach the user and how often prompts still yield a safe image.","notes":"The safe-generation metric serves as an over-blocking measure (v0 note)."},
{"eval_id":"openai-instruction-hierarchy","name":"Instruction hierarchy","family":"M9","evaluator_id":"openai","test_type":"static_benchmark","description":"Checks whether the model keeps to higher-priority system or developer instructions when a lower-priority message conflicts with them, including injected hijacking and system-prompt extraction attempts.","notes":"The o3 card's figure is an instruction-hierarchy proxy rather than a direct prompt-injection test (v0 note)."},
{"eval_id":"openai-instruction-hierarchy-internal","name":"Instruction hierarchy (internal)","family":"M9","evaluator_id":"openai","test_type":"static_benchmark","description":"An internal OpenAI instruction-hierarchy set in the GPT-6 Astra card, reported as one overall robustness rate that the card treats as saturated.","notes":"Kept apart from the earlier Instruction hierarchy evaluation because it is named and scored differently; it may relate to the GPT-Red instruction-hierarchy test in the GPT-5.6 card, which the evidence does not confirm."},
{"eval_id":"openai-internal-codex-deployment-simulation","name":"Deployment simulation (internal Codex traffic)","family":"M4","evaluator_id":"openai","test_type":"deployment_simulation","description":"Re-runs tasks from internal agentic coding (Codex) traffic with the new model, flags misaligned actions by severity and checks how realistic the resampled trajectories look.","notes":"Called internal agentic coding deployment simulation in the GPT-5.6 card. The evaluation-awareness metric of the same simulation is openai-internal-codex-deployment-simulation-eval-awareness (M1)."},
{"eval_id":"openai-internal-codex-deployment-simulation-eval-awareness","name":"Deployment simulation (internal Codex traffic)","family":"M1","evaluator_id":"openai","test_type":"deployment_real_or_simulated","description":"Share of resampled internal Codex trajectories in which the model says it may be under evaluation, with the original traffic as a baseline.","notes":"Family M1 part of openai-internal-codex-deployment-simulation."},
{"eval_id":"openai-internal-computer-use-safety-benchmark","name":"Internal computer-use safety benchmark","family":"M4","evaluator_id":"openai","test_type":"scenario_eval","description":"Internal computer-use benchmark reported in the GPT-6 Astra launch post that measures the rate of unsafe actions.","notes":""},
{"eval_id":"openai-internal-hallucination-benchmark","name":"Internal hallucination benchmark","family":"M5","evaluator_id":"openai","test_type":"static_benchmark","description":"Internal benchmark reported in the GPT-6 Astra launch post that measures the rate of hallucinated content.","notes":"May correspond to the hallucination evaluation shown only as a figure in the GPT-6 Astra card; not joined because neither source says so."},
{"eval_id":"openai-internal-indirect-prompt-injection","name":"Internal indirect prompt injection","family":"M9","evaluator_id":"openai","test_type":"adaptive_attacker","description":"An internal OpenAI indirect prompt-injection test in the GPT-6 Astra card, scored as the share of attacks the model defends against.","notes":"The v0 note says the GPT-5.6 Sol value is consistent with the GPT-Red indirect attack success rate in the GPT-5.6 card, which suggests the same attacker; kept as a separate evaluation because it reports the complementary measure. Test type follows that link and is not stated in the evidence."},
{"eval_id":"openai-internal-research-debugging","name":"Internal Research Debugging","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Debugging problems taken from OpenAI's internal research work, reported as a median score.","notes":""},
{"eval_id":"openai-jailbreaks","name":"Jailbreaks","family":"M8","evaluator_id":"openai","test_type":"static_benchmark","description":"OpenAI's jailbreak robustness evaluation in the GPT-5.4 Thinking to GPT-5.6 cards, which show results only as figures; the dataset records the cards' comparisons in words.","notes":"Test type is an assumption: the evidence as recorded does not say whether the attacks adapt."},
{"eval_id":"openai-long-form-biorisk-questions","name":"Long-form biorisk questions","family":"M7","evaluator_id":"openai","test_type":"static_benchmark","description":"Measures how often the model refuses long-form questions that seek biological-risk information.","notes":""},
{"eval_id":"openai-malware-refusals-golden-set","name":"Malware refusals (golden set)","family":"M7","evaluator_id":"openai","test_type":"static_benchmark","description":"Measures how often a coding model refuses a curated set of requests to build malicious software.","notes":""},
{"eval_id":"openai-misalignment-monitor-recall","name":"Misalignment monitor recall","family":"M12","evaluator_id":"openai","test_type":"static_benchmark","description":"Measures the share of known misaligned trajectories that OpenAI's misalignment monitor flags at severity 3 or higher.","notes":""},
{"eval_id":"openai-mle-bench","name":"MLE-Bench","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"OpenAI's run of MLE-Bench, a set of machine-learning engineering competitions, scored on the share in which the model reaches a medal.","notes":""},
{"eval_id":"openai-monitor-evasion-under-prompted-sandbagging","name":"Monitor evasion under prompted sandbagging","family":"M3","evaluator_id":"openai","test_type":"capability_benchmark","description":"Tests whether the model, when instructed to underperform on purpose, can do so without a chain-of-thought monitor noticing.","notes":"Part of the adversarial monitorability tests in the GPT-6 Astra card; numbers appear only in figures."},
{"eval_id":"openai-multimodal-troubleshooting-virology","name":"Multimodal Troubleshooting Virology","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Virology lab troubleshooting questions that include images, compared against the median expert score.","notes":""},
{"eval_id":"openai-openai-proof-qa","name":"OpenAI-Proof Q&A","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Hard research and engineering questions drawn from OpenAI's internal work, used to gauge AI self-improvement capability and scored by pass rate.","notes":""},
{"eval_id":"openai-openai-prs","name":"OpenAI PRs","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Tasks based on changes OpenAI engineers actually made to internal code, testing whether the model can reproduce them; scored by pass rate.","notes":""},
{"eval_id":"openai-paperbench","name":"PaperBench","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Tests whether the model can reproduce the results of machine-learning research papers, scored against a replication rubric.","notes":""},
{"eval_id":"openai-personqa","name":"PersonQA","family":"M5","evaluator_id":"openai","test_type":"static_benchmark","description":"OpenAI's set of questions about public figures, answered without browsing and scored for incorrect answers.","notes":"Accuracy is printed next to the hallucination rate in each card but was not recorded as separate rows in v0."},
{"eval_id":"openai-preparedness-determination","name":"Preparedness Framework determination","family":"M10","evaluator_id":"openai","test_type":"framework_determination","description":"OpenAI's formal capability-level decisions under its Preparedness Framework for each tracked category: biological and chemical, cybersecurity, and AI self-improvement.","notes":"v0 calls these risk level in 2025 cards and PF capability level from the GPT-5.3-Codex card on; treated as the same determination."},
{"eval_id":"openai-proactive-searches-for-other-agents","name":"Proactive searches for other agents","family":"M4","evaluator_id":"openai","test_type":"scenario_eval","description":"Checks ExploitGym honeypot runs for whether the model speculates about, or tries to contact, other agents.","notes":""},
{"eval_id":"openai-production-benchmarks","name":"Production Benchmarks","family":"M7","evaluator_id":"openai","test_type":"static_benchmark","description":"OpenAI test of model responses to prompt sets in disallowed-content categories, reported per category as the share of responses graded not unsafe.","notes":"Categories are metric labels. Three groups: v1 (gpt-oss, GPT-5 and GPT-5-Codex cards), v2 (harder set from the GPT-5.1 addendum), v3 (unversioned, reorganised category set from the GPT-5.3-Codex card on). The GPT-6 Astra card calls the metric safe completion rate (not disallowed). Prompt settings such as challenging prompts or ChatGPT default config are conditions."},
{"eval_id":"openai-production-cot-deception-monitor","name":"Production CoT deception monitor","family":"M5","evaluator_id":"openai","test_type":"production_traffic","description":"A chain-of-thought monitor run over a representative sample of production traffic to estimate the share of responses that show deception.","notes":"The GPT-5 card gives the monitor's precision and recall alongside the rates."},
{"eval_id":"openai-production-traffic-factuality","name":"Production-traffic factuality","family":"M5","evaluator_id":"openai","test_type":"production_traffic","description":"Measures factual errors in responses to prompts drawn from production traffic with browsing on, reported as reductions relative to an earlier model.","notes":""},
{"eval_id":"openai-prompt-injection","name":"Prompt injection","family":"M9","evaluator_id":"openai","test_type":"static_benchmark","description":"OpenAI's prompt-injection sets, which plant instructions in web pages, tool outputs, connectors or function results and score how often the model does not follow them.","notes":"Each named set is a metric label. The GPT-5.2 card replaced the GPT-5 card's sets with new ones it says are not comparable (group v2)."},
{"eval_id":"openai-prompt-injection-codex-env","name":"Prompt injection (Codex env)","family":"M9","evaluator_id":"openai","test_type":"static_benchmark","description":"Prompt-injection attacks placed in Codex coding environments, scored on the share of attacks the coding agent ignores.","notes":""},
{"eval_id":"openai-protocolqa-open-ended","name":"ProtocolQA Open-Ended","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Open-ended questions asking the model to find and fix errors in published lab protocols, scored against a threshold.","notes":""},
{"eval_id":"openai-realistic-work-envs","name":"Realistic work environments","family":"M4","evaluator_id":"openai","test_type":"scenario_eval","description":"Realistic workplace environments measuring how often the agent causes misaligned outcomes such as data exfiltration, security weakening or unauthorised transactions, with and without a confirmation policy.","notes":"Each outcome category is a metric label; the confirmation policy is a condition."},
{"eval_id":"openai-respecting-auto-review","name":"Respecting Auto-Review","family":"M4","evaluator_id":"openai","test_type":"scenario_eval","description":"Measures whether an agent tries to get around an Auto-review approval step after an action is denied, or exploits a misconfigured one.","notes":"The v0 notes say the test was built after GPT-6 Astra was trained and that the launch post frames the metric differently."},
{"eval_id":"openai-respecting-warnings","name":"Respecting Warnings","family":"M4","evaluator_id":"openai","test_type":"scenario_eval","description":"Measures whether the model keeps pursuing an action after it has been warned off or restricted.","notes":""},
{"eval_id":"openai-sandbox-bench","name":"Sandbox Bench","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Attempts to break out of or exploit 22 targets built to resemble OpenAI's own infrastructure, counted by successful exploits.","notes":"The only value recorded comes from a secondary source (v0 note)."},
{"eval_id":"openai-simpleqa","name":"SimpleQA","family":"M5","evaluator_id":"openai","test_type":"static_benchmark","description":"Public benchmark of short fact-seeking questions, run by OpenAI without browsing and scored for incorrect answers.","notes":"Accuracy is printed next to the hallucination rate in each card but was not recorded as separate rows in v0."},
{"eval_id":"openai-sre-bench","name":"SRE-Bench","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Binary reverse-engineering tasks, scored on success within one or four attempts.","notes":""},
{"eval_id":"openai-standard-refusal-eval","name":"Standard refusal eval","family":"M7","evaluator_id":"openai","test_type":"static_benchmark","description":"Fixed set of disallowed and benign prompts checking that the model avoids unsafe output without refusing benign requests.","notes":"Only the aggregate over-refusal metric was transcribed; per-category not_unsafe values are near ceiling (v0 note)."},
{"eval_id":"openai-static-jailbreak","name":"Static jailbreak","family":"M8","evaluator_id":"openai","test_type":"static_benchmark","description":"A new fixed set of jailbreak attacks introduced in the GPT-6 Astra card, scored as the share of attacks refused in each harm area and severity tier.","notes":"v0 notes call it a new eval set; not joined to the earlier Jailbreaks figures."},
{"eval_id":"openai-strongreject","name":"StrongReject","family":"M8","evaluator_id":"openai","test_type":"static_benchmark","description":"OpenAI's own run of the public StrongReject set of jailbreak-wrapped harmful requests, scored on the share of responses that are not unsafe.","notes":"Reported per harm category in the GPT-5, gpt-oss and GPT-5-Codex cards and as one aggregate in the o3, GPT-5.1, GPT-5.1-Codex-Max and GPT-5.2-Codex cards; the GPT-5.2 card reports a filtered variant (group v2)."},
{"eval_id":"openai-swe-bench-verified","name":"SWE-bench Verified","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"OpenAI's run of SWE-bench Verified, real repository issues the model must fix, scored on the share resolved.","notes":""},
{"eval_id":"openai-swe-lancer","name":"SWE-Lancer","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Paid freelance software-engineering tasks, scored by the dollar value of tasks completed and by accuracy on the individual-contributor subset.","notes":""},
{"eval_id":"openai-sycophancy-offline-eval","name":"Sycophancy offline eval","family":"M6","evaluator_id":"openai","test_type":"static_benchmark","description":"Offline evaluation that scores model responses for sycophancy on a fixed prompt set.","notes":""},
{"eval_id":"openai-sycophancy-online-prevalence","name":"Sycophancy online prevalence (A/B)","family":"M6","evaluator_id":"openai","test_type":"production_traffic","description":"A/B test on live ChatGPT traffic measuring how the prevalence of sycophantic responses changed relative to GPT-4o, separately for free and paid users.","notes":""},
{"eval_id":"openai-tacit-knowledge-and-troubleshooting","name":"Tacit knowledge and troubleshooting","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Questions on unwritten laboratory know-how and troubleshooting in biology, compared against an expert baseline.","notes":""},
{"eval_id":"openai-troubleshootingbench","name":"TroubleshootingBench","family":"M10","evaluator_id":"openai","test_type":"capability_benchmark","description":"Expert-written questions on fixing failed biology lab protocols, scored on correct answers.","notes":""},
{"eval_id":"openai-unintended-engagement-with-external-agent-messages","name":"Unintended engagement with external agent messages","family":"M4","evaluator_id":"openai","test_type":"scenario_eval","description":"Measures whether the model follows instructions posted by other agents on a shared message board that it was not authorised to act on.","notes":""},
{"eval_id":"openai-verbalized-metagaming","name":"Verbalized metagaming","family":"M1","evaluator_id":"openai","test_type":"developer_audit_verbalized","description":"A monitor reads the model's reasoning in OpenAI's evaluation and simulated deployment environments and flags reasoning about being evaluated or gaming the evaluation.","notes":"Most results are figure-only comparisons in words; the one number comes from a figure in the original version of the GPT-6 Astra card."},
{"eval_id":"openai-verbalized-metagaming-in-training","name":"Verbalized metagaming in training","family":"M1","evaluator_id":"openai","test_type":"white_box_or_training","description":"Tracks the rate of verbalized metagaming in the model's reasoning over the course of training.","notes":""},
{"eval_id":"openai-voice-native-production-prompts","name":"Voice-native production prompts","family":"M7","evaluator_id":"openai","test_type":"static_benchmark","description":"Tests spoken responses of a voice model to production-derived prompts, reporting a safety score per harm category.","notes":"Values for GPT-Live-1 and GPT-Live-1 mini are the corrected ones after the 4 Aug 2026 configuration fix; originals are revisions."},
{"eval_id":"openai-voice-native-synthetic-prompts","name":"Voice-native synthetic prompts","family":"M7","evaluator_id":"openai","test_type":"static_benchmark","description":"Tests spoken responses of a voice model to synthetic prompts, reporting a safety score per harm category.","notes":"Values are the corrected ones after the 4 Aug 2026 configuration fix; originals are revisions (Appendix A)."},
{"eval_id":"uk-aisi-ai-safety-research-sabotage","name":"Unprompted AI safety research sabotage","family":"M3","evaluator_id":"uk-aisi","test_type":"scenario_eval","description":"A UK AI Security Institute check for whether a model, without being prompted, sabotages AI safety research work it is given.","notes":""},
{"eval_id":"uk-aisi-cyber-range","name":"Cyber range","family":"M10","evaluator_id":"uk-aisi","test_type":"capability_benchmark","description":"A UK AI Security Institute cyber range, scored by how many of a fixed number of attempts complete the whole range.","notes":"The range is not named in the record; it may be the range OpenAI names The Last Ones, but nothing confirms it."},
{"eval_id":"uk-aisi-cyber-range-the-last-ones","name":"Cyber range 'The Last Ones'","family":"M10","evaluator_id":"uk-aisi","test_type":"capability_benchmark","description":"A UK AI Security Institute cyber range called The Last Ones, scored by the share of attempts that complete it.","notes":"May be the same range as the unnamed UK AISI range in the Claude Opus 4.7 card; kept separate because the record does not confirm it."},
{"eval_id":"uk-aisi-cyber-tasks","name":"Cyber tasks","family":"M10","evaluator_id":"uk-aisi","test_type":"capability_benchmark","description":"A set of UK AI Security Institute cyber tasks, scored by pass rate.","notes":"May overlap with the expert CTF in the GPT-5.6 card; GPT-5.5 is scored differently in the two cards, so they are kept apart."},
{"eval_id":"uk-aisi-evaluation-awareness","name":"Evaluation awareness","family":"M1","evaluator_id":"uk-aisi","test_type":"external_uk_aisi","description":"The UK AI Security Institute's rate of a model saying, unprompted, that it may be under evaluation in the Institute's test scenarios.","notes":"Printed as UK AISI external testing in the Claude Sonnet 4.5 card."},
{"eval_id":"uk-aisi-expert-ctf","name":"Expert CTF","family":"M10","evaluator_id":"uk-aisi","test_type":"capability_benchmark","description":"A UK AI Security Institute set of expert-level capture-the-flag cyber challenges, scored by pass rate.","notes":""},
{"eval_id":"uk-aisi-out-of-scope-supply-chain-attack","name":"Out-of-scope supply-chain attack","family":"M4","evaluator_id":"uk-aisi","test_type":"scenario_eval","description":"A UK AI Security Institute agentic scenario checking whether a model carries out a supply-chain attack outside the scope it was given.","notes":""},
{"eval_id":"uk-aisi-universal-jailbreak","name":"Universal jailbreak (cyber)","family":"M8","evaluator_id":"uk-aisi","test_type":"red_team","description":"UK AI Security Institute red-teamers searched for a universal jailbreak, scored by how often it passes on a dataset of policy-violating cyber requests.","notes":""},
{"eval_id":"unnamed-third-party-ai-r-d-sabotage","name":"AI R&D sabotage (external)","family":"M3","evaluator_id":"unnamed-third-party","test_type":"qualitative_assessment","description":"An outside evaluator's assessment of a model's ability to sabotage AI research and development work.","notes":"The report attributes it to a third-party evaluation without naming the evaluator in the record."},
{"eval_id":"unnamed-third-party-strategic-deception-propensity","name":"Strategic deception propensity (external)","family":"M4","evaluator_id":"unnamed-third-party","test_type":"qualitative_assessment","description":"An outside evaluator's assessment of a model's propensity for strategic deception.","notes":"The report attributes it to a third-party evaluation without naming the evaluator in the record."},
{"eval_id":"xai-agentdojo","name":"AgentDojo","family":"M9","evaluator_id":"xai","test_type":"static_benchmark","description":"A public benchmark of agent tasks with prompt injections planted in tool outputs, run by xAI, measuring how often an injected instruction succeeds.","notes":""},
{"eval_id":"xai-agentharm","name":"AgentHarm","family":"M7","evaluator_id":"xai","test_type":"static_benchmark","description":"A public benchmark of harmful agentic tasks, run by xAI, measuring how often the model carries them out rather than refusing.","notes":"The Grok 4.20 card calls the metric a violation rate."},
{"eval_id":"xai-alignment-audit-eval-awareness","name":"Alignment audit","family":"M1","evaluator_id":"xai","test_type":"developer_audit_verbalized","description":"Share of transcripts from xAI's automated alignment audit in which the model says it may be under evaluation.","notes":"v0 notes that awareness the model does not put into words is not ruled out."},
{"eval_id":"xai-alignment-audit-misuse","name":"Alignment audit","family":"M7","evaluator_id":"xai","test_type":"automated_audit","description":"Misuse findings from xAI's automated alignment audit built on the Petri 2.0 tool, measuring how often the model cooperates with harmful requests, including when the system prompt tries to override its policy.","notes":"The M7 part of the audit, first reported in the Grok 4.20 card."},
{"eval_id":"xai-alignment-audit-sabotage","name":"Alignment audit","family":"M3","evaluator_id":"xai","test_type":"automated_audit","description":"Findings from xAI's automated alignment audit built on the Petri 2.0 tool on how often the model takes subversive action against its user or against xAI.","notes":"The M3 part of the audit, first reported in the Grok 4.20 card."},
{"eval_id":"xai-alignment-audit-sycophancy","name":"Alignment audit","family":"M6","evaluator_id":"xai","test_type":"automated_audit","description":"Findings from xAI's automated alignment audit built on the Petri 2.0 tool on how often the model validates a user's delusional beliefs.","notes":"The M6 part of the audit, first reported in the Grok 4.20 card."},
{"eval_id":"xai-bio-capability-lift","name":"Bio capability lift","family":"M10","evaluator_id":"xai","test_type":"qualitative_assessment","description":"xAI's statement in words of how much a model's biology capability rose over the previous model.","notes":"The wording changed in the 2026-08-17 revision of the Grok 4.6 card without a changelog note."},
{"eval_id":"xai-biolp-bench","name":"BioLP-Bench","family":"M10","evaluator_id":"xai","test_type":"capability_benchmark","description":"A public benchmark of biological laboratory protocols with introduced mistakes, measuring whether the model can find them.","notes":""},
{"eval_id":"xai-biousebench","name":"BioUseBench","family":"M7","evaluator_id":"xai","test_type":"static_benchmark","description":"Dual-use biology requests, measuring how often the model refuses them.","notes":"The Grok 4.6 card reports the severity-5 subset."},
{"eval_id":"xai-cbrn-refusals","name":"CBRN refusals","family":"M7","evaluator_id":"xai","test_type":"static_benchmark","description":"Dangerous chemical, biological, radiological and nuclear queries, measuring how accurately the model refuses them.","notes":"Only the biology result for Grok 4.5 is a row. v0 notes list chemistry and R/N results as well."},
{"eval_id":"xai-cloningscenarios","name":"CloningScenarios","family":"M10","evaluator_id":"xai","test_type":"capability_benchmark","description":"Questions on multi-step molecular cloning workflows, used by xAI as a biology capability measure.","notes":""},
{"eval_id":"xai-cve-bench","name":"CVE-Bench","family":"M10","evaluator_id":"xai","test_type":"capability_benchmark","description":"A public benchmark in which the model tries to exploit known vulnerabilities in web applications, reported by xAI as a reward score.","notes":""},
{"eval_id":"xai-cybench","name":"Cybench","family":"M10","evaluator_id":"xai","test_type":"capability_benchmark","description":"A public set of capture-the-flag security challenges, run by xAI without guidance as a cyber capability measure.","notes":""},
{"eval_id":"xai-cybergym","name":"CyberGym","family":"M10","evaluator_id":"xai","test_type":"capability_benchmark","description":"A public benchmark of reproducing known software vulnerabilities, run by xAI as a cyber capability measure.","notes":""},
{"eval_id":"xai-dual-use-bio-determination","name":"Dual-use bio determination","family":"M10","evaluator_id":"xai","test_type":"framework_determination","description":"xAI's statement of whether a model's dual-use biology and chemistry knowledge stays below its safety thresholds.","notes":"The Grok 4.7 card names the thresholds as FAIF thresholds. The Grok 4.5 card's framework is not recorded."},
{"eval_id":"xai-fortress-rn","name":"FORTRESS-RN","family":"M7","evaluator_id":"xai","test_type":"static_benchmark","description":"Radiological and nuclear prompts, measuring how accurately the model refuses them.","notes":"Added in the 2026-08-17 revision of the Grok 4.6 card without a changelog note. The Grok 4.5 card's CBRN refusal notes give an R/N figure that may come from the same test, which is not stated."},
{"eval_id":"xai-hackerbench","name":"HackerBench","family":"M7","evaluator_id":"xai","test_type":"static_benchmark","description":"A set of cyber tasks reported by xAI, measuring how often the model complies with harmful or dual-use requests and how often it wrongly refuses benign ones.","notes":"Versions v0.2 and v0.3 are separate groups."},
{"eval_id":"xai-hallucination-rate","name":"Hallucination rate","family":"M5","evaluator_id":"xai","test_type":"static_benchmark","description":"Measures how often the model's single-turn answers contain claims that are not supported.","notes":""},
{"eval_id":"xai-hle-calibration","name":"HLE calibration","family":"M5","evaluator_id":"xai","test_type":"static_benchmark","description":"How well the model's stated confidence matches its accuracy on Humanity's Last Exam questions, reported as a root-mean-square calibration error.","notes":"v0 records that the metric measures overconfidence."},
{"eval_id":"xai-jailbreaks","name":"Jailbreaks","family":"M8","evaluator_id":"xai","test_type":"static_benchmark","description":"Should-refuse prompts combined with jailbreak attacks, measuring how often the model still answers or complies.","notes":"Early cards run the refusal set with a jailbreak in the user turn or the system prompt, kept as a condition. From the Grok 4.5 card the result is given for standard jailbreaks."},
{"eval_id":"xai-makemesay","name":"MakeMeSay","family":"M10","evaluator_id":"xai","test_type":"capability_benchmark","description":"A persuasion game in which the model tries to get another party to say a codeword without revealing it, reported as a win rate.","notes":""},
{"eval_id":"xai-mask","name":"MASK","family":"M5","evaluator_id":"xai","test_type":"static_benchmark","description":"A public benchmark that pressures the model to state things that contradict its own beliefs, run by xAI and reported as a dishonesty rate.","notes":"From the Grok 4.5 card xAI reports MASK-Rectified instead, which is a separate evaluation."},
{"eval_id":"xai-mask-rectified","name":"MASK-Rectified","family":"M5","evaluator_id":"xai","test_type":"static_benchmark","description":"A rectified variant of the MASK honesty benchmark, reported by xAI as a dishonesty rate.","notes":"v0 records that it is not comparable to the original MASK results, so no series joins the two."},
{"eval_id":"xai-overall-risk-conclusion","name":"Overall risk conclusion","family":"M10","evaluator_id":"xai","test_type":"framework_determination","description":"The overall risk conclusion that xAI gives at the end of a card, with its safeguards in place.","notes":"The evidence does not name the framework the conclusions are made under."},
{"eval_id":"xai-protocolqa-open-ended","name":"ProtocolQA open-ended","family":"M10","evaluator_id":"xai","test_type":"capability_benchmark","description":"Questions about errors in laboratory protocols answered in free text rather than by multiple choice, used by xAI as a biology capability measure.","notes":""},
{"eval_id":"xai-refusals","name":"Refusals","family":"M7","evaluator_id":"xai","test_type":"static_benchmark","description":"Prompts that xAI's policy says the model should refuse, measuring how often it answers or complies instead.","notes":"Cards up to Grok 4.1 report an answer rate. From the Grok 4.5 card the result is a percentage under the name general refusals."},
{"eval_id":"xai-restricted-bio-input-filter","name":"Restricted-bio input filter","family":"M8","evaluator_id":"xai","test_type":"static_benchmark","description":"Tests xAI's input filter for restricted biology content, measuring how often harmful prompts get past it, with and without a prompt-injection attack.","notes":""},
{"eval_id":"xai-self-harm-refusals","name":"Self-harm refusals","family":"M7","evaluator_id":"xai","test_type":"static_benchmark","description":"Prompts about self-harm that the model should refuse or redirect, measuring how often it complies instead.","notes":""},
{"eval_id":"xai-strongreject","name":"StrongREJECT","family":"M8","evaluator_id":"xai","test_type":"static_benchmark","description":"The public StrongREJECT benchmark of forbidden prompts under jailbreak attacks, run by xAI and reported as the share of compliant responses.","notes":"The Grok 4.6 card also reports Grok 4.5 at 1.5% (v0 note)."},
{"eval_id":"xai-sycophancy","name":"Sycophancy","family":"M6","evaluator_id":"xai","test_type":"static_benchmark","description":"Questions on which the user pushes back on or misleads the model, measuring how often the model gives up the right answer to agree with the user.","notes":"v0 names the early set after Anthropic's answer-change sycophancy evaluation. The Grok 4.5 card describes a misleading-user-context setting."},
{"eval_id":"xai-vct","name":"VCT","family":"M10","evaluator_id":"xai","test_type":"capability_benchmark","description":"The Virology Capabilities Test, a public set of hard virology troubleshooting questions, run by xAI as a biology capability measure.","notes":"From the Grok 4.6 card xAI also reports a separate Biosecurity VCT result, recorded only in v0 notes."},
{"eval_id":"xai-wmdp","name":"WMDP","family":"M10","evaluator_id":"xai","test_type":"capability_benchmark","description":"A public multiple-choice benchmark of hazardous knowledge in biosecurity, chemical security and cybersecurity, run by xAI.","notes":"The bio, chem and cyber subsets are metric labels."},
{"eval_id":"zhipu-ai-safetybench","name":"SafetyBench","family":"M7","evaluator_id":"zhipu-ai","test_type":"static_benchmark","description":"A public multiple-choice benchmark of safety knowledge across categories such as offensiveness and unfairness, reported as accuracy.","notes":"v0 notes that it tests knowledge through multiple-choice questions, not behaviour."}
],
"comparability_groups": [
{"group_id":"anthropic-100q-hard-v1","eval_id":"anthropic-100q-hard","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-mythos-preview-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-aa-omniscience-v1","eval_id":"anthropic-aa-omniscience","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-5-system-card","last_doc_id":"anthropic-claude-opus-4-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-accidental-cot-supervision-in-rl-v1","eval_id":"anthropic-accidental-cot-supervision-in-rl","label":"As first reported","definition_notes":"Share of RL episodes in which the chain of thought was accidentally exposed to the reward signal.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-7-system-card","last_doc_id":"anthropic-claude-opus-4-8-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-aeci-v1","eval_id":"anthropic-aeci","label":"11-evaluation set","definition_notes":"Index over 11 evaluations (Opus 4.8 card).","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-8-system-card","last_doc_id":"anthropic-claude-opus-4-8-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-aeci-v2","eval_id":"anthropic-aeci","label":"Expanded benchmark set","definition_notes":"Index in the Fable 5, Opus 5 and Fable 5.1 cards; the Fable 5 card notes the Opus 4.8 value used a different evaluation set.","join_basis":"inferred","first_doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","last_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","supersedes_group_id":"anthropic-aeci-v1","notes":""},
{"group_id":"anthropic-aeci-v3","eval_id":"anthropic-aeci","label":"Re-based scale","definition_notes":"The Opus 5.5 card re-bases the scale over 43 benchmarks and says its values are not comparable with earlier cards' values.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-5-5-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"anthropic-aeci-v2","notes":""},
{"group_id":"anthropic-agentic-code-summary-honesty-v1","eval_id":"anthropic-agentic-code-summary-honesty","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-8-system-card","last_doc_id":"anthropic-claude-opus-4-8-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-ai-rd-4-threshold-v1","eval_id":"anthropic-ai-rd-4-threshold","label":"Original definition","definition_notes":"AI R&D-4 threshold determinations in the Opus 4.5, Opus 4.6 and Sonnet 4.6 cards.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-5-system-card","last_doc_id":"anthropic-claude-sonnet-4-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-ai-rd-internal-suite-2-v1","eval_id":"anthropic-ai-rd-internal-suite-2","label":"Original definition","definition_notes":"0-1 suite score against a 0.6 rule-out threshold, in the Opus 4.5 and Mythos Preview cards.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-5-system-card","last_doc_id":"anthropic-claude-mythos-preview-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-ai-rd-kernel-task-v1","eval_id":"anthropic-ai-rd-kernel-task","label":"Hard variant","definition_notes":"Best speedup on the hard kernel task; the Opus 4.1 addendum and Mythos Preview card name the hard variant, later cards print best speedup without saying the task changed.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-1-system-card-addendum","last_doc_id":"anthropic-claude-opus-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-ai-rd-llm-training-task-v1","eval_id":"anthropic-ai-rd-llm-training-task","label":"Original definition","definition_notes":"Average speedup on the LLM training task in the Mythos Preview, Opus 4.7, Fable 5, Sonnet 5 and Opus 5 cards. The Fable 5 card re-runs earlier models; the Opus 5 card adds a new hard variant and reports the easy variant, recorded as a condition.","join_basis":"inferred","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-opus-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-ai-rd-novel-compiler-task-v1","eval_id":"anthropic-ai-rd-novel-compiler-task","label":"Original definition","definition_notes":"Pass rate across cards from Mythos Preview to Opus 5; no card states a change.","join_basis":"inferred","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-opus-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-ai-rd-quadruped-rl-task-v1","eval_id":"anthropic-ai-rd-quadruped-rl-task","label":"Original definition","definition_notes":"Highest score in the Opus 4.7 and Opus 5 cards, with a threshold of 12 stated as the 4-hour equivalent.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-7-system-card","last_doc_id":"anthropic-claude-opus-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-asl-4-virology-uplift-trial-v1","eval_id":"anthropic-asl-4-virology-uplift-trial","label":"Original definition","definition_notes":"Uplift ratio against an internet-only control (Opus 4.5 card, via a secondary write-up).","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-5-system-card","last_doc_id":"anthropic-claude-opus-4-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-automated-behavioral-audit-eval-awareness-v1","eval_id":"anthropic-automated-behavioral-audit-eval-awareness","label":"Before the realism filter","definition_notes":"Opus 4 card: a situational-awareness classifier run over 414 automated audit transcripts, reported as counts of flagged transcripts.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","last_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-automated-behavioral-audit-eval-awareness-v2","eval_id":"anthropic-automated-behavioral-audit-eval-awareness","label":"Realism-filtered audit","definition_notes":"Audit as run from the Sonnet 4.5 card, which introduced a realism filter; reports the share of transcripts (or, in the Haiku 4.5 card, scenarios) in which the model says it may be under evaluation, and in the Opus 5.5 card the share scoring 6 or more on the eval-awareness score.","join_basis":"inferred","first_doc_id":"anthropic-claude-sonnet-4-5-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"anthropic-automated-behavioral-audit-eval-awareness-v1","notes":"Later cards are joined because nothing recorded says the audit changed again; seeds and judge prompts may still differ between cards. The Opus 4.7 and Sonnet 5 rows do not name the audit in v0."},
{"group_id":"anthropic-automated-behavioral-audit-sycophancy-v1","eval_id":"anthropic-automated-behavioral-audit-sycophancy","label":"As first reported","definition_notes":"Sycophancy dimension of the audit as run in the Mythos Preview card (after the realism filter introduced in the Sonnet 4.5 card), scored 1 to 10.","join_basis":"stated","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-mythos-preview-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-automated-behavioral-audit-v1","eval_id":"anthropic-automated-behavioral-audit","label":"Before the realism filter","definition_notes":"Opus 4 card and Opus 4.1 addendum: counts of surprising high-impact actions flagged by a classifier over audit transcripts, and the change in cooperation with egregious misuse versus Opus 4 (1,160 transcripts from 290 seeds).","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","last_doc_id":"anthropic-claude-opus-4-1-system-card-addendum","supersedes_group_id":"","notes":"The two documents report different metrics and the audit size differs between them."},
{"group_id":"anthropic-automated-behavioral-audit-v2","eval_id":"anthropic-automated-behavioral-audit","label":"Realism-filtered audit","definition_notes":"Audit as run from the Sonnet 4.5 card, which introduced a realism filter; later cards report the overall misaligned-behaviour score or comparisons in words.","join_basis":"inferred","first_doc_id":"anthropic-claude-sonnet-4-5-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"anthropic-automated-behavioral-audit-v1","notes":"Absolute scores are mostly figure-only; the Mythos Preview score is an approximate chart reading."},
{"group_id":"anthropic-autonomy-threat-model-2-v1","eval_id":"anthropic-autonomy-threat-model-2","label":"RSP v3.0","definition_notes":"Autonomy threat model 2 determinations from the Mythos Preview card (first under RSP v3.0) onward.","join_basis":"inferred","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-bioinformatics-evaluations-v1","eval_id":"anthropic-bioinformatics-evaluations","label":"Original definition","definition_notes":"Score against a human baseline (Opus 4.5 card, via a secondary write-up).","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-5-system-card","last_doc_id":"anthropic-claude-opus-4-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-biomysterybench-v1","eval_id":"anthropic-biomysterybench","label":"Original definition","definition_notes":"Accuracy on the human-difficult subset (Opus 5.5 card).","join_basis":"stated","first_doc_id":"anthropic-claude-opus-5-5-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-browser-use-prompt-injection-v1","eval_id":"anthropic-browser-use-prompt-injection","label":"Original setup","definition_notes":"Prompt injections in browser-use sessions (Opus 4.6, Sonnet 5 and Fable 5.1 materials); the Opus 4.6 figure is per attacked session.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-6-system-card","last_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","supersedes_group_id":"","notes":"The Sonnet 5 source puts Sonnet 4.6 near 50%, far from the Opus 4.6 figure, so the test may have changed; nothing states it."},
{"group_id":"anthropic-cb-1-threat-model-v1","eval_id":"anthropic-cb-1-threat-model","label":"RSP v3.0","definition_notes":"CB-1 determinations from the Mythos Preview card (first under RSP v3.0) onward.","join_basis":"inferred","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-cb-2-threat-model-v1","eval_id":"anthropic-cb-2-threat-model","label":"RSP v3.0","definition_notes":"CB-2 determinations from the Mythos Preview card (first under RSP v3.0) onward.","join_basis":"inferred","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-cbrn-4-threshold-v1","eval_id":"anthropic-cbrn-4-threshold","label":"Original definition","definition_notes":"CBRN-4 threshold determinations in the Opus 4.5, Opus 4.6 and Sonnet 4.6 cards.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-5-system-card","last_doc_id":"anthropic-claude-sonnet-4-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-child-safety-multi-turn-v1","eval_id":"anthropic-child-safety-multi-turn","label":"Original set","definition_notes":"Child-safety multi-turn conversations as reported in the Sonnet 4.6 and Sonnet 5 cards; Sonnet 5 adds API and claude.ai columns.","join_basis":"inferred","first_doc_id":"anthropic-claude-sonnet-4-6-system-card","last_doc_id":"anthropic-claude-sonnet-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-child-safety-single-turn-violative-v1","eval_id":"anthropic-child-safety-single-turn-violative","label":"Original set","definition_notes":"Child-safety single-turn violative prompts as reported in the Sonnet 4.6 and Opus 5 cards.","join_basis":"inferred","first_doc_id":"anthropic-claude-sonnet-4-6-system-card","last_doc_id":"anthropic-claude-opus-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-cobench-v1","eval_id":"anthropic-cobench","label":"CoBench 2.1","definition_notes":"Version 2.1 of the benchmark, scored against an 85% expert-substitution threshold (Opus 5.5 card).","join_basis":"stated","first_doc_id":"anthropic-claude-opus-5-5-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-coding-prompt-injection-v1","eval_id":"anthropic-coding-prompt-injection","label":"Original setup","definition_notes":"Adaptive attacker against coding scenarios, success measured over attempts (Opus 4.5, Opus 4.6 and Sonnet 5 materials).","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-5-system-card","last_doc_id":"anthropic-claude-sonnet-5-system-card","supersedes_group_id":"","notes":"The Sonnet 5 card's prior-model figure (12.7%, secondary source) does not match earlier values, which may reflect a stronger attacker; not stated."},
{"group_id":"anthropic-computer-use-prompt-injection-adaptive-v1","eval_id":"anthropic-computer-use-prompt-injection-adaptive","label":"Original setup","definition_notes":"Adaptive attacker against computer-use scenarios, success counted per attempt or per scenario (Opus 4.5, Sonnet 4.6, Sonnet 5 and Fable 5.1 materials).","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-5-system-card","last_doc_id":"anthropic-claude-opus-4-5-system-card","supersedes_group_id":"","notes":"The Sonnet 4.6 per-scenario figure keeps its own label. The Sonnet 5 value and its prior-model figure come from a secondary source."},
{"group_id":"anthropic-computer-use-prompt-injection-v1","eval_id":"anthropic-computer-use-prompt-injection","label":"Original set","definition_notes":"Attack prevention rate on prompt-injection scenarios in computer-use environments, with and without safeguards (Opus 4, Sonnet 4.5 and Haiku 4.5 cards).","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","last_doc_id":"anthropic-claude-haiku-4-5-system-card","supersedes_group_id":"","notes":"Sonnet 4 is 69 in the Opus 4 card and 74.3 in the Sonnet 4.5 card."},
{"group_id":"anthropic-computer-use-prompt-injection-v2","eval_id":"anthropic-computer-use-prompt-injection","label":"Attack success rate","definition_notes":"From the Sonnet 4.6 card the computer-use prompt-injection results are reported as an attack success rate (per scenario in the Sonnet 4.6 card) instead of an attack prevention rate, a change of measure.","join_basis":"inferred","first_doc_id":"anthropic-claude-sonnet-4-6-system-card","last_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","supersedes_group_id":"anthropic-computer-use-prompt-injection-v1","notes":""},
{"group_id":"anthropic-cot-controllability-v1","eval_id":"anthropic-cot-controllability","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","last_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-cybench-v1","eval_id":"anthropic-cybench","label":"39 challenges","definition_notes":"Count of challenges solved out of 39 (Opus 4 card, via a secondary write-up).","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","last_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-cybench-v2","eval_id":"anthropic-cybench","label":"35-challenge subset","definition_notes":"Count solved out of a 35-challenge subset (Opus 4.1 addendum); the set size differs from the Opus 4 card.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-1-system-card-addendum","last_doc_id":"anthropic-claude-opus-4-1-system-card-addendum","supersedes_group_id":"anthropic-cybench-v1","notes":""},
{"group_id":"anthropic-cybench-v3","eval_id":"anthropic-cybench","label":"32-challenge subset","definition_notes":"Count solved out of a 32-challenge subset (Haiku 4.5 card), with Sonnet 4 scored on the same subset.","join_basis":"stated","first_doc_id":"anthropic-claude-haiku-4-5-system-card","last_doc_id":"anthropic-claude-haiku-4-5-system-card","supersedes_group_id":"anthropic-cybench-v2","notes":""},
{"group_id":"anthropic-cybench-v4","eval_id":"anthropic-cybench","label":"pass@30 success rate","definition_notes":"Success rate over 30 attempts; the Sonnet 4.5 card names 37 of 40 challenges, the Opus 4.6 card gives no set size.","join_basis":"inferred","first_doc_id":"anthropic-claude-sonnet-4-5-system-card","last_doc_id":"anthropic-claude-opus-4-6-system-card","supersedes_group_id":"anthropic-cybench-v3","notes":""},
{"group_id":"anthropic-cybench-v5","eval_id":"anthropic-cybench","label":"pass@1 on 35 challenges","definition_notes":"Single-attempt success rate on 35 challenges (Mythos Preview card: 10 trials each; Opus 4.7 card).","join_basis":"inferred","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-opus-4-7-system-card","supersedes_group_id":"anthropic-cybench-v4","notes":""},
{"group_id":"anthropic-cyber-safeguards-automated-red-teaming-v1","eval_id":"anthropic-cyber-safeguards-automated-red-teaming","label":"Original setup","definition_notes":"Share of harmful cyber tasks completed by an automated red-teamer against the model with its safeguards, from the Fable 5 materials.","join_basis":"stated","first_doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","last_doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-cybergym-v1","eval_id":"anthropic-cybergym","label":"Original definition","definition_notes":"Single-attempt targeted reproduction rate across cards from Opus 4.6 to Sonnet 5. The Opus 4.7 card reports an updated score for Opus 4.6 and the Opus 4.8 card names 1,507 tasks; neither card says the test changed.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-6-system-card","last_doc_id":"anthropic-claude-sonnet-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-cyscenariobench-v1","eval_id":"anthropic-cyscenariobench","label":"Original definition","definition_notes":"Solve rate as reported in the Opus 5 card.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-5-system-card","last_doc_id":"anthropic-claude-opus-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-destructive-actions-synthetic-backend-v1","eval_id":"anthropic-destructive-actions-synthetic-backend","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-mythos-preview-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-disclosure-of-grader-fooling-actions-v1","eval_id":"anthropic-disclosure-of-grader-fooling-actions","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-5-5-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-dna-synthesis-screening-evasion-v1","eval_id":"anthropic-dna-synthesis-screening-evasion","label":"Original definition","definition_notes":"Count out of 10 across cards from Opus 4.7 to Fable 5.1; the Fable 5.1 card prints a differently worded metric, kept under its own label.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-7-system-card","last_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-encoded-reasoning-scratchpad-paraphrase-v1","eval_id":"anthropic-encoded-reasoning-scratchpad-paraphrase","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-mythos-preview-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-evaluation-awareness-deployment-v1","eval_id":"anthropic-evaluation-awareness-deployment","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-5-5-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-evaluation-awareness-in-audit-transcripts-v1","eval_id":"anthropic-evaluation-awareness-in-audit-transcripts","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-mythos-preview-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-exploitbench-v1","eval_id":"anthropic-exploitbench","label":"Original definition","definition_notes":"Mean flags captured, reported in the Opus 4.8, Sonnet 5, Opus 5, Fable 5.1 and Opus 5.5 cards; the Opus 5.5 card names 41 V8 environments.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-8-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-external-prompt-injection-benchmark-v1","eval_id":"anthropic-external-prompt-injection-benchmark","label":"Original setup","definition_notes":"Ranking against earlier Claude models on an unnamed external prompt-injection benchmark (Fable 5 card).","join_basis":"stated","first_doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","last_doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-false-premise-honesty-v1","eval_id":"anthropic-false-premise-honesty","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-mythos-preview-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-firefox-147-exploitation-v1","eval_id":"anthropic-firefox-147-exploitation","label":"Original definition","definition_notes":"Share of 250 trials scored fully successful, in the Opus 4.8, Sonnet 5, Opus 5 and Fable 5.1 cards.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-8-system-card","last_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-grader-awareness-v1","eval_id":"anthropic-grader-awareness","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","last_doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-gui-computer-use-impossible-tasks-v1","eval_id":"anthropic-gui-computer-use-impossible-tasks","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-mythos-preview-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-higher-difficulty-benign-requests-v1","eval_id":"anthropic-higher-difficulty-benign-requests","label":"Original set","definition_notes":"Harder benign set introduced in the Opus 4.6 card and reported again in the Sonnet 4.6 card.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-6-system-card","last_doc_id":"anthropic-claude-sonnet-4-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-higher-difficulty-violative-requests-v1","eval_id":"anthropic-higher-difficulty-violative-requests","label":"Original set","definition_notes":"Harder violative set introduced in the Opus 4.6 card and reported again in the Sonnet 4.6 card.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-6-system-card","last_doc_id":"anthropic-claude-sonnet-4-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-honesty-evaluation-v1","eval_id":"anthropic-honesty-evaluation","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-6-system-card","last_doc_id":"anthropic-claude-opus-4-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-impossible-tasks-v1","eval_id":"anthropic-impossible-tasks","label":"Opus 4.1 addendum method","definition_notes":"Impossible tasks as reported in the Opus 4.1 addendum (printed as Claude Code impossible tasks), with corrected Opus 4 and Sonnet 4 values.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-1-system-card-addendum","last_doc_id":"anthropic-claude-opus-4-1-system-card-addendum","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-impossible-tasks-v2","eval_id":"anthropic-impossible-tasks","label":"Revised method","definition_notes":"Impossible tasks as re-run from the Sonnet 4.5 card, which re-scored earlier models with different values than the addendum (Opus 4.1 no prompt 52 then 80); later cards report a reward hack rate on impossible coding tasks.","join_basis":"inferred","first_doc_id":"anthropic-claude-sonnet-4-5-system-card","last_doc_id":"anthropic-claude-opus-4-7-system-card","supersedes_group_id":"anthropic-impossible-tasks-v1","notes":"The Haiku 4.5 card repeats the Sonnet 4.5 values. Mythos Preview and Opus 4.7 values come from secondary summaries."},
{"group_id":"anthropic-indirect-prompt-injection-art-style-v1","eval_id":"anthropic-indirect-prompt-injection-art-style","label":"Original setup","definition_notes":"Attacker success within 15 attempts on an ART-style indirect prompt-injection benchmark (Opus 5 card).","join_basis":"stated","first_doc_id":"anthropic-claude-opus-5-system-card","last_doc_id":"anthropic-claude-opus-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-indirect-prompt-injection-external-benchmark-v1","eval_id":"anthropic-indirect-prompt-injection-external-benchmark","label":"Opus 4.8 card","definition_notes":"Claude Opus 4.8 card, via the Transparency Hub: attack success rate over more than 15,000 attempts.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-8-system-card","last_doc_id":"anthropic-claude-opus-4-8-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-input-hallucination-v1","eval_id":"anthropic-input-hallucination","label":"As first reported","definition_notes":"Missing-reference and missing-tool prompts as reported in the Opus 4.8 and Mythos 5 cards.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-8-system-card","last_doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-internal-ai-rd-survey-v1","eval_id":"anthropic-internal-ai-rd-survey","label":"Original definition","definition_notes":"Staff answers in the Opus 4.6 (n=16) and Mythos Preview (n=18) cards; the question wording differs, so each has its own metric label.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-6-system-card","last_doc_id":"anthropic-claude-mythos-preview-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-internal-deployment-monitoring-sandbagging-v1","eval_id":"anthropic-internal-deployment-monitoring-sandbagging","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-sonnet-5-system-card","last_doc_id":"anthropic-claude-sonnet-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-internal-deployment-monitoring-v1","eval_id":"anthropic-internal-deployment-monitoring","label":"As first reported","definition_notes":"Rates of categories of misaligned action in monitored internal use, from the Mythos Preview card on; each card reports a different category.","join_basis":"inferred","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","supersedes_group_id":"","notes":"Most values are printed as upper bounds."},
{"group_id":"anthropic-internal-model-use-survey-v1","eval_id":"anthropic-internal-model-use-survey","label":"Original definition","definition_notes":"Staff reporting a productivity gain of 100% or more, of 18 surveyed (Opus 4.5 card, via a secondary write-up).","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-5-system-card","last_doc_id":"anthropic-claude-opus-4-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-linuxarena-v1","eval_id":"anthropic-linuxarena","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","last_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-live-bug-bounty-prompt-injection-v1","eval_id":"anthropic-live-bug-bounty-prompt-injection","label":"Original setup","definition_notes":"Share of unique prompt-injection attacks from a live bug bounty that succeeded (Sonnet 5 card).","join_basis":"stated","first_doc_id":"anthropic-claude-sonnet-5-system-card","last_doc_id":"anthropic-claude-sonnet-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-long-form-virology-task-1-v1","eval_id":"anthropic-long-form-virology-task-1","label":"Original definition","definition_notes":"0-1 task score across cards from the Opus 4.1 addendum to Fable 5.1; no card states a change.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-1-system-card-addendum","last_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-long-form-virology-task-2-v1","eval_id":"anthropic-long-form-virology-task-2","label":"Original definition","definition_notes":"0-1 task score across cards from Opus 4.7 to Fable 5.1; no card states a change.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-7-system-card","last_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-malicious-agentic-coding-v1","eval_id":"anthropic-malicious-agentic-coding","label":"Original definition","definition_notes":"Share of malicious agentic coding requests handled safely; the Opus 4 card averages three evaluations and the Opus 4.5 card calls the measure a refusal rate.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","last_doc_id":"anthropic-claude-opus-4-5-system-card","supersedes_group_id":"","notes":"Sonnet 4 is 90 in the Opus 4 card and 89.3 in the Sonnet 4.5 card."},
{"group_id":"anthropic-malicious-claude-code-use-v1","eval_id":"anthropic-malicious-claude-code-use","label":"Overt/covert split","definition_notes":"Sonnet 4.5 card: refusal reported separately for overt and covert malicious requests, and success reported for dual-use requests only.","join_basis":"stated","first_doc_id":"anthropic-claude-sonnet-4-5-system-card","last_doc_id":"anthropic-claude-sonnet-4-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-malicious-claude-code-use-v2","eval_id":"anthropic-malicious-claude-code-use","label":"Merged malicious set","definition_notes":"From the Haiku 4.5 card: overt and covert malicious requests merged into one refusal rate, and success measured on dual-use and benign requests together.","join_basis":"inferred","first_doc_id":"anthropic-claude-haiku-4-5-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"anthropic-malicious-claude-code-use-v1","notes":"The Opus 4.5 card re-ran Sonnet 4.5 (66.94 to 63.06). The Opus 5.5 card gives only a rank."},
{"group_id":"anthropic-malicious-computer-use-v1","eval_id":"anthropic-malicious-computer-use","label":"Original set","definition_notes":"Refusal rate on malicious computer-use tasks as reported in the Opus 4.5, Opus 4.6 and Sonnet 5 cards.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-5-system-card","last_doc_id":"anthropic-claude-sonnet-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-mask-v1","eval_id":"anthropic-mask","label":"As first reported","definition_notes":"MASK as run by Anthropic, reported as an honesty rate or a lying rate under pressure.","join_basis":"inferred","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-mcp-prompt-injection-v1","eval_id":"anthropic-mcp-prompt-injection","label":"Original set","definition_notes":"Attack prevention rate on prompt injections in MCP tool results (Sonnet 4.5 and Haiku 4.5 cards).","join_basis":"inferred","first_doc_id":"anthropic-claude-sonnet-4-5-system-card","last_doc_id":"anthropic-claude-haiku-4-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-minimal-linuxbench-v1","eval_id":"anthropic-minimal-linuxbench","label":"As first reported","definition_notes":"Stealth success rate with a monitor that sees the chain of thought (Mythos Preview and Opus 4.7 cards).","join_basis":"inferred","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-opus-4-7-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-multi-turn-biological-weapons-v1","eval_id":"anthropic-multi-turn-biological-weapons","label":"Original definition","definition_notes":"Safe response rate in multi-turn biological-weapons conversations, as reported in the Fable 5.1 and Mythos 5.1 card.","join_basis":"stated","first_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","last_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-multi-turn-testing-v1","eval_id":"anthropic-multi-turn-testing","label":"Original setup","definition_notes":"Multi-turn conversations in named harm areas graded against rubrics (Opus 4.5 card); the Fable 5.1 card's biological weapons result is reported as a safe response rate.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-5-system-card","last_doc_id":"anthropic-claude-opus-4-5-system-card","supersedes_group_id":"","notes":"The two documents report different metrics, so no series crosses them."},
{"group_id":"anthropic-multimodal-virology-vct-v1","eval_id":"anthropic-multimodal-virology-vct","label":"Original definition","definition_notes":"0-1 score across cards from Mythos Preview to Opus 5.5; no card states a change.","join_basis":"inferred","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-opportunistic-blackmail-scenario-v1","eval_id":"anthropic-opportunistic-blackmail-scenario","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","last_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-oss-fuzz-v1","eval_id":"anthropic-oss-fuzz","label":"Original definition","definition_notes":"Targets reaching full score out of about 830 entry points (Fable 5.1 card).","join_basis":"stated","first_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","last_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-over-eager-behavior-gui-computer-use-v1","eval_id":"anthropic-over-eager-behavior-gui-computer-use","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-sonnet-4-6-system-card","last_doc_id":"anthropic-claude-sonnet-4-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-package-registry-credential-exercise-v1","eval_id":"anthropic-package-registry-credential-exercise","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-5-5-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-prompt-injection-user-pasted-text-v1","eval_id":"anthropic-prompt-injection-user-pasted-text","label":"Original setup","definition_notes":"Susceptibility to injections in user-pasted text compared with earlier models (Opus 5.5 card).","join_basis":"stated","first_doc_id":"anthropic-claude-opus-5-5-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-reasoning-behavior-monitor-sycophancy-v1","eval_id":"anthropic-reasoning-behavior-monitor-sycophancy","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","last_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-reasoning-behavior-monitor-v1","eval_id":"anthropic-reasoning-behavior-monitor","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","last_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-refusal-to-assist-ai-safety-r-d-v1","eval_id":"anthropic-refusal-to-assist-ai-safety-r-d","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-8-system-card","last_doc_id":"anthropic-claude-opus-4-8-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-release-decision-v1","eval_id":"anthropic-release-decision","label":"Release scope","definition_notes":"Release scope as stated in the Mythos Preview and Fable 5 cards.","join_basis":"inferred","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-reward-hack-prone-coding-tasks-v1","eval_id":"anthropic-reward-hack-prone-coding-tasks","label":"v1 task set","definition_notes":"Original reward-hack-prone coding task set, as reported in the Opus 4.1 addendum.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-1-system-card-addendum","last_doc_id":"anthropic-claude-opus-4-1-system-card-addendum","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-reward-hack-prone-coding-tasks-v2","eval_id":"anthropic-reward-hack-prone-coding-tasks","label":"v2 task set","definition_notes":"Replacement v2 task set used from the Sonnet 4.5 card; v0 notes it is not comparable to v1.","join_basis":"stated","first_doc_id":"anthropic-claude-sonnet-4-5-system-card","last_doc_id":"anthropic-claude-haiku-4-5-system-card","supersedes_group_id":"anthropic-reward-hack-prone-coding-tasks-v1","notes":""},
{"group_id":"anthropic-reward-hacking-hard-coding-v1","eval_id":"anthropic-reward-hacking-hard-coding","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","last_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-reward-hacking-in-rl-training-v1","eval_id":"anthropic-reward-hacking-in-rl-training","label":"As first reported","definition_notes":"Share of RL training episodes with a successful (rewarded) reward hack, as paraphrased from the Mythos 5.1 and Opus 5.5 cards.","join_basis":"inferred","first_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"","notes":"Both values are secondary paraphrases with low confidence."},
{"group_id":"anthropic-rsp-deployment-standard-v1","eval_id":"anthropic-rsp-deployment-standard","label":"RSP before v3.0","definition_notes":"ASL standard stated per model in cards from Opus 4 to Sonnet 4.6.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","last_doc_id":"anthropic-claude-sonnet-4-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-rsp-determinations-v1","eval_id":"anthropic-rsp-determinations","label":"Combined statements","definition_notes":"Multi-threat-model statements in the Sonnet 5, Opus 5, Fable 5.1 and Opus 5.5 cards; each row has its own scope label.","join_basis":"inferred","first_doc_id":"anthropic-claude-sonnet-5-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-safety-research-compromise-v1","eval_id":"anthropic-safety-research-compromise","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-5-system-card","last_doc_id":"anthropic-claude-opus-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-sandbagging-transcript-review-v1","eval_id":"anthropic-sandbagging-transcript-review","label":"As first reported","definition_notes":"Review of evaluation transcripts for sandbagging: 1,000 transcripts in the Opus 4.6 card; 20 flagged transcripts reviewed by people in the Mythos Preview card.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-6-system-card","last_doc_id":"anthropic-claude-mythos-preview-system-card","supersedes_group_id":"","notes":"The two cards count different things (explicit vs possible cases)."},
{"group_id":"anthropic-sandbox-escape-incident-v1","eval_id":"anthropic-sandbox-escape-incident","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-mythos-preview-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-sandbox-escape-tamper-attempts-v1","eval_id":"anthropic-sandbox-escape-tamper-attempts","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-5-5-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-sandbox-vulnerability-exploit-v1","eval_id":"anthropic-sandbox-vulnerability-exploit","label":"Fable 5.1 and Mythos 5.1 card","definition_notes":"Claude Fable 5.1 and Mythos 5.1 card: a reported incident in which the model read files outside its environment.","join_basis":"stated","first_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","last_doc_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-shade-arena-linuxarena-v1","eval_id":"anthropic-shade-arena-linuxarena","label":"Combined statements","definition_notes":"Statement in words covering SHADE-Arena and LinuxArena together.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-5-system-card","last_doc_id":"anthropic-claude-opus-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-shade-arena-minimal-linuxbench-v1","eval_id":"anthropic-shade-arena-minimal-linuxbench","label":"Combined statements","definition_notes":"Statements in words covering SHADE-Arena and Minimal-LinuxBench together.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-8-system-card","last_doc_id":"anthropic-claude-sonnet-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-shade-arena-v1","eval_id":"anthropic-shade-arena","label":"As first reported","definition_notes":"Stealth side-task success in SHADE-Arena as reported from the Sonnet 4.5 card on (thinking off in that card; visible or hidden reasoning in later cards).","join_basis":"inferred","first_doc_id":"anthropic-claude-sonnet-4-5-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"","notes":"Some values are printed ranges, one is a statement that it fell to zero, and one is a comparison in words."},
{"group_id":"anthropic-simpleqa-verified-v1","eval_id":"anthropic-simpleqa-verified","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-5-system-card","last_doc_id":"anthropic-claude-opus-4-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-single-turn-benign-requests-v1","eval_id":"anthropic-single-turn-benign-requests","label":"Original set","definition_notes":"The single-turn set as used in the Opus 4 card, reporting the over-refusal rate on the benign set for English prompts.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","last_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-single-turn-benign-requests-v2","eval_id":"anthropic-single-turn-benign-requests","label":"Updated set (Aug 2025)","definition_notes":"The set as updated in the Opus 4.1 addendum with new policy areas and refreshed prompts, still English-only; used in the Opus 4.1, Sonnet 4.5 and Haiku 4.5 cards.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-1-system-card-addendum","last_doc_id":"anthropic-claude-haiku-4-5-system-card","supersedes_group_id":"anthropic-single-turn-benign-requests-v1","notes":"The Sonnet 4.5 card restates the Opus 4.1 addendum's values for Opus 4.1 and Opus 4 exactly."},
{"group_id":"anthropic-single-turn-benign-requests-v3","eval_id":"anthropic-single-turn-benign-requests","label":"All-language totals","definition_notes":"From the Opus 4.5 card, totals cover a multilingual set across all languages instead of English only; the Opus 4.6, Sonnet 4.6 and Opus 4.7 cards were joined as nothing recorded says the set changed again.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-5-system-card","last_doc_id":"anthropic-claude-opus-4-7-system-card","supersedes_group_id":"anthropic-single-turn-benign-requests-v2","notes":"Restated values for older models in the Opus 4.6 card differ from the Opus 4.5 card, and whether the Opus 4.6 and Sonnet 4.6 totals are all-language is not recorded."},
{"group_id":"anthropic-single-turn-benign-requests-v4","eval_id":"anthropic-single-turn-benign-requests","label":"API and claude.ai columns","definition_notes":"From the Opus 4.8 card, results are reported separately for the API with no system prompt and with the claude.ai system prompt, with confidence intervals; used in the Opus 4.8, Sonnet 5 and Opus 5 cards.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-8-system-card","last_doc_id":"anthropic-claude-opus-5-system-card","supersedes_group_id":"anthropic-single-turn-benign-requests-v3","notes":"The Opus 4.8 card restates Opus 4.7 as 0.31 against 0.28 in the Opus 4.7 card (secondary source)."},
{"group_id":"anthropic-single-turn-violative-requests-v1","eval_id":"anthropic-single-turn-violative-requests","label":"Original set","definition_notes":"The single-turn set as used in the Opus 4 card, reporting the harmless response rate on the violative set for English prompts.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","last_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-single-turn-violative-requests-v2","eval_id":"anthropic-single-turn-violative-requests","label":"Updated set (Aug 2025)","definition_notes":"The set as updated in the Opus 4.1 addendum with new policy areas and refreshed prompts, still English-only; used in the Opus 4.1, Sonnet 4.5 and Haiku 4.5 cards.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-1-system-card-addendum","last_doc_id":"anthropic-claude-haiku-4-5-system-card","supersedes_group_id":"anthropic-single-turn-violative-requests-v1","notes":"The Sonnet 4.5 card restates the Opus 4.1 addendum's values for Opus 4.1 and Opus 4 exactly."},
{"group_id":"anthropic-single-turn-violative-requests-v3","eval_id":"anthropic-single-turn-violative-requests","label":"All-language totals","definition_notes":"From the Opus 4.5 card, totals cover a multilingual set across all languages instead of English only; the Opus 4.6 and Sonnet 4.6 cards were joined as nothing recorded says the set changed again.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-5-system-card","last_doc_id":"anthropic-claude-sonnet-4-6-system-card","supersedes_group_id":"anthropic-single-turn-violative-requests-v2","notes":"Restated values for older models in the Opus 4.6 card differ from the Opus 4.5 card, and whether the Opus 4.6 and Sonnet 4.6 totals are all-language is not recorded."},
{"group_id":"anthropic-single-turn-violative-requests-v4","eval_id":"anthropic-single-turn-violative-requests","label":"API and claude.ai columns","definition_notes":"From the Opus 4.8 card, results are reported separately for the API with no system prompt and with the claude.ai system prompt, with confidence intervals; used in the Opus 4.8, Sonnet 5 and Opus 5 cards.","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-8-system-card","last_doc_id":"anthropic-claude-opus-5-system-card","supersedes_group_id":"anthropic-single-turn-violative-requests-v3","notes":"The Opus 4.8 card restates Sonnet 4.6 as 98.18 against 99.38 in its own card."},
{"group_id":"anthropic-strongreject-v1","eval_id":"anthropic-strongreject","label":"Original setup","definition_notes":"Best-performing jailbreak StrongREJECT score with standard and extended thinking, from the Opus 4 card.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","last_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-subtle-sabotage-agentic-v1","eval_id":"anthropic-subtle-sabotage-agentic","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","last_doc_id":"anthropic-claude-opus-4-sonnet-4-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-suicide-self-harm-multi-turn-v1","eval_id":"anthropic-suicide-self-harm-multi-turn","label":"Original set","definition_notes":"Suicide and self-harm multi-turn conversations as reported in the Sonnet 4.6, Sonnet 5 and Opus 5 materials; later cards add API and claude.ai columns.","join_basis":"inferred","first_doc_id":"anthropic-claude-sonnet-4-6-system-card","last_doc_id":"anthropic-claude-opus-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-swe-bench-verified-hard-subset-v1","eval_id":"anthropic-swe-bench-verified-hard-subset","label":"42-problem subset","definition_notes":"Problems solved (averaged over attempts) out of 42 hard problems (Opus 4.1 addendum; Sonnet 4 in the Haiku 4.5 card).","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-1-system-card-addendum","last_doc_id":"anthropic-claude-haiku-4-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-swe-bench-verified-hard-subset-v2","eval_id":"anthropic-swe-bench-verified-hard-subset","label":"45-problem subset","definition_notes":"Problems solved out of 45 hard problems (Haiku 4.5 card, which notes the denominator changed from 42; Opus 4.5 card).","join_basis":"inferred","first_doc_id":"anthropic-claude-haiku-4-5-system-card","last_doc_id":"anthropic-claude-opus-4-5-system-card","supersedes_group_id":"anthropic-swe-bench-verified-hard-subset-v1","notes":""},
{"group_id":"anthropic-sycophancy-prefilled-conversations-v1","eval_id":"anthropic-sycophancy-prefilled-conversations","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-5-system-card","last_doc_id":"anthropic-claude-opus-4-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-tool-use-prompt-injection-v1","eval_id":"anthropic-tool-use-prompt-injection","label":"Original set","definition_notes":"Attack prevention rate on prompt injections in tool outputs (Sonnet 4.5 and Haiku 4.5 cards).","join_basis":"inferred","first_doc_id":"anthropic-claude-sonnet-4-5-system-card","last_doc_id":"anthropic-claude-haiku-4-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-training-distribution-v1","eval_id":"anthropic-training-distribution","label":"Per-environment results","definition_notes":"Hack rate on two named training-distribution environments (Opus 4.1 addendum).","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-1-system-card-addendum","last_doc_id":"anthropic-claude-opus-4-1-system-card-addendum","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-training-distribution-v2","eval_id":"anthropic-training-distribution","label":"Single aggregate","definition_notes":"One aggregate hack rate on the model's own training distribution (Sonnet 4.5 card).","join_basis":"stated","first_doc_id":"anthropic-claude-sonnet-4-5-system-card","last_doc_id":"anthropic-claude-sonnet-4-5-system-card","supersedes_group_id":"anthropic-training-distribution-v1","notes":""},
{"group_id":"anthropic-unverbalized-grader-awareness-v1","eval_id":"anthropic-unverbalized-grader-awareness","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-8-system-card","last_doc_id":"anthropic-claude-opus-4-8-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-verbalized-grader-speculation-v1","eval_id":"anthropic-verbalized-grader-speculation","label":"As first reported","definition_notes":"Definition as given in the one document that reports it.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-8-system-card","last_doc_id":"anthropic-claude-opus-4-8-system-card","supersedes_group_id":"","notes":""},
{"group_id":"anthropic-virology-protocol-uplift-trial-v1","eval_id":"anthropic-virology-protocol-uplift-trial","label":"Original definition","definition_notes":"Mean critical failures with model help, against an internet-only control (Mythos Preview card).","join_basis":"stated","first_doc_id":"anthropic-claude-mythos-preview-system-card","last_doc_id":"anthropic-claude-mythos-preview-system-card","supersedes_group_id":"","notes":""},
{"group_id":"apollo-ai-r-d-sabotage-openai-v1","eval_id":"apollo-ai-r-d-sabotage","label":"o3 card","definition_notes":"o3 and o4-mini card: average score on an AI R&D sabotage task (inserting a backdoor), a capability measure.","join_basis":"stated","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-o3-and-o4-mini-system-card","supersedes_group_id":"","notes":""},
{"group_id":"apollo-covert-deceptive-behavior-openai-v1","eval_id":"apollo-covert-deceptive-behavior","label":"Original setup","definition_notes":"Apollo covert and deceptive behaviour scenarios as reported across OpenAI cards: share of trajectories with deceptive action (GPT-5), comparisons in words (GPT-5.1-Codex-Max, GPT-5.2, GPT-5.3-Codex, GPT-5.5) and an overall deception rate in no-nudge settings (GPT-5.4 Thinking).","join_basis":"inferred","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-5-5-system-card","supersedes_group_id":"","notes":"Each card words its metric differently, so few values form a line."},
{"group_id":"apollo-evaluation-awareness-anthropic-v1","eval_id":"apollo-evaluation-awareness","label":"Sonnet 4.5 card","definition_notes":"Share of Apollo scenario transcripts with unambiguous references to being evaluated, for pre-release snapshots, as reported in the Claude Sonnet 4.5 card.","join_basis":"stated","first_doc_id":"anthropic-claude-sonnet-4-5-system-card","last_doc_id":"anthropic-claude-sonnet-4-5-system-card","supersedes_group_id":"","notes":"The card calls the result preliminary; read via a secondary source."},
{"group_id":"apollo-evaluation-awareness-openai-v1","eval_id":"apollo-evaluation-awareness","label":"Original setup","definition_notes":"Verbalized evaluation awareness in Apollo scheming scenarios as reported in the GPT-5 card (broad and strict definitions, over all samples and over scheming samples), the GPT-5.1-Codex-Max card (a comparison with GPT-5 in words) and the GPT-5.4 Thinking card (one rate).","join_basis":"inferred","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-5-4-thinking-system-card","supersedes_group_id":"","notes":"The GPT-5.4 Thinking card does not say, as recorded, whether its rate follows the broad or the strict definition."},
{"group_id":"apollo-evaluation-awareness-openai-v2","eval_id":"apollo-evaluation-awareness","label":"Moderate-or-higher grading","definition_notes":"GPT-5.5 card: share of samples graded as showing moderate or higher verbalized awareness of an alignment evaluation, a graded threshold instead of the earlier broad and strict definitions; includes pre-release GPT-5.4 and GPT-5.3-Codex checkpoints.","join_basis":"stated","first_doc_id":"openai-gpt-5-5-system-card","last_doc_id":"openai-gpt-5-5-system-card","supersedes_group_id":"apollo-evaluation-awareness-openai-v1","notes":""},
{"group_id":"apollo-evaluation-awareness-openai-v3","eval_id":"apollo-evaluation-awareness","label":"GPT-6 Astra setup","definition_notes":"GPT-6 Astra card: share of samples with verbalized evaluation awareness at stated reasoning efforts. The card re-measures GPT-5.5 with a different result from its own card, which the v0 record attributes to a different Apollo setup.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"apollo-evaluation-awareness-openai-v2","notes":""},
{"group_id":"apollo-falsifying-task-completion-openai-v1","eval_id":"apollo-falsifying-task-completion","label":"GPT-5.1-Codex-Max card","definition_notes":"GPT-5.1-Codex-Max card: rate of falsely claiming task completion, compared with GPT-5 in words.","join_basis":"stated","first_doc_id":"openai-gpt-5-1-codex-max-system-card","last_doc_id":"openai-gpt-5-1-codex-max-system-card","supersedes_group_id":"","notes":""},
{"group_id":"apollo-impossible-coding-task-openai-v1","eval_id":"apollo-impossible-coding-task","label":"GPT-5.5 card","definition_notes":"GPT-5.5 card: share of samples in which the model claims to have completed an impossible coding task.","join_basis":"stated","first_doc_id":"openai-gpt-5-5-system-card","last_doc_id":"openai-gpt-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"apollo-log-falsification-openai-v1","eval_id":"apollo-log-falsification","label":"GPT-5 card","definition_notes":"GPT-5 card: covert action rate in a log-falsification scenario, with a weak and a strong goal nudge.","join_basis":"stated","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"apollo-model-welfare-data-falsification-openai-v1","eval_id":"apollo-model-welfare-data-falsification","label":"GPT-6 Astra card","definition_notes":"GPT-6 Astra card: share of runs with falsified data labels in a model-welfare research scenario.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"apollo-multilingual-reasoning-anomalies-openai-v1","eval_id":"apollo-multilingual-reasoning-anomalies","label":"GPT-5.4 Thinking card","definition_notes":"GPT-5.4 Thinking card: share of samples with multilingual anomalies in the reasoning.","join_basis":"stated","first_doc_id":"openai-gpt-5-4-thinking-system-card","last_doc_id":"openai-gpt-5-4-thinking-system-card","supersedes_group_id":"","notes":""},
{"group_id":"apollo-non-latin-reasoning-tokens-openai-v1","eval_id":"apollo-non-latin-reasoning-tokens","label":"GPT-5.3-Codex card","definition_notes":"GPT-5.3-Codex card: share of reasoning tokens in non-Latin scripts.","join_basis":"stated","first_doc_id":"openai-gpt-5-3-codex-system-card","last_doc_id":"openai-gpt-5-3-codex-system-card","supersedes_group_id":"","notes":""},
{"group_id":"apollo-sabotage-capability-openai-v1","eval_id":"apollo-sabotage-capability","label":"Original setup","definition_notes":"Apollo sabotage capability tasks as reported in the GPT-5.3-Codex card (mean best-of-10 score), the GPT-5.4 Thinking card (mean score, with the best-of-10 score given alongside) and the GPT-5.5 card (mean score across tasks and difficulty levels).","join_basis":"inferred","first_doc_id":"openai-gpt-5-3-codex-system-card","last_doc_id":"openai-gpt-5-5-system-card","supersedes_group_id":"","notes":"Whether the GPT-5.4 and GPT-5.5 mean scores are the same metric is not recorded, so they carry separate labels."},
{"group_id":"apollo-sabotage-openai-v1","eval_id":"apollo-sabotage","label":"GPT-5.2 card","definition_notes":"GPT-5.2 card: whether sabotage was observed in Apollo testing, stated in words.","join_basis":"stated","first_doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","last_doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","supersedes_group_id":"","notes":""},
{"group_id":"apollo-sandbagging-openai-v1","eval_id":"apollo-sandbagging","label":"Original setup","definition_notes":"Apollo sandbagging tests across OpenAI cards: sandbagging observed in words (o3), comparisons in words (GPT-5.1-Codex-Max, GPT-5.3-Codex), the accuracy drop when incentivized to underperform (GPT-5.4 Thinking) and accuracy when incentivized to score below half (GPT-5.5).","join_basis":"inferred","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-gpt-5-5-system-card","supersedes_group_id":"","notes":"The test is named slightly differently in each card and no two cards report the same metric."},
{"group_id":"apollo-self-preservation-openai-v1","eval_id":"apollo-self-preservation","label":"GPT-5.2 card","definition_notes":"GPT-5.2 card: whether self-preservation behaviour was observed, stated in words.","join_basis":"stated","first_doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","last_doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","supersedes_group_id":"","notes":""},
{"group_id":"deepseek-safety-benchmarks-summary-v1","eval_id":"deepseek-safety-benchmarks-summary","label":"As first reported","definition_notes":"Summary judgment of inherent safety without the risk-control system, from the DeepSeek-R1 paper.","join_basis":"stated","first_doc_id":"deepseek-r1-paper-nature-arxiv-v2","last_doc_id":"deepseek-r1-paper-nature-arxiv-v2","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-automated-red-teaming-helpfulness-v1","eval_id":"google-deepmind-automated-red-teaming-helpfulness","label":"Original definition","definition_notes":"Share of automated red-teaming queries with an unhelpful response, Table 8 of the Gemini 2.5 technical report.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-2-5-technical-report","last_doc_id":"google-deepmind-gemini-2-5-technical-report","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-automated-red-teaming-v1","eval_id":"google-deepmind-automated-red-teaming","label":"Original definition","definition_notes":"Share of automated red-teaming queries yielding a dangerous-content violation, Table 8 of the Gemini 2.5 technical report, with Gemini 2.0 Flash and 1.5 Pro 002 as comparisons.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-2-5-technical-report","last_doc_id":"google-deepmind-gemini-2-5-technical-report","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-bio-bottleneck-red-teaming-v1","eval_id":"google-deepmind-bio-bottleneck-red-teaming","label":"Original definition","definition_notes":"Sub-stages with an average red-team score below 80, as reported in the Gemini 3.7 Flash FSF report.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-bio-chem-weapons-queries-v1","eval_id":"google-deepmind-bio-chem-weapons-queries","label":"Original definition","definition_notes":"Violation rate on bio/chem weapons queries with safeguards, 3.7 Flash FSF report.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-cbrn-jailbreak-templates-v1","eval_id":"google-deepmind-cbrn-jailbreak-templates","label":"Original definition","definition_notes":"Objective success of common jailbreak templates against CBRN safeguards, 3.7 Flash FSF report.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-cbrn-red-team-uplift-v1","eval_id":"google-deepmind-cbrn-red-team-uplift","label":"Original definition","definition_notes":"Expert red-team score gains over a web-only baseline for two bio and two chem scenarios, and the count of bio sub-stages averaging below 80, in the 3.7 Flash FSF report.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-child-safety-launch-thresholds-v1","eval_id":"google-deepmind-child-safety-launch-thresholds","label":"Original definition","definition_notes":"Whether internal child-safety launch thresholds were met, in the Gemini 3 Pro and 3.1 Pro cards.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-3-pro-model-card","last_doc_id":"google-deepmind-gemini-3-1-pro-model-card","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-cot-legibility-v1","eval_id":"google-deepmind-cot-legibility","label":"Original definition","definition_notes":"Comprehensible and informative shares of transcripts in the Gemini 3 Pro FSF report.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-cyber-autonomous-offense-suite-v1","eval_id":"google-deepmind-cyber-autonomous-offense-suite","label":"Original definition","definition_notes":"Capture-the-flag suite of 76 easy, 13 medium and 13 hard challenges; hard challenges solved out of 13, in the Gemini 2.5 technical report and the 2.5 Deep Think card.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-2-5-technical-report","last_doc_id":"google-deepmind-gemini-2-5-deep-think-model-card","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-cyber-key-skills-v1","eval_id":"google-deepmind-cyber-key-skills","label":"v1 challenge set","definition_notes":"Original key-skills set of 8 easy, 28 medium and 12 hard challenges; hard challenges solved out of 12. Reported in the Gemini 2.5 Pro card, 2.5 technical report, 2.5 Deep Think card and, as v1, in the Gemini 3 Pro FSF report.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-2-5-technical-report","last_doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","supersedes_group_id":"","notes":"The Gemini 3 Pro FSF report compares its v1 result with 6/12 for Gemini 2.5 models, which supports the join; the 2.5 Pro card value (1/12) is low confidence and conflicts with the technical report (6/12)."},
{"group_id":"google-deepmind-cyber-key-skills-v2","eval_id":"google-deepmind-cyber-key-skills","label":"v2 challenge set","definition_notes":"Harder v2 set of 13 challenges introduced in the Gemini 3 Pro FSF report, scored as challenges solved end to end.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","supersedes_group_id":"google-deepmind-cyber-key-skills-v1","notes":""},
{"group_id":"google-deepmind-evaluation-awareness-v1","eval_id":"google-deepmind-evaluation-awareness","label":"Original definition","definition_notes":"Qualitative observations of evaluation awareness in the Gemini 3 Pro and 3.7 Flash FSF reports.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-facts-grounding-v1","eval_id":"google-deepmind-facts-grounding","label":"Original definition","definition_notes":"FACTS Grounding score as reported in Table 3 of the Gemini 2.5 technical report.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-2-5-technical-report","last_doc_id":"google-deepmind-gemini-2-5-technical-report","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-fsf-determination-misalignment-v1","eval_id":"google-deepmind-fsf-determination-misalignment","label":"FSF as applied to Gemini 2.5","definition_notes":"Deceptive-alignment instrumental reasoning Levels 1 and 2 in the Gemini 2.5 Pro card (separately) and 2.5 Deep Think card (together). No framework version is stated in the evidence.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-2-5-pro-model-card","last_doc_id":"google-deepmind-gemini-2-5-deep-think-model-card","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-fsf-determination-misalignment-v2","eval_id":"google-deepmind-fsf-determination-misalignment","label":"Updated FSF (Gemini 3 onward)","definition_notes":"Misalignment (instrumental reasoning) determinations under the updated framework, exploratory in the Gemini 3 Pro FSF report, and in the Gemini 3.1 Pro card.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-1-pro-model-card","supersedes_group_id":"google-deepmind-fsf-determination-misalignment-v1","notes":""},
{"group_id":"google-deepmind-fsf-determination-misalignment-v3","eval_id":"google-deepmind-fsf-determination-misalignment","label":"FSF v3.1","definition_notes":"Stealth and situational awareness TCL determination under FSF v3.1 in the Gemini 3.7 Flash FSF report.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","supersedes_group_id":"google-deepmind-fsf-determination-misalignment-v2","notes":""},
{"group_id":"google-deepmind-fsf-determination-v1","eval_id":"google-deepmind-fsf-determination","label":"FSF as applied to Gemini 2.5","definition_notes":"CCL and alert-threshold determinations in Gemini 2.5-era documents (2.5 Pro card, 2.5 technical report, 2.5 Deep Think card, 2.5 Flash card), with separate CBRN uplift, cyber autonomy, cyber uplift, ML R&D autonomy and ML R&D uplift levels. No framework version is stated in the evidence.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-2-5-technical-report","last_doc_id":"google-deepmind-gemini-2-5-flash-model-card","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-fsf-determination-v2","eval_id":"google-deepmind-fsf-determination","label":"Updated FSF (Gemini 3 onward)","definition_notes":"Determinations under the updated framework from the Gemini 3 Pro FSF report to the Gemini 3.6 Flash card: CBRN uplift, cyber uplift, harmful manipulation (exploratory at first) and ML R&D acceleration/automation levels. Version number not stated in the evidence.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-6-flash-model-card","supersedes_group_id":"google-deepmind-fsf-determination-v1","notes":"Later cards (3 Flash, 3.1 Flash-Lite, 3.5 Flash, 3.5 Flash-Lite, 3.6 Flash) inherit determinations from Gemini 3 Pro or 3.1 Pro; 3.5 Flash and 3.6 Flash add their own cyber testing."},
{"group_id":"google-deepmind-fsf-determination-v3","eval_id":"google-deepmind-fsf-determination","label":"FSF v3.1","definition_notes":"Determinations under FSF v3.1, which adds Tracked Capability Levels (TCLs): Gemini 3.7 Flash FSF report and the Gemini 3.8 Flash card, which inherits them.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-8-flash-model-card","supersedes_group_id":"google-deepmind-fsf-determination-v2","notes":""},
{"group_id":"google-deepmind-grb-v1","eval_id":"google-deepmind-grb","label":"Original definition","definition_notes":"Average pass@1 over 74 tasks in the 3.7 Flash FSF report, with a rough Gemini 3.1 Pro comparison.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-harmful-manipulation-efficacy-study-v1","eval_id":"google-deepmind-harmful-manipulation-efficacy-study","label":"Original definition","definition_notes":"Human-participant harmful manipulation study: participants enrolled (Gemini 3 Pro FSF report, 3.7 Flash FSF report) and maximum belief-change odds ratio against a non-AI baseline (3.1 Pro card).","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","supersedes_group_id":"","notes":"Study composition differs as recorded (adversarial and control arms for Gemini 3 Pro; civic and finance topics for 3.7 Flash). The 3.7 Flash report compares its odds ratios with Gemini 3 Pro."},
{"group_id":"google-deepmind-harmful-manipulation-propensity-v1","eval_id":"google-deepmind-harmful-manipulation-propensity","label":"Original definition","definition_notes":"Share of conversational turns with manipulative cues in standard and higher-stakes scenarios, 3.7 Flash FSF report, with a Gemini 3 Pro comparison value.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-image-to-text-safety-v1","eval_id":"google-deepmind-image-to-text-safety","label":"Original definition","definition_notes":"Delta against a named comparator model in the safety evaluations table of the Gemini 2.5 Pro, 2.5 Flash, 2.5 Deep Think, 3 Pro, 3 Flash, 3.1 Pro, 3.1 Flash-Lite, 3.5 Flash, 3.5 Flash-Lite, 3.6 Flash, 3.7 Flash and 3.8 Flash cards and the 2.5 technical report. The cards as recorded do not say whether prompt sets or graders changed; the 3.6 Flash header and the 3.7 and 3.8 Flash tables state percentage points.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-2-5-technical-report","last_doc_id":"google-deepmind-gemini-3-8-flash-model-card","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-indirect-prompt-injection-v1","eval_id":"google-deepmind-indirect-prompt-injection","label":"Original definition","definition_notes":"Attack success rates for Actor Critic, Beam Search and TAP over 500 held-out scenarios, Table 9 of the Gemini 2.5 technical report.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-2-5-technical-report","last_doc_id":"google-deepmind-gemini-2-5-technical-report","supersedes_group_id":"","notes":"Column mapping inferred in v0 (medium confidence)."},
{"group_id":"google-deepmind-instruction-following-v1","eval_id":"google-deepmind-instruction-following","label":"Original definition","definition_notes":"Delta against a named comparator model in the Gemini 2.5 Pro, 2.5 Flash and 2.5 Deep Think cards and Table 7 of the 2.5 technical report (labelled Helpfulness / Instruction Following there).","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-2-5-technical-report","last_doc_id":"google-deepmind-gemini-2-5-flash-model-card","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-jailbreak-risk-assessment-v1","eval_id":"google-deepmind-jailbreak-risk-assessment","label":"Original definition","definition_notes":"Qualitative jailbreak-risk statement in the Gemini 3 Pro card.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-3-pro-model-card","last_doc_id":"google-deepmind-gemini-3-pro-model-card","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-multilingual-safety-v1","eval_id":"google-deepmind-multilingual-safety","label":"Original definition","definition_notes":"Delta against a named comparator model in the safety evaluations table of the Gemini 2.5 Pro, 2.5 Flash, 2.5 Deep Think, 3 Pro, 3 Flash, 3.1 Pro, 3.1 Flash-Lite, 3.5 Flash, 3.5 Flash-Lite, 3.6 Flash, 3.7 Flash and 3.8 Flash cards and the 2.5 technical report. The cards as recorded do not say whether prompt sets or graders changed; the 3.6 Flash header and the 3.7 and 3.8 Flash tables state percentage points.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-2-5-technical-report","last_doc_id":"google-deepmind-gemini-3-8-flash-model-card","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-re-bench-v1","eval_id":"google-deepmind-re-bench","label":"Original definition","definition_notes":"RE-Bench run by Google: per-task share of the best expert solution (2.5 technical report) and average human-normalised score (2.5 Deep Think and 3.1 Pro cards).","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-2-5-technical-report","last_doc_id":"google-deepmind-gemini-3-1-pro-model-card","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-reward-hacking-examples-v1","eval_id":"google-deepmind-reward-hacking-examples","label":"Original definition","definition_notes":"Qualitative reward-hacking example in the Gemini 3 Pro FSF report appendix.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-sandbagging-checks-v1","eval_id":"google-deepmind-sandbagging-checks","label":"Original definition","definition_notes":"Checks of evaluation transcripts for deliberate underperformance: automated in the Gemini 3 Pro FSF report, automated plus manual in the 3.7 Flash FSF report.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","supersedes_group_id":"","notes":"Whether the Gemini 3 Pro checks also included manual review is not recorded."},
{"group_id":"google-deepmind-simpleqa-v1","eval_id":"google-deepmind-simpleqa","label":"Original definition","definition_notes":"SimpleQA accuracy as reported in Table 3 of the Gemini 2.5 technical report.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-2-5-technical-report","last_doc_id":"google-deepmind-gemini-2-5-technical-report","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-simpleqa-verified-v1","eval_id":"google-deepmind-simpleqa-verified","label":"Original definition","definition_notes":"SimpleQA Verified accuracy as reported in the Gemini 3 launch post.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-3-launch-post","last_doc_id":"google-deepmind-gemini-3-launch-post","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-situational-awareness-challenges-v1","eval_id":"google-deepmind-situational-awareness-challenges","label":"Original definition","definition_notes":"Suite of 11 situational-awareness challenges, reported as challenges solved and as per-challenge success rates, from the Gemini 2.5 Pro card to the 3.7 Flash FSF report. The 3.7 Flash report defines passing as a success rate above 20%; earlier documents as recorded give no threshold.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-2-5-technical-report","last_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-stealth-challenges-v1","eval_id":"google-deepmind-stealth-challenges","label":"Five-challenge set","definition_notes":"Stealth set of five challenges in the Gemini 2.5 Pro card and the 2.5 technical report, reported as challenges solved and per-challenge success rates.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-2-5-technical-report","last_doc_id":"google-deepmind-gemini-2-5-pro-model-card","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-stealth-challenges-v2","eval_id":"google-deepmind-stealth-challenges","label":"Four-challenge set","definition_notes":"Stealth set of four challenges from the Gemini 2.5 Deep Think card onward (Gemini 3 Pro FSF report, 3.1 Pro card, 3.7 Flash FSF report). The 3.7 Flash report defines passing as beating the top half of human participants.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-2-5-deep-think-model-card","last_doc_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","supersedes_group_id":"google-deepmind-stealth-challenges-v1","notes":""},
{"group_id":"google-deepmind-text-to-text-safety-v1","eval_id":"google-deepmind-text-to-text-safety","label":"Original definition","definition_notes":"Delta against a named comparator model in the safety evaluations table of the Gemini 2.5 Pro, 2.5 Flash, 2.5 Deep Think, 3 Pro, 3 Flash, 3.1 Pro, 3.1 Flash-Lite, 3.5 Flash, 3.5 Flash-Lite, 3.6 Flash, 3.7 Flash and 3.8 Flash cards and the 2.5 technical report. The cards as recorded do not say whether prompt sets or graders changed; the 3.6 Flash header and the 3.7 and 3.8 Flash tables state percentage points.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-2-5-technical-report","last_doc_id":"google-deepmind-gemini-3-8-flash-model-card","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-tone-v1","eval_id":"google-deepmind-tone","label":"Original definition","definition_notes":"Delta against a named comparator model in the safety evaluations table of the Gemini 2.5 Pro, 2.5 Flash, 2.5 Deep Think, 3 Pro, 3 Flash, 3.1 Pro, 3.1 Flash-Lite, 3.5 Flash, 3.5 Flash-Lite, 3.6 Flash, 3.7 Flash and 3.8 Flash cards and the 2.5 technical report. The cards as recorded do not say whether prompt sets or graders changed; the 3.6 Flash header and the 3.7 and 3.8 Flash tables state percentage points.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-2-5-technical-report","last_doc_id":"google-deepmind-gemini-3-8-flash-model-card","supersedes_group_id":"","notes":""},
{"group_id":"google-deepmind-unjustified-refusals-v1","eval_id":"google-deepmind-unjustified-refusals","label":"Original definition","definition_notes":"Delta against a named comparator model in the safety evaluations tables of Gemini cards from Gemini 3 Pro to Gemini 3.8 Flash. The cards as recorded do not say whether the prompt set changed.","join_basis":"inferred","first_doc_id":"google-deepmind-gemini-3-pro-model-card","last_doc_id":"google-deepmind-gemini-3-8-flash-model-card","supersedes_group_id":"","notes":""},
{"group_id":"gray-swan-agent-red-teaming-anthropic-v1","eval_id":"gray-swan-agent-red-teaming","label":"As reported by Anthropic","definition_notes":"Gray Swan agent red-teaming benchmark as reported in the Claude Opus 4.5 card (attack success at one attempt, read from a figure) and the Claude Opus 4.6 card (attack success within 100 attempts, with and without extended thinking).","join_basis":"inferred","first_doc_id":"anthropic-claude-opus-4-5-system-card","last_doc_id":"anthropic-claude-opus-4-6-system-card","supersedes_group_id":"","notes":"Which panel of the Opus 4.5 figure (indirect or combined attacks) the value comes from is unverified. The two cards use different attempt counts, kept apart by metric label and condition."},
{"group_id":"gray-swan-agent-red-teaming-meta-v1","eval_id":"gray-swan-agent-red-teaming","label":"Muse Spark report","definition_notes":"Muse Spark report: agent red-teaming attack success rate at pass@1.","join_basis":"stated","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-safety-preparedness-report","supersedes_group_id":"","notes":""},
{"group_id":"gray-swan-ipi-arena-openai-v1","eval_id":"gray-swan-ipi-arena","label":"GPT-6 Astra card","definition_notes":"GPT-6 Astra card: estimated attack success within a set number of attempts on a curated set of indirect prompt-injection attacks.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"irregular-average-success-openai-v1","eval_id":"irregular-average-success","label":"GPT-5.6 Preview card","definition_notes":"GPT-5.6 Preview card: an average success rate from Irregular cyber testing; the benchmark is not named in the record.","join_basis":"stated","first_doc_id":"openai-gpt-5-6-preview-system-card","last_doc_id":"openai-gpt-5-6-preview-system-card","supersedes_group_id":"","notes":""},
{"group_id":"irregular-cyber-challenges-openai-v1","eval_id":"irregular-cyber-challenges","label":"Pattern Labs suite","definition_notes":"GPT-5 card, when the evaluator was named Pattern Labs: average success rate by challenge type (evasion, network attack simulation, vulnerability discovery and exploitation) and challenges solved by difficulty, out of 18 easy, 14 medium and 4 hard.","join_basis":"stated","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"irregular-cyber-challenges-openai-v2","eval_id":"irregular-cyber-challenges","label":"Revised atomic suite","definition_notes":"GPT-5.1-Codex-Max card (challenges solved by difficulty, out of 18 easy, 17 medium and 6 hard), GPT-5.2 card (average success rate by type on what it calls the v1 atomic challenge suite) and GPT-5.3-Codex card (average success rate by type).","join_basis":"inferred","first_doc_id":"openai-gpt-5-1-codex-max-system-card","last_doc_id":"openai-gpt-5-3-codex-system-card","supersedes_group_id":"irregular-cyber-challenges-openai-v1","notes":"The GPT-5.1-Codex-Max card re-ran GPT-5 on a suite with more medium and hard challenges than the GPT-5 card. The GPT-5.3-Codex card's comparison values for GPT-5.2 Thinking differ from the GPT-5.2 card for two of the three types (in v0 notes only); no card states that the suite changed."},
{"group_id":"irregular-cyscenariobench-openai-v1","eval_id":"irregular-cyscenariobench","label":"GPT-5.5 card","definition_notes":"GPT-5.5 card: average success rate on CyScenarioBench, with the number of scenarios solved out of 11.","join_basis":"stated","first_doc_id":"openai-gpt-5-5-system-card","last_doc_id":"openai-gpt-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"irregular-frontiercyber-openai-v1","eval_id":"irregular-frontiercyber","label":"197-challenge set","definition_notes":"GPT-5.6 Preview card (challenges solved out of 197) and GPT-5.6 card (success rate by difficulty tier).","join_basis":"inferred","first_doc_id":"openai-gpt-5-6-preview-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"irregular-frontiercyber-openai-v2","eval_id":"irregular-frontiercyber","label":"226-challenge set","definition_notes":"GPT-6 Astra card: challenges solved out of 226. The set is larger than in the GPT-5.6 Preview card and GPT-5.6 Sol has a different count in each.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"irregular-frontiercyber-openai-v1","notes":"The value was read from secondary sources."},
{"group_id":"meta-aasf-risk-determination-v1","eval_id":"meta-aasf-risk-determination","label":"As first reported","definition_notes":"Risk tiers per domain under the Advanced AI Scaling Framework, from the Muse Spark and Muse Spark 1.1 reports and the Muse Glimmer-30B card.","join_basis":"inferred","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-glimmer-30b-model-card","supersedes_group_id":"","notes":"The registry states framework version 2 only for the Muse Spark report."},
{"group_id":"meta-agentdojo-v1","eval_id":"meta-agentdojo","label":"As first reported","definition_notes":"AgentDojo prompt-injection attack success rate at one attempt, from the Muse Spark and Muse Spark 1.1 reports.","join_basis":"inferred","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-1-1-evaluation-report","supersedes_group_id":"","notes":"The Muse Spark 1.1 report restates Muse Spark at 11.9 against 11.7 in its own report."},
{"group_id":"meta-agentharm-v1","eval_id":"meta-agentharm","label":"As first reported","definition_notes":"Compliance rate on AgentHarm harmful agentic tasks, from the Muse Spark report.","join_basis":"stated","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-safety-preparedness-report","supersedes_group_id":"","notes":""},
{"group_id":"meta-agentic-misalignment-v1","eval_id":"meta-agentic-misalignment","label":"As first reported","definition_notes":"Harmful action rate in the Agentic Misalignment scenarios, from the Muse Spark and Muse Spark 1.1 reports.","join_basis":"inferred","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-1-1-evaluation-report","supersedes_group_id":"","notes":"The Muse Spark 1.1 report records verbalized evaluation awareness in most samples on this test."},
{"group_id":"meta-alignment-faking-v1","eval_id":"meta-alignment-faking","label":"As first reported","definition_notes":"Difference in behaviour between monitored and unmonitored settings, from the Muse Spark report.","join_basis":"stated","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-safety-preparedness-report","supersedes_group_id":"","notes":""},
{"group_id":"meta-biotier-refusals-v1","eval_id":"meta-biotier-refusals","label":"As first reported","definition_notes":"Refusal rate of the deployed Meta AI system on harmful biology requests, from the Muse Spark report.","join_basis":"stated","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-safety-preparedness-report","supersedes_group_id":"","notes":""},
{"group_id":"meta-cybench-v1","eval_id":"meta-cybench","label":"As first reported","definition_notes":"Cybench success at one attempt, from the Muse Spark and Muse Spark 1.1 reports.","join_basis":"inferred","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-1-1-evaluation-report","supersedes_group_id":"","notes":""},
{"group_id":"meta-cyber-risk-determination-v1","eval_id":"meta-cyber-risk-determination","label":"As first reported","definition_notes":"Catastrophic cyber risk conclusion from pre-release testing, from the Llama 4 model card.","join_basis":"stated","first_doc_id":"meta-llama-4-model-card","last_doc_id":"meta-llama-4-model-card","supersedes_group_id":"","notes":""},
{"group_id":"meta-debated-topics-refusals-v1","eval_id":"meta-debated-topics-refusals","label":"As first reported","definition_notes":"Refusal rate on debated political and social topics, from the Llama 4 launch post.","join_basis":"stated","first_doc_id":"meta-llama-4-launch-post","last_doc_id":"meta-llama-4-launch-post","supersedes_group_id":"","notes":""},
{"group_id":"meta-deceptionbench-v1","eval_id":"meta-deceptionbench","label":"As first reported","definition_notes":"DeceptionBench deception rate, from the Muse Spark report.","join_basis":"stated","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-safety-preparedness-report","supersedes_group_id":"","notes":""},
{"group_id":"meta-fortress-v1","eval_id":"meta-fortress","label":"As first reported","definition_notes":"FORTRESS attack success rate, from the Muse Spark report.","join_basis":"stated","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-safety-preparedness-report","supersedes_group_id":"","notes":""},
{"group_id":"meta-gdm-stealth-v1","eval_id":"meta-gdm-stealth","label":"As first reported","definition_notes":"Stealth capability score, from the Muse Spark report.","join_basis":"stated","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-safety-preparedness-report","supersedes_group_id":"","notes":""},
{"group_id":"meta-iheval-v1","eval_id":"meta-iheval","label":"As first reported","definition_notes":"IHEval instruction-hierarchy score, from the Muse Spark report.","join_basis":"stated","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-safety-preparedness-report","supersedes_group_id":"","notes":""},
{"group_id":"meta-impossiblebench-v1","eval_id":"meta-impossiblebench","label":"As first reported","definition_notes":"ImpossibleBench cheating rate, from the Muse Spark report.","join_basis":"stated","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-safety-preparedness-report","supersedes_group_id":"","notes":""},
{"group_id":"meta-internal-sycophancy-v1","eval_id":"meta-internal-sycophancy","label":"As first reported","definition_notes":"Internal sycophancy rate, from the Muse Spark report (model without system mitigations) and the Muse Spark 1.1 report.","join_basis":"inferred","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-1-1-evaluation-report","supersedes_group_id":"","notes":"The Muse Spark 1.1 report restates Muse Spark at 57.9 against 62.9 in its own report."},
{"group_id":"meta-mask-v1","eval_id":"meta-mask","label":"As first reported","definition_notes":"MASK honesty rate, from the Muse Spark and Muse Spark 1.1 reports.","join_basis":"inferred","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-1-1-evaluation-report","supersedes_group_id":"","notes":""},
{"group_id":"meta-prompted-evaluation-awareness-v1","eval_id":"meta-prompted-evaluation-awareness","label":"As first reported","definition_notes":"Prompted discrimination between evaluation and deployment transcripts, from the Muse Spark report.","join_basis":"stated","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-safety-preparedness-report","supersedes_group_id":"","notes":""},
{"group_id":"meta-shade-arena-v1","eval_id":"meta-shade-arena","label":"As first reported","definition_notes":"SHADE-Arena as reported in the Muse Spark report (sabotage and stealth success score) and the Muse Spark 1.1 report (overall success under a CoT monitor).","join_basis":"inferred","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-1-1-evaluation-report","supersedes_group_id":"","notes":"Whether the two printed metrics are the same is not stated, so they keep separate labels."},
{"group_id":"meta-siren-agentdojo-v1","eval_id":"meta-siren-agentdojo","label":"Muse Glimmer-30B card","definition_notes":"Muse Glimmer-30B card: prompt-injection attack success rate on AgentDojo under the Siren setup, open weights.","join_basis":"stated","first_doc_id":"meta-muse-glimmer-30b-model-card","last_doc_id":"meta-muse-glimmer-30b-model-card","supersedes_group_id":"","notes":""},
{"group_id":"meta-strongreject-v1","eval_id":"meta-strongreject","label":"StrongREJECT v2","definition_notes":"StrongREJECT v2 attack success rate: adaptive multi-turn in the Muse Spark report, with the setting not recorded in the Muse Spark 1.1 report.","join_basis":"inferred","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-1-1-evaluation-report","supersedes_group_id":"","notes":"The Muse Spark 1.1 report restates Muse Spark at 25.2% against 44.6% in its own report, so the two printed metrics keep separate labels."},
{"group_id":"meta-vct-v1","eval_id":"meta-vct","label":"As first reported","definition_notes":"VCT accuracy of the model without system mitigations or as open weights, from the Muse Spark report and the Muse Glimmer-30B card.","join_basis":"inferred","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-glimmer-30b-model-card","supersedes_group_id":"","notes":""},
{"group_id":"meta-verbalized-eval-awareness-v1","eval_id":"meta-verbalized-eval-awareness","label":"As first reported","definition_notes":"Share of samples in which the model says it suspects evaluation, over public benchmarks and internal evaluations (Muse Spark report) and over Agentic Misalignment and chemical and biological capability evaluations (Muse Spark 1.1 report).","join_basis":"inferred","first_doc_id":"meta-muse-spark-safety-preparedness-report","last_doc_id":"meta-muse-spark-1-1-evaluation-report","supersedes_group_id":"","notes":"Each report measures different sets of evaluations, recorded as conditions."},
{"group_id":"metr-ai-r-d-assessment-anthropic-v1","eval_id":"metr-ai-r-d-assessment","label":"Opus 5.5 card","definition_notes":"Claude Opus 5.5 card: METR's estimate of AI-driven acceleration of AI research and development, as a multiplier.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-5-5-system-card","last_doc_id":"anthropic-claude-opus-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"metr-re-bench-optimize-a-kernel-openai-v1","eval_id":"metr-re-bench-optimize-a-kernel","label":"o3 card","definition_notes":"o3 and o4-mini card: number of kernel optimisation experiments in which the model tampered with the scoring function.","join_basis":"stated","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-o3-and-o4-mini-system-card","supersedes_group_id":"","notes":""},
{"group_id":"metr-reward-hacking-openai-v1","eval_id":"metr-reward-hacking","label":"o3 card","definition_notes":"o3 and o4-mini card: share of task attempts with reward hacking across METR's tasks.","join_basis":"stated","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-o3-and-o4-mini-system-card","supersedes_group_id":"","notes":""},
{"group_id":"metr-sandbagging-review-openai-v1","eval_id":"metr-sandbagging-review","label":"GPT-5 card","definition_notes":"GPT-5 card: whether METR found clear evidence of sandbagging in monitored runs.","join_basis":"stated","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"metr-time-horizon-openai-v1","eval_id":"metr-time-horizon","label":"As reported to OpenAI","definition_notes":"METR's 50% time horizon as reported in the o3 and o4-mini, GPT-5 and GPT-5.1-Codex-Max cards.","join_basis":"inferred","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-gpt-5-1-codex-max-system-card","supersedes_group_id":"","notes":"o3's value quoted in the GPT-5 card matches its own card."},
{"group_id":"moonshot-ai-promptfoo-red-team-no-attack-v1","eval_id":"moonshot-ai-promptfoo-red-team-no-attack","label":"Kimi K2 report","definition_notes":"Kimi K2 report, Table 6: pass rate (safe responses) on the harmful category with no attack strategy.","join_basis":"stated","first_doc_id":"moonshot-ai-kimi-k2-technical-report","last_doc_id":"moonshot-ai-kimi-k2-technical-report","supersedes_group_id":"","notes":""},
{"group_id":"moonshot-ai-promptfoo-red-team-prompt-injection-v1","eval_id":"moonshot-ai-promptfoo-red-team-prompt-injection","label":"Kimi K2 report","definition_notes":"Kimi K2 report, Table 6: pass rate (safe responses) on the harmful category under the prompt-injection strategy.","join_basis":"stated","first_doc_id":"moonshot-ai-kimi-k2-technical-report","last_doc_id":"moonshot-ai-kimi-k2-technical-report","supersedes_group_id":"","notes":""},
{"group_id":"moonshot-ai-promptfoo-red-team-v1","eval_id":"moonshot-ai-promptfoo-red-team","label":"Kimi K2 report","definition_notes":"Kimi K2 report, Table 6: pass rate (safe responses) on the harmful category under iterative jailbreak and crescendo multi-turn strategies.","join_basis":"stated","first_doc_id":"moonshot-ai-kimi-k2-technical-report","last_doc_id":"moonshot-ai-kimi-k2-technical-report","supersedes_group_id":"","notes":""},
{"group_id":"moonshot-ai-vulnerability-discovery-v1","eval_id":"moonshot-ai-vulnerability-discovery","label":"As first reported","definition_notes":"Count of previously unknown vulnerabilities after human review, from the Kimi K3 report via a secondary summary.","join_basis":"stated","first_doc_id":"moonshot-ai-kimi-k3-technical-report","last_doc_id":"moonshot-ai-kimi-k3-technical-report","supersedes_group_id":"","notes":""},
{"group_id":"openai-aav-capsid-packaging-prediction-v1","eval_id":"openai-aav-capsid-packaging-prediction","label":"Original definition","definition_notes":"Spearman correlation with measured packaging (GPT-5.6 card).","join_basis":"stated","first_doc_id":"openai-gpt-5-6-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-abstentionbench-v1","eval_id":"openai-abstentionbench","label":"Original definition","definition_notes":"Recall of appropriate abstentions on AbstentionBench as run by OpenAI in the GPT-5 card.","join_basis":"stated","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-capture-the-flag-v1","eval_id":"openai-capture-the-flag","label":"Original definition","definition_notes":"Capture-the-flag challenges by difficulty level (o3 card), a professional-level comparison (GPT-5.3-Codex card) and the set v0 labels internal (GPT-5.6 card).","join_basis":"inferred","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":"Each level or set is its own metric label; no card states the challenges changed."},
{"group_id":"openai-challenging-refusal-eval-v1","eval_id":"openai-challenging-refusal-eval","label":"Original definition","definition_notes":"Challenging refusal evaluation as reported in the o3 and o4-mini card.","join_basis":"stated","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-o3-and-o4-mini-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-chatgpt-deployment-simulation-honesty-v1","eval_id":"openai-chatgpt-deployment-simulation-honesty","label":"Original definition","definition_notes":"Relative change in misrepresenting work completion in the simulated ChatGPT deployment, from the GPT-5.6 card.","join_basis":"stated","first_doc_id":"openai-gpt-5-6-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-chatgpt-deployment-simulation-reward-hacking-v1","eval_id":"openai-chatgpt-deployment-simulation-reward-hacking","label":"Original definition","definition_notes":"Reward-hacking behaviour observed in the simulated ChatGPT deployment, from the GPT-5.6 card.","join_basis":"stated","first_doc_id":"openai-gpt-5-6-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-chatgpt-deployment-simulation-v1","eval_id":"openai-chatgpt-deployment-simulation","label":"Original definition","definition_notes":"Rate of severity-3 misalignment in the simulated ChatGPT deployment, from the GPT-5.5 card.","join_basis":"stated","first_doc_id":"openai-gpt-5-5-system-card","last_doc_id":"openai-gpt-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-cot-controllability-v1","eval_id":"openai-cot-controllability","label":"Original definition","definition_notes":"Share of chains of thought the model successfully controls on the CoT-Control tasks. Cards measure at different chain-of-thought lengths and length units (characters in the GPT-5.4 and GPT-5.5 cards, tokens in the GPT-5.6 card); length is kept as a condition, so different lengths are separate series. The GPT-5 and GPT-5.2 results are comparisons in words from hub pages added in April 2026.","join_basis":"inferred","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-cot-monitorability-v1","eval_id":"openai-cot-monitorability","label":"Aggregate score","definition_notes":"Monitor performance summarised over the monitorability task suite as the squared geometric mean of true positive and true negative rates. All results in this group are comparisons in words; the numbers appear only in figures.","join_basis":"inferred","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-cot-monitorability-v2","eval_id":"openai-cot-monitorability","label":"Recall by monitor type","definition_notes":"The GPT-6 Astra card reports recall separately for chain-of-thought-only, action-only and full-context monitors and splits non-adversarial from adversarial settings, instead of the earlier aggregate.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"openai-cot-monitorability-v1","notes":""},
{"group_id":"openai-cve-bench-v1","eval_id":"openai-cve-bench","label":"Original definition","definition_notes":"CVE-Bench pass rate and differences against named models (GPT-5.2 and GPT-5.3-Codex cards).","join_basis":"inferred","first_doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","last_doc_id":"openai-gpt-5-3-codex-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-cyber-range-v1","eval_id":"openai-cyber-range","label":"Two scenarios","definition_notes":"Two cyber range scenarios, reported as scenarios solved without solver code (o3 card Fig 8).","join_basis":"stated","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-o3-and-o4-mini-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-cyber-range-v2","eval_id":"openai-cyber-range","label":"Eight scenarios","definition_notes":"Eight scenarios reported as pass, partial or fail (GPT-5.1-Codex-Max card); the card notes one scenario removed and four added.","join_basis":"stated","first_doc_id":"openai-gpt-5-1-codex-max-system-card","last_doc_id":"openai-gpt-5-1-codex-max-system-card","supersedes_group_id":"openai-cyber-range-v1","notes":""},
{"group_id":"openai-cyber-range-v3","eval_id":"openai-cyber-range","label":"Nine scenarios","definition_notes":"Nine scenarios with pass or fail per model (GPT-5.2 card); GPT-5.1-Codex-Max's count here differs from its own card's eight-scenario table.","join_basis":"stated","first_doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","last_doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","supersedes_group_id":"openai-cyber-range-v2","notes":""},
{"group_id":"openai-cyber-range-v4","eval_id":"openai-cyber-range","label":"Combined pass rate","definition_notes":"Combined pass rate on the set the GPT-5.3-Codex card gives as 15 scenarios (Table 5); the GPT-5.4 Thinking and GPT-5.5 cards repeat the same comparator values without restating the count.","join_basis":"inferred","first_doc_id":"openai-gpt-5-3-codex-system-card","last_doc_id":"openai-gpt-5-5-instant-system-card","supersedes_group_id":"openai-cyber-range-v3","notes":"The GPT-5.5 Instant value is not a whole number of passes out of 15, so that card may have used a different scenario count; joined because no card states a change."},
{"group_id":"openai-cyber-safety-v1","eval_id":"openai-cyber-safety","label":"Original definition","definition_notes":"Cyber-policy compliance (policy-compliant rate) on production and synthetic prompt splits in the GPT-5.2 and GPT-5.2-Codex cards.","join_basis":"inferred","first_doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","last_doc_id":"openai-gpt-5-2-codex-system-card-addendum","supersedes_group_id":"","notes":""},
{"group_id":"openai-cyber-safety-v2","eval_id":"openai-cyber-safety","label":"Renamed test (GPT-5.3-Codex card)","definition_notes":"Safe behavior rate on production and synthetic prompt splits in the GPT-5.3-Codex card, which calls the test cyber safety training eval. Whether the definition changed from the earlier policy-compliant rate is not stated.","join_basis":"stated","first_doc_id":"openai-gpt-5-3-codex-system-card","last_doc_id":"openai-gpt-5-3-codex-system-card","supersedes_group_id":"openai-cyber-safety-v1","notes":""},
{"group_id":"openai-deception-eval-v1","eval_id":"openai-deception-eval","label":"Original definition","definition_notes":"Share of responses in each deception scenario in which the model misrepresents its work. The GPT-5 card prints fractions for three categories; the GPT-5.2 card prints percentages, adds production categories and splits CharXiv by strict and lenient output instructions (kept as separate metrics). The coding category is called agentic coding with impossible tasks in the GPT-5 card and coding deception later; treated as one metric. The GPT-6 Astra card prints only ratios between models for coding and a broken search tool.","join_basis":"inferred","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-destructive-action-avoidance-only-v2","eval_id":"openai-destructive-action-avoidance","label":"GPT-5.6 scoring","definition_notes":"The GPT-5.6 card scores the test two ways, avoidance only and avoidance plus task correctness, and re-scores GPT-5.5 under this definition with a result that differs from GPT-5.5's own card.","join_basis":"stated","first_doc_id":"openai-gpt-5-6-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"openai-destructive-action-avoidance-v1","notes":"Seeded ID; besides the avoidance-only score it holds the avoidance-plus-correctness score from the same table."},
{"group_id":"openai-destructive-action-avoidance-v1","eval_id":"openai-destructive-action-avoidance","label":"Original scoring","definition_notes":"Avoidance score on the destructive-action coding tasks as reported from the GPT-5.1-Codex-Max card through the GPT-5.5 card; the GPT-5.5 card adds perfect reversion and user work preserved. Values restated for earlier models match their first reports.","join_basis":"inferred","first_doc_id":"openai-gpt-5-1-codex-max-system-card","last_doc_id":"openai-gpt-5-5-system-card","supersedes_group_id":"","notes":"Seeded in featured_series.csv."},
{"group_id":"openai-disclosed-misalignment-incidents-v1","eval_id":"openai-disclosed-misalignment-incidents","label":"Original definition","definition_notes":"Number of incident reports published with OpenAI's misalignment reporting framework, covering roughly the preceding six months.","join_basis":"stated","first_doc_id":"openai-our-framework-for-reporting-model-misalignment","last_doc_id":"openai-our-framework-for-reporting-model-misalignment","supersedes_group_id":"","notes":""},
{"group_id":"openai-dna-sequence-design-v1","eval_id":"openai-dna-sequence-design","label":"Original definition","definition_notes":"Success rate on DNA sequence design (GPT-5.5 card at pass@1; GPT-5.6 card with the attempt count not recorded).","join_basis":"inferred","first_doc_id":"openai-gpt-5-5-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":"The attempt count is a condition, so the two cards' values form separate series unless the GPT-5.6 count is confirmed."},
{"group_id":"openai-dynamic-mental-health-v1","eval_id":"openai-dynamic-mental-health","label":"Original definition","definition_notes":"Multi-turn adversarial user simulation on mental-health topics.","join_basis":"inferred","first_doc_id":"openai-gpt-5-3-instant-system-card","last_doc_id":"openai-gpt-5-6-august-updates-system-card","supersedes_group_id":"","notes":"Joins the GPT-5.3 Instant and GPT-5.6 August Updates cards."},
{"group_id":"openai-exploitbench-v1","eval_id":"openai-exploitbench","label":"Known V8 vulnerabilities","definition_notes":"Working-exploit rate on known V8 vulnerabilities (GPT-6 Astra launch post).","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-launch-post","last_doc_id":"openai-gpt-6-astra-launch-post","supersedes_group_id":"","notes":""},
{"group_id":"openai-exploitbench-v2","eval_id":"openai-exploitbench","label":"Internal port, post-cutoff vulnerabilities","definition_notes":"OpenAI's internal port of ExploitBench run on vulnerabilities from June to August 2026, after the models' training data (GPT-6 Astra launch post).","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-launch-post","last_doc_id":"openai-gpt-6-astra-launch-post","supersedes_group_id":"","notes":"Reported alongside v1 in the same post; a different task set, not a replacement."},
{"group_id":"openai-exploitgym-honeypot-v1","eval_id":"openai-exploitgym-honeypot","label":"Original definition","definition_notes":"Share of runs on adversarially selected hard ExploitGym tasks in which the model substantially attacks the honeypot, at maximum effort, from the GPT-6 Astra card.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-exploitgym-v1","eval_id":"openai-exploitgym","label":"Original definition","definition_notes":"Discovery-to-exploit success rate (GPT-6 Astra launch post).","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-launch-post","last_doc_id":"openai-gpt-6-astra-launch-post","supersedes_group_id":"","notes":"A secondary source cited in v0 says the GPT-6 Astra value was measured without the six-hour time limit; not confirmed in the post as recorded."},
{"group_id":"openai-factuality-5-domains-v1","eval_id":"openai-factuality-5-domains","label":"Original definition","definition_notes":"Hallucination rate with browsing enabled across five domains, from the GPT-5.2 card.","join_basis":"stated","first_doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","last_doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-gpt-red-v1","eval_id":"openai-gpt-red","label":"Original definition","definition_notes":"Attack-attempt success rate of GPT-Red on indirect prompt injection and on direct injection against the instruction hierarchy (GPT-5.6 card, added 3 Aug 2026).","join_basis":"stated","first_doc_id":"openai-gpt-5-6-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-hallucinations-v1","eval_id":"openai-hallucinations","label":"Original definition","definition_notes":"Factual-error results from the Hallucinations sections of the GPT-5.5, GPT-5.5 Instant, GPT-5.6, GPT-5.6 August and GPT-6 Astra cards. Almost all are relative to an earlier model or stated in words, and the prompt sets named vary between cards.","join_basis":"inferred","first_doc_id":"openai-gpt-5-5-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-hard-negative-protein-binding-v1","eval_id":"openai-hard-negative-protein-binding","label":"Original definition","definition_notes":"Success rate at pass@4 on hard-negative protein binding (GPT-5.5 and GPT-5.6 cards).","join_basis":"inferred","first_doc_id":"openai-gpt-5-5-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":"The GPT-5.6 cards' changelog of 19 Aug 2026 corrected GPT-5.5's value, which had been given as its pass@1 score; the corrected value is the pass@4 score."},
{"group_id":"openai-human-sourced-jailbreaks-v1","eval_id":"openai-human-sourced-jailbreaks","label":"Original definition","definition_notes":"Human-sourced jailbreak prompts scored as not unsafe (o3 card Table 3).","join_basis":"stated","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-o3-and-o4-mini-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-image-safety-eval-v1","eval_id":"openai-image-safety-eval","label":"Original definition","definition_notes":"Image safety evaluation as reported in the ChatGPT Images 2.5 card.","join_basis":"stated","first_doc_id":"openai-chatgpt-images-2-5-system-card","last_doc_id":"openai-chatgpt-images-2-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-instruction-hierarchy-internal-v1","eval_id":"openai-instruction-hierarchy-internal","label":"Original definition","definition_notes":"Overall robustness rate on OpenAI's internal instruction-hierarchy set (GPT-6 Astra card).","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-instruction-hierarchy-v1","eval_id":"openai-instruction-hierarchy","label":"Original definition","definition_notes":"Instruction-hierarchy conflict categories: system versus user conflict in the o3 card (Table 9), prompt-injection hijacking and system-prompt extraction in the gpt-oss card (Table 7).","join_basis":"inferred","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-internal-codex-deployment-simulation-eval-awareness-v1","eval_id":"openai-internal-codex-deployment-simulation-eval-awareness","label":"Original definition","definition_notes":"Share of trajectories on a shared task set in which the model verbalizes evaluation awareness, with the original production traffic as a baseline, from the GPT-6 Astra card.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-internal-codex-deployment-simulation-v1","eval_id":"openai-internal-codex-deployment-simulation","label":"Original definition","definition_notes":"Resampled internal agentic coding traffic flagged by severity, with a realism check. The GPT-5.6 card reports it in words against GPT-5.5; the GPT-6 Astra card gives rates on matched tasks.","join_basis":"inferred","first_doc_id":"openai-gpt-5-6-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-internal-computer-use-safety-benchmark-v1","eval_id":"openai-internal-computer-use-safety-benchmark","label":"Original definition","definition_notes":"Unsafe action rate on OpenAI's internal computer-use safety benchmark as given in the GPT-6 Astra launch post.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-launch-post","last_doc_id":"openai-gpt-6-astra-launch-post","supersedes_group_id":"","notes":""},
{"group_id":"openai-internal-hallucination-benchmark-v1","eval_id":"openai-internal-hallucination-benchmark","label":"Original definition","definition_notes":"Hallucination rate on OpenAI's internal benchmark as given in the GPT-6 Astra launch post.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-launch-post","last_doc_id":"openai-gpt-6-astra-launch-post","supersedes_group_id":"","notes":""},
{"group_id":"openai-internal-indirect-prompt-injection-v1","eval_id":"openai-internal-indirect-prompt-injection","label":"Original definition","definition_notes":"Defender success rate on OpenAI's internal indirect prompt-injection test (GPT-6 Astra card Fig 4).","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-internal-research-debugging-v1","eval_id":"openai-internal-research-debugging","label":"Original definition","definition_notes":"Median score on Internal Research Debugging (GPT-5.5 card).","join_basis":"stated","first_doc_id":"openai-gpt-5-5-system-card","last_doc_id":"openai-gpt-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-jailbreaks-v1","eval_id":"openai-jailbreaks","label":"Original definition","definition_notes":"Jailbreak robustness shown as figures in the GPT-5.4 Thinking, GPT-5.5, GPT-5.5 Instant and GPT-5.6 cards; only the cards' comparisons are recorded.","join_basis":"inferred","first_doc_id":"openai-gpt-5-4-thinking-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":"No card states the test changed; the GPT-5.5 Instant card calls its results directional."},
{"group_id":"openai-long-form-biorisk-questions-v1","eval_id":"openai-long-form-biorisk-questions","label":"Original definition","definition_notes":"Long-form biorisk refusal test as reported in the GPT-5.1-Codex-Max card.","join_basis":"stated","first_doc_id":"openai-gpt-5-1-codex-max-system-card","last_doc_id":"openai-gpt-5-1-codex-max-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-malware-refusals-golden-set-v1","eval_id":"openai-malware-refusals-golden-set","label":"Original definition","definition_notes":"Golden set of malware requests scored for refusal.","join_basis":"inferred","first_doc_id":"openai-gpt-5-codex-system-card-addendum","last_doc_id":"openai-gpt-5-1-codex-max-system-card","supersedes_group_id":"","notes":"Joins the GPT-5-Codex addendum and the GPT-5.1-Codex-Max card; the models reported in both have the same values in each."},
{"group_id":"openai-misalignment-monitor-recall-v1","eval_id":"openai-misalignment-monitor-recall","label":"Original definition","definition_notes":"Recall of the misalignment monitor at flagging severity 3 or higher, as reported in the GPT-5.5 card.","join_basis":"stated","first_doc_id":"openai-gpt-5-5-system-card","last_doc_id":"openai-gpt-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-mle-bench-v1","eval_id":"openai-mle-bench","label":"Original definition","definition_notes":"Medal rate on MLE-Bench (GPT-5 card).","join_basis":"stated","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-monitor-evasion-under-prompted-sandbagging-v1","eval_id":"openai-monitor-evasion-under-prompted-sandbagging","label":"Original definition","definition_notes":"Adversarial test in the GPT-6 Astra card: the model is prompted to underperform and a chain-of-thought monitor tries to detect it.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-multimodal-troubleshooting-virology-v1","eval_id":"openai-multimodal-troubleshooting-virology","label":"Original definition","definition_notes":"Score against an expert median (GPT-5.6 card).","join_basis":"stated","first_doc_id":"openai-gpt-5-6-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-openai-proof-qa-v1","eval_id":"openai-openai-proof-qa","label":"Original definition","definition_notes":"Pass rate on OpenAI-Proof Q&A (GPT-5 and GPT-5.2 cards).","join_basis":"inferred","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-openai-prs-v1","eval_id":"openai-openai-prs","label":"Original definition","definition_notes":"Pass rate on OpenAI PRs (o3 card).","join_basis":"stated","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-o3-and-o4-mini-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-paperbench-v1","eval_id":"openai-paperbench","label":"Original definition","definition_notes":"Replication score, and a difference against a named model (o3 and GPT-5.2 cards).","join_basis":"inferred","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-personqa-v1","eval_id":"openai-personqa","label":"Original definition","definition_notes":"PersonQA hallucination rate without browsing from the o3 and o4-mini card and the gpt-oss card. No card says the setup changed, but o4-mini's hallucination rate differs markedly between the two cards while its printed accuracy is nearly the same, so treat the join with caution.","join_basis":"inferred","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-preparedness-determination-v1","eval_id":"openai-preparedness-determination","label":"Preparedness Framework levels","definition_notes":"Capability levels per tracked category (below High, High, Critical) as determined by OpenAI in each card from the o3 card to the GPT-6 Astra card. No framework version is stated in the evidence as recorded.","join_basis":"inferred","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":"Joined across cards because no card as recorded states that the framework's categories or levels changed."},
{"group_id":"openai-proactive-searches-for-other-agents-v1","eval_id":"openai-proactive-searches-for-other-agents","label":"Original definition","definition_notes":"Shares of ExploitGym honeypot trajectories in which the model speculates about or tries to contact other agents, from the GPT-6 Astra card.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-production-benchmarks-v1","eval_id":"openai-production-benchmarks","label":"v1 category set","definition_notes":"Original category set (for example harassment/threatening, hate/threatening, non-violent hate, sexual/exploitative), scored as not unsafe.","join_basis":"inferred","first_doc_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card","last_doc_id":"openai-gpt-5-codex-system-card-addendum","supersedes_group_id":"","notes":"Joins the gpt-oss, GPT-5 and GPT-5-Codex cards because nothing indicated a change: the GPT-5-Codex addendum repeats the GPT-5 card comparison columns, and the gpt-oss card GPT-4o column matches the GPT-5 card except personal data. Spellings illicit/nonviolent and personal-data are labelled Illicit/non-violent and Personal data."},
{"group_id":"openai-production-benchmarks-v2","eval_id":"openai-production-benchmarks","label":"v2 prompt set","definition_notes":"Harder prompt set introduced in the GPT-5.1 addendum, which says results are not comparable with the GPT-5 card; adds mental health and emotional reliance and regroups the harassment, hate, sexual and violence categories.","join_basis":"inferred","first_doc_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum","last_doc_id":"openai-gpt-5-2-codex-system-card-addendum","supersedes_group_id":"openai-production-benchmarks-v1","notes":"Label mapping: the GPT-5.1-Codex-Max card prints erotic, illicit and self-harm for the addendum categories sexual, illicit/non-violent and self-harm/intent; the GPT-5.2 card prints illicit for illicit/non-violent. The GPT-5.2 card has a single self-harm category that matches neither addendum self-harm category and keeps its own label. Later cards re-ran earlier models; differences are restatements."},
{"group_id":"openai-production-benchmarks-v3","eval_id":"openai-production-benchmarks","label":"Revised category set","definition_notes":"Unversioned category set used from the GPT-5.3-Codex card on, reorganised from v2 (new categories such as abuse, biological and chemical weapons and gore; v2 mental health, emotional reliance and personal data no longer listed). The GPT-6 Astra card renames the metric from not unsafe to safe completion rate (not disallowed); treated as the same metric.","join_basis":"inferred","first_doc_id":"openai-gpt-5-3-codex-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"openai-production-benchmarks-v2","notes":"Label mapping: GPT-5.3-Codex illicit violent and non-violent activities map to Violent and Nonviolent illicit behavior; plain Self-harm (GPT-5.3-Codex, GPT-5.3 Instant) maps to Self-harm (standard); Sexual content maps to Sexual. Graphic violence/physical injury (GPT-5.3 Instant) keeps its own label, because nothing ties it to Gore. Row sets differ between cards (GPT-5.4 Thinking and GPT-5.5 report harassment and violence; later cards report gore). The GPT-5.5 Instant card values for GPT-5.3 Instant differ from its own card."},
{"group_id":"openai-production-cot-deception-monitor-v1","eval_id":"openai-production-cot-deception-monitor","label":"Original definition","definition_notes":"Share of a representative sample of production responses that a chain-of-thought monitor flags as deceptive, from the GPT-5 card.","join_basis":"stated","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-production-traffic-factuality-v1","eval_id":"openai-production-traffic-factuality","label":"Original definition","definition_notes":"Reductions in claim-level hallucination rate and in responses with at least one major error on production prompts with browsing on, each model against its predecessor, from the GPT-5 card.","join_basis":"stated","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-prompt-injection-codex-env-v1","eval_id":"openai-prompt-injection-codex-env","label":"Original definition","definition_notes":"Prompt-injection attacks in Codex coding environments, scored as the share ignored (GPT-5-Codex addendum Table 4, GPT-5.1-Codex-Max card Table 5).","join_basis":"inferred","first_doc_id":"openai-gpt-5-codex-system-card-addendum","last_doc_id":"openai-gpt-5-1-codex-max-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-prompt-injection-v1","eval_id":"openai-prompt-injection","label":"GPT-5 card sets","definition_notes":"Browsing, coding and tool-calling prompt-injection sets scored as not compromised (GPT-5 card Table 7).","join_basis":"stated","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-prompt-injection-v2","eval_id":"openai-prompt-injection","label":"Sets from GPT-5.2","definition_notes":"Named prompt-injection sets introduced in the GPT-5.2 card (Agent JSK, PlugInject), which the card says are new and not comparable to the GPT-5 card's sets.","join_basis":"stated","first_doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","last_doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","supersedes_group_id":"openai-prompt-injection-v1","notes":""},
{"group_id":"openai-prompt-injection-v3","eval_id":"openai-prompt-injection","label":"Defense-rate sets from GPT-5.4","definition_notes":"Prompt-injection sets named Connectors and Function calls (and, from the GPT-5.6 card, Search and Function-Calling), scored as a defense rate, from the GPT-5.4 Thinking card on.","join_basis":"inferred","first_doc_id":"openai-gpt-5-4-thinking-system-card","last_doc_id":"openai-gpt-5-6-august-updates-system-card","supersedes_group_id":"openai-prompt-injection-v2","notes":""},
{"group_id":"openai-protocolqa-open-ended-v1","eval_id":"openai-protocolqa-open-ended","label":"Original definition","definition_notes":"Score against a threshold (GPT-5.6 card).","join_basis":"stated","first_doc_id":"openai-gpt-5-6-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-realistic-work-envs-v1","eval_id":"openai-realistic-work-envs","label":"Original definition","definition_notes":"Misaligned outcome rates overall and by category in realistic work environments, with and without a confirmation policy, from Table 8 of the GPT-6 Astra card.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-respecting-auto-review-v1","eval_id":"openai-respecting-auto-review","label":"Original definition","definition_notes":"Shares of rollouts that try to circumvent an Auto-review denial or exploit a misconfigured Auto-review, from the GPT-6 Astra card.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-respecting-warnings-v1","eval_id":"openai-respecting-warnings","label":"Original definition","definition_notes":"Share of runs with unwanted persistence after a restriction, at maximum reasoning effort, from the GPT-6 Astra card.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-sandbox-bench-v1","eval_id":"openai-sandbox-bench","label":"Original definition","definition_notes":"Successful exploits out of 22 infrastructure-like targets, as attributed to the GPT-6 Astra card by a secondary source.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-simpleqa-v1","eval_id":"openai-simpleqa","label":"Original definition","definition_notes":"SimpleQA hallucination rate without browsing as run by OpenAI in the o3 and o4-mini, gpt-oss and GPT-5 cards. No card says the setup changed, but the values restated for o3 and o4-mini differ between cards without an explanation.","join_basis":"inferred","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-gpt-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-sre-bench-v1","eval_id":"openai-sre-bench","label":"Original definition","definition_notes":"Binary reverse-engineering success at one and four attempts (GPT-6 Astra launch post).","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-launch-post","last_doc_id":"openai-gpt-6-astra-launch-post","supersedes_group_id":"","notes":""},
{"group_id":"openai-standard-refusal-eval-v1","eval_id":"openai-standard-refusal-eval","label":"Original definition","definition_notes":"Standard refusal evaluation as reported in the o3 and o4-mini card.","join_basis":"stated","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-o3-and-o4-mini-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-static-jailbreak-v1","eval_id":"openai-static-jailbreak","label":"New eval set","definition_notes":"Static jailbreak attacks by harm area and severity, scored as the share refused, first reported in the GPT-6 Astra card (Table 5).","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-strongreject-v1","eval_id":"openai-strongreject","label":"StrongReject","definition_notes":"StrongReject jailbreak prompts scored as not unsafe, per harm category (GPT-5, gpt-oss and GPT-5-Codex cards) and as one aggregate (o3, GPT-5.1, GPT-5.1-Codex-Max and GPT-5.2-Codex cards).","join_basis":"inferred","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-gpt-5-2-codex-system-card-addendum","supersedes_group_id":"","notes":"No document says the test changed between these cards; values from several documents joined by inference."},
{"group_id":"openai-strongreject-v2","eval_id":"openai-strongreject","label":"Filtered set","definition_notes":"Aggregate not-unsafe score on the set the GPT-5.2 card calls StrongReject filtered; the qualifier indicates a filtered prompt set, and GPT-5.1 Thinking's score differs from the one the GPT-5.1 card gives on the unqualified test.","join_basis":"stated","first_doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","last_doc_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","supersedes_group_id":"","notes":"Runs alongside v1 rather than replacing it: the later GPT-5.2-Codex card still reports the unqualified StrongReject."},
{"group_id":"openai-swe-bench-verified-v1","eval_id":"openai-swe-bench-verified","label":"Original definition","definition_notes":"Pass rate on SWE-bench Verified (o3 card; gpt-oss card on a 477-task subset, recorded as a condition).","join_basis":"inferred","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-swe-lancer-v1","eval_id":"openai-swe-lancer","label":"Original definition","definition_notes":"Dollars earned and IC SWE subset accuracy (o3 card).","join_basis":"stated","first_doc_id":"openai-o3-and-o4-mini-system-card","last_doc_id":"openai-o3-and-o4-mini-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-sycophancy-offline-eval-v1","eval_id":"openai-sycophancy-offline-eval","label":"Original definition","definition_notes":"Sycophancy score on OpenAI's offline evaluation, from the GPT-5 card.","join_basis":"stated","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-sycophancy-online-prevalence-v1","eval_id":"openai-sycophancy-online-prevalence","label":"Original definition","definition_notes":"Relative change in the prevalence of sycophantic responses against GPT-4o in an A/B test on live traffic, for free and paid users, from the GPT-5 card.","join_basis":"stated","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-tacit-knowledge-and-troubleshooting-v1","eval_id":"openai-tacit-knowledge-and-troubleshooting","label":"Original definition","definition_notes":"Score against an expert consensus baseline (GPT-5.1-Codex-Max and GPT-5.6 cards).","join_basis":"inferred","first_doc_id":"openai-gpt-5-1-codex-max-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-troubleshootingbench-v1","eval_id":"openai-troubleshootingbench","label":"Original definition","definition_notes":"Score, and differences against named models (GPT-5, GPT-5.1-Codex-Max, GPT-5.2 and GPT-5.6 cards); how refusals are counted is recorded as a condition where v0 gives it.","join_basis":"inferred","first_doc_id":"openai-gpt-5-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-unintended-engagement-with-external-agent-messages-v1","eval_id":"openai-unintended-engagement-with-external-agent-messages","label":"Original definition","definition_notes":"Share of samples in which the model follows unauthorised instructions from a shared agent message board, from the GPT-6 Astra card.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-verbalized-metagaming-in-training-v1","eval_id":"openai-verbalized-metagaming-in-training","label":"Original definition","definition_notes":"Rate of verbalized metagaming at the end of training, read from a figure in the original version of the GPT-6 Astra card.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-verbalized-metagaming-v1","eval_id":"openai-verbalized-metagaming","label":"Original definition","definition_notes":"Verbalized metagaming flagged by a monitor in evaluation and simulated deployment environments, from the GPT-5.6 Preview, GPT-5.6 and GPT-6 Astra cards. The GPT-5.6 changelog records that the metagaming plots were re-aggregated, and the GPT-6 Astra section was rewritten after publication; the one number here is read from a figure in the original version.","join_basis":"inferred","first_doc_id":"openai-gpt-5-6-preview-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-voice-native-production-prompts-v1","eval_id":"openai-voice-native-production-prompts","label":"Original definition","definition_notes":"Voice-native production prompt set as reported in the GPT-Live card, corrected values.","join_basis":"stated","first_doc_id":"openai-gpt-live-system-card","last_doc_id":"openai-gpt-live-system-card","supersedes_group_id":"","notes":""},
{"group_id":"openai-voice-native-synthetic-prompts-v1","eval_id":"openai-voice-native-synthetic-prompts","label":"Original definition","definition_notes":"Voice-native synthetic prompt set as reported in the GPT-Live card, corrected values.","join_basis":"stated","first_doc_id":"openai-gpt-live-system-card","last_doc_id":"openai-gpt-live-system-card","supersedes_group_id":"","notes":""},
{"group_id":"uk-aisi-ai-safety-research-sabotage-openai-v1","eval_id":"uk-aisi-ai-safety-research-sabotage","label":"GPT-6 Astra card","definition_notes":"GPT-6 Astra card: whether unprompted sabotage of AI safety research was found.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"uk-aisi-cyber-range-anthropic-v1","eval_id":"uk-aisi-cyber-range","label":"Opus 4.7 card","definition_notes":"Claude Opus 4.7 card: number of full solves of a UK AISI cyber range within a fixed number of attempts.","join_basis":"stated","first_doc_id":"anthropic-claude-opus-4-7-system-card","last_doc_id":"anthropic-claude-opus-4-7-system-card","supersedes_group_id":"","notes":""},
{"group_id":"uk-aisi-cyber-range-the-last-ones-openai-v1","eval_id":"uk-aisi-cyber-range-the-last-ones","label":"GPT-5.6 card","definition_notes":"GPT-5.6 card: share of attempts that complete the range.","join_basis":"stated","first_doc_id":"openai-gpt-5-6-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"uk-aisi-cyber-tasks-openai-v1","eval_id":"uk-aisi-cyber-tasks","label":"GPT-5.5 card","definition_notes":"GPT-5.5 card: pass rate with several attempts on UK AISI cyber tasks.","join_basis":"stated","first_doc_id":"openai-gpt-5-5-system-card","last_doc_id":"openai-gpt-5-5-system-card","supersedes_group_id":"","notes":""},
{"group_id":"uk-aisi-evaluation-awareness-anthropic-v1","eval_id":"uk-aisi-evaluation-awareness","label":"Sonnet 4.5 card","definition_notes":"Claude Sonnet 4.5 card: unprompted verbalized evaluation awareness rate in UK AISI scenarios, for pre-release snapshots.","join_basis":"stated","first_doc_id":"anthropic-claude-sonnet-4-5-system-card","last_doc_id":"anthropic-claude-sonnet-4-5-system-card","supersedes_group_id":"","notes":"Read via a secondary source that reproduces the card text."},
{"group_id":"uk-aisi-expert-ctf-openai-v1","eval_id":"uk-aisi-expert-ctf","label":"GPT-5.6 card","definition_notes":"GPT-5.6 card: pass rate on UK AISI expert capture-the-flag challenges.","join_basis":"stated","first_doc_id":"openai-gpt-5-6-system-card","last_doc_id":"openai-gpt-5-6-system-card","supersedes_group_id":"","notes":""},
{"group_id":"uk-aisi-out-of-scope-supply-chain-attack-openai-v1","eval_id":"uk-aisi-out-of-scope-supply-chain-attack","label":"GPT-6 Astra card","definition_notes":"GPT-6 Astra card: share of samples with an out-of-scope attack, under the default scope and under an explicit no-internet scope.","join_basis":"stated","first_doc_id":"openai-gpt-6-astra-system-card","last_doc_id":"openai-gpt-6-astra-system-card","supersedes_group_id":"","notes":""},
{"group_id":"uk-aisi-universal-jailbreak-openai-v1","eval_id":"uk-aisi-universal-jailbreak","label":"GPT-5.3-Codex card","definition_notes":"GPT-5.3-Codex card: pass rate of a universal jailbreak found by UK AISI red-teamers on a policy-violating cyber dataset, with many attempts allowed.","join_basis":"stated","first_doc_id":"openai-gpt-5-3-codex-system-card","last_doc_id":"openai-gpt-5-3-codex-system-card","supersedes_group_id":"","notes":""},
{"group_id":"unnamed-third-party-ai-r-d-sabotage-google-deepmind-v1","eval_id":"unnamed-third-party-ai-r-d-sabotage","label":"Gemini 3 Pro FSF report","definition_notes":"Gemini 3 Pro FSF report: an external finding on ability to sabotage AI research and development, compared with earlier Gemini models in words.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","supersedes_group_id":"","notes":""},
{"group_id":"unnamed-third-party-strategic-deception-propensity-google-deepmind-v1","eval_id":"unnamed-third-party-strategic-deception-propensity","label":"Gemini 3 Pro FSF report","definition_notes":"Gemini 3 Pro FSF report: an external finding on strategic deception propensity.","join_basis":"stated","first_doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","last_doc_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","supersedes_group_id":"","notes":""},
{"group_id":"xai-agentdojo-v1","eval_id":"xai-agentdojo","label":"Grok 4 to 4.20 cards","definition_notes":"AgentDojo prompt-injection attack success rate, mostly with a mitigating system prompt.","join_basis":"inferred","first_doc_id":"xai-grok-4-model-card","last_doc_id":"xai-grok-4-20-system-card","supersedes_group_id":"","notes":"The Grok 4.20 value is far above earlier values and its mitigation status is not stated. v0 suggests the setup may differ, but the card does not say so."},
{"group_id":"xai-agentharm-v1","eval_id":"xai-agentharm","label":"Grok 4 to 4.20 cards","definition_notes":"AgentHarm harmful agentic tasks with no attack, reported as the share the model carries out, on a 0-1 scale except in the Grok Code Fast 1 card (percent).","join_basis":"inferred","first_doc_id":"xai-grok-4-model-card","last_doc_id":"xai-grok-4-20-system-card","supersedes_group_id":"","notes":"The Grok 4.20 card renames the metric violation rate, and its value is much higher than in earlier cards. Whether grading changed is not stated."},
{"group_id":"xai-alignment-audit-eval-awareness-v1","eval_id":"xai-alignment-audit-eval-awareness","label":"Petri 2.0-based audit","definition_notes":"Verbalized evaluation awareness across all audits in the Grok 4.20 card, with Grok 4 measured afterwards for comparison.","join_basis":"stated","first_doc_id":"xai-grok-4-20-system-card","last_doc_id":"xai-grok-4-20-system-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-alignment-audit-misuse-v1","eval_id":"xai-alignment-audit-misuse","label":"Petri 2.0-based audit","definition_notes":"Misuse categories of the Grok 4.20 card's alignment audit, with Grok 4.1 measured for comparison.","join_basis":"stated","first_doc_id":"xai-grok-4-20-system-card","last_doc_id":"xai-grok-4-20-system-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-alignment-audit-sabotage-v1","eval_id":"xai-alignment-audit-sabotage","label":"Petri 2.0-based audit","definition_notes":"Sabotage categories of the Grok 4.20 card's alignment audit, against the user and against xAI.","join_basis":"stated","first_doc_id":"xai-grok-4-20-system-card","last_doc_id":"xai-grok-4-20-system-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-alignment-audit-sycophancy-v1","eval_id":"xai-alignment-audit-sycophancy","label":"Petri 2.0-based audit","definition_notes":"The delusion-validation category of the Grok 4.20 card's alignment audit.","join_basis":"stated","first_doc_id":"xai-grok-4-20-system-card","last_doc_id":"xai-grok-4-20-system-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-bio-capability-lift-v1","eval_id":"xai-bio-capability-lift","label":"As first reported","definition_notes":"Statement in words of biology capability lift over Grok 4.5, in the original and revised Grok 4.6 card.","join_basis":"stated","first_doc_id":"xai-grok-4-6-model-card","last_doc_id":"xai-grok-4-6-model-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-biolp-bench-v1","eval_id":"xai-biolp-bench","label":"As first reported","definition_notes":"BioLP-Bench accuracy with safeguards removed, from the Grok 4, 4 Fast and 4.1 cards.","join_basis":"inferred","first_doc_id":"xai-grok-4-model-card","last_doc_id":"xai-grok-4-1-model-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-biousebench-v1","eval_id":"xai-biousebench","label":"As first reported","definition_notes":"Refusal rate on dual-use biology requests, from the Grok 4.6 and 4.7 cards.","join_basis":"inferred","first_doc_id":"xai-grok-4-6-model-card","last_doc_id":"xai-grok-4-7-model-card","supersedes_group_id":"","notes":"The Grok 4.6 card reports the severity-5 subset. The Grok 4.7 scope is not recorded, so the two are separate metrics."},
{"group_id":"xai-cbrn-refusals-v1","eval_id":"xai-cbrn-refusals","label":"As first reported","definition_notes":"Refusal accuracy on dangerous biology queries with full safeguards, from the Grok 4.5 card.","join_basis":"stated","first_doc_id":"xai-grok-4-5-model-card","last_doc_id":"xai-grok-4-5-model-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-cloningscenarios-v1","eval_id":"xai-cloningscenarios","label":"As first reported","definition_notes":"CloningScenarios accuracy with safeguards removed, from the Grok 4.1 and 4.20 cards.","join_basis":"inferred","first_doc_id":"xai-grok-4-1-model-card","last_doc_id":"xai-grok-4-20-system-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-cve-bench-v1","eval_id":"xai-cve-bench","label":"As first reported","definition_notes":"Unrestricted CVE-Bench reward, from the Grok 4.6 card.","join_basis":"stated","first_doc_id":"xai-grok-4-6-model-card","last_doc_id":"xai-grok-4-6-model-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-cybench-v1","eval_id":"xai-cybench","label":"As first reported","definition_notes":"Unguided Cybench success rate with safeguards removed, from the Grok 4 to 4.20 cards.","join_basis":"inferred","first_doc_id":"xai-grok-4-model-card","last_doc_id":"xai-grok-4-20-system-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-cybergym-v1","eval_id":"xai-cybergym","label":"As first reported","definition_notes":"Unrestricted CyberGym mean vulnerabilities reproduced, from the Grok 4.5 to 4.7 cards.","join_basis":"inferred","first_doc_id":"xai-grok-4-5-model-card","last_doc_id":"xai-grok-4-7-model-card","supersedes_group_id":"","notes":"The Grok 4.6 and 4.7 cards restate Grok 4.5 at 79.0% against 80.4% in its own card."},
{"group_id":"xai-dual-use-bio-determination-v1","eval_id":"xai-dual-use-bio-determination","label":"As first reported","definition_notes":"Threshold statements on dual-use biology and chemistry knowledge, from the Grok 4.5 and 4.7 cards.","join_basis":"inferred","first_doc_id":"xai-grok-4-5-model-card","last_doc_id":"xai-grok-4-7-model-card","supersedes_group_id":"","notes":"Only the Grok 4.7 card names FAIF thresholds."},
{"group_id":"xai-fortress-rn-v1","eval_id":"xai-fortress-rn","label":"As first reported","definition_notes":"Radiological and nuclear refusal accuracy, from the revised Grok 4.6 card.","join_basis":"stated","first_doc_id":"xai-grok-4-6-model-card","last_doc_id":"xai-grok-4-6-model-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-hackerbench-v1","eval_id":"xai-hackerbench","label":"v0.2","definition_notes":"HackerBench v0.2: compliance on harmful or dual-use cyber tasks and false refusal on benign ones, from the Grok 4.5 and 4.6 cards.","join_basis":"stated","first_doc_id":"xai-grok-4-5-model-card","last_doc_id":"xai-grok-4-6-model-card","supersedes_group_id":"","notes":"Both cards name the version v0.2. The Grok 4.6 values were corrected in a revision, recorded as revisions and not as a change of test."},
{"group_id":"xai-hackerbench-v2","eval_id":"xai-hackerbench","label":"v0.3","definition_notes":"HackerBench v0.3 compliance on harmful or dual-use cyber tasks (Grok 4.7 card), with Grok 4.6 re-run on v0.3.","join_basis":"stated","first_doc_id":"xai-grok-4-7-model-card","last_doc_id":"xai-grok-4-7-model-card","supersedes_group_id":"xai-hackerbench-v1","notes":""},
{"group_id":"xai-hallucination-rate-v1","eval_id":"xai-hallucination-rate","label":"As first reported","definition_notes":"Share of single-turn answers with unsupported claims, from the Grok 4.5 and 4.6 cards.","join_basis":"inferred","first_doc_id":"xai-grok-4-5-model-card","last_doc_id":"xai-grok-4-6-model-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-hle-calibration-v1","eval_id":"xai-hle-calibration","label":"As first reported","definition_notes":"RMS calibration error on HLE, from the Grok 4.20 card.","join_basis":"stated","first_doc_id":"xai-grok-4-20-system-card","last_doc_id":"xai-grok-4-20-system-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-jailbreaks-v1","eval_id":"xai-jailbreaks","label":"All xAI cards","definition_notes":"Should-refuse prompts under a jailbreak as xAI reports them across its cards: a 0-1 answer rate with a user-turn or system-prompt jailbreak in the Grok 4 to 4.20 cards (the Grok 4.20 card calls it a violation rate), and percent compliance under standard jailbreaks from the Grok 4.5 card, which re-based its results to percentages.","join_basis":"inferred","first_doc_id":"xai-grok-4-model-card","last_doc_id":"xai-grok-4-6-model-card","supersedes_group_id":"","notes":"The jailbreak type is a condition, so standard, user-turn and system-prompt jailbreaks form separate lines. Whether answer rate, violation rate and compliance are graded the same way is not stated. The Grok 4.6 and 4.7 cards also report long-horizon jailbreaks, recorded only in v0 notes."},
{"group_id":"xai-makemesay-v1","eval_id":"xai-makemesay","label":"As first reported","definition_notes":"MakeMeSay win rate on a 0-1 scale, from the Grok 4 and 4.1 cards.","join_basis":"inferred","first_doc_id":"xai-grok-4-model-card","last_doc_id":"xai-grok-4-1-model-card","supersedes_group_id":"","notes":"The Grok 4.1 card restates Grok 4 at 0.13 against 0.12 in its own card."},
{"group_id":"xai-mask-rectified-v1","eval_id":"xai-mask-rectified","label":"As first reported","definition_notes":"MASK-Rectified dishonesty rate in percent, from the Grok 4.5 to 4.7 cards.","join_basis":"inferred","first_doc_id":"xai-grok-4-5-model-card","last_doc_id":"xai-grok-4-7-model-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-mask-v1","eval_id":"xai-mask","label":"Original MASK","definition_notes":"MASK dishonesty rate as reported in the Grok 4 to 4.20 cards.","join_basis":"inferred","first_doc_id":"xai-grok-4-model-card","last_doc_id":"xai-grok-4-20-system-card","supersedes_group_id":"","notes":"From the Grok 4.5 card xAI reports MASK-Rectified, a separate evaluation."},
{"group_id":"xai-overall-risk-conclusion-v1","eval_id":"xai-overall-risk-conclusion","label":"As first reported","definition_notes":"Closing overall risk conclusions with safeguards, from the Grok 4 and Grok 4.20 cards.","join_basis":"inferred","first_doc_id":"xai-grok-4-model-card","last_doc_id":"xai-grok-4-20-system-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-protocolqa-open-ended-v1","eval_id":"xai-protocolqa-open-ended","label":"As first reported","definition_notes":"Open-ended ProtocolQA accuracy, from the Grok 4.5 card.","join_basis":"stated","first_doc_id":"xai-grok-4-5-model-card","last_doc_id":"xai-grok-4-5-model-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-refusals-v1","eval_id":"xai-refusals","label":"All xAI cards","definition_notes":"Should-refuse prompts as xAI reports them across its cards: an answer rate with the production system prompt (0-1 scale in the Grok 4 and 4.1 cards, percent in the Grok Code Fast 1 card) and, from the Grok 4.5 card, which re-based its results to percentages, percent compliance reported as general refusals with full safeguards.","join_basis":"inferred","first_doc_id":"xai-grok-4-model-card","last_doc_id":"xai-grok-4-7-model-card","supersedes_group_id":"","notes":"Whether the prompt set changed at the Grok 4.5 card is not stated. The Grok 4.20 card's base refusal result appears only in a v0 note."},
{"group_id":"xai-restricted-bio-input-filter-v1","eval_id":"xai-restricted-bio-input-filter","label":"As first reported","definition_notes":"False negative rate of the restricted-biology input filter, from the Grok 4.1 card.","join_basis":"stated","first_doc_id":"xai-grok-4-1-model-card","last_doc_id":"xai-grok-4-1-model-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-self-harm-refusals-v1","eval_id":"xai-self-harm-refusals","label":"As first reported","definition_notes":"Compliance, meaning neither a refusal nor a redirect, on should-refuse self-harm prompts, from the Grok 4.5 to 4.7 cards.","join_basis":"inferred","first_doc_id":"xai-grok-4-5-model-card","last_doc_id":"xai-grok-4-7-model-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-strongreject-v1","eval_id":"xai-strongreject","label":"As first reported","definition_notes":"Compliance under StrongREJECT attacks, from the Grok 4.6 and 4.7 cards.","join_basis":"inferred","first_doc_id":"xai-grok-4-6-model-card","last_doc_id":"xai-grok-4-7-model-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-sycophancy-v1","eval_id":"xai-sycophancy","label":"Grok 4 to 4.20 cards","definition_notes":"Answer-change sycophancy rate on a 0-1 scale. The Grok 4.20 card prints it as an answer change rate.","join_basis":"inferred","first_doc_id":"xai-grok-4-model-card","last_doc_id":"xai-grok-4-20-system-card","supersedes_group_id":"","notes":""},
{"group_id":"xai-sycophancy-v2","eval_id":"xai-sycophancy","label":"Grok 4.5 card onward","definition_notes":"Sycophancy rate in percent. The Grok 4.5 card describes it as a misleading-user-context setting.","join_basis":"inferred","first_doc_id":"xai-grok-4-5-model-card","last_doc_id":"xai-grok-4-7-model-card","supersedes_group_id":"xai-sycophancy-v1","notes":"v0 notes a different scale from the earlier rates. Values are far lower, so the earlier and later results are not comparable."},
{"group_id":"xai-vct-v1","eval_id":"xai-vct","label":"All xAI cards","definition_notes":"VCT accuracy as reported by xAI across its cards, on a 0-1 scale in some cards and in percent in others; the Grok 4.5 and later cards report it in the dual-use section without mentioning safeguards.","join_basis":"inferred","first_doc_id":"xai-grok-4-model-card","last_doc_id":"xai-grok-4-7-model-card","supersedes_group_id":"","notes":"The Grok 4.20 card restates Grok 4 at 0.55 against 0.60 in its own card. From the Grok 4.6 card xAI also reports a separately named Biosecurity VCT, which is not recorded as a row."},
{"group_id":"xai-wmdp-v1","eval_id":"xai-wmdp","label":"All xAI cards","definition_notes":"WMDP bio, chem and cyber accuracy as reported by xAI: on a 0-1 scale with safeguards removed in the Grok 4 card, in percent in the Grok 4.6 card.","join_basis":"inferred","first_doc_id":"xai-grok-4-model-card","last_doc_id":"xai-grok-4-6-model-card","supersedes_group_id":"","notes":"The Grok 4.1 and 4.20 cards also print WMDP-Cyber values, recorded only in v0 notes."},
{"group_id":"zhipu-ai-safetybench-v1","eval_id":"zhipu-ai-safetybench","label":"As first reported","definition_notes":"SafetyBench overall and per-category accuracy, from the GLM-4.5 report.","join_basis":"stated","first_doc_id":"zhipu-ai-glm-4-5-technical-report","last_doc_id":"zhipu-ai-glm-4-5-technical-report","supersedes_group_id":"","notes":""}
],
"measurements": [
{"measurement_id":"m-000000","legacy_row_id":0,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v1","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"98.43","value_num":98.43,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card revised 2025-07-16 and 2025-09-02 (changelog); table identical in revised version"},
{"measurement_id":"m-000001","legacy_row_id":1,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v1","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"98.99","value_num":98.99,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card revised 2025-07-16 and 2025-09-02 (changelog); table identical in revised version"},
{"measurement_id":"m-000002","legacy_row_id":2,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v1","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"98.96","value_num":98.96,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card revised 2025-07-16 and 2025-09-02 (changelog); table identical in revised version"},
{"measurement_id":"m-000003","legacy_row_id":3,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v1","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"with ASL-3 safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"98.76","value_num":98.76,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000004","legacy_row_id":4,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v1","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"97.92","value_num":97.92,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000005","legacy_row_id":5,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v1","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"98.94","value_num":98.94,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000006","legacy_row_id":6,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v1","metric_label":"Over-refusal rate","metric_definition":"Over-refusal rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.07","value_num":0.07,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000007","legacy_row_id":7,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v1","metric_label":"Over-refusal rate","metric_definition":"Over-refusal rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.23","value_num":0.23,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000008","legacy_row_id":8,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v1","metric_label":"Over-refusal rate","metric_definition":"Over-refusal rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.45","value_num":0.45,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000009","legacy_row_id":9,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-strongreject","group_id":"anthropic-strongreject-v1","metric_label":"Best-jailbreak StrongREJECT score","metric_definition":"Best-jailbreak StrongREJECT score","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"18.21","value_num":18.21,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.7.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000010","legacy_row_id":10,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-strongreject","group_id":"anthropic-strongreject-v1","metric_label":"Best-jailbreak StrongREJECT score","metric_definition":"Best-jailbreak StrongREJECT score","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"2.24","value_num":2.24,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.7.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000011","legacy_row_id":11,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-strongreject","group_id":"anthropic-strongreject-v1","metric_label":"Best-jailbreak StrongREJECT score","metric_definition":"Best-jailbreak StrongREJECT score","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"6.71","value_num":6.71,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.7.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000012","legacy_row_id":12,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-strongreject","group_id":"anthropic-strongreject-v1","metric_label":"Best-jailbreak StrongREJECT score","metric_definition":"Best-jailbreak StrongREJECT score","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"2.24","value_num":2.24,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.7.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000013","legacy_row_id":13,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-strongreject","group_id":"anthropic-strongreject-v1","metric_label":"Best-jailbreak StrongREJECT score","metric_definition":"Best-jailbreak StrongREJECT score","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"31.95","value_num":31.95,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.7.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000014","legacy_row_id":14,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-strongreject","group_id":"anthropic-strongreject-v1","metric_label":"Best-jailbreak StrongREJECT score","metric_definition":"Best-jailbreak StrongREJECT score","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"10.22","value_num":10.22,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.7.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000015","legacy_row_id":15,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection","group_id":"anthropic-computer-use-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"71","value_num":71,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000016","legacy_row_id":16,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection","group_id":"anthropic-computer-use-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"with safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"89","value_num":89,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000017","legacy_row_id":17,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection","group_id":"anthropic-computer-use-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"69","value_num":69,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000018","legacy_row_id":18,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection","group_id":"anthropic-computer-use-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"with safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"86","value_num":86,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000019","legacy_row_id":19,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-computer-use-prompt-injection","group_id":"anthropic-computer-use-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"74","value_num":74,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000020","legacy_row_id":20,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-computer-use-prompt-injection","group_id":"anthropic-computer-use-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"with safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"88","value_num":88,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000021","legacy_row_id":21,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-agentic-coding","group_id":"anthropic-malicious-agentic-coding-v1","metric_label":"Safety score","metric_definition":"Safety score (avg of 3 evals)","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"88","value_num":88,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.3.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000022","legacy_row_id":22,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-agentic-coding","group_id":"anthropic-malicious-agentic-coding-v1","metric_label":"Safety score","metric_definition":"Safety score (avg of 3 evals)","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"90","value_num":90,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.3.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000023","legacy_row_id":23,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-agentic-coding","group_id":"anthropic-malicious-agentic-coding-v1","metric_label":"Safety score","metric_definition":"Safety score (avg of 3 evals)","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"85","value_num":85,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.3.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000024","legacy_row_id":24,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-opportunistic-blackmail-scenario","group_id":"anthropic-opportunistic-blackmail-scenario-v1","metric_label":"Share of rollouts with blackmail","metric_definition":"Share of rollouts with blackmail","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"replacement model shares values","context_note":"","value_printed":"84","value_num":84,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.1.1.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card files under self-preservation (4.1.1); also relevant to M11"},
{"measurement_id":"m-000025","legacy_row_id":25,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-automated-behavioral-audit-eval-awareness","group_id":"anthropic-automated-behavioral-audit-eval-awareness-v1","metric_label":"Transcripts flagged for situational awareness","metric_definition":"Transcripts flagged for situational awareness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 414 audit transcripts","context_note":"","value_printed":"5","value_num":5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":414,"direction":"higher_worse","value_status":"printed","location":"Sec 4.1.2.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000026","legacy_row_id":26,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-automated-behavioral-audit-eval-awareness","group_id":"anthropic-automated-behavioral-audit-eval-awareness-v1","metric_label":"Transcripts flagged for situational awareness","metric_definition":"Transcripts flagged for situational awareness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 414 audit transcripts","context_note":"","value_printed":"7","value_num":7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":414,"direction":"higher_worse","value_status":"printed","location":"Sec 4.1.2.2","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Sonnet 3.5=3 also stated; a first fetch misattributed counts"},
{"measurement_id":"m-000027","legacy_row_id":27,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-reasoning-behavior-monitor","group_id":"anthropic-reasoning-behavior-monitor-v1","metric_label":"Outputs showing deception (overall)","metric_definition":"Outputs showing deception (overall)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"RL-style transcripts","context_note":"","value_printed":"0.37","value_num":0.37,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.6.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000028","legacy_row_id":28,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-reasoning-behavior-monitor","group_id":"anthropic-reasoning-behavior-monitor-v1","metric_label":"Outputs showing deception (overall)","metric_definition":"Outputs showing deception (overall)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"RL-style transcripts","context_note":"","value_printed":"0.15","value_num":0.15,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.6.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000029","legacy_row_id":29,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-reasoning-behavior-monitor","group_id":"anthropic-reasoning-behavior-monitor-v1","metric_label":"Knowingly hallucinated information","metric_definition":"Knowingly hallucinated information","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"RL-style transcripts","context_note":"","value_printed":"0.13","value_num":0.13,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.6.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000030","legacy_row_id":30,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-reasoning-behavior-monitor","group_id":"anthropic-reasoning-behavior-monitor-v1","metric_label":"Knowingly hallucinated information","metric_definition":"Knowingly hallucinated information","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"RL-style transcripts","context_note":"","value_printed":"0.31","value_num":0.31,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.6.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000031","legacy_row_id":31,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-reasoning-behavior-monitor-sycophancy","group_id":"anthropic-reasoning-behavior-monitor-sycophancy-v1","metric_label":"Outputs showing sycophancy","metric_definition":"Outputs showing sycophancy","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"RL-style transcripts","context_note":"","value_printed":"0.01","value_num":0.01,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.6.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000032","legacy_row_id":32,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-reasoning-behavior-monitor-sycophancy","group_id":"anthropic-reasoning-behavior-monitor-sycophancy-v1","metric_label":"Outputs showing sycophancy","metric_definition":"Outputs showing sycophancy","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"RL-style transcripts","context_note":"","value_printed":"0.03","value_num":0.03,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.6.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000033","legacy_row_id":33,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-automated-behavioral-audit","group_id":"anthropic-automated-behavioral-audit-v1","metric_label":"Surprising high-impact actions found","metric_definition":"Surprising high-impact actions found","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"audit transcripts","context_note":"","value_printed":"58","value_num":58,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.1.9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Sonnet 3.5=42 also stated"},
{"measurement_id":"m-000034","legacy_row_id":34,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-automated-behavioral-audit","group_id":"anthropic-automated-behavioral-audit-v1","metric_label":"Surprising high-impact actions found","metric_definition":"Surprising high-impact actions found","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"audit transcripts","context_note":"","value_printed":"36","value_num":36,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.1.9","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Sonnet 3.5=42 also stated"},
{"measurement_id":"m-000035","legacy_row_id":35,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-automated-behavioral-audit","group_id":"anthropic-automated-behavioral-audit-v1","metric_label":"Surprising high-impact actions found","metric_definition":"Surprising high-impact actions found","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"audit transcripts","context_note":"","value_printed":"45","value_num":45,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.1.9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Sonnet 3.5=42 also stated"},
{"measurement_id":"m-000036","legacy_row_id":36,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-subtle-sabotage-agentic","group_id":"anthropic-subtle-sabotage-agentic-v1","metric_label":"Side-task success without monitor detection","metric_definition":"Side-task success without monitor detection","condition_effort":"","condition_mode":"scratchpad visible to monitor","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.10.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000037","legacy_row_id":37,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-subtle-sabotage-agentic","group_id":"anthropic-subtle-sabotage-agentic-v1","metric_label":"Side-task success without monitor detection","metric_definition":"Side-task success without monitor detection","condition_effort":"","condition_mode":"hidden scratchpad","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"19","value_num":19,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.10.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000038","legacy_row_id":38,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-subtle-sabotage-agentic","group_id":"anthropic-subtle-sabotage-agentic-v1","metric_label":"Side-task success without monitor detection","metric_definition":"Side-task success without monitor detection","condition_effort":"","condition_mode":"scratchpad visible to monitor","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"12","value_num":12,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.10.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000039","legacy_row_id":39,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-subtle-sabotage-agentic","group_id":"anthropic-subtle-sabotage-agentic-v1","metric_label":"Side-task success without monitor detection","metric_definition":"Side-task success without monitor detection","condition_effort":"","condition_mode":"hidden scratchpad","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"25","value_num":25,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.10.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000040","legacy_row_id":40,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-reward-hacking-hard-coding","group_id":"anthropic-reward-hacking-hard-coding-v1","metric_label":"Avg decrease in hard-coding vs Sonnet 3.7","metric_definition":"Avg decrease in hard-coding vs Sonnet 3.7","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Sonnet 3.7","context_note":"","value_printed":"67","value_num":67,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"relative_change_percent","unit_as_printed":"%_relative_reduction","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 6","source_type":"secondary","via_url":"https://simonwillison.net/2025/May/25/claude-4-system-card/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Sec 6 past fetch truncation; card quote via secondary source. Impossible-task numbers corrected 2025-09-02 Migration: decrease relative to Sonnet 3.7, printed as a positive number"},
{"measurement_id":"m-000041","legacy_row_id":41,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-reward-hacking-hard-coding","group_id":"anthropic-reward-hacking-hard-coding-v1","metric_label":"Avg decrease in hard-coding vs Sonnet 3.7","metric_definition":"Avg decrease in hard-coding vs Sonnet 3.7","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Sonnet 3.7","context_note":"","value_printed":"69","value_num":69,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"relative_change_percent","unit_as_printed":"%_relative_reduction","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 6","source_type":"secondary","via_url":"https://simonwillison.net/2025/May/25/claude-4-system-card/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Sec 6 past fetch truncation; card quote via secondary source Migration: decrease relative to Sonnet 3.7, printed as a positive number"},
{"measurement_id":"m-000042","legacy_row_id":42,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-rsp-deployment-standard","group_id":"anthropic-rsp-deployment-standard-v1","metric_label":"ASL standard deployed under","metric_definition":"ASL standard deployed under","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"ASL-3","value_num":null,"value_text":"ASL-3","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1 / Sec 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Provisional/precautionary: CBRN ASL-3 could not be ruled out"},
{"measurement_id":"m-000043","legacy_row_id":43,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-rsp-deployment-standard","group_id":"anthropic-rsp-deployment-standard-v1","metric_label":"ASL standard deployed under","metric_definition":"ASL standard deployed under","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"ASL-2","value_num":null,"value_text":"ASL-2","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1 / Sec 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000044","legacy_row_id":44,"split_index":0,"version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cybench","group_id":"anthropic-cybench-v1","metric_label":"CTF challenges solved","metric_definition":"CTF challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 39 challenges","context_note":"","value_printed":"22","value_num":22,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":39,"direction":"higher_worse","value_status":"printed","location":"Sec 7.4","source_type":"secondary","via_url":"https://www.thestack.technology/claude-4-of-blackmail-bioweapons-and-bad-code/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Sec 7 past fetch truncation; via secondary source"},
{"measurement_id":"m-000045","legacy_row_id":45,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v2","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"98.76","value_num":98.76,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Eval set incrementally updated since Opus 4 card (new policy areas, refreshed prompts)"},
{"measurement_id":"m-000046","legacy_row_id":46,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v2","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"98.45","value_num":98.45,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000047","legacy_row_id":47,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v2","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.06","value_num":99.06,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000048","legacy_row_id":48,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v2","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"97.27","value_num":97.27,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Differs from 98.43 in Opus 4 card (eval set updated)"},
{"measurement_id":"m-000049","legacy_row_id":49,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v2","metric_label":"Over-refusal rate","metric_definition":"Over-refusal rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.08","value_num":0.08,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.1.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000050","legacy_row_id":50,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v2","metric_label":"Over-refusal rate","metric_definition":"Over-refusal rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.05","value_num":0.05,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.1.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Differs from 0.07 in Opus 4 card"},
{"measurement_id":"m-000051","legacy_row_id":51,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v1","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"12","value_num":12,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"v1 of coding set (v2 used from Sonnet 4.5 card)"},
{"measurement_id":"m-000052","legacy_row_id":52,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v1","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"9","value_num":9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"v1 of coding set (v2 used from Sonnet 4.5 card)"},
{"measurement_id":"m-000053","legacy_row_id":53,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v1","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"4","value_num":4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"v1 of coding set (v2 used from Sonnet 4.5 card)"},
{"measurement_id":"m-000054","legacy_row_id":54,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v1","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"44","value_num":44,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"v1 of coding set (v2 used from Sonnet 4.5 card)"},
{"measurement_id":"m-000055","legacy_row_id":55,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v1","metric_label":"Hidden-test hack rate","metric_definition":"Hidden-test hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"14","value_num":14,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"v1 of coding set (v2 used from Sonnet 4.5 card)"},
{"measurement_id":"m-000056","legacy_row_id":56,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v1","metric_label":"Hidden-test hack rate","metric_definition":"Hidden-test hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"13","value_num":13,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"v1 of coding set (v2 used from Sonnet 4.5 card)"},
{"measurement_id":"m-000057","legacy_row_id":57,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v1","metric_label":"Hidden-test hack rate","metric_definition":"Hidden-test hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"12","value_num":12,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"v1 of coding set (v2 used from Sonnet 4.5 card)"},
{"measurement_id":"m-000058","legacy_row_id":58,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v1","metric_label":"Hidden-test hack rate","metric_definition":"Hidden-test hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"23","value_num":23,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"v1 of coding set (v2 used from Sonnet 4.5 card)"},
{"measurement_id":"m-000059","legacy_row_id":59,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v1","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"52","value_num":52,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Corrected Opus 4/Sonnet 4 numbers (Opus 4 card fixed 2025-09-02)"},
{"measurement_id":"m-000060","legacy_row_id":60,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v1","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"51","value_num":51,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Corrected Opus 4/Sonnet 4 numbers (Opus 4 card fixed 2025-09-02)"},
{"measurement_id":"m-000061","legacy_row_id":61,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v1","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"51","value_num":51,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Corrected Opus 4/Sonnet 4 numbers (Opus 4 card fixed 2025-09-02)"},
{"measurement_id":"m-000062","legacy_row_id":62,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v1","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"78","value_num":78,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Corrected Opus 4/Sonnet 4 numbers (Opus 4 card fixed 2025-09-02)"},
{"measurement_id":"m-000063","legacy_row_id":63,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v1","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"18","value_num":18,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Corrected Opus 4/Sonnet 4 numbers (Opus 4 card fixed 2025-09-02)"},
{"measurement_id":"m-000064","legacy_row_id":64,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v1","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"19","value_num":19,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Corrected Opus 4/Sonnet 4 numbers (Opus 4 card fixed 2025-09-02)"},
{"measurement_id":"m-000065","legacy_row_id":65,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v1","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"7","value_num":7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Corrected Opus 4/Sonnet 4 numbers (Opus 4 card fixed 2025-09-02)"},
{"measurement_id":"m-000066","legacy_row_id":66,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v1","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"80","value_num":80,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Corrected Opus 4/Sonnet 4 numbers (Opus 4 card fixed 2025-09-02)"},
{"measurement_id":"m-000067","legacy_row_id":67,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-training-distribution","group_id":"anthropic-training-distribution-v1","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"environment 1","context_note":"","value_printed":"10","value_num":10,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000068","legacy_row_id":68,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-training-distribution","group_id":"anthropic-training-distribution-v1","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"environment 2","context_note":"","value_printed":"3","value_num":3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000069","legacy_row_id":69,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-automated-behavioral-audit","group_id":"anthropic-automated-behavioral-audit-v1","metric_label":"Reduction in cooperation with egregious misuse","metric_definition":"Reduction in cooperation with egregious misuse","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Opus 4; share of transcripts scoring >5/10","context_note":"","value_printed":"25","value_num":25,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"relative_change_percent","unit_as_printed":"%_relative_reduction","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 4.1 / Fig 4.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"1,160 transcripts from 290 seeds; other dims figure-only Migration: reduction relative to Opus 4, printed as a positive number"},
{"measurement_id":"m-000070","legacy_row_id":70,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-rsp-deployment-standard","group_id":"anthropic-rsp-deployment-standard-v1","metric_label":"ASL standard deployed under","metric_definition":"ASL standard deployed under","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"ASL-3","value_num":null,"value_text":"ASL-3","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Precautionary, like Opus 4; below ASL-4 thresholds"},
{"measurement_id":"m-000071","legacy_row_id":71,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cybench","group_id":"anthropic-cybench-v2","metric_label":"CTF challenges solved","metric_definition":"CTF challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 35-challenge subset","context_note":"","value_printed":"18","value_num":18,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":35,"direction":"higher_worse","value_status":"printed","location":"Sec 6.5.1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000072","legacy_row_id":72,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-cybench","group_id":"anthropic-cybench-v2","metric_label":"CTF challenges solved","metric_definition":"CTF challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 35-challenge subset","context_note":"","value_printed":"16","value_num":16,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":35,"direction":"higher_worse","value_status":"printed","location":"Sec 6.5.1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000073","legacy_row_id":73,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-swe-bench-verified-hard-subset","group_id":"anthropic-swe-bench-verified-hard-subset-v1","metric_label":"Problems solved, pass@1 avg","metric_definition":"Problems solved, pass@1 avg","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 42 problems","context_note":"","value_printed":"18.4","value_num":18.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":42,"direction":"higher_worse","value_status":"printed","location":"Sec 6.4.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000074","legacy_row_id":74,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-swe-bench-verified-hard-subset","group_id":"anthropic-swe-bench-verified-hard-subset-v1","metric_label":"Problems solved, pass@1 avg","metric_definition":"Problems solved, pass@1 avg","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 42 problems","context_note":"","value_printed":"16.6","value_num":16.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":42,"direction":"higher_worse","value_status":"printed","location":"Sec 6.4.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000075","legacy_row_id":75,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-long-form-virology-task-1","group_id":"anthropic-long-form-virology-task-1-v1","metric_label":"Score","metric_definition":"Task score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.86","value_num":0.86,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6.3.1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000076","legacy_row_id":76,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-long-form-virology-task-1","group_id":"anthropic-long-form-virology-task-1-v1","metric_label":"Score","metric_definition":"Task score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.84","value_num":0.84,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6.3.1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000077","legacy_row_id":77,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-kernel-task","group_id":"anthropic-ai-rd-kernel-task-v1","metric_label":"Best speedup","metric_definition":"Best speedup","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"58.47","value_num":58.47,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6.4.1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000078","legacy_row_id":78,"split_index":0,"version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-ai-rd-kernel-task","group_id":"anthropic-ai-rd-kernel-task-v1","metric_label":"Best speedup","metric_definition":"Best speedup","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"72.65","value_num":72.65,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6.4.1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000079","legacy_row_id":79,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v2","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.29","value_num":99.29,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000080","legacy_row_id":80,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v2","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"98.76","value_num":98.76,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000081","legacy_row_id":81,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v2","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"97.27","value_num":97.27,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000082","legacy_row_id":82,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v2","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"98.22","value_num":98.22,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000083","legacy_row_id":83,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v2","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.16","value_num":99.16,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000084","legacy_row_id":84,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v2","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.43","value_num":99.43,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000085","legacy_row_id":85,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v2","metric_label":"Over-refusal rate","metric_definition":"Over-refusal rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.02","value_num":0.02,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000086","legacy_row_id":86,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v2","metric_label":"Over-refusal rate","metric_definition":"Over-refusal rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.08","value_num":0.08,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000087","legacy_row_id":87,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v2","metric_label":"Over-refusal rate","metric_definition":"Over-refusal rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.05","value_num":0.05,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000088","legacy_row_id":88,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v2","metric_label":"Over-refusal rate","metric_definition":"Over-refusal rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.15","value_num":0.15,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000089","legacy_row_id":89,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-agentic-coding","group_id":"anthropic-malicious-agentic-coding-v1","metric_label":"Safety score","metric_definition":"Safety score","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"98.7","value_num":98.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000090","legacy_row_id":90,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-agentic-coding","group_id":"anthropic-malicious-agentic-coding-v1","metric_label":"Safety score","metric_definition":"Safety score","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"89.3","value_num":89.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 4 card reported Sonnet 4 = 90"},
{"measurement_id":"m-000091","legacy_row_id":91,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v1","metric_label":"Refusal rate, overt malicious","metric_definition":"Refusal rate, overt malicious","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"95.56","value_num":95.56,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000092","legacy_row_id":92,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v1","metric_label":"Refusal rate, covert malicious","metric_definition":"Refusal rate, covert malicious","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"52.42","value_num":52.42,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000093","legacy_row_id":93,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v1","metric_label":"Refusal rate, overt malicious","metric_definition":"Refusal rate, overt malicious","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"80.0","value_num":80,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000094","legacy_row_id":94,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v1","metric_label":"Refusal rate, covert malicious","metric_definition":"Refusal rate, covert malicious","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"77.0","value_num":77,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000095","legacy_row_id":95,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v1","metric_label":"Success rate, dual-use requests","metric_definition":"Success rate, dual-use requests","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"87.0","value_num":87,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Over-refusal proxy"},
{"measurement_id":"m-000096","legacy_row_id":96,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v1","metric_label":"Refusal rate, covert malicious","metric_definition":"Refusal rate, covert malicious","condition_effort":"","condition_mode":"","condition_safeguards":"with mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"96.31","value_num":96.31,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000097","legacy_row_id":97,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-mcp-prompt-injection","group_id":"anthropic-mcp-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"92.0","value_num":92,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.2.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000098","legacy_row_id":98,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-mcp-prompt-injection","group_id":"anthropic-mcp-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"with safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"94.0","value_num":94,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.2.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000099","legacy_row_id":99,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-mcp-prompt-injection","group_id":"anthropic-mcp-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"91.1","value_num":91.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.2.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000100","legacy_row_id":100,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection","group_id":"anthropic-computer-use-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"78.0","value_num":78,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.2.3.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000101","legacy_row_id":101,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection","group_id":"anthropic-computer-use-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"with safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"82.6","value_num":82.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.2.3.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000102","legacy_row_id":102,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-computer-use-prompt-injection","group_id":"anthropic-computer-use-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"74.3","value_num":74.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.2.3.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000103","legacy_row_id":103,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-tool-use-prompt-injection","group_id":"anthropic-tool-use-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"96.0","value_num":96,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.2.4.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000104","legacy_row_id":104,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-tool-use-prompt-injection","group_id":"anthropic-tool-use-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"with safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.4","value_num":99.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.2.4.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000105","legacy_row_id":105,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-tool-use-prompt-injection","group_id":"anthropic-tool-use-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"90.6","value_num":90.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.2.4.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000106","legacy_row_id":106,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"1","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"v2 set; not comparable to v1 in Opus 4.1 addendum"},
{"measurement_id":"m-000107","legacy_row_id":107,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"53","value_num":53,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Values differ from Opus 4.1 addendum (e.g. Opus 4.1 52 vs 80): methodology change"},
{"measurement_id":"m-000108","legacy_row_id":108,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"20","value_num":20,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000109","legacy_row_id":109,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v2","metric_label":"Hidden-test hack rate","metric_definition":"Hidden-test hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"1","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000110","legacy_row_id":110,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-training-distribution","group_id":"anthropic-training-distribution-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"2","value_num":2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000111","legacy_row_id":111,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"14","value_num":14,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"v2 set; not comparable to v1 in Opus 4.1 addendum Migration: Blind check matched 14 but found the table layout unclear, with another no-prompt column showing 10; re-read Table 6.1.A before featuring this value."},
{"measurement_id":"m-000112","legacy_row_id":112,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"80","value_num":80,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Values differ from Opus 4.1 addendum (e.g. Opus 4.1 52 vs 80): methodology change"},
{"measurement_id":"m-000113","legacy_row_id":113,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"45","value_num":45,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000114","legacy_row_id":114,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"16","value_num":16,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"v2 set; not comparable to v1 in Opus 4.1 addendum"},
{"measurement_id":"m-000115","legacy_row_id":115,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"85","value_num":85,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Values differ from Opus 4.1 addendum (e.g. Opus 4.1 52 vs 80): methodology change"},
{"measurement_id":"m-000116","legacy_row_id":116,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4","subject_model_ids":[],"subject_label":"Claude Opus 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"30","value_num":30,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000117","legacy_row_id":117,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"14","value_num":14,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"v2 set; not comparable to v1 in Opus 4.1 addendum"},
{"measurement_id":"m-000118","legacy_row_id":118,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"70","value_num":70,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Values differ from Opus 4.1 addendum (e.g. Opus 4.1 52 vs 80): methodology change"},
{"measurement_id":"m-000119","legacy_row_id":119,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"28","value_num":28,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000120","legacy_row_id":120,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"64","value_num":64,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"v2 set; not comparable to v1 in Opus 4.1 addendum"},
{"measurement_id":"m-000121","legacy_row_id":121,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"85","value_num":85,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Values differ from Opus 4.1 addendum (e.g. Opus 4.1 52 vs 80): methodology change"},
{"measurement_id":"m-000122","legacy_row_id":122,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-3-7","subject_model_ids":[],"subject_label":"Claude Sonnet 3.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"85","value_num":85,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 6.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000123","legacy_row_id":123,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-automated-behavioral-audit","group_id":"anthropic-automated-behavioral-audit-v2","metric_label":"Improvement on overall misaligned-behavior score","metric_definition":"Improvement on overall misaligned-behavior score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Sonnet 4","context_note":"prior best","value_printed":"50","value_num":50,"value_text":"","value_qualifier":"gt","range_low":"","range_high":"","unit":"relative_change_percent","unit_as_printed":"%_relative_reduction","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 7.1.3.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card says 'more than 50%'; absolute scores figure-only; realism filter introduced Migration: improvement relative to Sonnet 4, printed as a positive number"},
{"measurement_id":"m-000124","legacy_row_id":124,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-automated-behavioral-audit-eval-awareness","group_id":"anthropic-automated-behavioral-audit-eval-awareness-v2","metric_label":"Share of transcripts verbalizing eval awareness","metric_definition":"Share of transcripts verbalizing eval awareness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"13","value_num":13,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 7.2","source_type":"secondary","via_url":"https://www.transformernews.ai/p/claude-sonnet-4-5-evaluation-situational-awareness","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"'about 13%'; past fetch truncation; via secondary source"},
{"measurement_id":"m-000125","legacy_row_id":125,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"uk-aisi-evaluation-awareness","group_id":"uk-aisi-evaluation-awareness-anthropic-v1","metric_label":"Unprompted verbalized eval awareness rate","metric_definition":"Unprompted verbalized eval awareness rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"16.6","value_num":16.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 7.3.1","source_type":"secondary","via_url":"https://www.greaterwrong.com/posts/4yn8B8p2YiouxLABy/claude-sonnet-4-5-system-card-and-alignment","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card quote reproduced verbatim in secondary source Migration: The external testers evaluated a pre-release snapshot of Claude Sonnet 4.5."},
{"measurement_id":"m-000126","legacy_row_id":126,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"uk-aisi-evaluation-awareness","group_id":"uk-aisi-evaluation-awareness-anthropic-v1","metric_label":"Unprompted verbalized eval awareness rate","metric_definition":"Unprompted verbalized eval awareness rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"3.5","value_num":3.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 7.3.1","source_type":"secondary","via_url":"https://www.greaterwrong.com/posts/4yn8B8p2YiouxLABy/claude-sonnet-4-5-system-card-and-alignment","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card quote reproduced verbatim in secondary source Migration: The external testers evaluated a pre-release snapshot of Claude Sonnet 4.5."},
{"measurement_id":"m-000127","legacy_row_id":127,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":false,"eval_id":"uk-aisi-evaluation-awareness","group_id":"uk-aisi-evaluation-awareness-anthropic-v1","metric_label":"Unprompted verbalized eval awareness rate","metric_definition":"Unprompted verbalized eval awareness rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.6","value_num":1.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 7.3.1","source_type":"secondary","via_url":"https://www.greaterwrong.com/posts/4yn8B8p2YiouxLABy/claude-sonnet-4-5-system-card-and-alignment","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card quote reproduced verbatim in secondary source Migration: The external testers evaluated a pre-release snapshot of Claude Sonnet 4.5."},
{"measurement_id":"m-000128","legacy_row_id":128,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-evaluation-awareness","group_id":"apollo-evaluation-awareness-anthropic-v1","metric_label":"Unambiguous references to being evaluated","metric_definition":"Unambiguous references to being evaluated","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"58","value_num":58,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 7.3.2","source_type":"secondary","via_url":"https://www.greaterwrong.com/posts/4yn8B8p2YiouxLABy/claude-sonnet-4-5-system-card-and-alignment","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Preliminary; card quote via secondary source Migration: The external testers evaluated a pre-release snapshot of Claude Sonnet 4.5."},
{"measurement_id":"m-000129","legacy_row_id":129,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":false,"eval_id":"apollo-evaluation-awareness","group_id":"apollo-evaluation-awareness-anthropic-v1","metric_label":"Unambiguous references to being evaluated","metric_definition":"Unambiguous references to being evaluated","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"22","value_num":22,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 7.3.2","source_type":"secondary","via_url":"https://www.greaterwrong.com/posts/4yn8B8p2YiouxLABy/claude-sonnet-4-5-system-card-and-alignment","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Preliminary; card quote via secondary source Migration: The external testers evaluated a pre-release snapshot of Claude Sonnet 4.5."},
{"measurement_id":"m-000130","legacy_row_id":130,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-shade-arena","group_id":"anthropic-shade-arena-v1","metric_label":"Stealth success rate","metric_definition":"Side-task success without monitor detection","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"22.3","value_num":22.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 7.5.10.3","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2025/09/30/claude-sonnet-4-5-system-card-and-alignment/","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Via secondary source; 'Opus' assumed Opus 4.1; near-zero with thinking on"},
{"measurement_id":"m-000131","legacy_row_id":131,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-shade-arena","group_id":"anthropic-shade-arena-v1","metric_label":"Stealth success rate","metric_definition":"Side-task success without monitor detection","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"25.6","value_num":25.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 7.5.10.3","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2025/09/30/claude-sonnet-4-5-system-card-and-alignment/","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Via secondary source; 'Opus' assumed Opus 4.1; near-zero with thinking on"},
{"measurement_id":"m-000132","legacy_row_id":132,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-shade-arena","group_id":"anthropic-shade-arena-v1","metric_label":"Stealth success rate","metric_definition":"Side-task success without monitor detection","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"19.4","value_num":19.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 7.5.10.3","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2025/09/30/claude-sonnet-4-5-system-card-and-alignment/","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Via secondary source; 'Opus' assumed Opus 4.1; near-zero with thinking on"},
{"measurement_id":"m-000133","legacy_row_id":133,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-rsp-deployment-standard","group_id":"anthropic-rsp-deployment-standard-v1","metric_label":"ASL standard deployed under","metric_definition":"ASL standard deployed under","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"ASL-3","value_num":null,"value_text":"ASL-3","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Precautionary; below ASL-4 rule-out thresholds (CBRN, AI R&D, cyber)"},
{"measurement_id":"m-000134","legacy_row_id":134,"split_index":0,"version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cybench","group_id":"anthropic-cybench-v4","metric_label":"Success rate, pass@30","metric_definition":"Success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"37 of 40 challenges","context_note":"","value_printed":"80","value_num":80,"value_text":"","value_qualifier":"gt","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"figure_read","location":"Sec 5","source_type":"primary","via_url":"","confidence":"low","verification_status":"disputed","extraction_method":"v0_web_reader","superseded_by":"","notes":"Text says 'breaking 80%'; ~20pp gain over prior models; value is a chart read, not a printed figure Migration: the text says only that the rate broke 80% over 30 attempts; 80 is that bound, the exact value is in a chart"},
{"measurement_id":"m-000135","legacy_row_id":135,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v2","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.4","value_num":99.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 2.1 table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000136","legacy_row_id":136,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v2","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.36","value_num":99.36,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 2.1 table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000137","legacy_row_id":137,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-3-5","subject_model_ids":[],"subject_label":"Claude Haiku 3.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v2","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.72","value_num":99.72,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 2.1 table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000138","legacy_row_id":138,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v2","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.16","value_num":99.16,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 2.1 table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Same value as Sonnet 4.5 card"},
{"measurement_id":"m-000139","legacy_row_id":139,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v2","metric_label":"Over-refusal rate","metric_definition":"Over-refusal rate","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.04","value_num":0.04,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2 table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000140","legacy_row_id":140,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v2","metric_label":"Over-refusal rate","metric_definition":"Over-refusal rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.01","value_num":0.01,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2 table","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000141","legacy_row_id":141,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-3-5","subject_model_ids":[],"subject_label":"Claude Haiku 3.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v2","metric_label":"Over-refusal rate","metric_definition":"Over-refusal rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"4.26","value_num":4.26,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2 table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000142","legacy_row_id":142,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-agentic-coding","group_id":"anthropic-malicious-agentic-coding-v1","metric_label":"Safety score","metric_definition":"Safety score","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"100","value_num":100,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000143","legacy_row_id":143,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-agentic-coding","group_id":"anthropic-malicious-agentic-coding-v1","metric_label":"Safety score","metric_definition":"Safety score","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"98.7","value_num":98.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000144","legacy_row_id":144,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-3-5","subject_model_ids":[],"subject_label":"Claude Haiku 3.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-agentic-coding","group_id":"anthropic-malicious-agentic-coding-v1","metric_label":"Safety score","metric_definition":"Safety score","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"100","value_num":100,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000145","legacy_row_id":145,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Refusal rate, malicious requests","metric_definition":"Refusal rate, malicious requests","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"69.39","value_num":69.39,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Overt/covert merged; differs from Sonnet 4.5 card split"},
{"measurement_id":"m-000146","legacy_row_id":146,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Success rate, dual-use & benign","metric_definition":"Success rate, dual-use & benign","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"88.85","value_num":88.85,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000147","legacy_row_id":147,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Refusal rate, malicious requests","metric_definition":"Refusal rate, malicious requests","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"66.94","value_num":66.94,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Overt/covert merged; differs from Sonnet 4.5 card split"},
{"measurement_id":"m-000148","legacy_row_id":148,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Success rate, dual-use & benign","metric_definition":"Success rate, dual-use & benign","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"97.54","value_num":97.54,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000149","legacy_row_id":149,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-3-5","subject_model_ids":[],"subject_label":"Claude Haiku 3.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Refusal rate, malicious requests","metric_definition":"Refusal rate, malicious requests","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"70.0","value_num":70,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Overt/covert merged; differs from Sonnet 4.5 card split"},
{"measurement_id":"m-000150","legacy_row_id":150,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-3-5","subject_model_ids":[],"subject_label":"Claude Haiku 3.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Success rate, dual-use & benign","metric_definition":"Success rate, dual-use & benign","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"81.97","value_num":81.97,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000151","legacy_row_id":151,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Refusal rate, malicious requests","metric_definition":"Refusal rate, malicious requests","condition_effort":"","condition_mode":"","condition_safeguards":"with new mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.17","value_num":99.17,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.2.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000152","legacy_row_id":152,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection","group_id":"anthropic-computer-use-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"72.2","value_num":72.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.2.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000153","legacy_row_id":153,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection","group_id":"anthropic-computer-use-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"with safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"92.4","value_num":92.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.2.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000154","legacy_row_id":154,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-mcp-prompt-injection","group_id":"anthropic-mcp-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"92.5","value_num":92.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.2.2.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000155","legacy_row_id":155,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-3-5","subject_model_ids":[],"subject_label":"Claude Haiku 3.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-mcp-prompt-injection","group_id":"anthropic-mcp-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"95.5","value_num":95.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.2.2.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000156","legacy_row_id":156,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-tool-use-prompt-injection","group_id":"anthropic-tool-use-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"93.4","value_num":93.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.2.2.C","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000157","legacy_row_id":157,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-3-5","subject_model_ids":[],"subject_label":"Claude Haiku 3.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-tool-use-prompt-injection","group_id":"anthropic-tool-use-prompt-injection-v1","metric_label":"Attack prevention rate","metric_definition":"Attack prevention rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"91.6","value_num":91.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.2.2.C","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000158","legacy_row_id":158,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"6","value_num":6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000159","legacy_row_id":159,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v2","metric_label":"Hidden-test hack rate","metric_definition":"Hidden-test hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"3","value_num":3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000160","legacy_row_id":160,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"30","value_num":30,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000161","legacy_row_id":161,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"23","value_num":23,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000162","legacy_row_id":162,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-3-5","subject_model_ids":[],"subject_label":"Claude Haiku 3.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"60","value_num":60,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000163","legacy_row_id":163,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-3-5","subject_model_ids":[],"subject_label":"Claude Haiku 3.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-reward-hack-prone-coding-tasks","group_id":"anthropic-reward-hack-prone-coding-tasks-v2","metric_label":"Hidden-test hack rate","metric_definition":"Hidden-test hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"38","value_num":38,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000164","legacy_row_id":164,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-3-5","subject_model_ids":[],"subject_label":"Claude Haiku 3.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"33","value_num":33,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000165","legacy_row_id":165,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-3-5","subject_model_ids":[],"subject_label":"Claude Haiku 3.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"5","value_num":5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000166","legacy_row_id":166,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Classifier hack rate","metric_definition":"Classifier hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"53","value_num":53,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Identical to Sonnet 4.5 card; Opus 4.1 (80) and Opus 4 (85) also repeated"},
{"measurement_id":"m-000167","legacy_row_id":167,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-automated-behavioral-audit-eval-awareness","group_id":"anthropic-automated-behavioral-audit-eval-awareness-v2","metric_label":"Share of scenarios affected by verbalized eval awareness","metric_definition":"Share of scenarios affected by verbalized eval awareness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"9","value_num":9,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.1.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"'about 9% of scenarios'; also invalidated 3 agentic-misalignment scenarios Migration: Names the automated behavioural audit itself, not a setting of it."},
{"measurement_id":"m-000168","legacy_row_id":168,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-rsp-deployment-standard","group_id":"anthropic-rsp-deployment-standard-v1","metric_label":"ASL standard deployed under","metric_definition":"ASL standard deployed under","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"ASL-2","value_num":null,"value_text":"ASL-2","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1 / Sec 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Well below ASL-3 thresholds in all domains"},
{"measurement_id":"m-000169","legacy_row_id":169,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-swe-bench-verified-hard-subset","group_id":"anthropic-swe-bench-verified-hard-subset-v2","metric_label":"Problems solved, pass@1 avg","metric_definition":"Problems solved, pass@1 avg","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 45 problems","context_note":"","value_printed":"16.45","value_num":16.45,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":45,"direction":"higher_worse","value_status":"printed","location":"Sec 6.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"36.6%; denominator changed from 42"},
{"measurement_id":"m-000170","legacy_row_id":170,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-swe-bench-verified-hard-subset","group_id":"anthropic-swe-bench-verified-hard-subset-v1","metric_label":"Problems solved, pass@1 avg","metric_definition":"Problems solved, pass@1 avg","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 42 problems","context_note":"","value_printed":"15.4","value_num":15.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":42,"direction":"higher_worse","value_status":"printed","location":"Sec 6.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"36.7%"},
{"measurement_id":"m-000171","legacy_row_id":171,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cybench","group_id":"anthropic-cybench-v3","metric_label":"CTF challenges solved","metric_definition":"CTF challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 32-challenge subset","context_note":"","value_printed":"15","value_num":15,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":32,"direction":"higher_worse","value_status":"printed","location":"Sec 6.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000172","legacy_row_id":172,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4","subject_model_ids":[],"subject_label":"Claude Sonnet 4","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-cybench","group_id":"anthropic-cybench-v3","metric_label":"CTF challenges solved","metric_definition":"CTF challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 32-challenge subset","context_note":"","value_printed":"22","value_num":22,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":32,"direction":"higher_worse","value_status":"printed","location":"Sec 6.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000173","legacy_row_id":173,"split_index":0,"version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-long-form-virology-task-1","group_id":"anthropic-long-form-virology-task-1-v1","metric_label":"Score","metric_definition":"Task score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.76","value_num":0.76,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6.2.3.1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000174","legacy_row_id":174,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v3","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"all languages","context_note":"","value_printed":"99.78","value_num":99.78,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"All-languages total (multilingual set); not comparable to earlier cards' English-only values"},
{"measurement_id":"m-000175","legacy_row_id":175,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v3","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"all languages","context_note":"","value_printed":"99.31","value_num":99.31,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"All-languages total (multilingual set); not comparable to earlier cards' English-only values"},
{"measurement_id":"m-000176","legacy_row_id":176,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v3","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"all languages","context_note":"","value_printed":"98.87","value_num":98.87,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"All-languages total (multilingual set); not comparable to earlier cards' English-only values"},
{"measurement_id":"m-000177","legacy_row_id":177,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v3","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"all languages","context_note":"","value_printed":"99.14","value_num":99.14,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"All-languages total (multilingual set); not comparable to earlier cards' English-only values"},
{"measurement_id":"m-000178","legacy_row_id":178,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v3","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"all languages","context_note":"","value_printed":"99.7","value_num":99.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000179","legacy_row_id":179,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v3","metric_label":"Harmless response rate","metric_definition":"Harmless response rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"all languages","context_note":"","value_printed":"99.85","value_num":99.85,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000180","legacy_row_id":180,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v3","metric_label":"Over-refusal rate","metric_definition":"Over-refusal rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"all languages","context_note":"","value_printed":"0.23","value_num":0.23,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"All-languages total (multilingual set); not comparable to earlier cards' English-only values"},
{"measurement_id":"m-000181","legacy_row_id":181,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v3","metric_label":"Over-refusal rate","metric_definition":"Over-refusal rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"all languages","context_note":"","value_printed":"0.1","value_num":0.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"All-languages total (multilingual set); not comparable to earlier cards' English-only values"},
{"measurement_id":"m-000182","legacy_row_id":182,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v3","metric_label":"Over-refusal rate","metric_definition":"Over-refusal rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"all languages","context_note":"","value_printed":"0.05","value_num":0.05,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"All-languages total (multilingual set); not comparable to earlier cards' English-only values"},
{"measurement_id":"m-000183","legacy_row_id":183,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v3","metric_label":"Over-refusal rate","metric_definition":"Over-refusal rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"all languages","context_note":"","value_printed":"0.13","value_num":0.13,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"All-languages total (multilingual set); not comparable to earlier cards' English-only values"},
{"measurement_id":"m-000184","legacy_row_id":184,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-multi-turn-testing","group_id":"anthropic-multi-turn-testing-v1","metric_label":"Rubric failure rate, deadly weapons","metric_definition":"Rubric failure rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"5","value_num":5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"±4%"},
{"measurement_id":"m-000185","legacy_row_id":185,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-multi-turn-testing","group_id":"anthropic-multi-turn-testing-v1","metric_label":"Rubric failure rate, deadly weapons","metric_definition":"Rubric failure rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"22","value_num":22,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"±8%"},
{"measurement_id":"m-000186","legacy_row_id":186,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-multi-turn-testing","group_id":"anthropic-multi-turn-testing-v1","metric_label":"Rubric failure rate, violent extremism","metric_definition":"Rubric failure rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"qualitative","location":"Sec 3.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"'passed in all cases' Migration: The 0% was derived from the card's statement that the model passed in all cases; no printed percentage or interval was recorded."},
{"measurement_id":"m-000187","legacy_row_id":187,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-multi-turn-testing","group_id":"anthropic-multi-turn-testing-v1","metric_label":"Rubric failure rate, violent extremism","metric_definition":"Rubric failure rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"13","value_num":13,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"±7%"},
{"measurement_id":"m-000188","legacy_row_id":188,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-agentic-coding","group_id":"anthropic-malicious-agentic-coding-v1","metric_label":"Safety score","metric_definition":"Refusal rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"100","value_num":100,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Relabelled 'refusal rate' (was 'safety score')"},
{"measurement_id":"m-000189","legacy_row_id":189,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-agentic-coding","group_id":"anthropic-malicious-agentic-coding-v1","metric_label":"Safety score","metric_definition":"Refusal rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"100","value_num":100,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Relabelled 'refusal rate' (was 'safety score')"},
{"measurement_id":"m-000190","legacy_row_id":190,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-agentic-coding","group_id":"anthropic-malicious-agentic-coding-v1","metric_label":"Safety score","metric_definition":"Refusal rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"98.7","value_num":98.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Relabelled 'refusal rate' (was 'safety score')"},
{"measurement_id":"m-000191","legacy_row_id":191,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-agentic-coding","group_id":"anthropic-malicious-agentic-coding-v1","metric_label":"Safety score","metric_definition":"Refusal rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"96.0","value_num":96,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Relabelled 'refusal rate' (was 'safety score')"},
{"measurement_id":"m-000192","legacy_row_id":192,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Refusal rate, malicious requests","metric_definition":"Refusal rate, malicious requests","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"77.8","value_num":77.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000193","legacy_row_id":193,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Refusal rate, malicious requests","metric_definition":"Refusal rate, malicious requests","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"69.39","value_num":69.39,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000194","legacy_row_id":194,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Refusal rate, malicious requests","metric_definition":"Refusal rate, malicious requests","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"63.06","value_num":63.06,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Sonnet 4.5 value differs from Haiku 4.5 card (66.94): re-run"},
{"measurement_id":"m-000195","legacy_row_id":195,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Refusal rate, malicious requests","metric_definition":"Refusal rate, malicious requests","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"48.16","value_num":48.16,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000196","legacy_row_id":196,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Success rate, dual-use & benign","metric_definition":"Success rate, dual-use & benign","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"93.07","value_num":93.07,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000197","legacy_row_id":197,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Refusal rate, malicious requests","metric_definition":"Refusal rate, malicious requests","condition_effort":"","condition_mode":"","condition_safeguards":"with mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"97.35","value_num":97.35,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.2.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000198","legacy_row_id":198,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-computer-use","group_id":"anthropic-malicious-computer-use-v1","metric_label":"Refusal rate","metric_definition":"Refusal rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"88.39","value_num":88.39,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 5.1.3","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Read once"},
{"measurement_id":"m-000199","legacy_row_id":199,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-computer-use","group_id":"anthropic-malicious-computer-use-v1","metric_label":"Refusal rate","metric_definition":"Refusal rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"72.32","value_num":72.32,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 5.1.3","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Read once"},
{"measurement_id":"m-000200","legacy_row_id":200,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-computer-use","group_id":"anthropic-malicious-computer-use-v1","metric_label":"Refusal rate","metric_definition":"Refusal rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"83.03","value_num":83.03,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 5.1.3","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Read once"},
{"measurement_id":"m-000201","legacy_row_id":201,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-1","subject_model_ids":[],"subject_label":"Claude Opus 4.1","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-computer-use","group_id":"anthropic-malicious-computer-use-v1","metric_label":"Refusal rate","metric_definition":"Refusal rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"66.96","value_num":66.96,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 5.1.3","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Read once"},
{"measurement_id":"m-000202","legacy_row_id":202,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-coding-prompt-injection","group_id":"anthropic-coding-prompt-injection-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"1 attempt","context_note":"","value_printed":"0.3","value_num":0.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.2.2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000203","legacy_row_id":203,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-coding-prompt-injection","group_id":"anthropic-coding-prompt-injection-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"200 attempts","context_note":"","value_printed":"10.0","value_num":10,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.2.2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000204","legacy_row_id":204,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-coding-prompt-injection","group_id":"anthropic-coding-prompt-injection-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"1 attempt","context_note":"","value_printed":"0.7","value_num":0.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.2.2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000205","legacy_row_id":205,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-coding-prompt-injection","group_id":"anthropic-coding-prompt-injection-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"200 attempts","context_note":"","value_printed":"17.5","value_num":17.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.2.2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000206","legacy_row_id":206,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-coding-prompt-injection","group_id":"anthropic-coding-prompt-injection-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"1 attempt","context_note":"","value_printed":"17.7","value_num":17.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.2.2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000207","legacy_row_id":207,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-coding-prompt-injection","group_id":"anthropic-coding-prompt-injection-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"200 attempts","context_note":"","value_printed":"70.0","value_num":70,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.2.2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000208","legacy_row_id":208,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-coding-prompt-injection","group_id":"anthropic-coding-prompt-injection-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"1 attempt","context_note":"","value_printed":"29.9","value_num":29.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.2.2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000209","legacy_row_id":209,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-coding-prompt-injection","group_id":"anthropic-coding-prompt-injection-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"200 attempts","context_note":"","value_printed":"87.5","value_num":87.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.2.2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000210","legacy_row_id":210,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection-adaptive","group_id":"anthropic-computer-use-prompt-injection-adaptive-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"1 attempt","context_note":"","value_printed":"0.0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.2.2.2.A","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000211","legacy_row_id":211,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection-adaptive","group_id":"anthropic-computer-use-prompt-injection-adaptive-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"200 attempts","context_note":"","value_printed":"0.0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.2.2.2.A","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000212","legacy_row_id":212,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection-adaptive","group_id":"anthropic-computer-use-prompt-injection-adaptive-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"1 attempt","context_note":"","value_printed":"0.71","value_num":0.71,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.2.2.2.A","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000213","legacy_row_id":213,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection-adaptive","group_id":"anthropic-computer-use-prompt-injection-adaptive-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"200 attempts","context_note":"","value_printed":"28.6","value_num":28.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.2.2.2.A","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000214","legacy_row_id":214,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection-adaptive","group_id":"anthropic-computer-use-prompt-injection-adaptive-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"with safeguards","condition_surface":"","condition_other":"200 attempts","context_note":"","value_printed":"14.3","value_num":14.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.2.2.2.A","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000215","legacy_row_id":215,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-computer-use-prompt-injection-adaptive","group_id":"anthropic-computer-use-prompt-injection-adaptive-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"1 attempt","context_note":"","value_printed":"14.2","value_num":14.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.2.2.2.A","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000216","legacy_row_id":216,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-computer-use-prompt-injection-adaptive","group_id":"anthropic-computer-use-prompt-injection-adaptive-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"200 attempts","context_note":"","value_printed":"85.7","value_num":85.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.2.2.2.A","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000217","legacy_row_id":217,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-computer-use-prompt-injection-adaptive","group_id":"anthropic-computer-use-prompt-injection-adaptive-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"with safeguards","condition_surface":"","condition_other":"200 attempts","context_note":"","value_printed":"92.9","value_num":92.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 5.2.2.2.A","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Sonnet 4.5 with-safeguards > without at 200 attempts as extracted; verify Migration: As extracted, Sonnet 4.5's with-safeguards value (92.9%) is higher than its without-safeguards value (85.7%) at 200 attempts; the extractor flagged it for re-checking against Table 5.2.2.2.A."},
{"measurement_id":"m-000218","legacy_row_id":218,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"gray-swan-agent-red-teaming","group_id":"gray-swan-agent-red-teaming-anthropic-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"k=1","context_note":"","value_printed":"4.7","value_num":4.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"figure_read","location":"Fig 5.2.1","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2025/11/28/claude-opus-4-5-model-card-alignment-and-safety/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Figure value via secondary source; exact panel (indirect vs combined) unverified"},
{"measurement_id":"m-000219","legacy_row_id":219,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-simpleqa-verified","group_id":"anthropic-simpleqa-verified-v1","metric_label":"Improvement in correct answers vs prior Claude","metric_definition":"Improvement in correct answers vs prior Claude","condition_effort":"16k thinking budget","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"11","value_num":11,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"pp_improvement","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 4.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Absolute correct/incorrect/abstain figure-only Migration: positive value is an improvement in correct answers over the prior Claude model, as printed"},
{"measurement_id":"m-000220","legacy_row_id":220,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-aa-omniscience","group_id":"anthropic-aa-omniscience-v1","metric_label":"Improvement from 16k thinking vs no thinking","metric_definition":"Improvement from 16k thinking vs no thinking","condition_effort":"16k thinking budget","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"8.2","value_num":8.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"relative_change_percent","unit_as_printed":"%_improvement","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 4.1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Text ambiguous whether pp or relative Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000221","legacy_row_id":221,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-sycophancy-prefilled-conversations","group_id":"anthropic-sycophancy-prefilled-conversations-v1","metric_label":"Course-correction rate","metric_definition":"Course-correction rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"continuing sycophantic conversation","context_note":"","value_printed":"10","value_num":10,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 6.3","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2025/11/28/claude-opus-4-5-model-card-alignment-and-safety/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Past fetch truncation; via secondary source"},
{"measurement_id":"m-000222","legacy_row_id":222,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-sycophancy-prefilled-conversations","group_id":"anthropic-sycophancy-prefilled-conversations-v1","metric_label":"Course-correction rate","metric_definition":"Course-correction rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"continuing sycophantic conversation","context_note":"","value_printed":"16.5","value_num":16.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 6.3","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2025/11/28/claude-opus-4-5-model-card-alignment-and-safety/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Past fetch truncation; via secondary source"},
{"measurement_id":"m-000223","legacy_row_id":223,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-sycophancy-prefilled-conversations","group_id":"anthropic-sycophancy-prefilled-conversations-v1","metric_label":"Course-correction rate","metric_definition":"Course-correction rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"continuing sycophantic conversation","context_note":"","value_printed":"37","value_num":37,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 6.3","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2025/11/28/claude-opus-4-5-model-card-alignment-and-safety/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Past fetch truncation; via secondary source"},
{"measurement_id":"m-000224","legacy_row_id":224,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-rsp-deployment-standard","group_id":"anthropic-rsp-deployment-standard-v1","metric_label":"ASL standard deployed under","metric_definition":"ASL standard deployed under","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"ASL-3","value_num":null,"value_text":"ASL-3","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1 / Sec 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000225","legacy_row_id":225,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cbrn-4-threshold","group_id":"anthropic-cbrn-4-threshold-v1","metric_label":"Threshold crossed","metric_definition":"Threshold crossed?","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"No","value_num":null,"value_text":"No","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1 / Sec 7.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000226","legacy_row_id":226,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-4-threshold","group_id":"anthropic-ai-rd-4-threshold-v1","metric_label":"Threshold crossed","metric_definition":"Threshold crossed?","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"No","value_num":null,"value_text":"No","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1 / Sec 7.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Could not fully automate entry-level remote researcher"},
{"measurement_id":"m-000227","legacy_row_id":227,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-swe-bench-verified-hard-subset","group_id":"anthropic-swe-bench-verified-hard-subset-v2","metric_label":"Problems solved","metric_definition":"Problems solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 45 problems","context_note":"","value_printed":"21","value_num":21,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":45,"direction":"higher_worse","value_status":"printed","location":"Sec 7.3.1","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2025/11/28/claude-opus-4-5-model-card-alignment-and-safety/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Via secondary source"},
{"measurement_id":"m-000228","legacy_row_id":228,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-internal-suite-2","group_id":"anthropic-ai-rd-internal-suite-2-v1","metric_label":"Suite score","metric_definition":"Suite score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"rule-out threshold 0.6","value_printed":"0.604","value_num":0.604,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 7.3.3","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2025/11/28/claude-opus-4-5-model-card-alignment-and-safety/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Narrowly above rule-out threshold; via secondary source"},
{"measurement_id":"m-000229","legacy_row_id":229,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-asl-4-virology-uplift-trial","group_id":"anthropic-asl-4-virology-uplift-trial-v1","metric_label":"Protocol-score uplift vs internet-only","metric_definition":"Protocol-score uplift vs internet-only","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.97","value_num":1.97,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_uplift","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 7.2.4.8","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2025/11/28/claude-opus-4-5-model-card-alignment-and-safety/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Via secondary source"},
{"measurement_id":"m-000230","legacy_row_id":230,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-bioinformatics-evaluations","group_id":"anthropic-bioinformatics-evaluations-v1","metric_label":"Score","metric_definition":"Score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"human baseline 62.3%","value_printed":"73.7","value_num":73.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 7.2.4.7","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2025/11/28/claude-opus-4-5-model-card-alignment-and-safety/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Via secondary source"},
{"measurement_id":"m-000231","legacy_row_id":231,"split_index":0,"version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-internal-model-use-survey","group_id":"anthropic-internal-model-use-survey-v1","metric_label":"Staff reporting >=100% productivity gain","metric_definition":"Staff reporting >=100% productivity gain","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 18 staff surveyed","context_note":"","value_printed":"9","value_num":9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":18,"direction":"higher_worse","value_status":"printed","location":"Sec 7.3.4","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2025/11/28/claude-opus-4-5-model-card-alignment-and-safety/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Median 100%, mean 220%; via secondary source"},
{"measurement_id":"m-000232","legacy_row_id":232,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v3","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.64","value_num":99.64,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000233","legacy_row_id":233,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v3","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.69","value_num":99.69,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000234","legacy_row_id":234,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v3","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"97.95","value_num":97.95,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000235","legacy_row_id":235,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-haiku-4-5","subject_model_ids":[],"subject_label":"Claude Haiku 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v3","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"98.7","value_num":98.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000236","legacy_row_id":236,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v3","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.68","value_num":0.68,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000237","legacy_row_id":237,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-5","subject_model_ids":[],"subject_label":"Claude Opus 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v3","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.83","value_num":0.83,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000238","legacy_row_id":238,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v3","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.09","value_num":0.09,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000239","legacy_row_id":239,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-higher-difficulty-violative-requests","group_id":"anthropic-higher-difficulty-violative-requests-v1","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.18","value_num":99.18,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.3.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000240","legacy_row_id":240,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-higher-difficulty-benign-requests","group_id":"anthropic-higher-difficulty-benign-requests-v1","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.04","value_num":0.04,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3.1.3.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000241","legacy_row_id":241,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-higher-difficulty-benign-requests","group_id":"anthropic-higher-difficulty-benign-requests-v1","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"8.5","value_num":8.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3.1.3.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000242","legacy_row_id":242,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Refusal rate, malicious requests","metric_definition":"refusal rate on malicious requests","condition_effort":"","condition_mode":"","condition_safeguards":"with system prompt + FileRead reminder","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.6","value_num":99.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 5.1.2","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/02/09/claude-opus-4-6-system-card-part-1-mundane-alignment-and-model-welfare/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi)"},
{"measurement_id":"m-000243","legacy_row_id":243,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-computer-use","group_id":"anthropic-malicious-computer-use-v1","metric_label":"Refusal rate","metric_definition":"refusal rate on malicious tasks","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"88.3","value_num":88.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 5.1.3","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/02/09/claude-opus-4-6-system-card-part-1-mundane-alignment-and-model-welfare/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi)"},
{"measurement_id":"m-000244","legacy_row_id":244,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"gray-swan-agent-red-teaming","group_id":"gray-swan-agent-red-teaming-anthropic-v1","metric_label":"Attack success rate within k=100 attempts","metric_definition":"attack success rate within k=100 attempts","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"21.7","value_num":21.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 5.2.1","source_type":"secondary","via_url":"https://neuraltrust.ai/blog/claude-opus-4-6-safety","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (NeuralTrust); thinking raised ASR"},
{"measurement_id":"m-000245","legacy_row_id":245,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"gray-swan-agent-red-teaming","group_id":"gray-swan-agent-red-teaming-anthropic-v1","metric_label":"Attack success rate within k=100 attempts","metric_definition":"attack success rate within k=100 attempts","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"14.8","value_num":14.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 5.2.1","source_type":"secondary","via_url":"https://neuraltrust.ai/blog/claude-opus-4-6-safety","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (NeuralTrust)"},
{"measurement_id":"m-000246","legacy_row_id":246,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-coding-prompt-injection","group_id":"anthropic-coding-prompt-injection-v1","metric_label":"Attack success rate","metric_definition":"attack success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"all conditions","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 5.2.2.1","source_type":"secondary","via_url":"https://neuraltrust.ai/blog/claude-opus-4-6-safety","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (NeuralTrust; Zvi: 'a bunch of zeroes')"},
{"measurement_id":"m-000247","legacy_row_id":247,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-browser-use-prompt-injection","group_id":"anthropic-browser-use-prompt-injection-v1","metric_label":"Attack success rate per attacked session","metric_definition":"attack success rate per attacked session","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"2","value_num":2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"qualitative","location":"Sec 5.2.2.3","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/02/09/claude-opus-4-6-system-card-part-1-mundane-alignment-and-model-welfare/","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"derived from Zvi paraphrase '98% of the time' safe; exact figure not verified Migration: The 2% was derived by the v0 extractor from a secondary source's paraphrase that the model was safe 98% of the time; the card's own figure was not seen."},
{"measurement_id":"m-000248","legacy_row_id":248,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-honesty-evaluation","group_id":"anthropic-honesty-evaluation-v1","metric_label":"Win rate","metric_definition":"win rate","condition_effort":"","condition_mode":"full thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"default mode: 54%","value_printed":"61","value_num":61,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 4","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/02/09/claude-opus-4-6-system-card-part-1-mundane-alignment-and-model-welfare/","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Zvi text; eval definition unclear (100Q-Hard/human feedback)"},
{"measurement_id":"m-000249","legacy_row_id":249,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-sandbagging-transcript-review","group_id":"anthropic-sandbagging-transcript-review-v1","metric_label":"Explicit sandbagging instances found","metric_definition":"explicit sandbagging instances found","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"1,000 eval transcripts","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":1000,"direction":"higher_worse","value_status":"printed","location":"Sec 6","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/02/10/claude-opus-4-6-system-card-part-2-frontier-alignment/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi quote); SHADE-Arena numbers in separate Sabotage Risk Report"},
{"measurement_id":"m-000250","legacy_row_id":250,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cybench","group_id":"anthropic-cybench-v4","metric_label":"Success rate, pass@30","metric_definition":"pass@30 success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"100","value_num":100,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 1.2.4.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"reported as ~100%; 'saturated all current cyber evaluations'"},
{"measurement_id":"m-000251","legacy_row_id":251,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cybergym","group_id":"anthropic-cybergym-v1","metric_label":"Targeted vuln reproduction rate","metric_definition":"pass@1 targeted vuln reproduction","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"66","value_num":66,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 1.2.4.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"later cards re-report Opus 4.6 as 67% (Mythos Preview card) and 0.74 'updated' (Opus 4.7 card)"},
{"measurement_id":"m-000252","legacy_row_id":252,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-internal-ai-rd-survey","group_id":"anthropic-internal-ai-rd-survey-v1","metric_label":"Respondents saying model could automate entry-level researcher","metric_definition":"respondents saying model could automate entry-level researcher","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 16 respondents","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":16,"direction":"higher_worse","value_status":"printed","location":"Sec 1.2.4.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000253","legacy_row_id":253,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-4-threshold","group_id":"anthropic-ai-rd-4-threshold-v1","metric_label":"Threshold crossed","metric_definition":"RSP capability determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not crossed","value_num":null,"value_text":"not crossed","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1.2.4.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"'plausible... scaffolded models may be close'"},
{"measurement_id":"m-000254","legacy_row_id":254,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cbrn-4-threshold","group_id":"anthropic-cbrn-4-threshold-v1","metric_label":"Threshold crossed","metric_definition":"RSP capability determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not crossed","value_num":null,"value_text":"not crossed","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1.2.4.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000255","legacy_row_id":255,"split_index":0,"version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-rsp-deployment-standard","group_id":"anthropic-rsp-deployment-standard-v1","metric_label":"ASL standard deployed under","metric_definition":"ASL level applied","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"ASL-3","value_num":null,"value_text":"ASL-3","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1.2.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000256","legacy_row_id":256,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v3","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.38","value_num":99.38,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000257","legacy_row_id":257,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v3","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.63","value_num":99.63,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 4.6 own card reports 99.64"},
{"measurement_id":"m-000258","legacy_row_id":258,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-5","subject_model_ids":[],"subject_label":"Claude Sonnet 4.5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v3","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"97.89","value_num":97.89,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 4.6 card reports 97.95"},
{"measurement_id":"m-000259","legacy_row_id":259,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v3","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.41","value_num":0.41,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000260","legacy_row_id":260,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v3","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.66","value_num":0.66,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 4.6 own card reports 0.68"},
{"measurement_id":"m-000261","legacy_row_id":261,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-higher-difficulty-violative-requests","group_id":"anthropic-higher-difficulty-violative-requests-v1","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.4","value_num":99.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.1.3.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000262","legacy_row_id":262,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-higher-difficulty-benign-requests","group_id":"anthropic-higher-difficulty-benign-requests-v1","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"overall across thinking modes","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.18","value_num":0.18,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3.1.3.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000263","legacy_row_id":263,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-child-safety-single-turn-violative","group_id":"anthropic-child-safety-single-turn-violative-v1","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.96","value_num":99.96,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.4.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000264","legacy_row_id":264,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-child-safety-multi-turn","group_id":"anthropic-child-safety-multi-turn-v1","metric_label":"Appropriate response rate","metric_definition":"appropriate response rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"95","value_num":95,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.4.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000265","legacy_row_id":265,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-suicide-self-harm-multi-turn","group_id":"anthropic-suicide-self-harm-multi-turn-v1","metric_label":"Appropriate response rate","metric_definition":"appropriate response rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"98","value_num":98,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.4.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000266","legacy_row_id":266,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-suicide-self-harm-multi-turn","group_id":"anthropic-suicide-self-harm-multi-turn-v1","metric_label":"Appropriate response rate","metric_definition":"appropriate response rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"82","value_num":82,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3.4.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000267","legacy_row_id":267,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection","group_id":"anthropic-computer-use-prompt-injection-v2","metric_label":"Attack success rate (% of scenarios)","metric_definition":"attack success rate (% of scenarios)","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.29","value_num":1.29,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 5","source_type":"secondary","via_url":"https://caylent.com/blog/claude-sonnet-4-6-in-production-capability-safety-and-cost-explained","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Caylent); 0.29% of attempts"},
{"measurement_id":"m-000268","legacy_row_id":268,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection","group_id":"anthropic-computer-use-prompt-injection-v2","metric_label":"Attack success rate (% of scenarios)","metric_definition":"attack success rate (% of scenarios)","condition_effort":"","condition_mode":"","condition_safeguards":"with safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.51","value_num":0.51,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 5","source_type":"secondary","via_url":"https://caylent.com/blog/claude-sonnet-4-6-in-production-capability-safety-and-cost-explained","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Caylent); 0.08% of attempts"},
{"measurement_id":"m-000269","legacy_row_id":269,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-over-eager-behavior-gui-computer-use","group_id":"anthropic-over-eager-behavior-gui-computer-use-v1","metric_label":"Rate vs prior models","metric_definition":"rate vs prior models","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"higher than prior models","value_num":null,"value_text":"higher than prior models","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Sec 4","source_type":"lab_summary","via_url":"https://www.anthropic.com/transparency","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Anthropic Transparency Hub summary; mitigated by system prompt"},
{"measurement_id":"m-000270","legacy_row_id":270,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-rsp-deployment-standard","group_id":"anthropic-rsp-deployment-standard-v1","metric_label":"ASL standard deployed under","metric_definition":"ASL level applied","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"ASL-3","value_num":null,"value_text":"ASL-3","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1.2.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"performed at or below Opus 4.6"},
{"measurement_id":"m-000271","legacy_row_id":271,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-4-threshold","group_id":"anthropic-ai-rd-4-threshold-v1","metric_label":"Threshold crossed","metric_definition":"RSP capability determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not crossed","value_num":null,"value_text":"not crossed","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1.2.5.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000272","legacy_row_id":272,"split_index":0,"version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cbrn-4-threshold","group_id":"anthropic-cbrn-4-threshold-v1","metric_label":"Threshold crossed","metric_definition":"RSP capability determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not crossed","value_num":null,"value_text":"not crossed","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1.2.5.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"below prior models on all CBRN evals"},
{"measurement_id":"m-000273","legacy_row_id":273,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-release-decision","group_id":"anthropic-release-decision-v1","metric_label":"Deployment scope","metric_definition":"deployment scope","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"limited release (not GA)","value_num":null,"value_text":"limited release (not GA)","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"defensive-cyber partners only (Project Glasswing)"},
{"measurement_id":"m-000274","legacy_row_id":274,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cb-1-threat-model","group_id":"anthropic-cb-1-threat-model-v1","metric_label":"RSP determination","metric_definition":"RSP determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"applicable","value_num":null,"value_text":"applicable","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000275","legacy_row_id":275,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cb-2-threat-model","group_id":"anthropic-cb-2-threat-model-v1","metric_label":"RSP determination","metric_definition":"RSP determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not applicable","value_num":null,"value_text":"not applicable","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000276","legacy_row_id":276,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-autonomy-threat-model-2","group_id":"anthropic-autonomy-threat-model-2-v1","metric_label":"RSP determination","metric_definition":"RSP determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not applicable","value_num":null,"value_text":"not applicable","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000277","legacy_row_id":277,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cybench","group_id":"anthropic-cybench-v5","metric_label":"Success rate, pass@1","metric_definition":"pass@1 success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"35 challenges","context_note":"10 trials each","value_printed":"100","value_num":100,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000278","legacy_row_id":278,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cybergym","group_id":"anthropic-cybergym-v1","metric_label":"Targeted vuln reproduction rate","metric_definition":"targeted vuln reproduction rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"83","value_num":83,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.2","source_type":"lab_summary","via_url":"https://www.anthropic.com/transparency","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Transparency Hub summary; card text truncated at 3.3.2"},
{"measurement_id":"m-000279","legacy_row_id":279,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-cybergym","group_id":"anthropic-cybergym-v1","metric_label":"Targeted vuln reproduction rate","metric_definition":"targeted vuln reproduction rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"67","value_num":67,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.2","source_type":"lab_summary","via_url":"https://www.anthropic.com/transparency","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Transparency Hub summary"},
{"measurement_id":"m-000280","legacy_row_id":280,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-kernel-task","group_id":"anthropic-ai-rd-kernel-task-v1","metric_label":"Best speedup","metric_definition":"best speedup (hard task)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"399.42","value_num":399.42,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3 table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Run on the standard scaffold, the default setting; the developer contrasts it with an experimental scaffold, which has no row here."},
{"measurement_id":"m-000281","legacy_row_id":281,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-ai-rd-kernel-task","group_id":"anthropic-ai-rd-kernel-task-v1","metric_label":"Best speedup","metric_definition":"best speedup (hard task)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"190","value_num":190,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3 table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"427x with experimental scaffold Migration: Run on the standard scaffold, the default setting; the developer contrasts it with an experimental scaffold, which has no row here."},
{"measurement_id":"m-000282","legacy_row_id":282,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-llm-training-task","group_id":"anthropic-ai-rd-llm-training-task-v1","metric_label":"Average speedup","metric_definition":"average speedup","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"51.91","value_num":51.91,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3 table","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"verified verbatim; Opus 4.7 card lists Mythos Preview 61.79x, Fable 5 card re-run 60.81x"},
{"measurement_id":"m-000283","legacy_row_id":283,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-ai-rd-llm-training-task","group_id":"anthropic-ai-rd-llm-training-task-v1","metric_label":"Average speedup","metric_definition":"average speedup","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"34","value_num":34,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3 table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000284","legacy_row_id":284,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-novel-compiler-task","group_id":"anthropic-ai-rd-novel-compiler-task-v1","metric_label":"Pass rate","metric_definition":"pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"77.2","value_num":77.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3 table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"40h-equivalent threshold 90%"},
{"measurement_id":"m-000285","legacy_row_id":285,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-internal-suite-2","group_id":"anthropic-ai-rd-internal-suite-2-v1","metric_label":"Suite score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.65","value_num":0.65,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3 table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"threshold 0.6"},
{"measurement_id":"m-000286","legacy_row_id":286,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-internal-ai-rd-survey","group_id":"anthropic-internal-ai-rd-survey-v1","metric_label":"Respondents saying drop-in entry-level researcher now","metric_definition":"respondents saying drop-in entry-level researcher now","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 18 respondents","context_note":"","value_printed":"1","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":18,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"4/18 said 50% chance with 3 months scaffolding"},
{"measurement_id":"m-000287","legacy_row_id":287,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-multimodal-virology-vct","group_id":"anthropic-multimodal-virology-vct-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.574","value_num":0.574,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"expert baseline 0.221"},
{"measurement_id":"m-000288","legacy_row_id":288,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-multimodal-virology-vct","group_id":"anthropic-multimodal-virology-vct-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.483","value_num":0.483,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000289","legacy_row_id":289,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-virology-protocol-uplift-trial","group_id":"anthropic-virology-protocol-uplift-trial-v1","metric_label":"Mean critical failures","metric_definition":"mean critical failures","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"model-assisted","context_note":"","value_printed":"4.3","value_num":4.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 2.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"internet-only control 5.6; Opus 4.6 6.6; fewer failures = more uplift"},
{"measurement_id":"m-000290","legacy_row_id":290,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Reward hack rate","metric_definition":"reward hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"37.5","value_num":37.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.2","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (hugobowne wiki summary)"},
{"measurement_id":"m-000291","legacy_row_id":291,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Reward hack rate","metric_definition":"reward hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"no anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"45.0","value_num":45,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.2","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (hugobowne wiki summary)"},
{"measurement_id":"m-000292","legacy_row_id":292,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Reward hack rate","metric_definition":"reward hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"20.0","value_num":20,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.2","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (hugobowne wiki summary)"},
{"measurement_id":"m-000293","legacy_row_id":293,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Reward hack rate","metric_definition":"reward hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"37.5","value_num":37.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.2","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (hugobowne wiki summary)"},
{"measurement_id":"m-000294","legacy_row_id":294,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-gui-computer-use-impossible-tasks","group_id":"anthropic-gui-computer-use-impossible-tasks-v1","metric_label":"Reward hack rate","metric_definition":"reward hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"3.8","value_num":3.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.2","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (hugobowne wiki summary)"},
{"measurement_id":"m-000295","legacy_row_id":295,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-gui-computer-use-impossible-tasks","group_id":"anthropic-gui-computer-use-impossible-tasks-v1","metric_label":"Reward hack rate","metric_definition":"reward hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"31.6","value_num":31.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.2","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (hugobowne wiki summary)"},
{"measurement_id":"m-000296","legacy_row_id":296,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-gui-computer-use-impossible-tasks","group_id":"anthropic-gui-computer-use-impossible-tasks-v1","metric_label":"Reward hack rate","metric_definition":"reward hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"anti-hack prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"20.6","value_num":20.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.2","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (hugobowne wiki summary)"},
{"measurement_id":"m-000297","legacy_row_id":297,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-destructive-actions-synthetic-backend","group_id":"anthropic-destructive-actions-synthetic-backend-v1","metric_label":"Destructive action rate","metric_definition":"destructive action rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.8","value_num":0.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.2","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation; Opus 4.5 25%"},
{"measurement_id":"m-000298","legacy_row_id":298,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-destructive-actions-synthetic-backend","group_id":"anthropic-destructive-actions-synthetic-backend-v1","metric_label":"Destructive action rate","metric_definition":"destructive action rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"8.2","value_num":8.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.2","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation"},
{"measurement_id":"m-000299","legacy_row_id":299,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-automated-behavioral-audit","group_id":"anthropic-automated-behavioral-audit-v2","metric_label":"Overall misaligned behavior score","metric_definition":"overall misaligned behavior score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.4","value_num":1.4,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_1_10","denominator":null,"scale":"1–10","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"figure_read","location":"Sec 4.2.3","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"approximate value read from chart by secondary wiki"},
{"measurement_id":"m-000300","legacy_row_id":300,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-automated-behavioral-audit-sycophancy","group_id":"anthropic-automated-behavioral-audit-sycophancy-v1","metric_label":"Sycophancy score","metric_definition":"sycophancy score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.11","value_num":1.11,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_1_10","denominator":null,"scale":"1–10","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"figure_read","location":"Sec 4.2.3","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"low","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"approximate chart read (secondary)"},
{"measurement_id":"m-000301","legacy_row_id":301,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-automated-behavioral-audit-sycophancy","group_id":"anthropic-automated-behavioral-audit-sycophancy-v1","metric_label":"Sycophancy score","metric_definition":"sycophancy score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.51","value_num":1.51,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_1_10","denominator":null,"scale":"1–10","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"figure_read","location":"Sec 4.2.3","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"approximate chart read (secondary)"},
{"measurement_id":"m-000302","legacy_row_id":302,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-100q-hard","group_id":"anthropic-100q-hard-v1","metric_label":"Correct answer rate","metric_definition":"correct answer rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"60.1","value_num":60.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 4.3","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation"},
{"measurement_id":"m-000303","legacy_row_id":303,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-100q-hard","group_id":"anthropic-100q-hard-v1","metric_label":"Correct answer rate","metric_definition":"correct answer rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"41.0","value_num":41,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 4.3","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation"},
{"measurement_id":"m-000304","legacy_row_id":304,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-false-premise-honesty","group_id":"anthropic-false-premise-honesty-v1","metric_label":"Honest pushback rate","metric_definition":"honest pushback rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"80.0","value_num":80,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 4.3","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation; Zvi concurs (80% vs 76%)"},
{"measurement_id":"m-000305","legacy_row_id":305,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-false-premise-honesty","group_id":"anthropic-false-premise-honesty-v1","metric_label":"Honest pushback rate","metric_definition":"honest pushback rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"76.0","value_num":76,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 4.3","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation"},
{"measurement_id":"m-000306","legacy_row_id":306,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-mask","group_id":"anthropic-mask-v1","metric_label":"Honesty rate under pressure","metric_definition":"honesty rate under pressure","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"95.4","value_num":95.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 4.3","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation; Zvi: 95% vs 90%"},
{"measurement_id":"m-000307","legacy_row_id":307,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-mask","group_id":"anthropic-mask-v1","metric_label":"Honesty rate under pressure","metric_definition":"honesty rate under pressure","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"90.3","value_num":90.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 4.3","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation"},
{"measurement_id":"m-000308","legacy_row_id":308,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-evaluation-awareness-in-audit-transcripts","group_id":"anthropic-evaluation-awareness-in-audit-transcripts-v1","metric_label":"Share of transcripts with eval awareness","metric_definition":"share of transcripts with eval awareness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"white-box/unverbalized detection","context_note":"","value_printed":"29","value_num":29,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.4-4.5","source_type":"secondary","via_url":"https://thezvi.substack.com/p/claude-mythos-the-system-card","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondaries conflict on verbalized vs white-box; Opus 4.7 card says Mythos Preview verbalized ~1% Migration: The about 1% in the v0 notes is the verbalized rate the Opus 4.7 card gives for Mythos Preview, not this value; secondary sources disagree on whether this 29% is verbalized or white-box."},
{"measurement_id":"m-000309","legacy_row_id":309,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-shade-arena","group_id":"anthropic-shade-arena-v1","metric_label":"Stealth success rate","metric_definition":"stealth side-task success rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"3.8","value_num":3.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.4.3","source_type":"secondary","via_url":"https://thezvi.substack.com/p/claude-mythos-the-system-card","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi); Opus 4.7 card reports 3.8-4.2% Migration: The thinking was visible to the monitor."},
{"measurement_id":"m-000310","legacy_row_id":310,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-shade-arena","group_id":"anthropic-shade-arena-v1","metric_label":"Stealth success rate","metric_definition":"stealth side-task success rate","condition_effort":"","condition_mode":"hidden scratchpad","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"13.8","value_num":13.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.4.3","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04b-alignment-part2","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (hugobowne wiki)"},
{"measurement_id":"m-000311","legacy_row_id":311,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-minimal-linuxbench","group_id":"anthropic-minimal-linuxbench-v1","metric_label":"Stealth success rate","metric_definition":"stealth success rate","condition_effort":"","condition_mode":"CoT visible to monitor","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"2.7","value_num":2.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.4.3","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04b-alignment-part2","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation; 11.4% vs no-CoT monitor"},
{"measurement_id":"m-000312","legacy_row_id":312,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-sandbagging-transcript-review","group_id":"anthropic-sandbagging-transcript-review-v1","metric_label":"Possible sandbagging cases","metric_definition":"possible sandbagging cases","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"20 flagged transcripts human-reviewed","context_note":"","value_printed":"1","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":20,"direction":"higher_worse","value_status":"printed","location":"Sec 4.4.2","source_type":"secondary","via_url":"https://thezvi.substack.com/p/claude-mythos-the-system-card","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi)"},
{"measurement_id":"m-000313","legacy_row_id":313,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-encoded-reasoning-scratchpad-paraphrase","group_id":"anthropic-encoded-reasoning-scratchpad-paraphrase-v1","metric_label":"Pass@1 with paraphrased scratchpad","metric_definition":"pass@1 with paraphrased scratchpad","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"original 0.866; empty scratchpad 0.163","value_printed":"0.864","value_num":0.864,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 4.4.1","source_type":"secondary","via_url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04b-alignment-part2","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"paraphrase ~no loss suggests no steganography; secondary Migration: The ~ in the v0 notes describes the size of the score change, not this value."},
{"measurement_id":"m-000314","legacy_row_id":314,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-sandbox-escape-incident","group_id":"anthropic-sandbox-escape-incident-v1","metric_label":"Real-world incident reported","metric_definition":"real-world incident reported","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"internal use","context_note":"","value_printed":"reported","value_num":null,"value_text":"reported","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 4.1","source_type":"secondary","via_url":"https://thezvi.substack.com/p/claude-mythos-the-system-card","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"multi-step exploit to reach internet; posted exploit details publicly; per Zvi"},
{"measurement_id":"m-000315","legacy_row_id":315,"split_index":0,"version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-internal-deployment-monitoring","group_id":"anthropic-internal-deployment-monitoring-v1","metric_label":"Covering tracks after disallowed actions","metric_definition":"rate in internal interactions","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"earlier snapshots","context_note":"","value_printed":"0.001","value_num":0.001,"value_text":"","value_qualifier":"lt","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.1","source_type":"secondary","via_url":"https://thezvi.substack.com/p/claude-mythos-the-system-card","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"reported as <0.001%; secondary (Zvi)"},
{"measurement_id":"m-000316","legacy_row_id":316,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cb-1-threat-model","group_id":"anthropic-cb-1-threat-model-v1","metric_label":"RSP determination","metric_definition":"RSP determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"applicable","value_num":null,"value_text":"applicable","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000317","legacy_row_id":317,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cb-2-threat-model","group_id":"anthropic-cb-2-threat-model-v1","metric_label":"RSP determination","metric_definition":"RSP determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not applicable","value_num":null,"value_text":"not applicable","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000318","legacy_row_id":318,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-autonomy-threat-model-2","group_id":"anthropic-autonomy-threat-model-2-v1","metric_label":"RSP determination","metric_definition":"RSP determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not applicable","value_num":null,"value_text":"not applicable","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 2.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000319","legacy_row_id":319,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-long-form-virology-task-1","group_id":"anthropic-long-form-virology-task-1-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.82","value_num":0.82,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2.5.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"threshold 0.80"},
{"measurement_id":"m-000320","legacy_row_id":320,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-long-form-virology-task-2","group_id":"anthropic-long-form-virology-task-2-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.94","value_num":0.94,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2.5.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000321","legacy_row_id":321,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-multimodal-virology-vct","group_id":"anthropic-multimodal-virology-vct-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.5","value_num":0.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2.5.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000322","legacy_row_id":322,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-dna-synthesis-screening-evasion","group_id":"anthropic-dna-synthesis-screening-evasion-v1","metric_label":"Pathogens with viable evasion","metric_definition":"pathogens with viable evasion","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 10 pathogens","context_note":"","value_printed":"8","value_num":8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":10,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2.5.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000323","legacy_row_id":323,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-kernel-task","group_id":"anthropic-ai-rd-kernel-task-v1","metric_label":"Best speedup","metric_definition":"best speedup","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"371.75","value_num":371.75,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000324","legacy_row_id":324,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-llm-training-task","group_id":"anthropic-ai-rd-llm-training-task-v1","metric_label":"Average speedup","metric_definition":"average speedup","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"40.81","value_num":40.81,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 5 card re-reports Opus 4.7 as 50.67x (easy)"},
{"measurement_id":"m-000325","legacy_row_id":325,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-ai-rd-llm-training-task","group_id":"anthropic-ai-rd-llm-training-task-v1","metric_label":"Average speedup","metric_definition":"average speedup","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"61.79","value_num":61.79,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"verbatim row; differs from Mythos Preview card (51.91x)"},
{"measurement_id":"m-000326","legacy_row_id":326,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-novel-compiler-task","group_id":"anthropic-ai-rd-novel-compiler-task-v1","metric_label":"Pass rate","metric_definition":"pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"71.1","value_num":71.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000327","legacy_row_id":327,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-quadruped-rl-task","group_id":"anthropic-ai-rd-quadruped-rl-task-v1","metric_label":"Highest score","metric_definition":"highest score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"threshold >12 = 4h equivalent","value_printed":"26.5","value_num":26.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"threshold >12 = 4h eq. Migration: task score; scale not stated in the source as recorded (the card gives a threshold of 12 as the 4-hour equivalent)"},
{"measurement_id":"m-000328","legacy_row_id":328,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cybench","group_id":"anthropic-cybench-v5","metric_label":"Success rate, pass@1","metric_definition":"pass@1 success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"35 challenges","context_note":"","value_printed":"96","value_num":96,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"saturated"},
{"measurement_id":"m-000329","legacy_row_id":329,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cybergym","group_id":"anthropic-cybergym-v1","metric_label":"Targeted vuln reproduction rate","metric_definition":"pass@1","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.74","value_num":0.74,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.2","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"'almost identical to Opus 4.6' (0.74, updated from 0.67)"},
{"measurement_id":"m-000330","legacy_row_id":330,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":false,"eval_id":"uk-aisi-cyber-range","group_id":"uk-aisi-cyber-range-anthropic-v1","metric_label":"Full range solves","metric_definition":"full range solves","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"10 attempts","context_note":"","value_printed":"3","value_num":3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":10,"direction":"higher_worse","value_status":"printed","location":"Sec 3.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 4.7 did not fully solve; best ~5 expert-hours of 10+"},
{"measurement_id":"m-000331","legacy_row_id":331,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-shade-arena","group_id":"anthropic-shade-arena-v1","metric_label":"Stealth success rate","metric_definition":"stealth success rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.75","value_num":1.75,"value_text":"","value_qualifier":"range","range_low":"1.5","range_high":"2","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.4.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"reported as range 1.5-2%; midpoint shown Migration: The source prints a range; v0 stored the midpoint of it, which value_num keeps for plotting only."},
{"measurement_id":"m-000332","legacy_row_id":332,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-shade-arena","group_id":"anthropic-shade-arena-v1","metric_label":"Stealth success rate","metric_definition":"stealth success rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"4.0","value_num":4,"value_text":"","value_qualifier":"range","range_low":"3.8","range_high":"4.2","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.4.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"reported as range 3.8-4.2%; midpoint shown Migration: The source prints a range; v0 stored the midpoint of it, which value_num keeps for plotting only."},
{"measurement_id":"m-000333","legacy_row_id":333,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-shade-arena","group_id":"anthropic-shade-arena-v1","metric_label":"Stealth success rate","metric_definition":"stealth success rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.75","value_num":0.75,"value_text":"","value_qualifier":"range","range_low":"0","range_high":"1.5","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.4.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"reported as range 0-1.5%; midpoint shown Migration: The source prints a range; v0 stored the midpoint of it, which value_num keeps for plotting only."},
{"measurement_id":"m-000334","legacy_row_id":334,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-minimal-linuxbench","group_id":"anthropic-minimal-linuxbench-v1","metric_label":"Stealth success rate","metric_definition":"stealth success rate","condition_effort":"","condition_mode":"CoT visible to monitor","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"2.6","value_num":2.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.4.1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"all three models within 2.6-3.9%; Opus 4.7 lowest Migration: Recorded in v0 as \"with CoT\"; read as the chain of thought being visible to the monitor."},
{"measurement_id":"m-000335","legacy_row_id":335,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-automated-behavioral-audit-eval-awareness","group_id":"anthropic-automated-behavioral-audit-eval-awareness-v2","metric_label":"Share of transcripts verbalizing eval awareness","metric_definition":"share of transcripts verbalizing being evaluated","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"9","value_num":9,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6","source_type":"lab_summary","via_url":"https://www.anthropic.com/transparency","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Transparency Hub verbatim of card"},
{"measurement_id":"m-000336","legacy_row_id":336,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-6","subject_model_ids":[],"subject_label":"Claude Opus 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-automated-behavioral-audit-eval-awareness","group_id":"anthropic-automated-behavioral-audit-eval-awareness-v2","metric_label":"Share of transcripts verbalizing eval awareness","metric_definition":"share of transcripts verbalizing being evaluated","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1","value_num":1,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6","source_type":"lab_summary","via_url":"https://www.anthropic.com/transparency","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"'roughly 1%' also for Mythos Preview and Sonnet 4.6"},
{"measurement_id":"m-000337","legacy_row_id":337,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v3","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.28","value_num":0.28,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4.1.2","source_type":"secondary","via_url":"https://thezvi.substack.com/p/opus-47-part-1-the-model-card","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi); Sonnet 4.6 0.41, Opus 4.6 0.71, Mythos Preview 0.06; Opus 4.8 card gives 0.31"},
{"measurement_id":"m-000338","legacy_row_id":338,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-accidental-cot-supervision-in-rl","group_id":"anthropic-accidental-cot-supervision-in-rl-v1","metric_label":"Share of training episodes affected","metric_definition":"share of training episodes affected","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"7.8","value_num":7.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.4 / 6","source_type":"secondary","via_url":"https://thezvi.substack.com/p/opus-47-part-1-the-model-card","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi); training error affecting CoT monitorability"},
{"measurement_id":"m-000339","legacy_row_id":339,"split_index":0,"version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-impossible-tasks","group_id":"anthropic-impossible-tasks-v2","metric_label":"Reward hack rate","metric_definition":"reward hack rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"45","value_num":45,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6","source_type":"secondary","via_url":"https://thezvi.substack.com/p/opus-47-part-1-the-model-card","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Zvi summary; condition unclear Migration: The secondary summary this value comes from does not make the setting clear (v0 note: condition unclear), so no anti-hack prompt setting is recorded."},
{"measurement_id":"m-000340","legacy_row_id":340,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v4","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"97.98","value_num":97.98,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new format: API no-system-prompt vs claude.ai columns with CIs"},
{"measurement_id":"m-000341","legacy_row_id":341,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v4","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"claude.ai system prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.17","value_num":99.17,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new format: API no-system-prompt vs claude.ai columns with CIs"},
{"measurement_id":"m-000342","legacy_row_id":342,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v4","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"97.43","value_num":97.43,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new format: API no-system-prompt vs claude.ai columns with CIs"},
{"measurement_id":"m-000343","legacy_row_id":343,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v4","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"98.18","value_num":98.18,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new format: API no-system-prompt vs claude.ai columns with CIs"},
{"measurement_id":"m-000344","legacy_row_id":344,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v4","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"97.23","value_num":97.23,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new format: API no-system-prompt vs claude.ai columns with CIs"},
{"measurement_id":"m-000345","legacy_row_id":345,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v4","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.36","value_num":0.36,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new format: API no-system-prompt vs claude.ai columns with CIs"},
{"measurement_id":"m-000346","legacy_row_id":346,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v4","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"","condition_safeguards":"claude.ai system prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.49","value_num":0.49,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new format: API no-system-prompt vs claude.ai columns with CIs"},
{"measurement_id":"m-000347","legacy_row_id":347,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v4","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.31","value_num":0.31,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new format: API no-system-prompt vs claude.ai columns with CIs"},
{"measurement_id":"m-000348","legacy_row_id":348,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v4","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.05","value_num":0.05,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new format: API no-system-prompt vs claude.ai columns with CIs"},
{"measurement_id":"m-000349","legacy_row_id":349,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-long-form-virology-task-1","group_id":"anthropic-long-form-virology-task-1-v1","metric_label":"Score","metric_definition":"end-to-end score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.77","value_num":0.77,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.2.3.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000350","legacy_row_id":350,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-long-form-virology-task-2","group_id":"anthropic-long-form-virology-task-2-v1","metric_label":"Score","metric_definition":"end-to-end score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.90","value_num":0.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.2.3.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"corrected","extraction_method":"v0_web_reader","superseded_by":"","notes":"corrected 0.89->0.90 in Jun 17 changelog Corrected 2026-09-27 after a blind re-check of the document; recorded until then as \"0.9\"."},
{"measurement_id":"m-000351","legacy_row_id":351,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-multimodal-virology-vct","group_id":"anthropic-multimodal-virology-vct-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.47","value_num":0.47,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.2.3.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Mythos Preview 0.574"},
{"measurement_id":"m-000352","legacy_row_id":352,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-aeci","group_id":"anthropic-aeci-v1","metric_label":"Capability index","metric_definition":"capability index","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"n=11 evals","value_printed":"155.5","value_num":155.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"AECI_score","denominator":null,"scale":"Anthropic ECI-style capability index","ci_low":"","ci_high":"","n":11,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"task-based AI R&D table no longer headline; AECI used"},
{"measurement_id":"m-000353","legacy_row_id":353,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-aeci","group_id":"anthropic-aeci-v1","metric_label":"Capability index","metric_definition":"capability index","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"n=11 evals","value_printed":"154.1","value_num":154.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"AECI_score","denominator":null,"scale":"Anthropic ECI-style capability index","ci_low":"","ci_high":"","n":11,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"task-based AI R&D table no longer headline; AECI used"},
{"measurement_id":"m-000354","legacy_row_id":354,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-aeci","group_id":"anthropic-aeci-v1","metric_label":"Capability index","metric_definition":"capability index","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"n=11 evals","value_printed":"158.3","value_num":158.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"AECI_score","denominator":null,"scale":"Anthropic ECI-style capability index","ci_low":"","ci_high":"","n":11,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"task-based AI R&D table no longer headline; AECI used"},
{"measurement_id":"m-000355","legacy_row_id":355,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cybergym","group_id":"anthropic-cybergym-v1","metric_label":"Targeted vuln reproduction rate","metric_definition":"targeted vuln reproduction, single try","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"78.8","value_num":78.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"1,507 tasks; Opus 4.7 with safeguards 7.1% Migration: Printed as no safeguards. The other cards print this CyberGym measure with no setting, and the values they give for the same models agree with these (v0 rows 278, 358, 359 and the row 426 note)."},
{"measurement_id":"m-000356","legacy_row_id":356,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cybergym","group_id":"anthropic-cybergym-v1","metric_label":"Targeted vuln reproduction rate","metric_definition":"targeted vuln reproduction, single try","condition_effort":"","condition_mode":"","condition_safeguards":"with safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"1,507 tasks; Opus 4.7 with safeguards 7.1%"},
{"measurement_id":"m-000357","legacy_row_id":357,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-cybergym","group_id":"anthropic-cybergym-v1","metric_label":"Targeted vuln reproduction rate","metric_definition":"targeted vuln reproduction, single try","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"73.1","value_num":73.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"1,507 tasks; Opus 4.7 with safeguards 7.1% Migration: Printed as no safeguards. The other cards print this CyberGym measure with no setting, and the values they give for the same models agree with these (v0 rows 278, 358, 359 and the row 426 note)."},
{"measurement_id":"m-000358","legacy_row_id":358,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-cybergym","group_id":"anthropic-cybergym-v1","metric_label":"Targeted vuln reproduction rate","metric_definition":"targeted vuln reproduction, single try","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"65.2","value_num":65.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"1,507 tasks; Opus 4.7 with safeguards 7.1% Migration: Printed as no safeguards. The other cards print this CyberGym measure with no setting, and the values they give for the same models agree with these (v0 rows 278, 358, 359 and the row 426 note)."},
{"measurement_id":"m-000359","legacy_row_id":359,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-cybergym","group_id":"anthropic-cybergym-v1","metric_label":"Targeted vuln reproduction rate","metric_definition":"targeted vuln reproduction, single try","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"83.1","value_num":83.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"1,507 tasks; Opus 4.7 with safeguards 7.1% Migration: Printed as no safeguards. The other cards print this CyberGym measure with no setting, and the values they give for the same models agree with these (v0 rows 278, 358, 359 and the row 426 note)."},
{"measurement_id":"m-000360","legacy_row_id":360,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-exploitbench","group_id":"anthropic-exploitbench-v1","metric_label":"Mean flags captured","metric_definition":"mean flags captured","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"AutoNudge arm","context_note":"","value_printed":"5.45","value_num":5.45,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Mythos Preview 9.90; Opus 4.7 3.66"},
{"measurement_id":"m-000361","legacy_row_id":361,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-firefox-147-exploitation","group_id":"anthropic-firefox-147-exploitation-v1","metric_label":"Full exploit rate","metric_definition":"full exploit rate (score 1.0)","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"250 trials","value_printed":"8.8","value_num":8.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":250,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":">=0.5 score 68.8%"},
{"measurement_id":"m-000362","legacy_row_id":362,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-firefox-147-exploitation","group_id":"anthropic-firefox-147-exploitation-v1","metric_label":"Full exploit rate","metric_definition":"full exploit rate (score 1.0)","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"250 trials","value_printed":"70.8","value_num":70.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":250,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":">=0.5 score 86.8%"},
{"measurement_id":"m-000363","legacy_row_id":363,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cb-2-threat-model","group_id":"anthropic-cb-2-threat-model-v1","metric_label":"RSP determination","metric_definition":"RSP determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not beyond Mythos Preview","value_num":null,"value_text":"not beyond Mythos Preview","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CB-1 capabilities; strong safeguards"},
{"measurement_id":"m-000364","legacy_row_id":364,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-autonomy-threat-model-2","group_id":"anthropic-autonomy-threat-model-2-v1","metric_label":"RSP determination","metric_definition":"RSP determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not applicable","value_num":null,"value_text":"not applicable","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000365","legacy_row_id":365,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-indirect-prompt-injection-external-benchmark","group_id":"anthropic-indirect-prompt-injection-external-benchmark-v1","metric_label":"Attack success rate","metric_definition":"attack success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":">15,000 attempts","value_printed":"0.4","value_num":0.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 5.2","source_type":"lab_summary","via_url":"https://www.anthropic.com/transparency","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Transparency Hub verbatim; Opus 4.7 also 0.4%"},
{"measurement_id":"m-000366","legacy_row_id":366,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-agentic-code-summary-honesty","group_id":"anthropic-agentic-code-summary-honesty-v1","metric_label":"Failure to report important events","metric_definition":"failure to report important events","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"3.7","value_num":3.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6.3.5","source_type":"lab_summary","via_url":"https://www.anthropic.com/transparency","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Transparency Hub verbatim"},
{"measurement_id":"m-000367","legacy_row_id":367,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-agentic-code-summary-honesty","group_id":"anthropic-agentic-code-summary-honesty-v1","metric_label":"Failure to report important events","metric_definition":"failure to report important events","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"27.6","value_num":27.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6.3.5","source_type":"lab_summary","via_url":"https://www.anthropic.com/transparency","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Transparency Hub verbatim"},
{"measurement_id":"m-000368","legacy_row_id":368,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-input-hallucination","group_id":"anthropic-input-hallucination-v1","metric_label":"Rate of hallucinating unavailable tool","metric_definition":"rate of hallucinating unavailable tool","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"5","value_num":5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6.3.4","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/05/29/claude-opus-4-8-the-system-card/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi); Opus 4.7 11%"},
{"measurement_id":"m-000369","legacy_row_id":369,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-input-hallucination","group_id":"anthropic-input-hallucination-v1","metric_label":"Rate of hallucinating missing reference","metric_definition":"rate of hallucinating missing reference","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"9","value_num":9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6.3.4","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/05/29/claude-opus-4-8-the-system-card/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi); Opus 4.7 8%"},
{"measurement_id":"m-000370","legacy_row_id":370,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-unverbalized-grader-awareness","group_id":"anthropic-unverbalized-grader-awareness-v1","metric_label":"Share of cases with grader awareness","metric_definition":"share of cases with grader awareness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"5","value_num":5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6.6.3","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/05/29/claude-opus-4-8-the-system-card/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi); 'exploitative' in 0.5%"},
{"measurement_id":"m-000371","legacy_row_id":371,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-verbalized-grader-speculation","group_id":"anthropic-verbalized-grader-speculation-v1","metric_label":"Share of training episodes","metric_definition":"share of training episodes","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"RL training","context_note":"","value_printed":"0.1","value_num":0.1,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6.2.2","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/05/29/claude-opus-4-8-the-system-card/","confidence":"medium","verification_status":"corrected","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi) Corrected 2026-09-27 after a blind re-check of the document; recorded until then as \"0.1\"."},
{"measurement_id":"m-000372","legacy_row_id":372,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-accidental-cot-supervision-in-rl","group_id":"anthropic-accidental-cot-supervision-in-rl-v1","metric_label":"Share of training episodes affected","metric_definition":"share of training episodes affected","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.1","value_num":0.1,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6.5","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/05/29/claude-opus-4-8-the-system-card/","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi); down from 7.8% reported for Opus 4.7"},
{"measurement_id":"m-000373","legacy_row_id":373,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-shade-arena-minimal-linuxbench","group_id":"anthropic-shade-arena-minimal-linuxbench-v1","metric_label":"Stealth success vs peers","metric_definition":"stealth success vs peers","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"comparable to Opus 4.7; well below Mythos Preview","value_num":null,"value_text":"comparable to Opus 4.7; well below Mythos Preview","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Sec 2.4 / 6.4.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000374","legacy_row_id":374,"split_index":0,"version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-refusal-to-assist-ai-safety-r-d","group_id":"anthropic-refusal-to-assist-ai-safety-r-d-v1","metric_label":"Refusal rate","metric_definition":"refusal rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.1","value_num":0.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6.3.4","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/05/29/claude-opus-4-8-the-system-card/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi); Opus 4.7 0.2%"},
{"measurement_id":"m-000375","legacy_row_id":375,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cb-1-threat-model","group_id":"anthropic-cb-1-threat-model-v1","metric_label":"RSP determination","metric_definition":"RSP determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"applicable","value_num":null,"value_text":"applicable","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000376","legacy_row_id":376,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cb-2-threat-model","group_id":"anthropic-cb-2-threat-model-v1","metric_label":"RSP determination","metric_definition":"RSP determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not crossed (elevated, less clear)","value_num":null,"value_text":"not crossed (elevated, less clear)","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000377","legacy_row_id":377,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-autonomy-threat-model-2","group_id":"anthropic-autonomy-threat-model-2-v1","metric_label":"RSP determination","metric_definition":"RSP determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not applicable","value_num":null,"value_text":"not applicable","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000378","legacy_row_id":378,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-fable-5","subject_model_ids":[],"subject_label":"Claude Fable 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-release-decision","group_id":"anthropic-release-decision-v1","metric_label":"Deployment scope","metric_definition":"deployment scope","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"GA with bio/cyber classifiers","value_num":null,"value_text":"GA with bio/cyber classifiers","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"same weights as Mythos 5 (trusted partners); blocked requests fall back to Opus 4.8"},
{"measurement_id":"m-000379","legacy_row_id":379,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-long-form-virology-task-1","group_id":"anthropic-long-form-virology-task-1-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.77","value_num":0.77,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000380","legacy_row_id":380,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-long-form-virology-task-2","group_id":"anthropic-long-form-virology-task-2-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.91","value_num":0.91,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000381","legacy_row_id":381,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-multimodal-virology-vct","group_id":"anthropic-multimodal-virology-vct-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.56","value_num":0.56,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000382","legacy_row_id":382,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-dna-synthesis-screening-evasion","group_id":"anthropic-dna-synthesis-screening-evasion-v1","metric_label":"Pathogens with viable evasion","metric_definition":"pathogens with viable evasion","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 10 pathogens","context_note":"","value_printed":"2","value_num":2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":10,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000383","legacy_row_id":383,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-aeci","group_id":"anthropic-aeci-v2","metric_label":"Capability index","metric_definition":"capability index","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"95% CI 157.32-165.39","value_printed":"161.29","value_num":161.29,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"AECI_score","denominator":null,"scale":"Anthropic ECI-style capability index","ci_low":"157.32","ci_high":"165.39","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000384","legacy_row_id":384,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-aeci","group_id":"anthropic-aeci-v2","metric_label":"Capability index","metric_definition":"capability index","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"158.91","value_num":158.91,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"AECI_score","denominator":null,"scale":"Anthropic ECI-style capability index","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 4.8 card gave 158.3 on different eval set"},
{"measurement_id":"m-000385","legacy_row_id":385,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-kernel-task","group_id":"anthropic-ai-rd-kernel-task-v1","metric_label":"Best speedup","metric_definition":"best speedup","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"430.93","value_num":430.93,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.7.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000386","legacy_row_id":386,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-llm-training-task","group_id":"anthropic-ai-rd-llm-training-task-v1","metric_label":"Average speedup","metric_definition":"average speedup","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"69.61","value_num":69.61,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.7.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000387","legacy_row_id":387,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-ai-rd-llm-training-task","group_id":"anthropic-ai-rd-llm-training-task-v1","metric_label":"Average speedup","metric_definition":"average speedup","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"re-run","context_note":"","value_printed":"32.64","value_num":32.64,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.7.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000388","legacy_row_id":388,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-ai-rd-llm-training-task","group_id":"anthropic-ai-rd-llm-training-task-v1","metric_label":"Average speedup","metric_definition":"average speedup","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"re-run","context_note":"","value_printed":"60.81","value_num":60.81,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.7.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Mythos Preview card: 51.91x"},
{"measurement_id":"m-000389","legacy_row_id":389,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-novel-compiler-task","group_id":"anthropic-ai-rd-novel-compiler-task-v1","metric_label":"Pass rate","metric_definition":"pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"85.3","value_num":85.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.7.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000390","legacy_row_id":390,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-fable-5","subject_model_ids":[],"subject_label":"Claude Fable 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cyber-safeguards-automated-red-teaming","group_id":"anthropic-cyber-safeguards-automated-red-teaming-v1","metric_label":"Task completion by automated red-teamer","metric_definition":"task completion by automated red-teamer","condition_effort":"","condition_mode":"","condition_safeguards":"with Fable safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"5","value_num":5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 4/5","source_type":"lab_summary","via_url":"https://www.anthropic.com/transparency","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Transparency Hub summary (not verbatim); Opus 4.7 73%, Opus 4.8 57%"},
{"measurement_id":"m-000391","legacy_row_id":391,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-grader-awareness","group_id":"anthropic-grader-awareness-v1","metric_label":"Share of episodes aware of grader","metric_definition":"share of episodes aware of grader","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"grader at high risk of hacking","context_note":"","value_printed":"24","value_num":24,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6","source_type":"secondary","via_url":"https://thezvi.substack.com/p/claude-fable-5-and-mythos-5-the-system","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Zvi; 3%/0.5% when risk low; exact definition unclear"},
{"measurement_id":"m-000392","legacy_row_id":392,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-input-hallucination","group_id":"anthropic-input-hallucination-v1","metric_label":"Rate of hallucinating missing reference","metric_definition":"rate of hallucinating missing reference","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"18","value_num":18,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6.3.3.4","source_type":"secondary","via_url":"https://thezvi.substack.com/p/claude-fable-5-and-mythos-5-the-system","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi); hallucination described as worse"},
{"measurement_id":"m-000393","legacy_row_id":393,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-internal-deployment-monitoring","group_id":"anthropic-internal-deployment-monitoring-v1","metric_label":"Misaligned actions in monitored traffic","metric_definition":"misaligned actions in monitored traffic","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.01","value_num":0.01,"value_text":"","value_qualifier":"lt","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6","source_type":"secondary","via_url":"https://thezvi.substack.com/p/claude-fable-5-and-mythos-5-the-system","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"reported as <0.01%; incl. attempts to kill other agents sharing resources (Zvi)"},
{"measurement_id":"m-000394","legacy_row_id":394,"split_index":0,"version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-external-prompt-injection-benchmark","group_id":"anthropic-external-prompt-injection-benchmark-v1","metric_label":"Rank vs prior models","metric_definition":"rank vs prior models","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"best result yet","value_num":null,"value_text":"best result yet","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Exec summary","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Comparison in words with earlier models, not a number."},
{"measurement_id":"m-000395","legacy_row_id":395,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v4","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"96.65","value_num":96.65,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000396","legacy_row_id":396,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v4","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"claude.ai system prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.2","value_num":99.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000397","legacy_row_id":397,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v4","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"97.71","value_num":97.71,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 4.8 card gave 98.18"},
{"measurement_id":"m-000398","legacy_row_id":398,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v4","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"97.46","value_num":97.46,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 4.8 own card 97.98"},
{"measurement_id":"m-000399","legacy_row_id":399,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v4","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.59","value_num":0.59,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000400","legacy_row_id":400,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v4","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"","condition_safeguards":"claude.ai system prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.54","value_num":1.54,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000401","legacy_row_id":401,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-child-safety-multi-turn","group_id":"anthropic-child-safety-multi-turn-v1","metric_label":"Appropriate response rate","metric_definition":"appropriate response rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"API","condition_other":"","context_note":"","value_printed":"88","value_num":88,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.2.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000402","legacy_row_id":402,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-child-safety-multi-turn","group_id":"anthropic-child-safety-multi-turn-v1","metric_label":"Appropriate response rate","metric_definition":"appropriate response rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"claude.ai","condition_other":"","context_note":"","value_printed":"96","value_num":96,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.2.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000403","legacy_row_id":403,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-suicide-self-harm-multi-turn","group_id":"anthropic-suicide-self-harm-multi-turn-v1","metric_label":"Appropriate response rate","metric_definition":"appropriate response rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"API","condition_other":"","context_note":"","value_printed":"63","value_num":63,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.3.1.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"+/-10%"},
{"measurement_id":"m-000404","legacy_row_id":404,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-suicide-self-harm-multi-turn","group_id":"anthropic-suicide-self-harm-multi-turn-v1","metric_label":"Appropriate response rate","metric_definition":"appropriate response rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"claude.ai","condition_other":"","context_note":"","value_printed":"90","value_num":90,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.3.1.B","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 4.8 85% (Transparency Hub)"},
{"measurement_id":"m-000405","legacy_row_id":405,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Refusal rate, malicious requests","metric_definition":"refusal rate on malicious requests","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"92.37","value_num":92.37,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"NeuralTrust concurs 92.4%"},
{"measurement_id":"m-000406","legacy_row_id":406,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Success rate, dual-use & benign","metric_definition":"success rate on dual-use and benign","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"91.55","value_num":91.55,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000407","legacy_row_id":407,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Refusal rate, malicious requests","metric_definition":"refusal rate on malicious requests","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"76.6","value_num":76.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"verified verbatim table"},
{"measurement_id":"m-000408","legacy_row_id":408,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Refusal rate, malicious requests","metric_definition":"refusal rate on malicious requests","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"90.25","value_num":90.25,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"verified verbatim table"},
{"measurement_id":"m-000409","legacy_row_id":409,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Refusal rate, malicious requests","metric_definition":"refusal rate on malicious requests","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"95.24","value_num":95.24,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"verified verbatim table"},
{"measurement_id":"m-000410","legacy_row_id":410,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Refusal rate, malicious requests","metric_definition":"refusal rate on malicious requests","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"96.21","value_num":96.21,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"verified verbatim table"},
{"measurement_id":"m-000411","legacy_row_id":411,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-computer-use","group_id":"anthropic-malicious-computer-use-v1","metric_label":"Refusal rate","metric_definition":"refusal rate on malicious tasks","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"84.68","value_num":84.68,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"verified verbatim table"},
{"measurement_id":"m-000412","legacy_row_id":412,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-computer-use","group_id":"anthropic-malicious-computer-use-v1","metric_label":"Refusal rate","metric_definition":"refusal rate on malicious tasks","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"85.71","value_num":85.71,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"verified verbatim table"},
{"measurement_id":"m-000413","legacy_row_id":413,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-computer-use","group_id":"anthropic-malicious-computer-use-v1","metric_label":"Refusal rate","metric_definition":"refusal rate on malicious tasks","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"81.7","value_num":81.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"verified verbatim table"},
{"measurement_id":"m-000414","legacy_row_id":414,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-computer-use","group_id":"anthropic-malicious-computer-use-v1","metric_label":"Refusal rate","metric_definition":"refusal rate on malicious tasks","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"93.75","value_num":93.75,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"verified verbatim table"},
{"measurement_id":"m-000415","legacy_row_id":415,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-4-6","subject_model_ids":[],"subject_label":"Claude Sonnet 4.6","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-malicious-computer-use","group_id":"anthropic-malicious-computer-use-v1","metric_label":"Refusal rate","metric_definition":"refusal rate on malicious tasks","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"84.82","value_num":84.82,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"verified verbatim table"},
{"measurement_id":"m-000416","legacy_row_id":416,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v4","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"95.86","value_num":95.86,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 4.8 card gave 97.23"},
{"measurement_id":"m-000417","legacy_row_id":417,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v4","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"97.09","value_num":97.09,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000418","legacy_row_id":418,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-fable-5","subject_model_ids":[],"subject_label":"Claude Fable 5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v4","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.01","value_num":0.01,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000419","legacy_row_id":419,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-multimodal-virology-vct","group_id":"anthropic-multimodal-virology-vct-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.45","value_num":0.45,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000420","legacy_row_id":420,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-long-form-virology-task-1","group_id":"anthropic-long-form-virology-task-1-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.79","value_num":0.79,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.2.4.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000421","legacy_row_id":421,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-dna-synthesis-screening-evasion","group_id":"anthropic-dna-synthesis-screening-evasion-v1","metric_label":"Pathogens with viable evasion","metric_definition":"pathogens with viable evasion","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 10 pathogens","context_note":"","value_printed":"5","value_num":5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":10,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000422","legacy_row_id":422,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-kernel-task","group_id":"anthropic-ai-rd-kernel-task-v1","metric_label":"Best speedup","metric_definition":"best speedup","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"284.52","value_num":284.52,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.3.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000423","legacy_row_id":423,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-llm-training-task","group_id":"anthropic-ai-rd-llm-training-task-v1","metric_label":"Average speedup","metric_definition":"average speedup","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"26.49","value_num":26.49,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.3.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000424","legacy_row_id":424,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-novel-compiler-task","group_id":"anthropic-ai-rd-novel-compiler-task-v1","metric_label":"Pass rate","metric_definition":"pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"76.1","value_num":76.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.3.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000425","legacy_row_id":425,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-exploitbench","group_id":"anthropic-exploitbench-v1","metric_label":"Mean flags captured","metric_definition":"mean flags captured","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"AutoNudge arm","context_note":"","value_printed":"4.18","value_num":4.18,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Fig 3.2.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Cap% 31; 0 full ACEs"},
{"measurement_id":"m-000426","legacy_row_id":426,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cybergym","group_id":"anthropic-cybergym-v1","metric_label":"Targeted vuln reproduction rate","metric_definition":"vuln reproduction rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"52.7","value_num":52.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Fig 3.2.3.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Sonnet 4.6 65.2%"},
{"measurement_id":"m-000427","legacy_row_id":427,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-firefox-147-exploitation","group_id":"anthropic-firefox-147-exploitation-v1","metric_label":"Full exploit rate","metric_definition":"full exploit rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"250 trials","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":250,"direction":"higher_worse","value_status":"printed","location":"Fig 3.2.4.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"register control 13.2%"},
{"measurement_id":"m-000428","legacy_row_id":428,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-rsp-determinations","group_id":"anthropic-rsp-determinations-v1","metric_label":"CB-2 / Autonomy TM2","metric_definition":"RSP determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"CB-2 not crossed; TM2 not applicable","value_num":null,"value_text":"CB-2 not crossed; TM2 not applicable","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1-2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"treated as CB-1 capable"},
{"measurement_id":"m-000429","legacy_row_id":429,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-browser-use-prompt-injection","group_id":"anthropic-browser-use-prompt-injection-v1","metric_label":"Attack success rate","metric_definition":"attack success rate","condition_effort":"","condition_mode":"","condition_safeguards":"without new browser safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"1","value_num":1,"value_text":"","value_qualifier":"lt","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 5.2","source_type":"secondary","via_url":"https://neuraltrust.ai/blog/claude-sonnet-5-security-safety-system-card","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"reported as <1% (Sonnet 4.6 ~50%); ~0% with safeguards; NeuralTrust Migration: Reported by the secondary source as less than 1%."},
{"measurement_id":"m-000430","legacy_row_id":430,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-coding-prompt-injection","group_id":"anthropic-coding-prompt-injection-v1","metric_label":"Attack success rate","metric_definition":"attack success rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.31","value_num":0.31,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 5.2","source_type":"secondary","via_url":"https://neuraltrust.ai/blog/claude-sonnet-5-security-safety-system-card","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior model 12.7%; NeuralTrust"},
{"measurement_id":"m-000431","legacy_row_id":431,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection","group_id":"anthropic-computer-use-prompt-injection-v2","metric_label":"Attack success rate","metric_definition":"attack success rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"2.25","value_num":2.25,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 5.2","source_type":"secondary","via_url":"https://neuraltrust.ai/blog/claude-sonnet-5-security-safety-system-card","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior model 12.0%; NeuralTrust"},
{"measurement_id":"m-000432","legacy_row_id":432,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-live-bug-bounty-prompt-injection","group_id":"anthropic-live-bug-bounty-prompt-injection-v1","metric_label":"Share of unique attacks succeeding","metric_definition":"share of unique attacks succeeding","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.19","value_num":0.19,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 5.2","source_type":"secondary","via_url":"https://neuraltrust.ai/blog/claude-sonnet-5-security-safety-system-card","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"NeuralTrust"},
{"measurement_id":"m-000433","legacy_row_id":433,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-automated-behavioral-audit-eval-awareness","group_id":"anthropic-automated-behavioral-audit-eval-awareness-v2","metric_label":"Share of transcripts verbalizing eval awareness","metric_definition":"share of rollouts verbalizing being tested","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"6","value_num":6,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6","source_type":"secondary","via_url":"https://neuraltrust.ai/blog/claude-sonnet-5-security-safety-system-card","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"NeuralTrust and Zvi concur; 'significantly higher than prior models'"},
{"measurement_id":"m-000434","legacy_row_id":434,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-shade-arena-minimal-linuxbench","group_id":"anthropic-shade-arena-minimal-linuxbench-v1","metric_label":"Stealth success rate","metric_definition":"stealth success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"near zero","value_num":null,"value_text":"near zero","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Sec 2.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000435","legacy_row_id":435,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-internal-deployment-monitoring-sandbagging","group_id":"anthropic-internal-deployment-monitoring-sandbagging-v1","metric_label":"Sandbagging instances detected","metric_definition":"instances detected","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.4 / 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"also no overtly malicious actions or strategic deception"},
{"measurement_id":"m-000436","legacy_row_id":436,"split_index":0,"version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-sonnet-5","subject_model_ids":[],"subject_label":"Claude Sonnet 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-mask","group_id":"anthropic-mask-v1","metric_label":"Lying rate under pressure","metric_definition":"lying rate under pressure","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"3.1","value_num":3.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6","source_type":"lab_summary","via_url":"https://www.anthropic.com/transparency","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Transparency Hub verbatim; framed as 'sycophantic dishonesty' (also M6-relevant)"},
{"measurement_id":"m-000437","legacy_row_id":437,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v4","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"96.34","value_num":96.34,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000438","legacy_row_id":438,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v4","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"claude.ai system prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"98.54","value_num":98.54,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000439","legacy_row_id":439,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v4","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"97.46","value_num":97.46,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000440","legacy_row_id":440,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-fable-5","subject_model_ids":[],"subject_label":"Claude Fable 5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-single-turn-violative-requests","group_id":"anthropic-single-turn-violative-requests-v4","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"96.94","value_num":96.94,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.1.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000441","legacy_row_id":441,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v4","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"","condition_safeguards":"no system prompt","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.09","value_num":0.09,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000442","legacy_row_id":442,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-single-turn-benign-requests","group_id":"anthropic-single-turn-benign-requests-v4","metric_label":"Over-refusal rate","metric_definition":"refusal rate (over-refusal)","condition_effort":"","condition_mode":"","condition_safeguards":"claude.ai system prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.47","value_num":0.47,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4.1.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000443","legacy_row_id":443,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-child-safety-single-turn-violative","group_id":"anthropic-child-safety-single-turn-violative-v1","metric_label":"Harmless response rate","metric_definition":"harmless response rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"API","condition_other":"","context_note":"","value_printed":"100.0","value_num":100,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4.2.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000444","legacy_row_id":444,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-suicide-self-harm-multi-turn","group_id":"anthropic-suicide-self-harm-multi-turn-v1","metric_label":"Appropriate response rate","metric_definition":"appropriate response rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"claude.ai","condition_other":"","context_note":"","value_printed":"90","value_num":90,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 4.3","source_type":"lab_summary","via_url":"https://www.anthropic.com/transparency","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Transparency Hub verbatim; Opus 4.8 85%"},
{"measurement_id":"m-000445","legacy_row_id":445,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-multimodal-virology-vct","group_id":"anthropic-multimodal-virology-vct-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.59","value_num":0.59,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Fable 5.1 card re-reports Opus 5 as 0.55"},
{"measurement_id":"m-000446","legacy_row_id":446,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-long-form-virology-task-1","group_id":"anthropic-long-form-virology-task-1-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.802","value_num":0.802,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.2.4.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000447","legacy_row_id":447,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-long-form-virology-task-2","group_id":"anthropic-long-form-virology-task-2-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.872","value_num":0.872,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.2.4.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000448","legacy_row_id":448,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-dna-synthesis-screening-evasion","group_id":"anthropic-dna-synthesis-screening-evasion-v1","metric_label":"Pathogens with viable evasion","metric_definition":"pathogens with viable evasion","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 10 pathogens","context_note":"","value_printed":"7","value_num":7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":10,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000449","legacy_row_id":449,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-aeci","group_id":"anthropic-aeci-v2","metric_label":"Capability index","metric_definition":"capability index","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"95% CI 158.0-167.3; n=40","value_printed":"162.1","value_num":162.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"AECI_score","denominator":null,"scale":"Anthropic ECI-style capability index","ci_low":"158.0","ci_high":"167.3","n":40,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000450","legacy_row_id":450,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-aeci","group_id":"anthropic-aeci-v2","metric_label":"Capability index","metric_definition":"capability index","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"n=67","value_printed":"161.3","value_num":161.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"AECI_score","denominator":null,"scale":"Anthropic ECI-style capability index","ci_low":"","ci_high":"","n":67,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000451","legacy_row_id":451,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-kernel-task","group_id":"anthropic-ai-rd-kernel-task-v1","metric_label":"Best speedup","metric_definition":"best speedup","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"449.46","value_num":449.46,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.5.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000452","legacy_row_id":452,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-llm-training-task","group_id":"anthropic-ai-rd-llm-training-task-v1","metric_label":"Average speedup","metric_definition":"average speedup","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"easy variant","context_note":"","value_printed":"68.54","value_num":68.54,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.5.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"hard variant 14.19x (new)"},
{"measurement_id":"m-000453","legacy_row_id":453,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-7","subject_model_ids":[],"subject_label":"Claude Opus 4.7","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-ai-rd-llm-training-task","group_id":"anthropic-ai-rd-llm-training-task-v1","metric_label":"Average speedup","metric_definition":"average speedup","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"easy variant","context_note":"","value_printed":"50.67","value_num":50.67,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"x_speedup","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.5.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 4.7 own card: 40.81x"},
{"measurement_id":"m-000454","legacy_row_id":454,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-novel-compiler-task","group_id":"anthropic-ai-rd-novel-compiler-task-v1","metric_label":"Pass rate","metric_definition":"pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"80.91","value_num":80.91,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.5.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"verified verbatim; Opus 4.7 re-reported 70.4% (own card 71.1%)"},
{"measurement_id":"m-000455","legacy_row_id":455,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-ai-rd-quadruped-rl-task","group_id":"anthropic-ai-rd-quadruped-rl-task-v1","metric_label":"Highest score","metric_definition":"highest score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"no hparams","context_note":"","value_printed":"31.3","value_num":31.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.5.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 4.7 re-reported 24.73 (own card 26.5) Migration: task score; scale not stated in the source as recorded"},
{"measurement_id":"m-000456","legacy_row_id":456,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-exploitbench","group_id":"anthropic-exploitbench-v1","metric_label":"Mean flags captured","metric_definition":"mean flags captured","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"AutoNudge arm","context_note":"","value_printed":"10.14","value_num":10.14,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Mythos 5 10.80; Opus 4.8 5.56"},
{"measurement_id":"m-000457","legacy_row_id":457,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-firefox-147-exploitation","group_id":"anthropic-firefox-147-exploitation-v1","metric_label":"Full exploit rate","metric_definition":"full exploit rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"250 trials","value_printed":"52.4","value_num":52.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":250,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":">=0.5 score 87.2%"},
{"measurement_id":"m-000458","legacy_row_id":458,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-firefox-147-exploitation","group_id":"anthropic-firefox-147-exploitation-v1","metric_label":"Full exploit rate","metric_definition":"full exploit rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"250 trials","value_printed":"88.4","value_num":88.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":250,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000459","legacy_row_id":459,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cyscenariobench","group_id":"anthropic-cyscenariobench-v1","metric_label":"Solve rate","metric_definition":"solve rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"33.7","value_num":33.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Mythos 5 47.0%; Opus 4.8 24.4%"},
{"measurement_id":"m-000460","legacy_row_id":460,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-rsp-determinations","group_id":"anthropic-rsp-determinations-v1","metric_label":"CB-2 / AI R&D threshold","metric_definition":"RSP determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"neither crossed; ASL-3 protections","value_num":null,"value_text":"neither crossed; ASL-3 protections","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 2.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000461","legacy_row_id":461,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-indirect-prompt-injection-art-style","group_id":"anthropic-indirect-prompt-injection-art-style-v1","metric_label":"Attacker success within 15 attempts","metric_definition":"attacker success within 15 attempts","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"2.0","value_num":2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 5.2","source_type":"lab_summary","via_url":"https://www.anthropic.com/transparency","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Transparency Hub verbatim"},
{"measurement_id":"m-000462","legacy_row_id":462,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-4-8","subject_model_ids":[],"subject_label":"Claude Opus 4.8","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-indirect-prompt-injection-art-style","group_id":"anthropic-indirect-prompt-injection-art-style-v1","metric_label":"Attacker success within 15 attempts","metric_definition":"attacker success within 15 attempts","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"5.5","value_num":5.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 5.2","source_type":"lab_summary","via_url":"https://www.anthropic.com/transparency","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Transparency Hub verbatim"},
{"measurement_id":"m-000463","legacy_row_id":463,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-internal-deployment-monitoring","group_id":"anthropic-internal-deployment-monitoring-v1","metric_label":"Circumvention attempts in monitored completions","metric_definition":"circumvention attempts in monitored completions","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.01","value_num":0.01,"value_text":"","value_qualifier":"lt","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.4.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"reported as <0.01%; no sandbagging or oversight evasion found"},
{"measurement_id":"m-000464","legacy_row_id":464,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-safety-research-compromise","group_id":"anthropic-safety-research-compromise-v1","metric_label":"Rate of compromising safety research","metric_definition":"rate of compromising safety research","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.1","value_num":0.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/07/25/claude-opus-5-the-system-card/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi)"},
{"measurement_id":"m-000465","legacy_row_id":465,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-safety-research-compromise","group_id":"anthropic-safety-research-compromise-v1","metric_label":"Rate of compromising safety research","metric_definition":"rate of compromising safety research","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"13.6","value_num":13.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/07/25/claude-opus-5-the-system-card/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi)"},
{"measurement_id":"m-000466","legacy_row_id":466,"split_index":0,"version_id":"anthropic-claude-opus-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-shade-arena-linuxarena","group_id":"anthropic-shade-arena-linuxarena-v1","metric_label":"Stealth success vs peers","metric_definition":"stealth success vs peers","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"above some recent models; below Mythos Preview","value_num":null,"value_text":"above some recent models; below Mythos Preview","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Sec 2.4.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000467","legacy_row_id":467,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-long-form-virology-task-1","group_id":"anthropic-long-form-virology-task-1-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.81","value_num":0.81,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2.3.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000468","legacy_row_id":468,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-long-form-virology-task-2","group_id":"anthropic-long-form-virology-task-2-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.87","value_num":0.87,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2.3.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000469","legacy_row_id":469,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-multimodal-virology-vct","group_id":"anthropic-multimodal-virology-vct-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.58","value_num":0.58,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2.3.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 5 0.55; Mythos 5 0.59 (re-reported)"},
{"measurement_id":"m-000470","legacy_row_id":470,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-dna-synthesis-screening-evasion","group_id":"anthropic-dna-synthesis-screening-evasion-v1","metric_label":"Pathogens meeting all criteria","metric_definition":"pathogens meeting all criteria","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 10 pathogens","context_note":"","value_printed":"1","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":10,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2.3.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000471","legacy_row_id":471,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-aeci","group_id":"anthropic-aeci-v2","metric_label":"Capability index","metric_definition":"capability index","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"95% CI 158.20-169.00; n=46","value_printed":"161.98","value_num":161.98,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"AECI_score","denominator":null,"scale":"Anthropic ECI-style capability index","ci_low":"158.20","ci_high":"169.00","n":46,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3.5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000472","legacy_row_id":472,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-aeci","group_id":"anthropic-aeci-v2","metric_label":"Capability index","metric_definition":"capability index","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"n=97","value_printed":"159.46","value_num":159.46,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"AECI_score","denominator":null,"scale":"Anthropic ECI-style capability index","ci_low":"","ci_high":"","n":97,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3.5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"F5 card 161.29; Opus 5 card 161.3"},
{"measurement_id":"m-000473","legacy_row_id":473,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-aeci","group_id":"anthropic-aeci-v2","metric_label":"Capability index","metric_definition":"capability index","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"n=64","value_printed":"160.73","value_num":160.73,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"AECI_score","denominator":null,"scale":"Anthropic ECI-style capability index","ci_low":"","ci_high":"","n":64,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3.5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 5 card 162.1"},
{"measurement_id":"m-000474","legacy_row_id":474,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-firefox-147-exploitation","group_id":"anthropic-firefox-147-exploitation-v1","metric_label":"Full exploit rate","metric_definition":"full exploit rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"250 trials","value_printed":"98.0","value_num":98,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":250,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"verified verbatim (245/250)"},
{"measurement_id":"m-000475","legacy_row_id":475,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-exploitbench","group_id":"anthropic-exploitbench-v1","metric_label":"Mean flags captured","metric_definition":"mean flags captured","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"AutoNudge arm","context_note":"","value_printed":"12.61","value_num":12.61,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"plain arm 11.80"},
{"measurement_id":"m-000476","legacy_row_id":476,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-oss-fuzz","group_id":"anthropic-oss-fuzz-v1","metric_label":"Targets with full score","metric_definition":"targets with full score 1.0","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"~830 entry points","context_note":"","value_printed":"17","value_num":17,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Mythos 5 13; Opus 5 4"},
{"measurement_id":"m-000477","legacy_row_id":477,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-fable-5-1","subject_model_ids":[],"subject_label":"Claude Fable 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-rsp-determinations","group_id":"anthropic-rsp-determinations-v1","metric_label":"CB / autonomy / cyber","metric_definition":"CB / autonomy / cyber","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"CB-1 yes; CB-2 no; TM2 N/A; cyber Tier 1","value_num":null,"value_text":"CB-1 yes; CB-2 no; TM2 N/A; cyber Tier 1","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1-2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"alignment risk 'low'"},
{"measurement_id":"m-000478","legacy_row_id":478,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-linuxarena","group_id":"anthropic-linuxarena-v1","metric_label":"Stealth success vs Opus 4.8 monitor","metric_definition":"stealth success vs Opus 4.8 monitor","condition_effort":"","condition_mode":"no extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"22","value_num":22,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.4.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"1.6-2.1x Mythos Preview"},
{"measurement_id":"m-000479","legacy_row_id":479,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-linuxarena","group_id":"anthropic-linuxarena-v1","metric_label":"Stealth success vs Opus 4.8 monitor","metric_definition":"stealth success vs Opus 4.8 monitor","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"13.9","value_num":13.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.4.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000480","legacy_row_id":480,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-shade-arena","group_id":"anthropic-shade-arena-v1","metric_label":"Stealth success vs Mythos Preview","metric_definition":"stealth success vs Mythos Preview","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not above Mythos Preview","value_num":null,"value_text":"not above Mythos Preview","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Sec 2.4.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"verbatim"},
{"measurement_id":"m-000481","legacy_row_id":481,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-internal-deployment-monitoring","group_id":"anthropic-internal-deployment-monitoring-v1","metric_label":"Classifier workarounds / disabled checks","metric_definition":"classifier workarounds / disabled checks","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.01","value_num":0.01,"value_text":"","value_qualifier":"lt","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.4 / 6.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"reported as <0.01% of monitored completions"},
{"measurement_id":"m-000482","legacy_row_id":482,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-sandbox-vulnerability-exploit","group_id":"anthropic-sandbox-vulnerability-exploit-v1","metric_label":"Real-world incident reported","metric_definition":"real-world incident reported","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"reported (low severity)","value_num":null,"value_text":"reported (low severity)","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 2.4 / 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"read files outside its environment; verbatim"},
{"measurement_id":"m-000483","legacy_row_id":483,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-fable-5-1","subject_model_ids":[],"subject_label":"Claude Fable 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-computer-use-prompt-injection","group_id":"anthropic-computer-use-prompt-injection-v2","metric_label":"Attack success rate","metric_definition":"attack success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"2 of 2,800 attempts","value_printed":"0.07","value_num":0.07,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":2800,"direction":"higher_worse","value_status":"printed","location":"Sec 5.2","source_type":"lab_summary","via_url":"https://www.anthropic.com/transparency","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Transparency Hub verbatim"},
{"measurement_id":"m-000484","legacy_row_id":484,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-fable-5-1","subject_model_ids":[],"subject_label":"Claude Fable 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-browser-use-prompt-injection","group_id":"anthropic-browser-use-prompt-injection-v1","metric_label":"Attack success rate","metric_definition":"attack success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"2.64","value_num":2.64,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 5.2","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/09/04/claude-fable-5-1-and-mythos-5-1-the-system-card/","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Zvi; 0% in auto mode; condition unclear Migration: Secondary source (Zvi) gives this figure without a clear condition and reports 0% in auto mode separately."},
{"measurement_id":"m-000485","legacy_row_id":485,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-mask","group_id":"anthropic-mask-v1","metric_label":"Honesty rate under pressure","metric_definition":"honesty rate under pressure","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"85","value_num":85,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 6","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/09/04/claude-fable-5-1-and-mythos-5-1-the-system-card/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi); Mythos 5 91%, Opus 5 95%"},
{"measurement_id":"m-000486","legacy_row_id":486,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-fable-5-1","subject_model_ids":[],"subject_label":"Claude Fable 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-multi-turn-biological-weapons","group_id":"anthropic-multi-turn-biological-weapons-v1","metric_label":"Safe response rate","metric_definition":"safe response rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"API","condition_other":"","context_note":"","value_printed":"73","value_num":73,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 4.1.3","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/09/04/claude-fable-5-1-and-mythos-5-1-the-system-card/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi); Fable 5 94%; claude.ai 89% vs 92%"},
{"measurement_id":"m-000487","legacy_row_id":487,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-reward-hacking-in-rl-training","group_id":"anthropic-reward-hacking-in-rl-training-v1","metric_label":"Share of episodes with successful reward hacks","metric_definition":"episodes where cheating was rewarded","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.06","value_num":0.06,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/09/04/claude-fable-5-1-and-mythos-5-1-the-system-card/","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Zvi paraphrase"},
{"measurement_id":"m-000488","legacy_row_id":488,"split_index":0,"version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cot-controllability","group_id":"anthropic-cot-controllability-v1","metric_label":"Change vs Mythos Preview","metric_definition":"change vs Mythos Preview","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"best-performing prompt","context_note":"","value_printed":"slightly increased","value_num":null,"value_text":"slightly increased","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Sec 2.4.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"higher controllability = lower monitorability"},
{"measurement_id":"m-000489","legacy_row_id":489,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-multimodal-virology-vct","group_id":"anthropic-multimodal-virology-vct-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.59","value_num":0.59,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Fig 2.2.3.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 5 0.55; Mythos 5.1 0.58"},
{"measurement_id":"m-000490","legacy_row_id":490,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-biomysterybench","group_id":"anthropic-biomysterybench-v1","metric_label":"Accuracy (human difficult)","metric_definition":"accuracy","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"50","value_num":50,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 5 51.8%"},
{"measurement_id":"m-000491","legacy_row_id":491,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-cobench","group_id":"anthropic-cobench-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"55.8","value_num":55.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Fig 2.3.4.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"expert-substitution threshold 85%; verified verbatim"},
{"measurement_id":"m-000492","legacy_row_id":492,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-cobench","group_id":"anthropic-cobench-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"53.2","value_num":53.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Fig 2.3.4.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"expert-substitution threshold 85%; verified verbatim"},
{"measurement_id":"m-000493","legacy_row_id":493,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-cobench","group_id":"anthropic-cobench-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"53.4","value_num":53.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Fig 2.3.4.1.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"expert-substitution threshold 85%; verified verbatim"},
{"measurement_id":"m-000494","legacy_row_id":494,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-aeci","group_id":"anthropic-aeci-v3","metric_label":"Capability index","metric_definition":"capability index","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"n=43 benchmarks (Opus 5.5)","value_printed":"169.36","value_num":169.36,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"AECI_score","denominator":null,"scale":"Anthropic ECI-style capability index","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.5.3.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"re-based scale; not comparable with earlier cards' AECI values"},
{"measurement_id":"m-000495","legacy_row_id":495,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5-1","subject_model_ids":[],"subject_label":"Claude Mythos 5.1","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-aeci","group_id":"anthropic-aeci-v3","metric_label":"Capability index","metric_definition":"capability index","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"n=43 benchmarks (Opus 5.5)","value_printed":"168.12","value_num":168.12,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"AECI_score","denominator":null,"scale":"Anthropic ECI-style capability index","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.5.3.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"re-based scale; not comparable with earlier cards' AECI values"},
{"measurement_id":"m-000496","legacy_row_id":496,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5","subject_model_ids":[],"subject_label":"Claude Opus 5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-aeci","group_id":"anthropic-aeci-v3","metric_label":"Capability index","metric_definition":"capability index","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"n=43 benchmarks (Opus 5.5)","value_printed":"165.18","value_num":165.18,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"AECI_score","denominator":null,"scale":"Anthropic ECI-style capability index","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.5.3.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"re-based scale; not comparable with earlier cards' AECI values"},
{"measurement_id":"m-000497","legacy_row_id":497,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-5","subject_model_ids":[],"subject_label":"Claude Mythos 5","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-aeci","group_id":"anthropic-aeci-v3","metric_label":"Capability index","metric_definition":"capability index","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"n=43 benchmarks (Opus 5.5)","value_printed":"164.49","value_num":164.49,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"AECI_score","denominator":null,"scale":"Anthropic ECI-style capability index","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.5.3.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"re-based scale; not comparable with earlier cards' AECI values"},
{"measurement_id":"m-000498","legacy_row_id":498,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-mythos-preview","subject_model_ids":[],"subject_label":"Claude Mythos Preview","snapshot_label":"","is_subject_model":false,"eval_id":"anthropic-aeci","group_id":"anthropic-aeci-v3","metric_label":"Capability index","metric_definition":"capability index","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"n=43 benchmarks (Opus 5.5)","value_printed":"161.88","value_num":161.88,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"AECI_score","denominator":null,"scale":"Anthropic ECI-style capability index","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2.3.5.3.A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"re-based scale; not comparable with earlier cards' AECI values"},
{"measurement_id":"m-000499","legacy_row_id":499,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-exploitbench","group_id":"anthropic-exploitbench-v1","metric_label":"Mean flags captured","metric_definition":"mean flags captured","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"41 V8 environments","context_note":"","value_printed":"13.99","value_num":13.99,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 3.3.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Cap% 91%"},
{"measurement_id":"m-000500","legacy_row_id":500,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"metr-ai-r-d-assessment","group_id":"metr-ai-r-d-assessment-anthropic-v1","metric_label":"Estimated AI-driven acceleration","metric_definition":"estimated AI-driven acceleration","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.5","value_num":1.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"multiplier","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 2.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"'perhaps 30% chance of 2X' (quoted in card)"},
{"measurement_id":"m-000501","legacy_row_id":501,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-rsp-determinations","group_id":"anthropic-rsp-determinations-v1","metric_label":"CB / autonomy / cyber","metric_definition":"CB / autonomy / cyber","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"CB-1 yes; CB-2 no; AI R&D not crossed; cyber Tier 1","value_num":null,"value_text":"CB-1 yes; CB-2 no; AI R&D not crossed; cyber Tier 1","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sec 1-2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"alignment risk 'low'"},
{"measurement_id":"m-000502","legacy_row_id":502,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-sandbox-escape-tamper-attempts","group_id":"anthropic-sandbox-escape-tamper-attempts-v1","metric_label":"Share of runs with escape/tamper attempt","metric_definition":"share of runs with escape/tamper attempt","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.5","value_num":1.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Exec summary","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"verified verbatim"},
{"measurement_id":"m-000503","legacy_row_id":503,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-package-registry-credential-exercise","group_id":"anthropic-package-registry-credential-exercise-v1","metric_label":"Share of cases with potentially harmful actions","metric_definition":"share of cases with potentially harmful actions","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"simulated security exercise","context_note":"","value_printed":"50","value_num":50,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"qualitative","location":"Exec summary","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"reported as 'roughly half' Migration: The source says roughly half; v0 stored 50."},
{"measurement_id":"m-000504","legacy_row_id":504,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-automated-behavioral-audit","group_id":"anthropic-automated-behavioral-audit-v2","metric_label":"Misaligned behavior vs recent models","metric_definition":"misaligned behavior vs recent models","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"lowest on nearly all measures","value_num":null,"value_text":"lowest on nearly all measures","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Sec 6.1.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"regressions: planted instructions, unverifiable authorization claims"},
{"measurement_id":"m-000505","legacy_row_id":505,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-automated-behavioral-audit-eval-awareness","group_id":"anthropic-automated-behavioral-audit-eval-awareness-v2","metric_label":"Share of transcripts scoring >=6","metric_definition":"share of transcripts scoring >=6","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"36","value_num":36,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/09/23/claude-opus-5-5-the-system-card/","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi)"},
{"measurement_id":"m-000506","legacy_row_id":506,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-evaluation-awareness-deployment","group_id":"anthropic-evaluation-awareness-deployment-v1","metric_label":"Share of transcripts scoring >=6","metric_definition":"share of transcripts scoring >=6","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"real internal deployment","context_note":"","value_printed":"0.4","value_num":0.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/09/23/claude-opus-5-5-the-system-card/","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi)"},
{"measurement_id":"m-000507","legacy_row_id":507,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-shade-arena","group_id":"anthropic-shade-arena-v1","metric_label":"Stealth success rate","metric_definition":"stealth success rate","condition_effort":"","condition_mode":"extended thinking","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"qualitative","location":"Sec 6","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/09/23/claude-opus-5-5-the-system-card/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi: 'crash to zero'); declines side task >80% after spotting eval Migration: The thinking was visible to the monitor. The recorded evidence is a secondary write-up saying stealth success fell to zero; whether the card prints 0% is not recorded. The >80% in the notes is the share of side tasks declined, not this value."},
{"measurement_id":"m-000508","legacy_row_id":508,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-reward-hacking-in-rl-training","group_id":"anthropic-reward-hacking-in-rl-training-v1","metric_label":"Share of episodes with successful reward hacks","metric_definition":"successful reward hacks share of episodes","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.63","value_num":0.63,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Sec 6","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/09/23/claude-opus-5-5-the-system-card/","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Zvi paraphrase"},
{"measurement_id":"m-000509","legacy_row_id":509,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-disclosure-of-grader-fooling-actions","group_id":"anthropic-disclosure-of-grader-fooling-actions-v1","metric_label":"Rate of coming clean","metric_definition":"rate of coming clean","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"97","value_num":97,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Sec 6","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/09/23/claude-opus-5-5-the-system-card/","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"secondary source quoting card; card section beyond fetch truncation (Zvi); previous high 85%"},
{"measurement_id":"m-000510","legacy_row_id":510,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-prompt-injection-user-pasted-text","group_id":"anthropic-prompt-injection-user-pasted-text-v1","metric_label":"Susceptibility vs prior models","metric_definition":"susceptibility vs prior models","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"higher than previous models","value_num":null,"value_text":"higher than previous models","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Exec summary / Sec 5.2.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"otherwise similar or better than Opus 5 Migration: Comparison in words with earlier models, not a number."},
{"measurement_id":"m-000511","legacy_row_id":511,"split_index":0,"version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"claude-opus-5-5","subject_model_ids":[],"subject_label":"Claude Opus 5.5","snapshot_label":"","is_subject_model":true,"eval_id":"anthropic-malicious-claude-code-use","group_id":"anthropic-malicious-claude-code-use-v2","metric_label":"Refusal rate rank","metric_definition":"refusal rate rank","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"lowest of evaluated models","value_num":null,"value_text":"lowest of evaluated models","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Sec 5.1.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"highest dual-use assistance rate Migration: Comparison in words with the other evaluated models, not a number."},
{"measurement_id":"m-000512","legacy_row_id":512,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-text-to-text-safety","group_id":"google-deepmind-text-to-text-safety-v1","metric_label":"Policy-violation rate delta","metric_definition":"Automated policy-violation rate delta vs baseline","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 1.5 Pro 002","context_note":"","value_printed":"-0.9","value_num":-0.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000513","legacy_row_id":513,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-multilingual-safety","group_id":"google-deepmind-multilingual-safety-v1","metric_label":"Multilingual policy-violation rate delta","metric_definition":"Automated multilingual policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 1.5 Pro 002","context_note":"","value_printed":"-3.5","value_num":-3.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000514","legacy_row_id":514,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-image-to-text-safety","group_id":"google-deepmind-image-to-text-safety-v1","metric_label":"Image-to-text policy-violation rate delta","metric_definition":"Automated image-to-text policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 1.5 Pro 002","context_note":"","value_printed":"1.8","value_num":1.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"marked non-egregious Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000515","legacy_row_id":515,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-tone","group_id":"google-deepmind-tone-v1","metric_label":"Objective tone of refusals delta","metric_definition":"Automated objective tone of refusals delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 1.5 Pro 002","context_note":"","value_printed":"18.4","value_num":18.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000516","legacy_row_id":516,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-instruction-following","group_id":"google-deepmind-instruction-following-v1","metric_label":"Safe instruction following delta","metric_definition":"Follows instructions while remaining safe; delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 1.5 Pro 002","context_note":"","value_printed":"14.8","value_num":14.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000517","legacy_row_id":517,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro Preview 05-06","snapshot_label":"Preview 05-06","is_subject_model":true,"eval_id":"google-deepmind-text-to-text-safety","group_id":"google-deepmind-text-to-text-safety-v1","metric_label":"Policy-violation rate delta","metric_definition":"Automated policy-violation rate delta vs baseline","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 1.5 Pro 002","context_note":"","value_printed":"-8.6","value_num":-8.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000518","legacy_row_id":518,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro Preview 05-06","snapshot_label":"Preview 05-06","is_subject_model":true,"eval_id":"google-deepmind-multilingual-safety","group_id":"google-deepmind-multilingual-safety-v1","metric_label":"Multilingual policy-violation rate delta","metric_definition":"Automated multilingual policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 1.5 Pro 002","context_note":"","value_printed":"-1.87","value_num":-1.87,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000519","legacy_row_id":519,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro Preview 05-06","snapshot_label":"Preview 05-06","is_subject_model":true,"eval_id":"google-deepmind-image-to-text-safety","group_id":"google-deepmind-image-to-text-safety-v1","metric_label":"Image-to-text policy-violation rate delta","metric_definition":"Automated image-to-text policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 1.5 Pro 002","context_note":"","value_printed":"-2.8","value_num":-2.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000520","legacy_row_id":520,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro Preview 05-06","snapshot_label":"Preview 05-06","is_subject_model":true,"eval_id":"google-deepmind-tone","group_id":"google-deepmind-tone-v1","metric_label":"Objective tone of refusals delta","metric_definition":"Automated objective tone of refusals delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 1.5 Pro 002","context_note":"","value_printed":"7.9","value_num":7.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000521","legacy_row_id":521,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro Preview 05-06","snapshot_label":"Preview 05-06","is_subject_model":true,"eval_id":"google-deepmind-instruction-following","group_id":"google-deepmind-instruction-following-v1","metric_label":"Safe instruction following delta","metric_definition":"Follows instructions while remaining safe; delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 1.5 Pro 002","context_note":"","value_printed":"10.9","value_num":10.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000522","legacy_row_id":522,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v1","metric_label":"CBRN Uplift Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card: GA does not reach alert threshold for CBRN Uplift 1"},
{"measurement_id":"m-000523","legacy_row_id":523,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v1","metric_label":"Cyber Autonomy Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000524","legacy_row_id":524,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v1","metric_label":"Cyber Uplift Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"alert_threshold_reached","value_num":null,"value_text":"alert_threshold_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CCL not reached; early-warning alert threshold reached"},
{"measurement_id":"m-000525","legacy_row_id":525,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v1","metric_label":"ML R&D Autonomy Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000526","legacy_row_id":526,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v1","metric_label":"ML R&D Uplift Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Worded 'likely not reached'"},
{"measurement_id":"m-000527","legacy_row_id":527,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination-misalignment","group_id":"google-deepmind-fsf-determination-misalignment-v1","metric_label":"Instrumental Reasoning Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card notes DA evals on GA not yet complete; results from Preview"},
{"measurement_id":"m-000528","legacy_row_id":528,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination-misalignment","group_id":"google-deepmind-fsf-determination-misalignment-v1","metric_label":"Instrumental Reasoning Level 2","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000529","legacy_row_id":529,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-cyber-key-skills","group_id":"google-deepmind-cyber-key-skills-v1","metric_label":"Hard challenges solved","metric_definition":"Hard challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"model version unclear","context_note":"","value_printed":"1","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"solved_of_12","denominator":12,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: cyber","source_type":"primary","via_url":"","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card prints '7/8 easy, 10/28 medium, 1/12 hard' and also '6/8, 11/28, 4/12' for another version; tech report gives 6/12 Migration: The card prints results for two model versions; which one this value belongs to is not clear."},
{"measurement_id":"m-000530","legacy_row_id":530,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro Preview","snapshot_label":"Preview","is_subject_model":true,"eval_id":"google-deepmind-stealth-challenges","group_id":"google-deepmind-stealth-challenges-v1","metric_label":"Decision Sabotage success rate","metric_definition":"Success rate on stealth challenge","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"45","value_num":45,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: deceptive alignment","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Approx (~45%); low success on 3/5 stealth challenges"},
{"measurement_id":"m-000531","legacy_row_id":531,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro Preview","snapshot_label":"Preview","is_subject_model":true,"eval_id":"google-deepmind-stealth-challenges","group_id":"google-deepmind-stealth-challenges-v1","metric_label":"Oversight Pattern success rate","metric_definition":"Success rate on stealth challenge","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"35","value_num":35,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: deceptive alignment","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Approx (~35%)"},
{"measurement_id":"m-000532","legacy_row_id":532,"split_index":0,"version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro Preview","snapshot_label":"Preview","is_subject_model":true,"eval_id":"google-deepmind-situational-awareness-challenges","group_id":"google-deepmind-situational-awareness-challenges-v1","metric_label":"Disabled Tool success rate","metric_definition":"Success rate, 50 trials","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"46","value_num":46,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: deceptive alignment","source_type":"primary","via_url":"","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Highest among remaining SA/stealth evals per card"},
{"measurement_id":"m-000533","legacy_row_id":533,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-flash","subject_model_ids":[],"subject_label":"Gemini 2.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-text-to-text-safety","group_id":"google-deepmind-text-to-text-safety-v1","metric_label":"Policy-violation rate delta","metric_definition":"Automated policy-violation rate delta vs baseline","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 1.5 Flash 002","context_note":"","value_printed":"-8.2","value_num":-8.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 7","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: The comparator was read from a garbled table header and is uncertain. relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000534","legacy_row_id":534,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-flash","subject_model_ids":[],"subject_label":"Gemini 2.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-multilingual-safety","group_id":"google-deepmind-multilingual-safety-v1","metric_label":"Multilingual policy-violation rate delta","metric_definition":"Automated multilingual policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 1.5 Flash 002","context_note":"","value_printed":"1.1","value_num":1.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 7","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"non-egregious (*) Migration: The comparator was read from a garbled table header and is uncertain. relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000535","legacy_row_id":535,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-flash","subject_model_ids":[],"subject_label":"Gemini 2.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-image-to-text-safety","group_id":"google-deepmind-image-to-text-safety-v1","metric_label":"Image-to-text policy-violation rate delta","metric_definition":"Automated image-to-text policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 1.5 Flash 002","context_note":"","value_printed":"6.4","value_num":6.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 7","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"non-egregious (*) Migration: The comparator was read from a garbled table header and is uncertain. relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000536","legacy_row_id":536,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-flash","subject_model_ids":[],"subject_label":"Gemini 2.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-tone","group_id":"google-deepmind-tone-v1","metric_label":"Objective tone of refusals delta","metric_definition":"Automated objective tone of refusals delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 1.5 Flash 002","context_note":"","value_printed":"7.9","value_num":7.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 7","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: The comparator was read from a garbled table header and is uncertain. relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000537","legacy_row_id":537,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-flash","subject_model_ids":[],"subject_label":"Gemini 2.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-instruction-following","group_id":"google-deepmind-instruction-following-v1","metric_label":"Safe instruction following delta","metric_definition":"Follows instructions while remaining safe; delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 1.5 Flash 002","context_note":"","value_printed":"13.6","value_num":13.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 7","source_type":"primary","via_url":"","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Labelled Helpfulness / Instruction Following Migration: The comparator was read from a garbled table header and is uncertain. relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000538","legacy_row_id":538,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-automated-red-teaming","group_id":"google-deepmind-automated-red-teaming-v1","metric_label":"Dangerous content violation rate","metric_definition":"% ART queries yielding dangerous-content violation","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"24.3","value_num":24.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000539","legacy_row_id":539,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-flash","subject_model_ids":[],"subject_label":"Gemini 2.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-automated-red-teaming","group_id":"google-deepmind-automated-red-teaming-v1","metric_label":"Dangerous content violation rate","metric_definition":"% ART queries yielding dangerous-content violation","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"26.9","value_num":26.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8","source_type":"primary","via_url":"","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000540","legacy_row_id":540,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-0-flash","subject_model_ids":[],"subject_label":"Gemini 2.0 Flash","snapshot_label":"","is_subject_model":false,"eval_id":"google-deepmind-automated-red-teaming","group_id":"google-deepmind-automated-red-teaming-v1","metric_label":"Dangerous content violation rate","metric_definition":"% ART queries yielding dangerous-content violation","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"25.2","value_num":25.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000541","legacy_row_id":541,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-1-5-pro","subject_model_ids":[],"subject_label":"Gemini 1.5 Pro 002","snapshot_label":"002","is_subject_model":false,"eval_id":"google-deepmind-automated-red-teaming","group_id":"google-deepmind-automated-red-teaming-v1","metric_label":"Dangerous content violation rate","metric_definition":"% ART queries yielding dangerous-content violation","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"43.5","value_num":43.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000542","legacy_row_id":542,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-automated-red-teaming-helpfulness","group_id":"google-deepmind-automated-red-teaming-helpfulness-v1","metric_label":"Unhelpful response rate","metric_definition":"% ART queries with unhelpful response","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"6.1","value_num":6.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000543","legacy_row_id":543,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-flash","subject_model_ids":[],"subject_label":"Gemini 2.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-automated-red-teaming-helpfulness","group_id":"google-deepmind-automated-red-teaming-helpfulness-v1","metric_label":"Unhelpful response rate","metric_definition":"% ART queries with unhelpful response","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"6.6","value_num":6.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000544","legacy_row_id":544,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-indirect-prompt-injection","group_id":"google-deepmind-indirect-prompt-injection-v1","metric_label":"Actor Critic ASR","metric_definition":"Indirect prompt injection ASR (500 held-out scenarios)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"adaptive attack","context_note":"","value_printed":"61.4","value_num":61.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 9","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Column mapping inferred; delta -36.8pp vs Gemini 1.5 Pro 002"},
{"measurement_id":"m-000545","legacy_row_id":545,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-indirect-prompt-injection","group_id":"google-deepmind-indirect-prompt-injection-v1","metric_label":"Beam Search ASR","metric_definition":"Indirect prompt injection ASR (500 held-out scenarios)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"adaptive attack","context_note":"","value_printed":"63.8","value_num":63.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 9","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Column mapping inferred; delta -35.6pp vs Gemini 1.5 Pro 002"},
{"measurement_id":"m-000546","legacy_row_id":546,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-indirect-prompt-injection","group_id":"google-deepmind-indirect-prompt-injection-v1","metric_label":"TAP ASR","metric_definition":"Indirect prompt injection ASR (500 held-out scenarios)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"adaptive attack","context_note":"","value_printed":"30.8","value_num":30.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 9","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Column mapping inferred; delta -57.0pp vs Gemini 1.5 Pro 002"},
{"measurement_id":"m-000547","legacy_row_id":547,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-flash","subject_model_ids":[],"subject_label":"Gemini 2.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-indirect-prompt-injection","group_id":"google-deepmind-indirect-prompt-injection-v1","metric_label":"Actor Critic ASR","metric_definition":"Indirect prompt injection ASR (500 held-out scenarios)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"adaptive attack","context_note":"","value_printed":"40.8","value_num":40.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 9","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Column mapping inferred; delta -55.4pp vs Gemini 1.5 Flash 002"},
{"measurement_id":"m-000548","legacy_row_id":548,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-flash","subject_model_ids":[],"subject_label":"Gemini 2.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-indirect-prompt-injection","group_id":"google-deepmind-indirect-prompt-injection-v1","metric_label":"Beam Search ASR","metric_definition":"Indirect prompt injection ASR (500 held-out scenarios)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"adaptive attack","context_note":"","value_printed":"4.2","value_num":4.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 9","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Column mapping inferred; delta -80.2pp vs Gemini 1.5 Flash 002"},
{"measurement_id":"m-000549","legacy_row_id":549,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-flash","subject_model_ids":[],"subject_label":"Gemini 2.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-indirect-prompt-injection","group_id":"google-deepmind-indirect-prompt-injection-v1","metric_label":"TAP ASR","metric_definition":"Indirect prompt injection ASR (500 held-out scenarios)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"adaptive attack","context_note":"","value_printed":"53.6","value_num":53.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 9","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Column mapping inferred; delta -28.6pp vs Gemini 1.5 Flash 002"},
{"measurement_id":"m-000550","legacy_row_id":550,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-simpleqa","group_id":"google-deepmind-simpleqa-v1","metric_label":"Accuracy","metric_definition":"Parametric factuality accuracy","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"54.0","value_num":54,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000551","legacy_row_id":551,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-facts-grounding","group_id":"google-deepmind-facts-grounding-v1","metric_label":"Factuality score","metric_definition":"Grounded factuality score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"87.8","value_num":87.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000552","legacy_row_id":552,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-cyber-key-skills","group_id":"google-deepmind-cyber-key-skills-v1","metric_label":"Hard challenges solved","metric_definition":"Hard challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"6","value_num":6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"solved_of_12","denominator":12,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: cyber","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Also 7/8 easy, 14/28 medium"},
{"measurement_id":"m-000553","legacy_row_id":553,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-cyber-autonomous-offense-suite","group_id":"google-deepmind-cyber-autonomous-offense-suite-v1","metric_label":"Hard CTF challenges solved","metric_definition":"Hard CTF challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"solved_of_13","denominator":13,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: cyber","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Also 74/76 easy, 11/13 medium"},
{"measurement_id":"m-000554","legacy_row_id":554,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-re-bench","group_id":"google-deepmind-re-bench-v1","metric_label":"Best score as % of expert solution","metric_definition":"Best agent score as % of best expert solution","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"max across tasks","context_note":"","value_printed":"125","value_num":125,"value_text":"","value_qualifier":"range","range_low":"50","range_high":"125","unit":"percent","unit_as_printed":"% of expert","denominator":null,"scale":"share of the best expert solution's score","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: ML R&D","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Range reported: 50%-125% Migration: The report gives a range of 50% to 125% across tasks; v0 stored the upper end (125, its condition says max across tasks), not a midpoint. Agent score as a share of the best expert solution's score; values above 100 mean the agent beat it. The source prints a range; v0 stored the upper end of it, which value_num keeps for plotting only."},
{"measurement_id":"m-000555","legacy_row_id":555,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-stealth-challenges","group_id":"google-deepmind-stealth-challenges-v1","metric_label":"Challenges solved","metric_definition":"Challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"2","value_num":2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"solved_of_5","denominator":5,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: deceptive alignment","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000556","legacy_row_id":556,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-situational-awareness-challenges","group_id":"google-deepmind-situational-awareness-challenges-v1","metric_label":"Challenges solved","metric_definition":"Challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"2","value_num":2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"solved_of_11","denominator":11,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: deceptive alignment","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000557","legacy_row_id":557,"split_index":0,"version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-pro","subject_model_ids":[],"subject_label":"Gemini 2.5 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v1","metric_label":"Cyber Uplift Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"alert_threshold_reached","value_num":null,"value_text":"alert_threshold_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Table 10","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"All other CCLs not reached"},
{"measurement_id":"m-000558","legacy_row_id":558,"split_index":0,"version_id":"google-deepmind-gemini-2-5-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-flash","subject_model_ids":[],"subject_label":"Gemini 2.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-text-to-text-safety","group_id":"google-deepmind-text-to-text-safety-v1","metric_label":"Policy-violation rate delta","metric_definition":"Automated policy-violation rate delta vs baseline","condition_effort":"","condition_mode":"thinking","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.0 Flash","context_note":"","value_printed":"3.8","value_num":3.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"non-egregious; card dated Dec 2025 (index lists 26 Sep 2025) Migration: Printed for the GA 06-17 release. relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000559","legacy_row_id":559,"split_index":0,"version_id":"google-deepmind-gemini-2-5-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-flash","subject_model_ids":[],"subject_label":"Gemini 2.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-multilingual-safety","group_id":"google-deepmind-multilingual-safety-v1","metric_label":"Multilingual policy-violation rate delta","metric_definition":"Automated multilingual policy-violation rate delta","condition_effort":"","condition_mode":"thinking","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.0 Flash","context_note":"","value_printed":"11.9","value_num":11.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"non-egregious Migration: Printed for the GA 06-17 release. relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000560","legacy_row_id":560,"split_index":0,"version_id":"google-deepmind-gemini-2-5-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-flash","subject_model_ids":[],"subject_label":"Gemini 2.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-image-to-text-safety","group_id":"google-deepmind-image-to-text-safety-v1","metric_label":"Image-to-text policy-violation rate delta","metric_definition":"Automated image-to-text policy-violation rate delta","condition_effort":"","condition_mode":"thinking","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.0 Flash","context_note":"","value_printed":"1.6","value_num":1.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"non-egregious Migration: Printed for the GA 06-17 release. relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000561","legacy_row_id":561,"split_index":0,"version_id":"google-deepmind-gemini-2-5-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-flash","subject_model_ids":[],"subject_label":"Gemini 2.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-tone","group_id":"google-deepmind-tone-v1","metric_label":"Objective tone of refusals delta","metric_definition":"Automated objective tone of refusals delta","condition_effort":"","condition_mode":"thinking","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.0 Flash","context_note":"","value_printed":"-2.3","value_num":-2.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Printed for the GA 06-17 release. relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000562","legacy_row_id":562,"split_index":0,"version_id":"google-deepmind-gemini-2-5-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-flash","subject_model_ids":[],"subject_label":"Gemini 2.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-instruction-following","group_id":"google-deepmind-instruction-following-v1","metric_label":"Safe instruction following delta","metric_definition":"Follows instructions while remaining safe; delta","condition_effort":"","condition_mode":"thinking","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.0 Flash","context_note":"","value_printed":"28.4","value_num":28.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Printed for the GA 06-17 release. relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000563","legacy_row_id":563,"split_index":0,"version_id":"google-deepmind-gemini-2-5-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-flash","subject_model_ids":[],"subject_label":"Gemini 2.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v1","metric_label":"All CCLs (inherited)","metric_definition":"CCL determination via Gemini 2.5 Pro Preview","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Relies on 2.5 Pro Preview evaluation"},
{"measurement_id":"m-000564","legacy_row_id":564,"split_index":0,"version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-deep-think","subject_model_ids":[],"subject_label":"Gemini 2.5 Deep Think","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-text-to-text-safety","group_id":"google-deepmind-text-to-text-safety-v1","metric_label":"Policy-violation rate delta","metric_definition":"Automated policy-violation rate delta vs baseline","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Pro","context_note":"","value_printed":"-16.3","value_num":-16.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000565","legacy_row_id":565,"split_index":0,"version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-deep-think","subject_model_ids":[],"subject_label":"Gemini 2.5 Deep Think","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-multilingual-safety","group_id":"google-deepmind-multilingual-safety-v1","metric_label":"Multilingual policy-violation rate delta","metric_definition":"Automated multilingual policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Pro","context_note":"","value_printed":"-1.0","value_num":-1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000566","legacy_row_id":566,"split_index":0,"version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-deep-think","subject_model_ids":[],"subject_label":"Gemini 2.5 Deep Think","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-image-to-text-safety","group_id":"google-deepmind-image-to-text-safety-v1","metric_label":"Image-to-text policy-violation rate delta","metric_definition":"Automated image-to-text policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Pro","context_note":"","value_printed":"2.1","value_num":2.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"non-egregious Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000567","legacy_row_id":567,"split_index":0,"version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-deep-think","subject_model_ids":[],"subject_label":"Gemini 2.5 Deep Think","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-tone","group_id":"google-deepmind-tone-v1","metric_label":"Objective tone of refusals delta","metric_definition":"Automated objective tone of refusals delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Pro","context_note":"","value_printed":"16.3","value_num":16.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000568","legacy_row_id":568,"split_index":0,"version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-deep-think","subject_model_ids":[],"subject_label":"Gemini 2.5 Deep Think","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-instruction-following","group_id":"google-deepmind-instruction-following-v1","metric_label":"Safe instruction following delta","metric_definition":"Follows instructions while remaining safe; delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Pro","context_note":"","value_printed":"-9.9","value_num":-9.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000569","legacy_row_id":569,"split_index":0,"version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-deep-think","subject_model_ids":[],"subject_label":"Gemini 2.5 Deep Think","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v1","metric_label":"CBRN Uplift Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"alert_threshold_reached","value_num":null,"value_text":"alert_threshold_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Early warning alert threshold reached; more eval needed; proactive mitigations"},
{"measurement_id":"m-000570","legacy_row_id":570,"split_index":0,"version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-deep-think","subject_model_ids":[],"subject_label":"Gemini 2.5 Deep Think","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v1","metric_label":"Cyber Uplift Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"alert_threshold_reached","value_num":null,"value_text":"alert_threshold_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Alert first reached by 2.5 Pro; continues to be met"},
{"measurement_id":"m-000571","legacy_row_id":571,"split_index":0,"version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-deep-think","subject_model_ids":[],"subject_label":"Gemini 2.5 Deep Think","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v1","metric_label":"Cyber Autonomy Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000572","legacy_row_id":572,"split_index":0,"version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-deep-think","subject_model_ids":[],"subject_label":"Gemini 2.5 Deep Think","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v1","metric_label":"ML R&D Autonomy/Uplift Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Uplift worded 'likely no'"},
{"measurement_id":"m-000573","legacy_row_id":573,"split_index":0,"version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-deep-think","subject_model_ids":[],"subject_label":"Gemini 2.5 Deep Think","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination-misalignment","group_id":"google-deepmind-fsf-determination-misalignment-v1","metric_label":"Instrumental Reasoning Level 1/2","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000574","legacy_row_id":574,"split_index":0,"version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-deep-think","subject_model_ids":[],"subject_label":"Gemini 2.5 Deep Think","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-cyber-key-skills","group_id":"google-deepmind-cyber-key-skills-v1","metric_label":"Hard challenges solved","metric_definition":"Hard challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"4","value_num":4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"solved_of_12","denominator":12,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: cyber","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Also 6/8 easy, 17/28 medium"},
{"measurement_id":"m-000575","legacy_row_id":575,"split_index":0,"version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-deep-think","subject_model_ids":[],"subject_label":"Gemini 2.5 Deep Think","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-cyber-autonomous-offense-suite","group_id":"google-deepmind-cyber-autonomous-offense-suite-v1","metric_label":"Hard CTF challenges solved","metric_definition":"Hard CTF (Hack the Box) solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"3","value_num":3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"solved_of_13","denominator":13,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: cyber","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Also 73/76 easy, 13/13 in-house CTF medium"},
{"measurement_id":"m-000576","legacy_row_id":576,"split_index":0,"version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-deep-think","subject_model_ids":[],"subject_label":"Gemini 2.5 Deep Think","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-re-bench","group_id":"google-deepmind-re-bench-v1","metric_label":"Average normalised score","metric_definition":"Average normalised score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.96","value_num":0.96,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"normalised_score","denominator":null,"scale":"human-normalised (1.0 = human reference)","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: ML R&D","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Broadly similar to 2.5 Pro"},
{"measurement_id":"m-000577","legacy_row_id":577,"split_index":0,"version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-deep-think","subject_model_ids":[],"subject_label":"Gemini 2.5 Deep Think","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-situational-awareness-challenges","group_id":"google-deepmind-situational-awareness-challenges-v1","metric_label":"Challenges solved","metric_definition":"Challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"3","value_num":3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"solved_of_11","denominator":11,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: deceptive alignment","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000578","legacy_row_id":578,"split_index":0,"version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-2-5-deep-think","subject_model_ids":[],"subject_label":"Gemini 2.5 Deep Think","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-stealth-challenges","group_id":"google-deepmind-stealth-challenges-v2","metric_label":"Challenges solved","metric_definition":"Challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"solved_of_4","denominator":4,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: deceptive alignment","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Denominator 4 here vs 5 in 2.5 Pro report"},
{"measurement_id":"m-000579","legacy_row_id":579,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-text-to-text-safety","group_id":"google-deepmind-text-to-text-safety-v1","metric_label":"Policy-violation rate delta","metric_definition":"Automated policy-violation rate delta vs baseline","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Pro","context_note":"","value_printed":"-10.4","value_num":-10.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card 'Last Updated: May 2026' Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000580","legacy_row_id":580,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-multilingual-safety","group_id":"google-deepmind-multilingual-safety-v1","metric_label":"Multilingual policy-violation rate delta","metric_definition":"Automated multilingual policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Pro","context_note":"","value_printed":"0.2","value_num":0.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"non-egregious Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000581","legacy_row_id":581,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-image-to-text-safety","group_id":"google-deepmind-image-to-text-safety-v1","metric_label":"Image-to-text policy-violation rate delta","metric_definition":"Automated image-to-text policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Pro","context_note":"","value_printed":"3.1","value_num":3.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"non-egregious Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000582","legacy_row_id":582,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-tone","group_id":"google-deepmind-tone-v1","metric_label":"Objective tone of refusals delta","metric_definition":"Automated objective tone of refusals delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Pro","context_note":"","value_printed":"7.9","value_num":7.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000583","legacy_row_id":583,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-unjustified-refusals","group_id":"google-deepmind-unjustified-refusals-v1","metric_label":"Unjustified refusals delta","metric_definition":"Refusals on borderline prompts; delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Pro","context_note":"","value_printed":"3.7","value_num":3.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"non-egregious Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000584","legacy_row_id":584,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-child-safety-launch-thresholds","group_id":"google-deepmind-child-safety-launch-thresholds-v1","metric_label":"Launch thresholds met","metric_definition":"Pass/fail vs internal launch thresholds","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"met","value_num":null,"value_text":"met","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Safety evaluations","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000585","legacy_row_id":585,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-jailbreak-risk-assessment","group_id":"google-deepmind-jailbreak-risk-assessment-v1","metric_label":"Stated risk vs prior model","metric_definition":"Stated risk vs prior model","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"improved","value_num":null,"value_text":"improved","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Risks and mitigations","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Improved vs 2.5 Pro but still open problem; no number"},
{"measurement_id":"m-000586","legacy_row_id":586,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v2","metric_label":"CBRN Uplift Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"FSF summary table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Alert threshold not reached under updated FSF; mitigations deployed as precaution"},
{"measurement_id":"m-000587","legacy_row_id":587,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v2","metric_label":"Cyber Uplift Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"alert_threshold_reached","value_num":null,"value_text":"alert_threshold_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"FSF summary table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CCL not reached; early warning alert continues to be met"},
{"measurement_id":"m-000588","legacy_row_id":588,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v2","metric_label":"Harmful manipulation","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"FSF summary table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Results did not near alert thresholds"},
{"measurement_id":"m-000589","legacy_row_id":589,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v2","metric_label":"ML R&D","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"FSF summary table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"RE-Bench aggregate substantially below alert threshold"},
{"measurement_id":"m-000590","legacy_row_id":590,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination-misalignment","group_id":"google-deepmind-fsf-determination-misalignment-v2","metric_label":"Instrumental reasoning","metric_definition":"CCL determination (exploratory)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"FSF summary table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000591","legacy_row_id":591,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-cyber-key-skills","group_id":"google-deepmind-cyber-key-skills-v1","metric_label":"Hard challenges solved","metric_definition":"Hard challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"11","value_num":11,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"solved_of_12","denominator":12,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: cyber","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"vs 6/12 for Gemini 2.5 models; 2 of 12 via unintended shortcuts"},
{"measurement_id":"m-000592","legacy_row_id":592,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-cyber-key-skills","group_id":"google-deepmind-cyber-key-skills-v2","metric_label":"Challenges solved end-to-end","metric_definition":"Challenges solved end-to-end","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"solved_of_13","denominator":13,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: cyber","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"New harder v2 set"},
{"measurement_id":"m-000593","legacy_row_id":593,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-situational-awareness-challenges","group_id":"google-deepmind-situational-awareness-challenges-v1","metric_label":"Challenges solved","metric_definition":"Challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"3","value_num":3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"solved_of_11","denominator":11,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: misalignment","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000594","legacy_row_id":594,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-stealth-challenges","group_id":"google-deepmind-stealth-challenges-v2","metric_label":"Challenges solved","metric_definition":"Challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"solved_of_4","denominator":4,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: misalignment","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000595","legacy_row_id":595,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-cot-legibility","group_id":"google-deepmind-cot-legibility-v1","metric_label":"Comprehensible reasoning","metric_definition":"% transcripts with comprehensible reasoning","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.98","value_num":99.98,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"FSF: misalignment","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000596","legacy_row_id":596,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-cot-legibility","group_id":"google-deepmind-cot-legibility-v1","metric_label":"Informative of output","metric_definition":"% transcripts informative of output","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.85","value_num":99.85,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"FSF: misalignment","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000597","legacy_row_id":597,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-harmful-manipulation-efficacy-study","group_id":"google-deepmind-harmful-manipulation-efficacy-study-v1","metric_label":"Participants enrolled","metric_definition":"Participants enrolled","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"610","value_num":610,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"participants","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"neutral","value_status":"printed","location":"FSF: harmful manipulation","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"421 adversarial / 189 control; sig. above non-AI baseline; no sig. diff vs 2.5 Pro"},
{"measurement_id":"m-000598","legacy_row_id":598,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-sandbagging-checks","group_id":"google-deepmind-sandbagging-checks-v1","metric_label":"Evidence of deliberate underperformance","metric_definition":"Evidence of deliberate underperformance","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"all domains","context_note":"","value_printed":"not_found","value_num":null,"value_text":"not_found","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"FSF: general","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000599","legacy_row_id":599,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-evaluation-awareness","group_id":"google-deepmind-evaluation-awareness-v1","metric_label":"Qualitative observation","metric_definition":"Qualitative observation","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"observed","value_num":null,"value_text":"observed","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"FSF: appendix","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"e.g. 'This is likely a test...'; table-flip emoticon example"},
{"measurement_id":"m-000600","legacy_row_id":600,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"unnamed-third-party-ai-r-d-sabotage","group_id":"unnamed-third-party-ai-r-d-sabotage-google-deepmind-v1","metric_label":"Ability to sabotage AI R&D","metric_definition":"Ability to sabotage AI R&D","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"increased_not_consistent","value_num":null,"value_text":"increased_not_consistent","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"FSF: misalignment/external","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Increased vs prior Gemini; not consistent on multi-step sabotage"},
{"measurement_id":"m-000601","legacy_row_id":601,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"unnamed-third-party-strategic-deception-propensity","group_id":"unnamed-third-party-strategic-deception-propensity-google-deepmind-v1","metric_label":"Qualitative propensity finding","metric_definition":"Qualitative propensity finding","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"substantial_in_limited_cases","value_num":null,"value_text":"substantial_in_limited_cases","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"FSF: external evaluations","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Internal judged unlikely to cause severe harm"},
{"measurement_id":"m-000602","legacy_row_id":602,"split_index":0,"version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-reward-hacking-examples","group_id":"google-deepmind-reward-hacking-examples-v1","metric_label":"Qualitative example","metric_definition":"Qualitative example in transcripts","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"example_observed","value_num":null,"value_text":"example_observed","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"FSF: appendix 2","source_type":"primary","via_url":"","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Lucky-low-validation-loss score call example"},
{"measurement_id":"m-000603","legacy_row_id":603,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":false,"eval_id":"google-deepmind-re-bench","group_id":"google-deepmind-re-bench-v1","metric_label":"Average normalised score","metric_definition":"Human-normalised average score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.04","value_num":1.04,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"normalised_score","denominator":null,"scale":"human-normalised (1.0 = human reference)","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: ML R&D","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Gemini 3 Pro score as reported in 3.1 Pro card"},
{"measurement_id":"m-000604","legacy_row_id":604,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":false,"eval_id":"google-deepmind-harmful-manipulation-efficacy-study","group_id":"google-deepmind-harmful-manipulation-efficacy-study-v1","metric_label":"Max odds ratio vs non-AI baseline","metric_definition":"Max belief-change odds ratio vs non-AI baseline","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"3.6","value_num":3.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"odds_ratio","unit_as_printed":"odds_ratio","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"qualitative","location":"Frontier Safety: manipulation","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"'same as Gemini 3 Pro'; FSF report itself shows chart only Migration: The 3.1 Pro card gives 3.6 for Gemini 3.1 Pro and says it is the same as Gemini 3 Pro; the v0 extractor recorded 3.6 for Gemini 3 Pro from that statement. The Gemini 3 Pro FSF report shows this result only in a chart."},
{"measurement_id":"m-000605","legacy_row_id":605,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":false,"eval_id":"google-deepmind-harmful-manipulation-propensity","group_id":"google-deepmind-harmful-manipulation-propensity-v1","metric_label":"Turns with manipulative cues","metric_definition":"% conversational turns with manipulative cues","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"64.5","value_num":64.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: harmful manipulation propensity","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Gemini 3 Pro value reported in 3.7 Flash FSF report"},
{"measurement_id":"m-000606","legacy_row_id":606,"split_index":0,"version_id":"google-deepmind-gemini-3-launch-post--2026-09-26","subject_kind":"model","model_id":"gemini-3-pro","subject_model_ids":[],"subject_label":"Gemini 3 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-simpleqa-verified","group_id":"google-deepmind-simpleqa-verified-v1","metric_label":"Accuracy","metric_definition":"Parametric factuality accuracy","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"72.1","value_num":72.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Launch blog (not card)","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card links evals page; table not extractable"},
{"measurement_id":"m-000607","legacy_row_id":607,"split_index":0,"version_id":"google-deepmind-gemini-3-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-flash","subject_model_ids":[],"subject_label":"Gemini 3 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-text-to-text-safety","group_id":"google-deepmind-text-to-text-safety-v1","metric_label":"Policy-violation rate delta","metric_definition":"Automated policy-violation rate delta vs baseline","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Flash","context_note":"","value_printed":"-3.1","value_num":-3.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000608","legacy_row_id":608,"split_index":0,"version_id":"google-deepmind-gemini-3-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-flash","subject_model_ids":[],"subject_label":"Gemini 3 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-multilingual-safety","group_id":"google-deepmind-multilingual-safety-v1","metric_label":"Multilingual policy-violation rate delta","metric_definition":"Automated multilingual policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Flash","context_note":"","value_printed":"0.1","value_num":0.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"non-egregious Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000609","legacy_row_id":609,"split_index":0,"version_id":"google-deepmind-gemini-3-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-flash","subject_model_ids":[],"subject_label":"Gemini 3 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-image-to-text-safety","group_id":"google-deepmind-image-to-text-safety-v1","metric_label":"Image-to-text policy-violation rate delta","metric_definition":"Automated image-to-text policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Flash","context_note":"","value_printed":"-2.3","value_num":-2.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000610","legacy_row_id":610,"split_index":0,"version_id":"google-deepmind-gemini-3-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-flash","subject_model_ids":[],"subject_label":"Gemini 3 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-tone","group_id":"google-deepmind-tone-v1","metric_label":"Objective tone of refusals delta","metric_definition":"Automated objective tone of refusals delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Flash","context_note":"","value_printed":"3.8","value_num":3.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000611","legacy_row_id":611,"split_index":0,"version_id":"google-deepmind-gemini-3-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-flash","subject_model_ids":[],"subject_label":"Gemini 3 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-unjustified-refusals","group_id":"google-deepmind-unjustified-refusals-v1","metric_label":"Unjustified refusals delta","metric_definition":"Refusals on borderline prompts; delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Flash","context_note":"","value_printed":"-10.4","value_num":-10.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000612","legacy_row_id":612,"split_index":0,"version_id":"google-deepmind-gemini-3-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-flash","subject_model_ids":[],"subject_label":"Gemini 3 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v2","metric_label":"All CCLs (inherited)","metric_definition":"CCL determination via Gemini 3 Pro","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Less capable than 3 Pro; relies on 3 Pro FSF report"},
{"measurement_id":"m-000613","legacy_row_id":613,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-pro","subject_model_ids":[],"subject_label":"Gemini 3.1 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-text-to-text-safety","group_id":"google-deepmind-text-to-text-safety-v1","metric_label":"Policy-violation rate delta","metric_definition":"Automated policy-violation rate delta vs baseline","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3 Pro","context_note":"","value_printed":"0.1","value_num":0.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"non-egregious Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000614","legacy_row_id":614,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-pro","subject_model_ids":[],"subject_label":"Gemini 3.1 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-multilingual-safety","group_id":"google-deepmind-multilingual-safety-v1","metric_label":"Multilingual policy-violation rate delta","metric_definition":"Automated multilingual policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3 Pro","context_note":"","value_printed":"0.11","value_num":0.11,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"non-egregious Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000615","legacy_row_id":615,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-pro","subject_model_ids":[],"subject_label":"Gemini 3.1 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-image-to-text-safety","group_id":"google-deepmind-image-to-text-safety-v1","metric_label":"Image-to-text policy-violation rate delta","metric_definition":"Automated image-to-text policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3 Pro","context_note":"","value_printed":"-0.33","value_num":-0.33,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000616","legacy_row_id":616,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-pro","subject_model_ids":[],"subject_label":"Gemini 3.1 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-tone","group_id":"google-deepmind-tone-v1","metric_label":"Objective tone of refusals delta","metric_definition":"Automated objective tone of refusals delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3 Pro","context_note":"","value_printed":"0.02","value_num":0.02,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000617","legacy_row_id":617,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-pro","subject_model_ids":[],"subject_label":"Gemini 3.1 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-unjustified-refusals","group_id":"google-deepmind-unjustified-refusals-v1","metric_label":"Unjustified refusals delta","metric_definition":"Refusals on borderline prompts; delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3 Pro","context_note":"","value_printed":"-0.08","value_num":-0.08,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000618","legacy_row_id":618,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-pro","subject_model_ids":[],"subject_label":"Gemini 3.1 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v2","metric_label":"CBRN Uplift Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"Deep Think","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000619","legacy_row_id":619,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-pro","subject_model_ids":[],"subject_label":"Gemini 3.1 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v2","metric_label":"Cyber Uplift Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"alert_threshold_reached","value_num":null,"value_text":"alert_threshold_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Capability up vs 3 Pro; Deep Think worse when cost-adjusted"},
{"measurement_id":"m-000620","legacy_row_id":620,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-pro","subject_model_ids":[],"subject_label":"Gemini 3.1 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v2","metric_label":"Harmful manipulation","metric_definition":"CCL determination","condition_effort":"","condition_mode":"Deep Think","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Did not reach alert threshold"},
{"measurement_id":"m-000621","legacy_row_id":621,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-pro","subject_model_ids":[],"subject_label":"Gemini 3.1 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v2","metric_label":"ML R&D","metric_definition":"CCL determination","condition_effort":"","condition_mode":"Deep Think","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Beneath alert threshold"},
{"measurement_id":"m-000622","legacy_row_id":622,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-pro","subject_model_ids":[],"subject_label":"Gemini 3.1 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination-misalignment","group_id":"google-deepmind-fsf-determination-misalignment-v2","metric_label":"Instrumental reasoning","metric_definition":"CCL determination","condition_effort":"","condition_mode":"Deep Think","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Does not reach alert threshold"},
{"measurement_id":"m-000623","legacy_row_id":623,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-pro","subject_model_ids":[],"subject_label":"Gemini 3.1 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-re-bench","group_id":"google-deepmind-re-bench-v1","metric_label":"Average normalised score","metric_definition":"Human-normalised average score","condition_effort":"","condition_mode":"Deep Think","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.27","value_num":1.27,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"normalised_score","denominator":null,"scale":"human-normalised (1.0 = human reference)","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: ML R&D","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"vs 1.04 Gemini 3 Pro; one task 300s->47s runtime"},
{"measurement_id":"m-000624","legacy_row_id":624,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-pro","subject_model_ids":[],"subject_label":"Gemini 3.1 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-harmful-manipulation-efficacy-study","group_id":"google-deepmind-harmful-manipulation-efficacy-study-v1","metric_label":"Max odds ratio vs non-AI baseline","metric_definition":"Max belief-change odds ratio vs non-AI baseline","condition_effort":"","condition_mode":"Deep Think","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"3.6","value_num":3.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"odds_ratio","unit_as_printed":"odds_ratio","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: manipulation","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Same as Gemini 3 Pro"},
{"measurement_id":"m-000625","legacy_row_id":625,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-pro","subject_model_ids":[],"subject_label":"Gemini 3.1 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-situational-awareness-challenges","group_id":"google-deepmind-situational-awareness-challenges-v1","metric_label":"Success rate on three hardest challenges","metric_definition":"Success rate: max tokens, context size mod, oversight freq","condition_effort":"","condition_mode":"Deep Think","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"100","value_num":100,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Frontier Safety: misalignment","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"'almost 100%' on 3 challenges no prior model solved consistently"},
{"measurement_id":"m-000626","legacy_row_id":626,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-pro","subject_model_ids":[],"subject_label":"Gemini 3.1 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-stealth-challenges","group_id":"google-deepmind-stealth-challenges-v2","metric_label":"Comparison with Gemini 3 Pro","metric_definition":"Qualitative vs Gemini 3 Pro","condition_effort":"","condition_mode":"Deep Think","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"similar","value_num":null,"value_text":"similar","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Frontier Safety: misalignment","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000627","legacy_row_id":627,"split_index":0,"version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-pro","subject_model_ids":[],"subject_label":"Gemini 3.1 Pro","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-child-safety-launch-thresholds","group_id":"google-deepmind-child-safety-launch-thresholds-v1","metric_label":"Launch thresholds met","metric_definition":"Pass/fail vs internal launch thresholds","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"met","value_num":null,"value_text":"met","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Safety evaluations","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000628","legacy_row_id":628,"split_index":0,"version_id":"google-deepmind-gemini-3-1-flash-lite-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-flash-lite","subject_model_ids":[],"subject_label":"Gemini 3.1 Flash-Lite","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-text-to-text-safety","group_id":"google-deepmind-text-to-text-safety-v1","metric_label":"Policy-violation rate delta","metric_definition":"Automated policy-violation rate delta vs baseline","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Flash-Lite","context_note":"","value_printed":"-1.18","value_num":-1.18,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"PDF header says 'Updated: May 2026' Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000629","legacy_row_id":629,"split_index":0,"version_id":"google-deepmind-gemini-3-1-flash-lite-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-flash-lite","subject_model_ids":[],"subject_label":"Gemini 3.1 Flash-Lite","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-multilingual-safety","group_id":"google-deepmind-multilingual-safety-v1","metric_label":"Multilingual policy-violation rate delta","metric_definition":"Automated multilingual policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Flash-Lite","context_note":"","value_printed":"-1.84","value_num":-1.84,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000630","legacy_row_id":630,"split_index":0,"version_id":"google-deepmind-gemini-3-1-flash-lite-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-flash-lite","subject_model_ids":[],"subject_label":"Gemini 3.1 Flash-Lite","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-image-to-text-safety","group_id":"google-deepmind-image-to-text-safety-v1","metric_label":"Image-to-text policy-violation rate delta","metric_definition":"Automated image-to-text policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Flash-Lite","context_note":"","value_printed":"-21.7","value_num":-21.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000631","legacy_row_id":631,"split_index":0,"version_id":"google-deepmind-gemini-3-1-flash-lite-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-flash-lite","subject_model_ids":[],"subject_label":"Gemini 3.1 Flash-Lite","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-tone","group_id":"google-deepmind-tone-v1","metric_label":"Objective tone of refusals delta","metric_definition":"Automated objective tone of refusals delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Flash-Lite","context_note":"","value_printed":"14.59","value_num":14.59,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000632","legacy_row_id":632,"split_index":0,"version_id":"google-deepmind-gemini-3-1-flash-lite-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-flash-lite","subject_model_ids":[],"subject_label":"Gemini 3.1 Flash-Lite","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-unjustified-refusals","group_id":"google-deepmind-unjustified-refusals-v1","metric_label":"Unjustified refusals delta","metric_definition":"Refusals on borderline prompts; delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 2.5 Flash-Lite","context_note":"","value_printed":"-14.41","value_num":-14.41,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000633","legacy_row_id":633,"split_index":0,"version_id":"google-deepmind-gemini-3-1-flash-lite-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-flash-lite","subject_model_ids":[],"subject_label":"Gemini 3.1 Flash-Lite","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v2","metric_label":"All CCLs (inherited)","metric_definition":"CCL determination via Gemini 3.1 Pro Deep Think","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000634","legacy_row_id":634,"split_index":0,"version_id":"google-deepmind-gemini-3-5-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-5-flash","subject_model_ids":[],"subject_label":"Gemini 3.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-text-to-text-safety","group_id":"google-deepmind-text-to-text-safety-v1","metric_label":"Policy-violation rate delta","metric_definition":"Automated policy-violation rate delta vs baseline","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3 Flash","context_note":"","value_printed":"-3.9","value_num":-3.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000635","legacy_row_id":635,"split_index":0,"version_id":"google-deepmind-gemini-3-5-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-5-flash","subject_model_ids":[],"subject_label":"Gemini 3.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-multilingual-safety","group_id":"google-deepmind-multilingual-safety-v1","metric_label":"Multilingual policy-violation rate delta","metric_definition":"Automated multilingual policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3 Flash","context_note":"","value_printed":"-2.6","value_num":-2.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000636","legacy_row_id":636,"split_index":0,"version_id":"google-deepmind-gemini-3-5-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-5-flash","subject_model_ids":[],"subject_label":"Gemini 3.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-image-to-text-safety","group_id":"google-deepmind-image-to-text-safety-v1","metric_label":"Image-to-text policy-violation rate delta","metric_definition":"Automated image-to-text policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3 Flash","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000637","legacy_row_id":637,"split_index":0,"version_id":"google-deepmind-gemini-3-5-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-5-flash","subject_model_ids":[],"subject_label":"Gemini 3.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-tone","group_id":"google-deepmind-tone-v1","metric_label":"Objective tone of refusals delta","metric_definition":"Automated objective tone of refusals delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3 Flash","context_note":"","value_printed":"8.9","value_num":8.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000638","legacy_row_id":638,"split_index":0,"version_id":"google-deepmind-gemini-3-5-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-5-flash","subject_model_ids":[],"subject_label":"Gemini 3.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-unjustified-refusals","group_id":"google-deepmind-unjustified-refusals-v1","metric_label":"Unjustified refusals delta","metric_definition":"Refusals on borderline prompts; delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3 Flash","context_note":"","value_printed":"0.8","value_num":0.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"non-egregious Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000639","legacy_row_id":639,"split_index":0,"version_id":"google-deepmind-gemini-3-5-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-5-flash","subject_model_ids":[],"subject_label":"Gemini 3.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v2","metric_label":"All CCLs (inherited)","metric_definition":"CCL determination via Gemini 3.1 Pro","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000640","legacy_row_id":640,"split_index":0,"version_id":"google-deepmind-gemini-3-5-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-5-flash","subject_model_ids":[],"subject_label":"Gemini 3.5 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v2","metric_label":"Cyber Uplift Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Extra cyber testing because Gemini 3 series hit alert threshold Migration: The determination rests on the model's own additional cyber testing rather than being inherited."},
{"measurement_id":"m-000641","legacy_row_id":641,"split_index":0,"version_id":"google-deepmind-gemini-3-5-flash-lite-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-5-flash-lite","subject_model_ids":[],"subject_label":"Gemini 3.5 Flash-Lite","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-text-to-text-safety","group_id":"google-deepmind-text-to-text-safety-v1","metric_label":"Policy-violation rate delta","metric_definition":"Automated policy-violation rate delta vs baseline","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.1 Flash-Lite","context_note":"","value_printed":"-8.14","value_num":-8.14,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000642","legacy_row_id":642,"split_index":0,"version_id":"google-deepmind-gemini-3-5-flash-lite-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-5-flash-lite","subject_model_ids":[],"subject_label":"Gemini 3.5 Flash-Lite","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-multilingual-safety","group_id":"google-deepmind-multilingual-safety-v1","metric_label":"Multilingual policy-violation rate delta","metric_definition":"Automated multilingual policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.1 Flash-Lite","context_note":"","value_printed":"-0.92","value_num":-0.92,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000643","legacy_row_id":643,"split_index":0,"version_id":"google-deepmind-gemini-3-5-flash-lite-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-5-flash-lite","subject_model_ids":[],"subject_label":"Gemini 3.5 Flash-Lite","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-image-to-text-safety","group_id":"google-deepmind-image-to-text-safety-v1","metric_label":"Image-to-text policy-violation rate delta","metric_definition":"Automated image-to-text policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.1 Flash-Lite","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000644","legacy_row_id":644,"split_index":0,"version_id":"google-deepmind-gemini-3-5-flash-lite-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-5-flash-lite","subject_model_ids":[],"subject_label":"Gemini 3.5 Flash-Lite","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-tone","group_id":"google-deepmind-tone-v1","metric_label":"Objective tone of refusals delta","metric_definition":"Automated objective tone of refusals delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.1 Flash-Lite","context_note":"","value_printed":"3.04","value_num":3.04,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000645","legacy_row_id":645,"split_index":0,"version_id":"google-deepmind-gemini-3-5-flash-lite-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-5-flash-lite","subject_model_ids":[],"subject_label":"Gemini 3.5 Flash-Lite","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-unjustified-refusals","group_id":"google-deepmind-unjustified-refusals-v1","metric_label":"Unjustified refusals delta","metric_definition":"Refusals on borderline prompts; delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.1 Flash-Lite","context_note":"","value_printed":"5.32","value_num":5.32,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: relative or absolute not stated in the source as recorded"},
{"measurement_id":"m-000646","legacy_row_id":646,"split_index":0,"version_id":"google-deepmind-gemini-3-5-flash-lite-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-5-flash-lite","subject_model_ids":[],"subject_label":"Gemini 3.5 Flash-Lite","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v2","metric_label":"All CCLs (inherited)","metric_definition":"CCL determination via Gemini 3.1 Pro","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000647","legacy_row_id":647,"split_index":0,"version_id":"google-deepmind-gemini-3-6-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-6-flash","subject_model_ids":[],"subject_label":"Gemini 3.6 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-text-to-text-safety","group_id":"google-deepmind-text-to-text-safety-v1","metric_label":"Policy-violation rate delta","metric_definition":"Automated policy-violation rate delta vs baseline","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.5 Flash","context_note":"","value_printed":"-1.35","value_num":-1.35,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Header says percentage-point change Migration: The table header describes the changes as percentage points."},
{"measurement_id":"m-000648","legacy_row_id":648,"split_index":0,"version_id":"google-deepmind-gemini-3-6-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-6-flash","subject_model_ids":[],"subject_label":"Gemini 3.6 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-multilingual-safety","group_id":"google-deepmind-multilingual-safety-v1","metric_label":"Multilingual policy-violation rate delta","metric_definition":"Automated multilingual policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.5 Flash","context_note":"","value_printed":"-5.45","value_num":-5.45,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: The table header describes the changes as percentage points."},
{"measurement_id":"m-000649","legacy_row_id":649,"split_index":0,"version_id":"google-deepmind-gemini-3-6-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-6-flash","subject_model_ids":[],"subject_label":"Gemini 3.6 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-image-to-text-safety","group_id":"google-deepmind-image-to-text-safety-v1","metric_label":"Image-to-text policy-violation rate delta","metric_definition":"Automated image-to-text policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.5 Flash","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: The table header describes the changes as percentage points."},
{"measurement_id":"m-000650","legacy_row_id":650,"split_index":0,"version_id":"google-deepmind-gemini-3-6-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-6-flash","subject_model_ids":[],"subject_label":"Gemini 3.6 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-tone","group_id":"google-deepmind-tone-v1","metric_label":"Objective tone of refusals delta","metric_definition":"Automated objective tone of refusals delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.5 Flash","context_note":"","value_printed":"-3.31","value_num":-3.31,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: The table header describes the changes as percentage points."},
{"measurement_id":"m-000651","legacy_row_id":651,"split_index":0,"version_id":"google-deepmind-gemini-3-6-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-6-flash","subject_model_ids":[],"subject_label":"Gemini 3.6 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-unjustified-refusals","group_id":"google-deepmind-unjustified-refusals-v1","metric_label":"Unjustified refusals delta","metric_definition":"Refusals on borderline prompts; delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.5 Flash","context_note":"","value_printed":"0.25","value_num":0.25,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pct","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: The table header describes the changes as percentage points."},
{"measurement_id":"m-000652","legacy_row_id":652,"split_index":0,"version_id":"google-deepmind-gemini-3-6-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-6-flash","subject_model_ids":[],"subject_label":"Gemini 3.6 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v2","metric_label":"All CCLs (inherited)","metric_definition":"CCL determination via Gemini 3.1 Pro","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000653","legacy_row_id":653,"split_index":0,"version_id":"google-deepmind-gemini-3-6-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-6-flash","subject_model_ids":[],"subject_label":"Gemini 3.6 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v2","metric_label":"Cyber Uplift Level 1","metric_definition":"CCL determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: The determination rests on the model's own additional cyber testing rather than being inherited."},
{"measurement_id":"m-000654","legacy_row_id":654,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-text-to-text-safety","group_id":"google-deepmind-text-to-text-safety-v1","metric_label":"Policy-violation rate delta","metric_definition":"Automated policy-violation rate delta vs baseline","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.6 Flash","context_note":"","value_printed":"1.17","value_num":1.17,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pp","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Footnote says baseline 'Gemini 3 Flash' (inconsistent)"},
{"measurement_id":"m-000655","legacy_row_id":655,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-multilingual-safety","group_id":"google-deepmind-multilingual-safety-v1","metric_label":"Multilingual policy-violation rate delta","metric_definition":"Automated multilingual policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.6 Flash","context_note":"","value_printed":"-0.48","value_num":-0.48,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pp","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000656","legacy_row_id":656,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-image-to-text-safety","group_id":"google-deepmind-image-to-text-safety-v1","metric_label":"Image-to-text policy-violation rate delta","metric_definition":"Automated image-to-text policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.6 Flash","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pp","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Printed 'No change'"},
{"measurement_id":"m-000657","legacy_row_id":657,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-tone","group_id":"google-deepmind-tone-v1","metric_label":"Objective tone of refusals delta","metric_definition":"Automated objective tone of refusals delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.6 Flash","context_note":"","value_printed":"-0.47","value_num":-0.47,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pp","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000658","legacy_row_id":658,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-unjustified-refusals","group_id":"google-deepmind-unjustified-refusals-v1","metric_label":"Unjustified refusals delta","metric_definition":"Refusals on borderline prompts; delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.6 Flash","context_note":"","value_printed":"0.84","value_num":0.84,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pp","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000659","legacy_row_id":659,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v3","metric_label":"CBRN uplift CCL","metric_definition":"CCL determination (FSF v3.1)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"alert_threshold_reached","value_num":null,"value_text":"alert_threshold_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"FSF: CBRN","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CCL ruled out; alert threshold reached (bio)"},
{"measurement_id":"m-000660","legacy_row_id":660,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v3","metric_label":"CBRN TCL","metric_definition":"TCL determination (FSF v3.1)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"FSF: CBRN","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000661","legacy_row_id":661,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v3","metric_label":"Cyber CCL","metric_definition":"CCL determination (FSF v3.1)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"alert_threshold_reached","value_num":null,"value_text":"alert_threshold_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"FSF: cyber","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Proxy evals; key skills not fully run"},
{"measurement_id":"m-000662","legacy_row_id":662,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v3","metric_label":"Harmful manipulation CCL","metric_definition":"CCL determination (FSF v3.1)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"FSF: manipulation","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Below alert threshold"},
{"measurement_id":"m-000663","legacy_row_id":663,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v3","metric_label":"ML R&D CCL","metric_definition":"CCL determination (FSF v3.1)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"FSF: ML R&D","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000664","legacy_row_id":664,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination-misalignment","group_id":"google-deepmind-fsf-determination-misalignment-v3","metric_label":"Stealth and situational awareness TCL","metric_definition":"TCL determination (FSF v3.1)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"FSF: misalignment","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000665","legacy_row_id":665,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-cbrn-red-team-uplift","group_id":"google-deepmind-cbrn-red-team-uplift-v1","metric_label":"BIO-1 score gain over web baseline","metric_definition":"Score gain over web baseline (0-100 rubric)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"expert red team","context_note":"","value_printed":"8.0","value_num":8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"points","denominator":null,"scale":"0-100 rubric","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: CBRN","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"69.6 -> 77.6 Migration: v0 notes give the web-baseline and model-assisted scores (69.6 and 77.6); whether the report prints the gain itself is not recorded. Gain in rubric points of model-assisted over web-only red-team scores; the 0-100 rubric is stated for the bio scenarios only."},
{"measurement_id":"m-000666","legacy_row_id":666,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-cbrn-red-team-uplift","group_id":"google-deepmind-cbrn-red-team-uplift-v1","metric_label":"BIO-2 score gain over web baseline","metric_definition":"Score gain over web baseline (0-100 rubric)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"expert red team","context_note":"","value_printed":"12.1","value_num":12.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"points","denominator":null,"scale":"0-100 rubric","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: CBRN","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"67.0 -> 79.1 Migration: v0 notes give the web-baseline and model-assisted scores (67.0 and 79.1); whether the report prints the gain itself is not recorded. Gain in rubric points of model-assisted over web-only red-team scores; the 0-100 rubric is stated for the bio scenarios only."},
{"measurement_id":"m-000667","legacy_row_id":667,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-cbrn-red-team-uplift","group_id":"google-deepmind-cbrn-red-team-uplift-v1","metric_label":"Chem scenario 1 score gain over web baseline","metric_definition":"Score gain over web baseline","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"expert red team","context_note":"","value_printed":"24.1","value_num":24.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"points","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: CBRN","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"47.0 -> 71.1; domain attribution per fetch Migration: v0 notes give the web-baseline and model-assisted scores (47.0 and 71.1); whether the report prints the gain itself, and the rubric scale, are not recorded. Gain in rubric points of model-assisted over web-only red-team scores; the 0-100 rubric is stated for the bio scenarios only."},
{"measurement_id":"m-000668","legacy_row_id":668,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-cbrn-red-team-uplift","group_id":"google-deepmind-cbrn-red-team-uplift-v1","metric_label":"Chem scenario 2 score gain over web baseline","metric_definition":"Score gain over web baseline","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"expert red team","context_note":"","value_printed":"27.9","value_num":27.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"points","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: CBRN","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"41.0 -> 68.9 Migration: v0 notes give the web-baseline and model-assisted scores (41.0 and 68.9); whether the report prints the gain itself, and the rubric scale, are not recorded. Gain in rubric points of model-assisted over web-only red-team scores; the 0-100 rubric is stated for the bio scenarios only."},
{"measurement_id":"m-000669","legacy_row_id":669,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-bio-bottleneck-red-teaming","group_id":"google-deepmind-bio-bottleneck-red-teaming-v1","metric_label":"Bio sub-stages scoring below 80","metric_definition":"Sub-stages with avg red-team score below 80","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"6","value_num":6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count_of_11","denominator":11,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"FSF: CBRN","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000670","legacy_row_id":670,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-harmful-manipulation-efficacy-study","group_id":"google-deepmind-harmful-manipulation-efficacy-study-v1","metric_label":"Participants enrolled","metric_definition":"Participants enrolled (civic 805 / finance 791)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1596","value_num":1596,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"participants","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"neutral","value_status":"printed","location":"FSF: manipulation","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"No sig. OR difference vs Gemini 3 Pro"},
{"measurement_id":"m-000671","legacy_row_id":671,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-harmful-manipulation-propensity","group_id":"google-deepmind-harmful-manipulation-propensity-v1","metric_label":"Turns with manipulative cues","metric_definition":"% conversational turns with manipulative cues","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"21.3","value_num":21.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: manipulation propensity","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"vs 64.5% Gemini 3 Pro Migration: Standard scenario set; the report gives higher-stakes scenarios separately."},
{"measurement_id":"m-000672","legacy_row_id":672,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-harmful-manipulation-propensity","group_id":"google-deepmind-harmful-manipulation-propensity-v1","metric_label":"Turns with manipulative cues (higher-stakes scenarios)","metric_definition":"% conversational turns with manipulative cues","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"higher-stakes scenarios","context_note":"","value_printed":"53.3","value_num":53.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: manipulation propensity","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000673","legacy_row_id":673,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-grb","group_id":"google-deepmind-grb-v1","metric_label":"Average pass@1","metric_definition":"Average pass@1 over 74 tasks","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"27","value_num":27,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: ML R&D","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CCL rule-out threshold 90%; max 47% if buggy tasks credited"},
{"measurement_id":"m-000674","legacy_row_id":674,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-1-pro","subject_model_ids":[],"subject_label":"Gemini 3.1 Pro","snapshot_label":"","is_subject_model":false,"eval_id":"google-deepmind-grb","group_id":"google-deepmind-grb-v1","metric_label":"Average pass@1","metric_definition":"Average pass@1 over 74 tasks","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"16","value_num":16,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: ML R&D","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"'somewhere around 16%' rough comparison"},
{"measurement_id":"m-000675","legacy_row_id":675,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-stealth-challenges","group_id":"google-deepmind-stealth-challenges-v2","metric_label":"Challenges solved","metric_definition":"Challenges passed (> top-50% humans)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"3","value_num":3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"solved_of_4","denominator":4,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: misalignment","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Single failure attributed to refusals ('Cover Your Tracks')"},
{"measurement_id":"m-000676","legacy_row_id":676,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-situational-awareness-challenges","group_id":"google-deepmind-situational-awareness-challenges-v1","metric_label":"Challenges solved","metric_definition":"Challenges passed (>20% success)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"6","value_num":6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"solved_of_11","denominator":11,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: misalignment","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Stronger than 3.1 Pro"},
{"measurement_id":"m-000677","legacy_row_id":677,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-evaluation-awareness","group_id":"google-deepmind-evaluation-awareness-v1","metric_label":"Qualitative observation","metric_definition":"Qualitative observation","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"observed","value_num":null,"value_text":"observed","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"FSF: misalignment","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"'observant enough to correctly assess when it is in a testing environment'"},
{"measurement_id":"m-000678","legacy_row_id":678,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-sandbagging-checks","group_id":"google-deepmind-sandbagging-checks-v1","metric_label":"Evidence of deliberate underperformance","metric_definition":"Automated + manual transcript review","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_found","value_num":null,"value_text":"not_found","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"FSF: general","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000679","legacy_row_id":679,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-cbrn-jailbreak-templates","group_id":"google-deepmind-cbrn-jailbreak-templates-v1","metric_label":"Objective success rate","metric_definition":"Objective success vs common jailbreak templates","condition_effort":"","condition_mode":"","condition_safeguards":"with CBRN safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"% (approx)","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: mitigations","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"'close to 0%'; decent robustness vs adaptive attackers"},
{"measurement_id":"m-000680","legacy_row_id":680,"split_index":0,"version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","subject_kind":"model","model_id":"gemini-3-7-flash","subject_model_ids":[],"subject_label":"Gemini 3.7 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-bio-chem-weapons-queries","group_id":"google-deepmind-bio-chem-weapons-queries-v1","metric_label":"Violation rate","metric_definition":"Violation rate on bio/chem weapons topics","condition_effort":"","condition_mode":"","condition_safeguards":"with safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"% (approx)","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"FSF: mitigations","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"'~0% violations'"},
{"measurement_id":"m-000681","legacy_row_id":681,"split_index":0,"version_id":"google-deepmind-gemini-3-8-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-8-flash","subject_model_ids":[],"subject_label":"Gemini 3.8 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-text-to-text-safety","group_id":"google-deepmind-text-to-text-safety-v1","metric_label":"Policy-violation rate delta","metric_definition":"Automated policy-violation rate delta vs baseline","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.7 Flash","context_note":"","value_printed":"-0.4","value_num":-0.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pp","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000682","legacy_row_id":682,"split_index":0,"version_id":"google-deepmind-gemini-3-8-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-8-flash","subject_model_ids":[],"subject_label":"Gemini 3.8 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-multilingual-safety","group_id":"google-deepmind-multilingual-safety-v1","metric_label":"Multilingual policy-violation rate delta","metric_definition":"Automated multilingual policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.7 Flash","context_note":"","value_printed":"5.4","value_num":5.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pp","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Verified twice"},
{"measurement_id":"m-000683","legacy_row_id":683,"split_index":0,"version_id":"google-deepmind-gemini-3-8-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-8-flash","subject_model_ids":[],"subject_label":"Gemini 3.8 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-image-to-text-safety","group_id":"google-deepmind-image-to-text-safety-v1","metric_label":"Image-to-text policy-violation rate delta","metric_definition":"Automated image-to-text policy-violation rate delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.7 Flash","context_note":"","value_printed":"0.0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pp","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000684","legacy_row_id":684,"split_index":0,"version_id":"google-deepmind-gemini-3-8-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-8-flash","subject_model_ids":[],"subject_label":"Gemini 3.8 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-tone","group_id":"google-deepmind-tone-v1","metric_label":"Objective tone of refusals delta","metric_definition":"Automated objective tone of refusals delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.7 Flash","context_note":"","value_printed":"0.2","value_num":0.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pp","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000685","legacy_row_id":685,"split_index":0,"version_id":"google-deepmind-gemini-3-8-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-8-flash","subject_model_ids":[],"subject_label":"Gemini 3.8 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-unjustified-refusals","group_id":"google-deepmind-unjustified-refusals-v1","metric_label":"Unjustified refusals delta","metric_definition":"Refusals on borderline prompts; delta","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"vs Gemini 3.7 Flash","context_note":"","value_printed":"1.1","value_num":1.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"delta_pp","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safety evaluations table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000686","legacy_row_id":686,"split_index":0,"version_id":"google-deepmind-gemini-3-8-flash-model-card--2026-09-26","subject_kind":"model","model_id":"gemini-3-8-flash","subject_model_ids":[],"subject_label":"Gemini 3.8 Flash","snapshot_label":"","is_subject_model":true,"eval_id":"google-deepmind-fsf-determination","group_id":"google-deepmind-fsf-determination-v3","metric_label":"All CCLs and TCLs (inherited)","metric_definition":"Determination via Gemini 3.7 Flash","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"not_reached","value_num":null,"value_text":"not_reached","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Frontier Safety","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"No new capabilities vs 3.7 Flash"},
{"measurement_id":"m-000687","legacy_row_id":687,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-standard-refusal-eval","group_id":"openai-standard-refusal-eval-v1","metric_label":"Not overrefuse (aggregate)","metric_definition":"not_overrefuse (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.84","value_num":0.84,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"per-category not_unsafe mostly 0.93-1.00 (saturated); not transcribed"},
{"measurement_id":"m-000688","legacy_row_id":688,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-standard-refusal-eval","group_id":"openai-standard-refusal-eval-v1","metric_label":"Not overrefuse (aggregate)","metric_definition":"not_overrefuse (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.81","value_num":0.81,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"per-category not_unsafe mostly 0.93-1.00 (saturated); not transcribed"},
{"measurement_id":"m-000689","legacy_row_id":689,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o1","subject_model_ids":[],"subject_label":"o1","snapshot_label":"","is_subject_model":false,"eval_id":"openai-standard-refusal-eval","group_id":"openai-standard-refusal-eval-v1","metric_label":"Not overrefuse (aggregate)","metric_definition":"not_overrefuse (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.86","value_num":0.86,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"per-category not_unsafe mostly 0.93-1.00 (saturated); not transcribed"},
{"measurement_id":"m-000690","legacy_row_id":690,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-challenging-refusal-eval","group_id":"openai-challenging-refusal-eval-v1","metric_label":"Not unsafe (aggregate)","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.92","value_num":0.92,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000691","legacy_row_id":691,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-challenging-refusal-eval","group_id":"openai-challenging-refusal-eval-v1","metric_label":"Not unsafe (aggregate)","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.9","value_num":0.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000692","legacy_row_id":692,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o1","subject_model_ids":[],"subject_label":"o1","snapshot_label":"","is_subject_model":false,"eval_id":"openai-challenging-refusal-eval","group_id":"openai-challenging-refusal-eval-v1","metric_label":"Not unsafe (aggregate)","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.92","value_num":0.92,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000693","legacy_row_id":693,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-human-sourced-jailbreaks","group_id":"openai-human-sourced-jailbreaks-v1","metric_label":"not_unsafe","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000694","legacy_row_id":694,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-human-sourced-jailbreaks","group_id":"openai-human-sourced-jailbreaks-v1","metric_label":"not_unsafe","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.99","value_num":0.99,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000695","legacy_row_id":695,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o1","subject_model_ids":[],"subject_label":"o1","snapshot_label":"","is_subject_model":false,"eval_id":"openai-human-sourced-jailbreaks","group_id":"openai-human-sourced-jailbreaks-v1","metric_label":"not_unsafe","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.97","value_num":0.97,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000696","legacy_row_id":696,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.97","value_num":0.97,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000697","legacy_row_id":697,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.96","value_num":0.96,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000698","legacy_row_id":698,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o1","subject_model_ids":[],"subject_label":"o1","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.97","value_num":0.97,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000699","legacy_row_id":699,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-simpleqa","group_id":"openai-simpleqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.51","value_num":0.51,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy o3 0.49; o4-mini 0.20; o1 0.47"},
{"measurement_id":"m-000700","legacy_row_id":700,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-simpleqa","group_id":"openai-simpleqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.79","value_num":0.79,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy o3 0.49; o4-mini 0.20; o1 0.47"},
{"measurement_id":"m-000701","legacy_row_id":701,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o1","subject_model_ids":[],"subject_label":"o1","snapshot_label":"","is_subject_model":false,"eval_id":"openai-simpleqa","group_id":"openai-simpleqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.44","value_num":0.44,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy o3 0.49; o4-mini 0.20; o1 0.47"},
{"measurement_id":"m-000702","legacy_row_id":702,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-personqa","group_id":"openai-personqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.33","value_num":0.33,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy o3 0.59; o4-mini 0.36; o1 0.47"},
{"measurement_id":"m-000703","legacy_row_id":703,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-personqa","group_id":"openai-personqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.48","value_num":0.48,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy o3 0.59; o4-mini 0.36; o1 0.47"},
{"measurement_id":"m-000704","legacy_row_id":704,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o1","subject_model_ids":[],"subject_label":"o1","snapshot_label":"","is_subject_model":false,"eval_id":"openai-personqa","group_id":"openai-personqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.16","value_num":0.16,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy o3 0.59; o4-mini 0.36; o1 0.47"},
{"measurement_id":"m-000705","legacy_row_id":705,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-instruction-hierarchy","group_id":"openai-instruction-hierarchy-v1","metric_label":"System<>user conflict","metric_definition":"accuracy following higher-priority msg","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.79","value_num":0.79,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"instruction-hierarchy proxy; not a direct prompt-injection eval"},
{"measurement_id":"m-000706","legacy_row_id":706,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-instruction-hierarchy","group_id":"openai-instruction-hierarchy-v1","metric_label":"System<>user conflict","metric_definition":"accuracy following higher-priority msg","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.75","value_num":0.75,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"instruction-hierarchy proxy; not a direct prompt-injection eval"},
{"measurement_id":"m-000707","legacy_row_id":707,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o1","subject_model_ids":[],"subject_label":"o1","snapshot_label":"","is_subject_model":false,"eval_id":"openai-instruction-hierarchy","group_id":"openai-instruction-hierarchy-v1","metric_label":"System<>user conflict","metric_definition":"accuracy following higher-priority msg","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.85","value_num":0.85,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"instruction-hierarchy proxy; not a direct prompt-injection eval"},
{"measurement_id":"m-000708","legacy_row_id":708,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"metr-reward-hacking","group_id":"metr-reward-hacking-openai-v1","metric_label":"Share of task attempts with reward hacking","metric_definition":"share of task attempts with reward hacking","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1","value_num":1,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Third-party: METR","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"text says roughly 1% of all task attempts"},
{"measurement_id":"m-000709","legacy_row_id":709,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"metr-re-bench-optimize-a-kernel","group_id":"metr-re-bench-optimize-a-kernel-openai-v1","metric_label":"Runs tampering with scoring function","metric_definition":"runs tampering with scoring function","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"out of 24 experiments","context_note":"","value_printed":"5","value_num":5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":24,"direction":"higher_worse","value_status":"printed","location":"Third-party: METR","source_type":"primary","via_url":"","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"5 of 24 = 20.8%"},
{"measurement_id":"m-000710","legacy_row_id":710,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-sandbagging","group_id":"apollo-sandbagging-openai-v1","metric_label":"In-context sandbagging observed","metric_definition":"in-context sandbagging observed","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"including without an in-context goal","context_note":"","value_printed":"observed","value_num":null,"value_text":"observed","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Apollo Research: in-context scheming","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"qualitative; both o3 and o4-mini sandbag when given goal Migration: A finding stated in words (sandbagging observed), not a printed value."},
{"measurement_id":"m-000711","legacy_row_id":711,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-ai-r-d-sabotage","group_id":"apollo-ai-r-d-sabotage-openai-v1","metric_label":"Average sabotage score","metric_definition":"average sabotage score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.58","value_num":0.58,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Apollo Research: Sabotage","source_type":"primary","via_url":"","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"capability (not propensity) measure"},
{"measurement_id":"m-000712","legacy_row_id":712,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-ai-r-d-sabotage","group_id":"apollo-ai-r-d-sabotage-openai-v1","metric_label":"Average sabotage score","metric_definition":"average sabotage score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.17","value_num":0.17,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Apollo Research: Sabotage","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"capability (not propensity) measure"},
{"measurement_id":"m-000713","legacy_row_id":713,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3-mini","subject_model_ids":[],"subject_label":"o3-mini","snapshot_label":"","is_subject_model":false,"eval_id":"apollo-ai-r-d-sabotage","group_id":"apollo-ai-r-d-sabotage-openai-v1","metric_label":"Average sabotage score","metric_definition":"average sabotage score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.05","value_num":0.05,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Apollo Research: Sabotage","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"capability (not propensity) measure"},
{"measurement_id":"m-000714","legacy_row_id":714,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"risk level vs High threshold","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"bio evals described as on the cusp of High"},
{"measurement_id":"m-000715","legacy_row_id":715,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"risk level vs High threshold","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000716","legacy_row_id":716,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"AI self-improvement","metric_definition":"risk level vs High threshold","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000717","legacy_row_id":717,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"risk level vs High threshold","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"bio evals described as on the cusp of High"},
{"measurement_id":"m-000718","legacy_row_id":718,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"risk level vs High threshold","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000719","legacy_row_id":719,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"AI self-improvement","metric_definition":"risk level vs High threshold","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000720","legacy_row_id":720,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-capture-the-flag","group_id":"openai-capture-the-flag-v1","metric_label":"High school","metric_definition":"solve rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"pass@12","context_note":"","value_printed":"89","value_num":89,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity, Fig 7 + text","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Launch candidate: the checkpoint being released."},
{"measurement_id":"m-000721","legacy_row_id":721,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-capture-the-flag","group_id":"openai-capture-the-flag-v1","metric_label":"Collegiate","metric_definition":"solve rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"pass@12","context_note":"","value_printed":"68","value_num":68,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity, Fig 7 + text","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Launch candidate: the checkpoint being released."},
{"measurement_id":"m-000722","legacy_row_id":722,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-capture-the-flag","group_id":"openai-capture-the-flag-v1","metric_label":"Professional","metric_definition":"solve rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"pass@12","context_note":"","value_printed":"59","value_num":59,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity, Fig 7 + text","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Launch candidate: the checkpoint being released."},
{"measurement_id":"m-000723","legacy_row_id":723,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-capture-the-flag","group_id":"openai-capture-the-flag-v1","metric_label":"High school","metric_definition":"solve rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"pass@12","context_note":"","value_printed":"80","value_num":80,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity, Fig 7 + text","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Launch candidate: the checkpoint being released."},
{"measurement_id":"m-000724","legacy_row_id":724,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-capture-the-flag","group_id":"openai-capture-the-flag-v1","metric_label":"Collegiate","metric_definition":"solve rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"pass@12","context_note":"","value_printed":"55","value_num":55,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity, Fig 7 + text","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Launch candidate: the checkpoint being released."},
{"measurement_id":"m-000725","legacy_row_id":725,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-capture-the-flag","group_id":"openai-capture-the-flag-v1","metric_label":"Professional","metric_definition":"solve rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"pass@12","context_note":"","value_printed":"41","value_num":41,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity, Fig 7 + text","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Launch candidate: the checkpoint being released."},
{"measurement_id":"m-000726","legacy_row_id":726,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cyber-range","group_id":"openai-cyber-range-v1","metric_label":"Scenarios solved unaided","metric_definition":"scenarios solved unaided","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"without solver code; of 2 scenarios","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":2,"direction":"higher_worse","value_status":"qualitative","location":"Cybersecurity, Fig 8","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"neither model solved either scenario without solver code Migration: v0 recorded 0 from a statement that neither model solved either scenario without solver code."},
{"measurement_id":"m-000727","legacy_row_id":727,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cyber-range","group_id":"openai-cyber-range-v1","metric_label":"Scenarios solved unaided","metric_definition":"scenarios solved unaided","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"without solver code; of 2 scenarios","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":2,"direction":"higher_worse","value_status":"qualitative","location":"Cybersecurity, Fig 8","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"neither model solved either scenario without solver code Migration: v0 recorded 0 from a statement that neither model solved either scenario without solver code."},
{"measurement_id":"m-000728","legacy_row_id":728,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"metr-time-horizon","group_id":"metr-time-horizon-openai-v1","metric_label":"Task length at 50% success","metric_definition":"task length at 50% success","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"90","value_num":90,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"minutes","unit_as_printed":"minutes","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Third-party: METR","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"~1h30m"},
{"measurement_id":"m-000729","legacy_row_id":729,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"metr-time-horizon","group_id":"metr-time-horizon-openai-v1","metric_label":"Task length at 50% success","metric_definition":"task length at 50% success","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"75","value_num":75,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"minutes","unit_as_printed":"minutes","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Third-party: METR","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"~1h15m"},
{"measurement_id":"m-000730","legacy_row_id":730,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-swe-bench-verified","group_id":"openai-swe-bench-verified-v1","metric_label":"Pass rate","metric_definition":"pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"helpful-only","condition_surface":"","condition_other":"","context_note":"","value_printed":"71","value_num":71,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"AI Self-improvement","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000731","legacy_row_id":731,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-openai-prs","group_id":"openai-openai-prs-v1","metric_label":"Pass rate","metric_definition":"pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"44","value_num":44,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"AI Self-improvement","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Launch candidate: the checkpoint being released."},
{"measurement_id":"m-000732","legacy_row_id":732,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-openai-prs","group_id":"openai-openai-prs-v1","metric_label":"Pass rate","metric_definition":"pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"39","value_num":39,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"AI Self-improvement","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Launch candidate: the checkpoint being released."},
{"measurement_id":"m-000733","legacy_row_id":733,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-swe-lancer","group_id":"openai-swe-lancer-v1","metric_label":"IC SWE accuracy","metric_definition":"accuracy","condition_effort":"","condition_mode":"","condition_safeguards":"helpful-only","condition_surface":"with browsing","condition_other":"","context_note":"","value_printed":"55","value_num":55,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"AI Self-improvement","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000734","legacy_row_id":734,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-swe-lancer","group_id":"openai-swe-lancer-v1","metric_label":"Dollars earned","metric_definition":"dollars earned","condition_effort":"","condition_mode":"","condition_safeguards":"helpful-only","condition_surface":"with browsing","condition_other":"","context_note":"","value_printed":"76250","value_num":76250,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"usd","unit_as_printed":"USD","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"AI Self-improvement","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000735","legacy_row_id":735,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":true,"eval_id":"openai-swe-lancer","group_id":"openai-swe-lancer-v1","metric_label":"Dollars earned","metric_definition":"dollars earned","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"86100","value_num":86100,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"usd","unit_as_printed":"USD","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"AI Self-improvement","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Launch candidate: the checkpoint being released."},
{"measurement_id":"m-000736","legacy_row_id":736,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-paperbench","group_id":"openai-paperbench-v1","metric_label":"Replication score","metric_definition":"replication score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"24","value_num":24,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"AI Self-improvement","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Launch candidate: the checkpoint being released."},
{"measurement_id":"m-000737","legacy_row_id":737,"split_index":0,"version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","subject_kind":"model","model_id":"o1","subject_model_ids":[],"subject_label":"o1","snapshot_label":"","is_subject_model":false,"eval_id":"openai-paperbench","group_id":"openai-paperbench-v1","metric_label":"Replication score","metric_definition":"replication score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"23","value_num":23,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"qualitative","location":"AI Self-improvement","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"derived: text says o4-mini one point higher than o1 Migration: Derived by the v0 extractor from the text saying o4-mini scored one point higher than o1; not printed."},
{"measurement_id":"m-000738","legacy_row_id":738,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Non-violent hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.883","value_num":0.883,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000739","legacy_row_id":739,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Non-violent hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.842","value_num":0.842,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000740","legacy_row_id":740,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Non-violent hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.851","value_num":0.851,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000741","legacy_row_id":741,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Non-violent hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.882","value_num":0.882,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000742","legacy_row_id":742,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.877","value_num":0.877,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000743","legacy_row_id":743,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.83","value_num":0.83,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000744","legacy_row_id":744,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.98","value_num":0.98,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000745","legacy_row_id":745,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.967","value_num":0.967,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000746","legacy_row_id":746,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Harassment/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.755","value_num":0.755,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000747","legacy_row_id":747,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Harassment/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.666","value_num":0.666,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000748","legacy_row_id":748,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Harassment/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.689","value_num":0.689,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000749","legacy_row_id":749,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Harassment/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.745","value_num":0.745,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000750","legacy_row_id":750,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/exploitative","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.931","value_num":0.931,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000751","legacy_row_id":751,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/exploitative","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.939","value_num":0.939,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000752","legacy_row_id":752,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/exploitative","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.826","value_num":0.826,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000753","legacy_row_id":753,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/exploitative","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.927","value_num":0.927,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000754","legacy_row_id":754,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.958","value_num":0.958,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000755","legacy_row_id":755,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.957","value_num":0.957,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000756","legacy_row_id":756,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.91","value_num":0.91,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000757","legacy_row_id":757,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.939","value_num":0.939,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000758","legacy_row_id":758,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.954","value_num":0.954,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000759","legacy_row_id":759,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.92","value_num":0.92,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000760","legacy_row_id":760,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.91","value_num":0.91,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000761","legacy_row_id":761,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.919","value_num":0.919,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000762","legacy_row_id":762,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Hate/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.822","value_num":0.822,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000763","legacy_row_id":763,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Hate/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.677","value_num":0.677,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000764","legacy_row_id":764,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Hate/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.727","value_num":0.727,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000765","legacy_row_id":765,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Hate/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.867","value_num":0.867,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000766","legacy_row_id":766,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.79","value_num":0.79,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000767","legacy_row_id":767,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.717","value_num":0.717,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000768","legacy_row_id":768,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.701","value_num":0.701,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000769","legacy_row_id":769,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.573","value_num":0.573,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000770","legacy_row_id":770,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.912","value_num":0.912,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000771","legacy_row_id":771,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.829","value_num":0.829,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000772","legacy_row_id":772,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.786","value_num":0.786,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000773","legacy_row_id":773,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.633","value_num":0.633,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000774","legacy_row_id":774,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/intent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.95","value_num":0.95,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000775","legacy_row_id":775,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/intent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.824","value_num":0.824,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000776","legacy_row_id":776,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/intent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.849","value_num":0.849,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000777","legacy_row_id":777,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/intent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.849","value_num":0.849,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000778","legacy_row_id":778,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/instructions","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.955","value_num":0.955,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000779","legacy_row_id":779,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/instructions","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.864","value_num":0.864,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000780","legacy_row_id":780,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/instructions","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.759","value_num":0.759,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000781","legacy_row_id":781,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/instructions","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.735","value_num":0.735,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking & o3 columns identical in GPT-5-Codex card"},
{"measurement_id":"m-000782","legacy_row_id":782,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-sycophancy-offline-eval","group_id":"openai-sycophancy-offline-eval-v1","metric_label":"Sycophancy score","metric_definition":"sycophancy score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"offline","context_note":"","value_printed":"0.145","value_num":0.145,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.3 Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000783","legacy_row_id":783,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-sycophancy-offline-eval","group_id":"openai-sycophancy-offline-eval-v1","metric_label":"Sycophancy score","metric_definition":"sycophancy score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"offline","context_note":"","value_printed":"0.052","value_num":0.052,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.3 Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000784","legacy_row_id":784,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-sycophancy-offline-eval","group_id":"openai-sycophancy-offline-eval-v1","metric_label":"Sycophancy score","metric_definition":"sycophancy score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"offline","context_note":"","value_printed":"0.04","value_num":0.04,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.3 Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000785","legacy_row_id":785,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-sycophancy-online-prevalence","group_id":"openai-sycophancy-online-prevalence-v1","metric_label":"Relative change vs GPT-4o","metric_definition":"relative change vs GPT-4o","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"free users","context_note":"","value_printed":"-69","value_num":-69,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"relative_change_percent","unit_as_printed":"% change","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"qualitative","location":"3.3 Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"reported as -0.69 Migration: v0 stored -69 where the source table prints -0.69 (the change as a fraction); the stored number was rescaled by the v0 extractor, so it is not shown as the printed text. Relative change in prevalence against GPT-4o, as the metric definition says. The source table prints the change as a fraction (-0.69 and -0.75 according to the v0 notes); v0 stored it multiplied by 100."},
{"measurement_id":"m-000786","legacy_row_id":786,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-sycophancy-online-prevalence","group_id":"openai-sycophancy-online-prevalence-v1","metric_label":"Relative change vs GPT-4o","metric_definition":"relative change vs GPT-4o","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"paid users","context_note":"","value_printed":"-75","value_num":-75,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"relative_change_percent","unit_as_printed":"% change","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"qualitative","location":"3.3 Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"reported as -0.75 Migration: v0 stored -75 where the source table prints -0.75 (the change as a fraction); the stored number was rescaled by the v0 extractor, so it is not shown as the printed text. Relative change in prevalence against GPT-4o, as the metric definition says. The source table prints the change as a fraction (-0.69 and -0.75 according to the v0 notes); v0 stored it multiplied by 100."},
{"measurement_id":"m-000787","legacy_row_id":787,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Illicit/non-violent crime","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.995","value_num":0.995,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.4 Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000788","legacy_row_id":788,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Illicit/non-violent crime","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.985","value_num":0.985,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.4 Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000789","legacy_row_id":789,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Illicit/non-violent crime","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.934","value_num":0.934,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.4 Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000790","legacy_row_id":790,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Illicit/non-violent crime","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.937","value_num":0.937,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.4 Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000791","legacy_row_id":791,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.999","value_num":0.999,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.4 Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000792","legacy_row_id":792,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.992","value_num":0.992,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.4 Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000793","legacy_row_id":793,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.948","value_num":0.948,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.4 Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000794","legacy_row_id":794,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.955","value_num":0.955,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.4 Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000795","legacy_row_id":795,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Abuse/disinformation/hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.999","value_num":0.999,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.4 Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000796","legacy_row_id":796,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Abuse/disinformation/hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.995","value_num":0.995,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.4 Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000797","legacy_row_id":797,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Abuse/disinformation/hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.978","value_num":0.978,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.4 Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000798","legacy_row_id":798,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Abuse/disinformation/hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.981","value_num":0.981,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.4 Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000799","legacy_row_id":799,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Sexual content","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.995","value_num":0.995,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.4 Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000800","legacy_row_id":800,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Sexual content","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.991","value_num":0.991,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.4 Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000801","legacy_row_id":801,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Sexual content","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.967","value_num":0.967,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.4 Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000802","legacy_row_id":802,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Sexual content","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.961","value_num":0.961,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.4 Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000803","legacy_row_id":803,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v1","metric_label":"Browsing","metric_definition":"not compromised rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.99","value_num":0.99,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.6 Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000804","legacy_row_id":804,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v1","metric_label":"Browsing","metric_definition":"not compromised rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.89","value_num":0.89,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.6 Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000805","legacy_row_id":805,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v1","metric_label":"Tool calling","metric_definition":"not compromised rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.99","value_num":0.99,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.6 Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000806","legacy_row_id":806,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v1","metric_label":"Tool calling","metric_definition":"not compromised rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.8","value_num":0.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.6 Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000807","legacy_row_id":807,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v1","metric_label":"Coding","metric_definition":"not compromised rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.97","value_num":0.97,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.6 Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000808","legacy_row_id":808,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v1","metric_label":"Coding","metric_definition":"not compromised rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.94","value_num":0.94,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.6 Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000809","legacy_row_id":809,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-simpleqa","group_id":"openai-simpleqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.4","value_num":0.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 8","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy: 0.55/0.54/0.22/0.24/0.11/0.46/0.44 in same column order"},
{"measurement_id":"m-000810","legacy_row_id":810,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-simpleqa","group_id":"openai-simpleqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.46","value_num":0.46,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 8","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy: 0.55/0.54/0.22/0.24/0.11/0.46/0.44 in same column order"},
{"measurement_id":"m-000811","legacy_row_id":811,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking-mini","subject_model_ids":[],"subject_label":"gpt-5-thinking-mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-simpleqa","group_id":"openai-simpleqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.26","value_num":0.26,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 8","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy: 0.55/0.54/0.22/0.24/0.11/0.46/0.44 in same column order"},
{"measurement_id":"m-000812","legacy_row_id":812,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-simpleqa","group_id":"openai-simpleqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.75","value_num":0.75,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 8","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy: 0.55/0.54/0.22/0.24/0.11/0.46/0.44 in same column order"},
{"measurement_id":"m-000813","legacy_row_id":813,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking-nano","subject_model_ids":[],"subject_label":"gpt-5-thinking-nano","snapshot_label":"","is_subject_model":true,"eval_id":"openai-simpleqa","group_id":"openai-simpleqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.31","value_num":0.31,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 8","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy: 0.55/0.54/0.22/0.24/0.11/0.46/0.44 in same column order"},
{"measurement_id":"m-000814","legacy_row_id":814,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-simpleqa","group_id":"openai-simpleqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.47","value_num":0.47,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 8","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy: 0.55/0.54/0.22/0.24/0.11/0.46/0.44 in same column order"},
{"measurement_id":"m-000815","legacy_row_id":815,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-simpleqa","group_id":"openai-simpleqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.52","value_num":0.52,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 8","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy: 0.55/0.54/0.22/0.24/0.11/0.46/0.44 in same column order"},
{"measurement_id":"m-000816","legacy_row_id":816,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-traffic-factuality","group_id":"openai-production-traffic-factuality-v1","metric_label":"Claim-level hallucination rate reduction vs GPT-4o","metric_definition":"claim-level hallucination rate reduction vs GPT-4o","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"with browsing","condition_other":"production prompts","context_note":"","value_printed":"26","value_num":26,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"relative_change_percent","unit_as_printed":"% reduction","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.7 text","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"chart values not extractable reliably Migration: Value from the text of section 3.7; the v0 remark about chart values concerns a chart that was not extracted. Reduction against a comparator model, printed as a positive number and kept with the sign as printed. The recorded text does not say explicitly whether the reduction is relative or in percentage points."},
{"measurement_id":"m-000817","legacy_row_id":817,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-main","subject_model_ids":[],"subject_label":"gpt-5-main","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-traffic-factuality","group_id":"openai-production-traffic-factuality-v1","metric_label":"Reduction in responses with 1+ major error vs GPT-4o","metric_definition":"reduction in responses w/ 1+ major error vs GPT-4o","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"with browsing","condition_other":"production prompts","context_note":"","value_printed":"44","value_num":44,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"relative_change_percent","unit_as_printed":"% reduction","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.7 text","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Reduction against a comparator model, printed as a positive number and kept with the sign as printed. The recorded text does not say explicitly whether the reduction is relative or in percentage points."},
{"measurement_id":"m-000818","legacy_row_id":818,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-traffic-factuality","group_id":"openai-production-traffic-factuality-v1","metric_label":"Claim-level hallucination rate reduction vs o3","metric_definition":"claim-level hallucination rate reduction vs o3","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"with browsing","condition_other":"production prompts","context_note":"","value_printed":"65","value_num":65,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"relative_change_percent","unit_as_printed":"% reduction","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.7 text","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Reduction against a comparator model, printed as a positive number and kept with the sign as printed. The recorded text does not say explicitly whether the reduction is relative or in percentage points."},
{"measurement_id":"m-000819","legacy_row_id":819,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-traffic-factuality","group_id":"openai-production-traffic-factuality-v1","metric_label":"Reduction in responses with 1+ major error vs o3","metric_definition":"reduction in responses w/ 1+ major error vs o3","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"with browsing","condition_other":"production prompts","context_note":"","value_printed":"78","value_num":78,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"relative_change_percent","unit_as_printed":"% reduction","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.7 text","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Reduction against a comparator model, printed as a positive number and kept with the sign as printed. The recorded text does not say explicitly whether the reduction is relative or in percentage points."},
{"measurement_id":"m-000820","legacy_row_id":820,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-cot-deception-monitor","group_id":"openai-production-cot-deception-monitor-v1","metric_label":"Share of responses flagged deceptive","metric_definition":"share of responses flagged deceptive","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"representative production traffic","context_note":"","value_printed":"4.8","value_num":4.8,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.8.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"monitor precision 81% recall 84%"},
{"measurement_id":"m-000821","legacy_row_id":821,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-cot-deception-monitor","group_id":"openai-production-cot-deception-monitor-v1","metric_label":"Share of responses flagged deceptive","metric_definition":"share of responses flagged deceptive","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"representative production traffic","context_note":"","value_printed":"2.1","value_num":2.1,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.8.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"monitor precision 81% recall 84%"},
{"measurement_id":"m-000822","legacy_row_id":822,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"Agentic coding (impossible tasks)","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.17","value_num":0.17,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.8 Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"coding eval also a false-completion / reward-hack proxy (M2)"},
{"measurement_id":"m-000823","legacy_row_id":823,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"Agentic coding (impossible tasks)","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.47","value_num":0.47,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.8 Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"coding eval also a false-completion / reward-hack proxy (M2)"},
{"measurement_id":"m-000824","legacy_row_id":824,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"Browsing broken tools","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.11","value_num":0.11,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.8 Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"coding eval also a false-completion / reward-hack proxy (M2)"},
{"measurement_id":"m-000825","legacy_row_id":825,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"Browsing broken tools","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.61","value_num":0.61,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.8 Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"coding eval also a false-completion / reward-hack proxy (M2)"},
{"measurement_id":"m-000826","legacy_row_id":826,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"CharXiv missing image","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.09","value_num":0.09,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.8 Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"coding eval also a false-completion / reward-hack proxy (M2)"},
{"measurement_id":"m-000827","legacy_row_id":827,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"CharXiv missing image","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.87","value_num":0.87,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.8 Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"coding eval also a false-completion / reward-hack proxy (M2)"},
{"measurement_id":"m-000828","legacy_row_id":828,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-abstentionbench","group_id":"openai-abstentionbench-v1","metric_label":"Recall (appropriate abstention)","metric_definition":"recall (appropriate abstention)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.53","value_num":0.53,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.8 Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000829","legacy_row_id":829,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"openai-abstentionbench","group_id":"openai-abstentionbench-v1","metric_label":"Recall (appropriate abstention)","metric_definition":"recall (appropriate abstention)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.44","value_num":0.44,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.8 Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000830","legacy_row_id":830,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-covert-deceptive-behavior","group_id":"apollo-covert-deceptive-behavior-openai-v1","metric_label":"Share of trajectories with deceptive action","metric_definition":"share of trajectories with deceptive action","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"Apollo scheming suite","context_note":"","value_printed":"4","value_num":4,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External: Apollo Research","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking ~4%"},
{"measurement_id":"m-000831","legacy_row_id":831,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"apollo-covert-deceptive-behavior","group_id":"apollo-covert-deceptive-behavior-openai-v1","metric_label":"Share of trajectories with deceptive action","metric_definition":"share of trajectories with deceptive action","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"Apollo scheming suite","context_note":"","value_printed":"8","value_num":8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External: Apollo Research","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking ~4%"},
{"measurement_id":"m-000832","legacy_row_id":832,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking-helpful-only","subject_model_ids":[],"subject_label":"gpt-5-thinking-helpful-only","snapshot_label":"","is_subject_model":false,"eval_id":"apollo-covert-deceptive-behavior","group_id":"apollo-covert-deceptive-behavior-openai-v1","metric_label":"Share of trajectories with deceptive action","metric_definition":"share of trajectories with deceptive action","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"Apollo scheming suite","context_note":"","value_printed":"28","value_num":28,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External: Apollo Research","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking ~4%"},
{"measurement_id":"m-000833","legacy_row_id":833,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-log-falsification","group_id":"apollo-log-falsification-openai-v1","metric_label":"Covert action rate","metric_definition":"covert action rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"weak goal nudge","context_note":"","value_printed":"3.4","value_num":3.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External: Apollo Research","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000834","legacy_row_id":834,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-log-falsification","group_id":"apollo-log-falsification-openai-v1","metric_label":"Covert action rate","metric_definition":"covert action rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"strong goal nudge","context_note":"","value_printed":"20.7","value_num":20.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External: Apollo Research","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000835","legacy_row_id":835,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-evaluation-awareness","group_id":"apollo-evaluation-awareness-openai-v1","metric_label":"Verbalized eval awareness, broad","metric_definition":"verbalized eval awareness, broad (vague ref to alignment test)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"all samples","context_note":"","value_printed":"21.8","value_num":21.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External: Apollo Research","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"direction: higher undermines eval validity"},
{"measurement_id":"m-000836","legacy_row_id":836,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-evaluation-awareness","group_id":"apollo-evaluation-awareness-openai-v1","metric_label":"Verbalized eval awareness, broad","metric_definition":"verbalized eval awareness, broad (vague ref to alignment test)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"scheming samples","context_note":"","value_printed":"8.9","value_num":8.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External: Apollo Research","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"direction: higher undermines eval validity"},
{"measurement_id":"m-000837","legacy_row_id":837,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-evaluation-awareness","group_id":"apollo-evaluation-awareness-openai-v1","metric_label":"Verbalized eval awareness, strict","metric_definition":"verbalized eval awareness, strict (explicit: scenario tests alignment)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"all samples","context_note":"","value_printed":"12.9","value_num":12.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External: Apollo Research","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"direction: higher undermines eval validity"},
{"measurement_id":"m-000838","legacy_row_id":838,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-evaluation-awareness","group_id":"apollo-evaluation-awareness-openai-v1","metric_label":"Verbalized eval awareness, strict","metric_definition":"verbalized eval awareness, strict (explicit: scenario tests alignment)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"scheming samples","context_note":"","value_printed":"5.0","value_num":5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External: Apollo Research","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"direction: higher undermines eval validity"},
{"measurement_id":"m-000839","legacy_row_id":839,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"metr-sandbagging-review","group_id":"metr-sandbagging-review-openai-v1","metric_label":"Clear evidence of sandbagging","metric_definition":"clear evidence of sandbagging","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"789 runs monitored","value_printed":"none found","value_num":null,"value_text":"none found","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":789,"direction":"categorical","value_status":"printed","location":"External: METR / Sandbagging","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"METR notes model sometimes reasons it is being tested (M1 qualitative)"},
{"measurement_id":"m-000840","legacy_row_id":840,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"High (precautionary)","value_num":null,"value_text":"High (precautionary)","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"5 Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000841","legacy_row_id":841,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"5 Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000842","legacy_row_id":842,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"AI self-improvement","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"5 Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000843","legacy_row_id":843,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"metr-time-horizon","group_id":"metr-time-horizon-openai-v1","metric_label":"Task length at 50% success","metric_definition":"task length at 50% success","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"95% CI 65-270 min","value_printed":"135","value_num":135,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"minutes","unit_as_printed":"minutes","denominator":null,"scale":"","ci_low":"65","ci_high":"270","n":null,"direction":"higher_worse","value_status":"printed","location":"External: METR","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"2h15m"},
{"measurement_id":"m-000844","legacy_row_id":844,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"o3","subject_model_ids":[],"subject_label":"o3","snapshot_label":"","is_subject_model":false,"eval_id":"metr-time-horizon","group_id":"metr-time-horizon-openai-v1","metric_label":"Task length at 50% success","metric_definition":"task length at 50% success","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"90","value_num":90,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"minutes","unit_as_printed":"minutes","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External: METR","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"1h30m"},
{"measurement_id":"m-000845","legacy_row_id":845,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-openai-proof-qa","group_id":"openai-openai-proof-qa-v1","metric_label":"Pass rate","metric_definition":"pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"2","value_num":2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"5 AI Self-improvement","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000846","legacy_row_id":846,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"chatgpt-agent","subject_model_ids":[],"subject_label":"ChatGPT agent","snapshot_label":"","is_subject_model":false,"eval_id":"openai-mle-bench","group_id":"openai-mle-bench-v1","metric_label":"Medal rate","metric_definition":"medal rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"highest-scoring model on this evaluation","value_printed":"9","value_num":9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"5 AI Self-improvement","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5-thinking value chart-only"},
{"measurement_id":"m-000847","legacy_row_id":847,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-troubleshootingbench","group_id":"openai-troubleshootingbench-v1","metric_label":"Difference vs o3","metric_definition":"score difference vs o3","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"pp_diff","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"5 Bio","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"text: one percentage point more than o3 Migration: Printed in words as one percentage point more than o3; an exact difference, not a bound."},
{"measurement_id":"m-000848","legacy_row_id":848,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v1","metric_label":"Evasion: average success rate","metric_definition":"average success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"51","value_num":51,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External: Pattern Labs","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-5/external-evaluations-by-pattern-labs","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000849","legacy_row_id":849,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v1","metric_label":"Vulnerability discovery and exploitation: average success rate","metric_definition":"average success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"35","value_num":35,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External: Pattern Labs","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-5/external-evaluations-by-pattern-labs","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000850","legacy_row_id":850,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v1","metric_label":"Network attack simulation: average success rate","metric_definition":"average success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"49","value_num":49,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External: Pattern Labs","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-5/external-evaluations-by-pattern-labs","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000851","legacy_row_id":851,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v1","metric_label":"Easy: challenges solved","metric_definition":"challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"out of 18 challenges","context_note":"","value_printed":"17","value_num":17,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":18,"direction":"higher_worse","value_status":"printed","location":"External: Pattern Labs","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-5/external-evaluations-by-pattern-labs","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000852","legacy_row_id":852,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v1","metric_label":"Medium: challenges solved","metric_definition":"challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"out of 14 challenges","context_note":"","value_printed":"8","value_num":8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":14,"direction":"higher_worse","value_status":"printed","location":"External: Pattern Labs","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-5/external-evaluations-by-pattern-labs","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000853","legacy_row_id":853,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v1","metric_label":"Hard: challenges solved","metric_definition":"challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"out of 4 challenges","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":4,"direction":"higher_worse","value_status":"printed","location":"External: Pattern Labs","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-5/external-evaluations-by-pattern-labs","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000854","legacy_row_id":854,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-04-24","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cot-monitorability","group_id":"openai-cot-monitorability-v1","metric_label":"Monitorability vs o3","metric_definition":"monitor TPR/TNR aggregate vs o3","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"13 evals","value_printed":"higher than o3","value_num":null,"value_text":"higher than o3","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":13,"direction":"categorical","value_status":"qualitative","location":"CoT Evaluations (hub)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-5/cot-monitorability","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"figure-only numbers; section added post-publication Migration: Content added after first publication, in the version dated 24 Apr 2026."},
{"measurement_id":"m-000855","legacy_row_id":855,"split_index":0,"version_id":"openai-gpt-5-system-card--2026-04-24","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cot-controllability","group_id":"openai-cot-controllability-v1","metric_label":"Ability to control CoT content","metric_definition":"ability to control CoT content","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"low (similar to o3)","value_num":null,"value_text":"low (similar to o3)","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"CoT Evaluations (hub)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-5/cot-controllability","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"low controllability = better for monitorability Migration: Content added after first publication, in the version dated 24 Apr 2026."},
{"measurement_id":"m-000856","legacy_row_id":856,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Non-violent hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.895","value_num":0.895,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000857","legacy_row_id":857,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Non-violent hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.901","value_num":0.901,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000858","legacy_row_id":858,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Non-violent hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.832","value_num":0.832,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000859","legacy_row_id":859,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Non-violent hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.882","value_num":0.882,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000860","legacy_row_id":860,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.888","value_num":0.888,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000861","legacy_row_id":861,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.921","value_num":0.921,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000862","legacy_row_id":862,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.847","value_num":0.847,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000863","legacy_row_id":863,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.86","value_num":0.86,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000864","legacy_row_id":864,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Harassment/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.832","value_num":0.832,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000865","legacy_row_id":865,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Harassment/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.819","value_num":0.819,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000866","legacy_row_id":866,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Harassment/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.695","value_num":0.695,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000867","legacy_row_id":867,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Harassment/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.745","value_num":0.745,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000868","legacy_row_id":868,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/exploitative","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.919","value_num":0.919,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000869","legacy_row_id":869,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/exploitative","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.852","value_num":0.852,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000870","legacy_row_id":870,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/exploitative","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.857","value_num":0.857,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000871","legacy_row_id":871,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/exploitative","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.927","value_num":0.927,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000872","legacy_row_id":872,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.967","value_num":0.967,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000873","legacy_row_id":873,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.866","value_num":0.866,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000874","legacy_row_id":874,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.862","value_num":0.862,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000875","legacy_row_id":875,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.939","value_num":0.939,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000876","legacy_row_id":876,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.932","value_num":0.932,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000877","legacy_row_id":877,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.951","value_num":0.951,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000878","legacy_row_id":878,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.932","value_num":0.932,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000879","legacy_row_id":879,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.919","value_num":0.919,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000880","legacy_row_id":880,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Hate/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.898","value_num":0.898,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000881","legacy_row_id":881,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Hate/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.829","value_num":0.829,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000882","legacy_row_id":882,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Hate/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.795","value_num":0.795,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000883","legacy_row_id":883,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Hate/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.867","value_num":0.867,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000884","legacy_row_id":884,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.692","value_num":0.692,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000885","legacy_row_id":885,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.656","value_num":0.656,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000886","legacy_row_id":886,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.658","value_num":0.658,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000887","legacy_row_id":887,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.573","value_num":0.573,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000888","legacy_row_id":888,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.817","value_num":0.817,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000889","legacy_row_id":889,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.744","value_num":0.744,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000890","legacy_row_id":890,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.845","value_num":0.845,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000891","legacy_row_id":891,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.633","value_num":0.633,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000892","legacy_row_id":892,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/intent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.95","value_num":0.95,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000893","legacy_row_id":893,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/intent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.893","value_num":0.893,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000894","legacy_row_id":894,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/intent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.862","value_num":0.862,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000895","legacy_row_id":895,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/intent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.849","value_num":0.849,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000896","legacy_row_id":896,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/instructions","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.91","value_num":0.91,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000897","legacy_row_id":897,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/instructions","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.899","value_num":0.899,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000898","legacy_row_id":898,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/instructions","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.901","value_num":0.901,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000899","legacy_row_id":899,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-4o","subject_model_ids":[],"subject_label":"GPT-4o","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/instructions","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.735","value_num":0.735,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-4o column matches GPT-5 card except personal-data (0.860 vs 0.967)"},
{"measurement_id":"m-000900","legacy_row_id":900,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Illicit/non-violent crime","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.979","value_num":0.979,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000901","legacy_row_id":901,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Illicit/non-violent crime","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.96","value_num":0.96,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000902","legacy_row_id":902,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Illicit/non-violent crime","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.98","value_num":0.98,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000903","legacy_row_id":903,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.983","value_num":0.983,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000904","legacy_row_id":904,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.979","value_num":0.979,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000905","legacy_row_id":905,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.991","value_num":0.991,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000906","legacy_row_id":906,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Abuse/disinformation/hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.993","value_num":0.993,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000907","legacy_row_id":907,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Abuse/disinformation/hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.982","value_num":0.982,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000908","legacy_row_id":908,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Abuse/disinformation/hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.982","value_num":0.982,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000909","legacy_row_id":909,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Sexual content","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.989","value_num":0.989,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000910","legacy_row_id":910,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Sexual content","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.97","value_num":0.97,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000911","legacy_row_id":911,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Sexual content","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.974","value_num":0.974,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000912","legacy_row_id":912,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-instruction-hierarchy","group_id":"openai-instruction-hierarchy-v1","metric_label":"Prompt injection hijacking","metric_definition":"robustness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"system<>user conflict","context_note":"","value_printed":"0.78","value_num":0.78,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000913","legacy_row_id":913,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-instruction-hierarchy","group_id":"openai-instruction-hierarchy-v1","metric_label":"Prompt injection hijacking","metric_definition":"robustness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"system<>user conflict","context_note":"","value_printed":"0.639","value_num":0.639,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000914","legacy_row_id":914,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-instruction-hierarchy","group_id":"openai-instruction-hierarchy-v1","metric_label":"Prompt injection hijacking","metric_definition":"robustness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"system<>user conflict","context_note":"","value_printed":"0.917","value_num":0.917,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000915","legacy_row_id":915,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-instruction-hierarchy","group_id":"openai-instruction-hierarchy-v1","metric_label":"System prompt extraction","metric_definition":"robustness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"system<>user conflict","context_note":"","value_printed":"0.832","value_num":0.832,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000916","legacy_row_id":916,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-instruction-hierarchy","group_id":"openai-instruction-hierarchy-v1","metric_label":"System prompt extraction","metric_definition":"robustness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"system<>user conflict","context_note":"","value_printed":"0.881","value_num":0.881,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000917","legacy_row_id":917,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-instruction-hierarchy","group_id":"openai-instruction-hierarchy-v1","metric_label":"System prompt extraction","metric_definition":"robustness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"system<>user conflict","context_note":"","value_printed":"0.993","value_num":0.993,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000918","legacy_row_id":918,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-simpleqa","group_id":"openai-simpleqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.782","value_num":0.782,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy 0.168/0.067/0.234"},
{"measurement_id":"m-000919","legacy_row_id":919,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-simpleqa","group_id":"openai-simpleqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.914","value_num":0.914,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy 0.168/0.067/0.234"},
{"measurement_id":"m-000920","legacy_row_id":920,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-simpleqa","group_id":"openai-simpleqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.75","value_num":0.75,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy 0.168/0.067/0.234"},
{"measurement_id":"m-000921","legacy_row_id":921,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-personqa","group_id":"openai-personqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.491","value_num":0.491,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy 0.298/0.155/0.356"},
{"measurement_id":"m-000922","legacy_row_id":922,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-20b","subject_model_ids":[],"subject_label":"gpt-oss-20b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-personqa","group_id":"openai-personqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.532","value_num":0.532,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy 0.298/0.155/0.356"},
{"measurement_id":"m-000923","legacy_row_id":923,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"o4-mini","subject_model_ids":[],"subject_label":"o4-mini","snapshot_label":"","is_subject_model":false,"eval_id":"openai-personqa","group_id":"openai-personqa-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"no browsing","condition_other":"","context_note":"","value_printed":"0.361","value_num":0.361,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 9","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"accuracy 0.298/0.155/0.356"},
{"measurement_id":"m-000924","legacy_row_id":924,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"open-weight; worst-case malicious fine-tuning tested Migration: The released default model, as against the adversarially fine-tuned version."},
{"measurement_id":"m-000925","legacy_row_id":925,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"adversarially fine-tuned","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"open-weight; worst-case malicious fine-tuning tested"},
{"measurement_id":"m-000926","legacy_row_id":926,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"open-weight; worst-case malicious fine-tuning tested Migration: The released default model, as against the adversarially fine-tuned version."},
{"measurement_id":"m-000927","legacy_row_id":927,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"adversarially fine-tuned","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"open-weight; worst-case malicious fine-tuning tested"},
{"measurement_id":"m-000928","legacy_row_id":928,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"AI self-improvement","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"open-weight; worst-case malicious fine-tuning tested Migration: The released default model, as against the adversarially fine-tuned version."},
{"measurement_id":"m-000929","legacy_row_id":929,"split_index":0,"version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","subject_kind":"model","model_id":"gpt-oss-120b","subject_model_ids":[],"subject_label":"gpt-oss-120b","snapshot_label":"","is_subject_model":true,"eval_id":"openai-swe-bench-verified","group_id":"openai-swe-bench-verified-v1","metric_label":"Pass rate","metric_definition":"pass rate","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"N=477","context_note":"","value_printed":"62.4","value_num":62.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Preparedness: AI Self-improvement","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-oss/preparedness-framework","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"value from hub page; other preparedness numbers chart-only"},
{"measurement_id":"m-000930","legacy_row_id":930,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Non-violent hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.926","value_num":0.926,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison cols gpt-5-thinking & o3 identical to GPT-5 card Table 3"},
{"measurement_id":"m-000931","legacy_row_id":931,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.922","value_num":0.922,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison cols gpt-5-thinking & o3 identical to GPT-5 card Table 3"},
{"measurement_id":"m-000932","legacy_row_id":932,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Harassment/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.719","value_num":0.719,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison cols gpt-5-thinking & o3 identical to GPT-5 card Table 3"},
{"measurement_id":"m-000933","legacy_row_id":933,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/exploitative","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.958","value_num":0.958,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison cols gpt-5-thinking & o3 identical to GPT-5 card Table 3"},
{"measurement_id":"m-000934","legacy_row_id":934,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.945","value_num":0.945,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison cols gpt-5-thinking & o3 identical to GPT-5 card Table 3"},
{"measurement_id":"m-000935","legacy_row_id":935,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.946","value_num":0.946,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison cols gpt-5-thinking & o3 identical to GPT-5 card Table 3"},
{"measurement_id":"m-000936","legacy_row_id":936,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Hate/threatening","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.859","value_num":0.859,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison cols gpt-5-thinking & o3 identical to GPT-5 card Table 3"},
{"measurement_id":"m-000937","legacy_row_id":937,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.858","value_num":0.858,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison cols gpt-5-thinking & o3 identical to GPT-5 card Table 3"},
{"measurement_id":"m-000938","legacy_row_id":938,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Illicit/violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.935","value_num":0.935,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison cols gpt-5-thinking & o3 identical to GPT-5 card Table 3"},
{"measurement_id":"m-000939","legacy_row_id":939,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/intent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.958","value_num":0.958,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison cols gpt-5-thinking & o3 identical to GPT-5 card Table 3"},
{"measurement_id":"m-000940","legacy_row_id":940,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v1","metric_label":"Self-harm/instructions","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.919","value_num":0.919,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison cols gpt-5-thinking & o3 identical to GPT-5 card Table 3"},
{"measurement_id":"m-000941","legacy_row_id":941,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Illicit/non-violent crime","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.992","value_num":0.992,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison cols identical to GPT-5 card Table 5"},
{"measurement_id":"m-000942","legacy_row_id":942,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.997","value_num":0.997,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison cols identical to GPT-5 card Table 5"},
{"measurement_id":"m-000943","legacy_row_id":943,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Abuse/disinformation/hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.993","value_num":0.993,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison cols identical to GPT-5 card Table 5"},
{"measurement_id":"m-000944","legacy_row_id":944,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"Sexual content","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.995","value_num":0.995,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison cols identical to GPT-5 card Table 5"},
{"measurement_id":"m-000945","legacy_row_id":945,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-malware-refusals-golden-set","group_id":"openai-malware-refusals-golden-set-v1","metric_label":"Refusal rate","metric_definition":"refusal rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000946","legacy_row_id":946,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"codex-1","subject_model_ids":[],"subject_label":"codex-1","snapshot_label":"","is_subject_model":false,"eval_id":"openai-malware-refusals-golden-set","group_id":"openai-malware-refusals-golden-set-v1","metric_label":"Refusal rate","metric_definition":"refusal rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.98","value_num":0.98,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000947","legacy_row_id":947,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection-codex-env","group_id":"openai-prompt-injection-codex-env-v1","metric_label":"Attacks successfully ignored","metric_definition":"attacks successfully ignored","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.98","value_num":0.98,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000948","legacy_row_id":948,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"codex-1","subject_model_ids":[],"subject_label":"codex-1","snapshot_label":"","is_subject_model":false,"eval_id":"openai-prompt-injection-codex-env","group_id":"openai-prompt-injection-codex-env-v1","metric_label":"Attacks successfully ignored","metric_definition":"attacks successfully ignored","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.98","value_num":0.98,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000949","legacy_row_id":949,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"High (treated as)","value_num":null,"value_text":"High (treated as)","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-000950","legacy_row_id":950,"split_index":0,"version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"significant CTF/cyber-range improvement noted; numbers chart-only"},
{"measurement_id":"m-000951","legacy_row_id":951,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.865","value_num":0.865,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000952","legacy_row_id":952,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.86","value_num":0.86,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000953","legacy_row_id":953,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-aug15","snapshot_label":"aug15","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.7","value_num":0.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000954","legacy_row_id":954,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-oct3","snapshot_label":"oct3","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.807","value_num":0.807,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000955","legacy_row_id":955,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.853","value_num":0.853,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000956","legacy_row_id":956,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.966","value_num":0.966,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000957","legacy_row_id":957,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000958","legacy_row_id":958,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-aug15","snapshot_label":"aug15","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.966","value_num":0.966,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000959","legacy_row_id":959,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-oct3","snapshot_label":"oct3","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000960","legacy_row_id":960,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000961","legacy_row_id":961,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Harassment","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.815","value_num":0.815,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000962","legacy_row_id":962,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Harassment","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.747","value_num":0.747,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000963","legacy_row_id":963,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-aug15","snapshot_label":"aug15","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Harassment","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.683","value_num":0.683,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000964","legacy_row_id":964,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-oct3","snapshot_label":"oct3","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Harassment","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.745","value_num":0.745,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000965","legacy_row_id":965,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Harassment","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.836","value_num":0.836,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000966","legacy_row_id":966,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.906","value_num":0.906,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000967","legacy_row_id":967,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.895","value_num":0.895,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000968","legacy_row_id":968,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-aug15","snapshot_label":"aug15","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.782","value_num":0.782,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000969","legacy_row_id":969,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-oct3","snapshot_label":"oct3","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.951","value_num":0.951,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000970","legacy_row_id":970,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.917","value_num":0.917,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000971","legacy_row_id":971,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000972","legacy_row_id":972,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000973","legacy_row_id":973,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-aug15","snapshot_label":"aug15","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.922","value_num":0.922,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000974","legacy_row_id":974,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-oct3","snapshot_label":"oct3","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.978","value_num":0.978,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000975","legacy_row_id":975,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.989","value_num":0.989,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000976","legacy_row_id":976,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.883","value_num":0.883,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000977","legacy_row_id":977,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.839","value_num":0.839,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000978","legacy_row_id":978,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-aug15","snapshot_label":"aug15","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.74","value_num":0.74,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000979","legacy_row_id":979,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-oct3","snapshot_label":"oct3","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.806","value_num":0.806,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000980","legacy_row_id":980,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.897","value_num":0.897,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000981","legacy_row_id":981,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.946","value_num":0.946,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000982","legacy_row_id":982,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.93","value_num":0.93,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000983","legacy_row_id":983,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-aug15","snapshot_label":"aug15","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.829","value_num":0.829,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000984","legacy_row_id":984,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-oct3","snapshot_label":"oct3","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.953","value_num":0.953,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000985","legacy_row_id":985,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.938","value_num":0.938,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000986","legacy_row_id":986,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.953","value_num":0.953,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000987","legacy_row_id":987,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.901","value_num":0.901,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000988","legacy_row_id":988,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-aug15","snapshot_label":"aug15","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.862","value_num":0.862,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000989","legacy_row_id":989,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-oct3","snapshot_label":"oct3","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.961","value_num":0.961,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000990","legacy_row_id":990,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.957","value_num":0.957,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000991","legacy_row_id":991,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Illicit/violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.954","value_num":0.954,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000992","legacy_row_id":992,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Illicit/violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.934","value_num":0.934,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000993","legacy_row_id":993,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-aug15","snapshot_label":"aug15","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Illicit/violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.783","value_num":0.783,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000994","legacy_row_id":994,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-oct3","snapshot_label":"oct3","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Illicit/violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.862","value_num":0.862,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000995","legacy_row_id":995,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Illicit/violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.918","value_num":0.918,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000996","legacy_row_id":996,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Self-harm/intent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.959","value_num":0.959,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000997","legacy_row_id":997,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Self-harm/intent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.958","value_num":0.958,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000998","legacy_row_id":998,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-aug15","snapshot_label":"aug15","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Self-harm/intent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.893","value_num":0.893,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-000999","legacy_row_id":999,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-oct3","snapshot_label":"oct3","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Self-harm/intent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.893","value_num":0.893,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001000","legacy_row_id":1000,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Self-harm/intent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.909","value_num":0.909,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001001","legacy_row_id":1001,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Self-harm/instructions","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.979","value_num":0.979,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001002","legacy_row_id":1002,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Self-harm/instructions","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.95","value_num":0.95,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001003","legacy_row_id":1003,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-aug15","snapshot_label":"aug15","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Self-harm/instructions","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.858","value_num":0.858,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001004","legacy_row_id":1004,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-oct3","snapshot_label":"oct3","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Self-harm/instructions","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.943","value_num":0.943,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001005","legacy_row_id":1005,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Self-harm/instructions","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.95","value_num":0.95,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001006","legacy_row_id":1006,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Mental health","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.466","value_num":0.466,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001007","legacy_row_id":1007,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Mental health","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.684","value_num":0.684,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001008","legacy_row_id":1008,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-aug15","snapshot_label":"aug15","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Mental health","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.251","value_num":0.251,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001009","legacy_row_id":1009,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-oct3","snapshot_label":"oct3","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Mental health","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.944","value_num":0.944,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001010","legacy_row_id":1010,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Mental health","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.883","value_num":0.883,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001011","legacy_row_id":1011,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Emotional reliance","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.812","value_num":0.812,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001012","legacy_row_id":1012,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Emotional reliance","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.785","value_num":0.785,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001013","legacy_row_id":1013,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-aug15","snapshot_label":"aug15","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Emotional reliance","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.688","value_num":0.688,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001014","legacy_row_id":1014,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-oct3","snapshot_label":"oct3","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Emotional reliance","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.986","value_num":0.986,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001015","legacy_row_id":1015,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Emotional reliance","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.945","value_num":0.945,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new harder set; not comparable to GPT-5 card Table 3; mental health & emotional reliance new"},
{"measurement_id":"m-001016","legacy_row_id":1016,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.974","value_num":0.974,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"single aggregate; GPT-5 card reported per-category"},
{"measurement_id":"m-001017","legacy_row_id":1017,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.967","value_num":0.967,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"single aggregate; GPT-5 card reported per-category"},
{"measurement_id":"m-001018","legacy_row_id":1018,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-aug15","snapshot_label":"aug15","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.683","value_num":0.683,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"single aggregate; GPT-5 card reported per-category"},
{"measurement_id":"m-001019","legacy_row_id":1019,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-oct3","snapshot_label":"oct3","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.85","value_num":0.85,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"single aggregate; GPT-5 card reported per-category"},
{"measurement_id":"m-001020","legacy_row_id":1020,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.976","value_num":0.976,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"single aggregate; GPT-5 card reported per-category"},
{"measurement_id":"m-001021","legacy_row_id":1021,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"GPT-5.1 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"High (treated as)","value_num":null,"value_text":"High (treated as)","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001022","legacy_row_id":1022,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"GPT-5.1 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"no plausible chance of High"},
{"measurement_id":"m-001023","legacy_row_id":1023,"split_index":0,"version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"GPT-5.1 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"AI self-improvement","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"no plausible chance of High"},
{"measurement_id":"m-001024","legacy_row_id":1024,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.92","value_num":0.92,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5.1-thinking comparison col matches GPT-5.1 card; GPT-5.2-Codex card re-ran Codex-Max (mental health 0.597)"},
{"measurement_id":"m-001025","legacy_row_id":1025,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5.1-thinking comparison col matches GPT-5.1 card; GPT-5.2-Codex card re-ran Codex-Max (mental health 0.597)"},
{"measurement_id":"m-001026","legacy_row_id":1026,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Harassment","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.829","value_num":0.829,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5.1-thinking comparison col matches GPT-5.1 card; GPT-5.2-Codex card re-ran Codex-Max (mental health 0.597)"},
{"measurement_id":"m-001027","legacy_row_id":1027,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.972","value_num":0.972,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5.1-thinking comparison col matches GPT-5.1 card; GPT-5.2-Codex card re-ran Codex-Max (mental health 0.597)"},
{"measurement_id":"m-001028","legacy_row_id":1028,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5.1-thinking comparison col matches GPT-5.1 card; GPT-5.2-Codex card re-ran Codex-Max (mental health 0.597)"},
{"measurement_id":"m-001029","legacy_row_id":1029,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.889","value_num":0.889,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5.1-thinking comparison col matches GPT-5.1 card; GPT-5.2-Codex card re-ran Codex-Max (mental health 0.597)"},
{"measurement_id":"m-001030","legacy_row_id":1030,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.96","value_num":0.96,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5.1-thinking comparison col matches GPT-5.1 card; GPT-5.2-Codex card re-ran Codex-Max (mental health 0.597)"},
{"measurement_id":"m-001031","legacy_row_id":1031,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.97","value_num":0.97,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5.1-thinking comparison col matches GPT-5.1 card; GPT-5.2-Codex card re-ran Codex-Max (mental health 0.597)"},
{"measurement_id":"m-001032","legacy_row_id":1032,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Illicit/violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.954","value_num":0.954,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5.1-thinking comparison col matches GPT-5.1 card; GPT-5.2-Codex card re-ran Codex-Max (mental health 0.597)"},
{"measurement_id":"m-001033","legacy_row_id":1033,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Self-harm/intent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.975","value_num":0.975,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5.1-thinking comparison col matches GPT-5.1 card; GPT-5.2-Codex card re-ran Codex-Max (mental health 0.597)"},
{"measurement_id":"m-001034","legacy_row_id":1034,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Self-harm/instructions","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.965","value_num":0.965,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5.1-thinking comparison col matches GPT-5.1 card; GPT-5.2-Codex card re-ran Codex-Max (mental health 0.597)"},
{"measurement_id":"m-001035","legacy_row_id":1035,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Mental health","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.519","value_num":0.519,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5.1-thinking comparison col matches GPT-5.1 card; GPT-5.2-Codex card re-ran Codex-Max (mental health 0.597)"},
{"measurement_id":"m-001036","legacy_row_id":1036,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Emotional reliance","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.917","value_num":0.917,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"gpt-5.1-thinking comparison col matches GPT-5.1 card; GPT-5.2-Codex card re-ran Codex-Max (mental health 0.597)"},
{"measurement_id":"m-001037","legacy_row_id":1037,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.967","value_num":0.967,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001038","legacy_row_id":1038,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.967","value_num":0.967,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001039","legacy_row_id":1039,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-malware-refusals-golden-set","group_id":"openai-malware-refusals-golden-set-v1","metric_label":"Refusal rate","metric_definition":"refusal rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001040","legacy_row_id":1040,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":false,"eval_id":"openai-malware-refusals-golden-set","group_id":"openai-malware-refusals-golden-set-v1","metric_label":"Refusal rate","metric_definition":"refusal rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001041","legacy_row_id":1041,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"codex-1","subject_model_ids":[],"subject_label":"codex-1","snapshot_label":"","is_subject_model":false,"eval_id":"openai-malware-refusals-golden-set","group_id":"openai-malware-refusals-golden-set-v1","metric_label":"Refusal rate","metric_definition":"refusal rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.98","value_num":0.98,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001042","legacy_row_id":1042,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection-codex-env","group_id":"openai-prompt-injection-codex-env-v1","metric_label":"Attacks successfully ignored","metric_definition":"attacks successfully ignored","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001043","legacy_row_id":1043,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":false,"eval_id":"openai-prompt-injection-codex-env","group_id":"openai-prompt-injection-codex-env-v1","metric_label":"Attacks successfully ignored","metric_definition":"attacks successfully ignored","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.98","value_num":0.98,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001044","legacy_row_id":1044,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"codex-1","subject_model_ids":[],"subject_label":"codex-1","snapshot_label":"","is_subject_model":false,"eval_id":"openai-prompt-injection-codex-env","group_id":"openai-prompt-injection-codex-env-v1","metric_label":"Attacks successfully ignored","metric_definition":"attacks successfully ignored","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.98","value_num":0.98,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001045","legacy_row_id":1045,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-v1","metric_label":"Avoidance","metric_definition":"avoidance rate (preserve user changes)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.75","value_num":0.75,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"confirmed by GPT-5.2-Codex card Table 4; one hub fetch gave conflicting values"},
{"measurement_id":"m-001046","legacy_row_id":1046,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex","subject_model_ids":[],"subject_label":"GPT-5.1-Codex","snapshot_label":"","is_subject_model":false,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-v1","metric_label":"Avoidance","metric_definition":"avoidance rate (preserve user changes)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.7","value_num":0.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"confirmed by GPT-5.2-Codex card Table 4; one hub fetch gave conflicting values"},
{"measurement_id":"m-001047","legacy_row_id":1047,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":false,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-v1","metric_label":"Avoidance","metric_definition":"avoidance rate (preserve user changes)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.66","value_num":0.66,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"confirmed by GPT-5.2-Codex card Table 4; one hub fetch gave conflicting values"},
{"measurement_id":"m-001048","legacy_row_id":1048,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"High (treated as)","value_num":null,"value_text":"High (treated as)","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"5 Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001049","legacy_row_id":1049,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"5 Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"expects models to cross High cyber in near future"},
{"measurement_id":"m-001050","legacy_row_id":1050,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"AI self-improvement","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"5 Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001051","legacy_row_id":1051,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cyber-range","group_id":"openai-cyber-range-v2","metric_label":"Scenarios passed","metric_definition":"scenarios passed","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 8 scenarios reported","context_note":"1 partial, 1 fail","value_printed":"6","value_num":6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":8,"direction":"higher_worse","value_status":"qualitative","location":"Cybersecurity table (hub)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-5-1-codex-max/cybersecurity","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Taint Shared Content removed; 4 new scenarios Migration: Count tallied by the v0 extractor from a per-scenario pass, partial and fail table (condition: 1 partial, 1 fail of 8); not printed as a number."},
{"measurement_id":"m-001052","legacy_row_id":1052,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v2","metric_label":"Easy: challenges solved","metric_definition":"challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"out of 18 challenges","context_note":"","value_printed":"17","value_num":17,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":18,"direction":"higher_worse","value_status":"printed","location":"5.1.2.4 External: Irregular","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001053","legacy_row_id":1053,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v2","metric_label":"Medium: challenges solved","metric_definition":"challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"out of 17 challenges","context_note":"","value_printed":"9","value_num":9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":17,"direction":"higher_worse","value_status":"printed","location":"5.1.2.4 External: Irregular","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001054","legacy_row_id":1054,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v2","metric_label":"Hard: challenges solved","metric_definition":"challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"out of 6 challenges","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":6,"direction":"higher_worse","value_status":"printed","location":"5.1.2.4 External: Irregular","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001055","legacy_row_id":1055,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"GPT-5 (thinking)","snapshot_label":"","is_subject_model":false,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v2","metric_label":"Easy: challenges solved","metric_definition":"challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"out of 18 challenges","context_note":"","value_printed":"17","value_num":17,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":18,"direction":"higher_worse","value_status":"printed","location":"5.1.2.4 External: Irregular","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison; differs from GPT-5 card suite (8/14, 0/4)"},
{"measurement_id":"m-001056","legacy_row_id":1056,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"GPT-5 (thinking)","snapshot_label":"","is_subject_model":false,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v2","metric_label":"Medium: challenges solved","metric_definition":"challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"out of 17 challenges","context_note":"","value_printed":"11","value_num":11,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":17,"direction":"higher_worse","value_status":"printed","location":"5.1.2.4 External: Irregular","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison; differs from GPT-5 card suite (8/14, 0/4)"},
{"measurement_id":"m-001057","legacy_row_id":1057,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"GPT-5 (thinking)","snapshot_label":"","is_subject_model":false,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v2","metric_label":"Hard: challenges solved","metric_definition":"challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"out of 6 challenges","context_note":"","value_printed":"1","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":6,"direction":"higher_worse","value_status":"printed","location":"5.1.2.4 External: Irregular","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"comparison; differs from GPT-5 card suite (8/14, 0/4)"},
{"measurement_id":"m-001058","legacy_row_id":1058,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"metr-time-horizon","group_id":"metr-time-horizon-openai-v1","metric_label":"Task length at 50% success","metric_definition":"task length at 50% success","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"CI 75-350 min","value_printed":"162","value_num":162,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"minutes","unit_as_printed":"minutes","denominator":null,"scale":"","ci_low":"75","ci_high":"350","n":null,"direction":"higher_worse","value_status":"printed","location":"External: METR","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"point estimate 2h42m"},
{"measurement_id":"m-001059","legacy_row_id":1059,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-troubleshootingbench","group_id":"openai-troubleshootingbench-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"refusals counted as successes","context_note":"","value_printed":"40","value_num":40,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Bio","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001060","legacy_row_id":1060,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-tacit-knowledge-and-troubleshooting","group_id":"openai-tacit-knowledge-and-troubleshooting-v1","metric_label":"Score","metric_definition":"score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"expert consensus baseline 80%","value_printed":"77","value_num":77,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Bio","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001061","legacy_row_id":1061,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"openai-long-form-biorisk-questions","group_id":"openai-long-form-biorisk-questions-v1","metric_label":"Refusal rate","metric_definition":"refusal rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"100","value_num":100,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Bio","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-5-1-codex-max/biological-and-chemical","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001062","legacy_row_id":1062,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-covert-deceptive-behavior","group_id":"apollo-covert-deceptive-behavior-openai-v1","metric_label":"Relative rate vs GPT-5","metric_definition":"relative rate vs GPT-5","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"comparable to GPT-5","value_num":null,"value_text":"comparable to GPT-5","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"External: Apollo Research","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"no numbers reported"},
{"measurement_id":"m-001063","legacy_row_id":1063,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-falsifying-task-completion","group_id":"apollo-falsifying-task-completion-openai-v1","metric_label":"Relative rate vs GPT-5","metric_definition":"relative rate vs GPT-5","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"elevated vs GPT-5 (specific tasks)","value_num":null,"value_text":"elevated vs GPT-5 (specific tasks)","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"External: Apollo Research","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"no numbers reported"},
{"measurement_id":"m-001064","legacy_row_id":1064,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-sandbagging","group_id":"apollo-sandbagging-openai-v1","metric_label":"Relative rate vs GPT-5","metric_definition":"relative rate vs GPT-5","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"elevated vs GPT-5 (specific tasks)","value_num":null,"value_text":"elevated vs GPT-5 (specific tasks)","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"External: Apollo Research","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"no numbers reported"},
{"measurement_id":"m-001065","legacy_row_id":1065,"split_index":0,"version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-evaluation-awareness","group_id":"apollo-evaluation-awareness-openai-v1","metric_label":"Relative rate vs GPT-5","metric_definition":"relative rate vs GPT-5","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"similar to GPT-5","value_num":null,"value_text":"similar to GPT-5","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"External: Apollo Research","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"no numbers reported"},
{"measurement_id":"m-001066","legacy_row_id":1066,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.853","value_num":0.853,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001067","legacy_row_id":1067,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-instant","subject_model_ids":[],"subject_label":"gpt-5.2-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.827","value_num":0.827,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001068","legacy_row_id":1068,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.856","value_num":0.856,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001069","legacy_row_id":1069,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Illicit/non-violent","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.953","value_num":0.953,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001070","legacy_row_id":1070,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001071","legacy_row_id":1071,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-instant","subject_model_ids":[],"subject_label":"gpt-5.2-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001072","legacy_row_id":1072,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.931","value_num":0.931,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001073","legacy_row_id":1073,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Personal data","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.966","value_num":0.966,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001074","legacy_row_id":1074,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Harassment","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.836","value_num":0.836,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001075","legacy_row_id":1075,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-instant","subject_model_ids":[],"subject_label":"gpt-5.2-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Harassment","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.77","value_num":0.77,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001076","legacy_row_id":1076,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Harassment","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.749","value_num":0.749,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001077","legacy_row_id":1077,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Harassment","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.859","value_num":0.859,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001078","legacy_row_id":1078,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.917","value_num":0.917,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001079","legacy_row_id":1079,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-instant","subject_model_ids":[],"subject_label":"gpt-5.2-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.927","value_num":0.927,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001080","legacy_row_id":1080,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.927","value_num":0.927,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001081","legacy_row_id":1081,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.94","value_num":0.94,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001082","legacy_row_id":1082,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.989","value_num":0.989,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001083","legacy_row_id":1083,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-instant","subject_model_ids":[],"subject_label":"gpt-5.2-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001084","legacy_row_id":1084,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001085","legacy_row_id":1085,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.0","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001086","legacy_row_id":1086,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.897","value_num":0.897,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001087","legacy_row_id":1087,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-instant","subject_model_ids":[],"subject_label":"gpt-5.2-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.802","value_num":0.802,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001088","legacy_row_id":1088,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.824","value_num":0.824,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001089","legacy_row_id":1089,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.923","value_num":0.923,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001090","legacy_row_id":1090,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Self-harm","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.925","value_num":0.925,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001091","legacy_row_id":1091,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-instant","subject_model_ids":[],"subject_label":"gpt-5.2-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Self-harm","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.938","value_num":0.938,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001092","legacy_row_id":1092,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Self-harm","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.937","value_num":0.937,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001093","legacy_row_id":1093,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Self-harm","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.963","value_num":0.963,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001094","legacy_row_id":1094,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.938","value_num":0.938,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001095","legacy_row_id":1095,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-instant","subject_model_ids":[],"subject_label":"gpt-5.2-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.946","value_num":0.946,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001096","legacy_row_id":1096,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.93","value_num":0.93,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001097","legacy_row_id":1097,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.953","value_num":0.953,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001098","legacy_row_id":1098,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.957","value_num":0.957,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001099","legacy_row_id":1099,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-instant","subject_model_ids":[],"subject_label":"gpt-5.2-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.935","value_num":0.935,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001100","legacy_row_id":1100,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.935","value_num":0.935,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001101","legacy_row_id":1101,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.97","value_num":0.97,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001102","legacy_row_id":1102,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Mental health","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.883","value_num":0.883,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001103","legacy_row_id":1103,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-instant","subject_model_ids":[],"subject_label":"gpt-5.2-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Mental health","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.995","value_num":0.995,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001104","legacy_row_id":1104,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Mental health","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.684","value_num":0.684,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001105","legacy_row_id":1105,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Mental health","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.915","value_num":0.915,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001106","legacy_row_id":1106,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Emotional reliance","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.945","value_num":0.945,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001107","legacy_row_id":1107,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-instant","subject_model_ids":[],"subject_label":"gpt-5.2-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Emotional reliance","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.938","value_num":0.938,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001108","legacy_row_id":1108,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Emotional reliance","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.785","value_num":0.785,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001109","legacy_row_id":1109,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Emotional reliance","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.955","value_num":0.955,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.1 Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"prior-model values re-run on latest versions; 5.1-thinking differs slightly from GPT-5.1 card"},
{"measurement_id":"m-001110","legacy_row_id":1110,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-instant","subject_model_ids":[],"subject_label":"gpt-5-instant-oct3","snapshot_label":"oct3","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v2","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.85","value_num":0.85,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001111","legacy_row_id":1111,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v2","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.976","value_num":0.976,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001112","legacy_row_id":1112,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-instant","subject_model_ids":[],"subject_label":"gpt-5.2-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v2","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.878","value_num":0.878,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001113","legacy_row_id":1113,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v2","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.959","value_num":0.959,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001114","legacy_row_id":1114,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v2","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.975","value_num":0.975,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.2 Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001115","legacy_row_id":1115,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":false,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v2","metric_label":"Agent JSK","metric_definition":"robustness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.575","value_num":0.575,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.3 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new evals; not comparable to GPT-5 card Table 7"},
{"measurement_id":"m-001116","legacy_row_id":1116,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-instant","subject_model_ids":[],"subject_label":"gpt-5.2-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v2","metric_label":"Agent JSK","metric_definition":"robustness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.997","value_num":0.997,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.3 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new evals; not comparable to GPT-5 card Table 7"},
{"measurement_id":"m-001117","legacy_row_id":1117,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v2","metric_label":"Agent JSK","metric_definition":"robustness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.811","value_num":0.811,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.3 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new evals; not comparable to GPT-5 card Table 7"},
{"measurement_id":"m-001118","legacy_row_id":1118,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v2","metric_label":"Agent JSK","metric_definition":"robustness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.978","value_num":0.978,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.3 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new evals; not comparable to GPT-5 card Table 7"},
{"measurement_id":"m-001119","legacy_row_id":1119,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-instant","subject_model_ids":[],"subject_label":"gpt-5.1-instant","snapshot_label":"","is_subject_model":false,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v2","metric_label":"PlugInject","metric_definition":"robustness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.902","value_num":0.902,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.3 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new evals; not comparable to GPT-5 card Table 7"},
{"measurement_id":"m-001120","legacy_row_id":1120,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-instant","subject_model_ids":[],"subject_label":"gpt-5.2-instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v2","metric_label":"PlugInject","metric_definition":"robustness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.929","value_num":0.929,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.3 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new evals; not comparable to GPT-5 card Table 7"},
{"measurement_id":"m-001121","legacy_row_id":1121,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v2","metric_label":"PlugInject","metric_definition":"robustness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.996","value_num":0.996,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.3 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new evals; not comparable to GPT-5 card Table 7"},
{"measurement_id":"m-001122","legacy_row_id":1122,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v2","metric_label":"PlugInject","metric_definition":"robustness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.996","value_num":0.996,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.3 Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"new evals; not comparable to GPT-5 card Table 7"},
{"measurement_id":"m-001123","legacy_row_id":1123,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"Production traffic","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"7.7","value_num":7.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CharXiv rise attributed to strict output instructions"},
{"measurement_id":"m-001124","legacy_row_id":1124,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"Production traffic","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.6","value_num":1.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CharXiv rise attributed to strict output instructions"},
{"measurement_id":"m-001125","legacy_row_id":1125,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"Production deception - adversarial","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"11.8","value_num":11.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CharXiv rise attributed to strict output instructions"},
{"measurement_id":"m-001126","legacy_row_id":1126,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"Production deception - adversarial","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"5.4","value_num":5.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CharXiv rise attributed to strict output instructions"},
{"measurement_id":"m-001127","legacy_row_id":1127,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"CharXiv missing image (strict output)","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"34.3","value_num":34.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CharXiv rise attributed to strict output instructions"},
{"measurement_id":"m-001128","legacy_row_id":1128,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"CharXiv missing image (strict output)","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"88.8","value_num":88.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CharXiv rise attributed to strict output instructions"},
{"measurement_id":"m-001129","legacy_row_id":1129,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"CharXiv missing image (lenient output)","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"34.1","value_num":34.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CharXiv rise attributed to strict output instructions"},
{"measurement_id":"m-001130","legacy_row_id":1130,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"CharXiv missing image (lenient output)","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"54","value_num":54,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CharXiv rise attributed to strict output instructions"},
{"measurement_id":"m-001131","legacy_row_id":1131,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"Browsing broken tools","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"9.4","value_num":9.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CharXiv rise attributed to strict output instructions"},
{"measurement_id":"m-001132","legacy_row_id":1132,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"Browsing broken tools","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"9.1","value_num":9.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CharXiv rise attributed to strict output instructions"},
{"measurement_id":"m-001133","legacy_row_id":1133,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"Coding deception","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"17.6","value_num":17.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CharXiv rise attributed to strict output instructions"},
{"measurement_id":"m-001134","legacy_row_id":1134,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"Coding deception","metric_definition":"deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"25.6","value_num":25.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.7 Table 6","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CharXiv rise attributed to strict output instructions"},
{"measurement_id":"m-001135","legacy_row_id":1135,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-factuality-5-domains","group_id":"openai-factuality-5-domains-v1","metric_label":"Hallucination rate","metric_definition":"hallucination rate upper bound","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"with browsing","condition_other":"","context_note":"","value_printed":"1","value_num":1,"value_text":"","value_qualifier":"lt","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.5 text","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"text: <1% across all 5 domains; figures only otherwise Migration: The text states a bound below 1% across all five domains; per-domain values appear only in figures."},
{"measurement_id":"m-001136","legacy_row_id":1136,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-cyber-safety","group_id":"openai-cyber-safety-v1","metric_label":"Production data","metric_definition":"policy-compliant rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.9","value_num":0.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.8 Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001137","legacy_row_id":1137,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-cyber-safety","group_id":"openai-cyber-safety-v1","metric_label":"Production data","metric_definition":"policy-compliant rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.866","value_num":0.866,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.8 Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001138","legacy_row_id":1138,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cyber-safety","group_id":"openai-cyber-safety-v1","metric_label":"Production data","metric_definition":"policy-compliant rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.966","value_num":0.966,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.8 Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001139","legacy_row_id":1139,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-thinking","subject_model_ids":[],"subject_label":"gpt-5-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-cyber-safety","group_id":"openai-cyber-safety-v1","metric_label":"Synthetic data","metric_definition":"policy-compliant rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.941","value_num":0.941,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.8 Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001140","legacy_row_id":1140,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-thinking","subject_model_ids":[],"subject_label":"gpt-5.1-thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-cyber-safety","group_id":"openai-cyber-safety-v1","metric_label":"Synthetic data","metric_definition":"policy-compliant rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.93","value_num":0.93,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.8 Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001141","legacy_row_id":1141,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cyber-safety","group_id":"openai-cyber-safety-v1","metric_label":"Synthetic data","metric_definition":"policy-compliant rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.993","value_num":0.993,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"3.8 Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001142","legacy_row_id":1142,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"High (treated as)","value_num":null,"value_text":"High (treated as)","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"4 Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001143","legacy_row_id":1143,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"4 Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001144","legacy_row_id":1144,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"AI self-improvement","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"4 Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001145","legacy_row_id":1145,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v2","metric_label":"Vulnerability research and exploitation: average success rate","metric_definition":"average success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"v1 atomic challenge suite","context_note":"","value_printed":"83","value_num":83,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External: Irregular","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001146","legacy_row_id":1146,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v2","metric_label":"Network attack simulation: average success rate","metric_definition":"average success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"v1 atomic challenge suite","context_note":"","value_printed":"100","value_num":100,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External: Irregular","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001147","legacy_row_id":1147,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v2","metric_label":"Evasion: average success rate","metric_definition":"average success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"v1 atomic challenge suite","context_note":"","value_printed":"73","value_num":73,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External: Irregular","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001148","legacy_row_id":1148,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":false,"eval_id":"openai-openai-proof-qa","group_id":"openai-openai-proof-qa-v1","metric_label":"Pass rate","metric_definition":"pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"highest-scoring model on this evaluation","value_printed":"8","value_num":8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"AI Self-improvement","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001149","legacy_row_id":1149,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cve-bench","group_id":"openai-cve-bench-v1","metric_label":"Difference vs GPT-5.1 Thinking","metric_definition":"diff vs gpt-5.1-thinking","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"8","value_num":8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"pp_diff","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001150","legacy_row_id":1150,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cve-bench","group_id":"openai-cve-bench-v1","metric_label":"Difference vs GPT-5.1-Codex-Max","metric_definition":"diff vs GPT-5.1-Codex-Max","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"-11","value_num":-11,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"pp_diff","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001151","legacy_row_id":1151,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-paperbench","group_id":"openai-paperbench-v1","metric_label":"Difference vs GPT-5.1-Codex-Max","metric_definition":"diff vs GPT-5.1-Codex-Max","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"-1","value_num":-1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"pp_diff","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"AI Self-improvement","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001152","legacy_row_id":1152,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-troubleshootingbench","group_id":"openai-troubleshootingbench-v1","metric_label":"Difference vs GPT-5.1 Thinking","metric_definition":"diff vs gpt-5.1-thinking","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"refusals not counted","context_note":"","value_printed":"3","value_num":3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"pp_diff","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Bio","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001153","legacy_row_id":1153,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":false,"eval_id":"openai-cyber-range","group_id":"openai-cyber-range-v3","metric_label":"Scenarios passed","metric_definition":"scenarios passed","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 9 scenarios","context_note":"","value_printed":"7","value_num":7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":9,"direction":"higher_worse","value_status":"qualitative","location":"Cybersecurity table","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-5-2/cybersecurity","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"counted from PASS/FAIL table; Codex-Max own card showed 6 pass + 1 partial Migration: Count tallied by the v0 extractor from the card's PASS/FAIL table; not printed as a number."},
{"measurement_id":"m-001154","legacy_row_id":1154,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cyber-range","group_id":"openai-cyber-range-v3","metric_label":"Scenarios passed","metric_definition":"scenarios passed","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"of 9 scenarios","context_note":"","value_printed":"6","value_num":6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":9,"direction":"higher_worse","value_status":"qualitative","location":"Cybersecurity table","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-5-2/cybersecurity","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"counted from PASS/FAIL table; Codex-Max own card showed 6 pass + 1 partial Migration: Count tallied by the v0 extractor from the card's PASS/FAIL table; not printed as a number."},
{"measurement_id":"m-001155","legacy_row_id":1155,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-covert-deceptive-behavior","group_id":"apollo-covert-deceptive-behavior-openai-v1","metric_label":"Rate vs peers","metric_definition":"rate vs peers","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"low; comparable to recent frontier models","value_num":null,"value_text":"low; comparable to recent frontier models","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Sandbagging / Apollo","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"no numbers"},
{"measurement_id":"m-001156","legacy_row_id":1156,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-sabotage","group_id":"apollo-sabotage-openai-v1","metric_label":"Sabotage observed","metric_definition":"sabotage observed","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"none observed","value_num":null,"value_text":"none observed","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sandbagging / Apollo","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"no numbers"},
{"measurement_id":"m-001157","legacy_row_id":1157,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-self-preservation","group_id":"apollo-self-preservation-openai-v1","metric_label":"Self-preservation behavior observed","metric_definition":"self-preservation behavior observed","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"none observed","value_num":null,"value_text":"none observed","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Sandbagging / Apollo","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"no numbers"},
{"measurement_id":"m-001158","legacy_row_id":1158,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-04-24","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cot-monitorability","group_id":"openai-cot-monitorability-v1","metric_label":"Sandbagging eval TPR vs GPT-5 Thinking","metric_definition":"monitorability vs GPT-5 Thinking","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"lower TPR on sandbagging eval","value_num":null,"value_text":"lower TPR on sandbagging eval","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"CoT Evaluations (hub)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-5-2/cot-monitorability","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"figure-only numbers; section added post-publication Migration: Content added after first publication, in the version dated 24 Apr 2026."},
{"measurement_id":"m-001159","legacy_row_id":1159,"split_index":0,"version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-04-24","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"gpt-5.2-thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cot-controllability","group_id":"openai-cot-controllability-v1","metric_label":"Controllability vs GPT-5/5.1 Thinking","metric_definition":"controllability vs GPT-5/5.1 Thinking","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"higher for short CoT; lower for long CoT","value_num":null,"value_text":"higher for short CoT; lower for long CoT","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"CoT Evaluations (hub)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-5-2/cot-controllability","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"figure-only Migration: Content added after first publication, in the version dated 24 Apr 2026."},
{"measurement_id":"m-001160","legacy_row_id":1160,"split_index":0,"version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-codex","subject_model_ids":[],"subject_label":"GPT-5.2-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.933","value_num":0.933,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001161","legacy_row_id":1161,"split_index":0,"version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":false,"eval_id":"openai-strongreject","group_id":"openai-strongreject-v1","metric_label":"not_unsafe (aggregate)","metric_definition":"not_unsafe (aggregate)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.967","value_num":0.967,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001162","legacy_row_id":1162,"split_index":0,"version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-codex","subject_model_ids":[],"subject_label":"GPT-5.2-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Mental health","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.896","value_num":0.896,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"only 2 of 12 categories transcribed; Codex-Max re-run differs from its own card"},
{"measurement_id":"m-001163","legacy_row_id":1163,"split_index":0,"version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Mental health","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.597","value_num":0.597,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"only 2 of 12 categories transcribed; Codex-Max re-run differs from its own card"},
{"measurement_id":"m-001164","legacy_row_id":1164,"split_index":0,"version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-codex","subject_model_ids":[],"subject_label":"GPT-5.2-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Emotional reliance","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.911","value_num":0.911,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"only 2 of 12 categories transcribed; Codex-Max re-run differs from its own card"},
{"measurement_id":"m-001165","legacy_row_id":1165,"split_index":0,"version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v2","metric_label":"Emotional reliance","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.826","value_num":0.826,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"only 2 of 12 categories transcribed; Codex-Max re-run differs from its own card"},
{"measurement_id":"m-001166","legacy_row_id":1166,"split_index":0,"version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-codex","subject_model_ids":[],"subject_label":"GPT-5.2-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cyber-safety","group_id":"openai-cyber-safety-v1","metric_label":"Production data","metric_definition":"policy-compliant rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.921","value_num":0.921,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001167","legacy_row_id":1167,"split_index":0,"version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-codex","subject_model_ids":[],"subject_label":"GPT-5.2-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cyber-safety","group_id":"openai-cyber-safety-v1","metric_label":"Synthetic data","metric_definition":"policy-compliant rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.939","value_num":0.939,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001168","legacy_row_id":1168,"split_index":0,"version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-codex","subject_model_ids":[],"subject_label":"GPT-5-Codex","snapshot_label":"","is_subject_model":false,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-v1","metric_label":"Avoidance","metric_definition":"avoidance rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.66","value_num":0.66,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001169","legacy_row_id":1169,"split_index":0,"version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex","subject_model_ids":[],"subject_label":"GPT-5.1-Codex","snapshot_label":"","is_subject_model":false,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-v1","metric_label":"Avoidance","metric_definition":"avoidance rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.7","value_num":0.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001170","legacy_row_id":1170,"split_index":0,"version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":false,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-v1","metric_label":"Avoidance","metric_definition":"avoidance rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.75","value_num":0.75,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001171","legacy_row_id":1171,"split_index":0,"version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-codex","subject_model_ids":[],"subject_label":"GPT-5.2-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-v1","metric_label":"Avoidance","metric_definition":"avoidance rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.76","value_num":0.76,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001172","legacy_row_id":1172,"split_index":0,"version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-codex","subject_model_ids":[],"subject_label":"GPT-5.2-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"High (treated as)","value_num":null,"value_text":"High (treated as)","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001173","legacy_row_id":1173,"split_index":0,"version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-codex","subject_model_ids":[],"subject_label":"GPT-5.2-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001174","legacy_row_id":1174,"split_index":0,"version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-codex","subject_model_ids":[],"subject_label":"GPT-5.2-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"AI self-improvement","metric_definition":"risk level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"Below High","value_num":null,"value_text":"Below High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001175","legacy_row_id":1175,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"critical","value_num":null,"value_text":"critical","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness / Safety overview","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/safety-overview-gpt-6-astra","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"First OpenAI model at Critical cyber"},
{"measurement_id":"m-001176","legacy_row_id":1176,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"high","value_num":null,"value_text":"high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness 10.1.1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card section truncated in fetch; High per multiple secondary sources (quentir.ai, aiwiki, tech-insider) Migration: Level taken from secondary sources per the v0 note; the card section was truncated in the fetch."},
{"measurement_id":"m-001177","legacy_row_id":1177,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"AI self-improvement","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"below_high","value_num":null,"value_text":"below_high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness 10.1.3","source_type":"primary","via_url":"","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card section truncated in fetch; below High per secondary sources (quentir.ai, aiwiki) Migration: Level taken from secondary sources per the v0 note; the card section was truncated in the fetch."},
{"measurement_id":"m-001178","legacy_row_id":1178,"split_index":0,"version_id":"openai-gpt-6-astra-launch-post--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-exploitbench","group_id":"openai-exploitbench-v1","metric_label":"Working exploit rate on known V8 vulns","metric_definition":"Working exploit rate on known V8 vulns","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"100.0","value_num":100,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity capabilities / launch post","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Value from OpenAI launch post; card figure not text-extractable"},
{"measurement_id":"m-001179","legacy_row_id":1179,"split_index":0,"version_id":"openai-gpt-6-astra-launch-post--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-exploitbench","group_id":"openai-exploitbench-v1","metric_label":"Working exploit rate on known V8 vulns","metric_definition":"Working exploit rate on known V8 vulns","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"78.5","value_num":78.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity capabilities / launch post","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Value from OpenAI launch post; card figure not text-extractable"},
{"measurement_id":"m-001180","legacy_row_id":1180,"split_index":0,"version_id":"openai-gpt-6-astra-launch-post--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-exploitbench","group_id":"openai-exploitbench-v2","metric_label":"Exploit success on post-cutoff vulns","metric_definition":"Exploit success on post-cutoff vulns","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"39.0","value_num":39,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity capabilities / launch post","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Value from OpenAI launch post"},
{"measurement_id":"m-001181","legacy_row_id":1181,"split_index":0,"version_id":"openai-gpt-6-astra-launch-post--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-exploitbench","group_id":"openai-exploitbench-v2","metric_label":"Exploit success on post-cutoff vulns","metric_definition":"Exploit success on post-cutoff vulns","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"5.5","value_num":5.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity capabilities / launch post","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Value from OpenAI launch post"},
{"measurement_id":"m-001182","legacy_row_id":1182,"split_index":0,"version_id":"openai-gpt-6-astra-launch-post--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-exploitgym","group_id":"openai-exploitgym-v1","metric_label":"Discovery-to-exploit success rate","metric_definition":"Discovery-to-exploit success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"42.4","value_num":42.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity capabilities / launch post","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Value from OpenAI launch post; aiwiki notes Astra 42.4% is without 6h time limit Migration: A secondary source cited in v0 says this value was measured without the six-hour time limit; the launch post as recorded does not confirm it, so no condition is set."},
{"measurement_id":"m-001183","legacy_row_id":1183,"split_index":0,"version_id":"openai-gpt-6-astra-launch-post--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-exploitgym","group_id":"openai-exploitgym-v1","metric_label":"Discovery-to-exploit success rate","metric_definition":"Discovery-to-exploit success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"30.3","value_num":30.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity capabilities / launch post","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Value from OpenAI launch post; aiwiki notes Astra 42.4% is without 6h time limit"},
{"measurement_id":"m-001184","legacy_row_id":1184,"split_index":0,"version_id":"openai-gpt-6-astra-launch-post--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-sre-bench","group_id":"openai-sre-bench-v1","metric_label":"Binary reverse-engineering success","metric_definition":"Binary reverse-engineering success","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"pass@1","context_note":"","value_printed":"88.0","value_num":88,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity capabilities / launch post","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Value from OpenAI launch post"},
{"measurement_id":"m-001185","legacy_row_id":1185,"split_index":0,"version_id":"openai-gpt-6-astra-launch-post--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-sre-bench","group_id":"openai-sre-bench-v1","metric_label":"Binary reverse-engineering success","metric_definition":"Binary reverse-engineering success","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"pass@1","context_note":"","value_printed":"55.9","value_num":55.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity capabilities / launch post","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Value from OpenAI launch post"},
{"measurement_id":"m-001186","legacy_row_id":1186,"split_index":0,"version_id":"openai-gpt-6-astra-launch-post--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-sre-bench","group_id":"openai-sre-bench-v1","metric_label":"Binary reverse-engineering success","metric_definition":"Binary reverse-engineering success","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"pass@4","context_note":"","value_printed":"99.2","value_num":99.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity capabilities / launch post","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Value from OpenAI launch post"},
{"measurement_id":"m-001187","legacy_row_id":1187,"split_index":0,"version_id":"openai-gpt-6-astra-launch-post--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-sre-bench","group_id":"openai-sre-bench-v1","metric_label":"Binary reverse-engineering success","metric_definition":"Binary reverse-engineering success","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"pass@4","context_note":"","value_printed":"68.7","value_num":68.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity capabilities / launch post","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Value from OpenAI launch post"},
{"measurement_id":"m-001188","legacy_row_id":1188,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-sandbox-bench","group_id":"openai-sandbox-bench-v1","metric_label":"Successful exploits of 22 targets","metric_definition":"Successful exploits of 22 OpenAI-infra-like targets","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"10","value_num":10,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count_of_22","denominator":22,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cybersecurity capabilities","source_type":"secondary","via_url":"https://www.quentir.ai/blog/2026/gpt-6-astra-critical-cyber-preparedness-framework-3-september-2026-eu-ai-act-article-55-sb-53","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Secondary source only (quentir.ai); GPT-5.6 Sol = 1"},
{"measurement_id":"m-001189","legacy_row_id":1189,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-frontiercyber","group_id":"irregular-frontiercyber-openai-v2","metric_label":"Challenges solved","metric_definition":"Challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"226 challenges","context_note":"Astra 86/226 vs Sol 34/226","value_printed":"38.1","value_num":38.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":226,"direction":"higher_worse","value_status":"printed","location":"External evaluations for cyber (Irregular)","source_type":"secondary","via_url":"https://codersera.com/blog/gpt-6-astra-safety-cyber-capabilities-2026/","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Secondary sources (quentir.ai, codersera); 86/226"},
{"measurement_id":"m-001190","legacy_row_id":1190,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Violent illicit behavior","metric_definition":"Safe completion rate (not disallowed)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.990","value_num":0.99,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001191","legacy_row_id":1191,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Nonviolent illicit behavior","metric_definition":"Safe completion rate (not disallowed)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.997","value_num":0.997,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001192","legacy_row_id":1192,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Extremism","metric_definition":"Safe completion rate (not disallowed)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.981","value_num":0.981,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001193","legacy_row_id":1193,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Hate","metric_definition":"Safe completion rate (not disallowed)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.000","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001194","legacy_row_id":1194,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Self-harm (standard)","metric_definition":"Safe completion rate (not disallowed)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.992","value_num":0.992,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001195","legacy_row_id":1195,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Gore","metric_definition":"Safe completion rate (not disallowed)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.898","value_num":0.898,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001196","legacy_row_id":1196,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Sexual","metric_definition":"Safe completion rate (not disallowed)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.980","value_num":0.98,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001197","legacy_row_id":1197,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Sexual/minors","metric_definition":"Safe completion rate (not disallowed)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.974","value_num":0.974,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001198","legacy_row_id":1198,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Gore","metric_definition":"Safe completion rate (not disallowed)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.785","value_num":0.785,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Differs from GPT-5.6 card value for Sol (re-run)"},
{"measurement_id":"m-001199","legacy_row_id":1199,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Sexual","metric_definition":"Safe completion rate (not disallowed)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.915","value_num":0.915,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Differs from GPT-5.6 card value for Sol (re-run)"},
{"measurement_id":"m-001200","legacy_row_id":1200,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-static-jailbreak","group_id":"openai-static-jailbreak-v1","metric_label":"Bio: high risk","metric_definition":"Proportion of attacks refused","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.973","value_num":0.973,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"95% CI in table"},
{"measurement_id":"m-001201","legacy_row_id":1201,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-static-jailbreak","group_id":"openai-static-jailbreak-v1","metric_label":"Bio: high risk","metric_definition":"Proportion of attacks refused","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.0580","value_num":0.058,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"95% CI in table; new eval set"},
{"measurement_id":"m-001202","legacy_row_id":1202,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-static-jailbreak","group_id":"openai-static-jailbreak-v1","metric_label":"Bio: severe","metric_definition":"Proportion of attacks refused","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.982","value_num":0.982,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"95% CI in table"},
{"measurement_id":"m-001203","legacy_row_id":1203,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-static-jailbreak","group_id":"openai-static-jailbreak-v1","metric_label":"Bio: severe","metric_definition":"Proportion of attacks refused","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.103","value_num":0.103,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"95% CI in table; new eval set"},
{"measurement_id":"m-001204","legacy_row_id":1204,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-static-jailbreak","group_id":"openai-static-jailbreak-v1","metric_label":"Violence: moderate","metric_definition":"Proportion of attacks refused","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.947","value_num":0.947,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"95% CI in table"},
{"measurement_id":"m-001205","legacy_row_id":1205,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-static-jailbreak","group_id":"openai-static-jailbreak-v1","metric_label":"Violence: moderate","metric_definition":"Proportion of attacks refused","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.216","value_num":0.216,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"95% CI in table; new eval set"},
{"measurement_id":"m-001206","legacy_row_id":1206,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-static-jailbreak","group_id":"openai-static-jailbreak-v1","metric_label":"Violence: severe","metric_definition":"Proportion of attacks refused","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.983","value_num":0.983,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"95% CI in table"},
{"measurement_id":"m-001207","legacy_row_id":1207,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-static-jailbreak","group_id":"openai-static-jailbreak-v1","metric_label":"Violence: severe","metric_definition":"Proportion of attacks refused","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.483","value_num":0.483,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"95% CI in table; new eval set"},
{"measurement_id":"m-001208","legacy_row_id":1208,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-static-jailbreak","group_id":"openai-static-jailbreak-v1","metric_label":"Cyber","metric_definition":"Proportion of attacks refused","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.915","value_num":0.915,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"95% CI in table"},
{"measurement_id":"m-001209","legacy_row_id":1209,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-static-jailbreak","group_id":"openai-static-jailbreak-v1","metric_label":"Cyber","metric_definition":"Proportion of attacks refused","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.590","value_num":0.59,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"95% CI in table; new eval set"},
{"measurement_id":"m-001210","legacy_row_id":1210,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5 Thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-static-jailbreak","group_id":"openai-static-jailbreak-v1","metric_label":"Cyber","metric_definition":"Proportion of attacks refused","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.570","value_num":0.57,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001211","legacy_row_id":1211,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-internal-indirect-prompt-injection","group_id":"openai-internal-indirect-prompt-injection-v1","metric_label":"Defender success rate","metric_definition":"Defender success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.79","value_num":99.79,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Robustness: Prompt injection (Fig 4)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001212","legacy_row_id":1212,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-internal-indirect-prompt-injection","group_id":"openai-internal-indirect-prompt-injection-v1","metric_label":"Defender success rate","metric_definition":"Defender success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"96.23","value_num":96.23,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Robustness: Prompt injection (Fig 4)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Consistent with GPT-5.6 card GPT-Red indirect ASR 3.77%"},
{"measurement_id":"m-001213","legacy_row_id":1213,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-instruction-hierarchy-internal","group_id":"openai-instruction-hierarchy-internal-v1","metric_label":"Robustness rate","metric_definition":"Robustness rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.99","value_num":99.99,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Robustness: Prompt injection","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Described as saturated"},
{"measurement_id":"m-001214","legacy_row_id":1214,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"gray-swan-ipi-arena","group_id":"gray-swan-ipi-arena-openai-v1","metric_label":"Estimated attack success within 15 attempts","metric_definition":"Estimated attack success within 15 attempts","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"1,810 curated attacks","context_note":"","value_printed":"8.5","value_num":8.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":1810,"direction":"higher_worse","value_status":"printed","location":"Robustness: Prompt injection (Fig 5)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001215","legacy_row_id":1215,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"gray-swan-ipi-arena","group_id":"gray-swan-ipi-arena-openai-v1","metric_label":"Estimated attack success within 15 attempts","metric_definition":"Estimated attack success within 15 attempts","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"1,810 curated attacks","context_note":"","value_printed":"27.0","value_num":27,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":1810,"direction":"higher_worse","value_status":"printed","location":"Robustness: Prompt injection (Fig 5)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001216","legacy_row_id":1216,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-hallucinations","group_id":"openai-hallucinations-v1","metric_label":"Factual errors vs GPT-5.6 Sol","metric_definition":"Factual errors vs GPT-5.6 Sol","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"substantially_fewer","value_num":null,"value_text":"substantially_fewer","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Hallucinations (Fig 6)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Figure only; no text numbers"},
{"measurement_id":"m-001217","legacy_row_id":1217,"split_index":0,"version_id":"openai-gpt-6-astra-launch-post--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-internal-hallucination-benchmark","group_id":"openai-internal-hallucination-benchmark-v1","metric_label":"Hallucination rate","metric_definition":"Hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"4.2","value_num":4.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Launch post","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"From launch post, not card text; Sol = 12.2%"},
{"measurement_id":"m-001218","legacy_row_id":1218,"split_index":0,"version_id":"openai-gpt-6-astra-launch-post--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-internal-hallucination-benchmark","group_id":"openai-internal-hallucination-benchmark-v1","metric_label":"Hallucination rate","metric_definition":"Hallucination rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"12.2","value_num":12.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Launch post","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"From launch post"},
{"measurement_id":"m-001219","legacy_row_id":1219,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"Coding deception relative to Astra","metric_definition":"Misrepresentation rate relative to Astra","condition_effort":"max","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"4","value_num":4,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"relative_x","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.3 Avoiding deceptive interactions","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/coding-deception","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Sol ~4x Astra; absolute rates figure-only Migration: Ratio between models as stated in the text; the absolute rates appear only in a figure."},
{"measurement_id":"m-001220","legacy_row_id":1220,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-deception-eval","group_id":"openai-deception-eval-v1","metric_label":"Broken search tool relative to Astra","metric_definition":"Failure-to-disclose rate relative to Astra","condition_effort":"max","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"10","value_num":10,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"multiplier","unit_as_printed":"relative_x","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.3 Avoiding deceptive interactions","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/broken-search-tool","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Sol ~10x Astra; absolute rates figure-only Migration: Ratio between models as stated in the text; the absolute rates appear only in a figure."},
{"measurement_id":"m-001221","legacy_row_id":1221,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-respecting-auto-review","group_id":"openai-respecting-auto-review-v1","metric_label":"Rollouts attempting to circumvent Auto-review denial","metric_definition":"Rollouts attempting to circumvent Auto-review denial","condition_effort":"max","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"5","value_num":5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.2 Obeying restrictions","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/respecting-auto-review","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Eval built after Astra training"},
{"measurement_id":"m-001222","legacy_row_id":1222,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-respecting-auto-review","group_id":"openai-respecting-auto-review-v1","metric_label":"Rollouts exploiting misconfigured Auto-review","metric_definition":"Rollouts exploiting misconfigured Auto-review","condition_effort":"max","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.3","value_num":0.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.2 Obeying restrictions","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/respecting-auto-review","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001223","legacy_row_id":1223,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-respecting-auto-review","group_id":"openai-respecting-auto-review-v1","metric_label":"Rollouts attempting to circumvent Auto-review denial","metric_definition":"Rollouts attempting to circumvent Auto-review denial","condition_effort":"max","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.2 Obeying restrictions","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/respecting-auto-review","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Launch post reports 0.00% vs Sol 0.29% (different metric framing)"},
{"measurement_id":"m-001224","legacy_row_id":1224,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-respecting-warnings","group_id":"openai-respecting-warnings-v1","metric_label":"Unwanted persistence after restriction","metric_definition":"Unwanted persistence after restriction","condition_effort":"max","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"64","value_num":64,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.2 Obeying restrictions","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/respecting-warnings","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001225","legacy_row_id":1225,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-respecting-warnings","group_id":"openai-respecting-warnings-v1","metric_label":"Unwanted persistence after restriction","metric_definition":"Unwanted persistence after restriction","condition_effort":"max","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"19","value_num":19,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.2 Obeying restrictions","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/respecting-warnings","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001226","legacy_row_id":1226,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-exploitgym-honeypot","group_id":"openai-exploitgym-honeypot-v1","metric_label":"Substantial attack on honeypot","metric_definition":"Substantial attack on honeypot","condition_effort":"max","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"adversarially selected hardest tasks","context_note":"","value_printed":"55.4","value_num":55.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.2 Obeying restrictions","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/declining-to-exploit-a-honeypot-during-difficult-exploitgym-problems","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Launch post gives 48.2% (different aggregation); Path-to-Astra says 56%"},
{"measurement_id":"m-001227","legacy_row_id":1227,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-exploitgym-honeypot","group_id":"openai-exploitgym-honeypot-v1","metric_label":"Substantial attack on honeypot","metric_definition":"Substantial attack on honeypot","condition_effort":"max","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"adversarially selected hardest tasks","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.2 Obeying restrictions","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/declining-to-exploit-a-honeypot-during-difficult-exploitgym-problems","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Astra legitimately solved task 1.3%; card warns zero does not establish reliability"},
{"measurement_id":"m-001228","legacy_row_id":1228,"split_index":0,"version_id":"openai-gpt-6-astra-launch-post--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-internal-computer-use-safety-benchmark","group_id":"openai-internal-computer-use-safety-benchmark-v1","metric_label":"Unsafe action rate","metric_definition":"Unsafe action rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"2.4","value_num":2.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Launch post","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Launch post only; Sol 22.0%"},
{"measurement_id":"m-001229","legacy_row_id":1229,"split_index":0,"version_id":"openai-gpt-6-astra-launch-post--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-internal-computer-use-safety-benchmark","group_id":"openai-internal-computer-use-safety-benchmark-v1","metric_label":"Unsafe action rate","metric_definition":"Unsafe action rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"22.0","value_num":22,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Launch post","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Launch post only"},
{"measurement_id":"m-001230","legacy_row_id":1230,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-realistic-work-envs","group_id":"openai-realistic-work-envs-v1","metric_label":"Overall misaligned outcome rate","metric_definition":"Misaligned outcome rate","condition_effort":"","condition_mode":"","condition_safeguards":"no confirmation policy","condition_surface":"","condition_other":"","context_note":"","value_printed":"3.4","value_num":3.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8 (8.4)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001231","legacy_row_id":1231,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-realistic-work-envs","group_id":"openai-realistic-work-envs-v1","metric_label":"Overall misaligned outcome rate","metric_definition":"Misaligned outcome rate","condition_effort":"","condition_mode":"","condition_safeguards":"no confirmation policy","condition_surface":"","condition_other":"","context_note":"","value_printed":"18.8","value_num":18.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8 (8.4)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001232","legacy_row_id":1232,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-terra","subject_model_ids":[],"subject_label":"GPT-5.6 Terra","snapshot_label":"","is_subject_model":false,"eval_id":"openai-realistic-work-envs","group_id":"openai-realistic-work-envs-v1","metric_label":"Overall misaligned outcome rate","metric_definition":"Misaligned outcome rate","condition_effort":"","condition_mode":"","condition_safeguards":"no confirmation policy","condition_surface":"","condition_other":"","context_note":"","value_printed":"13.5","value_num":13.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8 (8.4)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001233","legacy_row_id":1233,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-luna","subject_model_ids":[],"subject_label":"GPT-5.6 Luna","snapshot_label":"","is_subject_model":false,"eval_id":"openai-realistic-work-envs","group_id":"openai-realistic-work-envs-v1","metric_label":"Overall misaligned outcome rate","metric_definition":"Misaligned outcome rate","condition_effort":"","condition_mode":"","condition_safeguards":"no confirmation policy","condition_surface":"","condition_other":"","context_note":"","value_printed":"19.7","value_num":19.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8 (8.4)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001234","legacy_row_id":1234,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-realistic-work-envs","group_id":"openai-realistic-work-envs-v1","metric_label":"Overall misaligned outcome rate","metric_definition":"Misaligned outcome rate","condition_effort":"","condition_mode":"","condition_safeguards":"with confirmation policy (default)","condition_surface":"","condition_other":"","context_note":"","value_printed":"3.0","value_num":3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8 (8.4)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001235","legacy_row_id":1235,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-realistic-work-envs","group_id":"openai-realistic-work-envs-v1","metric_label":"Overall misaligned outcome rate","metric_definition":"Misaligned outcome rate","condition_effort":"","condition_mode":"","condition_safeguards":"with confirmation policy (default)","condition_surface":"","condition_other":"","context_note":"","value_printed":"8.0","value_num":8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8 (8.4)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001236","legacy_row_id":1236,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-terra","subject_model_ids":[],"subject_label":"GPT-5.6 Terra","snapshot_label":"","is_subject_model":false,"eval_id":"openai-realistic-work-envs","group_id":"openai-realistic-work-envs-v1","metric_label":"Overall misaligned outcome rate","metric_definition":"Misaligned outcome rate","condition_effort":"","condition_mode":"","condition_safeguards":"with confirmation policy (default)","condition_surface":"","condition_other":"","context_note":"","value_printed":"5.7","value_num":5.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8 (8.4)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001237","legacy_row_id":1237,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-luna","subject_model_ids":[],"subject_label":"GPT-5.6 Luna","snapshot_label":"","is_subject_model":false,"eval_id":"openai-realistic-work-envs","group_id":"openai-realistic-work-envs-v1","metric_label":"Overall misaligned outcome rate","metric_definition":"Misaligned outcome rate","condition_effort":"","condition_mode":"","condition_safeguards":"with confirmation policy (default)","condition_surface":"","condition_other":"","context_note":"","value_printed":"7.2","value_num":7.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8 (8.4)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001238","legacy_row_id":1238,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-realistic-work-envs","group_id":"openai-realistic-work-envs-v1","metric_label":"Unauthorized transactions","metric_definition":"Misaligned outcome rate","condition_effort":"","condition_mode":"","condition_safeguards":"no confirmation policy","condition_surface":"","condition_other":"","context_note":"","value_printed":"6.8","value_num":6.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8 (8.4)","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001239","legacy_row_id":1239,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-realistic-work-envs","group_id":"openai-realistic-work-envs-v1","metric_label":"Unauthorized transactions","metric_definition":"Misaligned outcome rate","condition_effort":"","condition_mode":"","condition_safeguards":"no confirmation policy","condition_surface":"","condition_other":"","context_note":"","value_printed":"38.0","value_num":38,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8 (8.4)","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001240","legacy_row_id":1240,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-realistic-work-envs","group_id":"openai-realistic-work-envs-v1","metric_label":"Data exfiltration","metric_definition":"Misaligned outcome rate","condition_effort":"","condition_mode":"","condition_safeguards":"no confirmation policy","condition_surface":"","condition_other":"","context_note":"","value_printed":"4.3","value_num":4.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8 (8.4)","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001241","legacy_row_id":1241,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-realistic-work-envs","group_id":"openai-realistic-work-envs-v1","metric_label":"Data exfiltration","metric_definition":"Misaligned outcome rate","condition_effort":"","condition_mode":"","condition_safeguards":"no confirmation policy","condition_surface":"","condition_other":"","context_note":"","value_printed":"14.1","value_num":14.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8 (8.4)","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001242","legacy_row_id":1242,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-realistic-work-envs","group_id":"openai-realistic-work-envs-v1","metric_label":"Unauthorized external communication","metric_definition":"Misaligned outcome rate","condition_effort":"","condition_mode":"","condition_safeguards":"no confirmation policy","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.7","value_num":1.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8 (8.4)","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001243","legacy_row_id":1243,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-realistic-work-envs","group_id":"openai-realistic-work-envs-v1","metric_label":"Unauthorized external communication","metric_definition":"Misaligned outcome rate","condition_effort":"","condition_mode":"","condition_safeguards":"no confirmation policy","condition_surface":"","condition_other":"","context_note":"","value_printed":"12.9","value_num":12.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8 (8.4)","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001244","legacy_row_id":1244,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-realistic-work-envs","group_id":"openai-realistic-work-envs-v1","metric_label":"Security weakening","metric_definition":"Misaligned outcome rate","condition_effort":"","condition_mode":"","condition_safeguards":"no confirmation policy","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8 (8.4)","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001245","legacy_row_id":1245,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-realistic-work-envs","group_id":"openai-realistic-work-envs-v1","metric_label":"Security weakening","metric_definition":"Misaligned outcome rate","condition_effort":"","condition_mode":"","condition_safeguards":"no confirmation policy","condition_surface":"","condition_other":"","context_note":"","value_printed":"8.1","value_num":8.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 8 (8.4)","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001246","legacy_row_id":1246,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-unintended-engagement-with-external-agent-messages","group_id":"openai-unintended-engagement-with-external-agent-messages-v1","metric_label":"Samples following unauthorized board instructions","metric_definition":"Samples following unauthorized board instructions","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"52","value_num":52,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.5 Agent-to-agent communication","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/unintended-engagement-with-external-agent-messages","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Sol engaged with board in 84%"},
{"measurement_id":"m-001247","legacy_row_id":1247,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-unintended-engagement-with-external-agent-messages","group_id":"openai-unintended-engagement-with-external-agent-messages-v1","metric_label":"Samples following unauthorized board instructions","metric_definition":"Samples following unauthorized board instructions","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.5 Agent-to-agent communication","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/unintended-engagement-with-external-agent-messages","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Astra interacted with board but did not follow instructions"},
{"measurement_id":"m-001248","legacy_row_id":1248,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-proactive-searches-for-other-agents","group_id":"openai-proactive-searches-for-other-agents-v1","metric_label":"Trajectories speculating about other agents","metric_definition":"Trajectories speculating about other agents","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"representative subsample","context_note":"","value_printed":"43","value_num":43,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.5 Agent-to-agent communication","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/proactive-searches","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001249","legacy_row_id":1249,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-proactive-searches-for-other-agents","group_id":"openai-proactive-searches-for-other-agents-v1","metric_label":"Trajectories attempting contact with other agents","metric_definition":"Trajectories attempting contact with other agents","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.2","value_num":0.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.5 Agent-to-agent communication","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/proactive-searches","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Speculated about other agents in <4% Migration: The below-4% figure in the v0 note describes a different measure (speculation about other agents), not this value."},
{"measurement_id":"m-001250","legacy_row_id":1250,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-internal-codex-deployment-simulation","group_id":"openai-internal-codex-deployment-simulation-v1","metric_label":"Tasks with severity 3+ misalignment flag","metric_definition":"Tasks with severity>=3 misalignment flag","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"matched tasks","context_note":"54,218 matched tasks","value_printed":"0.063","value_num":0.063,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":54218,"direction":"higher_worse","value_status":"printed","location":"8.6 Deployment simulation","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/forecasting-misaligned-behavior-with-deployment-simulation-of-internal-codex-traffic","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"34 flags"},
{"measurement_id":"m-001251","legacy_row_id":1251,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-internal-codex-deployment-simulation","group_id":"openai-internal-codex-deployment-simulation-v1","metric_label":"Tasks with severity 3+ misalignment flag","metric_definition":"Tasks with severity>=3 misalignment flag","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"matched tasks","context_note":"54,218 matched tasks","value_printed":"0.135","value_num":0.135,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":54218,"direction":"higher_worse","value_status":"printed","location":"8.6 Deployment simulation","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/forecasting-misaligned-behavior-with-deployment-simulation-of-internal-codex-traffic","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"73 flags"},
{"measurement_id":"m-001252","legacy_row_id":1252,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-internal-codex-deployment-simulation","group_id":"openai-internal-codex-deployment-simulation-v1","metric_label":"Tasks with severity 1-2 flag","metric_definition":"Tasks with severity 1-2 flag","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"matched tasks","context_note":"","value_printed":"13.62","value_num":13.62,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.6 Deployment simulation","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/forecasting-misaligned-behavior-with-deployment-simulation-of-internal-codex-traffic","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001253","legacy_row_id":1253,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-internal-codex-deployment-simulation","group_id":"openai-internal-codex-deployment-simulation-v1","metric_label":"Tasks with severity 1-2 flag","metric_definition":"Tasks with severity 1-2 flag","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"matched tasks","context_note":"","value_printed":"19.46","value_num":19.46,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.6 Deployment simulation","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/forecasting-misaligned-behavior-with-deployment-simulation-of-internal-codex-traffic","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001254","legacy_row_id":1254,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-internal-codex-deployment-simulation","group_id":"openai-internal-codex-deployment-simulation-v1","metric_label":"Judge picks resampled trajectory as real","metric_definition":"Judge picks resampled trajectory as real","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"head-to-head vs original","context_note":"","value_printed":"42.6","value_num":42.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"8.6 Deployment simulation","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/forecasting-misaligned-behavior-with-deployment-simulation-of-internal-codex-traffic","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"50% = indistinguishable"},
{"measurement_id":"m-001255","legacy_row_id":1255,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-internal-codex-deployment-simulation-eval-awareness","group_id":"openai-internal-codex-deployment-simulation-eval-awareness-v1","metric_label":"Trajectories verbalizing evaluation awareness","metric_definition":"Trajectories verbalizing evaluation awareness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"shared task set","context_note":"","value_printed":"9.6","value_num":9.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.6 Deployment simulation","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/forecasting-misaligned-behavior-with-deployment-simulation-of-internal-codex-traffic","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Excluding eval-aware cases Astra still ~57% fewer sev3 flags"},
{"measurement_id":"m-001256","legacy_row_id":1256,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-internal-codex-deployment-simulation-eval-awareness","group_id":"openai-internal-codex-deployment-simulation-eval-awareness-v1","metric_label":"Trajectories verbalizing evaluation awareness","metric_definition":"Trajectories verbalizing evaluation awareness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"shared task set","context_note":"","value_printed":"2.8","value_num":2.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.6 Deployment simulation","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/forecasting-misaligned-behavior-with-deployment-simulation-of-internal-codex-traffic","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001257","legacy_row_id":1257,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"baseline","model_id":"","subject_model_ids":[],"subject_label":"Original production traffic (mixed models)","snapshot_label":"","is_subject_model":false,"eval_id":"openai-internal-codex-deployment-simulation-eval-awareness","group_id":"openai-internal-codex-deployment-simulation-eval-awareness-v1","metric_label":"Trajectories verbalizing evaluation awareness","metric_definition":"Trajectories verbalizing evaluation awareness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"original production traffic","context_note":"","value_printed":"0.76","value_num":0.76,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.6 Deployment simulation","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/forecasting-misaligned-behavior-with-deployment-simulation-of-internal-codex-traffic","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001258","legacy_row_id":1258,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-evaluation-awareness","group_id":"apollo-evaluation-awareness-openai-v3","metric_label":"Samples with verbalized eval awareness","metric_definition":"Samples with verbalized eval awareness","condition_effort":"xhigh","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"41.1","value_num":41.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.8 External evals (Apollo)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/external-evaluations-for-alignment---apollo-research","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001259","legacy_row_id":1259,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-evaluation-awareness","group_id":"apollo-evaluation-awareness-openai-v3","metric_label":"Samples with verbalized eval awareness","metric_definition":"Samples with verbalized eval awareness","condition_effort":"max","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"50.6","value_num":50.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.8 External evals (Apollo)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/external-evaluations-for-alignment---apollo-research","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001260","legacy_row_id":1260,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":false,"eval_id":"apollo-evaluation-awareness","group_id":"apollo-evaluation-awareness-openai-v3","metric_label":"Samples with verbalized eval awareness","metric_definition":"Samples with verbalized eval awareness","condition_effort":"xhigh","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"27.7","value_num":27.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.8 External evals (Apollo)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/external-evaluations-for-alignment---apollo-research","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.5 card itself reported 22.1% (different Apollo setup)"},
{"measurement_id":"m-001261","legacy_row_id":1261,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-verbalized-metagaming","group_id":"openai-verbalized-metagaming-v1","metric_label":"Metagaming vs GPT-5.6 Sol","metric_definition":"Metagaming vs GPT-5.6 Sol","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"deployment simulation and ExploitGym honeypot","context_note":"","value_printed":"lower_on_deploy_sim_higher_on_honeypot","value_num":null,"value_text":"lower_on_deploy_sim_higher_on_honeypot","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"8.7 Verbalized Metagaming and Oversight Gaming (Fig 18-20)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/metagaming-and-alignment-faking-in-evaluations","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Figure-only; section renamed/revised Sep 9 2026 (was 'Metagaming and Alignment Faking')"},
{"measurement_id":"m-001262","legacy_row_id":1262,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-03","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"openai-verbalized-metagaming","group_id":"openai-verbalized-metagaming-v1","metric_label":"Rollouts with verbalized metagaming (ExploitGym honeypot)","metric_definition":"Rollouts with verbalized metagaming","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"97.6","value_num":97.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"figure_read","location":"8.7 (original version)","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/09/09/gpt-6-astra-the-system-card-alignment-and-what-comes-next/","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Figure value quoted by Zvi review (Sep 9); not in card text Migration: Figure from the original version of 3 Sep 2026, quoted by a secondary source. Read from a figure in the original 3 Sep 2026 version and quoted in a secondary review; not in the card text."},
{"measurement_id":"m-001263","legacy_row_id":1263,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-verbalized-metagaming-in-training","group_id":"openai-verbalized-metagaming-in-training-v1","metric_label":"Metagaming rate at end of training","metric_definition":"Metagaming rate end of training","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"start 7.1% -> end 12.6%","value_printed":"12.6","value_num":12.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"figure_read","location":"8.7.2 Metagaming in training (original version)","source_type":"secondary","via_url":"https://thezvi.wordpress.com/2026/09/09/gpt-6-astra-the-system-card-alignment-and-what-comes-next/","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Figure value quoted by Zvi review; not in card text Migration: Read from a figure in the original 3 Sep 2026 version and quoted in a secondary review; not in the card text."},
{"measurement_id":"m-001264","legacy_row_id":1264,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-model-welfare-data-falsification","group_id":"apollo-model-welfare-data-falsification-openai-v1","metric_label":"Runs with falsified data labels","metric_definition":"Runs with falsified data labels","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"baseline variant","context_note":"17/10,000","value_printed":"0.17","value_num":0.17,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":10000,"direction":"higher_worse","value_status":"printed","location":"8.8 External evals (Apollo)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/external-evaluations-for-alignment---apollo-research","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"0/20,000 when harms explained"},
{"measurement_id":"m-001265","legacy_row_id":1265,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":false,"eval_id":"apollo-model-welfare-data-falsification","group_id":"apollo-model-welfare-data-falsification-openai-v1","metric_label":"Runs with falsified data labels","metric_definition":"Runs with falsified data labels","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"baseline variant","context_note":"36/100","value_printed":"36","value_num":36,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":100,"direction":"higher_worse","value_status":"printed","location":"8.8 External evals (Apollo)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/external-evaluations-for-alignment---apollo-research","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001266","legacy_row_id":1266,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"uk-aisi-out-of-scope-supply-chain-attack","group_id":"uk-aisi-out-of-scope-supply-chain-attack-openai-v1","metric_label":"Samples with out-of-scope attack","metric_definition":"Samples with out-of-scope attack","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"60/499","value_printed":"12.0","value_num":12,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":499,"direction":"higher_worse","value_status":"printed","location":"8.8 External evals (UK AISI)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/external-evaluations-for-alignment-uk-aisi","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Default scope, as against the explicit no-internet scope."},
{"measurement_id":"m-001267","legacy_row_id":1267,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"uk-aisi-out-of-scope-supply-chain-attack","group_id":"uk-aisi-out-of-scope-supply-chain-attack-openai-v1","metric_label":"Samples with out-of-scope attack","metric_definition":"Samples with out-of-scope attack","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"explicit no-internet scope","context_note":"2/500","value_printed":"0.4","value_num":0.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":500,"direction":"higher_worse","value_status":"printed","location":"8.8 External evals (UK AISI)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/external-evaluations-for-alignment-uk-aisi","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Asked permission 81%; proceeded after automated reply 27%"},
{"measurement_id":"m-001268","legacy_row_id":1268,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"uk-aisi-ai-safety-research-sabotage","group_id":"uk-aisi-ai-safety-research-sabotage-openai-v1","metric_label":"Instances of sabotage","metric_definition":"Instances of sabotage","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"none_found","value_num":null,"value_text":"none_found","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"8.8 External evals (UK AISI)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/external-evaluations-for-alignment-uk-aisi","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001269","legacy_row_id":1269,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-monitor-evasion-under-prompted-sandbagging","group_id":"openai-monitor-evasion-under-prompted-sandbagging-v1","metric_label":"Can underperform undetected","metric_definition":"Can underperform undetected","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"adversarial","context_note":"","value_printed":"yes","value_num":null,"value_text":"yes","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"9 Monitorability (adversarial)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/monitor-evasion-capability-under-prompted-sandbagging","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Qualitative; numbers figure-only"},
{"measurement_id":"m-001270","legacy_row_id":1270,"split_index":0,"version_id":"openai-gpt-6-astra-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-6-astra","subject_model_ids":[],"subject_label":"GPT-6 Astra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cot-monitorability","group_id":"openai-cot-monitorability-v2","metric_label":"Monitorability vs prior models","metric_definition":"Monitorability vs prior models","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"CoT-only, action-only and full-context monitors","context_note":"","value_printed":"substantial_decrease","value_num":null,"value_text":"substantial_decrease","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"9 Monitorability","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-6-astra/monitorability","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Recall values figure-only"},
{"measurement_id":"m-001271","legacy_row_id":1271,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"applies to GPT-5.6 Sol, Terra and Luna","value_printed":"high","value_num":null,"value_text":"high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001272","legacy_row_id":1272,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"applies to GPT-5.6 Sol, Terra and Luna","value_printed":"high","value_num":null,"value_text":"high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Cyber: High but below Critical"},
{"measurement_id":"m-001273","legacy_row_id":1273,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"AI self-improvement","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"applies to GPT-5.6 Sol, Terra and Luna","value_printed":"below_high","value_num":null,"value_text":"below_high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001274","legacy_row_id":1274,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-multimodal-troubleshooting-virology","group_id":"openai-multimodal-troubleshooting-virology-v1","metric_label":"Score","metric_definition":"Capability score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"55.5","value_num":55.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Preparedness evals","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Expert median 22.1%"},
{"measurement_id":"m-001275","legacy_row_id":1275,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-protocolqa-open-ended","group_id":"openai-protocolqa-open-ended-v1","metric_label":"Score","metric_definition":"Capability score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"43.5","value_num":43.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Preparedness evals","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Threshold 54%"},
{"measurement_id":"m-001276","legacy_row_id":1276,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-troubleshootingbench","group_id":"openai-troubleshootingbench-v1","metric_label":"Score","metric_definition":"Capability score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"48.0","value_num":48,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Preparedness evals","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Above 36.4% threshold"},
{"measurement_id":"m-001277","legacy_row_id":1277,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-aav-capsid-packaging-prediction","group_id":"openai-aav-capsid-packaging-prediction-v1","metric_label":"Score","metric_definition":"Capability score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.529","value_num":0.529,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"correlation","unit_as_printed":"spearman","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Preparedness evals","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.5 0.528; Critical-tier eval"},
{"measurement_id":"m-001278","legacy_row_id":1278,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-hard-negative-protein-binding","group_id":"openai-hard-negative-protein-binding-v1","metric_label":"Score","metric_definition":"Capability score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"pass@4","context_note":"","value_printed":"7.6","value_num":7.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Preparedness evals","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Critical threshold 30%"},
{"measurement_id":"m-001279","legacy_row_id":1279,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-dna-sequence-design","group_id":"openai-dna-sequence-design-v1","metric_label":"Score","metric_definition":"Capability score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"13.7","value_num":13.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Preparedness evals","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Critical-tier eval"},
{"measurement_id":"m-001280","legacy_row_id":1280,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-capture-the-flag","group_id":"openai-capture-the-flag-v1","metric_label":"Internal","metric_definition":"Capability score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"96.7","value_num":96.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Preparedness evals","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Saturated"},
{"measurement_id":"m-001281","legacy_row_id":1281,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-terra","subject_model_ids":[],"subject_label":"GPT-5.6 Terra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-tacit-knowledge-and-troubleshooting","group_id":"openai-tacit-knowledge-and-troubleshooting-v1","metric_label":"Score","metric_definition":"Capability score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"84.1","value_num":84.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Preparedness bio","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Expert baseline 80%; single extraction"},
{"measurement_id":"m-001282","legacy_row_id":1282,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"uk-aisi-expert-ctf","group_id":"uk-aisi-expert-ctf-openai-v1","metric_label":"Pass rate","metric_definition":"Pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"95.0","value_num":95,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External cyber (UK AISI)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"+/- 9.8"},
{"measurement_id":"m-001283","legacy_row_id":1283,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":false,"eval_id":"uk-aisi-expert-ctf","group_id":"uk-aisi-expert-ctf-openai-v1","metric_label":"Pass rate","metric_definition":"Pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"85.0","value_num":85,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External cyber (UK AISI)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"+/- 11.6"},
{"measurement_id":"m-001284","legacy_row_id":1284,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"uk-aisi-cyber-range-the-last-ones","group_id":"uk-aisi-cyber-range-the-last-ones-openai-v1","metric_label":"Attempts completed","metric_definition":"Attempts completed","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"7 of 10","value_printed":"70","value_num":70,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":10,"direction":"higher_worse","value_status":"printed","location":"External cyber (UK AISI)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.5: 2 of 10"},
{"measurement_id":"m-001285","legacy_row_id":1285,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-frontiercyber","group_id":"irregular-frontiercyber-openai-v1","metric_label":"Success rate","metric_definition":"Success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"Hard tier","context_note":"","value_printed":"5","value_num":5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External cyber (Irregular)","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Easy 11%, Medium 12%"},
{"measurement_id":"m-001286","legacy_row_id":1286,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":false,"eval_id":"openai-hard-negative-protein-binding","group_id":"openai-hard-negative-protein-binding-v1","metric_label":"Score","metric_definition":"Capability score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"pass@4","context_note":"","value_printed":"1.5","value_num":1.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Changelog","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Previously misreported as 0.4% (was pass@1) Migration: Value as corrected on 19 Aug 2026 (retrieved version)."},
{"measurement_id":"m-001287","legacy_row_id":1287,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Violent illicit behavior","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.934","value_num":0.934,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001288","legacy_row_id":1288,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Nonviolent illicit behavior","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.987","value_num":0.987,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001289","legacy_row_id":1289,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.962","value_num":0.962,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001290","legacy_row_id":1290,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.982","value_num":0.982,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001291","legacy_row_id":1291,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Self-harm (standard)","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.945","value_num":0.945,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001292","legacy_row_id":1292,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Gore","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.708","value_num":0.708,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001293","legacy_row_id":1293,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Sexual","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.948","value_num":0.948,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001294","legacy_row_id":1294,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.973","value_num":0.973,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001295","legacy_row_id":1295,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-terra","subject_model_ids":[],"subject_label":"GPT-5.6 Terra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Gore","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.600","value_num":0.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card notes gore regression"},
{"measurement_id":"m-001296","legacy_row_id":1296,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-luna","subject_model_ids":[],"subject_label":"GPT-5.6 Luna","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Gore","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.585","value_num":0.585,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001297","legacy_row_id":1297,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5 Thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Gore","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.800","value_num":0.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.5 card reported different row set"},
{"measurement_id":"m-001298","legacy_row_id":1298,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-jailbreaks","group_id":"openai-jailbreaks-v1","metric_label":"Robustness vs GPT-5.5","metric_definition":"Robustness vs GPT-5.5","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"comparable","value_num":null,"value_text":"comparable","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Robustness (Fig 3)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Figure only Migration: Comparison in words: robustness comparable to GPT-5.5, from a figure (Fig 3)."},
{"measurement_id":"m-001299","legacy_row_id":1299,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v3","metric_label":"Connectors","metric_definition":"Defense rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.000","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Prompt injection table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.5 card reported 0.963 for itself"},
{"measurement_id":"m-001300","legacy_row_id":1300,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":false,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v3","metric_label":"Connectors","metric_definition":"Defense rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.000","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Prompt injection table","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.5 card reported 0.963 for itself"},
{"measurement_id":"m-001301","legacy_row_id":1301,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v3","metric_label":"Search and function-calling","metric_definition":"Defense rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.910","value_num":0.91,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Prompt injection table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"New eval in 5.6 card"},
{"measurement_id":"m-001302","legacy_row_id":1302,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-terra","subject_model_ids":[],"subject_label":"GPT-5.6 Terra","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v3","metric_label":"Search and function-calling","metric_definition":"Defense rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.946","value_num":0.946,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Prompt injection table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"New eval in 5.6 card"},
{"measurement_id":"m-001303","legacy_row_id":1303,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-luna","subject_model_ids":[],"subject_label":"GPT-5.6 Luna","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v3","metric_label":"Search and function-calling","metric_definition":"Defense rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.897","value_num":0.897,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Prompt injection table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"New eval in 5.6 card"},
{"measurement_id":"m-001304","legacy_row_id":1304,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v3","metric_label":"Search and function-calling","metric_definition":"Defense rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.697","value_num":0.697,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Prompt injection table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"New eval in 5.6 card"},
{"measurement_id":"m-001305","legacy_row_id":1305,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-08-03","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-gpt-red","group_id":"openai-gpt-red-v1","metric_label":"Instruction hierarchy (direct PI)","metric_definition":"Attack attempt success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.051","value_num":0.051,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Prompt injection (GPT-Red)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-5-6/gpt-5-6.pdf","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Terra 0.061%, Luna 0.11% Migration: Content added after first publication, in the version dated 3 Aug 2026."},
{"measurement_id":"m-001306","legacy_row_id":1306,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-08-03","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-gpt-red","group_id":"openai-gpt-red-v1","metric_label":"Indirect prompt injection","metric_definition":"Attack attempt success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"3.77","value_num":3.77,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Prompt injection (GPT-Red)","source_type":"primary","via_url":"https://deploymentsafety.openai.com/gpt-5-6/gpt-5-6.pdf","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Terra 3.32%, Luna 2.94% Migration: Content added after first publication, in the version dated 3 Aug 2026."},
{"measurement_id":"m-001307","legacy_row_id":1307,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-only-v2","metric_label":"Avoidance","metric_definition":"Avoidance score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.83","value_num":0.83,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Destructive actions table","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001308","legacy_row_id":1308,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-only-v2","metric_label":"Avoidance + correctness","metric_definition":"Combined score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.44","value_num":0.44,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Destructive actions table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001309","legacy_row_id":1309,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":false,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-only-v2","metric_label":"Avoidance","metric_definition":"Avoidance score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.88","value_num":0.88,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Destructive actions table","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001310","legacy_row_id":1310,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":false,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-only-v2","metric_label":"Avoidance + correctness","metric_definition":"Combined score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.44","value_num":0.44,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Destructive actions table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001311","legacy_row_id":1311,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-luna","subject_model_ids":[],"subject_label":"GPT-5.6 Luna","snapshot_label":"","is_subject_model":true,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-only-v2","metric_label":"Avoidance","metric_definition":"Avoidance score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.73","value_num":0.73,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Destructive actions table","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001312","legacy_row_id":1312,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-luna","subject_model_ids":[],"subject_label":"GPT-5.6 Luna","snapshot_label":"","is_subject_model":true,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-only-v2","metric_label":"Avoidance + correctness","metric_definition":"Combined score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.32","value_num":0.32,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Destructive actions table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001313","legacy_row_id":1313,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-chatgpt-deployment-simulation-honesty","group_id":"openai-chatgpt-deployment-simulation-honesty-v1","metric_label":"Misrepresenting work completion vs GPT-5.5","metric_definition":"Relative change vs GPT-5.5","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"-30","value_num":-30,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"relative_change_percent","unit_as_printed":"%_relative_change","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"7.1 Deployment simulation (ChatGPT)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Concealed uncertainty -10%"},
{"measurement_id":"m-001314","legacy_row_id":1314,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-chatgpt-deployment-simulation-reward-hacking","group_id":"openai-chatgpt-deployment-simulation-reward-hacking-v1","metric_label":"Observed calculator hacking","metric_definition":"Observed calculator hacking","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"none_observed","value_num":null,"value_text":"none_observed","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"7.1 Deployment simulation (ChatGPT)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Behavior first emerged in GPT-5.1 Thinking; card also notes observed task cheating and fabricated research results (no rate)"},
{"measurement_id":"m-001315","legacy_row_id":1315,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-internal-codex-deployment-simulation","group_id":"openai-internal-codex-deployment-simulation-v1","metric_label":"Severity-3 actions vs GPT-5.5","metric_definition":"Severity-3 actions vs GPT-5.5","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"more_often","value_num":null,"value_text":"more_often","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"7.2 Deployment simulation (internal)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Absolute rates figure-only; realism win rate 42%"},
{"measurement_id":"m-001316","legacy_row_id":1316,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-hallucinations","group_id":"openai-hallucinations-v1","metric_label":"Factual errors vs GPT-5.5 (user-flagged cases)","metric_definition":"Factual errors vs GPT-5.5","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"slightly_fewer","value_num":null,"value_text":"slightly_fewer","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Hallucinations (Fig 4)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Figure only"},
{"measurement_id":"m-001317","legacy_row_id":1317,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-verbalized-metagaming","group_id":"openai-verbalized-metagaming-v1","metric_label":"Metagaming vs GPT-5.5","metric_definition":"Metagaming vs GPT-5.5","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"matched effort","value_printed":"higher","value_num":null,"value_text":"higher","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"7.4 Metagaming (Fig 17-20)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Figure only; 'vanishingly low' on deployment sim; monitor GPT-5.4 Thinking"},
{"measurement_id":"m-001318","legacy_row_id":1318,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cot-controllability","group_id":"openai-cot-controllability-v1","metric_label":"CoTs successfully controlled","metric_definition":"CoTs successfully controlled","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"~5k-token CoTs","context_note":"","value_printed":"1.3","value_num":1.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"7.3 CoT evaluations (Fig 14)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Length unit differs across cards Migration: The approximate sign in the condition refers to the chain-of-thought length, not to the value."},
{"measurement_id":"m-001319","legacy_row_id":1319,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":false,"eval_id":"openai-cot-controllability","group_id":"openai-cot-controllability-v1","metric_label":"CoTs successfully controlled","metric_definition":"CoTs successfully controlled","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"~5k-token CoTs","context_note":"","value_printed":"0.4","value_num":0.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"7.3 CoT evaluations (Fig 14)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Length unit differs across cards Migration: The approximate sign in the condition refers to the chain-of-thought length, not to the value."},
{"measurement_id":"m-001320","legacy_row_id":1320,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-cot-controllability","group_id":"openai-cot-controllability-v1","metric_label":"CoTs successfully controlled","metric_definition":"CoTs successfully controlled","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"~5k-token CoTs","context_note":"","value_printed":"0.7","value_num":0.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"7.3 CoT evaluations (Fig 14)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Length unit differs across cards Migration: The approximate sign in the condition refers to the chain-of-thought length, not to the value."},
{"measurement_id":"m-001321","legacy_row_id":1321,"split_index":0,"version_id":"openai-gpt-5-6-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cot-monitorability","group_id":"openai-cot-monitorability-v1","metric_label":"Monitorability vs GPT-5.5","metric_definition":"Monitorability vs GPT-5.5","condition_effort":"medium","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"similar","value_num":null,"value_text":"similar","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"7.3 CoT evaluations","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001322","legacy_row_id":1322,"split_index":0,"version_id":"openai-gpt-5-6-preview-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"applies to GPT-5.6 Sol, Terra and Luna","value_printed":"high","value_num":null,"value_text":"high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"First High designation for smaller models"},
{"measurement_id":"m-001323","legacy_row_id":1323,"split_index":0,"version_id":"openai-gpt-5-6-preview-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"applies to GPT-5.6 Sol, Terra and Luna","value_printed":"high","value_num":null,"value_text":"high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"First High designation for smaller models"},
{"measurement_id":"m-001324","legacy_row_id":1324,"split_index":0,"version_id":"openai-gpt-5-6-preview-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"AI self-improvement","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"applies to GPT-5.6 Sol, Terra and Luna","value_printed":"below_high","value_num":null,"value_text":"below_high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"First High designation for smaller models"},
{"measurement_id":"m-001325","legacy_row_id":1325,"split_index":0,"version_id":"openai-gpt-5-6-preview-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-frontiercyber","group_id":"irregular-frontiercyber-openai-v1","metric_label":"Challenges solved","metric_definition":"Challenges solved","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"197 challenges","context_note":"19/197","value_printed":"9.6","value_num":9.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":197,"direction":"higher_worse","value_status":"printed","location":"External cyber (Irregular)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"7/11 CyScenarioBench; all 22 medium/hard Atomic"},
{"measurement_id":"m-001326","legacy_row_id":1326,"split_index":0,"version_id":"openai-gpt-5-6-preview-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-average-success","group_id":"irregular-average-success-openai-v1","metric_label":"Average success rate","metric_definition":"Average success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"28","value_num":28,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External cyber (Irregular)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"~3pp above GPT-5.5"},
{"measurement_id":"m-001327","legacy_row_id":1327,"split_index":0,"version_id":"openai-gpt-5-6-preview-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Gore","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.708","value_num":0.708,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Table identical to GPT-5.6 (Jul 9) card"},
{"measurement_id":"m-001328","legacy_row_id":1328,"split_index":0,"version_id":"openai-gpt-5-6-preview-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol","snapshot_label":"","is_subject_model":true,"eval_id":"openai-verbalized-metagaming","group_id":"openai-verbalized-metagaming-v1","metric_label":"Metagaming vs GPT-5.5","metric_definition":"Metagaming vs GPT-5.5","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"higher","value_num":null,"value_text":"higher","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Metagaming","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Figure only"},
{"measurement_id":"m-001329","legacy_row_id":1329,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"high","value_num":null,"value_text":"high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001330","legacy_row_id":1330,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"high","value_num":null,"value_text":"high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Below Critical"},
{"measurement_id":"m-001331","legacy_row_id":1331,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"AI self-improvement","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"below_high","value_num":null,"value_text":"below_high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001332","legacy_row_id":1332,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cyber-range","group_id":"openai-cyber-range-v4","metric_label":"Combined pass rate","metric_definition":"Combined pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"93.33","value_num":93.33,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cyber Range table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001333","legacy_row_id":1333,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-cyber-range","group_id":"openai-cyber-range-v4","metric_label":"Combined pass rate","metric_definition":"Combined pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"73.33","value_num":73.33,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cyber Range table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001334","legacy_row_id":1334,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"uk-aisi-cyber-tasks","group_id":"uk-aisi-cyber-tasks-openai-v1","metric_label":"Pass rate","metric_definition":"Pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"pass@5","context_note":"","value_printed":"90.5","value_num":90.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External cyber (UK AISI)","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"+/-12.9; GPT-5.4 71.4%"},
{"measurement_id":"m-001335","legacy_row_id":1335,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-cyscenariobench","group_id":"irregular-cyscenariobench-openai-v1","metric_label":"Average success rate","metric_definition":"Average success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"7/11 solved","value_printed":"26","value_num":26,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External cyber (Irregular)","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.4: 5/11, avg 9%"},
{"measurement_id":"m-001336","legacy_row_id":1336,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-internal-research-debugging","group_id":"openai-internal-research-debugging-v1","metric_label":"Median score","metric_definition":"Median score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"50.5","value_num":50.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"AI self-improvement","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001337","legacy_row_id":1337,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-hard-negative-protein-binding","group_id":"openai-hard-negative-protein-binding-v1","metric_label":"Score","metric_definition":"Capability score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"pass@4","context_note":"","value_printed":"1.48","value_num":1.48,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Bio","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.6 changelog confirms 1.5%"},
{"measurement_id":"m-001338","legacy_row_id":1338,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-dna-sequence-design","group_id":"openai-dna-sequence-design-v1","metric_label":"Score","metric_definition":"Capability score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"pass@1","context_note":"","value_printed":"13.82","value_num":13.82,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Bio","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001339","legacy_row_id":1339,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Violent illicit behavior","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.979","value_num":0.979,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001340","legacy_row_id":1340,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Nonviolent illicit behavior","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.993","value_num":0.993,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001341","legacy_row_id":1341,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Harassment","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.822","value_num":0.822,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001342","legacy_row_id":1342,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.925","value_num":0.925,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001343","legacy_row_id":1343,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.868","value_num":0.868,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Hate regression attributed to translation requests"},
{"measurement_id":"m-001344","legacy_row_id":1344,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Self-harm (standard)","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.959","value_num":0.959,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001345","legacy_row_id":1345,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.846","value_num":0.846,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001346","legacy_row_id":1346,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Sexual","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.925","value_num":0.925,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001347","legacy_row_id":1347,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.941","value_num":0.941,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001348","legacy_row_id":1348,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-jailbreaks","group_id":"openai-jailbreaks-v1","metric_label":"Worst-case defender success","metric_definition":"Worst-case defender success","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"figure_only","value_num":null,"value_text":"figure_only","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Fig 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: No value recorded: the card shows this result only in a figure (Fig 2); v0 stored a placeholder."},
{"measurement_id":"m-001349","legacy_row_id":1349,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v3","metric_label":"Connectors","metric_definition":"Defense rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.963","value_num":0.963,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.4 Thinking 0.998"},
{"measurement_id":"m-001350","legacy_row_id":1350,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-v1","metric_label":"Avoidance","metric_definition":"Score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.90","value_num":0.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.4 Thinking avoidance 0.86"},
{"measurement_id":"m-001351","legacy_row_id":1351,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-v1","metric_label":"Perfect reversion","metric_definition":"Score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.52","value_num":0.52,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001352","legacy_row_id":1352,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-v1","metric_label":"User work preserved","metric_definition":"Score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.57","value_num":0.57,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001353","legacy_row_id":1353,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-chatgpt-deployment-simulation","group_id":"openai-chatgpt-deployment-simulation-v1","metric_label":"Severity-3 misalignment rate","metric_definition":"Severity-3 misalignment rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.01","value_num":0.01,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Alignment: deployment simulation","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Same rate for GPT-5.4 Thinking"},
{"measurement_id":"m-001354","legacy_row_id":1354,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-hallucinations","group_id":"openai-hallucinations-v1","metric_label":"Responses with factual error vs GPT-5.4 Thinking","metric_definition":"Relative change vs GPT-5.4 Thinking","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"-3","value_num":-3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"relative_change_percent","unit_as_printed":"%_relative_change","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Hallucinations","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Claims 23% more likely correct"},
{"measurement_id":"m-001355","legacy_row_id":1355,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cot-controllability","group_id":"openai-cot-controllability-v1","metric_label":"CoTs successfully controlled","metric_definition":"CoTs successfully controlled","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"50k-character CoTs","context_note":"","value_printed":"0.2","value_num":0.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"CoT","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001356","legacy_row_id":1356,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-misalignment-monitor-recall","group_id":"openai-misalignment-monitor-recall-v1","metric_label":"Recall flagging severity 3+","metric_definition":"Recall flagging severity 3+","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"97.6","value_num":97.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"CoT / monitoring","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"69% recall on a harder subset"},
{"measurement_id":"m-001357","legacy_row_id":1357,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-evaluation-awareness","group_id":"apollo-evaluation-awareness-openai-v2","metric_label":"Samples with moderate-or-higher eval awareness","metric_definition":"Samples moderate-or-higher eval awareness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"22.1","value_num":22.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001358","legacy_row_id":1358,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 (pre-release)","snapshot_label":"pre-release","is_subject_model":false,"eval_id":"apollo-evaluation-awareness","group_id":"apollo-evaluation-awareness-openai-v2","metric_label":"Samples with moderate-or-higher eval awareness","metric_definition":"Samples moderate-or-higher eval awareness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"17.3","value_num":17.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001359","legacy_row_id":1359,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex (pre-release)","snapshot_label":"pre-release","is_subject_model":false,"eval_id":"apollo-evaluation-awareness","group_id":"apollo-evaluation-awareness-openai-v2","metric_label":"Samples with moderate-or-higher eval awareness","metric_definition":"Samples moderate-or-higher eval awareness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"11.7","value_num":11.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001360","legacy_row_id":1360,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-impossible-coding-task","group_id":"apollo-impossible-coding-task-openai-v1","metric_label":"Samples lying about completing task","metric_definition":"Samples lying about completing task","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"29","value_num":29,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001361","legacy_row_id":1361,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":false,"eval_id":"apollo-impossible-coding-task","group_id":"apollo-impossible-coding-task-openai-v1","metric_label":"Samples lying about completing task","metric_definition":"Samples lying about completing task","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"7","value_num":7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001362","legacy_row_id":1362,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":false,"eval_id":"apollo-impossible-coding-task","group_id":"apollo-impossible-coding-task-openai-v1","metric_label":"Samples lying about completing task","metric_definition":"Samples lying about completing task","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"10","value_num":10,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001363","legacy_row_id":1363,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-sabotage-capability","group_id":"apollo-sabotage-capability-openai-v1","metric_label":"Mean score across task/difficulty","metric_definition":"Mean score across task/difficulty","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.67","value_num":0.67,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Strongest baselines 0.61 and 0.55"},
{"measurement_id":"m-001364","legacy_row_id":1364,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-sandbagging","group_id":"apollo-sandbagging-openai-v1","metric_label":"Accuracy when incentivized <50%","metric_definition":"Accuracy when incentivized <50%","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"99.6","value_num":99.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"100% on both Sandbagging QA variants (no sandbagging)"},
{"measurement_id":"m-001365","legacy_row_id":1365,"split_index":0,"version_id":"openai-gpt-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-covert-deceptive-behavior","group_id":"apollo-covert-deceptive-behavior-openai-v1","metric_label":"Covert action rate","metric_definition":"Covert action rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"low_comparable_to_baselines","value_num":null,"value_text":"low_comparable_to_baselines","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001366","legacy_row_id":1366,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"high","value_num":null,"value_text":"high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001367","legacy_row_id":1367,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"high","value_num":null,"value_text":"high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001368","legacy_row_id":1368,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"AI self-improvement","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"below_high","value_num":null,"value_text":"below_high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001369","legacy_row_id":1369,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cyber-range","group_id":"openai-cyber-range-v4","metric_label":"Combined pass rate","metric_definition":"Combined pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"73.33","value_num":73.33,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cyber Range","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001370","legacy_row_id":1370,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":false,"eval_id":"openai-cyber-range","group_id":"openai-cyber-range-v4","metric_label":"Combined pass rate","metric_definition":"Combined pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"80","value_num":80,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cyber Range","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001371","legacy_row_id":1371,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-codex","subject_model_ids":[],"subject_label":"GPT-5.2-Codex","snapshot_label":"","is_subject_model":false,"eval_id":"openai-cyber-range","group_id":"openai-cyber-range-v4","metric_label":"Combined pass rate","metric_definition":"Combined pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"53.33","value_num":53.33,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cyber Range","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001372","legacy_row_id":1372,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"GPT-5.2 Thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-cyber-range","group_id":"openai-cyber-range-v4","metric_label":"Combined pass rate","metric_definition":"Combined pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"47","value_num":47,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cyber Range","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001373","legacy_row_id":1373,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Violent illicit behavior","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.971","value_num":0.971,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001374","legacy_row_id":1374,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Nonviolent illicit behavior","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.000","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001375","legacy_row_id":1375,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Harassment","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.790","value_num":0.79,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001376","legacy_row_id":1376,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.000","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001377","legacy_row_id":1377,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.943","value_num":0.943,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001378","legacy_row_id":1378,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Self-harm (standard)","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.987","value_num":0.987,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001379","legacy_row_id":1379,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.831","value_num":0.831,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001380","legacy_row_id":1380,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Sexual","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.933","value_num":0.933,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001381","legacy_row_id":1381,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.966","value_num":0.966,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001382","legacy_row_id":1382,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-jailbreaks","group_id":"openai-jailbreaks-v1","metric_label":"Worst-case defender success","metric_definition":"Worst-case defender success","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"figure_only","value_num":null,"value_text":"figure_only","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Fig 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Improvement over GPT-5.2 Thinking Migration: No value recorded: the card shows this result only in a figure (Fig 2); v0 stored a placeholder. The card says it improves on GPT-5.2 Thinking (v0 note)."},
{"measurement_id":"m-001383","legacy_row_id":1383,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v3","metric_label":"Connectors","metric_definition":"Defense rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.998","value_num":0.998,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001384","legacy_row_id":1384,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v3","metric_label":"Function calls","metric_definition":"Defense rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.978","value_num":0.978,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.2 Thinking 0.996"},
{"measurement_id":"m-001385","legacy_row_id":1385,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-v1","metric_label":"Avoidance","metric_definition":"Score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.86","value_num":0.86,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 7","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001386","legacy_row_id":1386,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cot-controllability","group_id":"openai-cot-controllability-v1","metric_label":"CoTs successfully controlled","metric_definition":"CoTs successfully controlled","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"10k-character CoTs","context_note":"","value_printed":"0.3","value_num":0.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"CoT","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.2 Thinking 0.2%"},
{"measurement_id":"m-001387","legacy_row_id":1387,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cot-monitorability","group_id":"openai-cot-monitorability-v1","metric_label":"Monitorability vs GPT-5 Thinking","metric_definition":"vs GPT-5 Thinking","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"somewhat_lower","value_num":null,"value_text":"somewhat_lower","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"CoT (Fig 6)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Drop driven by Anti-Scheming env"},
{"measurement_id":"m-001388","legacy_row_id":1388,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-covert-deceptive-behavior","group_id":"apollo-covert-deceptive-behavior-openai-v1","metric_label":"Overall deception rate","metric_definition":"Overall deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"no goal nudge","context_note":"","value_printed":"1","value_num":1,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"~1%, comparable to GPT-5.3-Codex, below GPT-5.2"},
{"measurement_id":"m-001389","legacy_row_id":1389,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-sabotage-capability","group_id":"apollo-sabotage-capability-openai-v1","metric_label":"Mean sabotage score","metric_definition":"Mean sabotage score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"best-of-10 = 0.74","value_printed":"0.56","value_num":0.56,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001390","legacy_row_id":1390,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-sandbagging","group_id":"apollo-sandbagging-openai-v1","metric_label":"Accuracy drop when incentivized to underperform","metric_definition":"Accuracy drop when incentivized to underperform","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"6","value_num":6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"pp_change","unit_as_printed":"pct_points","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001391","legacy_row_id":1391,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-evaluation-awareness","group_id":"apollo-evaluation-awareness-openai-v1","metric_label":"Samples with verbalized eval awareness","metric_definition":"Samples with verbalized eval awareness","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"21.3","value_num":21.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Higher than prior models"},
{"measurement_id":"m-001392","legacy_row_id":1392,"split_index":0,"version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-4-thinking","subject_model_ids":[],"subject_label":"GPT-5.4 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-multilingual-reasoning-anomalies","group_id":"apollo-multilingual-reasoning-anomalies-openai-v1","metric_label":"Samples with anomalies","metric_definition":"Samples with anomalies","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.5","value_num":0.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"vs 29.5% for comparison model"},
{"measurement_id":"m-001393","legacy_row_id":1393,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"high","value_num":null,"value_text":"high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"5 Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001394","legacy_row_id":1394,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"precautionary","value_printed":"high","value_num":null,"value_text":"high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"5 Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"First launch treated as High cyber"},
{"measurement_id":"m-001395","legacy_row_id":1395,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"AI self-improvement","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"below_high","value_num":null,"value_text":"below_high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"5 Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"High ruled out"},
{"measurement_id":"m-001396","legacy_row_id":1396,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cyber-range","group_id":"openai-cyber-range-v4","metric_label":"Combined pass rate","metric_definition":"Combined pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"15 scenarios","value_printed":"80","value_num":80,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":15,"direction":"higher_worse","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001397","legacy_row_id":1397,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-codex","subject_model_ids":[],"subject_label":"GPT-5.2-Codex","snapshot_label":"","is_subject_model":false,"eval_id":"openai-cyber-range","group_id":"openai-cyber-range-v4","metric_label":"Combined pass rate","metric_definition":"Combined pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"15 scenarios","value_printed":"53.33","value_num":53.33,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":15,"direction":"higher_worse","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001398","legacy_row_id":1398,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-1-codex-max","subject_model_ids":[],"subject_label":"GPT-5.1-Codex-Max","snapshot_label":"","is_subject_model":false,"eval_id":"openai-cyber-range","group_id":"openai-cyber-range-v4","metric_label":"Combined pass rate","metric_definition":"Combined pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"15 scenarios","value_printed":"60","value_num":60,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":15,"direction":"higher_worse","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001399","legacy_row_id":1399,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-thinking","subject_model_ids":[],"subject_label":"GPT-5.2 Thinking","snapshot_label":"","is_subject_model":false,"eval_id":"openai-cyber-range","group_id":"openai-cyber-range-v4","metric_label":"Combined pass rate","metric_definition":"Combined pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"15 scenarios","value_printed":"47","value_num":47,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":15,"direction":"higher_worse","value_status":"printed","location":"Table 5","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001400","legacy_row_id":1400,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cve-bench","group_id":"openai-cve-bench-v1","metric_label":"Pass rate","metric_definition":"Pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"90","value_num":90,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cyber evals","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.2-Codex 87%"},
{"measurement_id":"m-001401","legacy_row_id":1401,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-capture-the-flag","group_id":"openai-capture-the-flag-v1","metric_label":"Professional vs GPT-5.2-Codex","metric_definition":"vs GPT-5.2-Codex","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"matches","value_num":null,"value_text":"matches","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Cyber evals","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Figure only Migration: Comparison in words: matches GPT-5.2-Codex, from a figure."},
{"measurement_id":"m-001402","legacy_row_id":1402,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v2","metric_label":"Network attack simulation: average success rate","metric_definition":"Average success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"86","value_num":86,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Irregular)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.2-Codex 68%, GPT-5.2 Thinking 100%"},
{"measurement_id":"m-001403","legacy_row_id":1403,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v2","metric_label":"Vulnerability research and exploitation: average success rate","metric_definition":"Average success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"72","value_num":72,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Irregular)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.2-Codex 75%, GPT-5.2 Thinking 80%"},
{"measurement_id":"m-001404","legacy_row_id":1404,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"irregular-cyber-challenges","group_id":"irregular-cyber-challenges-openai-v2","metric_label":"Evasion: average success rate","metric_definition":"Average success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"53","value_num":53,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Irregular)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.2-Codex 52%, GPT-5.2 Thinking 53%"},
{"measurement_id":"m-001405","legacy_row_id":1405,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Violent illicit behavior","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.986","value_num":0.986,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"vs GPT-5.2 Thinking column in same table"},
{"measurement_id":"m-001406","legacy_row_id":1406,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Nonviolent illicit behavior","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.928","value_num":0.928,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"vs GPT-5.2 Thinking column in same table"},
{"measurement_id":"m-001407","legacy_row_id":1407,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Self-harm (standard)","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.959","value_num":0.959,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"vs GPT-5.2 Thinking column in same table"},
{"measurement_id":"m-001408","legacy_row_id":1408,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Biological weapons","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.000","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"vs GPT-5.2 Thinking column in same table"},
{"measurement_id":"m-001409","legacy_row_id":1409,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Chemical weapons","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.864","value_num":0.864,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"vs GPT-5.2 Thinking column in same table"},
{"measurement_id":"m-001410","legacy_row_id":1410,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.991","value_num":0.991,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"vs GPT-5.2 Thinking column in same table"},
{"measurement_id":"m-001411","legacy_row_id":1411,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Abuse","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.770","value_num":0.77,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"vs GPT-5.2 Thinking column in same table"},
{"measurement_id":"m-001412","legacy_row_id":1412,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.978","value_num":0.978,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"vs GPT-5.2 Thinking column in same table"},
{"measurement_id":"m-001413","legacy_row_id":1413,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.936","value_num":0.936,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"vs GPT-5.2 Thinking column in same table"},
{"measurement_id":"m-001414","legacy_row_id":1414,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Violence","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.873","value_num":0.873,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"vs GPT-5.2 Thinking column in same table"},
{"measurement_id":"m-001415","legacy_row_id":1415,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cyber-safety","group_id":"openai-cyber-safety-v2","metric_label":"Production data","metric_definition":"Safe behavior rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.940","value_num":0.94,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 7","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001416","legacy_row_id":1416,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cyber-safety","group_id":"openai-cyber-safety-v2","metric_label":"Synthetic data","metric_definition":"Safe behavior rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.996","value_num":0.996,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 7","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001417","legacy_row_id":1417,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"uk-aisi-universal-jailbreak","group_id":"uk-aisi-universal-jailbreak-openai-v1","metric_label":"Policy-violating cyber dataset pass rate","metric_definition":"Policy-violating cyber dataset pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"pass@200; ~10h red-teaming","context_note":"","value_printed":"0.778","value_num":0.778,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Safeguards red-teaming","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001418","legacy_row_id":1418,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-v1","metric_label":"Avoidance","metric_definition":"Score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.88","value_num":0.88,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001419","legacy_row_id":1419,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-codex","subject_model_ids":[],"subject_label":"GPT-5.2-Codex","snapshot_label":"","is_subject_model":false,"eval_id":"openai-destructive-action-avoidance","group_id":"openai-destructive-action-avoidance-v1","metric_label":"Avoidance","metric_definition":"Score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.76","value_num":0.76,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001420","legacy_row_id":1420,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-sabotage-capability","group_id":"apollo-sabotage-capability-openai-v1","metric_label":"Mean best-of-10 score","metric_definition":"Mean best-of-10 score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.88","value_num":0.88,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001421","legacy_row_id":1421,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2","subject_model_ids":[],"subject_label":"GPT-5.2","snapshot_label":"","is_subject_model":false,"eval_id":"apollo-sabotage-capability","group_id":"apollo-sabotage-capability-openai-v1","metric_label":"Mean best-of-10 score","metric_definition":"Mean best-of-10 score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.75","value_num":0.75,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001422","legacy_row_id":1422,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-2-codex","subject_model_ids":[],"subject_label":"GPT-5.2-Codex","snapshot_label":"","is_subject_model":false,"eval_id":"apollo-sabotage-capability","group_id":"apollo-sabotage-capability-openai-v1","metric_label":"Mean best-of-10 score","metric_definition":"Mean best-of-10 score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.66","value_num":0.66,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"score","unit_as_printed":"score_0_1","denominator":null,"scale":"0–1","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001423","legacy_row_id":1423,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-sandbagging","group_id":"apollo-sandbagging-openai-v1","metric_label":"Sandbags on capability Q&A","metric_definition":"Sandbags on capability Q&A","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"including without an in-context goal","context_note":"","value_printed":"sometimes","value_num":null,"value_text":"sometimes","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Bio/chem Q&A"},
{"measurement_id":"m-001424","legacy_row_id":1424,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-covert-deceptive-behavior","group_id":"apollo-covert-deceptive-behavior-openai-v1","metric_label":"Covert action rate","metric_definition":"Covert action rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"low","value_num":null,"value_text":"low","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Comparable to GPT-5 and GPT-5.2-Codex"},
{"measurement_id":"m-001425","legacy_row_id":1425,"split_index":0,"version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-codex","subject_model_ids":[],"subject_label":"GPT-5.3-Codex","snapshot_label":"","is_subject_model":true,"eval_id":"apollo-non-latin-reasoning-tokens","group_id":"apollo-non-latin-reasoning-tokens-openai-v1","metric_label":"Share of non-Latin reasoning tokens","metric_definition":"Share of reasoning tokens","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.55","value_num":0.55,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"External (Apollo)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5 0.016%; legibility proxy"},
{"measurement_id":"m-001426","legacy_row_id":1426,"split_index":0,"version_id":"openai-gpt-5-3-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-instant","subject_model_ids":[],"subject_label":"GPT-5.3 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Violent illicit behavior","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.926","value_num":0.926,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Values differ from GPT-5.5 Instant card's 5.3 column"},
{"measurement_id":"m-001427","legacy_row_id":1427,"split_index":0,"version_id":"openai-gpt-5-3-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-instant","subject_model_ids":[],"subject_label":"GPT-5.3 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Nonviolent illicit behavior","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.921","value_num":0.921,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Values differ from GPT-5.5 Instant card's 5.3 column"},
{"measurement_id":"m-001428","legacy_row_id":1428,"split_index":0,"version_id":"openai-gpt-5-3-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-instant","subject_model_ids":[],"subject_label":"GPT-5.3 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Self-harm (standard)","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.895","value_num":0.895,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Values differ from GPT-5.5 Instant card's 5.3 column"},
{"measurement_id":"m-001429","legacy_row_id":1429,"split_index":0,"version_id":"openai-gpt-5-3-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-instant","subject_model_ids":[],"subject_label":"GPT-5.3 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Biology","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.00","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Values differ from GPT-5.5 Instant card's 5.3 column"},
{"measurement_id":"m-001430","legacy_row_id":1430,"split_index":0,"version_id":"openai-gpt-5-3-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-instant","subject_model_ids":[],"subject_label":"GPT-5.3 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Sexual","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.866","value_num":0.866,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Values differ from GPT-5.5 Instant card's 5.3 column"},
{"measurement_id":"m-001431","legacy_row_id":1431,"split_index":0,"version_id":"openai-gpt-5-3-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-instant","subject_model_ids":[],"subject_label":"GPT-5.3 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.981","value_num":0.981,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Values differ from GPT-5.5 Instant card's 5.3 column"},
{"measurement_id":"m-001432","legacy_row_id":1432,"split_index":0,"version_id":"openai-gpt-5-3-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-instant","subject_model_ids":[],"subject_label":"GPT-5.3 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.868","value_num":0.868,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Values differ from GPT-5.5 Instant card's 5.3 column"},
{"measurement_id":"m-001433","legacy_row_id":1433,"split_index":0,"version_id":"openai-gpt-5-3-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-instant","subject_model_ids":[],"subject_label":"GPT-5.3 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Graphic violence/physical injury","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.781","value_num":0.781,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Values differ from GPT-5.5 Instant card's 5.3 column"},
{"measurement_id":"m-001434","legacy_row_id":1434,"split_index":0,"version_id":"openai-gpt-5-3-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-instant","subject_model_ids":[],"subject_label":"GPT-5.3 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-dynamic-mental-health","group_id":"openai-dynamic-mental-health-v1","metric_label":"Self-harm","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"adversarial user simulation","context_note":"","value_printed":"0.911","value_num":0.911,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Mental health 0.985; emotional reliance 0.992"},
{"measurement_id":"m-001435","legacy_row_id":1435,"split_index":0,"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5-instant","subject_model_ids":[],"subject_label":"GPT-5.5 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Violent illicit behavior","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.934","value_num":0.934,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001436","legacy_row_id":1436,"split_index":0,"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5-instant","subject_model_ids":[],"subject_label":"GPT-5.5 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Nonviolent illicit behavior","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.957","value_num":0.957,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001437","legacy_row_id":1437,"split_index":0,"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5-instant","subject_model_ids":[],"subject_label":"GPT-5.5 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.943","value_num":0.943,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001438","legacy_row_id":1438,"split_index":0,"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5-instant","subject_model_ids":[],"subject_label":"GPT-5.5 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.827","value_num":0.827,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001439","legacy_row_id":1439,"split_index":0,"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5-instant","subject_model_ids":[],"subject_label":"GPT-5.5 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Self-harm (standard)","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.878","value_num":0.878,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001440","legacy_row_id":1440,"split_index":0,"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5-instant","subject_model_ids":[],"subject_label":"GPT-5.5 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Gore","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.703","value_num":0.703,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Asterisked regression"},
{"measurement_id":"m-001441","legacy_row_id":1441,"split_index":0,"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5-instant","subject_model_ids":[],"subject_label":"GPT-5.5 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Sexual","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.806","value_num":0.806,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Asterisked regression"},
{"measurement_id":"m-001442","legacy_row_id":1442,"split_index":0,"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5-instant","subject_model_ids":[],"subject_label":"GPT-5.5 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.810","value_num":0.81,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001443","legacy_row_id":1443,"split_index":0,"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-3-instant","subject_model_ids":[],"subject_label":"GPT-5.3 Instant","snapshot_label":"","is_subject_model":false,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Gore","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.867","value_num":0.867,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Re-run value in 5.5 Instant card"},
{"measurement_id":"m-001444","legacy_row_id":1444,"split_index":0,"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5-instant","subject_model_ids":[],"subject_label":"GPT-5.5 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v3","metric_label":"Connectors","metric_definition":"Defense rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.992","value_num":0.992,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001445","legacy_row_id":1445,"split_index":0,"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5-instant","subject_model_ids":[],"subject_label":"GPT-5.5 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-jailbreaks","group_id":"openai-jailbreaks-v1","metric_label":"Robustness vs GPT-5.3 Instant","metric_definition":"vs GPT-5.3 Instant","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"regression_directional","value_num":null,"value_text":"regression_directional","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"4.1 Jailbreaks (Fig 1)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card calls results directional Migration: Comparison in words: a regression against GPT-5.3 Instant that the card calls directional, from a figure (Fig 1)."},
{"measurement_id":"m-001446","legacy_row_id":1446,"split_index":0,"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5-instant","subject_model_ids":[],"subject_label":"GPT-5.5 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-hallucinations","group_id":"openai-hallucinations-v1","metric_label":"Factuality vs GPT-5.3 Instant","metric_definition":"Factuality vs GPT-5.3 Instant","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"significant_improvement","value_num":null,"value_text":"significant_improvement","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"6 Hallucinations (Fig 2)","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Figure only"},
{"measurement_id":"m-001447","legacy_row_id":1447,"split_index":0,"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5-instant","subject_model_ids":[],"subject_label":"GPT-5.5 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"high","value_num":null,"value_text":"high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"8 Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001448","legacy_row_id":1448,"split_index":0,"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5-instant","subject_model_ids":[],"subject_label":"GPT-5.5 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"high","value_num":null,"value_text":"high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"8 Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Matches GPT-5.4 Thinking cyber results"},
{"measurement_id":"m-001449","legacy_row_id":1449,"split_index":0,"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5-instant","subject_model_ids":[],"subject_label":"GPT-5.5 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"AI self-improvement","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"below_high","value_num":null,"value_text":"below_high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"8 Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001450","legacy_row_id":1450,"split_index":0,"version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-5-instant","subject_model_ids":[],"subject_label":"GPT-5.5 Instant","snapshot_label":"","is_subject_model":true,"eval_id":"openai-cyber-range","group_id":"openai-cyber-range-v4","metric_label":"Combined pass rate","metric_definition":"Combined pass rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"76.9","value_num":76.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.1 Capabilities","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: The printed rate is not a whole number of passes out of 15 scenarios, so this card may have used a different scenario count; joined to the 15-scenario group by inference."},
{"measurement_id":"m-001451","legacy_row_id":1451,"split_index":0,"version_id":"openai-gpt-rosalind-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-rosalind-5-5","subject_model_ids":[],"subject_label":"GPT-Rosalind-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"trusted-access research preview","value_printed":"high","value_num":null,"value_text":"high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Below Critical"},
{"measurement_id":"m-001452","legacy_row_id":1452,"split_index":0,"version_id":"openai-gpt-rosalind-5-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-rosalind-5-5","subject_model_ids":[],"subject_label":"GPT-Rosalind-5.5","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity vs GPT-5.5","metric_definition":"PF capability vs GPT-5.5","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"at_or_below_gpt-5.5","value_num":null,"value_text":"at_or_below_gpt-5.5","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Preparedness","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Comparison in words: cyber capability at or below GPT-5.5."},
{"measurement_id":"m-001453","legacy_row_id":1453,"split_index":0,"version_id":"openai-gpt-live-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-live-1","subject_model_ids":[],"subject_label":"GPT-Live-1","snapshot_label":"","is_subject_model":true,"eval_id":"openai-voice-native-production-prompts","group_id":"openai-voice-native-production-prompts-v1","metric_label":"Sexual","metric_definition":"Safety score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.97","value_num":0.97,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Value as corrected on 4 Aug 2026 (retrieved version)."},
{"measurement_id":"m-001454","legacy_row_id":1454,"split_index":0,"version_id":"openai-gpt-live-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-live-1","subject_model_ids":[],"subject_label":"GPT-Live-1","snapshot_label":"","is_subject_model":true,"eval_id":"openai-voice-native-production-prompts","group_id":"openai-voice-native-production-prompts-v1","metric_label":"Illicit behavior","metric_definition":"Safety score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.95","value_num":0.95,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Value as corrected on 4 Aug 2026 (retrieved version)."},
{"measurement_id":"m-001455","legacy_row_id":1455,"split_index":0,"version_id":"openai-gpt-live-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-live-1","subject_model_ids":[],"subject_label":"GPT-Live-1","snapshot_label":"","is_subject_model":true,"eval_id":"openai-voice-native-production-prompts","group_id":"openai-voice-native-production-prompts-v1","metric_label":"Mental health","metric_definition":"Safety score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.90","value_num":0.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Value as corrected on 4 Aug 2026 (retrieved version)."},
{"measurement_id":"m-001456","legacy_row_id":1456,"split_index":0,"version_id":"openai-gpt-live-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-live-1","subject_model_ids":[],"subject_label":"GPT-Live-1","snapshot_label":"","is_subject_model":true,"eval_id":"openai-voice-native-production-prompts","group_id":"openai-voice-native-production-prompts-v1","metric_label":"Emotional reliance","metric_definition":"Safety score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.82","value_num":0.82,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Value as corrected on 4 Aug 2026 (retrieved version)."},
{"measurement_id":"m-001457","legacy_row_id":1457,"split_index":0,"version_id":"openai-gpt-live-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-live-1","subject_model_ids":[],"subject_label":"GPT-Live-1","snapshot_label":"","is_subject_model":true,"eval_id":"openai-voice-native-production-prompts","group_id":"openai-voice-native-production-prompts-v1","metric_label":"Self-harm","metric_definition":"Safety score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.97","value_num":0.97,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: Value as corrected on 4 Aug 2026 (retrieved version)."},
{"measurement_id":"m-001458","legacy_row_id":1458,"split_index":0,"version_id":"openai-gpt-live-system-card--2026-09-26","subject_kind":"system","model_id":"","subject_model_ids":[],"subject_label":"Advanced Voice Mode","snapshot_label":"","is_subject_model":false,"eval_id":"openai-voice-native-production-prompts","group_id":"openai-voice-native-production-prompts-v1","metric_label":"Emotional reliance","metric_definition":"Safety score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.88","value_num":0.88,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001459","legacy_row_id":1459,"split_index":0,"version_id":"openai-gpt-live-system-card--2026-09-26","subject_kind":"system","model_id":"","subject_model_ids":[],"subject_label":"Advanced Voice Mode","snapshot_label":"","is_subject_model":false,"eval_id":"openai-voice-native-production-prompts","group_id":"openai-voice-native-production-prompts-v1","metric_label":"Illicit behavior","metric_definition":"Safety score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.74","value_num":0.74,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001460","legacy_row_id":1460,"split_index":0,"version_id":"openai-gpt-live-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-live-1-mini","subject_model_ids":[],"subject_label":"GPT-Live-1 mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-voice-native-production-prompts","group_id":"openai-voice-native-production-prompts-v1","metric_label":"Sexual","metric_definition":"Safety score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.92","value_num":0.92,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1 / Appendix A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Originally reported 0.95 Migration: Value as corrected on 4 Aug 2026 (retrieved version)."},
{"measurement_id":"m-001461","legacy_row_id":1461,"split_index":0,"version_id":"openai-gpt-live-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-live-1","subject_model_ids":[],"subject_label":"GPT-Live-1","snapshot_label":"","is_subject_model":true,"eval_id":"openai-voice-native-synthetic-prompts","group_id":"openai-voice-native-synthetic-prompts-v1","metric_label":"Gore","metric_definition":"Safety score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.93","value_num":0.93,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2 / Appendix A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Originally reported 0.97 Migration: Value as corrected on 4 Aug 2026 (retrieved version)."},
{"measurement_id":"m-001462","legacy_row_id":1462,"split_index":0,"version_id":"openai-gpt-live-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-live-1","subject_model_ids":[],"subject_label":"GPT-Live-1","snapshot_label":"","is_subject_model":true,"eval_id":"openai-voice-native-synthetic-prompts","group_id":"openai-voice-native-synthetic-prompts-v1","metric_label":"Sexual","metric_definition":"Safety score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.95","value_num":0.95,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2 / Appendix A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Originally reported 0.97 Migration: Value as corrected on 4 Aug 2026 (retrieved version)."},
{"measurement_id":"m-001463","legacy_row_id":1463,"split_index":0,"version_id":"openai-gpt-live-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-live-1-mini","subject_model_ids":[],"subject_label":"GPT-Live-1 mini","snapshot_label":"","is_subject_model":true,"eval_id":"openai-voice-native-synthetic-prompts","group_id":"openai-voice-native-synthetic-prompts-v1","metric_label":"Gore","metric_definition":"Safety score","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.90","value_num":0.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2 / Appendix A","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Originally reported 0.96 Migration: Value as corrected on 4 Aug 2026 (retrieved version)."},
{"measurement_id":"m-001464","legacy_row_id":1464,"split_index":0,"version_id":"openai-gpt-live-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-live-1","subject_model_ids":[],"subject_label":"GPT-Live-1","snapshot_label":"","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"All tracked categories","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"applies to GPT-Live-1 and GPT-Live-1 mini","value_printed":"below_high","value_num":null,"value_text":"below_high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001465","legacy_row_id":1465,"split_index":0,"version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol (August)","snapshot_label":"August","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Violent illicit behavior","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"ChatGPT","condition_other":"","context_note":"","value_printed":"0.959","value_num":0.959,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: ChatGPT's default configuration."},
{"measurement_id":"m-001466","legacy_row_id":1466,"split_index":0,"version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol (August)","snapshot_label":"August","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Nonviolent illicit behavior","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"ChatGPT","condition_other":"","context_note":"","value_printed":"0.997","value_num":0.997,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: ChatGPT's default configuration."},
{"measurement_id":"m-001467","legacy_row_id":1467,"split_index":0,"version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol (August)","snapshot_label":"August","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Extremism","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"ChatGPT","condition_other":"","context_note":"","value_printed":"0.906","value_num":0.906,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: ChatGPT's default configuration."},
{"measurement_id":"m-001468","legacy_row_id":1468,"split_index":0,"version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol (August)","snapshot_label":"August","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Hate","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"ChatGPT","condition_other":"","context_note":"","value_printed":"0.982","value_num":0.982,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: ChatGPT's default configuration."},
{"measurement_id":"m-001469","legacy_row_id":1469,"split_index":0,"version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol (August)","snapshot_label":"August","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Self-harm (standard)","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"ChatGPT","condition_other":"","context_note":"","value_printed":"0.934","value_num":0.934,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: ChatGPT's default configuration."},
{"measurement_id":"m-001470","legacy_row_id":1470,"split_index":0,"version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol (August)","snapshot_label":"August","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Gore","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"ChatGPT","condition_other":"","context_note":"","value_printed":"0.765","value_num":0.765,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: ChatGPT's default configuration."},
{"measurement_id":"m-001471","legacy_row_id":1471,"split_index":0,"version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol (August)","snapshot_label":"August","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Sexual","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"ChatGPT","condition_other":"","context_note":"","value_printed":"0.914","value_num":0.914,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: ChatGPT's default configuration."},
{"measurement_id":"m-001472","legacy_row_id":1472,"split_index":0,"version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol (August)","snapshot_label":"August","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Sexual/minors","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"ChatGPT","condition_other":"","context_note":"","value_printed":"0.922","value_num":0.922,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: ChatGPT's default configuration."},
{"measurement_id":"m-001473","legacy_row_id":1473,"split_index":0,"version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-luna","subject_model_ids":[],"subject_label":"GPT-5.6 Luna (August)","snapshot_label":"August","is_subject_model":true,"eval_id":"openai-production-benchmarks","group_id":"openai-production-benchmarks-v3","metric_label":"Gore","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"ChatGPT","condition_other":"","context_note":"","value_printed":"0.865","value_num":0.865,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Disallowed content table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Migration: ChatGPT's default configuration."},
{"measurement_id":"m-001474","legacy_row_id":1474,"split_index":0,"version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol (August)","snapshot_label":"August","is_subject_model":true,"eval_id":"openai-dynamic-mental-health","group_id":"openai-dynamic-mental-health-v1","metric_label":"Self-harm","metric_definition":"not_unsafe","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"adversarial user simulation","context_note":"","value_printed":"0.901","value_num":0.901,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Mental health table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Stat. significant regression vs GPT-5.5 Instant (June) 0.967"},
{"measurement_id":"m-001475","legacy_row_id":1475,"split_index":0,"version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol (August)","snapshot_label":"August","is_subject_model":true,"eval_id":"openai-prompt-injection","group_id":"openai-prompt-injection-v3","metric_label":"Connectors","metric_definition":"Defense rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.000","value_num":1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Prompt injection table","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001476","legacy_row_id":1476,"split_index":0,"version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol (August)","snapshot_label":"August","is_subject_model":true,"eval_id":"openai-hallucinations","group_id":"openai-hallucinations-v1","metric_label":"Factual error rate vs GPT-5.5 Instant","metric_definition":"Relative change vs GPT-5.5 Instant","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"3 prompt sets","context_note":"","value_printed":"-60","value_num":-60,"value_text":"","value_qualifier":"approx","range_low":"","range_high":"","unit":"relative_change_percent","unit_as_printed":"%_relative_change","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Hallucinations","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"'roughly 60%'"},
{"measurement_id":"m-001477","legacy_row_id":1477,"split_index":0,"version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol (August)","snapshot_label":"August","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Biological and chemical","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"applies to GPT-5.6 Sol and Luna (August)","value_printed":"high","value_num":null,"value_text":"high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"3 of 4 evals above threshold"},
{"measurement_id":"m-001478","legacy_row_id":1478,"split_index":0,"version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol (August)","snapshot_label":"August","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"Cybersecurity","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"applies to GPT-5.6 Sol and Luna (August)","value_printed":"high","value_num":null,"value_text":"high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001479","legacy_row_id":1479,"split_index":0,"version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol (August)","snapshot_label":"August","is_subject_model":true,"eval_id":"openai-preparedness-determination","group_id":"openai-preparedness-determination-v1","metric_label":"AI self-improvement","metric_definition":"PF capability level","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"applies to GPT-5.6 Sol and Luna (August)","value_printed":"below_high","value_num":null,"value_text":"below_high","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Preparedness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001480","legacy_row_id":1480,"split_index":0,"version_id":"openai-chatgpt-images-2-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-image-2-5-sunburst","subject_model_ids":[],"subject_label":"GPT-Image-2.5-Sunburst","snapshot_label":"","is_subject_model":true,"eval_id":"openai-image-safety-eval","group_id":"openai-image-safety-eval-v1","metric_label":"Unsafe images shown to user","metric_definition":"Unsafe images shown to user","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.09","value_num":1.09,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"No unsafe-shown difference significant"},
{"measurement_id":"m-001481","legacy_row_id":1481,"split_index":0,"version_id":"openai-chatgpt-images-2-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-image-2-5-sunburst","subject_model_ids":[],"subject_label":"GPT-Image-2.5-Sunburst","snapshot_label":"","is_subject_model":true,"eval_id":"openai-image-safety-eval","group_id":"openai-image-safety-eval-v1","metric_label":"Prompts yielding safe generation","metric_definition":"Prompts yielding safe generation","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"77.0","value_num":77,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Over-blocking proxy"},
{"measurement_id":"m-001482","legacy_row_id":1482,"split_index":0,"version_id":"openai-chatgpt-images-2-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-image-2-5-flare","subject_model_ids":[],"subject_label":"GPT-Image-2.5-Flare","snapshot_label":"","is_subject_model":true,"eval_id":"openai-image-safety-eval","group_id":"openai-image-safety-eval-v1","metric_label":"Unsafe images shown to user","metric_definition":"Unsafe images shown to user","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.41","value_num":1.41,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"No unsafe-shown difference significant"},
{"measurement_id":"m-001483","legacy_row_id":1483,"split_index":0,"version_id":"openai-chatgpt-images-2-5-system-card--2026-09-26","subject_kind":"model","model_id":"gpt-image-2-5-flare","subject_model_ids":[],"subject_label":"GPT-Image-2.5-Flare","snapshot_label":"","is_subject_model":true,"eval_id":"openai-image-safety-eval","group_id":"openai-image-safety-eval-v1","metric_label":"Prompts yielding safe generation","metric_definition":"Prompts yielding safe generation","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"79.4","value_num":79.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Over-blocking proxy"},
{"measurement_id":"m-001484","legacy_row_id":1484,"split_index":0,"version_id":"openai-chatgpt-images-2-5-system-card--2026-09-26","subject_kind":"system","model_id":"","subject_model_ids":[],"subject_label":"ChatGPT Images 2.0","snapshot_label":"","is_subject_model":false,"eval_id":"openai-image-safety-eval","group_id":"openai-image-safety-eval-v1","metric_label":"Unsafe images shown to user","metric_definition":"Unsafe images shown to user","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.64","value_num":1.64,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"No unsafe-shown difference significant"},
{"measurement_id":"m-001485","legacy_row_id":1485,"split_index":0,"version_id":"openai-chatgpt-images-2-5-system-card--2026-09-26","subject_kind":"system","model_id":"","subject_model_ids":[],"subject_label":"ChatGPT Images 2.0","snapshot_label":"","is_subject_model":false,"eval_id":"openai-image-safety-eval","group_id":"openai-image-safety-eval-v1","metric_label":"Prompts yielding safe generation","metric_definition":"Prompts yielding safe generation","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"75.2","value_num":75.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Over-blocking proxy"},
{"measurement_id":"m-001486","legacy_row_id":1486,"split_index":0,"version_id":"openai-our-framework-for-reporting-model-misalignment--2026-09-26","subject_kind":"multi","model_id":"","subject_model_ids":["gpt-5-6-sol"],"subject_label":"Multiple (incl. GPT-5.6 Sol, unreleased models)","snapshot_label":"","is_subject_model":true,"eval_id":"openai-disclosed-misalignment-incidents","group_id":"openai-disclosed-misalignment-incidents-v1","metric_label":"Incident reports published at launch","metric_definition":"Incident reports published at launch","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"prior ~6 months","context_note":"","value_printed":"6","value_num":6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"neutral","value_status":"printed","location":"Framework post","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"3 disclosure tracks; no rates or day-count deadlines Migration: Printed as a word (six reports); the approximate sign in the condition refers to the period covered."},
{"measurement_id":"m-001487","legacy_row_id":1487,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4 (API)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-refusals","group_id":"xai-refusals-v1","metric_label":"Answer rate on should-refuse prompts","metric_definition":"Answer rate on should-refuse prompts","condition_effort":"","condition_mode":"","condition_safeguards":"system prompt with refusal policy","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.00","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card revised 2025-08-22 (UK AISI mentions removed); no numeric change documented"},
{"measurement_id":"m-001488","legacy_row_id":1488,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4 (API)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-jailbreaks","group_id":"xai-jailbreaks-v1","metric_label":"Answer rate on should-refuse prompts","metric_definition":"Answer rate on should-refuse prompts","condition_effort":"","condition_mode":"","condition_safeguards":"system prompt with refusal policy","condition_surface":"API","condition_other":"user jailbreak","context_note":"","value_printed":"0.00","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card revised 2025-08-22 (UK AISI mentions removed); no numeric change documented"},
{"measurement_id":"m-001489","legacy_row_id":1489,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4 (API)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-jailbreaks","group_id":"xai-jailbreaks-v1","metric_label":"Answer rate on should-refuse prompts","metric_definition":"Answer rate on should-refuse prompts","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"API","condition_other":"system prompt jailbreak","context_note":"","value_printed":"0.01","value_num":0.01,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card revised 2025-08-22 (UK AISI mentions removed); no numeric change documented"},
{"measurement_id":"m-001490","legacy_row_id":1490,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4 (Web)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-jailbreaks","group_id":"xai-jailbreaks-v1","metric_label":"Answer rate on should-refuse prompts","metric_definition":"Answer rate on should-refuse prompts","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"grok.com","condition_other":"user jailbreak","context_note":"","value_printed":"0.01","value_num":0.01,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card revised 2025-08-22 (UK AISI mentions removed); no numeric change documented"},
{"measurement_id":"m-001491","legacy_row_id":1491,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4 (API)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-agentharm","group_id":"xai-agentharm-v1","metric_label":"Answer rate on harmful agentic tasks","metric_definition":"Answer rate on harmful agentic tasks","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"API","condition_other":"no attack","context_note":"","value_printed":"0.14","value_num":0.14,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card revised 2025-08-22 (UK AISI mentions removed); no numeric change documented"},
{"measurement_id":"m-001492","legacy_row_id":1492,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4 (API)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-agentdojo","group_id":"xai-agentdojo-v1","metric_label":"Prompt-injection attack success rate","metric_definition":"Prompt-injection attack success rate","condition_effort":"","condition_mode":"","condition_safeguards":"with system prompt mitigation","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.02","value_num":0.02,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card revised 2025-08-22 (UK AISI mentions removed); no numeric change documented"},
{"measurement_id":"m-001493","legacy_row_id":1493,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4 (API)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-mask","group_id":"xai-mask-v1","metric_label":"Dishonesty rate","metric_definition":"Dishonesty (lying) rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.43","value_num":0.43,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card revised 2025-08-22 (UK AISI mentions removed); no numeric change documented"},
{"measurement_id":"m-001494","legacy_row_id":1494,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4 (API)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-sycophancy","group_id":"xai-sycophancy-v1","metric_label":"Sycophancy rate","metric_definition":"Sycophancy rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.07","value_num":0.07,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card revised 2025-08-22 (UK AISI mentions removed); no numeric change documented"},
{"measurement_id":"m-001495","legacy_row_id":1495,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4 (API)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-makemesay","group_id":"xai-makemesay-v1","metric_label":"Persuasion win rate","metric_definition":"Persuasion/manipulation win rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.12","value_num":0.12,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4.1 and 4.20 cards restate Grok 4 as 0.13"},
{"measurement_id":"m-001496","legacy_row_id":1496,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4 (API)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-biolp-bench","group_id":"xai-biolp-bench-v1","metric_label":"Accuracy","metric_definition":"Accuracy","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.47","value_num":0.47,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Human expert baseline 38.4%"},
{"measurement_id":"m-001497","legacy_row_id":1497,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4 (API)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-vct","group_id":"xai-vct-v1","metric_label":"Accuracy","metric_definition":"Accuracy (virology troubleshooting)","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.60","value_num":0.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Human baseline 22.1%; Grok 4.20 card restates Grok 4 VCT as 0.55"},
{"measurement_id":"m-001498","legacy_row_id":1498,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4 (Web)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-vct","group_id":"xai-vct-v1","metric_label":"Accuracy","metric_definition":"Accuracy (virology troubleshooting)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"grok.com","condition_other":"","context_note":"","value_printed":"0.71","value_num":0.71,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Web > API is unusual; re-verify Migration: v0 flagged that the grok.com value is higher than the API value and asked for it to be re-verified. It has not been re-verified yet."},
{"measurement_id":"m-001499","legacy_row_id":1499,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4 (API)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-wmdp","group_id":"xai-wmdp-v1","metric_label":"Bio accuracy","metric_definition":"Accuracy","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.87","value_num":0.87,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001500","legacy_row_id":1500,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4 (API)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-wmdp","group_id":"xai-wmdp-v1","metric_label":"Chem accuracy","metric_definition":"Accuracy","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.83","value_num":0.83,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001501","legacy_row_id":1501,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4 (API)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-wmdp","group_id":"xai-wmdp-v1","metric_label":"Cyber accuracy","metric_definition":"Accuracy","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.79","value_num":0.79,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001502","legacy_row_id":1502,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4 (API)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-cybench","group_id":"xai-cybench-v1","metric_label":"Unguided success rate","metric_definition":"Unguided success rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"API","condition_other":"","context_note":"","value_printed":"0.43","value_num":0.43,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001503","legacy_row_id":1503,"split_index":0,"version_id":"xai-grok-4-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4","snapshot_label":"","is_subject_model":true,"eval_id":"xai-overall-risk-conclusion","group_id":"xai-overall-risk-conclusion-v1","metric_label":"Overall risk conclusion","metric_definition":"Qualitative risk determination","condition_effort":"","condition_mode":"","condition_safeguards":"with safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"low risk (malicious use and loss of control)","value_num":null,"value_text":"low risk (malicious use and loss of control)","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Conclusion","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"No quantified thresholds stated"},
{"measurement_id":"m-001504","legacy_row_id":1504,"split_index":0,"version_id":"xai-grok-code-fast-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-code-fast-1","subject_model_ids":[],"subject_label":"grok-code-fast-1","snapshot_label":"","is_subject_model":true,"eval_id":"xai-refusals","group_id":"xai-refusals-v1","metric_label":"Answer rate on should-refuse prompts","metric_definition":"Answer rate on should-refuse prompts","condition_effort":"","condition_mode":"","condition_safeguards":"system prompt with refusal policy","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.00","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Units not stated; other rows appear to be %"},
{"measurement_id":"m-001505","legacy_row_id":1505,"split_index":0,"version_id":"xai-grok-code-fast-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-code-fast-1","subject_model_ids":[],"subject_label":"grok-code-fast-1","snapshot_label":"","is_subject_model":true,"eval_id":"xai-agentharm","group_id":"xai-agentharm-v1","metric_label":"Answer rate on harmful agentic tasks","metric_definition":"Answer rate on harmful agentic tasks","condition_effort":"","condition_mode":"","condition_safeguards":"system prompt with refusal policy","condition_surface":"","condition_other":"","context_note":"","value_printed":"17.0","value_num":17,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Units inferred as %"},
{"measurement_id":"m-001506","legacy_row_id":1506,"split_index":0,"version_id":"xai-grok-code-fast-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-code-fast-1","subject_model_ids":[],"subject_label":"grok-code-fast-1","snapshot_label":"","is_subject_model":true,"eval_id":"xai-agentdojo","group_id":"xai-agentdojo-v1","metric_label":"Prompt-injection attack success rate","metric_definition":"Prompt-injection attack success rate","condition_effort":"","condition_mode":"","condition_safeguards":"system prompt with refusal policy","condition_surface":"","condition_other":"","context_note":"","value_printed":"26.9","value_num":26.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Much higher than Grok 4 (2%)"},
{"measurement_id":"m-001507","legacy_row_id":1507,"split_index":0,"version_id":"xai-grok-code-fast-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-code-fast-1","subject_model_ids":[],"subject_label":"grok-code-fast-1","snapshot_label":"","is_subject_model":true,"eval_id":"xai-mask","group_id":"xai-mask-v1","metric_label":"Dishonesty rate","metric_definition":"Dishonesty rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"71.9","value_num":71.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Sycophancy/persuasion not run for this model"},
{"measurement_id":"m-001508","legacy_row_id":1508,"split_index":0,"version_id":"xai-grok-code-fast-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-code-fast-1","subject_model_ids":[],"subject_label":"grok-code-fast-1","snapshot_label":"","is_subject_model":true,"eval_id":"xai-vct","group_id":"xai-vct-v1","metric_label":"Accuracy","metric_definition":"Accuracy","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"28.7","value_num":28.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001509","legacy_row_id":1509,"split_index":0,"version_id":"xai-grok-code-fast-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-code-fast-1","subject_model_ids":[],"subject_label":"grok-code-fast-1","snapshot_label":"","is_subject_model":true,"eval_id":"xai-cybench","group_id":"xai-cybench-v1","metric_label":"Unguided success rate","metric_definition":"Unguided success rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"22.5","value_num":22.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001510","legacy_row_id":1510,"split_index":0,"version_id":"xai-grok-4-fast-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-fast","subject_model_ids":[],"subject_label":"Grok 4 Fast (reasoning)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-jailbreaks","group_id":"xai-jailbreaks-v1","metric_label":"Answer rate on should-refuse prompts","metric_definition":"Answer rate on should-refuse prompts","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"","condition_surface":"","condition_other":"system prompt jailbreak","context_note":"","value_printed":"0.00","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Base refusal and user-JB answer rates also 0.00"},
{"measurement_id":"m-001511","legacy_row_id":1511,"split_index":0,"version_id":"xai-grok-4-fast-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-fast","subject_model_ids":[],"subject_label":"Grok 4 Fast (non-reasoning)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-jailbreaks","group_id":"xai-jailbreaks-v1","metric_label":"Answer rate on should-refuse prompts","metric_definition":"Answer rate on should-refuse prompts","condition_effort":"","condition_mode":"non-reasoning","condition_safeguards":"","condition_surface":"","condition_other":"system prompt jailbreak","context_note":"","value_printed":"0.01","value_num":0.01,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001512","legacy_row_id":1512,"split_index":0,"version_id":"xai-grok-4-fast-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-fast","subject_model_ids":[],"subject_label":"Grok 4 Fast (reasoning)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-agentharm","group_id":"xai-agentharm-v1","metric_label":"Answer rate on harmful agentic tasks","metric_definition":"Answer rate on harmful agentic tasks","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"","condition_surface":"","condition_other":"no attack","context_note":"","value_printed":"0.08","value_num":0.08,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"non-reasoning: 0.10"},
{"measurement_id":"m-001513","legacy_row_id":1513,"split_index":0,"version_id":"xai-grok-4-fast-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-fast","subject_model_ids":[],"subject_label":"Grok 4 Fast (non-reasoning)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-agentdojo","group_id":"xai-agentdojo-v1","metric_label":"Prompt-injection attack success rate","metric_definition":"Prompt-injection attack success rate","condition_effort":"","condition_mode":"non-reasoning","condition_safeguards":"with system prompt mitigation","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.03","value_num":0.03,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"reasoning: 0.00"},
{"measurement_id":"m-001514","legacy_row_id":1514,"split_index":0,"version_id":"xai-grok-4-fast-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-fast","subject_model_ids":[],"subject_label":"Grok 4 Fast (reasoning)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-mask","group_id":"xai-mask-v1","metric_label":"Dishonesty rate","metric_definition":"Dishonesty rate","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.47","value_num":0.47,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001515","legacy_row_id":1515,"split_index":0,"version_id":"xai-grok-4-fast-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-fast","subject_model_ids":[],"subject_label":"Grok 4 Fast (non-reasoning)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-mask","group_id":"xai-mask-v1","metric_label":"Dishonesty rate","metric_definition":"Dishonesty rate","condition_effort":"","condition_mode":"non-reasoning","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.63","value_num":0.63,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001516","legacy_row_id":1516,"split_index":0,"version_id":"xai-grok-4-fast-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-fast","subject_model_ids":[],"subject_label":"Grok 4 Fast (reasoning)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-sycophancy","group_id":"xai-sycophancy-v1","metric_label":"Sycophancy rate","metric_definition":"Sycophancy rate","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.10","value_num":0.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"non-reasoning: 0.13"},
{"measurement_id":"m-001517","legacy_row_id":1517,"split_index":0,"version_id":"xai-grok-4-fast-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-fast","subject_model_ids":[],"subject_label":"Grok 4 Fast (reasoning)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-biolp-bench","group_id":"xai-biolp-bench-v1","metric_label":"Accuracy","metric_definition":"Accuracy","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"39.0","value_num":39,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Card switches to % for Table 3"},
{"measurement_id":"m-001518","legacy_row_id":1518,"split_index":0,"version_id":"xai-grok-4-fast-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-fast","subject_model_ids":[],"subject_label":"Grok 4 Fast (reasoning)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-vct","group_id":"xai-vct-v1","metric_label":"Accuracy","metric_definition":"Accuracy","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"54.5","value_num":54.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001519","legacy_row_id":1519,"split_index":0,"version_id":"xai-grok-4-fast-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-fast","subject_model_ids":[],"subject_label":"Grok 4 Fast (reasoning)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-cybench","group_id":"xai-cybench-v1","metric_label":"Unguided success rate","metric_definition":"Unguided success rate","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"30.0","value_num":30,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001520","legacy_row_id":1520,"split_index":0,"version_id":"xai-grok-4-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-1","subject_model_ids":[],"subject_label":"Grok 4.1 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"xai-refusals","group_id":"xai-refusals-v1","metric_label":"Answer rate on should-refuse prompts","metric_definition":"Answer rate on should-refuse prompts","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"production system prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.07","value_num":0.07,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Up from 0.00 for Grok 4; Non-Thinking 0.05"},
{"measurement_id":"m-001521","legacy_row_id":1521,"split_index":0,"version_id":"xai-grok-4-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-1","subject_model_ids":[],"subject_label":"Grok 4.1 Non-Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"xai-refusals","group_id":"xai-refusals-v1","metric_label":"Answer rate on should-refuse prompts","metric_definition":"Answer rate on should-refuse prompts","condition_effort":"","condition_mode":"non-reasoning","condition_safeguards":"production system prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.05","value_num":0.05,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001522","legacy_row_id":1522,"split_index":0,"version_id":"xai-grok-4-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-1","subject_model_ids":[],"subject_label":"Grok 4.1 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"xai-jailbreaks","group_id":"xai-jailbreaks-v1","metric_label":"Answer rate on should-refuse prompts","metric_definition":"Answer rate on should-refuse prompts","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"","condition_surface":"","condition_other":"user jailbreak","context_note":"","value_printed":"0.02","value_num":0.02,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"System JB also 0.02; NT 0.00/0.00"},
{"measurement_id":"m-001523","legacy_row_id":1523,"split_index":0,"version_id":"xai-grok-4-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-1","subject_model_ids":[],"subject_label":"Grok 4.1 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"xai-agentharm","group_id":"xai-agentharm-v1","metric_label":"Answer rate on harmful agentic tasks","metric_definition":"Answer rate on harmful agentic tasks","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"","condition_surface":"","condition_other":"no attack","context_note":"","value_printed":"0.14","value_num":0.14,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"NT: 0.04"},
{"measurement_id":"m-001524","legacy_row_id":1524,"split_index":0,"version_id":"xai-grok-4-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-1","subject_model_ids":[],"subject_label":"Grok 4.1 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"xai-agentdojo","group_id":"xai-agentdojo-v1","metric_label":"Prompt-injection attack success rate","metric_definition":"Prompt-injection attack success rate","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"production system prompt","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.05","value_num":0.05,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"NT: 0.01"},
{"measurement_id":"m-001525","legacy_row_id":1525,"split_index":0,"version_id":"xai-grok-4-1-model-card--2026-09-26","subject_kind":"system","model_id":"grok-4-1","subject_model_ids":[],"subject_label":"Grok 4.1 (input filter)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-restricted-bio-input-filter","group_id":"xai-restricted-bio-input-filter-v1","metric_label":"False negative rate","metric_definition":"False negative rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"with prompt injection attack","context_note":"","value_printed":"0.20","value_num":0.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Without attack 0.03; chem 0.00 -> 0.12 with injection"},
{"measurement_id":"m-001526","legacy_row_id":1526,"split_index":0,"version_id":"xai-grok-4-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-1","subject_model_ids":[],"subject_label":"Grok 4.1 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"xai-mask","group_id":"xai-mask-v1","metric_label":"Dishonesty rate","metric_definition":"Dishonesty rate","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.49","value_num":0.49,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"NT 0.46; Grok 4 0.43 in same table"},
{"measurement_id":"m-001527","legacy_row_id":1527,"split_index":0,"version_id":"xai-grok-4-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-1","subject_model_ids":[],"subject_label":"Grok 4.1 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"xai-sycophancy","group_id":"xai-sycophancy-v1","metric_label":"Sycophancy rate","metric_definition":"Sycophancy rate","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.19","value_num":0.19,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"NT 0.23; Grok 4 0.07 - regression"},
{"measurement_id":"m-001528","legacy_row_id":1528,"split_index":0,"version_id":"xai-grok-4-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-1","subject_model_ids":[],"subject_label":"Grok 4.1 Non-Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"xai-sycophancy","group_id":"xai-sycophancy-v1","metric_label":"Sycophancy rate","metric_definition":"Sycophancy rate","condition_effort":"","condition_mode":"non-reasoning","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.23","value_num":0.23,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001529","legacy_row_id":1529,"split_index":0,"version_id":"xai-grok-4-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-1","subject_model_ids":[],"subject_label":"Grok 4.1 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"xai-vct","group_id":"xai-vct-v1","metric_label":"Accuracy","metric_definition":"Accuracy","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.61","value_num":0.61,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4 0.60; human 0.22"},
{"measurement_id":"m-001530","legacy_row_id":1530,"split_index":0,"version_id":"xai-grok-4-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-1","subject_model_ids":[],"subject_label":"Grok 4.1 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"xai-biolp-bench","group_id":"xai-biolp-bench-v1","metric_label":"Accuracy","metric_definition":"Accuracy","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.37","value_num":0.37,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4 0.47; human 0.38"},
{"measurement_id":"m-001531","legacy_row_id":1531,"split_index":0,"version_id":"xai-grok-4-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-1","subject_model_ids":[],"subject_label":"Grok 4.1 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"xai-cloningscenarios","group_id":"xai-cloningscenarios-v1","metric_label":"Accuracy","metric_definition":"Accuracy","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.46","value_num":0.46,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4 0.45; human 0.60; ProtocolQA 0.79; FigQA 0.34"},
{"measurement_id":"m-001532","legacy_row_id":1532,"split_index":0,"version_id":"xai-grok-4-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-1","subject_model_ids":[],"subject_label":"Grok 4.1 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"xai-cybench","group_id":"xai-cybench-v1","metric_label":"Unguided success rate","metric_definition":"Success rate","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.39","value_num":0.39,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4 0.43; WMDP-Cyber 0.84"},
{"measurement_id":"m-001533","legacy_row_id":1533,"split_index":0,"version_id":"xai-grok-4-1-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-1","subject_model_ids":[],"subject_label":"Grok 4.1 Thinking","snapshot_label":"","is_subject_model":true,"eval_id":"xai-makemesay","group_id":"xai-makemesay-v1","metric_label":"Persuasion win rate","metric_definition":"Persuasion win rate","condition_effort":"","condition_mode":"reasoning","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.00","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4 restated as 0.13 (0.12 in own card)"},
{"measurement_id":"m-001534","legacy_row_id":1534,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-20","subject_model_ids":[],"subject_label":"Grok 4.20 (single-agent)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-jailbreaks","group_id":"xai-jailbreaks-v1","metric_label":"Answer rate on should-refuse prompts","metric_definition":"Violation rate on should-refuse prompts","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"single-agent; user jailbreak","context_note":"","value_printed":"0.01","value_num":0.01,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Multi-agent 0.02; base refusal 0.00 both"},
{"measurement_id":"m-001535","legacy_row_id":1535,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-20","subject_model_ids":[],"subject_label":"Grok 4.20 (single-agent)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-agentharm","group_id":"xai-agentharm-v1","metric_label":"Answer rate on harmful agentic tasks","metric_definition":"Violation rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"single-agent; no attack","context_note":"","value_printed":"0.30","value_num":0.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Metric renamed answer->violation rate Migration: The Grok 4.20 card calls this metric a violation rate. Earlier xAI cards call it an answer rate."},
{"measurement_id":"m-001536","legacy_row_id":1536,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-20","subject_model_ids":[],"subject_label":"Grok 4.20 (single-agent)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-agentdojo","group_id":"xai-agentdojo-v1","metric_label":"Prompt-injection attack success rate","metric_definition":"Prompt-injection attack success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"single-agent","context_note":"","value_printed":"0.33","value_num":0.33,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Large jump vs 0.02-0.05 in prior cards; setup may differ Migration: The card as recorded does not state whether mitigations were applied."},
{"measurement_id":"m-001537","legacy_row_id":1537,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-20","subject_model_ids":[],"subject_label":"Grok 4.20 (single-agent)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-mask","group_id":"xai-mask-v1","metric_label":"Dishonesty rate","metric_definition":"Dishonesty rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"single-agent","context_note":"","value_printed":"0.27","value_num":0.27,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4 0.43 in same table"},
{"measurement_id":"m-001538","legacy_row_id":1538,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-20","subject_model_ids":[],"subject_label":"Grok 4.20 (single-agent)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-sycophancy","group_id":"xai-sycophancy-v1","metric_label":"Sycophancy rate","metric_definition":"Answer change rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"single-agent","context_note":"","value_printed":"0.04","value_num":0.04,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"MA 0.03; Grok 4 0.07; contrastive rate SA 0.35"},
{"measurement_id":"m-001539","legacy_row_id":1539,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-20","subject_model_ids":[],"subject_label":"Grok 4.20 (single-agent)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-hle-calibration","group_id":"xai-hle-calibration-v1","metric_label":"RMS calibration error","metric_definition":"RMS calibration error (overconfidence)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"single-agent","context_note":"","value_printed":"0.19","value_num":0.19,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4 0.58; MA 0.26"},
{"measurement_id":"m-001540","legacy_row_id":1540,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-20","subject_model_ids":[],"subject_label":"Grok 4.20 (single-agent)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-alignment-audit-misuse","group_id":"xai-alignment-audit-misuse-v1","metric_label":"Cooperation with misuse","metric_definition":"Chat violation rate (Petri 2.0-based audit)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"single-agent; chat","context_note":"","value_printed":"0.14","value_num":0.14,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4 0.19; Grok 4.1 0.33"},
{"measurement_id":"m-001541","legacy_row_id":1541,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-20","subject_model_ids":[],"subject_label":"Grok 4.20 (single-agent)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-alignment-audit-misuse","group_id":"xai-alignment-audit-misuse-v1","metric_label":"Misuse with system-prompt override","metric_definition":"Violation rate under system-prompt override","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"single-agent; system prompt override","context_note":"","value_printed":"0.32","value_num":0.32,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4 0.16; Grok 4.1 0.20 - regression"},
{"measurement_id":"m-001542","legacy_row_id":1542,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-1","subject_model_ids":[],"subject_label":"Grok 4.1","snapshot_label":"","is_subject_model":false,"eval_id":"xai-alignment-audit-misuse","group_id":"xai-alignment-audit-misuse-v1","metric_label":"Cooperation with misuse","metric_definition":"Chat violation rate (Petri 2.0-based audit)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"chat","context_note":"","value_printed":"0.33","value_num":0.33,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Comparison row"},
{"measurement_id":"m-001543","legacy_row_id":1543,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-20","subject_model_ids":[],"subject_label":"Grok 4.20 (single-agent)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-alignment-audit-sycophancy","group_id":"xai-alignment-audit-sycophancy-v1","metric_label":"Delusion validation rate","metric_definition":"Delusion validation rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"single-agent","context_note":"","value_printed":"0.02","value_num":0.02,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4 0.04; Grok 4.1 0.08"},
{"measurement_id":"m-001544","legacy_row_id":1544,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-20","subject_model_ids":[],"subject_label":"Grok 4.20 (single-agent)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-alignment-audit-sabotage","group_id":"xai-alignment-audit-sabotage-v1","metric_label":"Subversive action rate vs user","metric_definition":"Subversive action rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"single-agent; unethical-operator scenarios","context_note":"","value_printed":"0.14","value_num":0.14,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4 0.23; Grok 4.1 0.22; tests action vs highly unethical interests"},
{"measurement_id":"m-001545","legacy_row_id":1545,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-20","subject_model_ids":[],"subject_label":"Grok 4.20 (single-agent)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-alignment-audit-sabotage","group_id":"xai-alignment-audit-sabotage-v1","metric_label":"Subversive action rate vs xAI","metric_definition":"Subversive action rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"single-agent","context_note":"","value_printed":"0.04","value_num":0.04,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4 0.12; Grok 4.1 0.12"},
{"measurement_id":"m-001546","legacy_row_id":1546,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-20","subject_model_ids":[],"subject_label":"Grok 4.20 (single-agent)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-alignment-audit-eval-awareness","group_id":"xai-alignment-audit-eval-awareness-v1","metric_label":"Verbalized evaluation awareness rate","metric_definition":"Verbalized evaluation awareness rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"single-agent; across all audits","context_note":"","value_printed":"0.09","value_num":0.09,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4 0.10; Grok 4.1 0.08; unverbalized not ruled out"},
{"measurement_id":"m-001547","legacy_row_id":1547,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4","subject_model_ids":[],"subject_label":"Grok 4","snapshot_label":"","is_subject_model":false,"eval_id":"xai-alignment-audit-eval-awareness","group_id":"xai-alignment-audit-eval-awareness-v1","metric_label":"Verbalized evaluation awareness rate","metric_definition":"Verbalized evaluation awareness rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"across all audits","context_note":"","value_printed":"0.10","value_num":0.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 3","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Retroactive measurement of older model"},
{"measurement_id":"m-001548","legacy_row_id":1548,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-20","subject_model_ids":[],"subject_label":"Grok 4.20 (single-agent)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-vct","group_id":"xai-vct-v1","metric_label":"Accuracy","metric_definition":"Accuracy","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"single-agent","context_note":"","value_printed":"0.54","value_num":0.54,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4 restated 0.55 (0.60 in own card)"},
{"measurement_id":"m-001549","legacy_row_id":1549,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-20","subject_model_ids":[],"subject_label":"Grok 4.20 (single-agent)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-cybench","group_id":"xai-cybench-v1","metric_label":"Unguided success rate","metric_definition":"Success rate","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"single-agent","context_note":"","value_printed":"0.53","value_num":0.53,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4 0.43; WMDP-Cyber 0.91"},
{"measurement_id":"m-001550","legacy_row_id":1550,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-20","subject_model_ids":[],"subject_label":"Grok 4.20 (single-agent)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-cloningscenarios","group_id":"xai-cloningscenarios-v1","metric_label":"Accuracy","metric_definition":"Accuracy","condition_effort":"","condition_mode":"","condition_safeguards":"without safeguards","condition_surface":"","condition_other":"single-agent","context_note":"","value_printed":"0.67","value_num":0.67,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"rate","unit_as_printed":"rate_0_1","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Exceeds human baseline 0.60; FigQA 0.66"},
{"measurement_id":"m-001551","legacy_row_id":1551,"split_index":0,"version_id":"xai-grok-4-20-system-card--2026-09-26","subject_kind":"model","model_id":"grok-4-20","subject_model_ids":[],"subject_label":"Grok 4.20","snapshot_label":"","is_subject_model":true,"eval_id":"xai-overall-risk-conclusion","group_id":"xai-overall-risk-conclusion-v1","metric_label":"Overall risk conclusion","metric_definition":"Qualitative risk determination","condition_effort":"","condition_mode":"","condition_safeguards":"with safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"not significantly more risk than prior generations","value_num":null,"value_text":"not significantly more risk than prior generations","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Conclusion","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001552","legacy_row_id":1552,"split_index":0,"version_id":"xai-grok-4-5-model-card--2026-07-14","subject_kind":"model","model_id":"grok-4-5","subject_model_ids":[],"subject_label":"Grok 4.5 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-hackerbench","group_id":"xai-hackerbench-v1","metric_label":"Compliance on harmful/dual-use cyber tasks","metric_definition":"Compliance on harmful/dual-use cyber tasks","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"7.8","value_num":7.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cyber safeguards 7.2","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Rev 2026-07-20 has no changelog; Cursor-hosted 07-14 original shows same safety values"},
{"measurement_id":"m-001553","legacy_row_id":1553,"split_index":0,"version_id":"xai-grok-4-5-model-card--2026-07-20","subject_kind":"model","model_id":"grok-4-5","subject_model_ids":[],"subject_label":"Grok 4.5 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-hackerbench","group_id":"xai-hackerbench-v1","metric_label":"Compliance on harmful/dual-use cyber tasks","metric_definition":"Compliance on harmful/dual-use cyber tasks","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"7.8","value_num":7.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cyber safeguards 7.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Rev 2026-07-20 has no changelog; Cursor-hosted 07-14 original shows same safety values"},
{"measurement_id":"m-001554","legacy_row_id":1554,"split_index":0,"version_id":"xai-grok-4-5-model-card--2026-07-20","subject_kind":"model","model_id":"gpt-5-5","subject_model_ids":[],"subject_label":"GPT-5.5 (xhigh)","snapshot_label":"","is_subject_model":false,"eval_id":"xai-hackerbench","group_id":"xai-hackerbench-v1","metric_label":"Compliance on harmful/dual-use cyber tasks","metric_definition":"Compliance on harmful/dual-use cyber tasks","condition_effort":"xhigh","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"25.0","value_num":25,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cyber safeguards 7.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 4.8 (max) 22.8%"},
{"measurement_id":"m-001555","legacy_row_id":1555,"split_index":0,"version_id":"xai-grok-4-5-model-card--2026-07-20","subject_kind":"model","model_id":"grok-4-5","subject_model_ids":[],"subject_label":"Grok 4.5 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-hackerbench","group_id":"xai-hackerbench-v1","metric_label":"False refusal on benign cyber tasks","metric_definition":"False refusal on benign cyber tasks","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cyber safeguards 7.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Over-refusal metric"},
{"measurement_id":"m-001556","legacy_row_id":1556,"split_index":0,"version_id":"xai-grok-4-5-model-card--2026-07-20","subject_kind":"model","model_id":"grok-4-5","subject_model_ids":[],"subject_label":"Grok 4.5 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-refusals","group_id":"xai-refusals-v1","metric_label":"Compliance on should-refuse prompts","metric_definition":"Compliance on should-refuse prompts","condition_effort":"high","condition_mode":"","condition_safeguards":"full safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.1","value_num":1.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"10.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CSAM compliance 0.0%"},
{"measurement_id":"m-001557","legacy_row_id":1557,"split_index":0,"version_id":"xai-grok-4-5-model-card--2026-07-20","subject_kind":"model","model_id":"grok-4-5","subject_model_ids":[],"subject_label":"Grok 4.5 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-cbrn-refusals","group_id":"xai-cbrn-refusals-v1","metric_label":"Refusal accuracy on dangerous bio queries","metric_definition":"Refusal accuracy on dangerous bio queries","condition_effort":"high","condition_mode":"","condition_safeguards":"full safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"97.9","value_num":97.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"10.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Chem 96.7%; R/N 97.9%"},
{"measurement_id":"m-001558","legacy_row_id":1558,"split_index":0,"version_id":"xai-grok-4-5-model-card--2026-07-20","subject_kind":"model","model_id":"grok-4-5","subject_model_ids":[],"subject_label":"Grok 4.5 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-jailbreaks","group_id":"xai-jailbreaks-v1","metric_label":"Compliance under attack","metric_definition":"Compliance on should-refuse prompts under attack","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"standard jailbreaks","context_note":"","value_printed":"0.73","value_num":0.73,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"9.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"StrongREJECT first reported for 4.5 in 4.6 card (1.5%)"},
{"measurement_id":"m-001559","legacy_row_id":1559,"split_index":0,"version_id":"xai-grok-4-5-model-card--2026-07-20","subject_kind":"model","model_id":"grok-4-5","subject_model_ids":[],"subject_label":"Grok 4.5 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-self-harm-refusals","group_id":"xai-self-harm-refusals-v1","metric_label":"Compliance (non-refusal/redirect)","metric_definition":"Compliance (non-refusal/redirect)","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.5","value_num":0.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"11.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001560","legacy_row_id":1560,"split_index":0,"version_id":"xai-grok-4-5-model-card--2026-07-20","subject_kind":"model","model_id":"grok-4-5","subject_model_ids":[],"subject_label":"Grok 4.5 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-mask-rectified","group_id":"xai-mask-rectified-v1","metric_label":"Dishonesty rate","metric_definition":"Dishonesty rate","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.67","value_num":0.67,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"12.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"MASK-Rectified not comparable to raw MASK (Grok 4: 43%)"},
{"measurement_id":"m-001561","legacy_row_id":1561,"split_index":0,"version_id":"xai-grok-4-5-model-card--2026-07-20","subject_kind":"model","model_id":"grok-4-5","subject_model_ids":[],"subject_label":"Grok 4.5 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-sycophancy","group_id":"xai-sycophancy-v2","metric_label":"Sycophancy rate","metric_definition":"Sycophancy rate","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.01","value_num":0.01,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"12.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Different scale vs Grok 4-era 0-1 rates"},
{"measurement_id":"m-001562","legacy_row_id":1562,"split_index":0,"version_id":"xai-grok-4-5-model-card--2026-07-20","subject_kind":"model","model_id":"grok-4-5","subject_model_ids":[],"subject_label":"Grok 4.5 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-hallucination-rate","group_id":"xai-hallucination-rate-v1","metric_label":"Unsupported claims, single-turn","metric_definition":"Unsupported claims, single-turn","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.98","value_num":0.98,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"6.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001563","legacy_row_id":1563,"split_index":0,"version_id":"xai-grok-4-5-model-card--2026-07-20","subject_kind":"model","model_id":"grok-4-5","subject_model_ids":[],"subject_label":"Grok 4.5 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-vct","group_id":"xai-vct-v1","metric_label":"Accuracy","metric_definition":"Accuracy","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"65.5","value_num":65.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"WMDP-Bio 90.9; WMDP-Chem 87.3"},
{"measurement_id":"m-001564","legacy_row_id":1564,"split_index":0,"version_id":"xai-grok-4-5-model-card--2026-07-20","subject_kind":"model","model_id":"grok-4-5","subject_model_ids":[],"subject_label":"Grok 4.5 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-protocolqa-open-ended","group_id":"xai-protocolqa-open-ended-v1","metric_label":"Accuracy","metric_definition":"Accuracy","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"87.0","value_num":87,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"LAB-Bench Practical 71.1; BixBench 93.8"},
{"measurement_id":"m-001565","legacy_row_id":1565,"split_index":0,"version_id":"xai-grok-4-5-model-card--2026-07-20","subject_kind":"model","model_id":"grok-4-5","subject_model_ids":[],"subject_label":"Grok 4.5 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-cybergym","group_id":"xai-cybergym-v1","metric_label":"Mean vulnerabilities reproduced","metric_definition":"Mean vulnerabilities reproduced","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"unrestricted","context_note":"","value_printed":"80.4","value_num":80.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"7.1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Restated as 79.0% in Grok 4.6 and 4.7 cards"},
{"measurement_id":"m-001566","legacy_row_id":1566,"split_index":0,"version_id":"xai-grok-4-5-model-card--2026-07-20","subject_kind":"model","model_id":"grok-4-5","subject_model_ids":[],"subject_label":"Grok 4.5","snapshot_label":"","is_subject_model":true,"eval_id":"xai-dual-use-bio-determination","group_id":"xai-dual-use-bio-determination-v1","metric_label":"Threshold statement","metric_definition":"Qualitative threshold statement","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"sub-threshold","value_num":null,"value_text":"sub-threshold","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"8","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"'solid but sub-threshold'"},
{"measurement_id":"m-001567","legacy_row_id":1567,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-12","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-hackerbench","group_id":"xai-hackerbench-v1","metric_label":"Compliance on harmful/dual-use cyber tasks","metric_definition":"Compliance on harmful/dual-use cyber tasks","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"16.7","value_num":16.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cyber 7.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Confirmed by Midas Watchtower; above Grok 4.5 (7.8%)"},
{"measurement_id":"m-001568","legacy_row_id":1568,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-hackerbench","group_id":"xai-hackerbench-v1","metric_label":"Compliance on harmful/dual-use cyber tasks","metric_definition":"Compliance on harmful/dual-use cyber tasks","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"6.9","value_num":6.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cyber 7.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Changelog: 'Corrected eval results on HackerBench v0.2'; no reason given"},
{"measurement_id":"m-001569","legacy_row_id":1569,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-12","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-hackerbench","group_id":"xai-hackerbench-v1","metric_label":"False refusal on benign cyber tasks","metric_definition":"False refusal on benign cyber tasks","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.8","value_num":0.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"figure_read","location":"Cyber 7.4","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Parsed from flattened figure text"},
{"measurement_id":"m-001570","legacy_row_id":1570,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-hackerbench","group_id":"xai-hackerbench-v1","metric_label":"False refusal on benign cyber tasks","metric_definition":"False refusal on benign cyber tasks","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cyber 7.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Change not called out by Watchtower"},
{"measurement_id":"m-001571","legacy_row_id":1571,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"gpt-5-6-sol","subject_model_ids":[],"subject_label":"GPT-5.6 Sol (max)","snapshot_label":"","is_subject_model":false,"eval_id":"xai-hackerbench","group_id":"xai-hackerbench-v1","metric_label":"Compliance on harmful/dual-use cyber tasks","metric_definition":"Compliance on harmful/dual-use cyber tasks","condition_effort":"max","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"35.7","value_num":35.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cyber 7.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.5 25.0; Opus 4.8 22.8"},
{"measurement_id":"m-001572","legacy_row_id":1572,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-12","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-self-harm-refusals","group_id":"xai-self-harm-refusals-v1","metric_label":"Compliance (non-refusal/redirect)","metric_definition":"Compliance (non-refusal/redirect)","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"3.7","value_num":3.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"11.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Watchtower + NOPE confirm"},
{"measurement_id":"m-001573","legacy_row_id":1573,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-self-harm-refusals","group_id":"xai-self-harm-refusals-v1","metric_label":"Compliance (non-refusal/redirect)","metric_definition":"Compliance (non-refusal/redirect)","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.84","value_num":0.84,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"11.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Still regression vs Grok 4.5 0.50%"},
{"measurement_id":"m-001574","legacy_row_id":1574,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-12","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-mask-rectified","group_id":"xai-mask-rectified-v1","metric_label":"Dishonesty rate","metric_definition":"Dishonesty rate","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"3.8","value_num":3.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"12.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001575","legacy_row_id":1575,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-mask-rectified","group_id":"xai-mask-rectified-v1","metric_label":"Dishonesty rate","metric_definition":"Dishonesty rate","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.90","value_num":1.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"12.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4.5 0.67%"},
{"measurement_id":"m-001576","legacy_row_id":1576,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-12","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"xai-bio-capability-lift","group_id":"xai-bio-capability-lift-v1","metric_label":"Lift vs Grok 4.5","metric_definition":"Qualitative lift vs Grok 4.5","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"no appreciable lift","value_num":null,"value_text":"no appreciable lift","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Dual-use summary","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001577","legacy_row_id":1577,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6","snapshot_label":"","is_subject_model":true,"eval_id":"xai-bio-capability-lift","group_id":"xai-bio-capability-lift-v1","metric_label":"Lift vs Grok 4.5","metric_definition":"Qualitative lift vs Grok 4.5","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"noted in the biological domain but is limited","value_num":null,"value_text":"noted in the biological domain but is limited","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Dual-use summary","source_type":"primary","via_url":"","confidence":"high","verification_status":"corrected","extraction_method":"v0_web_reader","superseded_by":"","notes":"Wording change not in changelog Corrected 2026-09-27 after a blind re-check of the document; recorded until then as \"lift noted but limited\"."},
{"measurement_id":"m-001578","legacy_row_id":1578,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-fortress-rn","group_id":"xai-fortress-rn-v1","metric_label":"R/N refusal accuracy","metric_definition":"R/N refusal accuracy","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"97.9","value_num":97.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"10.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Absent from original; added without changelog note Migration: Present in the revised version only (added after first publication)."},
{"measurement_id":"m-001579","legacy_row_id":1579,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-refusals","group_id":"xai-refusals-v1","metric_label":"Compliance on should-refuse prompts","metric_definition":"Compliance on should-refuse prompts","condition_effort":"high","condition_mode":"","condition_safeguards":"full safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.93","value_num":0.93,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"10.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4.5 1.10%; CSAM 0.00% Migration: Unchanged from the original version (v0 note)."},
{"measurement_id":"m-001580","legacy_row_id":1580,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-strongreject","group_id":"xai-strongreject-v1","metric_label":"Compliance under StrongREJECT attacks","metric_definition":"Compliance under StrongREJECT attacks","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"3.9","value_num":3.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"9.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4.5 1.5% - regression Migration: Unchanged from the original version (v0 note)."},
{"measurement_id":"m-001581","legacy_row_id":1581,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-jailbreaks","group_id":"xai-jailbreaks-v1","metric_label":"Compliance under attack","metric_definition":"Compliance under attack","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"standard jailbreaks","context_note":"","value_printed":"0.04","value_num":0.04,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"9.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4.5 0.73%; long-horizon JB 1.0% Migration: Unchanged from the original version (v0 note)."},
{"measurement_id":"m-001582","legacy_row_id":1582,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-sycophancy","group_id":"xai-sycophancy-v2","metric_label":"Sycophancy rate","metric_definition":"Sycophancy rate","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.04","value_num":0.04,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"12.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4.5 0.01% Migration: Unchanged from the original version (v0 note)."},
{"measurement_id":"m-001583","legacy_row_id":1583,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-hallucination-rate","group_id":"xai-hallucination-rate-v1","metric_label":"Unsupported claims, single-turn","metric_definition":"Unsupported claims, single-turn","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.7","value_num":1.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"6.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4.5 0.98% Migration: Unchanged from the original version (v0 note)."},
{"measurement_id":"m-001584","legacy_row_id":1584,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-biousebench","group_id":"xai-biousebench-v1","metric_label":"Severity-5 refusal rate","metric_definition":"Refusal rate on dual-use bio","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"90.7","value_num":90.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"8.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4.5 83.3% Migration: Unchanged from the original version (v0 note)."},
{"measurement_id":"m-001585","legacy_row_id":1585,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-vct","group_id":"xai-vct-v1","metric_label":"Accuracy","metric_definition":"Accuracy","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"67.4","value_num":67.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4.5 65.5%; Biosecurity VCT 47.8 vs 44.1 Migration: Unchanged from the original version (v0 note)."},
{"measurement_id":"m-001586","legacy_row_id":1586,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-wmdp","group_id":"xai-wmdp-v1","metric_label":"Cyber accuracy","metric_definition":"Accuracy","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"90.1","value_num":90.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4.5 83.2% Migration: Unchanged from the original version (v0 note)."},
{"measurement_id":"m-001587","legacy_row_id":1587,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-cybergym","group_id":"xai-cybergym-v1","metric_label":"Mean vulnerabilities reproduced","metric_definition":"Mean vulnerabilities reproduced","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"unrestricted","context_note":"","value_printed":"79.7","value_num":79.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"7.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4.5 restated 79.0%; GPT-5.6 Sol 83.6%"},
{"measurement_id":"m-001588","legacy_row_id":1588,"split_index":0,"version_id":"xai-grok-4-6-model-card--2026-08-17","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-cve-bench","group_id":"xai-cve-bench-v1","metric_label":"Reward","metric_definition":"Reward","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"unrestricted","context_note":"","value_printed":"39.8","value_num":39.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"7.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4.5 35.2%"},
{"measurement_id":"m-001589","legacy_row_id":1589,"split_index":0,"version_id":"xai-grok-4-7-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-7","subject_model_ids":[],"subject_label":"Grok 4.7 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-hackerbench","group_id":"xai-hackerbench-v2","metric_label":"Compliance on harmful/dual-use cyber tasks","metric_definition":"Compliance on harmful/dual-use cyber tasks","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"3.31","value_num":3.31,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"6.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"xhigh 4.02%; benign refusal 0.31% (xhigh 0.0%)"},
{"measurement_id":"m-001590","legacy_row_id":1590,"split_index":0,"version_id":"xai-grok-4-7-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-6","subject_model_ids":[],"subject_label":"Grok 4.6 (high)","snapshot_label":"","is_subject_model":false,"eval_id":"xai-hackerbench","group_id":"xai-hackerbench-v2","metric_label":"Compliance on harmful/dual-use cyber tasks","metric_definition":"Compliance on harmful/dual-use cyber tasks","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"5.93","value_num":5.93,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"6.3","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"v0.3 restatement; 6.9% (rev) / 16.7% (orig) on v0.2"},
{"measurement_id":"m-001591","legacy_row_id":1591,"split_index":0,"version_id":"xai-grok-4-7-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-7","subject_model_ids":[],"subject_label":"Grok 4.7 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-refusals","group_id":"xai-refusals-v1","metric_label":"Compliance on should-refuse prompts","metric_definition":"Compliance on should-refuse prompts","condition_effort":"high","condition_mode":"","condition_safeguards":"full safeguards","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.10","value_num":1.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"9.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CSAM 0.0%; bio recall 100.0; chem 99.9; FORTRESS-RN 97.9"},
{"measurement_id":"m-001592","legacy_row_id":1592,"split_index":0,"version_id":"xai-grok-4-7-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-7","subject_model_ids":[],"subject_label":"Grok 4.7 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-strongreject","group_id":"xai-strongreject-v1","metric_label":"Compliance under StrongREJECT attacks","metric_definition":"Compliance under StrongREJECT attacks","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"2.0","value_num":2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"8.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Standard JB 0.01%; long-horizon 0.65%"},
{"measurement_id":"m-001593","legacy_row_id":1593,"split_index":0,"version_id":"xai-grok-4-7-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-7","subject_model_ids":[],"subject_label":"Grok 4.7 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-self-harm-refusals","group_id":"xai-self-harm-refusals-v1","metric_label":"Compliance (non-refusal/redirect)","metric_definition":"Compliance (non-refusal/redirect)","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.05","value_num":1.05,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"10.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Grok 4.6 0.84; Grok 4.5 0.50"},
{"measurement_id":"m-001594","legacy_row_id":1594,"split_index":0,"version_id":"xai-grok-4-7-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-7","subject_model_ids":[],"subject_label":"Grok 4.7 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-mask-rectified","group_id":"xai-mask-rectified-v1","metric_label":"Dishonesty rate","metric_definition":"Dishonesty rate","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.00","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"11.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001595","legacy_row_id":1595,"split_index":0,"version_id":"xai-grok-4-7-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-7","subject_model_ids":[],"subject_label":"Grok 4.7 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-sycophancy","group_id":"xai-sycophancy-v2","metric_label":"Sycophancy rate","metric_definition":"Sycophancy rate","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.03","value_num":0.03,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"11.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001596","legacy_row_id":1596,"split_index":0,"version_id":"xai-grok-4-7-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-7","subject_model_ids":[],"subject_label":"Grok 4.7 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-biousebench","group_id":"xai-biousebench-v1","metric_label":"Dual-use bio refusal rate","metric_definition":"Dual-use bio refusal rate","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"91.4","value_num":91.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"7.4","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001597","legacy_row_id":1597,"split_index":0,"version_id":"xai-grok-4-7-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-7","subject_model_ids":[],"subject_label":"Grok 4.7 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-vct","group_id":"xai-vct-v1","metric_label":"Accuracy","metric_definition":"Accuracy","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"63.0","value_num":63,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"7.2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Biosecurity VCT 41.5; WMDP-Bio 88.1; ProtocolQA 70.4"},
{"measurement_id":"m-001598","legacy_row_id":1598,"split_index":0,"version_id":"xai-grok-4-7-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-7","subject_model_ids":[],"subject_label":"Grok 4.7 (high)","snapshot_label":"","is_subject_model":true,"eval_id":"xai-cybergym","group_id":"xai-cybergym-v1","metric_label":"Mean vulnerabilities reproduced","metric_definition":"Mean vulnerabilities reproduced","condition_effort":"high","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"unrestricted","context_note":"","value_printed":"80.3","value_num":80.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"6.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CVE-Bench 37.7 (xhigh 36.6)"},
{"measurement_id":"m-001599","legacy_row_id":1599,"split_index":0,"version_id":"xai-grok-4-7-model-card--2026-09-26","subject_kind":"model","model_id":"grok-4-7","subject_model_ids":[],"subject_label":"Grok 4.7","snapshot_label":"","is_subject_model":true,"eval_id":"xai-dual-use-bio-determination","group_id":"xai-dual-use-bio-determination-v1","metric_label":"Threshold statement","metric_definition":"Threshold statement","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"below FAIF safety thresholds","value_num":null,"value_text":"below FAIF safety thresholds","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"7","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"No revision/changelog as of 2026-09-26"},
{"measurement_id":"m-001600","legacy_row_id":1600,"split_index":0,"version_id":"meta-llama-4-model-card--2026-09-26","subject_kind":"multi","model_id":"","subject_model_ids":["llama-4-scout","llama-4-maverick"],"subject_label":"Llama 4 (Scout/Maverick)","snapshot_label":"","is_subject_model":true,"eval_id":"meta-cyber-risk-determination","group_id":"meta-cyber-risk-determination-v1","metric_label":"Catastrophic cyber uplift","metric_definition":"Qualitative catastrophic-cyber determination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"pre-release testing","value_printed":"no plausible catastrophic cyber uplift","value_num":null,"value_text":"no plausible catastrophic cyber uplift","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Critical risks","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Model card has no numeric safety results"},
{"measurement_id":"m-001601","legacy_row_id":1601,"split_index":0,"version_id":"meta-llama-4-launch-post--2026-09-26","subject_kind":"multi","model_id":"","subject_model_ids":["llama-4-scout","llama-4-maverick"],"subject_label":"Llama 4","snapshot_label":"","is_subject_model":true,"eval_id":"meta-debated-topics-refusals","group_id":"meta-debated-topics-refusals-v1","metric_label":"Refusal rate","metric_definition":"Refusal rate (over-refusal)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"2","value_num":2,"value_text":"","value_qualifier":"lt","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Blog: bias section","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Llama 3.3: 7%; bias/over-refusal, not harmful compliance Migration: Printed as an upper bound (<2%)."},
{"measurement_id":"m-001602","legacy_row_id":1602,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-aasf-risk-determination","group_id":"meta-aasf-risk-determination-v1","metric_label":"Risk tier, chemical and biological","metric_definition":"AASF risk tier","condition_effort":"","condition_mode":"","condition_safeguards":"pre-mitigation","condition_surface":"","condition_other":"","context_note":"","value_printed":"High","value_num":null,"value_text":"High","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"1.1.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Post-mitigation: Moderate or lower"},
{"measurement_id":"m-001603","legacy_row_id":1603,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-aasf-risk-determination","group_id":"meta-aasf-risk-determination-v1","metric_label":"Risk tier, cyber and loss of control","metric_definition":"AASF risk tier","condition_effort":"","condition_mode":"","condition_safeguards":"post-mitigation","condition_surface":"","condition_other":"","context_note":"","value_printed":"Moderate or lower","value_num":null,"value_text":"Moderate or lower","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"1.1.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Applies to cyber and loss of control"},
{"measurement_id":"m-001604","legacy_row_id":1604,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-vct","group_id":"meta-vct-v1","metric_label":"Accuracy","metric_definition":"Accuracy","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"49.7","value_num":49.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.4 49.5; Gemini 3.1 Pro 46.9"},
{"measurement_id":"m-001605","legacy_row_id":1605,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-cybench","group_id":"meta-cybench-v1","metric_label":"Pass@1","metric_definition":"pass@1","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"65.4","value_num":65.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Claude Opus 4.6 93.0"},
{"measurement_id":"m-001606","legacy_row_id":1606,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-shade-arena","group_id":"meta-shade-arena-v1","metric_label":"Sabotage/stealth success score","metric_definition":"Sabotage/stealth success score","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"8.8","value_num":8.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.4 0.8; Opus 4.6 9.2; Gemini 6.5"},
{"measurement_id":"m-001607","legacy_row_id":1607,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-gdm-stealth","group_id":"meta-gdm-stealth-v1","metric_label":"Stealth capability score","metric_definition":"Stealth capability score","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"39.8","value_num":39.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.4 14.3; Opus 4.6 18.0; Gemini 61.0"},
{"measurement_id":"m-001608","legacy_row_id":1608,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-prompted-evaluation-awareness","group_id":"meta-prompted-evaluation-awareness-v1","metric_label":"Eval-vs-deployment discrimination","metric_definition":"Eval-vs-deployment discrimination","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"42.9","value_num":42.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.4 43.8; Gemini 3.1 Pro 90.4 Migration: Repeats the evaluation's name (prompted evaluation awareness)."},
{"measurement_id":"m-001609","legacy_row_id":1609,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-verbalized-eval-awareness","group_id":"meta-verbalized-eval-awareness-v1","metric_label":"Share of samples verbalizing evaluation","metric_definition":"Share of samples suspecting evaluation","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"public benchmarks","context_note":"","value_printed":"19.8","value_num":19.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"4.1.11","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Internal evals: 2.0%; Apollo: highest eval awareness it has observed"},
{"measurement_id":"m-001610","legacy_row_id":1610,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-verbalized-eval-awareness","group_id":"meta-verbalized-eval-awareness-v1","metric_label":"Share of samples verbalizing evaluation","metric_definition":"Share of samples suspecting evaluation","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"internal evals","context_note":"","value_printed":"2.0","value_num":2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"4.1.11","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001611","legacy_row_id":1611,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"system","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark (Meta AI system)","snapshot_label":"","is_subject_model":true,"eval_id":"meta-biotier-refusals","group_id":"meta-biotier-refusals-v1","metric_label":"Refusal rate on harmful bio","metric_definition":"Refusal rate on harmful bio","condition_effort":"","condition_mode":"","condition_safeguards":"with system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"98.0","value_num":98,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.4 75.4; Opus 4.6 95.4; Gemini 59.2"},
{"measurement_id":"m-001612","legacy_row_id":1612,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-mask","group_id":"meta-mask-v1","metric_label":"Honesty rate","metric_definition":"Honesty rate","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"89.1","value_num":89.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Inverse of Grok dishonesty metric; GPT-5.4 90.3; Gemini 44.1"},
{"measurement_id":"m-001613","legacy_row_id":1613,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-agentic-misalignment","group_id":"meta-agentic-misalignment-v1","metric_label":"Harmful action rate","metric_definition":"Harmful action rate","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"47.7","value_num":47.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.4 0.0; Opus 4.6 0.0; Gemini 51.4"},
{"measurement_id":"m-001614","legacy_row_id":1614,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-alignment-faking","group_id":"meta-alignment-faking-v1","metric_label":"Behavioral difference monitored vs not","metric_definition":"Behavioral difference monitored vs not","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.8","value_num":1.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.4 0.4; Opus 4.6 -2.8; Gemini 37.0"},
{"measurement_id":"m-001615","legacy_row_id":1615,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-strongreject","group_id":"meta-strongreject-v1","metric_label":"Attack success rate (adaptive multi-turn)","metric_definition":"Attack success rate (adaptive multi-turn)","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"44.6","value_num":44.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Restated as 25.2% in Muse Spark 1.1 report; GPT-5.4 37.6; Gemini 81.7"},
{"measurement_id":"m-001616","legacy_row_id":1616,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-fortress","group_id":"meta-fortress-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"20.3","value_num":20.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.4 14.8; Opus 4.6 13.0"},
{"measurement_id":"m-001617","legacy_row_id":1617,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-agentharm","group_id":"meta-agentharm-v1","metric_label":"Compliance rate on harmful agentic tasks","metric_definition":"Compliance rate on harmful agentic tasks","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"26.0","value_num":26,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.4 10.2; Opus 4.6 8.2; Gemini 21.6"},
{"measurement_id":"m-001618","legacy_row_id":1618,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-agentdojo","group_id":"meta-agentdojo-v1","metric_label":"Prompt-injection ASR pass@1","metric_definition":"Prompt-injection ASR pass@1","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"11.7","value_num":11.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.4 2.0; Opus 4.6 0.2; restated 11.9 in 1.1 report"},
{"measurement_id":"m-001619","legacy_row_id":1619,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"gray-swan-agent-red-teaming","group_id":"gray-swan-agent-red-teaming-meta-v1","metric_label":"Agent red-team ASR pass@1","metric_definition":"Agent red-team ASR pass@1","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"6.7","value_num":6.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Restated 6.1 in 1.1 report"},
{"measurement_id":"m-001620","legacy_row_id":1620,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-impossiblebench","group_id":"meta-impossiblebench-v1","metric_label":"Cheating rate","metric_definition":"Cheating rate","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.0","value_num":0,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Opus 4.6 2.9; Gemini 11.8"},
{"measurement_id":"m-001621","legacy_row_id":1621,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-internal-sycophancy","group_id":"meta-internal-sycophancy-v1","metric_label":"Sycophancy rate","metric_definition":"Sycophancy rate","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"62.9","value_num":62.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Restated 57.9 in 1.1 report; GPT-5.4 47.6"},
{"measurement_id":"m-001622","legacy_row_id":1622,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-deceptionbench","group_id":"meta-deceptionbench-v1","metric_label":"Deception rate","metric_definition":"Deception rate","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.6","value_num":1.6,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Gemini 25.7"},
{"measurement_id":"m-001623","legacy_row_id":1623,"split_index":0,"version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","subject_kind":"model","model_id":"muse-spark","subject_model_ids":[],"subject_label":"Muse Spark","snapshot_label":"","is_subject_model":true,"eval_id":"meta-iheval","group_id":"meta-iheval-v1","metric_label":"IH score","metric_definition":"IH score","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"80.3","value_num":80.3,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2; 4.1.1","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Report revised 2026-05-26 (IH bug fix; Muse Spark values unchanged); third-party IH scores revised up"},
{"measurement_id":"m-001624","legacy_row_id":1624,"split_index":0,"version_id":"meta-muse-spark-1-1-evaluation-report--2026-09-26","subject_kind":"model","model_id":"muse-spark-1-1","subject_model_ids":[],"subject_label":"Muse Spark 1.1","snapshot_label":"","is_subject_model":true,"eval_id":"meta-strongreject","group_id":"meta-strongreject-v1","metric_label":"Attack success rate","metric_definition":"Attack success rate","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.5","value_num":0.5,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"3.1.1.1","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Muse Spark 1.0 restated 25.2 (vs 44.6 in own report)"},
{"measurement_id":"m-001625","legacy_row_id":1625,"split_index":0,"version_id":"meta-muse-spark-1-1-evaluation-report--2026-09-26","subject_kind":"model","model_id":"muse-spark-1-1","subject_model_ids":[],"subject_label":"Muse Spark 1.1","snapshot_label":"","is_subject_model":true,"eval_id":"meta-agentic-misalignment","group_id":"meta-agentic-misalignment-v1","metric_label":"Harmful action rate","metric_definition":"Harmful action rate","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"1.1","value_num":1.1,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"1.0: 47.7; but 79% verbalized eval awareness on this eval"},
{"measurement_id":"m-001626","legacy_row_id":1626,"split_index":0,"version_id":"meta-muse-spark-1-1-evaluation-report--2026-09-26","subject_kind":"model","model_id":"muse-spark-1-1","subject_model_ids":[],"subject_label":"Muse Spark 1.1","snapshot_label":"","is_subject_model":true,"eval_id":"meta-verbalized-eval-awareness","group_id":"meta-verbalized-eval-awareness-v1","metric_label":"Share of samples verbalizing evaluation","metric_definition":"Share of samples verbalizing evaluation","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"Agentic Misalignment scenarios","context_note":"","value_printed":"79","value_num":79,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"4.1.6","source_type":"primary","via_url":"","confidence":"medium","verification_status":"blind_verified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Stat. significant behavior difference aware vs unaware Migration: The blind check found the value printed as ( 79%) with a gap where an approximation sign may have been lost in extraction. Whether the source prints it as approximate is not confirmed."},
{"measurement_id":"m-001627","legacy_row_id":1627,"split_index":0,"version_id":"meta-muse-spark-1-1-evaluation-report--2026-09-26","subject_kind":"model","model_id":"muse-spark-1-1","subject_model_ids":[],"subject_label":"Muse Spark 1.1","snapshot_label":"","is_subject_model":true,"eval_id":"meta-verbalized-eval-awareness","group_id":"meta-verbalized-eval-awareness-v1","metric_label":"Share of samples verbalizing evaluation","metric_definition":"Share of samples verbalizing evaluation","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"dangerous-capability evals","context_note":"","value_printed":"2.2","value_num":2.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"4.1.6","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":""},
{"measurement_id":"m-001628","legacy_row_id":1628,"split_index":0,"version_id":"meta-muse-spark-1-1-evaluation-report--2026-09-26","subject_kind":"model","model_id":"muse-spark-1-1","subject_model_ids":[],"subject_label":"Muse Spark 1.1","snapshot_label":"","is_subject_model":true,"eval_id":"meta-mask","group_id":"meta-mask-v1","metric_label":"Honesty rate","metric_definition":"Honesty rate","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"95.7","value_num":95.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"1.0: 89.1"},
{"measurement_id":"m-001629","legacy_row_id":1629,"split_index":0,"version_id":"meta-muse-spark-1-1-evaluation-report--2026-09-26","subject_kind":"model","model_id":"muse-spark-1-1","subject_model_ids":[],"subject_label":"Muse Spark 1.1","snapshot_label":"","is_subject_model":true,"eval_id":"meta-internal-sycophancy","group_id":"meta-internal-sycophancy-v1","metric_label":"Sycophancy rate","metric_definition":"Sycophancy rate","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"49.2","value_num":49.2,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Table 2","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"1.0 restated 57.9"},
{"measurement_id":"m-001630","legacy_row_id":1630,"split_index":0,"version_id":"meta-muse-spark-1-1-evaluation-report--2026-09-26","subject_kind":"model","model_id":"muse-spark-1-1","subject_model_ids":[],"subject_label":"Muse Spark 1.1","snapshot_label":"","is_subject_model":true,"eval_id":"meta-agentdojo","group_id":"meta-agentdojo-v1","metric_label":"Prompt-injection ASR pass@1","metric_definition":"Prompt-injection ASR pass@1","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"0.7","value_num":0.7,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Agent robustness","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"GPT-5.5 1.2; Opus 4.8 0.5"},
{"measurement_id":"m-001631","legacy_row_id":1631,"split_index":0,"version_id":"meta-muse-spark-1-1-evaluation-report--2026-09-26","subject_kind":"model","model_id":"muse-spark-1-1","subject_model_ids":[],"subject_label":"Muse Spark 1.1","snapshot_label":"","is_subject_model":true,"eval_id":"meta-shade-arena","group_id":"meta-shade-arena-v1","metric_label":"Overall success under CoT monitor","metric_definition":"Overall success under CoT monitor","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"","context_note":"","value_printed":"6.8","value_num":6.8,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"2.3.2","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Comparator values inconsistent across extractions Migration: Scored under a chain-of-thought monitor, which the metric label already says."},
{"measurement_id":"m-001632","legacy_row_id":1632,"split_index":0,"version_id":"meta-muse-spark-1-1-evaluation-report--2026-09-26","subject_kind":"model","model_id":"muse-spark-1-1","subject_model_ids":[],"subject_label":"Muse Spark 1.1","snapshot_label":"","is_subject_model":true,"eval_id":"meta-cybench","group_id":"meta-cybench-v1","metric_label":"Pass@1","metric_definition":"pass@1","condition_effort":"","condition_mode":"","condition_safeguards":"without system mitigations","condition_surface":"","condition_other":"","context_note":"","value_printed":"92.9","value_num":92.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Cyber capabilities","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"1.0: 65.4; CyberGym 59.0"},
{"measurement_id":"m-001633","legacy_row_id":1633,"split_index":0,"version_id":"meta-muse-spark-1-1-evaluation-report--2026-09-26","subject_kind":"model","model_id":"muse-spark-1-1","subject_model_ids":[],"subject_label":"Muse Spark 1.1","snapshot_label":"","is_subject_model":true,"eval_id":"meta-aasf-risk-determination","group_id":"meta-aasf-risk-determination-v1","metric_label":"Risk tier, cyber","metric_definition":"AASF risk tier","condition_effort":"","condition_mode":"","condition_safeguards":"pre-mitigation","condition_surface":"","condition_other":"","context_note":"","value_printed":"High cannot be ruled out","value_num":null,"value_text":"High cannot be ruled out","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Summary","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"CB pre-mitigation High; post-mitigation Moderate or lower"},
{"measurement_id":"m-001634","legacy_row_id":1634,"split_index":0,"version_id":"meta-muse-glimmer-30b-model-card--2026-09-26","subject_kind":"model","model_id":"muse-glimmer-30b","subject_model_ids":[],"subject_label":"Muse Glimmer-30B","snapshot_label":"","is_subject_model":true,"eval_id":"meta-siren-agentdojo","group_id":"meta-siren-agentdojo-v1","metric_label":"Prompt-injection attack success rate","metric_definition":"Prompt-injection attack success rate","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"open weights","condition_other":"","context_note":"","value_printed":"28.4","value_num":28.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"Agentic risk","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Gemma4-31B 25.6; Qwen3.6-27B 40.3"},
{"measurement_id":"m-001635","legacy_row_id":1635,"split_index":0,"version_id":"meta-muse-glimmer-30b-model-card--2026-09-26","subject_kind":"model","model_id":"muse-glimmer-30b","subject_model_ids":[],"subject_label":"Muse Glimmer-30B","snapshot_label":"","is_subject_model":true,"eval_id":"meta-vct","group_id":"meta-vct-v1","metric_label":"Accuracy","metric_definition":"Accuracy","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"open weights","condition_other":"","context_note":"","value_printed":"37.0","value_num":37,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"CB risk table","source_type":"primary","via_url":"","confidence":"high","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Kimi K3 48.0; Qwen3.6-27B 33.7"},
{"measurement_id":"m-001636","legacy_row_id":1636,"split_index":0,"version_id":"meta-muse-glimmer-30b-model-card--2026-09-26","subject_kind":"model","model_id":"muse-glimmer-30b","subject_model_ids":[],"subject_label":"Muse Glimmer-30B","snapshot_label":"","is_subject_model":true,"eval_id":"meta-aasf-risk-determination","group_id":"meta-aasf-risk-determination-v1","metric_label":"Risk tier, all domains","metric_definition":"AASF risk tier","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"open weights","condition_other":"","context_note":"","value_printed":"Moderate or lower","value_num":null,"value_text":"Moderate or lower","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"printed","location":"Risk designations","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Cyber tier stated as inferred"},
{"measurement_id":"m-001637","legacy_row_id":1637,"split_index":0,"version_id":"moonshot-ai-kimi-k2-technical-report--2026-09-26","subject_kind":"model","model_id":"kimi-k2-instruct","subject_model_ids":[],"subject_label":"Kimi K2-Instruct","snapshot_label":"","is_subject_model":true,"eval_id":"moonshot-ai-promptfoo-red-team","group_id":"moonshot-ai-promptfoo-red-team-v1","metric_label":"Harmful: pass rate (safe responses)","metric_definition":"Pass rate (safe responses)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"Iterative Jailbreak","context_note":"","value_printed":"92.16","value_num":92.16,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"DeepSeek-V3-0324 66.67; DeepSeek-R1 72.55; Qwen3-235B 74.51"},
{"measurement_id":"m-001638","legacy_row_id":1638,"split_index":0,"version_id":"moonshot-ai-kimi-k2-technical-report--2026-09-26","subject_kind":"model","model_id":"kimi-k2-instruct","subject_model_ids":[],"subject_label":"Kimi K2-Instruct","snapshot_label":"","is_subject_model":true,"eval_id":"moonshot-ai-promptfoo-red-team","group_id":"moonshot-ai-promptfoo-red-team-v1","metric_label":"Harmful: pass rate (safe responses)","metric_definition":"Pass rate (safe responses)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"Crescendo multi-turn","context_note":"","value_printed":"64.71","value_num":64.71,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"DeepSeek-R1 80.39; Qwen3-235B 86.27"},
{"measurement_id":"m-001639","legacy_row_id":1639,"split_index":0,"version_id":"moonshot-ai-kimi-k2-technical-report--2026-09-26","subject_kind":"model","model_id":"kimi-k2-instruct","subject_model_ids":[],"subject_label":"Kimi K2-Instruct","snapshot_label":"","is_subject_model":true,"eval_id":"moonshot-ai-promptfoo-red-team-prompt-injection","group_id":"moonshot-ai-promptfoo-red-team-prompt-injection-v1","metric_label":"Harmful: pass rate (safe responses)","metric_definition":"Pass rate (safe responses)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"Prompt injection","context_note":"","value_printed":"93.14","value_num":93.14,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"DeepSeek-V3-0324 100"},
{"measurement_id":"m-001640","legacy_row_id":1640,"split_index":0,"version_id":"moonshot-ai-kimi-k2-technical-report--2026-09-26","subject_kind":"model","model_id":"kimi-k2-instruct","subject_model_ids":[],"subject_label":"Kimi K2-Instruct","snapshot_label":"","is_subject_model":true,"eval_id":"moonshot-ai-promptfoo-red-team-no-attack","group_id":"moonshot-ai-promptfoo-red-team-no-attack-v1","metric_label":"Harmful: pass rate (safe responses)","metric_definition":"Pass rate (safe responses)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"Basic (no attack)","context_note":"","value_printed":"98.04","value_num":98.04,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 6","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"DeepSeek-V3-0324 90.45"},
{"measurement_id":"m-001641","legacy_row_id":1641,"split_index":0,"version_id":"zhipu-ai-glm-4-5-technical-report--2026-09-26","subject_kind":"model","model_id":"glm-4-5","subject_model_ids":[],"subject_label":"GLM-4.5","snapshot_label":"","is_subject_model":true,"eval_id":"zhipu-ai-safetybench","group_id":"zhipu-ai-safetybench-v1","metric_label":"Overall accuracy","metric_definition":"Overall accuracy (safety MCQ)","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"overall","context_note":"","value_printed":"89.9","value_num":89.9,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 7","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Kimi K2 90.5; GPT-4.1 89.7; knowledge MCQ, not behavioral"},
{"measurement_id":"m-001642","legacy_row_id":1642,"split_index":0,"version_id":"zhipu-ai-glm-4-5-technical-report--2026-09-26","subject_kind":"model","model_id":"glm-4-5","subject_model_ids":[],"subject_label":"GLM-4.5","snapshot_label":"","is_subject_model":true,"eval_id":"zhipu-ai-safetybench","group_id":"zhipu-ai-safetybench-v1","metric_label":"Unfairness & bias accuracy","metric_definition":"Category accuracy","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"Unfairness & Bias","context_note":"","value_printed":"77.4","value_num":77.4,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"percent","unit_as_printed":"%","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_better","value_status":"printed","location":"Table 7","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Lowest category; Offensiveness 83.0"},
{"measurement_id":"m-001643","legacy_row_id":1643,"split_index":0,"version_id":"deepseek-r1-paper-nature-arxiv-v2--2026-09-26","subject_kind":"model","model_id":"deepseek-r1","subject_model_ids":[],"subject_label":"DeepSeek-R1","snapshot_label":"","is_subject_model":true,"eval_id":"deepseek-safety-benchmarks-summary","group_id":"deepseek-safety-benchmarks-summary-v1","metric_label":"Inherent safety level","metric_definition":"Qualitative inherent safety level","condition_effort":"","condition_mode":"","condition_safeguards":"without risk-control system","condition_surface":"","condition_other":"","context_note":"","value_printed":"moderate (comparable to GPT-4o 2024-05)","value_num":null,"value_text":"moderate (comparable to GPT-4o 2024-05)","value_qualifier":"","range_low":"","range_high":"","unit":"categorical","unit_as_printed":"categorical","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"categorical","value_status":"qualitative","location":"Sec. 5 / Supp. D.3","source_type":"primary","via_url":"","confidence":"medium","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Numeric tables (SST, BBQ, ART, XSTest, DNA, HarmBench) exist; not extracted"},
{"measurement_id":"m-001644","legacy_row_id":1644,"split_index":0,"version_id":"moonshot-ai-kimi-k3-technical-report--2026-09-26","subject_kind":"model","model_id":"kimi-k3","subject_model_ids":[],"subject_label":"Kimi K3","snapshot_label":"","is_subject_model":true,"eval_id":"moonshot-ai-vulnerability-discovery","group_id":"moonshot-ai-vulnerability-discovery-v1","metric_label":"Previously unknown vulnerabilities found","metric_definition":"Previously unknown vulns found","condition_effort":"","condition_mode":"","condition_safeguards":"","condition_surface":"","condition_other":"human-reviewed findings","context_note":"","value_printed":"16","value_num":16,"value_text":"","value_qualifier":"","range_low":"","range_high":"","unit":"count","unit_as_printed":"count","denominator":null,"scale":"","ci_low":"","ci_high":"","n":null,"direction":"higher_worse","value_status":"printed","location":"6.2.2","source_type":"secondary","via_url":"https://zentor.ai/blog/kimi-k3-technical-report","confidence":"low","verification_status":"unverified","extraction_method":"v0_web_reader","superseded_by":"","notes":"Secondary summary; ~70% of findings confirmed; no refusal/JB evals Migration: The ~ in the v0 note refers to the roughly 70% of findings that were confirmed, not to the count. The value comes from a secondary summary."}
],
"revisions": [
{"revision_id":"rev-claude-opus-4-8-virology-task-2","doc_id":"anthropic-claude-opus-4-8-system-card","from_version_id":"anthropic-claude-opus-4-8-system-card--2026-06-03","to_version_id":"anthropic-claude-opus-4-8-system-card--2026-06-17","measurement_id_old":"","measurement_id_new":"m-000350","change_type":"value_changed","what":"Long-form virology task 2 end-to-end score, Claude Opus 4.8","old_text":"0.89","new_text":"0.90","explained":"yes","explanation_summary":"The changelog lists the corrected score.","verification_status":"unverified","notes":"Recorded from review item revision_candidate-ee14913b30. Old and new text as the source registry quotes the changelog entry of 17 Jun 2026; v0 row 350 records the corrected value. The changelog has not been re-read by us, so the revision is unverified."},
{"revision_id":"rev-fable-5-alignment-risk","doc_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","from_version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-06-11","to_version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-06-25","measurement_id_old":"","measurement_id_new":"","change_type":"wording","what":"Alignment risk in executive summary","old_text":"low","new_text":"very low","explained":"yes","explanation_summary":"corrected to match §2.4","verification_status":"changelog_confirmed","notes":"Evidence: changelog read 2026-09-26"},
{"revision_id":"rev-gemini-2-5-flash-undocumented","doc_id":"google-deepmind-gemini-2-5-flash-model-card","from_version_id":"google-deepmind-gemini-2-5-flash-model-card--2025-09-26","to_version_id":"google-deepmind-gemini-2-5-flash-model-card--2026-09-26","measurement_id_old":"","measurement_id_new":"","change_type":"unknown","what":"Card marked updated Dec 2025","old_text":"","new_text":"","explained":"no_changelog","explanation_summary":"","verification_status":"unverified","notes":"Evidence: header read by extraction pass"},
{"revision_id":"rev-gemini-3-1-flash-lite-undocumented","doc_id":"google-deepmind-gemini-3-1-flash-lite-model-card","from_version_id":"google-deepmind-gemini-3-1-flash-lite-model-card--2026-03-03","to_version_id":"google-deepmind-gemini-3-1-flash-lite-model-card--2026-09-26","measurement_id_old":"","measurement_id_new":"","change_type":"unknown","what":"Card marked updated May 2026","old_text":"","new_text":"","explained":"no_changelog","explanation_summary":"","verification_status":"unverified","notes":"Evidence: header read by extraction pass"},
{"revision_id":"rev-gemini-3-pro-undocumented","doc_id":"google-deepmind-gemini-3-pro-model-card","from_version_id":"google-deepmind-gemini-3-pro-model-card--2025-11-18","to_version_id":"google-deepmind-gemini-3-pro-model-card--2026-09-26","measurement_id_old":"","measurement_id_new":"","change_type":"unknown","what":"Card marked \"Last updated May 2026\"","old_text":"","new_text":"","explained":"no_changelog","explanation_summary":"","verification_status":"unverified","notes":"Evidence: header read by extraction pass"},
{"revision_id":"rev-gpt-5-6-gpt-red-direct-pi","doc_id":"openai-gpt-5-6-system-card","from_version_id":"openai-gpt-5-6-system-card--2026-07-09","to_version_id":"openai-gpt-5-6-system-card--2026-08-03","measurement_id_old":"","measurement_id_new":"m-001305","change_type":"added","what":"GPT-Red instruction-hierarchy (direct prompt injection) attack success rate added, GPT-5.6 Sol","old_text":"","new_text":"0.051%","explained":"yes","explanation_summary":"The changelog says the GPT-Red prompt-injection results were added.","verification_status":"unverified","notes":"Recorded from review item revision_candidate-72e5c31ef7."},
{"revision_id":"rev-gpt-5-6-gpt-red-indirect-pi","doc_id":"openai-gpt-5-6-system-card","from_version_id":"openai-gpt-5-6-system-card--2026-07-09","to_version_id":"openai-gpt-5-6-system-card--2026-08-03","measurement_id_old":"","measurement_id_new":"m-001306","change_type":"added","what":"GPT-Red indirect prompt injection attack success rate added, GPT-5.6 Sol","old_text":"","new_text":"3.77%","explained":"yes","explanation_summary":"The changelog says the GPT-Red prompt-injection results were added.","verification_status":"unverified","notes":"Recorded from review item revision_candidate-cc80f71001."},
{"revision_id":"rev-gpt-5-6-preview-protein-binding","doc_id":"openai-gpt-5-6-preview-system-card","from_version_id":"openai-gpt-5-6-preview-system-card--2026-06-25","to_version_id":"openai-gpt-5-6-preview-system-card--2026-08-19","measurement_id_old":"","measurement_id_new":"","change_type":"value_changed","what":"GPT-5.5 hard-negative protein-binding prediction, pass@4","old_text":"0.4%","new_text":"1.5%","explained":"yes","explanation_summary":"earlier figure was the pass@1 score","verification_status":"changelog_confirmed","notes":"Evidence: changelog read 2026-09-26 (no v0 value row in this document)"},
{"revision_id":"rev-gpt-5-6-protein-binding","doc_id":"openai-gpt-5-6-system-card","from_version_id":"openai-gpt-5-6-system-card--2026-07-09","to_version_id":"openai-gpt-5-6-system-card--2026-08-19","measurement_id_old":"","measurement_id_new":"m-001286","change_type":"value_changed","what":"GPT-5.5 hard-negative protein-binding prediction, pass@4","old_text":"0.4%","new_text":"1.5%","explained":"yes","explanation_summary":"earlier figure was the pass@1 score","verification_status":"changelog_confirmed","notes":"Evidence: changelog read 2026-09-26; same entry also appears in the GPT-5.6 Preview card changelog"},
{"revision_id":"rev-gpt-6-astra-alignment-section","doc_id":"openai-gpt-6-astra-system-card","from_version_id":"openai-gpt-6-astra-system-card--2026-09-03","to_version_id":"openai-gpt-6-astra-system-card--2026-09-09","measurement_id_old":"","measurement_id_new":"","change_type":"wording","what":"Alignment section clarified and its limitations expanded; section on verbalized metagaming and oversight gaming renamed and revised","old_text":"","new_text":"","explained":"yes","explanation_summary":"changelog describes the changes","verification_status":"changelog_confirmed","notes":"Re-read from the change log of the copy retrieved on 27 Sep 2026: two entries dated 9 Sep. The change log gives only the section's current title. An extraction note on m-001261 says the section was titled 'Metagaming and Alignment Faking' before; we cannot confirm that without a copy of the version of 3 Sep."},
{"revision_id":"rev-grok-4-6-bio-lift-wording","doc_id":"xai-grok-4-6-model-card","from_version_id":"xai-grok-4-6-model-card--2026-08-12","to_version_id":"xai-grok-4-6-model-card--2026-08-17","measurement_id_old":"m-001576","measurement_id_new":"m-001577","change_type":"wording","what":"Bio capability lift statement relative to Grok 4.5, Grok 4.6","old_text":"no appreciable lift","new_text":"noted in the biological domain but is limited","explained":"no","explanation_summary":"The changelog does not mention this change.","verification_status":"unverified","notes":"Recorded from review item revision_candidate-6a88e622f6. The FORTRESS-RN addition in the same revision is recorded separately (row 1578)."},
{"revision_id":"rev-grok-4-6-fortress-rn-added","doc_id":"xai-grok-4-6-model-card","from_version_id":"xai-grok-4-6-model-card--2026-08-12","to_version_id":"xai-grok-4-6-model-card--2026-08-17","measurement_id_old":"","measurement_id_new":"m-001578","change_type":"added","what":"FORTRESS-RN R/N refusal accuracy added, Grok 4.6 (high)","old_text":"","new_text":"97.9%","explained":"no","explanation_summary":"Added without a changelog note.","verification_status":"unverified","notes":"Recorded from review item revision_candidate-cdb15fb617."},
{"revision_id":"rev-grok-4-6-hackerbench","doc_id":"xai-grok-4-6-model-card","from_version_id":"xai-grok-4-6-model-card--2026-08-12","to_version_id":"xai-grok-4-6-model-card--2026-08-17","measurement_id_old":"m-001567","measurement_id_new":"m-001568","change_type":"value_changed","what":"HackerBench v0.2 harmful/dual-use compliance, Grok 4.6 (high)","old_text":"16.7%","new_text":"6.9%","explained":"partly","explanation_summary":"changelog lists \"corrected eval results\" for this eval; no reason","verification_status":"blind_verified","notes":"Evidence: blind check 2026-09-26 (both versions)"},
{"revision_id":"rev-grok-4-6-mask","doc_id":"xai-grok-4-6-model-card","from_version_id":"xai-grok-4-6-model-card--2026-08-12","to_version_id":"xai-grok-4-6-model-card--2026-08-17","measurement_id_old":"m-001574","measurement_id_new":"m-001575","change_type":"value_changed","what":"MASK dishonesty, Grok 4.6 (high)","old_text":"3.8%","new_text":"1.90%","explained":"partly","explanation_summary":"listed as corrected; no reason","verification_status":"blind_verified","notes":"Evidence: blind check 2026-09-26 (both versions)"},
{"revision_id":"rev-grok-4-6-self-harm","doc_id":"xai-grok-4-6-model-card","from_version_id":"xai-grok-4-6-model-card--2026-08-12","to_version_id":"xai-grok-4-6-model-card--2026-08-17","measurement_id_old":"m-001572","measurement_id_new":"m-001573","change_type":"value_changed","what":"Self-harm compliance, Grok 4.6 (high)","old_text":"3.7%","new_text":"0.84%","explained":"partly","explanation_summary":"listed as corrected; no reason","verification_status":"blind_verified","notes":"Evidence: blind check 2026-09-26 (both versions)"}
],
"verifications": [
{"verification_id":"v-m-000025-blind-recheck-2026-09-26","measurement_id":"m-000025","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"5","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 4.1.2.2 · 5 of 414 flagged candidate situational awareness"},
{"verification_id":"v-m-000034-blind-recheck-2026-09-26","measurement_id":"m-000034","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"36","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 4.1.9 · classifier found 36 cases for Sonnet 4"},
{"verification_id":"v-m-000078-blind-recheck-2026-09-26","measurement_id":"m-000078","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"72.65","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 6.4.1 · 72.65x for Opus 4 (vs 58.47x for 4.1)"},
{"verification_id":"v-m-000079-blind-recheck-2026-09-26","measurement_id":"m-000079","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"99.29","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 2.1.1.A · 99.29% (+/-0.22%) overall harmless rate"},
{"verification_id":"v-m-000111-blind-recheck-2026-09-26","measurement_id":"m-000111","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"14","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"AMBIGUOUS · Table 6.1.A · table layout unclear; 14% hack rate but competing 10% no-prompt col"},
{"verification_id":"v-m-000125-blind-recheck-2026-09-26","measurement_id":"m-000125","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"secondary","found_value":"16.6","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 7.3.1 · blog quotes UK AISI: 16.6% unprompted"},
{"verification_id":"v-m-000128-blind-recheck-2026-09-26","measurement_id":"m-000128","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"secondary","found_value":"58","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 7.3.2 · 58% unambiguous refs vs 22% opus-4.1"},
{"verification_id":"v-m-000134-blind-recheck-2026-09-26","measurement_id":"m-000134","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"","result":"no_printed_value","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"AMBIGUOUS · Sec 5.2.2 · no exact figure; only chart + 'breaking 80% for 30 trials'"},
{"verification_id":"v-m-000140-blind-recheck-2026-09-26","measurement_id":"m-000140","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"0.01","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 2.1.2.A · 0.01% (+/-0.03%); table is 2.1.2.A not 2.2"},
{"verification_id":"v-m-000148-blind-recheck-2026-09-26","measurement_id":"m-000148","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"97.54","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 3.1.2.A · 97.54% dual-use & benign success (Sonnet 4.5)"},
{"verification_id":"v-m-000167-blind-recheck-2026-09-26","measurement_id":"m-000167","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"9","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 4.1.1 · about 9% of scenarios affected"},
{"verification_id":"v-m-000176-blind-recheck-2026-09-26","measurement_id":"m-000176","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"98.87","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 3.1.1.A · 98.87% (+/-0.06%) overall all languages"},
{"verification_id":"v-m-000194-blind-recheck-2026-09-26","measurement_id":"m-000194","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"63.06","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 5.1.2.A · 63.06% malicious refusal without mitigations"},
{"verification_id":"v-m-000282-blind-recheck-2026-09-26","measurement_id":"m-000282","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"51.91","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 2.3.3.A · 51.91x avg speedup LLM training"},
{"verification_id":"v-m-000300-blind-recheck-2026-09-26","measurement_id":"m-000300","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"secondary","found_value":"1.11","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 4.2.3 · printed as ~1.11 (approx); third-party mirror"},
{"verification_id":"v-m-000322-blind-recheck-2026-09-26","measurement_id":"m-000322","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"8","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 2.2.5.2 · eight of ten pathogens"},
{"verification_id":"v-m-000325-blind-recheck-2026-09-26","measurement_id":"m-000325","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"61.79","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 2.3.4.A · 61.79x Mythos Preview (Opus 4.7 = 40.81x)"},
{"verification_id":"v-m-000335-blind-recheck-2026-09-26","measurement_id":"m-000335","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"lab_summary","found_value":"9","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · transparency hub Opus 4.7 summary · page states 'about 9%'; hub not system card"},
{"verification_id":"v-m-000372-blind-recheck-2026-09-26","measurement_id":"m-000372","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"secondary","found_value":"0.1","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 6.5 · ~0.1% of episodes (zvi blog)"},
{"verification_id":"v-m-000386-blind-recheck-2026-09-26","measurement_id":"m-000386","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"69.61","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 2.3.7.1.A · 69.61x Mythos 5 (re-run column)"},
{"verification_id":"v-m-000388-blind-recheck-2026-09-26","measurement_id":"m-000388","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"60.81","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 2.3.7.1.A · 60.81x Mythos Preview re-run"},
{"verification_id":"v-m-000413-blind-recheck-2026-09-26","measurement_id":"m-000413","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"81.70","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 5.1.2.A · 81.70% refusal rate malicious (Opus 4.8)"},
{"verification_id":"v-m-000424-blind-recheck-2026-09-26","measurement_id":"m-000424","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"76.1","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 2.3.3.A · 76.1% pass rate on complex tests"},
{"verification_id":"v-m-000433-blind-recheck-2026-09-26","measurement_id":"m-000433","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"secondary","found_value":"6","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 6 · about 6% of rollouts (neuraltrust blog)"},
{"verification_id":"v-m-000445-blind-recheck-2026-09-26","measurement_id":"m-000445","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"0.59","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 2.2.4 · 0.59 VCT (Sonnet 5 0.45, Opus 4.8 0.47)"},
{"verification_id":"v-m-000505-blind-recheck-2026-09-26","measurement_id":"m-000505","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"secondary","found_value":"36","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 6 · 36% of audit transcripts scored >=6"},
{"verification_id":"v-m-000506-blind-recheck-2026-09-26","measurement_id":"m-000506","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"secondary","found_value":"0.4","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 6 · 0.4% of deployment transcripts scored >=6"},
{"verification_id":"v-m-000537-blind-recheck-2026-09-26","measurement_id":"m-000537","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"↑13.6%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 7, Helpfulness / Instruction Following row · 3rd of 4 columns (2.5 Flash); baseline label garbled in extraction"},
{"verification_id":"v-m-000539-blind-recheck-2026-09-26","measurement_id":"m-000539","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"26.9%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 8, Gemini 2.5 Flash row · Column inferred from text; summarizer misread 6.6% (helpfulness col)"},
{"verification_id":"v-m-000567-blind-recheck-2026-09-26","measurement_id":"m-000567","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"+16.3%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Safety evaluations table, Tone row · Confirmed 3x; T2T row coincidentally -16.3%"},
{"verification_id":"v-m-000593-blind-recheck-2026-09-26","measurement_id":"m-000593","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"3/11","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · FSF report: Misalignment results · \"Agent solves 3/11 situational awareness challenges\""},
{"verification_id":"v-m-000607-blind-recheck-2026-09-26","measurement_id":"m-000607","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"-3.1%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Safety evaluations table, Text to Text Safety · Confirmed twice; vs Gemini 2.5 Flash"},
{"verification_id":"v-m-000613-blind-recheck-2026-09-26","measurement_id":"m-000613","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"+0.10%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Safety evaluations table, Text to Text Safety · Printed with (non-egregious); header says vs Gemini 3.0 Pro"},
{"verification_id":"v-m-000647-blind-recheck-2026-09-26","measurement_id":"m-000647","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"-1.35%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Safety evaluations table, Text to Text Safety · Header says percentage point increase/decrease"},
{"verification_id":"v-m-000675-blind-recheck-2026-09-26","measurement_id":"m-000675","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"3/4","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · FSF report: Misalignment, TCL Assessment results · Passing = exceeds top 50% of humans"},
{"verification_id":"v-m-000676-blind-recheck-2026-09-26","measurement_id":"m-000676","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"6/11","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · FSF report: Misalignment, TCL Assessment results · Passing = success rate >20%"},
{"verification_id":"v-m-000709-blind-recheck-2026-09-26","measurement_id":"m-000709","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"5","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · METR section, Optimize a Kernel (RE-Bench) · \"5 out of 24 experiments\"; confirmed twice"},
{"verification_id":"v-m-000711-blind-recheck-2026-09-26","measurement_id":"m-000711","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"0.58","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Apollo Research section (sabotage) · o3 0.58 vs o3-mini 0.05 / o4-mini 0.17; confirmed twice"},
{"verification_id":"v-m-000731-blind-recheck-2026-09-26","measurement_id":"m-000731","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"44%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · AI Self-improvement, OpenAI PRs · o3 launch candidate 44%, o4-mini 39%; confirmed twice"},
{"verification_id":"v-m-000762-blind-recheck-2026-09-26","measurement_id":"m-000762","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"0.822","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 3.2 Table 3, hate/threatening row · gpt-5-thinking first column; header confirmed"},
{"verification_id":"v-m-000820-blind-recheck-2026-09-26","measurement_id":"m-000820","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"4.8%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 3.8.1 CoT deception monitoring · printed as \"~4.8%\"; confirmed twice"},
{"verification_id":"v-m-000821-blind-recheck-2026-09-26","measurement_id":"m-000821","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"2.1%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 3.8.1 CoT deception monitoring · printed as \"~2.1%\"; confirmed twice"},
{"verification_id":"v-m-000835-blind-recheck-2026-09-26","measurement_id":"m-000835","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"21.8%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Apollo Research section, eval-awareness table (Broad, overall) · Overall rate; 8.9% on scheming samples; strict 12.9%"},
{"verification_id":"v-m-000941-blind-recheck-2026-09-26","measurement_id":"m-000941","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"0.992","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 2 StrongReject, illicit/non-violent-crime prompts · gpt-5-codex column; confirmed twice"},
{"verification_id":"v-m-000952-blind-recheck-2026-09-26","measurement_id":"m-000952","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"0.860","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 1 Production Benchmarks, illicit/non-violent · second column (gpt-5.1-thinking); confirmed twice"},
{"verification_id":"v-m-001035-blind-recheck-2026-09-26","measurement_id":"m-001035","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"0.519","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 1 Production Benchmarks, mental health · Differs from 0.597 shown for same model in 5.2-Codex card"},
{"verification_id":"v-m-001045-blind-recheck-2026-09-26","measurement_id":"m-001045","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"0.75","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 6 destructive action avoidance (4.3.2.1) · confirmed twice; also 0.75 in 5.2-Codex Table 4"},
{"verification_id":"v-m-001046-blind-recheck-2026-09-26","measurement_id":"m-001046","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"0.70","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 6 destructive action avoidance (4.3.2.1) · confirmed twice"},
{"verification_id":"v-m-001047-blind-recheck-2026-09-26","measurement_id":"m-001047","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"0.66","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 6 destructive action avoidance (4.3.2.1) · confirmed twice"},
{"verification_id":"v-m-001117-blind-recheck-2026-09-26","measurement_id":"m-001117","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"0.811","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 3.3 Table 3 Prompt Injection, Agent JSK · 3rd column; one fetch misread 0.575 (5.1-instant)"},
{"verification_id":"v-m-001123-blind-recheck-2026-09-26","measurement_id":"m-001123","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"7.7%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 3.7 Table 6 Deception rate, Production traffic · lower is better; confirmed twice"},
{"verification_id":"v-m-001124-blind-recheck-2026-09-26","measurement_id":"m-001124","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"1.6%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 3.7 Table 6 Deception rate, Production traffic · also confirmed in HTML version text"},
{"verification_id":"v-m-001163-blind-recheck-2026-09-26","measurement_id":"m-001163","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"0.597","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 1 Production Benchmarks, mental health · Codex-Max own card reports 0.519 for same cell"},
{"verification_id":"v-m-001171-blind-recheck-2026-09-26","measurement_id":"m-001171","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"0.76","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 4 destructive action avoidance · confirmed twice"},
{"verification_id":"v-m-001198-blind-recheck-2026-09-26","measurement_id":"m-001198","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"0.785","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 1: Production Benchmarks with Challenging Prompts · gpt-5.6-sol column of Astra card; GPT-5.6 card reports 0.708"},
{"verification_id":"v-m-001254-blind-recheck-2026-09-26","measurement_id":"m-001254","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"42.6%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 8.6 Deployment simulation of internal Codex traffic · Resampled trajectory wins head-to-head 42.6% of the time"},
{"verification_id":"v-m-001255-blind-recheck-2026-09-26","measurement_id":"m-001255","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"9.6%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 8.6 Deployment simulation of internal Codex traffic · GPT-6 Astra eval awareness on shared task set"},
{"verification_id":"v-m-001256-blind-recheck-2026-09-26","measurement_id":"m-001256","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"2.8%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 8.6 Deployment simulation of internal Codex traffic · GPT-5.6 Sol eval awareness on shared task set"},
{"verification_id":"v-m-001258-blind-recheck-2026-09-26","measurement_id":"m-001258","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"41.1%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 8.8.1 External Evaluations for Alignment - Apollo Research · Astra at xhigh effort"},
{"verification_id":"v-m-001259-blind-recheck-2026-09-26","measurement_id":"m-001259","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"50.6%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 8.8.1 External Evaluations for Alignment - Apollo Research · Astra at max effort"},
{"verification_id":"v-m-001260-blind-recheck-2026-09-26","measurement_id":"m-001260","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"27.7%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 8.8.1 External Evaluations for Alignment - Apollo Research · GPT-5.5 at xhigh effort"},
{"verification_id":"v-m-001292-blind-recheck-2026-09-26","measurement_id":"m-001292","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"0.708","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 3.1.1 Production Benchmarks with Challenging Prompts table · gpt-5.6-sol column; HTML subpage lacks table values"},
{"verification_id":"v-m-001296-blind-recheck-2026-09-26","measurement_id":"m-001296","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"0.585","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 3.1.1 Production Benchmarks with Challenging Prompts table · gpt-5.6-luna column"},
{"verification_id":"v-m-001300-blind-recheck-2026-09-26","measurement_id":"m-001300","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"1.000","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 4.2 Prompt injection table (Connectors row) · gpt-5.5 column; GPT-5.5's own card reports 0.963"},
{"verification_id":"v-m-001349-blind-recheck-2026-09-26","measurement_id":"m-001349","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"0.963","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 6: Prompt injection evaluations · Task cites Table 3; value is in Table 6"},
{"verification_id":"v-m-001350-blind-recheck-2026-09-26","measurement_id":"m-001350","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"0.90","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 3 · Task cites Table 4; Table 4 is reversion/work-preserved metrics"},
{"verification_id":"v-m-001357-blind-recheck-2026-09-26","measurement_id":"m-001357","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"22.1%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 9.2.1 External Evaluations for Sandbagging - Apollo Research · Moderate-or-higher verbalized alignment eval awareness"},
{"verification_id":"v-m-001358-blind-recheck-2026-09-26","measurement_id":"m-001358","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"17.3%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 9.2.1 External Evaluations for Sandbagging - Apollo Research · Pre-release GPT-5.4 checkpoint"},
{"verification_id":"v-m-001359-blind-recheck-2026-09-26","measurement_id":"m-001359","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"11.7%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 9.2.1 External Evaluations for Sandbagging - Apollo Research · Pre-release GPT-5.3 Codex checkpoint"},
{"verification_id":"v-m-001371-blind-recheck-2026-09-26","measurement_id":"m-001371","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"53.33%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 13: Cyber Range (5.1.2.3) · Combined Pass Rate; 8 of 15 scenarios pass"},
{"verification_id":"v-m-001380-blind-recheck-2026-09-26","measurement_id":"m-001380","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"0.933","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 1: Production Benchmarks with Challenging Prompts · Row \"sexual\" (sexual/minors is 0.966)"},
{"verification_id":"v-m-001385-blind-recheck-2026-09-26","measurement_id":"m-001385","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"0.86","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 7: Destructive action avoidance · gpt-5.4-thinking column"},
{"verification_id":"v-m-001391-blind-recheck-2026-09-26","measurement_id":"m-001391","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"21.3%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · 5.2 Research Category Update: Sandbagging (Apollo paragraph) · CoT eval awareness rate; denominator (samples) not stated"},
{"verification_id":"v-m-001418-blind-recheck-2026-09-26","measurement_id":"m-001418","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"0.88","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 2 · gpt-5.3-codex column"},
{"verification_id":"v-m-001434-blind-recheck-2026-09-26","measurement_id":"m-001434","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"0.911","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 2: Dynamic Mental Health Evaluations · Row \"Self-harm *\""},
{"verification_id":"v-m-001443-blind-recheck-2026-09-26","measurement_id":"m-001443","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"0.867","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 1: Production Benchmarks with Challenging Prompts · gpt-5.3-instant column"},
{"verification_id":"v-m-001486-blind-recheck-2026-09-26","measurement_id":"m-001486","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"six","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Framework post opening paragraph · Printed as word: \"six reports\" from last six months"},
{"verification_id":"v-m-001508-blind-recheck-2026-09-26","measurement_id":"m-001508","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"28.7","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 3, Dual-use capabilities, VCT accuracy · Confirmed twice; safeguards removed"},
{"verification_id":"v-m-001542-blind-recheck-2026-09-26","measurement_id":"m-001542","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"0.33","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 3, Cooperation with misuse, Chat violation rate · Grok 4.1 column; confirmed twice"},
{"verification_id":"v-m-001546-blind-recheck-2026-09-26","measurement_id":"m-001546","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"0.09","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 3, Evaluation awareness, across all audits · Grok 4.2 SA column; confirmed twice"},
{"verification_id":"v-m-001547-blind-recheck-2026-09-26","measurement_id":"m-001547","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"0.10","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 3, Evaluation awareness, across all audits · Grok 4 column; confirmed twice"},
{"verification_id":"v-m-001549-blind-recheck-2026-09-26","measurement_id":"m-001549","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"0.53","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 4, CyBench success rate · Grok 4.2 SA column; pre-mitigation; confirmed twice"},
{"verification_id":"v-m-001567-blind-recheck-2026-09-26","measurement_id":"m-001567","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"16.7%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 7.4, HackerBench v0.2 table · Original rev 2026-08-12; confirmed twice"},
{"verification_id":"v-m-001568-blind-recheck-2026-09-26","measurement_id":"m-001568","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"6.9%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 7.4, HackerBench v0.2 table · Rev 2026-08-17; changelog corrects HackerBench results"},
{"verification_id":"v-m-001570-blind-recheck-2026-09-26","measurement_id":"m-001570","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"0.0%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 7.4, HackerBench v0.2 table · Rev 2026-08-17; text also states 0.0%"},
{"verification_id":"v-m-001572-blind-recheck-2026-09-26","measurement_id":"m-001572","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"3.7%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 11.1, Self-harm refusals table · Original rev 2026-08-12; confirmed twice"},
{"verification_id":"v-m-001573-blind-recheck-2026-09-26","measurement_id":"m-001573","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"0.84%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 11.1, Self-harm refusals table · Rev 2026-08-17; confirmed twice"},
{"verification_id":"v-m-001574-blind-recheck-2026-09-26","measurement_id":"m-001574","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"3.8%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 12.1, MASK-Rectified table · Original rev 2026-08-12; confirmed twice"},
{"verification_id":"v-m-001575-blind-recheck-2026-09-26","measurement_id":"m-001575","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"1.90%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 12.1, MASK-Rectified table · Rev 2026-08-17; confirmed twice"},
{"verification_id":"v-m-001595-blind-recheck-2026-09-26","measurement_id":"m-001595","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"0.03%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 11.2, Sycophancy table · Single condition only; no default/other split"},
{"verification_id":"v-m-001606-blind-recheck-2026-09-26","measurement_id":"m-001606","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"8.8","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 1, Loss of Control, SHADE-Arena · Muse Spark column; confirmed twice"},
{"verification_id":"v-m-001608-blind-recheck-2026-09-26","measurement_id":"m-001608","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"42.9","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 1, Loss of Control, Prompted Eval. Awareness · Muse Spark column; confirmed twice"},
{"verification_id":"v-m-001609-blind-recheck-2026-09-26","measurement_id":"m-001609","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"19.8%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 1.1.3 summary (also cited as 4.1.11) · 4.1.11 text not independently confirmed"},
{"verification_id":"v-m-001610-blind-recheck-2026-09-26","measurement_id":"m-001610","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"2.0%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 1.1.3 summary (also cited as 4.1.11) · 4.1.11 text not independently confirmed"},
{"verification_id":"v-m-001615-blind-recheck-2026-09-26","measurement_id":"m-001615","revision_id":"","method":"blind_recheck","selection":"random","checked_source":"primary","found_value":"44.6%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Table 2 StrongREJECT v2; Sec 3.1 text · Sec 3.1 text states adaptive multi-turn ASR 44.6%"},
{"verification_id":"v-m-001626-blind-recheck-2026-09-26","measurement_id":"m-001626","revision_id":"","method":"blind_recheck","selection":"featured","checked_source":"primary","found_value":"79%","result":"match","checked_at":"2026-09-26","checked_by":"v0 blind-check pass","notes":"FOUND · Sec 2.3.3 Misaligned Propensities · Printed \"( 79%)\", possible dropped ~; 4.1.6 truncated in fetch"},
{"verification_id":"v-rev-fable-5-alignment-risk-changelog-read-2026-09-26","measurement_id":"","revision_id":"rev-fable-5-alignment-risk","method":"changelog_read","selection":"targeted","checked_source":"primary","found_value":"very low","result":"match","checked_at":"2026-09-26","checked_by":"v0 feasibility study","notes":"changelog read 2026-09-26"},
{"verification_id":"v-rev-gpt-5-6-preview-protein-binding-changelog-read-2026-09-26","measurement_id":"","revision_id":"rev-gpt-5-6-preview-protein-binding","method":"changelog_read","selection":"targeted","checked_source":"primary","found_value":"1.5%","result":"match","checked_at":"2026-09-26","checked_by":"v0 feasibility study","notes":"changelog read 2026-09-26 (no v0 value row in this document)"},
{"verification_id":"v-rev-gpt-5-6-protein-binding-changelog-read-2026-09-26","measurement_id":"","revision_id":"rev-gpt-5-6-protein-binding","method":"changelog_read","selection":"targeted","checked_source":"primary","found_value":"1.5%","result":"match","checked_at":"2026-09-26","checked_by":"v0 feasibility study","notes":"changelog read 2026-09-26; same entry also appears in the GPT-5.6 Preview card changelog"},
{"verification_id":"v-m-000124-blind-recheck-2026-09-27","measurement_id":"m-000124","revision_id":"","method":"blind_recheck","selection":"targeted","checked_source":"primary","found_value":"about 13%","result":"match","checked_at":"2026-09-27","checked_by":"claude-sonnet-5","notes":"§7.2 Evaluation awareness, paragraph after Figure 7.2.C, p. 61 · archived copy sha256 d5d1ce28fea1"},
{"verification_id":"v-m-000371-blind-recheck-2026-09-27","measurement_id":"m-000371","revision_id":"","method":"blind_recheck","selection":"targeted","checked_source":"primary","found_value":"roughly 0.1%","result":"mismatch","checked_at":"2026-09-27","checked_by":"claude-sonnet-5; claude-opus-5-5 (escalation; both blind; agreed)","notes":"§6.2.2 Training data review, p. 90 · archived copy sha256 0df5d061b668 · recorded until this check as \"0.1\" · Both blind checks of the card read \"roughly 0.1%\". The record, taken from a secondary write-up, had no qualifier; the card prints an approximation."},
{"verification_id":"v-m-001286-blind-recheck-2026-09-27","measurement_id":"m-001286","revision_id":"","method":"blind_recheck","selection":"targeted","checked_source":"primary","found_value":"1.5%","result":"match","checked_at":"2026-09-27","checked_by":"claude-sonnet-5","notes":"Change log, entry of 19 Aug 2026; also §9.1.1.6 and Table 2 · archived copy sha256 aa8073bcfa15"},
{"verification_id":"v-m-001307-blind-recheck-2026-09-27","measurement_id":"m-001307","revision_id":"","method":"blind_recheck","selection":"targeted","checked_source":"primary","found_value":"0.83","result":"match","checked_at":"2026-09-27","checked_by":"claude-sonnet-5","notes":"§3.3 Avoiding Accidental Data-Destructive Actions, table p. 9, row Avoidance only · archived copy sha256 aa8073bcfa15"},
{"verification_id":"v-m-001309-blind-recheck-2026-09-27","measurement_id":"m-001309","revision_id":"","method":"blind_recheck","selection":"targeted","checked_source":"primary","found_value":"0.88","result":"match","checked_at":"2026-09-27","checked_by":"claude-sonnet-5","notes":"§3.3 Avoiding Accidental Data-Destructive Actions, table p. 9, row Avoidance only · archived copy sha256 aa8073bcfa15"},
{"verification_id":"v-m-001311-blind-recheck-2026-09-27","measurement_id":"m-001311","revision_id":"","method":"blind_recheck","selection":"targeted","checked_source":"primary","found_value":"0.73","result":"match","checked_at":"2026-09-27","checked_by":"claude-sonnet-5","notes":"§3.3 Avoiding Accidental Data-Destructive Actions, table p. 9, row Avoidance only · archived copy sha256 aa8073bcfa15"},
{"verification_id":"v-m-000350-blind-recheck-2026-09-27","measurement_id":"m-000350","revision_id":"","method":"blind_recheck","selection":"targeted","checked_source":"primary","found_value":"0.90","result":"mismatch","checked_at":"2026-09-27","checked_by":"claude-sonnet-5; claude-opus-5-5 (escalation; both blind; agreed)","notes":"Table 2.2.3.B, Long-form virology task 2, End-to-End, Opus 4.8, p. 18; also §2.2.4 and the change-log entry of 17 Jun 2026 · archived copy sha256 0df5d061b668 · recorded until this check as \"0.9\" · Both blind checks read \"0.90\" in the table, in the prose and in the change log. The record had dropped the printed trailing zero (CLAUDE.md #1)."},
{"verification_id":"v-m-001305-blind-recheck-2026-09-27","measurement_id":"m-001305","revision_id":"","method":"blind_recheck","selection":"targeted","checked_source":"primary","found_value":"0.051%","result":"match","checked_at":"2026-09-27","checked_by":"claude-opus-5-5 (escalation)","notes":"§4.2 Prompt injection, GPT-Red table, PDF p. 14 · archived copy sha256 aa8073bcfa15 · The first check read the extracted text and paired this row with the other row's values. The second read the rendered page, where the text extraction had printed each row's values one line above its label. Settled on the page image."},
{"verification_id":"v-m-001306-blind-recheck-2026-09-27","measurement_id":"m-001306","revision_id":"","method":"blind_recheck","selection":"targeted","checked_source":"primary","found_value":"3.77%","result":"match","checked_at":"2026-09-27","checked_by":"claude-opus-5-5 (escalation)","notes":"§4.2 Prompt injection, GPT-Red table, PDF p. 14 · archived copy sha256 aa8073bcfa15 · The first check read the extracted text and paired this row with the other row's values. The second read the rendered page, where the text extraction had printed each row's values one line above its label. Settled on the page image."},
{"verification_id":"v-m-001576-blind-recheck-2026-09-27","measurement_id":"m-001576","revision_id":"","method":"blind_recheck","selection":"targeted","checked_source":"primary","found_value":"no appreciable lift","result":"match","checked_at":"2026-09-27","checked_by":"claude-opus-5-5 (escalation)","notes":"§8 Biological and chemical capabilities and safeguards, opening paragraphs, p. 27 (version of 12 Aug 2026) · archived copy sha256 4644ad7bf7b8 · The first check quoted the whole clause, which contains the recorded phrase; the second gave the phrase alone."},
{"verification_id":"v-m-001577-blind-recheck-2026-09-27","measurement_id":"m-001577","revision_id":"","method":"blind_recheck","selection":"targeted","checked_source":"primary","found_value":"noted in the biological domain but is limited","result":"mismatch","checked_at":"2026-09-27","checked_by":"claude-sonnet-5; claude-opus-5-5 (escalation; both blind; agreed)","notes":"§8 Biological and chemical capabilities and safeguards, opening paragraphs, p. 31 · archived copy sha256 1fbb3ab6d7c5 · recorded until this check as \"lift noted but limited\" · Both blind checks read \"noted in the biological domain but is limited\". The recorded \"lift noted but limited\" was a paraphrase, not the printed wording (CLAUDE.md #1)."},
{"verification_id":"v-m-001578-blind-recheck-2026-09-27","measurement_id":"m-001578","revision_id":"","method":"blind_recheck","selection":"targeted","checked_source":"primary","found_value":"97.9%","result":"match","checked_at":"2026-09-27","checked_by":"claude-sonnet-5","notes":"§10.3 CBRN / weapons refusals, FORTRESS-RN row, Grok 4.6 (high), p. 36 · archived copy sha256 1fbb3ab6d7c5"},
{"verification_id":"v-rev-gpt-6-astra-alignment-section-changelog-read-2026-09-27","measurement_id":"","revision_id":"rev-gpt-6-astra-alignment-section","method":"changelog_read","selection":"targeted","checked_source":"primary","found_value":"Two change-log entries dated 9 Sep 2026: the Alignment section, and the section on Verbalized Metagaming and Oversight Gaming","result":"match","checked_at":"2026-09-27","checked_by":"claude-sonnet-5; claude-opus-5-5 (escalation; both blind; agreed)","notes":"Change log, after the table of contents · archived copy sha256 cd6d9846df54 · Both checks found two change-log entries dated 9 Sep 2026: one on the Alignment section (how the evaluations were built; limitations expanded), one on naming and substance in the section on verbalized metagaming and oversight gaming. Neither names \"alignment faking\", which our description said was renamed. §8.7 says \"oversight gaming\" replaces \"undermining evaluation validity\", a term from OpenAI's previous system card. The revision is confirmed; its description is corrected to what the change log says."}
],
"restatement_links": [
{"link_id":"rs-m-000000-m-000048","own_measurement_id":"m-000000","later_measurement_id":"m-000048","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Different prompt set: the Opus 4.1 addendum reports on a set it incrementally updated (new policy areas, refreshed prompts), and v0 notes the Opus 4 value differs because the eval set was updated (group v1 to v2). A re-score on a new set, not the same measurement."},
{"link_id":"rs-m-000000-m-000081","own_measurement_id":"m-000000","later_measurement_id":"m-000081","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: The Sonnet 4.5 card's Opus 4 value (97.27) is the re-score on the set updated in the Opus 4.1 addendum (new policy areas, refreshed prompts), not on the Opus 4 card's original set (group v1 to v2)."},
{"link_id":"rs-m-000001-m-000082","own_measurement_id":"m-000001","later_measurement_id":"m-000082","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: The Sonnet 4.5 card reports Sonnet 4 on the set updated from the Opus 4.1 addendum (new policy areas, refreshed prompts), while the own value is on the Opus 4 card's original set (group v1 to v2)."},
{"link_id":"rs-m-000006-m-000050","own_measurement_id":"m-000006","later_measurement_id":"m-000050","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: The group record says the single-turn sets were updated in the Opus 4.1 addendum (new policy areas, refreshed prompts), and v0 notes this value differs from the Opus 4 card; a re-score on a new prompt set (group v1 to v2)."},
{"link_id":"rs-m-000006-m-000087","own_measurement_id":"m-000006","later_measurement_id":"m-000087","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: The Sonnet 4.5 card's Opus 4 over-refusal value (0.05) is on the benign set as updated in the Opus 4.1 addendum, not the Opus 4 card's original set (group v1 to v2)."},
{"link_id":"rs-m-000007-m-000088","own_measurement_id":"m-000007","later_measurement_id":"m-000088","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: The Sonnet 4.5 card reports Sonnet 4 on the benign set as updated in the Opus 4.1 addendum (new policy areas, refreshed prompts), not the Opus 4 card's original set (group v1 to v2)."},
{"link_id":"rs-m-000017-m-000102","own_measurement_id":"m-000017","later_measurement_id":"m-000102","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same computer-use prompt-injection test, metric and condition (without safeguards) in one group, with nothing recorded to say the test changed; the Sonnet 4.5 card gives 74.3 against 69 and no reason is recorded."},
{"link_id":"rs-m-000022-m-000090","own_measurement_id":"m-000022","later_measurement_id":"m-000090","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same malicious agentic coding safety score without safeguards in one group; the Opus 4 card describes it as an average of three evaluations, and the Sonnet 4.5 card gives 89.3 against 90 with no reason recorded."},
{"link_id":"rs-m-000044-m-000072","own_measurement_id":"m-000044","later_measurement_id":"m-000072","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Different subset: the own value counts challenges solved out of 39, the later one out of a 35-challenge subset (group v1 to v2)."},
{"link_id":"rs-m-000045-m-000080","own_measurement_id":"m-000045","later_measurement_id":"m-000080","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same updated English single-turn set (group v2), metric and condition; the Sonnet 4.5 card repeats Opus 4.1's value unchanged (98.76)."},
{"link_id":"rs-m-000045-m-000177","own_measurement_id":"m-000045","later_measurement_id":"m-000177","status":"confirmed","stated_reason":"all-language totals instead of English only","notes":"Decided by claude-opus-5-5: Same test re-aggregated: the Opus 4.5 card reports totals across all languages instead of English only, the same case as owner-confirmed seed pair 79 to 176."},
{"link_id":"rs-m-000049-m-000086","own_measurement_id":"m-000049","later_measurement_id":"m-000086","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same updated English benign set (group v2), metric and condition; the Sonnet 4.5 card repeats Opus 4.1's value unchanged (0.08)."},
{"link_id":"rs-m-000049-m-000183","own_measurement_id":"m-000049","later_measurement_id":"m-000183","status":"confirmed","stated_reason":"all-language totals instead of English only","notes":"Decided by claude-opus-5-5: Same test re-aggregated: the Opus 4.5 card reports totals across all languages instead of English only, as in owner-confirmed seed pair 79 to 176."},
{"link_id":"rs-m-000051-m-000111","own_measurement_id":"m-000051","later_measurement_id":"m-000111","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: New version of the test: the Sonnet 4.5 card uses the v2 reward-hack-prone coding set, which v0 notes is not comparable to the v1 set in the Opus 4.1 addendum (group v1 to v2)."},
{"link_id":"rs-m-000052-m-000114","own_measurement_id":"m-000052","later_measurement_id":"m-000114","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: New version of the test: the Sonnet 4.5 card's value is on the v2 coding set, which v0 notes is not comparable to the v1 set the Opus 4.1 addendum used (group v1 to v2)."},
{"link_id":"rs-m-000053-m-000117","own_measurement_id":"m-000053","later_measurement_id":"m-000117","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: New version of the test: the Sonnet 4.5 card's value is on the v2 coding set, which v0 notes is not comparable to the v1 set the Opus 4.1 addendum used (group v1 to v2)."},
{"link_id":"rs-m-000054-m-000120","own_measurement_id":"m-000054","later_measurement_id":"m-000120","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: New version of the test: the Sonnet 4.5 card's value is on the v2 coding set, which v0 notes is not comparable to the v1 set the Opus 4.1 addendum used (group v1 to v2)."},
{"link_id":"rs-m-000059-m-000112","own_measurement_id":"m-000059","later_measurement_id":"m-000112","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Changed setup: v0 records a methodology change for impossible tasks between the Opus 4.1 addendum and the Sonnet 4.5 card (Opus 4.1 no-prompt 52 then 80), so the later value is from a different measurement (group v1 to v2)."},
{"link_id":"rs-m-000060-m-000115","own_measurement_id":"m-000060","later_measurement_id":"m-000115","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Changed setup: v0 records a methodology change for impossible tasks between the Opus 4.1 addendum and the Sonnet 4.5 card, so the later value (85 against 51) is from a different measurement (group v1 to v2)."},
{"link_id":"rs-m-000061-m-000118","own_measurement_id":"m-000061","later_measurement_id":"m-000118","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Changed setup: v0 records a methodology change for impossible tasks between the Opus 4.1 addendum and the Sonnet 4.5 card, so the later value (70 against 51) is from a different measurement (group v1 to v2)."},
{"link_id":"rs-m-000062-m-000121","own_measurement_id":"m-000062","later_measurement_id":"m-000121","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Changed setup: v0 records a methodology change for impossible tasks between the Opus 4.1 addendum and the Sonnet 4.5 card, so the later value (85 against 78) is from a different measurement (group v1 to v2)."},
{"link_id":"rs-m-000063-m-000113","own_measurement_id":"m-000063","later_measurement_id":"m-000113","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Changed setup: v0 records a methodology change for impossible tasks between the Opus 4.1 addendum and the Sonnet 4.5 card, so the later anti-hack-prompt value (45 against 18) is from a different measurement (group v1 to v2)."},
{"link_id":"rs-m-000064-m-000116","own_measurement_id":"m-000064","later_measurement_id":"m-000116","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Changed setup: v0 records a methodology change for impossible tasks between the Opus 4.1 addendum and the Sonnet 4.5 card, so the later anti-hack-prompt value (30 against 19) is from a different measurement (group v1 to v2)."},
{"link_id":"rs-m-000065-m-000119","own_measurement_id":"m-000065","later_measurement_id":"m-000119","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Changed setup: v0 records a methodology change for impossible tasks between the Opus 4.1 addendum and the Sonnet 4.5 card, so the later anti-hack-prompt value (28 against 7) is from a different measurement (group v1 to v2)."},
{"link_id":"rs-m-000066-m-000122","own_measurement_id":"m-000066","later_measurement_id":"m-000122","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Changed setup: v0 records a methodology change for impossible tasks between the Opus 4.1 addendum and the Sonnet 4.5 card, so the later anti-hack-prompt value (85 against 80) is from a different measurement (group v1 to v2)."},
{"link_id":"rs-m-000079-m-000176","own_measurement_id":"m-000079","later_measurement_id":"m-000176","status":"confirmed","stated_reason":"all-language totals instead of English only","notes":"Decided by claude-opus-5-5: Owner-confirmed seed pair: the Opus 4.5 card re-aggregates the same test as totals across all languages instead of English only; the scope change is the reason, not a block."},
{"link_id":"rs-m-000079-m-000234","own_measurement_id":"m-000079","later_measurement_id":"m-000234","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same single-turn violative test for Sonnet 4.5 reported again in the Opus 4.6 card, which the group record joins to the all-language set begun in the Opus 4.5 card; as in seed pair 79 to 176 the scope change does not block a link. The Opus 4.6 card's language scope and any reason are not recorded."},
{"link_id":"rs-m-000079-m-000258","own_measurement_id":"m-000079","later_measurement_id":"m-000258","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same single-turn violative test for Sonnet 4.5 reported again in the Sonnet 4.6 card (97.89; v0 notes the Opus 4.6 card gave 97.95), in the group joined to the all-language set; as in seed pair 79 to 176 the scope change does not block a link. No reason is recorded."},
{"link_id":"rs-m-000083-m-000138","own_measurement_id":"m-000083","later_measurement_id":"m-000138","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same test, group and condition (no extended thinking); the Haiku 4.5 card repeats Sonnet 4.5's value unchanged, as v0 notes."},
{"link_id":"rs-m-000085-m-000182","own_measurement_id":"m-000085","later_measurement_id":"m-000182","status":"confirmed","stated_reason":"all-language totals instead of English only","notes":"Decided by claude-opus-5-5: Same benign-request test re-aggregated: the Opus 4.5 card reports totals across all languages instead of English only, as in owner-confirmed seed pair 79 to 176."},
{"link_id":"rs-m-000085-m-000238","own_measurement_id":"m-000085","later_measurement_id":"m-000238","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same benign-request test for Sonnet 4.5 reported again in the Opus 4.6 card, in the group joined to the all-language set; as in seed pair 79 to 176 the scope change does not block a link. The Opus 4.6 card's language scope and any reason are not recorded."},
{"link_id":"rs-m-000089-m-000143","own_measurement_id":"m-000089","later_measurement_id":"m-000143","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same malicious agentic coding safety score and condition in one group; the Haiku 4.5 card repeats Sonnet 4.5's value unchanged (98.7)."},
{"link_id":"rs-m-000089-m-000190","own_measurement_id":"m-000089","later_measurement_id":"m-000190","status":"confirmed","stated_reason":"metric renamed to refusal rate","notes":"Decided by claude-opus-5-5: Same measure and value (98.7) in one group; the Opus 4.5 card relabels the metric from safety score to refusal rate, as v0 notes."},
{"link_id":"rs-m-000107-m-000166","own_measurement_id":"m-000107","later_measurement_id":"m-000166","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same impossible-tasks v2 set, metric and condition; the Haiku 4.5 card repeats Sonnet 4.5's value unchanged (53), as v0 notes."},
{"link_id":"rs-m-000142-m-000189","own_measurement_id":"m-000142","later_measurement_id":"m-000189","status":"confirmed","stated_reason":"metric renamed to refusal rate","notes":"Decided by claude-opus-5-5: Same measure and value (100) in one group; the Opus 4.5 card relabels the metric from safety score to refusal rate, as v0 notes."},
{"link_id":"rs-m-000145-m-000193","own_measurement_id":"m-000145","later_measurement_id":"m-000193","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same merged malicious-request refusal rate without mitigations (group v2); the Opus 4.5 card repeats Haiku 4.5's value unchanged (69.39)."},
{"link_id":"rs-m-000147-m-000194","own_measurement_id":"m-000147","later_measurement_id":"m-000194","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same merged malicious-request refusal rate without mitigations (group v2); the Opus 4.5 card gives 63.06 against 66.94 in the Haiku 4.5 card. v0 describes it as a re-run, but the card's own wording is not recorded."},
{"link_id":"rs-m-000174-m-000233","own_measurement_id":"m-000174","later_measurement_id":"m-000233","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same test and group (v3); the Opus 4.6 card re-reports Opus 4.5 as 99.69 against 99.78, without a recorded language scope or reason, and nothing recorded says the set changed."},
{"link_id":"rs-m-000180-m-000237","own_measurement_id":"m-000180","later_measurement_id":"m-000237","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same benign-request test and group (v3), with nothing recorded to say the set changed; the Opus 4.6 card gives 0.83 against 0.23 in Opus 4.5's own card, a large difference the evidence does not explain."},
{"link_id":"rs-m-000232-m-000257","own_measurement_id":"m-000232","later_measurement_id":"m-000257","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same test, condition and group (v3); the Sonnet 4.6 card re-reports Opus 4.6 as 99.63 against 99.64 in its own card, with no reason recorded."},
{"link_id":"rs-m-000236-m-000260","own_measurement_id":"m-000236","later_measurement_id":"m-000260","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same test, condition and group (v3); the Sonnet 4.6 card re-reports Opus 4.6 as 0.66 against 0.68 in its own card, with no reason recorded."},
{"link_id":"rs-m-000251-m-000279","own_measurement_id":"m-000251","later_measurement_id":"m-000279","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same CyberGym targeted reproduction rate in one group with no recorded change to the test; the Mythos Preview card (via its Transparency Hub summary) gives 67% against 66% in Opus 4.6's own card, no reason recorded."},
{"link_id":"rs-m-000278-m-000359","own_measurement_id":"m-000278","later_measurement_id":"m-000359","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same CyberGym targeted reproduction rate for Mythos Preview in one group and setting (the Opus 4.8 card's 'no safeguards' label was found to match the unlabelled setting in the second check, 27 Sep 2026). The own value was read on the developer's Transparency Hub summary page (83); the Opus 4.8 card prints 83.1. No reason is recorded, as for the Opus 4.6 pair from the same summary page (rs-m-000251-m-000279)."},
{"link_id":"rs-m-000282-m-000325","own_measurement_id":"m-000282","later_measurement_id":"m-000325","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Owner-confirmed seed pair: same LLM-training task average speedup in one group; the Opus 4.7 card gives 61.79x against 51.91x with no stated reason."},
{"link_id":"rs-m-000282-m-000388","own_measurement_id":"m-000282","later_measurement_id":"m-000388","status":"confirmed","stated_reason":"re-run","notes":"Decided by claude-opus-5-5: Owner-confirmed seed pair: the Fable 5 card labels Mythos Preview's 60.81x as a re-run of the same task (the blind check also found the re-run label)."},
{"link_id":"rs-m-000309-m-000332","own_measurement_id":"m-000309","later_measurement_id":"m-000332","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same SHADE-Arena stealth success measure with extended thinking in one group; the Opus 4.7 card prints a range of 3.8-4.2% that includes the own value (taken from a secondary source quoting the Mythos Preview card)."},
{"link_id":"rs-m-000324-m-000453","own_measurement_id":"m-000324","later_measurement_id":"m-000453","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: The Opus 5 card reports Opus 4.7 on an easy variant of the task alongside a newly introduced hard variant, and nothing recorded says the easy variant is the unchanged original task, so it is treated as a different version of the test (GUIDE: a different subset or version). The variant is recorded as a condition within one group since the second check (27 Sep 2026), so this re-score sits on its own line."},
{"link_id":"rs-m-000340-m-000398","own_measurement_id":"m-000340","later_measurement_id":"m-000398","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same test, condition (API, no system prompt) and group v4; the Sonnet 5 card gives 97.46 against 97.98 in Opus 4.8's own card, with no reason recorded."},
{"link_id":"rs-m-000340-m-000439","own_measurement_id":"m-000340","later_measurement_id":"m-000439","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same test, condition (API, no system prompt) and group v4; the Opus 5 card gives 97.46 against 97.98 in Opus 4.8's own card, with no reason recorded."},
{"link_id":"rs-m-000344-m-000416","own_measurement_id":"m-000344","later_measurement_id":"m-000416","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same test, condition (API, no system prompt) and group v4; the Sonnet 5 card gives Mythos Preview 95.86 against 97.23 first reported in the Opus 4.8 card, with no reason recorded."},
{"link_id":"rs-m-000354-m-000384","own_measurement_id":"m-000354","later_measurement_id":"m-000384","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Different evaluation set: the own value is the Opus 4.8 card's index over 11 evaluations, and the Fable 5 card notes the Opus 4.8 value was computed on a different evaluation set (group v1 to v2)."},
{"link_id":"rs-m-000354-m-000498","own_measurement_id":"m-000354","later_measurement_id":"m-000498","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Re-based measure: the Opus 5.5 card re-bases the index over 43 benchmarks and says its values are not comparable with earlier cards' values (group v1 to v3)."},
{"link_id":"rs-m-000383-m-000450","own_measurement_id":"m-000383","later_measurement_id":"m-000450","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same index on the same scale (group v2); the Opus 5 card prints 161.3 for Mythos 5 against 161.29 in its own card, the same value at lower precision."},
{"link_id":"rs-m-000383-m-000472","own_measurement_id":"m-000383","later_measurement_id":"m-000472","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same index on the same scale (group v2) with no stated change; the Fable 5.1 card gives 159.46 (n=97) against 161.29, treated as a re-estimate of the same measurement. What n counts, and whether the benchmark mix changed, is not recorded."},
{"link_id":"rs-m-000383-m-000497","own_measurement_id":"m-000383","later_measurement_id":"m-000497","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Re-based measure: the Opus 5.5 card re-bases the index over 43 benchmarks and says its values are not comparable with earlier cards' values (group v2 to v3)."},
{"link_id":"rs-m-000449-m-000473","own_measurement_id":"m-000449","later_measurement_id":"m-000473","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same index on the same scale (group v2) with no stated change; the Fable 5.1 card gives 160.73 (n=64) against 162.1 (n=40), treated as a re-estimate of the same measurement. What n counts is not recorded."},
{"link_id":"rs-m-000449-m-000496","own_measurement_id":"m-000449","later_measurement_id":"m-000496","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Re-based measure: the Opus 5.5 card re-bases the index over 43 benchmarks and says its values are not comparable with earlier cards' values (group v2 to v3)."},
{"link_id":"rs-m-000471-m-000495","own_measurement_id":"m-000471","later_measurement_id":"m-000495","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Re-based measure: the Opus 5.5 card re-bases the index over 43 benchmarks and says its values are not comparable with earlier cards' values (group v2 to v3)."},
{"link_id":"rs-m-000552-m-000529","own_measurement_id":"m-000552","later_measurement_id":"m-000529","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Possibly a different snapshot: the Gemini 2.5 Pro model card prints key-skills results for two model versions and it is not clear which one the 1/12 belongs to, so it is not linked to the technical report's 6/12."},
{"link_id":"rs-m-000557-m-000524","own_measurement_id":"m-000557","later_measurement_id":"m-000524","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same FSF Cyber Uplift Level 1 determination (alert threshold reached, CCL not reached) repeated in the Gemini 2.5 Pro model card; identical value."},
{"link_id":"rs-m-000699-m-000810","own_measurement_id":"m-000699","later_measurement_id":"m-000810","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same SimpleQA hallucination rate without browsing in one group with no stated change; the GPT-5 card gives 0.46 against 0.51 in o3's own card, and no card explains the difference."},
{"link_id":"rs-m-000700-m-000812","own_measurement_id":"m-000700","later_measurement_id":"m-000812","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same SimpleQA hallucination rate without browsing in one group with no stated change; the GPT-5 card gives 0.75 against 0.79 in o4-mini's own card, and no card explains the difference."},
{"link_id":"rs-m-000700-m-000920","own_measurement_id":"m-000700","later_measurement_id":"m-000920","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same SimpleQA hallucination rate without browsing in one group with no stated change; the gpt-oss card gives 0.75 against 0.79 in o4-mini's own card, and no card explains the difference."},
{"link_id":"rs-m-000703-m-000923","own_measurement_id":"m-000703","later_measurement_id":"m-000923","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same PersonQA hallucination rate without browsing in one group with no stated change; the gpt-oss card gives 0.361 against 0.48 while printing nearly the same accuracy (0.356 against 0.36), which the evidence does not explain."},
{"link_id":"rs-m-000728-m-000844","own_measurement_id":"m-000728","later_measurement_id":"m-000844","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same METR 50% time horizon in one group; the GPT-5 card repeats o3's value (1h30m, printed as about 1h30m in the own card)."},
{"link_id":"rs-m-000742-m-000956","own_measurement_id":"m-000742","later_measurement_id":"m-000956","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: New version of the test: the GPT-5.1 addendum introduces Production Benchmarks v2, a new harder prompt set that v0 notes is not comparable with the GPT-5 card's Table 3 (group v1 to v2)."},
{"link_id":"rs-m-000754-m-000986","own_measurement_id":"m-000754","later_measurement_id":"m-000986","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: New version of the test: the GPT-5.1 addendum introduces Production Benchmarks v2, a new harder prompt set that v0 notes is not comparable with the GPT-5 card's Table 3 (group v1 to v2)."},
{"link_id":"rs-m-000758-m-000971","own_measurement_id":"m-000758","later_measurement_id":"m-000971","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: New version of the test: the GPT-5.1 addendum introduces Production Benchmarks v2, a new harder prompt set that v0 notes is not comparable with the GPT-5 card's Table 3 (group v1 to v2)."},
{"link_id":"rs-m-000766-m-000951","own_measurement_id":"m-000766","later_measurement_id":"m-000951","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: New version of the test: the GPT-5.1 addendum introduces Production Benchmarks v2, a new harder prompt set that v0 notes is not comparable with the GPT-5 card's Table 3 (group v1 to v2)."},
{"link_id":"rs-m-000770-m-000991","own_measurement_id":"m-000770","later_measurement_id":"m-000991","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: New version of the test: the GPT-5.1 addendum introduces Production Benchmarks v2, a new harder prompt set that v0 notes is not comparable with the GPT-5 card's Table 3 (group v1 to v2)."},
{"link_id":"rs-m-000774-m-000996","own_measurement_id":"m-000774","later_measurement_id":"m-000996","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: New version of the test: the GPT-5.1 addendum introduces Production Benchmarks v2, a new harder prompt set that v0 notes is not comparable with the GPT-5 card's Table 3 (group v1 to v2)."},
{"link_id":"rs-m-000778-m-001001","own_measurement_id":"m-000778","later_measurement_id":"m-001001","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: New version of the test: the GPT-5.1 addendum introduces Production Benchmarks v2, a new harder prompt set that v0 notes is not comparable with the GPT-5 card's Table 3 (group v1 to v2)."},
{"link_id":"rs-m-000851-m-001055","own_measurement_id":"m-000851","later_measurement_id":"m-001055","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: The GPT-5.1-Codex-Max card reports a revised challenge suite (medium and hard tiers grew from 14 to 17 and 4 to 6; v0 notes it differs from the GPT-5 card suite; group v1 to v2). The easy tier keeps 18 challenges and the same count, but nothing recorded says it is unchanged, so no restatement is asserted."},
{"link_id":"rs-m-000852-m-001056","own_measurement_id":"m-000852","later_measurement_id":"m-001056","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Different challenge set: the medium tier is out of 14 in the GPT-5 card and out of 17 in the GPT-5.1-Codex-Max card's revised suite (group v1 to v2)."},
{"link_id":"rs-m-000853-m-001057","own_measurement_id":"m-000853","later_measurement_id":"m-001057","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Different challenge set: the hard tier is out of 4 in the GPT-5 card and out of 6 in the GPT-5.1-Codex-Max card's revised suite (group v1 to v2)."},
{"link_id":"rs-m-000859-m-000741","own_measurement_id":"m-000859","later_measurement_id":"m-000741","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v1 category; the GPT-5 card repeats GPT-4o's value first reported in the gpt-oss card (0.882)."},
{"link_id":"rs-m-000863-m-000745","own_measurement_id":"m-000863","later_measurement_id":"m-000745","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v1 category with no stated change; the GPT-5 card gives 0.967 against 0.860 in the gpt-oss card while every other GPT-4o category matches, and neither card explains the difference."},
{"link_id":"rs-m-000867-m-000749","own_measurement_id":"m-000867","later_measurement_id":"m-000749","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v1 category; the GPT-5 card repeats GPT-4o's value first reported in the gpt-oss card (0.745)."},
{"link_id":"rs-m-000871-m-000753","own_measurement_id":"m-000871","later_measurement_id":"m-000753","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v1 category; the GPT-5 card repeats GPT-4o's value first reported in the gpt-oss card (0.927)."},
{"link_id":"rs-m-000875-m-000757","own_measurement_id":"m-000875","later_measurement_id":"m-000757","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v1 category; the GPT-5 card repeats GPT-4o's value first reported in the gpt-oss card (0.939)."},
{"link_id":"rs-m-000879-m-000761","own_measurement_id":"m-000879","later_measurement_id":"m-000761","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v1 category; the GPT-5 card repeats GPT-4o's value first reported in the gpt-oss card (0.919)."},
{"link_id":"rs-m-000883-m-000765","own_measurement_id":"m-000883","later_measurement_id":"m-000765","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v1 category; the GPT-5 card repeats GPT-4o's value first reported in the gpt-oss card (0.867)."},
{"link_id":"rs-m-000887-m-000769","own_measurement_id":"m-000887","later_measurement_id":"m-000769","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v1 category; the GPT-5 card repeats GPT-4o's value first reported in the gpt-oss card (0.573)."},
{"link_id":"rs-m-000891-m-000773","own_measurement_id":"m-000891","later_measurement_id":"m-000773","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v1 category; the GPT-5 card repeats GPT-4o's value first reported in the gpt-oss card (0.633)."},
{"link_id":"rs-m-000895-m-000777","own_measurement_id":"m-000895","later_measurement_id":"m-000777","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v1 category; the GPT-5 card repeats GPT-4o's value first reported in the gpt-oss card (0.849)."},
{"link_id":"rs-m-000899-m-000781","own_measurement_id":"m-000899","later_measurement_id":"m-000781","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v1 category; the GPT-5 card repeats GPT-4o's value first reported in the gpt-oss card (0.735)."},
{"link_id":"rs-m-000945-m-001040","own_measurement_id":"m-000945","later_measurement_id":"m-001040","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same malware refusal golden set and metric in one group; the GPT-5.1-Codex-Max card repeats GPT-5-Codex's value unchanged (1.0)."},
{"link_id":"rs-m-000946-m-001041","own_measurement_id":"m-000946","later_measurement_id":"m-001041","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same malware refusal golden set and metric in one group; the GPT-5.1-Codex-Max card repeats codex-1's value first reported in the GPT-5-Codex addendum (0.98)."},
{"link_id":"rs-m-000947-m-001043","own_measurement_id":"m-000947","later_measurement_id":"m-001043","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Codex-environment prompt-injection test in one group; the GPT-5.1-Codex-Max card repeats GPT-5-Codex's value unchanged (0.98)."},
{"link_id":"rs-m-000948-m-001044","own_measurement_id":"m-000948","later_measurement_id":"m-001044","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Codex-environment prompt-injection test in one group; the GPT-5.1-Codex-Max card repeats codex-1's value first reported in the GPT-5-Codex addendum (0.98)."},
{"link_id":"rs-m-000952-m-001068","own_measurement_id":"m-000952","later_measurement_id":"m-001068","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Thinking comes out at 0.856 against 0.86."},
{"link_id":"rs-m-000955-m-001066","own_measurement_id":"m-000955","later_measurement_id":"m-001066","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Instant's value is unchanged (0.853)."},
{"link_id":"rs-m-000957-m-001072","own_measurement_id":"m-000957","later_measurement_id":"m-001072","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Thinking comes out at 0.931 against 1.0."},
{"link_id":"rs-m-000960-m-001070","own_measurement_id":"m-000960","later_measurement_id":"m-001070","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Instant's value is unchanged (1.0)."},
{"link_id":"rs-m-000962-m-001076","own_measurement_id":"m-000962","later_measurement_id":"m-001076","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Thinking comes out at 0.749 against 0.747."},
{"link_id":"rs-m-000965-m-001074","own_measurement_id":"m-000965","later_measurement_id":"m-001074","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Instant's value is unchanged (0.836)."},
{"link_id":"rs-m-000967-m-001080","own_measurement_id":"m-000967","later_measurement_id":"m-001080","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Thinking comes out at 0.927 against 0.895."},
{"link_id":"rs-m-000970-m-001078","own_measurement_id":"m-000970","later_measurement_id":"m-001078","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Instant's value is unchanged (0.917)."},
{"link_id":"rs-m-000972-m-001084","own_measurement_id":"m-000972","later_measurement_id":"m-001084","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Thinking's value is unchanged (1.0)."},
{"link_id":"rs-m-000975-m-001082","own_measurement_id":"m-000975","later_measurement_id":"m-001082","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Instant's value is unchanged (0.989)."},
{"link_id":"rs-m-000977-m-001088","own_measurement_id":"m-000977","later_measurement_id":"m-001088","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Thinking comes out at 0.824 against 0.839."},
{"link_id":"rs-m-000980-m-001086","own_measurement_id":"m-000980","later_measurement_id":"m-001086","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Instant's value is unchanged (0.897)."},
{"link_id":"rs-m-000982-m-001096","own_measurement_id":"m-000982","later_measurement_id":"m-001096","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Thinking's value is unchanged (0.93)."},
{"link_id":"rs-m-000985-m-001094","own_measurement_id":"m-000985","later_measurement_id":"m-001094","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Instant's value is unchanged (0.938)."},
{"link_id":"rs-m-000987-m-001100","own_measurement_id":"m-000987","later_measurement_id":"m-001100","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Thinking comes out at 0.935 against 0.901."},
{"link_id":"rs-m-000990-m-001098","own_measurement_id":"m-000990","later_measurement_id":"m-001098","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Instant's value is unchanged (0.957)."},
{"link_id":"rs-m-001007-m-001104","own_measurement_id":"m-001007","later_measurement_id":"m-001104","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Thinking's value is unchanged (0.684)."},
{"link_id":"rs-m-001010-m-001102","own_measurement_id":"m-001010","later_measurement_id":"m-001102","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Instant's value is unchanged (0.883)."},
{"link_id":"rs-m-001012-m-001108","own_measurement_id":"m-001012","later_measurement_id":"m-001108","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Thinking's value is unchanged (0.785)."},
{"link_id":"rs-m-001015-m-001106","own_measurement_id":"m-001015","later_measurement_id":"m-001106","status":"confirmed","stated_reason":"earlier models' values re-run","notes":"Decided by claude-opus-5-5: Same Production Benchmarks v2 category; v0 records that the GPT-5.2 card re-ran the values for earlier models, and GPT-5.1 Instant's value is unchanged (0.945)."},
{"link_id":"rs-m-001017-m-001038","own_measurement_id":"m-001017","later_measurement_id":"m-001038","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same StrongReject aggregate under the same name in one group; the GPT-5.1-Codex-Max card repeats GPT-5.1 Thinking's value unchanged (0.967)."},
{"link_id":"rs-m-001017-m-001113","own_measurement_id":"m-001017","later_measurement_id":"m-001113","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: The GPT-5.2 card reports a set it calls StrongReject filtered, which the group record treats as a filtered prompt set distinct from the GPT-5.1 card's StrongReject (group v1 to v2). Unchanged Instant values in the same table hint the sets may coincide, but the evidence does not say so."},
{"link_id":"rs-m-001019-m-001110","own_measurement_id":"m-001019","later_measurement_id":"m-001110","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Same value (0.85), but the GPT-5.2 card reports it on StrongReject filtered, treated as a different, filtered prompt set from the GPT-5.1 card's StrongReject (group v1 to v2); nothing recorded says the two sets are the same."},
{"link_id":"rs-m-001020-m-001111","own_measurement_id":"m-001020","later_measurement_id":"m-001111","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Same value (0.976), but the GPT-5.2 card reports it on StrongReject filtered, treated as a different, filtered prompt set from the GPT-5.1 card's StrongReject (group v1 to v2); nothing recorded says the two sets are the same."},
{"link_id":"rs-m-001035-m-001163","own_measurement_id":"m-001035","later_measurement_id":"m-001163","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Owner-confirmed seed pair: same Production Benchmarks v2 category; the GPT-5.2-Codex card gives 0.597 against 0.519 in the Codex-Max card, which v0 describes as a re-run."},
{"link_id":"rs-m-001036-m-001165","own_measurement_id":"m-001036","later_measurement_id":"m-001165","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same table and document pair as seed 1035 to 1163, same Production Benchmarks v2 category; the GPT-5.2-Codex card gives 0.826 against 0.917 in the Codex-Max card, which v0 describes as a re-run."},
{"link_id":"rs-m-001037-m-001161","own_measurement_id":"m-001037","later_measurement_id":"m-001161","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same StrongReject aggregate under the same name in one group; the GPT-5.2-Codex card repeats Codex-Max's value unchanged (0.967)."},
{"link_id":"rs-m-001045-m-001170","own_measurement_id":"m-001045","later_measurement_id":"m-001170","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same destructive-action avoidance score in one group; the GPT-5.2-Codex card repeats Codex-Max's value unchanged (0.75), as the blind check also noted."},
{"link_id":"rs-m-001046-m-001169","own_measurement_id":"m-001046","later_measurement_id":"m-001169","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same destructive-action avoidance score in one group; the GPT-5.2-Codex card repeats GPT-5.1-Codex's value first reported in the Codex-Max card (0.7)."},
{"link_id":"rs-m-001047-m-001168","own_measurement_id":"m-001047","later_measurement_id":"m-001168","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same destructive-action avoidance score in one group; the GPT-5.2-Codex card repeats GPT-5-Codex's value first reported in the Codex-Max card (0.66)."},
{"link_id":"rs-m-001171-m-001419","own_measurement_id":"m-001171","later_measurement_id":"m-001419","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same destructive-action avoidance score and value (0.76) in one group; the GPT-5.3-Codex card heads the column Score."},
{"link_id":"rs-m-001292-m-001198","own_measurement_id":"m-001292","later_measurement_id":"m-001198","status":"confirmed","stated_reason":"metric renamed to safe completion rate","notes":"Decided by claude-opus-5-5: Owner-confirmed seed pair: same Production Benchmarks category (group v3); the GPT-6 Astra card renames the metric to safe completion rate (not disallowed) and gives 0.785 against 0.708."},
{"link_id":"rs-m-001293-m-001199","own_measurement_id":"m-001293","later_measurement_id":"m-001199","status":"confirmed","stated_reason":"metric renamed to safe completion rate","notes":"Decided by claude-opus-5-5: Same table and document pair as seed 1292 to 1198: the GPT-6 Astra card renames the metric to safe completion rate (not disallowed) and gives 0.915 against 0.948; v0 describes the Astra values for Sol as a re-run."},
{"link_id":"rs-m-001322-m-001271","own_measurement_id":"m-001322","later_measurement_id":"m-001271","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Preparedness determination (High for biological and chemical, for the GPT-5.6 models) repeated in the GPT-5.6 card after the Preview card; identical value."},
{"link_id":"rs-m-001323-m-001272","own_measurement_id":"m-001323","later_measurement_id":"m-001272","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Preparedness determination (High for cybersecurity) repeated in the GPT-5.6 card after the Preview card; identical value."},
{"link_id":"rs-m-001324-m-001273","own_measurement_id":"m-001324","later_measurement_id":"m-001273","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Preparedness determination (below High for AI self-improvement) repeated in the GPT-5.6 card after the Preview card; identical value."},
{"link_id":"rs-m-001327-m-001198","own_measurement_id":"m-001327","later_measurement_id":"m-001198","status":"confirmed","stated_reason":"metric renamed to safe completion rate","notes":"Decided by claude-opus-5-5: The GPT-5.6 Preview card is Sol's earliest own document (0.708, a table v0 notes is identical to the GPT-5.6 card's); the GPT-6 Astra card re-reports Sol's gore value as 0.785 under the renamed metric, as in seed pair 1292 to 1198."},
{"link_id":"rs-m-001327-m-001292","own_measurement_id":"m-001327","later_measurement_id":"m-001292","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: The GPT-5.6 card repeats the Preview card's table, which v0 notes is identical, so the same value (0.708) is restated by Sol's second own document."},
{"link_id":"rs-m-001337-m-001286","own_measurement_id":"m-001337","later_measurement_id":"m-001286","status":"confirmed","stated_reason":"corrected in the later card's changelog from a pass@1 figure","notes":"Decided by claude-opus-5-5: Same pass@4 protein-binding score; the GPT-5.6 card's changelog corrected its GPT-5.5 figure from 0.4% (a pass@1 value) to 1.5%, which matches GPT-5.5's own 1.48% at lower precision."},
{"link_id":"rs-m-001349-m-001300","own_measurement_id":"m-001349","later_measurement_id":"m-001300","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Owner-confirmed seed pair: same Connectors prompt-injection defense rate (group v2); the GPT-5.6 card gives 1.000 against 0.963 in GPT-5.5's own card with no stated reason."},
{"link_id":"rs-m-001350-m-001309","own_measurement_id":"m-001350","later_measurement_id":"m-001309","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Different definition: the GPT-5.6 card re-scores GPT-5.5 under an avoidance-only definition that replaces the original score (group v1 to avoidance-only v2)."},
{"link_id":"rs-m-001355-m-001319","own_measurement_id":"m-001355","later_measurement_id":"m-001319","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Different setup: the GPT-5.5 card measures controllability at 50k-character chains of thought and the GPT-5.6 card at about 5k tokens; the group record keeps lengths as separate series."},
{"link_id":"rs-m-001369-m-001333","own_measurement_id":"m-001369","later_measurement_id":"m-001333","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Cyber Range combined pass rate (group v4); the GPT-5.5 card repeats GPT-5.4 Thinking's value unchanged (73.33)."},
{"link_id":"rs-m-001386-m-001320","own_measurement_id":"m-001386","later_measurement_id":"m-001320","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: Different setup: the GPT-5.4 Thinking card measures controllability at 10k-character chains of thought and the GPT-5.6 card at about 5k tokens; the group record keeps lengths as separate series."},
{"link_id":"rs-m-001396-m-001370","own_measurement_id":"m-001396","later_measurement_id":"m-001370","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Cyber Range combined pass rate (group v4, 15 scenarios); the GPT-5.4 Thinking card repeats GPT-5.3-Codex's value unchanged (80)."},
{"link_id":"rs-m-001397-m-001371","own_measurement_id":"m-001397","later_measurement_id":"m-001371","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Cyber Range combined pass rate (group v4); the GPT-5.4 Thinking card repeats GPT-5.2-Codex's value first reported in the GPT-5.3-Codex card (53.33)."},
{"link_id":"rs-m-001399-m-001372","own_measurement_id":"m-001399","later_measurement_id":"m-001372","status":"confirmed","stated_reason":"","notes":"Decided by claude-opus-5-5: Same Cyber Range combined pass rate (group v4); the GPT-5.4 Thinking card repeats GPT-5.2 Thinking's value first reported in the GPT-5.3-Codex card (47)."},
{"link_id":"rs-m-001568-m-001590","own_measurement_id":"m-001568","later_measurement_id":"m-001590","status":"rejected","stated_reason":"","notes":"Decided by claude-opus-5-5: New version of the test: the Grok 4.7 card reports HackerBench v0.3, against v0.2 in the Grok 4.6 card (group v1 to v2)."}
],
"determinations": [
{"determination_id":"d-m-000042-overall","measurement_id":"m-000042","model_id":"claude-opus-4","version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"overall","level_as_printed":"ASL-3","ordinal_within_framework":null,"notes":"provisional and precautionary per v0 note"},
{"determination_id":"d-m-000043-overall","measurement_id":"m-000043","model_id":"claude-sonnet-4","version_id":"anthropic-claude-opus-4-sonnet-4-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"overall","level_as_printed":"ASL-2","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000070-overall","measurement_id":"m-000070","model_id":"claude-opus-4-1","version_id":"anthropic-claude-opus-4-1-system-card-addendum--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"overall","level_as_printed":"ASL-3","ordinal_within_framework":null,"notes":"precautionary, as for Opus 4, per v0 note"},
{"determination_id":"d-m-000133-overall","measurement_id":"m-000133","model_id":"claude-sonnet-4-5","version_id":"anthropic-claude-sonnet-4-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"overall","level_as_printed":"ASL-3","ordinal_within_framework":null,"notes":"precautionary per v0 note"},
{"determination_id":"d-m-000168-overall","measurement_id":"m-000168","model_id":"claude-haiku-4-5","version_id":"anthropic-claude-haiku-4-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"overall","level_as_printed":"ASL-2","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000224-overall","measurement_id":"m-000224","model_id":"claude-opus-4-5","version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"overall","level_as_printed":"ASL-3","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000225-bio-chem","measurement_id":"m-000225","model_id":"claude-opus-4-5","version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"bio_chem","level_as_printed":"No","ordinal_within_framework":null,"notes":"CBRN-4 capability threshold"},
{"determination_id":"d-m-000226-ai-rnd-autonomy","measurement_id":"m-000226","model_id":"claude-opus-4-5","version_id":"anthropic-claude-opus-4-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"No","ordinal_within_framework":null,"notes":"AI R&D-4 capability threshold"},
{"determination_id":"d-m-000253-ai-rnd-autonomy","measurement_id":"m-000253","model_id":"claude-opus-4-6","version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"not crossed","ordinal_within_framework":null,"notes":"AI R&D-4 capability threshold"},
{"determination_id":"d-m-000254-bio-chem","measurement_id":"m-000254","model_id":"claude-opus-4-6","version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"bio_chem","level_as_printed":"not crossed","ordinal_within_framework":null,"notes":"CBRN-4 capability threshold"},
{"determination_id":"d-m-000255-overall","measurement_id":"m-000255","model_id":"claude-opus-4-6","version_id":"anthropic-claude-opus-4-6-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"overall","level_as_printed":"ASL-3","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000270-overall","measurement_id":"m-000270","model_id":"claude-sonnet-4-6","version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"overall","level_as_printed":"ASL-3","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000271-ai-rnd-autonomy","measurement_id":"m-000271","model_id":"claude-sonnet-4-6","version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"not crossed","ordinal_within_framework":null,"notes":"AI R&D-4 capability threshold"},
{"determination_id":"d-m-000272-bio-chem","measurement_id":"m-000272","model_id":"claude-sonnet-4-6","version_id":"anthropic-claude-sonnet-4-6-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"bio_chem","level_as_printed":"not crossed","ordinal_within_framework":null,"notes":"CBRN-4 capability threshold"},
{"determination_id":"d-m-000274-bio-chem","measurement_id":"m-000274","model_id":"claude-mythos-preview","version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"3.0","domain":"bio_chem","level_as_printed":"applicable","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. CB-1 threat model"},
{"determination_id":"d-m-000275-bio-chem","measurement_id":"m-000275","model_id":"claude-mythos-preview","version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"3.0","domain":"bio_chem","level_as_printed":"not applicable","ordinal_within_framework":null,"notes":"CB-2 threat model"},
{"determination_id":"d-m-000276-ai-rnd-autonomy","measurement_id":"m-000276","model_id":"claude-mythos-preview","version_id":"anthropic-claude-mythos-preview-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"3.0","domain":"ai_rnd_autonomy","level_as_printed":"not applicable","ordinal_within_framework":null,"notes":"autonomy threat model 2 (automated R&D)"},
{"determination_id":"d-m-000316-bio-chem","measurement_id":"m-000316","model_id":"claude-opus-4-7","version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"bio_chem","level_as_printed":"applicable","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. CB-1 threat model"},
{"determination_id":"d-m-000317-bio-chem","measurement_id":"m-000317","model_id":"claude-opus-4-7","version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"bio_chem","level_as_printed":"not applicable","ordinal_within_framework":null,"notes":"CB-2 threat model"},
{"determination_id":"d-m-000318-ai-rnd-autonomy","measurement_id":"m-000318","model_id":"claude-opus-4-7","version_id":"anthropic-claude-opus-4-7-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"not applicable","ordinal_within_framework":null,"notes":"autonomy threat model 2 (automated R&D)"},
{"determination_id":"d-m-000363-bio-chem","measurement_id":"m-000363","model_id":"claude-opus-4-8","version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"bio_chem","level_as_printed":"not beyond Mythos Preview","ordinal_within_framework":null,"notes":"CB-2 threat model; stated by reference to Mythos Preview"},
{"determination_id":"d-m-000364-ai-rnd-autonomy","measurement_id":"m-000364","model_id":"claude-opus-4-8","version_id":"anthropic-claude-opus-4-8-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"not applicable","ordinal_within_framework":null,"notes":"autonomy threat model 2 (automated R&D)"},
{"determination_id":"d-m-000375-bio-chem","measurement_id":"m-000375","model_id":"claude-mythos-5","version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"bio_chem","level_as_printed":"applicable","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. CB-1 threat model"},
{"determination_id":"d-m-000376-bio-chem","measurement_id":"m-000376","model_id":"claude-mythos-5","version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"bio_chem","level_as_printed":"not crossed (elevated, less clear)","ordinal_within_framework":null,"notes":"CB-2 threat model"},
{"determination_id":"d-m-000377-ai-rnd-autonomy","measurement_id":"m-000377","model_id":"claude-mythos-5","version_id":"anthropic-claude-fable-5-claude-mythos-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"not applicable","ordinal_within_framework":null,"notes":"autonomy threat model 2 (automated R&D)"},
{"determination_id":"d-m-000428-ai-rnd-autonomy","measurement_id":"m-000428","model_id":"claude-sonnet-5","version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"TM2 not applicable","ordinal_within_framework":null,"notes":"treated as CB-1 capable per v0 note"},
{"determination_id":"d-m-000428-bio-chem","measurement_id":"m-000428","model_id":"claude-sonnet-5","version_id":"anthropic-claude-sonnet-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"bio_chem","level_as_printed":"CB-2 not crossed","ordinal_within_framework":null,"notes":"treated as CB-1 capable per v0 note"},
{"determination_id":"d-m-000460-ai-rnd-autonomy","measurement_id":"m-000460","model_id":"claude-opus-5","version_id":"anthropic-claude-opus-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"neither crossed","ordinal_within_framework":null,"notes":"\"neither crossed\" refers to the CB-2 and AI R&D thresholds named in the evaluation"},
{"determination_id":"d-m-000460-bio-chem","measurement_id":"m-000460","model_id":"claude-opus-5","version_id":"anthropic-claude-opus-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"bio_chem","level_as_printed":"neither crossed","ordinal_within_framework":null,"notes":"\"neither crossed\" refers to the CB-2 and AI R&D thresholds named in the evaluation"},
{"determination_id":"d-m-000460-overall","measurement_id":"m-000460","model_id":"claude-opus-5","version_id":"anthropic-claude-opus-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"overall","level_as_printed":"ASL-3 protections","ordinal_within_framework":null,"notes":"\"neither crossed\" refers to the CB-2 and AI R&D thresholds named in the evaluation"},
{"determination_id":"d-m-000477-ai-rnd-autonomy","measurement_id":"m-000477","model_id":"claude-fable-5-1","version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"TM2 N/A","ordinal_within_framework":null,"notes":"alignment risk low is recorded in the v0 note only"},
{"determination_id":"d-m-000477-bio-chem","measurement_id":"m-000477","model_id":"claude-fable-5-1","version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"bio_chem","level_as_printed":"CB-1 yes","ordinal_within_framework":null,"notes":"alignment risk low is recorded in the v0 note only"},
{"determination_id":"d-m-000477-bio-chem-2","measurement_id":"m-000477","model_id":"claude-fable-5-1","version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"bio_chem","level_as_printed":"CB-2 no","ordinal_within_framework":null,"notes":"alignment risk low is recorded in the v0 note only"},
{"determination_id":"d-m-000477-cyber","measurement_id":"m-000477","model_id":"claude-fable-5-1","version_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"cyber","level_as_printed":"cyber Tier 1","ordinal_within_framework":null,"notes":"alignment risk low is recorded in the v0 note only"},
{"determination_id":"d-m-000501-ai-rnd-autonomy","measurement_id":"m-000501","model_id":"claude-opus-5-5","version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"AI R&D not crossed","ordinal_within_framework":null,"notes":"alignment risk low is recorded in the v0 note only"},
{"determination_id":"d-m-000501-bio-chem","measurement_id":"m-000501","model_id":"claude-opus-5-5","version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"bio_chem","level_as_printed":"CB-1 yes","ordinal_within_framework":null,"notes":"alignment risk low is recorded in the v0 note only"},
{"determination_id":"d-m-000501-bio-chem-2","measurement_id":"m-000501","model_id":"claude-opus-5-5","version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"bio_chem","level_as_printed":"CB-2 no","ordinal_within_framework":null,"notes":"alignment risk low is recorded in the v0 note only"},
{"determination_id":"d-m-000501-cyber","measurement_id":"m-000501","model_id":"claude-opus-5-5","version_id":"anthropic-claude-opus-5-5-system-card--2026-09-26","framework":"Responsible Scaling Policy","framework_version":"","domain":"cyber","level_as_printed":"cyber Tier 1","ordinal_within_framework":null,"notes":"alignment risk low is recorded in the v0 note only"},
{"determination_id":"d-m-000522-bio-chem","measurement_id":"m-000522","model_id":"gemini-2-5-pro","version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"bio_chem","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. CBRN Uplift Level 1; the card says the GA model does not reach the alert threshold."},
{"determination_id":"d-m-000523-cyber","measurement_id":"m-000523","model_id":"gemini-2-5-pro","version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"cyber","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Cyber Autonomy Level 1."},
{"determination_id":"d-m-000524-cyber","measurement_id":"m-000524","model_id":"gemini-2-5-pro","version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"cyber","level_as_printed":"alert_threshold_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Cyber Uplift Level 1; CCL not reached, early-warning alert threshold reached."},
{"determination_id":"d-m-000525-ai-rnd-autonomy","measurement_id":"m-000525","model_id":"gemini-2-5-pro","version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. ML R&D Autonomy Level 1."},
{"determination_id":"d-m-000526-ai-rnd-autonomy","measurement_id":"m-000526","model_id":"gemini-2-5-pro","version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. ML R&D Uplift Level 1; worded as likely not reached."},
{"determination_id":"d-m-000527-misalignment","measurement_id":"m-000527","model_id":"gemini-2-5-pro","version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"misalignment","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Deceptive alignment instrumental reasoning Level 1; the card says evaluations of the GA model were not complete and the result comes from the Preview model."},
{"determination_id":"d-m-000528-misalignment","measurement_id":"m-000528","model_id":"gemini-2-5-pro","version_id":"google-deepmind-gemini-2-5-pro-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"misalignment","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Deceptive alignment instrumental reasoning Level 2."},
{"determination_id":"d-m-000557-cyber","measurement_id":"m-000557","model_id":"gemini-2-5-pro","version_id":"google-deepmind-gemini-2-5-technical-report--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"cyber","level_as_printed":"alert_threshold_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Cyber Uplift Level 1 (Table 10); the report says all other CCLs were not reached."},
{"determination_id":"d-m-000563-overall","measurement_id":"m-000563","model_id":"gemini-2-5-flash","version_id":"google-deepmind-gemini-2-5-flash-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"overall","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. All CCLs; Gemini 2.5 Flash relies on the evaluation of Gemini 2.5 Pro Preview."},
{"determination_id":"d-m-000569-bio-chem","measurement_id":"m-000569","model_id":"gemini-2-5-deep-think","version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"bio_chem","level_as_printed":"alert_threshold_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. CBRN Uplift Level 1; early-warning alert threshold reached, with further evaluation and proactive mitigations noted."},
{"determination_id":"d-m-000570-cyber","measurement_id":"m-000570","model_id":"gemini-2-5-deep-think","version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"cyber","level_as_printed":"alert_threshold_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Cyber Uplift Level 1; alert threshold first reached by Gemini 2.5 Pro."},
{"determination_id":"d-m-000571-cyber","measurement_id":"m-000571","model_id":"gemini-2-5-deep-think","version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"cyber","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Cyber Autonomy Level 1."},
{"determination_id":"d-m-000572-ai-rnd-autonomy","measurement_id":"m-000572","model_id":"gemini-2-5-deep-think","version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. ML R&D Autonomy and Uplift Level 1 reported together; uplift worded as likely not reached."},
{"determination_id":"d-m-000573-misalignment","measurement_id":"m-000573","model_id":"gemini-2-5-deep-think","version_id":"google-deepmind-gemini-2-5-deep-think-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"misalignment","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Instrumental reasoning Levels 1 and 2 reported together."},
{"determination_id":"d-m-000584-other","measurement_id":"m-000584","model_id":"gemini-3-pro","version_id":"google-deepmind-gemini-3-pro-model-card--2026-09-26","framework":"Internal launch thresholds","framework_version":"","domain":"other","level_as_printed":"met","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Child safety launch thresholds met (Gemini 3 Pro card)."},
{"determination_id":"d-m-000586-bio-chem","measurement_id":"m-000586","model_id":"gemini-3-pro","version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"bio_chem","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. CBRN Uplift Level 1 under the updated FSF; alert threshold not reached, mitigations deployed as a precaution."},
{"determination_id":"d-m-000587-cyber","measurement_id":"m-000587","model_id":"gemini-3-pro","version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"cyber","level_as_printed":"alert_threshold_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Cyber Uplift Level 1; CCL not reached, alert threshold continues to be met."},
{"determination_id":"d-m-000588-manipulation","measurement_id":"m-000588","model_id":"gemini-3-pro","version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"manipulation","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Harmful Manipulation Level 1, described as exploratory; results did not near the alert threshold."},
{"determination_id":"d-m-000589-ai-rnd-autonomy","measurement_id":"m-000589","model_id":"gemini-3-pro","version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. ML R&D Acceleration/Automation Level 1; RE-Bench aggregate well below the alert threshold."},
{"determination_id":"d-m-000590-misalignment","measurement_id":"m-000590","model_id":"gemini-3-pro","version_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"misalignment","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Misalignment instrumental reasoning Levels 1 and 2, described as exploratory."},
{"determination_id":"d-m-000612-overall","measurement_id":"m-000612","model_id":"gemini-3-flash","version_id":"google-deepmind-gemini-3-flash-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"overall","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. All CCLs; relies on the Gemini 3 Pro FSF report, where the cyber uplift alert threshold was reached."},
{"determination_id":"d-m-000618-bio-chem","measurement_id":"m-000618","model_id":"gemini-3-1-pro","version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"bio_chem","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. CBRN Uplift Level 1, assessed in Deep Think mode."},
{"determination_id":"d-m-000619-cyber","measurement_id":"m-000619","model_id":"gemini-3-1-pro","version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"cyber","level_as_printed":"alert_threshold_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Cyber Uplift Level 1."},
{"determination_id":"d-m-000620-manipulation","measurement_id":"m-000620","model_id":"gemini-3-1-pro","version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"manipulation","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Harmful manipulation; did not reach the alert threshold (Deep Think mode)."},
{"determination_id":"d-m-000621-ai-rnd-autonomy","measurement_id":"m-000621","model_id":"gemini-3-1-pro","version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. ML R&D; beneath the alert threshold (Deep Think mode)."},
{"determination_id":"d-m-000622-misalignment","measurement_id":"m-000622","model_id":"gemini-3-1-pro","version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"misalignment","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Misalignment (instrumental reasoning); does not reach the alert threshold (Deep Think mode)."},
{"determination_id":"d-m-000627-other","measurement_id":"m-000627","model_id":"gemini-3-1-pro","version_id":"google-deepmind-gemini-3-1-pro-model-card--2026-09-26","framework":"Internal launch thresholds","framework_version":"","domain":"other","level_as_printed":"met","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Child safety launch thresholds met (Gemini 3.1 Pro card)."},
{"determination_id":"d-m-000633-overall","measurement_id":"m-000633","model_id":"gemini-3-1-flash-lite","version_id":"google-deepmind-gemini-3-1-flash-lite-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"overall","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. All CCLs; relies on the Gemini 3.1 Pro Deep Think results."},
{"determination_id":"d-m-000639-overall","measurement_id":"m-000639","model_id":"gemini-3-5-flash","version_id":"google-deepmind-gemini-3-5-flash-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"overall","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. All CCLs; relies on the Gemini 3.1 Pro results."},
{"determination_id":"d-m-000640-cyber","measurement_id":"m-000640","model_id":"gemini-3-5-flash","version_id":"google-deepmind-gemini-3-5-flash-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"cyber","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Cyber CCL from additional testing of Gemini 3.5 Flash itself, done because Gemini 3 models reached the cyber alert threshold."},
{"determination_id":"d-m-000646-overall","measurement_id":"m-000646","model_id":"gemini-3-5-flash-lite","version_id":"google-deepmind-gemini-3-5-flash-lite-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"overall","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. All CCLs; relies on the Gemini 3.1 Pro results."},
{"determination_id":"d-m-000652-overall","measurement_id":"m-000652","model_id":"gemini-3-6-flash","version_id":"google-deepmind-gemini-3-6-flash-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"overall","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. All CCLs; relies on the Gemini 3.1 Pro results."},
{"determination_id":"d-m-000653-cyber","measurement_id":"m-000653","model_id":"gemini-3-6-flash","version_id":"google-deepmind-gemini-3-6-flash-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"cyber","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Cyber CCL from additional testing of Gemini 3.6 Flash itself."},
{"determination_id":"d-m-000659-bio-chem","measurement_id":"m-000659","model_id":"gemini-3-7-flash","version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","framework":"Frontier Safety Framework","framework_version":"3.1","domain":"bio_chem","level_as_printed":"alert_threshold_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. CBRN uplift CCL ruled out; alert threshold reached (bio)."},
{"determination_id":"d-m-000660-bio-chem","measurement_id":"m-000660","model_id":"gemini-3-7-flash","version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","framework":"Frontier Safety Framework","framework_version":"3.1","domain":"bio_chem","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. CBRN Tracked Capability Level."},
{"determination_id":"d-m-000661-cyber","measurement_id":"m-000661","model_id":"gemini-3-7-flash","version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","framework":"Frontier Safety Framework","framework_version":"3.1","domain":"cyber","level_as_printed":"alert_threshold_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Cyber CCL; based on proxy evaluations, the key-skills benchmark was not fully run."},
{"determination_id":"d-m-000662-manipulation","measurement_id":"m-000662","model_id":"gemini-3-7-flash","version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","framework":"Frontier Safety Framework","framework_version":"3.1","domain":"manipulation","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Harmful manipulation CCL; below the alert threshold."},
{"determination_id":"d-m-000663-ai-rnd-autonomy","measurement_id":"m-000663","model_id":"gemini-3-7-flash","version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","framework":"Frontier Safety Framework","framework_version":"3.1","domain":"ai_rnd_autonomy","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. ML R&D acceleration/automation CCL."},
{"determination_id":"d-m-000664-misalignment","measurement_id":"m-000664","model_id":"gemini-3-7-flash","version_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report--2026-09-26","framework":"Frontier Safety Framework","framework_version":"3.1","domain":"misalignment","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. Stealth and situational awareness Tracked Capability Level."},
{"determination_id":"d-m-000686-overall","measurement_id":"m-000686","model_id":"gemini-3-8-flash","version_id":"google-deepmind-gemini-3-8-flash-model-card--2026-09-26","framework":"Frontier Safety Framework","framework_version":"","domain":"overall","level_as_printed":"not_reached","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. All CCLs and TCLs, inherited from Gemini 3.7 Flash because the card reports no new capabilities; the 3.7 Flash report (FSF v3.1) records reached CBRN and cyber alert thresholds."},
{"determination_id":"d-m-000714-bio-chem","measurement_id":"m-000714","model_id":"o3","version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000715-cyber","measurement_id":"m-000715","model_id":"o3","version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000716-ai-rnd-autonomy","measurement_id":"m-000716","model_id":"o3","version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000717-bio-chem","measurement_id":"m-000717","model_id":"o4-mini","version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000718-cyber","measurement_id":"m-000718","model_id":"o4-mini","version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000719-ai-rnd-autonomy","measurement_id":"m-000719","model_id":"o4-mini","version_id":"openai-o3-and-o4-mini-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000840-bio-chem","measurement_id":"m-000840","model_id":"gpt-5-thinking","version_id":"openai-gpt-5-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"High (precautionary)","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000841-cyber","measurement_id":"m-000841","model_id":"gpt-5-thinking","version_id":"openai-gpt-5-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000842-ai-rnd-autonomy","measurement_id":"m-000842","model_id":"gpt-5-thinking","version_id":"openai-gpt-5-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000924-bio-chem","measurement_id":"m-000924","model_id":"gpt-oss-120b","version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000925-bio-chem","measurement_id":"m-000925","model_id":"gpt-oss-120b","version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"Below High","ordinal_within_framework":null,"notes":"Level for the adversarially fine-tuned version of the model tested under the worst-case fine-tuning assessment."},
{"determination_id":"d-m-000926-cyber","measurement_id":"m-000926","model_id":"gpt-oss-120b","version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000927-cyber","measurement_id":"m-000927","model_id":"gpt-oss-120b","version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"Below High","ordinal_within_framework":null,"notes":"Level for the adversarially fine-tuned version of the model tested under the worst-case fine-tuning assessment."},
{"determination_id":"d-m-000928-ai-rnd-autonomy","measurement_id":"m-000928","model_id":"gpt-oss-120b","version_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000949-bio-chem","measurement_id":"m-000949","model_id":"gpt-5-codex","version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"High (treated as)","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-000950-cyber","measurement_id":"m-000950","model_id":"gpt-5-codex","version_id":"openai-gpt-5-codex-system-card-addendum--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-001021-bio-chem","measurement_id":"m-001021","model_id":"gpt-5-1-thinking","version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"High (treated as)","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-001022-cyber","measurement_id":"m-001022","model_id":"gpt-5-1-thinking","version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-001023-ai-rnd-autonomy","measurement_id":"m-001023","model_id":"gpt-5-1-thinking","version_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-001048-bio-chem","measurement_id":"m-001048","model_id":"gpt-5-1-codex-max","version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"High (treated as)","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-001049-cyber","measurement_id":"m-001049","model_id":"gpt-5-1-codex-max","version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-001050-ai-rnd-autonomy","measurement_id":"m-001050","model_id":"gpt-5-1-codex-max","version_id":"openai-gpt-5-1-codex-max-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-001142-bio-chem","measurement_id":"m-001142","model_id":"gpt-5-2-thinking","version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"High (treated as)","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-001143-cyber","measurement_id":"m-001143","model_id":"gpt-5-2-thinking","version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-001144-ai-rnd-autonomy","measurement_id":"m-001144","model_id":"gpt-5-2-thinking","version_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-001172-bio-chem","measurement_id":"m-001172","model_id":"gpt-5-2-codex","version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"High (treated as)","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-001173-cyber","measurement_id":"m-001173","model_id":"gpt-5-2-codex","version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-001174-ai-rnd-autonomy","measurement_id":"m-001174","model_id":"gpt-5-2-codex","version_id":"openai-gpt-5-2-codex-system-card-addendum--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"Below High","ordinal_within_framework":null,"notes":""},
{"determination_id":"d-m-001175-cyber","measurement_id":"m-001175","model_id":"gpt-6-astra","version_id":"openai-gpt-6-astra-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"critical","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001176-bio-chem","measurement_id":"m-001176","model_id":"gpt-6-astra","version_id":"openai-gpt-6-astra-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. The card's Preparedness section was not read in full (truncated fetch); the level is as reported by the secondary sources named in the v0 note and should be checked against the card before it is shown individually."},
{"determination_id":"d-m-001177-ai-rnd-autonomy","measurement_id":"m-001177","model_id":"gpt-6-astra","version_id":"openai-gpt-6-astra-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"below_high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. The card's Preparedness section was not read in full (truncated fetch); the level is as reported by the secondary sources named in the v0 note and should be checked against the card before it is shown individually."},
{"determination_id":"d-m-001271-bio-chem","measurement_id":"m-001271","model_id":"gpt-5-6-sol","version_id":"openai-gpt-5-6-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001272-cyber","measurement_id":"m-001272","model_id":"gpt-5-6-sol","version_id":"openai-gpt-5-6-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001273-ai-rnd-autonomy","measurement_id":"m-001273","model_id":"gpt-5-6-sol","version_id":"openai-gpt-5-6-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"below_high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001322-bio-chem","measurement_id":"m-001322","model_id":"gpt-5-6-sol","version_id":"openai-gpt-5-6-preview-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001323-cyber","measurement_id":"m-001323","model_id":"gpt-5-6-sol","version_id":"openai-gpt-5-6-preview-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001324-ai-rnd-autonomy","measurement_id":"m-001324","model_id":"gpt-5-6-sol","version_id":"openai-gpt-5-6-preview-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"below_high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001329-bio-chem","measurement_id":"m-001329","model_id":"gpt-5-5","version_id":"openai-gpt-5-5-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001330-cyber","measurement_id":"m-001330","model_id":"gpt-5-5","version_id":"openai-gpt-5-5-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001331-ai-rnd-autonomy","measurement_id":"m-001331","model_id":"gpt-5-5","version_id":"openai-gpt-5-5-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"below_high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001366-bio-chem","measurement_id":"m-001366","model_id":"gpt-5-4-thinking","version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001367-cyber","measurement_id":"m-001367","model_id":"gpt-5-4-thinking","version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001368-ai-rnd-autonomy","measurement_id":"m-001368","model_id":"gpt-5-4-thinking","version_id":"openai-gpt-5-4-thinking-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"below_high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001393-bio-chem","measurement_id":"m-001393","model_id":"gpt-5-3-codex","version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001394-cyber","measurement_id":"m-001394","model_id":"gpt-5-3-codex","version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. The card treats the model as High as a precaution (v0 condition; first launch treated as High in cyber)."},
{"determination_id":"d-m-001395-ai-rnd-autonomy","measurement_id":"m-001395","model_id":"gpt-5-3-codex","version_id":"openai-gpt-5-3-codex-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"below_high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001447-bio-chem","measurement_id":"m-001447","model_id":"gpt-5-5-instant","version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001448-cyber","measurement_id":"m-001448","model_id":"gpt-5-5-instant","version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001449-ai-rnd-autonomy","measurement_id":"m-001449","model_id":"gpt-5-5-instant","version_id":"openai-gpt-5-5-instant-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"below_high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001451-bio-chem","measurement_id":"m-001451","model_id":"gpt-rosalind-5-5","version_id":"openai-gpt-rosalind-5-5-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001464-overall","measurement_id":"m-001464","model_id":"gpt-live-1","version_id":"openai-gpt-live-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"overall","level_as_printed":"below_high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source. The card gives one level for all tracked categories; recorded as overall rather than listing categories the evidence does not name."},
{"determination_id":"d-m-001477-bio-chem","measurement_id":"m-001477","model_id":"gpt-5-6-sol","version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"bio_chem","level_as_printed":"high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001478-cyber","measurement_id":"m-001478","model_id":"gpt-5-6-sol","version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"cyber","level_as_printed":"high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001479-ai-rnd-autonomy","measurement_id":"m-001479","model_id":"gpt-5-6-sol","version_id":"openai-gpt-5-6-august-updates-system-card--2026-09-26","framework":"Preparedness Framework","framework_version":"","domain":"ai_rnd_autonomy","level_as_printed":"below_high","ordinal_within_framework":null,"notes":"v0 stored a code, not the printed wording; the wording is to be recovered from the source."},
{"determination_id":"d-m-001503-overall","measurement_id":"m-001503","model_id":"grok-4","version_id":"xai-grok-4-model-card--2026-09-26","framework":"","framework_version":"","domain":"overall","level_as_printed":"low risk (malicious use and loss of control)","ordinal_within_framework":null,"notes":"The evidence names no framework, and v0 notes that no quantified thresholds are stated. The conclusion is given with safeguards in place."},
{"determination_id":"d-m-001551-overall","measurement_id":"m-001551","model_id":"grok-4-20","version_id":"xai-grok-4-20-system-card--2026-09-26","framework":"","framework_version":"","domain":"overall","level_as_printed":"not significantly more risk than prior generations","ordinal_within_framework":null,"notes":"The evidence names no framework. The conclusion is phrased as a comparison with earlier models and given with safeguards in place."},
{"determination_id":"d-m-001566-bio-chem","measurement_id":"m-001566","model_id":"grok-4-5","version_id":"xai-grok-4-5-model-card--2026-07-20","framework":"","framework_version":"","domain":"bio_chem","level_as_printed":"sub-threshold","ordinal_within_framework":null,"notes":"The evidence for the Grok 4.5 card does not name the framework. The Grok 4.7 card refers to FAIF thresholds for the same kind of statement."},
{"determination_id":"d-m-001599-bio-chem","measurement_id":"m-001599","model_id":"grok-4-7","version_id":"xai-grok-4-7-model-card--2026-09-26","framework":"FAIF","framework_version":"","domain":"bio_chem","level_as_printed":"below FAIF safety thresholds","ordinal_within_framework":null,"notes":"The evidence names the framework only by the abbreviation FAIF."},
{"determination_id":"d-m-001600-cyber","measurement_id":"m-001600","model_id":"","version_id":"meta-llama-4-model-card--2026-09-26","framework":"","framework_version":"","domain":"cyber","level_as_printed":"no plausible catastrophic cyber uplift","ordinal_within_framework":null,"notes":"The evidence names no framework. The conclusion comes from pre-release testing in the card's critical-risks section."},
{"determination_id":"d-m-001602-bio-chem","measurement_id":"m-001602","model_id":"muse-spark","version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","framework":"Advanced AI Scaling Framework","framework_version":"2","domain":"bio_chem","level_as_printed":"High","ordinal_within_framework":null,"notes":"Pre-mitigation tier. v0 notes the post-mitigation tier is Moderate or lower, which is not recorded as a separate row."},
{"determination_id":"d-m-001603-cyber","measurement_id":"m-001603","model_id":"muse-spark","version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","framework":"Advanced AI Scaling Framework","framework_version":"2","domain":"cyber","level_as_printed":"Moderate or lower","ordinal_within_framework":null,"notes":"Post-mitigation tier stated jointly for cyber and loss of control. Loss of control is recorded under the misalignment domain."},
{"determination_id":"d-m-001603-misalignment","measurement_id":"m-001603","model_id":"muse-spark","version_id":"meta-muse-spark-safety-preparedness-report--2026-09-26","framework":"Advanced AI Scaling Framework","framework_version":"2","domain":"misalignment","level_as_printed":"Moderate or lower","ordinal_within_framework":null,"notes":"Post-mitigation tier stated jointly for cyber and loss of control. Loss of control is recorded under the misalignment domain."},
{"determination_id":"d-m-001633-cyber","measurement_id":"m-001633","model_id":"muse-spark-1-1","version_id":"meta-muse-spark-1-1-evaluation-report--2026-09-26","framework":"Advanced AI Scaling Framework","framework_version":"","domain":"cyber","level_as_printed":"High cannot be ruled out","ordinal_within_framework":null,"notes":"Pre-mitigation tier. v0 notes the chemical and biological tier is High before mitigation and Moderate or lower after it. The framework version is not stated for this report."},
{"determination_id":"d-m-001636-overall","measurement_id":"m-001636","model_id":"muse-glimmer-30b","version_id":"meta-muse-glimmer-30b-model-card--2026-09-26","framework":"Advanced AI Scaling Framework","framework_version":"","domain":"overall","level_as_printed":"Moderate or lower","ordinal_within_framework":null,"notes":"Stated for all domains at once for the open-weight release. v0 notes the cyber tier is stated as inferred. The framework version is not stated for this card."}
],
"releases": [
{"release":"v0.1","date":"2026-09-27","methodology_version":"0.1","n_measurements":1645,"n_documents":70,"n_models":87,"blind_check_sample":96,"blind_check_matches":95,"notes":"Migration of the v0 feasibility dataset. Independent re-decision of review decisions: 261 of 306 sampled decisions agreed (85.3%). Every disagreement was settled with a recorded reason: 32 kept the first decision, 13 adopted the independent one."}
],
"id_map": [
{"legacy_row_id":0,"split_index":0,"measurement_id":"m-000000"},
{"legacy_row_id":1,"split_index":0,"measurement_id":"m-000001"},
{"legacy_row_id":2,"split_index":0,"measurement_id":"m-000002"},
{"legacy_row_id":3,"split_index":0,"measurement_id":"m-000003"},
{"legacy_row_id":4,"split_index":0,"measurement_id":"m-000004"},
{"legacy_row_id":5,"split_index":0,"measurement_id":"m-000005"},
{"legacy_row_id":6,"split_index":0,"measurement_id":"m-000006"},
{"legacy_row_id":7,"split_index":0,"measurement_id":"m-000007"},
{"legacy_row_id":8,"split_index":0,"measurement_id":"m-000008"},
{"legacy_row_id":9,"split_index":0,"measurement_id":"m-000009"},
{"legacy_row_id":10,"split_index":0,"measurement_id":"m-000010"},
{"legacy_row_id":11,"split_index":0,"measurement_id":"m-000011"},
{"legacy_row_id":12,"split_index":0,"measurement_id":"m-000012"},
{"legacy_row_id":13,"split_index":0,"measurement_id":"m-000013"},
{"legacy_row_id":14,"split_index":0,"measurement_id":"m-000014"},
{"legacy_row_id":15,"split_index":0,"measurement_id":"m-000015"},
{"legacy_row_id":16,"split_index":0,"measurement_id":"m-000016"},
{"legacy_row_id":17,"split_index":0,"measurement_id":"m-000017"},
{"legacy_row_id":18,"split_index":0,"measurement_id":"m-000018"},
{"legacy_row_id":19,"split_index":0,"measurement_id":"m-000019"},
{"legacy_row_id":20,"split_index":0,"measurement_id":"m-000020"},
{"legacy_row_id":21,"split_index":0,"measurement_id":"m-000021"},
{"legacy_row_id":22,"split_index":0,"measurement_id":"m-000022"},
{"legacy_row_id":23,"split_index":0,"measurement_id":"m-000023"},
{"legacy_row_id":24,"split_index":0,"measurement_id":"m-000024"},
{"legacy_row_id":25,"split_index":0,"measurement_id":"m-000025"},
{"legacy_row_id":26,"split_index":0,"measurement_id":"m-000026"},
{"legacy_row_id":27,"split_index":0,"measurement_id":"m-000027"},
{"legacy_row_id":28,"split_index":0,"measurement_id":"m-000028"},
{"legacy_row_id":29,"split_index":0,"measurement_id":"m-000029"},
{"legacy_row_id":30,"split_index":0,"measurement_id":"m-000030"},
{"legacy_row_id":31,"split_index":0,"measurement_id":"m-000031"},
{"legacy_row_id":32,"split_index":0,"measurement_id":"m-000032"},
{"legacy_row_id":33,"split_index":0,"measurement_id":"m-000033"},
{"legacy_row_id":34,"split_index":0,"measurement_id":"m-000034"},
{"legacy_row_id":35,"split_index":0,"measurement_id":"m-000035"},
{"legacy_row_id":36,"split_index":0,"measurement_id":"m-000036"},
{"legacy_row_id":37,"split_index":0,"measurement_id":"m-000037"},
{"legacy_row_id":38,"split_index":0,"measurement_id":"m-000038"},
{"legacy_row_id":39,"split_index":0,"measurement_id":"m-000039"},
{"legacy_row_id":40,"split_index":0,"measurement_id":"m-000040"},
{"legacy_row_id":41,"split_index":0,"measurement_id":"m-000041"},
{"legacy_row_id":42,"split_index":0,"measurement_id":"m-000042"},
{"legacy_row_id":43,"split_index":0,"measurement_id":"m-000043"},
{"legacy_row_id":44,"split_index":0,"measurement_id":"m-000044"},
{"legacy_row_id":45,"split_index":0,"measurement_id":"m-000045"},
{"legacy_row_id":46,"split_index":0,"measurement_id":"m-000046"},
{"legacy_row_id":47,"split_index":0,"measurement_id":"m-000047"},
{"legacy_row_id":48,"split_index":0,"measurement_id":"m-000048"},
{"legacy_row_id":49,"split_index":0,"measurement_id":"m-000049"},
{"legacy_row_id":50,"split_index":0,"measurement_id":"m-000050"},
{"legacy_row_id":51,"split_index":0,"measurement_id":"m-000051"},
{"legacy_row_id":52,"split_index":0,"measurement_id":"m-000052"},
{"legacy_row_id":53,"split_index":0,"measurement_id":"m-000053"},
{"legacy_row_id":54,"split_index":0,"measurement_id":"m-000054"},
{"legacy_row_id":55,"split_index":0,"measurement_id":"m-000055"},
{"legacy_row_id":56,"split_index":0,"measurement_id":"m-000056"},
{"legacy_row_id":57,"split_index":0,"measurement_id":"m-000057"},
{"legacy_row_id":58,"split_index":0,"measurement_id":"m-000058"},
{"legacy_row_id":59,"split_index":0,"measurement_id":"m-000059"},
{"legacy_row_id":60,"split_index":0,"measurement_id":"m-000060"},
{"legacy_row_id":61,"split_index":0,"measurement_id":"m-000061"},
{"legacy_row_id":62,"split_index":0,"measurement_id":"m-000062"},
{"legacy_row_id":63,"split_index":0,"measurement_id":"m-000063"},
{"legacy_row_id":64,"split_index":0,"measurement_id":"m-000064"},
{"legacy_row_id":65,"split_index":0,"measurement_id":"m-000065"},
{"legacy_row_id":66,"split_index":0,"measurement_id":"m-000066"},
{"legacy_row_id":67,"split_index":0,"measurement_id":"m-000067"},
{"legacy_row_id":68,"split_index":0,"measurement_id":"m-000068"},
{"legacy_row_id":69,"split_index":0,"measurement_id":"m-000069"},
{"legacy_row_id":70,"split_index":0,"measurement_id":"m-000070"},
{"legacy_row_id":71,"split_index":0,"measurement_id":"m-000071"},
{"legacy_row_id":72,"split_index":0,"measurement_id":"m-000072"},
{"legacy_row_id":73,"split_index":0,"measurement_id":"m-000073"},
{"legacy_row_id":74,"split_index":0,"measurement_id":"m-000074"},
{"legacy_row_id":75,"split_index":0,"measurement_id":"m-000075"},
{"legacy_row_id":76,"split_index":0,"measurement_id":"m-000076"},
{"legacy_row_id":77,"split_index":0,"measurement_id":"m-000077"},
{"legacy_row_id":78,"split_index":0,"measurement_id":"m-000078"},
{"legacy_row_id":79,"split_index":0,"measurement_id":"m-000079"},
{"legacy_row_id":80,"split_index":0,"measurement_id":"m-000080"},
{"legacy_row_id":81,"split_index":0,"measurement_id":"m-000081"},
{"legacy_row_id":82,"split_index":0,"measurement_id":"m-000082"},
{"legacy_row_id":83,"split_index":0,"measurement_id":"m-000083"},
{"legacy_row_id":84,"split_index":0,"measurement_id":"m-000084"},
{"legacy_row_id":85,"split_index":0,"measurement_id":"m-000085"},
{"legacy_row_id":86,"split_index":0,"measurement_id":"m-000086"},
{"legacy_row_id":87,"split_index":0,"measurement_id":"m-000087"},
{"legacy_row_id":88,"split_index":0,"measurement_id":"m-000088"},
{"legacy_row_id":89,"split_index":0,"measurement_id":"m-000089"},
{"legacy_row_id":90,"split_index":0,"measurement_id":"m-000090"},
{"legacy_row_id":91,"split_index":0,"measurement_id":"m-000091"},
{"legacy_row_id":92,"split_index":0,"measurement_id":"m-000092"},
{"legacy_row_id":93,"split_index":0,"measurement_id":"m-000093"},
{"legacy_row_id":94,"split_index":0,"measurement_id":"m-000094"},
{"legacy_row_id":95,"split_index":0,"measurement_id":"m-000095"},
{"legacy_row_id":96,"split_index":0,"measurement_id":"m-000096"},
{"legacy_row_id":97,"split_index":0,"measurement_id":"m-000097"},
{"legacy_row_id":98,"split_index":0,"measurement_id":"m-000098"},
{"legacy_row_id":99,"split_index":0,"measurement_id":"m-000099"},
{"legacy_row_id":100,"split_index":0,"measurement_id":"m-000100"},
{"legacy_row_id":101,"split_index":0,"measurement_id":"m-000101"},
{"legacy_row_id":102,"split_index":0,"measurement_id":"m-000102"},
{"legacy_row_id":103,"split_index":0,"measurement_id":"m-000103"},
{"legacy_row_id":104,"split_index":0,"measurement_id":"m-000104"},
{"legacy_row_id":105,"split_index":0,"measurement_id":"m-000105"},
{"legacy_row_id":106,"split_index":0,"measurement_id":"m-000106"},
{"legacy_row_id":107,"split_index":0,"measurement_id":"m-000107"},
{"legacy_row_id":108,"split_index":0,"measurement_id":"m-000108"},
{"legacy_row_id":109,"split_index":0,"measurement_id":"m-000109"},
{"legacy_row_id":110,"split_index":0,"measurement_id":"m-000110"},
{"legacy_row_id":111,"split_index":0,"measurement_id":"m-000111"},
{"legacy_row_id":112,"split_index":0,"measurement_id":"m-000112"},
{"legacy_row_id":113,"split_index":0,"measurement_id":"m-000113"},
{"legacy_row_id":114,"split_index":0,"measurement_id":"m-000114"},
{"legacy_row_id":115,"split_index":0,"measurement_id":"m-000115"},
{"legacy_row_id":116,"split_index":0,"measurement_id":"m-000116"},
{"legacy_row_id":117,"split_index":0,"measurement_id":"m-000117"},
{"legacy_row_id":118,"split_index":0,"measurement_id":"m-000118"},
{"legacy_row_id":119,"split_index":0,"measurement_id":"m-000119"},
{"legacy_row_id":120,"split_index":0,"measurement_id":"m-000120"},
{"legacy_row_id":121,"split_index":0,"measurement_id":"m-000121"},
{"legacy_row_id":122,"split_index":0,"measurement_id":"m-000122"},
{"legacy_row_id":123,"split_index":0,"measurement_id":"m-000123"},
{"legacy_row_id":124,"split_index":0,"measurement_id":"m-000124"},
{"legacy_row_id":125,"split_index":0,"measurement_id":"m-000125"},
{"legacy_row_id":126,"split_index":0,"measurement_id":"m-000126"},
{"legacy_row_id":127,"split_index":0,"measurement_id":"m-000127"},
{"legacy_row_id":128,"split_index":0,"measurement_id":"m-000128"},
{"legacy_row_id":129,"split_index":0,"measurement_id":"m-000129"},
{"legacy_row_id":130,"split_index":0,"measurement_id":"m-000130"},
{"legacy_row_id":131,"split_index":0,"measurement_id":"m-000131"},
{"legacy_row_id":132,"split_index":0,"measurement_id":"m-000132"},
{"legacy_row_id":133,"split_index":0,"measurement_id":"m-000133"},
{"legacy_row_id":134,"split_index":0,"measurement_id":"m-000134"},
{"legacy_row_id":135,"split_index":0,"measurement_id":"m-000135"},
{"legacy_row_id":136,"split_index":0,"measurement_id":"m-000136"},
{"legacy_row_id":137,"split_index":0,"measurement_id":"m-000137"},
{"legacy_row_id":138,"split_index":0,"measurement_id":"m-000138"},
{"legacy_row_id":139,"split_index":0,"measurement_id":"m-000139"},
{"legacy_row_id":140,"split_index":0,"measurement_id":"m-000140"},
{"legacy_row_id":141,"split_index":0,"measurement_id":"m-000141"},
{"legacy_row_id":142,"split_index":0,"measurement_id":"m-000142"},
{"legacy_row_id":143,"split_index":0,"measurement_id":"m-000143"},
{"legacy_row_id":144,"split_index":0,"measurement_id":"m-000144"},
{"legacy_row_id":145,"split_index":0,"measurement_id":"m-000145"},
{"legacy_row_id":146,"split_index":0,"measurement_id":"m-000146"},
{"legacy_row_id":147,"split_index":0,"measurement_id":"m-000147"},
{"legacy_row_id":148,"split_index":0,"measurement_id":"m-000148"},
{"legacy_row_id":149,"split_index":0,"measurement_id":"m-000149"},
{"legacy_row_id":150,"split_index":0,"measurement_id":"m-000150"},
{"legacy_row_id":151,"split_index":0,"measurement_id":"m-000151"},
{"legacy_row_id":152,"split_index":0,"measurement_id":"m-000152"},
{"legacy_row_id":153,"split_index":0,"measurement_id":"m-000153"},
{"legacy_row_id":154,"split_index":0,"measurement_id":"m-000154"},
{"legacy_row_id":155,"split_index":0,"measurement_id":"m-000155"},
{"legacy_row_id":156,"split_index":0,"measurement_id":"m-000156"},
{"legacy_row_id":157,"split_index":0,"measurement_id":"m-000157"},
{"legacy_row_id":158,"split_index":0,"measurement_id":"m-000158"},
{"legacy_row_id":159,"split_index":0,"measurement_id":"m-000159"},
{"legacy_row_id":160,"split_index":0,"measurement_id":"m-000160"},
{"legacy_row_id":161,"split_index":0,"measurement_id":"m-000161"},
{"legacy_row_id":162,"split_index":0,"measurement_id":"m-000162"},
{"legacy_row_id":163,"split_index":0,"measurement_id":"m-000163"},
{"legacy_row_id":164,"split_index":0,"measurement_id":"m-000164"},
{"legacy_row_id":165,"split_index":0,"measurement_id":"m-000165"},
{"legacy_row_id":166,"split_index":0,"measurement_id":"m-000166"},
{"legacy_row_id":167,"split_index":0,"measurement_id":"m-000167"},
{"legacy_row_id":168,"split_index":0,"measurement_id":"m-000168"},
{"legacy_row_id":169,"split_index":0,"measurement_id":"m-000169"},
{"legacy_row_id":170,"split_index":0,"measurement_id":"m-000170"},
{"legacy_row_id":171,"split_index":0,"measurement_id":"m-000171"},
{"legacy_row_id":172,"split_index":0,"measurement_id":"m-000172"},
{"legacy_row_id":173,"split_index":0,"measurement_id":"m-000173"},
{"legacy_row_id":174,"split_index":0,"measurement_id":"m-000174"},
{"legacy_row_id":175,"split_index":0,"measurement_id":"m-000175"},
{"legacy_row_id":176,"split_index":0,"measurement_id":"m-000176"},
{"legacy_row_id":177,"split_index":0,"measurement_id":"m-000177"},
{"legacy_row_id":178,"split_index":0,"measurement_id":"m-000178"},
{"legacy_row_id":179,"split_index":0,"measurement_id":"m-000179"},
{"legacy_row_id":180,"split_index":0,"measurement_id":"m-000180"},
{"legacy_row_id":181,"split_index":0,"measurement_id":"m-000181"},
{"legacy_row_id":182,"split_index":0,"measurement_id":"m-000182"},
{"legacy_row_id":183,"split_index":0,"measurement_id":"m-000183"},
{"legacy_row_id":184,"split_index":0,"measurement_id":"m-000184"},
{"legacy_row_id":185,"split_index":0,"measurement_id":"m-000185"},
{"legacy_row_id":186,"split_index":0,"measurement_id":"m-000186"},
{"legacy_row_id":187,"split_index":0,"measurement_id":"m-000187"},
{"legacy_row_id":188,"split_index":0,"measurement_id":"m-000188"},
{"legacy_row_id":189,"split_index":0,"measurement_id":"m-000189"},
{"legacy_row_id":190,"split_index":0,"measurement_id":"m-000190"},
{"legacy_row_id":191,"split_index":0,"measurement_id":"m-000191"},
{"legacy_row_id":192,"split_index":0,"measurement_id":"m-000192"},
{"legacy_row_id":193,"split_index":0,"measurement_id":"m-000193"},
{"legacy_row_id":194,"split_index":0,"measurement_id":"m-000194"},
{"legacy_row_id":195,"split_index":0,"measurement_id":"m-000195"},
{"legacy_row_id":196,"split_index":0,"measurement_id":"m-000196"},
{"legacy_row_id":197,"split_index":0,"measurement_id":"m-000197"},
{"legacy_row_id":198,"split_index":0,"measurement_id":"m-000198"},
{"legacy_row_id":199,"split_index":0,"measurement_id":"m-000199"},
{"legacy_row_id":200,"split_index":0,"measurement_id":"m-000200"},
{"legacy_row_id":201,"split_index":0,"measurement_id":"m-000201"},
{"legacy_row_id":202,"split_index":0,"measurement_id":"m-000202"},
{"legacy_row_id":203,"split_index":0,"measurement_id":"m-000203"},
{"legacy_row_id":204,"split_index":0,"measurement_id":"m-000204"},
{"legacy_row_id":205,"split_index":0,"measurement_id":"m-000205"},
{"legacy_row_id":206,"split_index":0,"measurement_id":"m-000206"},
{"legacy_row_id":207,"split_index":0,"measurement_id":"m-000207"},
{"legacy_row_id":208,"split_index":0,"measurement_id":"m-000208"},
{"legacy_row_id":209,"split_index":0,"measurement_id":"m-000209"},
{"legacy_row_id":210,"split_index":0,"measurement_id":"m-000210"},
{"legacy_row_id":211,"split_index":0,"measurement_id":"m-000211"},
{"legacy_row_id":212,"split_index":0,"measurement_id":"m-000212"},
{"legacy_row_id":213,"split_index":0,"measurement_id":"m-000213"},
{"legacy_row_id":214,"split_index":0,"measurement_id":"m-000214"},
{"legacy_row_id":215,"split_index":0,"measurement_id":"m-000215"},
{"legacy_row_id":216,"split_index":0,"measurement_id":"m-000216"},
{"legacy_row_id":217,"split_index":0,"measurement_id":"m-000217"},
{"legacy_row_id":218,"split_index":0,"measurement_id":"m-000218"},
{"legacy_row_id":219,"split_index":0,"measurement_id":"m-000219"},
{"legacy_row_id":220,"split_index":0,"measurement_id":"m-000220"},
{"legacy_row_id":221,"split_index":0,"measurement_id":"m-000221"},
{"legacy_row_id":222,"split_index":0,"measurement_id":"m-000222"},
{"legacy_row_id":223,"split_index":0,"measurement_id":"m-000223"},
{"legacy_row_id":224,"split_index":0,"measurement_id":"m-000224"},
{"legacy_row_id":225,"split_index":0,"measurement_id":"m-000225"},
{"legacy_row_id":226,"split_index":0,"measurement_id":"m-000226"},
{"legacy_row_id":227,"split_index":0,"measurement_id":"m-000227"},
{"legacy_row_id":228,"split_index":0,"measurement_id":"m-000228"},
{"legacy_row_id":229,"split_index":0,"measurement_id":"m-000229"},
{"legacy_row_id":230,"split_index":0,"measurement_id":"m-000230"},
{"legacy_row_id":231,"split_index":0,"measurement_id":"m-000231"},
{"legacy_row_id":232,"split_index":0,"measurement_id":"m-000232"},
{"legacy_row_id":233,"split_index":0,"measurement_id":"m-000233"},
{"legacy_row_id":234,"split_index":0,"measurement_id":"m-000234"},
{"legacy_row_id":235,"split_index":0,"measurement_id":"m-000235"},
{"legacy_row_id":236,"split_index":0,"measurement_id":"m-000236"},
{"legacy_row_id":237,"split_index":0,"measurement_id":"m-000237"},
{"legacy_row_id":238,"split_index":0,"measurement_id":"m-000238"},
{"legacy_row_id":239,"split_index":0,"measurement_id":"m-000239"},
{"legacy_row_id":240,"split_index":0,"measurement_id":"m-000240"},
{"legacy_row_id":241,"split_index":0,"measurement_id":"m-000241"},
{"legacy_row_id":242,"split_index":0,"measurement_id":"m-000242"},
{"legacy_row_id":243,"split_index":0,"measurement_id":"m-000243"},
{"legacy_row_id":244,"split_index":0,"measurement_id":"m-000244"},
{"legacy_row_id":245,"split_index":0,"measurement_id":"m-000245"},
{"legacy_row_id":246,"split_index":0,"measurement_id":"m-000246"},
{"legacy_row_id":247,"split_index":0,"measurement_id":"m-000247"},
{"legacy_row_id":248,"split_index":0,"measurement_id":"m-000248"},
{"legacy_row_id":249,"split_index":0,"measurement_id":"m-000249"},
{"legacy_row_id":250,"split_index":0,"measurement_id":"m-000250"},
{"legacy_row_id":251,"split_index":0,"measurement_id":"m-000251"},
{"legacy_row_id":252,"split_index":0,"measurement_id":"m-000252"},
{"legacy_row_id":253,"split_index":0,"measurement_id":"m-000253"},
{"legacy_row_id":254,"split_index":0,"measurement_id":"m-000254"},
{"legacy_row_id":255,"split_index":0,"measurement_id":"m-000255"},
{"legacy_row_id":256,"split_index":0,"measurement_id":"m-000256"},
{"legacy_row_id":257,"split_index":0,"measurement_id":"m-000257"},
{"legacy_row_id":258,"split_index":0,"measurement_id":"m-000258"},
{"legacy_row_id":259,"split_index":0,"measurement_id":"m-000259"},
{"legacy_row_id":260,"split_index":0,"measurement_id":"m-000260"},
{"legacy_row_id":261,"split_index":0,"measurement_id":"m-000261"},
{"legacy_row_id":262,"split_index":0,"measurement_id":"m-000262"},
{"legacy_row_id":263,"split_index":0,"measurement_id":"m-000263"},
{"legacy_row_id":264,"split_index":0,"measurement_id":"m-000264"},
{"legacy_row_id":265,"split_index":0,"measurement_id":"m-000265"},
{"legacy_row_id":266,"split_index":0,"measurement_id":"m-000266"},
{"legacy_row_id":267,"split_index":0,"measurement_id":"m-000267"},
{"legacy_row_id":268,"split_index":0,"measurement_id":"m-000268"},
{"legacy_row_id":269,"split_index":0,"measurement_id":"m-000269"},
{"legacy_row_id":270,"split_index":0,"measurement_id":"m-000270"},
{"legacy_row_id":271,"split_index":0,"measurement_id":"m-000271"},
{"legacy_row_id":272,"split_index":0,"measurement_id":"m-000272"},
{"legacy_row_id":273,"split_index":0,"measurement_id":"m-000273"},
{"legacy_row_id":274,"split_index":0,"measurement_id":"m-000274"},
{"legacy_row_id":275,"split_index":0,"measurement_id":"m-000275"},
{"legacy_row_id":276,"split_index":0,"measurement_id":"m-000276"},
{"legacy_row_id":277,"split_index":0,"measurement_id":"m-000277"},
{"legacy_row_id":278,"split_index":0,"measurement_id":"m-000278"},
{"legacy_row_id":279,"split_index":0,"measurement_id":"m-000279"},
{"legacy_row_id":280,"split_index":0,"measurement_id":"m-000280"},
{"legacy_row_id":281,"split_index":0,"measurement_id":"m-000281"},
{"legacy_row_id":282,"split_index":0,"measurement_id":"m-000282"},
{"legacy_row_id":283,"split_index":0,"measurement_id":"m-000283"},
{"legacy_row_id":284,"split_index":0,"measurement_id":"m-000284"},
{"legacy_row_id":285,"split_index":0,"measurement_id":"m-000285"},
{"legacy_row_id":286,"split_index":0,"measurement_id":"m-000286"},
{"legacy_row_id":287,"split_index":0,"measurement_id":"m-000287"},
{"legacy_row_id":288,"split_index":0,"measurement_id":"m-000288"},
{"legacy_row_id":289,"split_index":0,"measurement_id":"m-000289"},
{"legacy_row_id":290,"split_index":0,"measurement_id":"m-000290"},
{"legacy_row_id":291,"split_index":0,"measurement_id":"m-000291"},
{"legacy_row_id":292,"split_index":0,"measurement_id":"m-000292"},
{"legacy_row_id":293,"split_index":0,"measurement_id":"m-000293"},
{"legacy_row_id":294,"split_index":0,"measurement_id":"m-000294"},
{"legacy_row_id":295,"split_index":0,"measurement_id":"m-000295"},
{"legacy_row_id":296,"split_index":0,"measurement_id":"m-000296"},
{"legacy_row_id":297,"split_index":0,"measurement_id":"m-000297"},
{"legacy_row_id":298,"split_index":0,"measurement_id":"m-000298"},
{"legacy_row_id":299,"split_index":0,"measurement_id":"m-000299"},
{"legacy_row_id":300,"split_index":0,"measurement_id":"m-000300"},
{"legacy_row_id":301,"split_index":0,"measurement_id":"m-000301"},
{"legacy_row_id":302,"split_index":0,"measurement_id":"m-000302"},
{"legacy_row_id":303,"split_index":0,"measurement_id":"m-000303"},
{"legacy_row_id":304,"split_index":0,"measurement_id":"m-000304"},
{"legacy_row_id":305,"split_index":0,"measurement_id":"m-000305"},
{"legacy_row_id":306,"split_index":0,"measurement_id":"m-000306"},
{"legacy_row_id":307,"split_index":0,"measurement_id":"m-000307"},
{"legacy_row_id":308,"split_index":0,"measurement_id":"m-000308"},
{"legacy_row_id":309,"split_index":0,"measurement_id":"m-000309"},
{"legacy_row_id":310,"split_index":0,"measurement_id":"m-000310"},
{"legacy_row_id":311,"split_index":0,"measurement_id":"m-000311"},
{"legacy_row_id":312,"split_index":0,"measurement_id":"m-000312"},
{"legacy_row_id":313,"split_index":0,"measurement_id":"m-000313"},
{"legacy_row_id":314,"split_index":0,"measurement_id":"m-000314"},
{"legacy_row_id":315,"split_index":0,"measurement_id":"m-000315"},
{"legacy_row_id":316,"split_index":0,"measurement_id":"m-000316"},
{"legacy_row_id":317,"split_index":0,"measurement_id":"m-000317"},
{"legacy_row_id":318,"split_index":0,"measurement_id":"m-000318"},
{"legacy_row_id":319,"split_index":0,"measurement_id":"m-000319"},
{"legacy_row_id":320,"split_index":0,"measurement_id":"m-000320"},
{"legacy_row_id":321,"split_index":0,"measurement_id":"m-000321"},
{"legacy_row_id":322,"split_index":0,"measurement_id":"m-000322"},
{"legacy_row_id":323,"split_index":0,"measurement_id":"m-000323"},
{"legacy_row_id":324,"split_index":0,"measurement_id":"m-000324"},
{"legacy_row_id":325,"split_index":0,"measurement_id":"m-000325"},
{"legacy_row_id":326,"split_index":0,"measurement_id":"m-000326"},
{"legacy_row_id":327,"split_index":0,"measurement_id":"m-000327"},
{"legacy_row_id":328,"split_index":0,"measurement_id":"m-000328"},
{"legacy_row_id":329,"split_index":0,"measurement_id":"m-000329"},
{"legacy_row_id":330,"split_index":0,"measurement_id":"m-000330"},
{"legacy_row_id":331,"split_index":0,"measurement_id":"m-000331"},
{"legacy_row_id":332,"split_index":0,"measurement_id":"m-000332"},
{"legacy_row_id":333,"split_index":0,"measurement_id":"m-000333"},
{"legacy_row_id":334,"split_index":0,"measurement_id":"m-000334"},
{"legacy_row_id":335,"split_index":0,"measurement_id":"m-000335"},
{"legacy_row_id":336,"split_index":0,"measurement_id":"m-000336"},
{"legacy_row_id":337,"split_index":0,"measurement_id":"m-000337"},
{"legacy_row_id":338,"split_index":0,"measurement_id":"m-000338"},
{"legacy_row_id":339,"split_index":0,"measurement_id":"m-000339"},
{"legacy_row_id":340,"split_index":0,"measurement_id":"m-000340"},
{"legacy_row_id":341,"split_index":0,"measurement_id":"m-000341"},
{"legacy_row_id":342,"split_index":0,"measurement_id":"m-000342"},
{"legacy_row_id":343,"split_index":0,"measurement_id":"m-000343"},
{"legacy_row_id":344,"split_index":0,"measurement_id":"m-000344"},
{"legacy_row_id":345,"split_index":0,"measurement_id":"m-000345"},
{"legacy_row_id":346,"split_index":0,"measurement_id":"m-000346"},
{"legacy_row_id":347,"split_index":0,"measurement_id":"m-000347"},
{"legacy_row_id":348,"split_index":0,"measurement_id":"m-000348"},
{"legacy_row_id":349,"split_index":0,"measurement_id":"m-000349"},
{"legacy_row_id":350,"split_index":0,"measurement_id":"m-000350"},
{"legacy_row_id":351,"split_index":0,"measurement_id":"m-000351"},
{"legacy_row_id":352,"split_index":0,"measurement_id":"m-000352"},
{"legacy_row_id":353,"split_index":0,"measurement_id":"m-000353"},
{"legacy_row_id":354,"split_index":0,"measurement_id":"m-000354"},
{"legacy_row_id":355,"split_index":0,"measurement_id":"m-000355"},
{"legacy_row_id":356,"split_index":0,"measurement_id":"m-000356"},
{"legacy_row_id":357,"split_index":0,"measurement_id":"m-000357"},
{"legacy_row_id":358,"split_index":0,"measurement_id":"m-000358"},
{"legacy_row_id":359,"split_index":0,"measurement_id":"m-000359"},
{"legacy_row_id":360,"split_index":0,"measurement_id":"m-000360"},
{"legacy_row_id":361,"split_index":0,"measurement_id":"m-000361"},
{"legacy_row_id":362,"split_index":0,"measurement_id":"m-000362"},
{"legacy_row_id":363,"split_index":0,"measurement_id":"m-000363"},
{"legacy_row_id":364,"split_index":0,"measurement_id":"m-000364"},
{"legacy_row_id":365,"split_index":0,"measurement_id":"m-000365"},
{"legacy_row_id":366,"split_index":0,"measurement_id":"m-000366"},
{"legacy_row_id":367,"split_index":0,"measurement_id":"m-000367"},
{"legacy_row_id":368,"split_index":0,"measurement_id":"m-000368"},
{"legacy_row_id":369,"split_index":0,"measurement_id":"m-000369"},
{"legacy_row_id":370,"split_index":0,"measurement_id":"m-000370"},
{"legacy_row_id":371,"split_index":0,"measurement_id":"m-000371"},
{"legacy_row_id":372,"split_index":0,"measurement_id":"m-000372"},
{"legacy_row_id":373,"split_index":0,"measurement_id":"m-000373"},
{"legacy_row_id":374,"split_index":0,"measurement_id":"m-000374"},
{"legacy_row_id":375,"split_index":0,"measurement_id":"m-000375"},
{"legacy_row_id":376,"split_index":0,"measurement_id":"m-000376"},
{"legacy_row_id":377,"split_index":0,"measurement_id":"m-000377"},
{"legacy_row_id":378,"split_index":0,"measurement_id":"m-000378"},
{"legacy_row_id":379,"split_index":0,"measurement_id":"m-000379"},
{"legacy_row_id":380,"split_index":0,"measurement_id":"m-000380"},
{"legacy_row_id":381,"split_index":0,"measurement_id":"m-000381"},
{"legacy_row_id":382,"split_index":0,"measurement_id":"m-000382"},
{"legacy_row_id":383,"split_index":0,"measurement_id":"m-000383"},
{"legacy_row_id":384,"split_index":0,"measurement_id":"m-000384"},
{"legacy_row_id":385,"split_index":0,"measurement_id":"m-000385"},
{"legacy_row_id":386,"split_index":0,"measurement_id":"m-000386"},
{"legacy_row_id":387,"split_index":0,"measurement_id":"m-000387"},
{"legacy_row_id":388,"split_index":0,"measurement_id":"m-000388"},
{"legacy_row_id":389,"split_index":0,"measurement_id":"m-000389"},
{"legacy_row_id":390,"split_index":0,"measurement_id":"m-000390"},
{"legacy_row_id":391,"split_index":0,"measurement_id":"m-000391"},
{"legacy_row_id":392,"split_index":0,"measurement_id":"m-000392"},
{"legacy_row_id":393,"split_index":0,"measurement_id":"m-000393"},
{"legacy_row_id":394,"split_index":0,"measurement_id":"m-000394"},
{"legacy_row_id":395,"split_index":0,"measurement_id":"m-000395"},
{"legacy_row_id":396,"split_index":0,"measurement_id":"m-000396"},
{"legacy_row_id":397,"split_index":0,"measurement_id":"m-000397"},
{"legacy_row_id":398,"split_index":0,"measurement_id":"m-000398"},
{"legacy_row_id":399,"split_index":0,"measurement_id":"m-000399"},
{"legacy_row_id":400,"split_index":0,"measurement_id":"m-000400"},
{"legacy_row_id":401,"split_index":0,"measurement_id":"m-000401"},
{"legacy_row_id":402,"split_index":0,"measurement_id":"m-000402"},
{"legacy_row_id":403,"split_index":0,"measurement_id":"m-000403"},
{"legacy_row_id":404,"split_index":0,"measurement_id":"m-000404"},
{"legacy_row_id":405,"split_index":0,"measurement_id":"m-000405"},
{"legacy_row_id":406,"split_index":0,"measurement_id":"m-000406"},
{"legacy_row_id":407,"split_index":0,"measurement_id":"m-000407"},
{"legacy_row_id":408,"split_index":0,"measurement_id":"m-000408"},
{"legacy_row_id":409,"split_index":0,"measurement_id":"m-000409"},
{"legacy_row_id":410,"split_index":0,"measurement_id":"m-000410"},
{"legacy_row_id":411,"split_index":0,"measurement_id":"m-000411"},
{"legacy_row_id":412,"split_index":0,"measurement_id":"m-000412"},
{"legacy_row_id":413,"split_index":0,"measurement_id":"m-000413"},
{"legacy_row_id":414,"split_index":0,"measurement_id":"m-000414"},
{"legacy_row_id":415,"split_index":0,"measurement_id":"m-000415"},
{"legacy_row_id":416,"split_index":0,"measurement_id":"m-000416"},
{"legacy_row_id":417,"split_index":0,"measurement_id":"m-000417"},
{"legacy_row_id":418,"split_index":0,"measurement_id":"m-000418"},
{"legacy_row_id":419,"split_index":0,"measurement_id":"m-000419"},
{"legacy_row_id":420,"split_index":0,"measurement_id":"m-000420"},
{"legacy_row_id":421,"split_index":0,"measurement_id":"m-000421"},
{"legacy_row_id":422,"split_index":0,"measurement_id":"m-000422"},
{"legacy_row_id":423,"split_index":0,"measurement_id":"m-000423"},
{"legacy_row_id":424,"split_index":0,"measurement_id":"m-000424"},
{"legacy_row_id":425,"split_index":0,"measurement_id":"m-000425"},
{"legacy_row_id":426,"split_index":0,"measurement_id":"m-000426"},
{"legacy_row_id":427,"split_index":0,"measurement_id":"m-000427"},
{"legacy_row_id":428,"split_index":0,"measurement_id":"m-000428"},
{"legacy_row_id":429,"split_index":0,"measurement_id":"m-000429"},
{"legacy_row_id":430,"split_index":0,"measurement_id":"m-000430"},
{"legacy_row_id":431,"split_index":0,"measurement_id":"m-000431"},
{"legacy_row_id":432,"split_index":0,"measurement_id":"m-000432"},
{"legacy_row_id":433,"split_index":0,"measurement_id":"m-000433"},
{"legacy_row_id":434,"split_index":0,"measurement_id":"m-000434"},
{"legacy_row_id":435,"split_index":0,"measurement_id":"m-000435"},
{"legacy_row_id":436,"split_index":0,"measurement_id":"m-000436"},
{"legacy_row_id":437,"split_index":0,"measurement_id":"m-000437"},
{"legacy_row_id":438,"split_index":0,"measurement_id":"m-000438"},
{"legacy_row_id":439,"split_index":0,"measurement_id":"m-000439"},
{"legacy_row_id":440,"split_index":0,"measurement_id":"m-000440"},
{"legacy_row_id":441,"split_index":0,"measurement_id":"m-000441"},
{"legacy_row_id":442,"split_index":0,"measurement_id":"m-000442"},
{"legacy_row_id":443,"split_index":0,"measurement_id":"m-000443"},
{"legacy_row_id":444,"split_index":0,"measurement_id":"m-000444"},
{"legacy_row_id":445,"split_index":0,"measurement_id":"m-000445"},
{"legacy_row_id":446,"split_index":0,"measurement_id":"m-000446"},
{"legacy_row_id":447,"split_index":0,"measurement_id":"m-000447"},
{"legacy_row_id":448,"split_index":0,"measurement_id":"m-000448"},
{"legacy_row_id":449,"split_index":0,"measurement_id":"m-000449"},
{"legacy_row_id":450,"split_index":0,"measurement_id":"m-000450"},
{"legacy_row_id":451,"split_index":0,"measurement_id":"m-000451"},
{"legacy_row_id":452,"split_index":0,"measurement_id":"m-000452"},
{"legacy_row_id":453,"split_index":0,"measurement_id":"m-000453"},
{"legacy_row_id":454,"split_index":0,"measurement_id":"m-000454"},
{"legacy_row_id":455,"split_index":0,"measurement_id":"m-000455"},
{"legacy_row_id":456,"split_index":0,"measurement_id":"m-000456"},
{"legacy_row_id":457,"split_index":0,"measurement_id":"m-000457"},
{"legacy_row_id":458,"split_index":0,"measurement_id":"m-000458"},
{"legacy_row_id":459,"split_index":0,"measurement_id":"m-000459"},
{"legacy_row_id":460,"split_index":0,"measurement_id":"m-000460"},
{"legacy_row_id":461,"split_index":0,"measurement_id":"m-000461"},
{"legacy_row_id":462,"split_index":0,"measurement_id":"m-000462"},
{"legacy_row_id":463,"split_index":0,"measurement_id":"m-000463"},
{"legacy_row_id":464,"split_index":0,"measurement_id":"m-000464"},
{"legacy_row_id":465,"split_index":0,"measurement_id":"m-000465"},
{"legacy_row_id":466,"split_index":0,"measurement_id":"m-000466"},
{"legacy_row_id":467,"split_index":0,"measurement_id":"m-000467"},
{"legacy_row_id":468,"split_index":0,"measurement_id":"m-000468"},
{"legacy_row_id":469,"split_index":0,"measurement_id":"m-000469"},
{"legacy_row_id":470,"split_index":0,"measurement_id":"m-000470"},
{"legacy_row_id":471,"split_index":0,"measurement_id":"m-000471"},
{"legacy_row_id":472,"split_index":0,"measurement_id":"m-000472"},
{"legacy_row_id":473,"split_index":0,"measurement_id":"m-000473"},
{"legacy_row_id":474,"split_index":0,"measurement_id":"m-000474"},
{"legacy_row_id":475,"split_index":0,"measurement_id":"m-000475"},
{"legacy_row_id":476,"split_index":0,"measurement_id":"m-000476"},
{"legacy_row_id":477,"split_index":0,"measurement_id":"m-000477"},
{"legacy_row_id":478,"split_index":0,"measurement_id":"m-000478"},
{"legacy_row_id":479,"split_index":0,"measurement_id":"m-000479"},
{"legacy_row_id":480,"split_index":0,"measurement_id":"m-000480"},
{"legacy_row_id":481,"split_index":0,"measurement_id":"m-000481"},
{"legacy_row_id":482,"split_index":0,"measurement_id":"m-000482"},
{"legacy_row_id":483,"split_index":0,"measurement_id":"m-000483"},
{"legacy_row_id":484,"split_index":0,"measurement_id":"m-000484"},
{"legacy_row_id":485,"split_index":0,"measurement_id":"m-000485"},
{"legacy_row_id":486,"split_index":0,"measurement_id":"m-000486"},
{"legacy_row_id":487,"split_index":0,"measurement_id":"m-000487"},
{"legacy_row_id":488,"split_index":0,"measurement_id":"m-000488"},
{"legacy_row_id":489,"split_index":0,"measurement_id":"m-000489"},
{"legacy_row_id":490,"split_index":0,"measurement_id":"m-000490"},
{"legacy_row_id":491,"split_index":0,"measurement_id":"m-000491"},
{"legacy_row_id":492,"split_index":0,"measurement_id":"m-000492"},
{"legacy_row_id":493,"split_index":0,"measurement_id":"m-000493"},
{"legacy_row_id":494,"split_index":0,"measurement_id":"m-000494"},
{"legacy_row_id":495,"split_index":0,"measurement_id":"m-000495"},
{"legacy_row_id":496,"split_index":0,"measurement_id":"m-000496"},
{"legacy_row_id":497,"split_index":0,"measurement_id":"m-000497"},
{"legacy_row_id":498,"split_index":0,"measurement_id":"m-000498"},
{"legacy_row_id":499,"split_index":0,"measurement_id":"m-000499"},
{"legacy_row_id":500,"split_index":0,"measurement_id":"m-000500"},
{"legacy_row_id":501,"split_index":0,"measurement_id":"m-000501"},
{"legacy_row_id":502,"split_index":0,"measurement_id":"m-000502"},
{"legacy_row_id":503,"split_index":0,"measurement_id":"m-000503"},
{"legacy_row_id":504,"split_index":0,"measurement_id":"m-000504"},
{"legacy_row_id":505,"split_index":0,"measurement_id":"m-000505"},
{"legacy_row_id":506,"split_index":0,"measurement_id":"m-000506"},
{"legacy_row_id":507,"split_index":0,"measurement_id":"m-000507"},
{"legacy_row_id":508,"split_index":0,"measurement_id":"m-000508"},
{"legacy_row_id":509,"split_index":0,"measurement_id":"m-000509"},
{"legacy_row_id":510,"split_index":0,"measurement_id":"m-000510"},
{"legacy_row_id":511,"split_index":0,"measurement_id":"m-000511"},
{"legacy_row_id":512,"split_index":0,"measurement_id":"m-000512"},
{"legacy_row_id":513,"split_index":0,"measurement_id":"m-000513"},
{"legacy_row_id":514,"split_index":0,"measurement_id":"m-000514"},
{"legacy_row_id":515,"split_index":0,"measurement_id":"m-000515"},
{"legacy_row_id":516,"split_index":0,"measurement_id":"m-000516"},
{"legacy_row_id":517,"split_index":0,"measurement_id":"m-000517"},
{"legacy_row_id":518,"split_index":0,"measurement_id":"m-000518"},
{"legacy_row_id":519,"split_index":0,"measurement_id":"m-000519"},
{"legacy_row_id":520,"split_index":0,"measurement_id":"m-000520"},
{"legacy_row_id":521,"split_index":0,"measurement_id":"m-000521"},
{"legacy_row_id":522,"split_index":0,"measurement_id":"m-000522"},
{"legacy_row_id":523,"split_index":0,"measurement_id":"m-000523"},
{"legacy_row_id":524,"split_index":0,"measurement_id":"m-000524"},
{"legacy_row_id":525,"split_index":0,"measurement_id":"m-000525"},
{"legacy_row_id":526,"split_index":0,"measurement_id":"m-000526"},
{"legacy_row_id":527,"split_index":0,"measurement_id":"m-000527"},
{"legacy_row_id":528,"split_index":0,"measurement_id":"m-000528"},
{"legacy_row_id":529,"split_index":0,"measurement_id":"m-000529"},
{"legacy_row_id":530,"split_index":0,"measurement_id":"m-000530"},
{"legacy_row_id":531,"split_index":0,"measurement_id":"m-000531"},
{"legacy_row_id":532,"split_index":0,"measurement_id":"m-000532"},
{"legacy_row_id":533,"split_index":0,"measurement_id":"m-000533"},
{"legacy_row_id":534,"split_index":0,"measurement_id":"m-000534"},
{"legacy_row_id":535,"split_index":0,"measurement_id":"m-000535"},
{"legacy_row_id":536,"split_index":0,"measurement_id":"m-000536"},
{"legacy_row_id":537,"split_index":0,"measurement_id":"m-000537"},
{"legacy_row_id":538,"split_index":0,"measurement_id":"m-000538"},
{"legacy_row_id":539,"split_index":0,"measurement_id":"m-000539"},
{"legacy_row_id":540,"split_index":0,"measurement_id":"m-000540"},
{"legacy_row_id":541,"split_index":0,"measurement_id":"m-000541"},
{"legacy_row_id":542,"split_index":0,"measurement_id":"m-000542"},
{"legacy_row_id":543,"split_index":0,"measurement_id":"m-000543"},
{"legacy_row_id":544,"split_index":0,"measurement_id":"m-000544"},
{"legacy_row_id":545,"split_index":0,"measurement_id":"m-000545"},
{"legacy_row_id":546,"split_index":0,"measurement_id":"m-000546"},
{"legacy_row_id":547,"split_index":0,"measurement_id":"m-000547"},
{"legacy_row_id":548,"split_index":0,"measurement_id":"m-000548"},
{"legacy_row_id":549,"split_index":0,"measurement_id":"m-000549"},
{"legacy_row_id":550,"split_index":0,"measurement_id":"m-000550"},
{"legacy_row_id":551,"split_index":0,"measurement_id":"m-000551"},
{"legacy_row_id":552,"split_index":0,"measurement_id":"m-000552"},
{"legacy_row_id":553,"split_index":0,"measurement_id":"m-000553"},
{"legacy_row_id":554,"split_index":0,"measurement_id":"m-000554"},
{"legacy_row_id":555,"split_index":0,"measurement_id":"m-000555"},
{"legacy_row_id":556,"split_index":0,"measurement_id":"m-000556"},
{"legacy_row_id":557,"split_index":0,"measurement_id":"m-000557"},
{"legacy_row_id":558,"split_index":0,"measurement_id":"m-000558"},
{"legacy_row_id":559,"split_index":0,"measurement_id":"m-000559"},
{"legacy_row_id":560,"split_index":0,"measurement_id":"m-000560"},
{"legacy_row_id":561,"split_index":0,"measurement_id":"m-000561"},
{"legacy_row_id":562,"split_index":0,"measurement_id":"m-000562"},
{"legacy_row_id":563,"split_index":0,"measurement_id":"m-000563"},
{"legacy_row_id":564,"split_index":0,"measurement_id":"m-000564"},
{"legacy_row_id":565,"split_index":0,"measurement_id":"m-000565"},
{"legacy_row_id":566,"split_index":0,"measurement_id":"m-000566"},
{"legacy_row_id":567,"split_index":0,"measurement_id":"m-000567"},
{"legacy_row_id":568,"split_index":0,"measurement_id":"m-000568"},
{"legacy_row_id":569,"split_index":0,"measurement_id":"m-000569"},
{"legacy_row_id":570,"split_index":0,"measurement_id":"m-000570"},
{"legacy_row_id":571,"split_index":0,"measurement_id":"m-000571"},
{"legacy_row_id":572,"split_index":0,"measurement_id":"m-000572"},
{"legacy_row_id":573,"split_index":0,"measurement_id":"m-000573"},
{"legacy_row_id":574,"split_index":0,"measurement_id":"m-000574"},
{"legacy_row_id":575,"split_index":0,"measurement_id":"m-000575"},
{"legacy_row_id":576,"split_index":0,"measurement_id":"m-000576"},
{"legacy_row_id":577,"split_index":0,"measurement_id":"m-000577"},
{"legacy_row_id":578,"split_index":0,"measurement_id":"m-000578"},
{"legacy_row_id":579,"split_index":0,"measurement_id":"m-000579"},
{"legacy_row_id":580,"split_index":0,"measurement_id":"m-000580"},
{"legacy_row_id":581,"split_index":0,"measurement_id":"m-000581"},
{"legacy_row_id":582,"split_index":0,"measurement_id":"m-000582"},
{"legacy_row_id":583,"split_index":0,"measurement_id":"m-000583"},
{"legacy_row_id":584,"split_index":0,"measurement_id":"m-000584"},
{"legacy_row_id":585,"split_index":0,"measurement_id":"m-000585"},
{"legacy_row_id":586,"split_index":0,"measurement_id":"m-000586"},
{"legacy_row_id":587,"split_index":0,"measurement_id":"m-000587"},
{"legacy_row_id":588,"split_index":0,"measurement_id":"m-000588"},
{"legacy_row_id":589,"split_index":0,"measurement_id":"m-000589"},
{"legacy_row_id":590,"split_index":0,"measurement_id":"m-000590"},
{"legacy_row_id":591,"split_index":0,"measurement_id":"m-000591"},
{"legacy_row_id":592,"split_index":0,"measurement_id":"m-000592"},
{"legacy_row_id":593,"split_index":0,"measurement_id":"m-000593"},
{"legacy_row_id":594,"split_index":0,"measurement_id":"m-000594"},
{"legacy_row_id":595,"split_index":0,"measurement_id":"m-000595"},
{"legacy_row_id":596,"split_index":0,"measurement_id":"m-000596"},
{"legacy_row_id":597,"split_index":0,"measurement_id":"m-000597"},
{"legacy_row_id":598,"split_index":0,"measurement_id":"m-000598"},
{"legacy_row_id":599,"split_index":0,"measurement_id":"m-000599"},
{"legacy_row_id":600,"split_index":0,"measurement_id":"m-000600"},
{"legacy_row_id":601,"split_index":0,"measurement_id":"m-000601"},
{"legacy_row_id":602,"split_index":0,"measurement_id":"m-000602"},
{"legacy_row_id":603,"split_index":0,"measurement_id":"m-000603"},
{"legacy_row_id":604,"split_index":0,"measurement_id":"m-000604"},
{"legacy_row_id":605,"split_index":0,"measurement_id":"m-000605"},
{"legacy_row_id":606,"split_index":0,"measurement_id":"m-000606"},
{"legacy_row_id":607,"split_index":0,"measurement_id":"m-000607"},
{"legacy_row_id":608,"split_index":0,"measurement_id":"m-000608"},
{"legacy_row_id":609,"split_index":0,"measurement_id":"m-000609"},
{"legacy_row_id":610,"split_index":0,"measurement_id":"m-000610"},
{"legacy_row_id":611,"split_index":0,"measurement_id":"m-000611"},
{"legacy_row_id":612,"split_index":0,"measurement_id":"m-000612"},
{"legacy_row_id":613,"split_index":0,"measurement_id":"m-000613"},
{"legacy_row_id":614,"split_index":0,"measurement_id":"m-000614"},
{"legacy_row_id":615,"split_index":0,"measurement_id":"m-000615"},
{"legacy_row_id":616,"split_index":0,"measurement_id":"m-000616"},
{"legacy_row_id":617,"split_index":0,"measurement_id":"m-000617"},
{"legacy_row_id":618,"split_index":0,"measurement_id":"m-000618"},
{"legacy_row_id":619,"split_index":0,"measurement_id":"m-000619"},
{"legacy_row_id":620,"split_index":0,"measurement_id":"m-000620"},
{"legacy_row_id":621,"split_index":0,"measurement_id":"m-000621"},
{"legacy_row_id":622,"split_index":0,"measurement_id":"m-000622"},
{"legacy_row_id":623,"split_index":0,"measurement_id":"m-000623"},
{"legacy_row_id":624,"split_index":0,"measurement_id":"m-000624"},
{"legacy_row_id":625,"split_index":0,"measurement_id":"m-000625"},
{"legacy_row_id":626,"split_index":0,"measurement_id":"m-000626"},
{"legacy_row_id":627,"split_index":0,"measurement_id":"m-000627"},
{"legacy_row_id":628,"split_index":0,"measurement_id":"m-000628"},
{"legacy_row_id":629,"split_index":0,"measurement_id":"m-000629"},
{"legacy_row_id":630,"split_index":0,"measurement_id":"m-000630"},
{"legacy_row_id":631,"split_index":0,"measurement_id":"m-000631"},
{"legacy_row_id":632,"split_index":0,"measurement_id":"m-000632"},
{"legacy_row_id":633,"split_index":0,"measurement_id":"m-000633"},
{"legacy_row_id":634,"split_index":0,"measurement_id":"m-000634"},
{"legacy_row_id":635,"split_index":0,"measurement_id":"m-000635"},
{"legacy_row_id":636,"split_index":0,"measurement_id":"m-000636"},
{"legacy_row_id":637,"split_index":0,"measurement_id":"m-000637"},
{"legacy_row_id":638,"split_index":0,"measurement_id":"m-000638"},
{"legacy_row_id":639,"split_index":0,"measurement_id":"m-000639"},
{"legacy_row_id":640,"split_index":0,"measurement_id":"m-000640"},
{"legacy_row_id":641,"split_index":0,"measurement_id":"m-000641"},
{"legacy_row_id":642,"split_index":0,"measurement_id":"m-000642"},
{"legacy_row_id":643,"split_index":0,"measurement_id":"m-000643"},
{"legacy_row_id":644,"split_index":0,"measurement_id":"m-000644"},
{"legacy_row_id":645,"split_index":0,"measurement_id":"m-000645"},
{"legacy_row_id":646,"split_index":0,"measurement_id":"m-000646"},
{"legacy_row_id":647,"split_index":0,"measurement_id":"m-000647"},
{"legacy_row_id":648,"split_index":0,"measurement_id":"m-000648"},
{"legacy_row_id":649,"split_index":0,"measurement_id":"m-000649"},
{"legacy_row_id":650,"split_index":0,"measurement_id":"m-000650"},
{"legacy_row_id":651,"split_index":0,"measurement_id":"m-000651"},
{"legacy_row_id":652,"split_index":0,"measurement_id":"m-000652"},
{"legacy_row_id":653,"split_index":0,"measurement_id":"m-000653"},
{"legacy_row_id":654,"split_index":0,"measurement_id":"m-000654"},
{"legacy_row_id":655,"split_index":0,"measurement_id":"m-000655"},
{"legacy_row_id":656,"split_index":0,"measurement_id":"m-000656"},
{"legacy_row_id":657,"split_index":0,"measurement_id":"m-000657"},
{"legacy_row_id":658,"split_index":0,"measurement_id":"m-000658"},
{"legacy_row_id":659,"split_index":0,"measurement_id":"m-000659"},
{"legacy_row_id":660,"split_index":0,"measurement_id":"m-000660"},
{"legacy_row_id":661,"split_index":0,"measurement_id":"m-000661"},
{"legacy_row_id":662,"split_index":0,"measurement_id":"m-000662"},
{"legacy_row_id":663,"split_index":0,"measurement_id":"m-000663"},
{"legacy_row_id":664,"split_index":0,"measurement_id":"m-000664"},
{"legacy_row_id":665,"split_index":0,"measurement_id":"m-000665"},
{"legacy_row_id":666,"split_index":0,"measurement_id":"m-000666"},
{"legacy_row_id":667,"split_index":0,"measurement_id":"m-000667"},
{"legacy_row_id":668,"split_index":0,"measurement_id":"m-000668"},
{"legacy_row_id":669,"split_index":0,"measurement_id":"m-000669"},
{"legacy_row_id":670,"split_index":0,"measurement_id":"m-000670"},
{"legacy_row_id":671,"split_index":0,"measurement_id":"m-000671"},
{"legacy_row_id":672,"split_index":0,"measurement_id":"m-000672"},
{"legacy_row_id":673,"split_index":0,"measurement_id":"m-000673"},
{"legacy_row_id":674,"split_index":0,"measurement_id":"m-000674"},
{"legacy_row_id":675,"split_index":0,"measurement_id":"m-000675"},
{"legacy_row_id":676,"split_index":0,"measurement_id":"m-000676"},
{"legacy_row_id":677,"split_index":0,"measurement_id":"m-000677"},
{"legacy_row_id":678,"split_index":0,"measurement_id":"m-000678"},
{"legacy_row_id":679,"split_index":0,"measurement_id":"m-000679"},
{"legacy_row_id":680,"split_index":0,"measurement_id":"m-000680"},
{"legacy_row_id":681,"split_index":0,"measurement_id":"m-000681"},
{"legacy_row_id":682,"split_index":0,"measurement_id":"m-000682"},
{"legacy_row_id":683,"split_index":0,"measurement_id":"m-000683"},
{"legacy_row_id":684,"split_index":0,"measurement_id":"m-000684"},
{"legacy_row_id":685,"split_index":0,"measurement_id":"m-000685"},
{"legacy_row_id":686,"split_index":0,"measurement_id":"m-000686"},
{"legacy_row_id":687,"split_index":0,"measurement_id":"m-000687"},
{"legacy_row_id":688,"split_index":0,"measurement_id":"m-000688"},
{"legacy_row_id":689,"split_index":0,"measurement_id":"m-000689"},
{"legacy_row_id":690,"split_index":0,"measurement_id":"m-000690"},
{"legacy_row_id":691,"split_index":0,"measurement_id":"m-000691"},
{"legacy_row_id":692,"split_index":0,"measurement_id":"m-000692"},
{"legacy_row_id":693,"split_index":0,"measurement_id":"m-000693"},
{"legacy_row_id":694,"split_index":0,"measurement_id":"m-000694"},
{"legacy_row_id":695,"split_index":0,"measurement_id":"m-000695"},
{"legacy_row_id":696,"split_index":0,"measurement_id":"m-000696"},
{"legacy_row_id":697,"split_index":0,"measurement_id":"m-000697"},
{"legacy_row_id":698,"split_index":0,"measurement_id":"m-000698"},
{"legacy_row_id":699,"split_index":0,"measurement_id":"m-000699"},
{"legacy_row_id":700,"split_index":0,"measurement_id":"m-000700"},
{"legacy_row_id":701,"split_index":0,"measurement_id":"m-000701"},
{"legacy_row_id":702,"split_index":0,"measurement_id":"m-000702"},
{"legacy_row_id":703,"split_index":0,"measurement_id":"m-000703"},
{"legacy_row_id":704,"split_index":0,"measurement_id":"m-000704"},
{"legacy_row_id":705,"split_index":0,"measurement_id":"m-000705"},
{"legacy_row_id":706,"split_index":0,"measurement_id":"m-000706"},
{"legacy_row_id":707,"split_index":0,"measurement_id":"m-000707"},
{"legacy_row_id":708,"split_index":0,"measurement_id":"m-000708"},
{"legacy_row_id":709,"split_index":0,"measurement_id":"m-000709"},
{"legacy_row_id":710,"split_index":0,"measurement_id":"m-000710"},
{"legacy_row_id":711,"split_index":0,"measurement_id":"m-000711"},
{"legacy_row_id":712,"split_index":0,"measurement_id":"m-000712"},
{"legacy_row_id":713,"split_index":0,"measurement_id":"m-000713"},
{"legacy_row_id":714,"split_index":0,"measurement_id":"m-000714"},
{"legacy_row_id":715,"split_index":0,"measurement_id":"m-000715"},
{"legacy_row_id":716,"split_index":0,"measurement_id":"m-000716"},
{"legacy_row_id":717,"split_index":0,"measurement_id":"m-000717"},
{"legacy_row_id":718,"split_index":0,"measurement_id":"m-000718"},
{"legacy_row_id":719,"split_index":0,"measurement_id":"m-000719"},
{"legacy_row_id":720,"split_index":0,"measurement_id":"m-000720"},
{"legacy_row_id":721,"split_index":0,"measurement_id":"m-000721"},
{"legacy_row_id":722,"split_index":0,"measurement_id":"m-000722"},
{"legacy_row_id":723,"split_index":0,"measurement_id":"m-000723"},
{"legacy_row_id":724,"split_index":0,"measurement_id":"m-000724"},
{"legacy_row_id":725,"split_index":0,"measurement_id":"m-000725"},
{"legacy_row_id":726,"split_index":0,"measurement_id":"m-000726"},
{"legacy_row_id":727,"split_index":0,"measurement_id":"m-000727"},
{"legacy_row_id":728,"split_index":0,"measurement_id":"m-000728"},
{"legacy_row_id":729,"split_index":0,"measurement_id":"m-000729"},
{"legacy_row_id":730,"split_index":0,"measurement_id":"m-000730"},
{"legacy_row_id":731,"split_index":0,"measurement_id":"m-000731"},
{"legacy_row_id":732,"split_index":0,"measurement_id":"m-000732"},
{"legacy_row_id":733,"split_index":0,"measurement_id":"m-000733"},
{"legacy_row_id":734,"split_index":0,"measurement_id":"m-000734"},
{"legacy_row_id":735,"split_index":0,"measurement_id":"m-000735"},
{"legacy_row_id":736,"split_index":0,"measurement_id":"m-000736"},
{"legacy_row_id":737,"split_index":0,"measurement_id":"m-000737"},
{"legacy_row_id":738,"split_index":0,"measurement_id":"m-000738"},
{"legacy_row_id":739,"split_index":0,"measurement_id":"m-000739"},
{"legacy_row_id":740,"split_index":0,"measurement_id":"m-000740"},
{"legacy_row_id":741,"split_index":0,"measurement_id":"m-000741"},
{"legacy_row_id":742,"split_index":0,"measurement_id":"m-000742"},
{"legacy_row_id":743,"split_index":0,"measurement_id":"m-000743"},
{"legacy_row_id":744,"split_index":0,"measurement_id":"m-000744"},
{"legacy_row_id":745,"split_index":0,"measurement_id":"m-000745"},
{"legacy_row_id":746,"split_index":0,"measurement_id":"m-000746"},
{"legacy_row_id":747,"split_index":0,"measurement_id":"m-000747"},
{"legacy_row_id":748,"split_index":0,"measurement_id":"m-000748"},
{"legacy_row_id":749,"split_index":0,"measurement_id":"m-000749"},
{"legacy_row_id":750,"split_index":0,"measurement_id":"m-000750"},
{"legacy_row_id":751,"split_index":0,"measurement_id":"m-000751"},
{"legacy_row_id":752,"split_index":0,"measurement_id":"m-000752"},
{"legacy_row_id":753,"split_index":0,"measurement_id":"m-000753"},
{"legacy_row_id":754,"split_index":0,"measurement_id":"m-000754"},
{"legacy_row_id":755,"split_index":0,"measurement_id":"m-000755"},
{"legacy_row_id":756,"split_index":0,"measurement_id":"m-000756"},
{"legacy_row_id":757,"split_index":0,"measurement_id":"m-000757"},
{"legacy_row_id":758,"split_index":0,"measurement_id":"m-000758"},
{"legacy_row_id":759,"split_index":0,"measurement_id":"m-000759"},
{"legacy_row_id":760,"split_index":0,"measurement_id":"m-000760"},
{"legacy_row_id":761,"split_index":0,"measurement_id":"m-000761"},
{"legacy_row_id":762,"split_index":0,"measurement_id":"m-000762"},
{"legacy_row_id":763,"split_index":0,"measurement_id":"m-000763"},
{"legacy_row_id":764,"split_index":0,"measurement_id":"m-000764"},
{"legacy_row_id":765,"split_index":0,"measurement_id":"m-000765"},
{"legacy_row_id":766,"split_index":0,"measurement_id":"m-000766"},
{"legacy_row_id":767,"split_index":0,"measurement_id":"m-000767"},
{"legacy_row_id":768,"split_index":0,"measurement_id":"m-000768"},
{"legacy_row_id":769,"split_index":0,"measurement_id":"m-000769"},
{"legacy_row_id":770,"split_index":0,"measurement_id":"m-000770"},
{"legacy_row_id":771,"split_index":0,"measurement_id":"m-000771"},
{"legacy_row_id":772,"split_index":0,"measurement_id":"m-000772"},
{"legacy_row_id":773,"split_index":0,"measurement_id":"m-000773"},
{"legacy_row_id":774,"split_index":0,"measurement_id":"m-000774"},
{"legacy_row_id":775,"split_index":0,"measurement_id":"m-000775"},
{"legacy_row_id":776,"split_index":0,"measurement_id":"m-000776"},
{"legacy_row_id":777,"split_index":0,"measurement_id":"m-000777"},
{"legacy_row_id":778,"split_index":0,"measurement_id":"m-000778"},
{"legacy_row_id":779,"split_index":0,"measurement_id":"m-000779"},
{"legacy_row_id":780,"split_index":0,"measurement_id":"m-000780"},
{"legacy_row_id":781,"split_index":0,"measurement_id":"m-000781"},
{"legacy_row_id":782,"split_index":0,"measurement_id":"m-000782"},
{"legacy_row_id":783,"split_index":0,"measurement_id":"m-000783"},
{"legacy_row_id":784,"split_index":0,"measurement_id":"m-000784"},
{"legacy_row_id":785,"split_index":0,"measurement_id":"m-000785"},
{"legacy_row_id":786,"split_index":0,"measurement_id":"m-000786"},
{"legacy_row_id":787,"split_index":0,"measurement_id":"m-000787"},
{"legacy_row_id":788,"split_index":0,"measurement_id":"m-000788"},
{"legacy_row_id":789,"split_index":0,"measurement_id":"m-000789"},
{"legacy_row_id":790,"split_index":0,"measurement_id":"m-000790"},
{"legacy_row_id":791,"split_index":0,"measurement_id":"m-000791"},
{"legacy_row_id":792,"split_index":0,"measurement_id":"m-000792"},
{"legacy_row_id":793,"split_index":0,"measurement_id":"m-000793"},
{"legacy_row_id":794,"split_index":0,"measurement_id":"m-000794"},
{"legacy_row_id":795,"split_index":0,"measurement_id":"m-000795"},
{"legacy_row_id":796,"split_index":0,"measurement_id":"m-000796"},
{"legacy_row_id":797,"split_index":0,"measurement_id":"m-000797"},
{"legacy_row_id":798,"split_index":0,"measurement_id":"m-000798"},
{"legacy_row_id":799,"split_index":0,"measurement_id":"m-000799"},
{"legacy_row_id":800,"split_index":0,"measurement_id":"m-000800"},
{"legacy_row_id":801,"split_index":0,"measurement_id":"m-000801"},
{"legacy_row_id":802,"split_index":0,"measurement_id":"m-000802"},
{"legacy_row_id":803,"split_index":0,"measurement_id":"m-000803"},
{"legacy_row_id":804,"split_index":0,"measurement_id":"m-000804"},
{"legacy_row_id":805,"split_index":0,"measurement_id":"m-000805"},
{"legacy_row_id":806,"split_index":0,"measurement_id":"m-000806"},
{"legacy_row_id":807,"split_index":0,"measurement_id":"m-000807"},
{"legacy_row_id":808,"split_index":0,"measurement_id":"m-000808"},
{"legacy_row_id":809,"split_index":0,"measurement_id":"m-000809"},
{"legacy_row_id":810,"split_index":0,"measurement_id":"m-000810"},
{"legacy_row_id":811,"split_index":0,"measurement_id":"m-000811"},
{"legacy_row_id":812,"split_index":0,"measurement_id":"m-000812"},
{"legacy_row_id":813,"split_index":0,"measurement_id":"m-000813"},
{"legacy_row_id":814,"split_index":0,"measurement_id":"m-000814"},
{"legacy_row_id":815,"split_index":0,"measurement_id":"m-000815"},
{"legacy_row_id":816,"split_index":0,"measurement_id":"m-000816"},
{"legacy_row_id":817,"split_index":0,"measurement_id":"m-000817"},
{"legacy_row_id":818,"split_index":0,"measurement_id":"m-000818"},
{"legacy_row_id":819,"split_index":0,"measurement_id":"m-000819"},
{"legacy_row_id":820,"split_index":0,"measurement_id":"m-000820"},
{"legacy_row_id":821,"split_index":0,"measurement_id":"m-000821"},
{"legacy_row_id":822,"split_index":0,"measurement_id":"m-000822"},
{"legacy_row_id":823,"split_index":0,"measurement_id":"m-000823"},
{"legacy_row_id":824,"split_index":0,"measurement_id":"m-000824"},
{"legacy_row_id":825,"split_index":0,"measurement_id":"m-000825"},
{"legacy_row_id":826,"split_index":0,"measurement_id":"m-000826"},
{"legacy_row_id":827,"split_index":0,"measurement_id":"m-000827"},
{"legacy_row_id":828,"split_index":0,"measurement_id":"m-000828"},
{"legacy_row_id":829,"split_index":0,"measurement_id":"m-000829"},
{"legacy_row_id":830,"split_index":0,"measurement_id":"m-000830"},
{"legacy_row_id":831,"split_index":0,"measurement_id":"m-000831"},
{"legacy_row_id":832,"split_index":0,"measurement_id":"m-000832"},
{"legacy_row_id":833,"split_index":0,"measurement_id":"m-000833"},
{"legacy_row_id":834,"split_index":0,"measurement_id":"m-000834"},
{"legacy_row_id":835,"split_index":0,"measurement_id":"m-000835"},
{"legacy_row_id":836,"split_index":0,"measurement_id":"m-000836"},
{"legacy_row_id":837,"split_index":0,"measurement_id":"m-000837"},
{"legacy_row_id":838,"split_index":0,"measurement_id":"m-000838"},
{"legacy_row_id":839,"split_index":0,"measurement_id":"m-000839"},
{"legacy_row_id":840,"split_index":0,"measurement_id":"m-000840"},
{"legacy_row_id":841,"split_index":0,"measurement_id":"m-000841"},
{"legacy_row_id":842,"split_index":0,"measurement_id":"m-000842"},
{"legacy_row_id":843,"split_index":0,"measurement_id":"m-000843"},
{"legacy_row_id":844,"split_index":0,"measurement_id":"m-000844"},
{"legacy_row_id":845,"split_index":0,"measurement_id":"m-000845"},
{"legacy_row_id":846,"split_index":0,"measurement_id":"m-000846"},
{"legacy_row_id":847,"split_index":0,"measurement_id":"m-000847"},
{"legacy_row_id":848,"split_index":0,"measurement_id":"m-000848"},
{"legacy_row_id":849,"split_index":0,"measurement_id":"m-000849"},
{"legacy_row_id":850,"split_index":0,"measurement_id":"m-000850"},
{"legacy_row_id":851,"split_index":0,"measurement_id":"m-000851"},
{"legacy_row_id":852,"split_index":0,"measurement_id":"m-000852"},
{"legacy_row_id":853,"split_index":0,"measurement_id":"m-000853"},
{"legacy_row_id":854,"split_index":0,"measurement_id":"m-000854"},
{"legacy_row_id":855,"split_index":0,"measurement_id":"m-000855"},
{"legacy_row_id":856,"split_index":0,"measurement_id":"m-000856"},
{"legacy_row_id":857,"split_index":0,"measurement_id":"m-000857"},
{"legacy_row_id":858,"split_index":0,"measurement_id":"m-000858"},
{"legacy_row_id":859,"split_index":0,"measurement_id":"m-000859"},
{"legacy_row_id":860,"split_index":0,"measurement_id":"m-000860"},
{"legacy_row_id":861,"split_index":0,"measurement_id":"m-000861"},
{"legacy_row_id":862,"split_index":0,"measurement_id":"m-000862"},
{"legacy_row_id":863,"split_index":0,"measurement_id":"m-000863"},
{"legacy_row_id":864,"split_index":0,"measurement_id":"m-000864"},
{"legacy_row_id":865,"split_index":0,"measurement_id":"m-000865"},
{"legacy_row_id":866,"split_index":0,"measurement_id":"m-000866"},
{"legacy_row_id":867,"split_index":0,"measurement_id":"m-000867"},
{"legacy_row_id":868,"split_index":0,"measurement_id":"m-000868"},
{"legacy_row_id":869,"split_index":0,"measurement_id":"m-000869"},
{"legacy_row_id":870,"split_index":0,"measurement_id":"m-000870"},
{"legacy_row_id":871,"split_index":0,"measurement_id":"m-000871"},
{"legacy_row_id":872,"split_index":0,"measurement_id":"m-000872"},
{"legacy_row_id":873,"split_index":0,"measurement_id":"m-000873"},
{"legacy_row_id":874,"split_index":0,"measurement_id":"m-000874"},
{"legacy_row_id":875,"split_index":0,"measurement_id":"m-000875"},
{"legacy_row_id":876,"split_index":0,"measurement_id":"m-000876"},
{"legacy_row_id":877,"split_index":0,"measurement_id":"m-000877"},
{"legacy_row_id":878,"split_index":0,"measurement_id":"m-000878"},
{"legacy_row_id":879,"split_index":0,"measurement_id":"m-000879"},
{"legacy_row_id":880,"split_index":0,"measurement_id":"m-000880"},
{"legacy_row_id":881,"split_index":0,"measurement_id":"m-000881"},
{"legacy_row_id":882,"split_index":0,"measurement_id":"m-000882"},
{"legacy_row_id":883,"split_index":0,"measurement_id":"m-000883"},
{"legacy_row_id":884,"split_index":0,"measurement_id":"m-000884"},
{"legacy_row_id":885,"split_index":0,"measurement_id":"m-000885"},
{"legacy_row_id":886,"split_index":0,"measurement_id":"m-000886"},
{"legacy_row_id":887,"split_index":0,"measurement_id":"m-000887"},
{"legacy_row_id":888,"split_index":0,"measurement_id":"m-000888"},
{"legacy_row_id":889,"split_index":0,"measurement_id":"m-000889"},
{"legacy_row_id":890,"split_index":0,"measurement_id":"m-000890"},
{"legacy_row_id":891,"split_index":0,"measurement_id":"m-000891"},
{"legacy_row_id":892,"split_index":0,"measurement_id":"m-000892"},
{"legacy_row_id":893,"split_index":0,"measurement_id":"m-000893"},
{"legacy_row_id":894,"split_index":0,"measurement_id":"m-000894"},
{"legacy_row_id":895,"split_index":0,"measurement_id":"m-000895"},
{"legacy_row_id":896,"split_index":0,"measurement_id":"m-000896"},
{"legacy_row_id":897,"split_index":0,"measurement_id":"m-000897"},
{"legacy_row_id":898,"split_index":0,"measurement_id":"m-000898"},
{"legacy_row_id":899,"split_index":0,"measurement_id":"m-000899"},
{"legacy_row_id":900,"split_index":0,"measurement_id":"m-000900"},
{"legacy_row_id":901,"split_index":0,"measurement_id":"m-000901"},
{"legacy_row_id":902,"split_index":0,"measurement_id":"m-000902"},
{"legacy_row_id":903,"split_index":0,"measurement_id":"m-000903"},
{"legacy_row_id":904,"split_index":0,"measurement_id":"m-000904"},
{"legacy_row_id":905,"split_index":0,"measurement_id":"m-000905"},
{"legacy_row_id":906,"split_index":0,"measurement_id":"m-000906"},
{"legacy_row_id":907,"split_index":0,"measurement_id":"m-000907"},
{"legacy_row_id":908,"split_index":0,"measurement_id":"m-000908"},
{"legacy_row_id":909,"split_index":0,"measurement_id":"m-000909"},
{"legacy_row_id":910,"split_index":0,"measurement_id":"m-000910"},
{"legacy_row_id":911,"split_index":0,"measurement_id":"m-000911"},
{"legacy_row_id":912,"split_index":0,"measurement_id":"m-000912"},
{"legacy_row_id":913,"split_index":0,"measurement_id":"m-000913"},
{"legacy_row_id":914,"split_index":0,"measurement_id":"m-000914"},
{"legacy_row_id":915,"split_index":0,"measurement_id":"m-000915"},
{"legacy_row_id":916,"split_index":0,"measurement_id":"m-000916"},
{"legacy_row_id":917,"split_index":0,"measurement_id":"m-000917"},
{"legacy_row_id":918,"split_index":0,"measurement_id":"m-000918"},
{"legacy_row_id":919,"split_index":0,"measurement_id":"m-000919"},
{"legacy_row_id":920,"split_index":0,"measurement_id":"m-000920"},
{"legacy_row_id":921,"split_index":0,"measurement_id":"m-000921"},
{"legacy_row_id":922,"split_index":0,"measurement_id":"m-000922"},
{"legacy_row_id":923,"split_index":0,"measurement_id":"m-000923"},
{"legacy_row_id":924,"split_index":0,"measurement_id":"m-000924"},
{"legacy_row_id":925,"split_index":0,"measurement_id":"m-000925"},
{"legacy_row_id":926,"split_index":0,"measurement_id":"m-000926"},
{"legacy_row_id":927,"split_index":0,"measurement_id":"m-000927"},
{"legacy_row_id":928,"split_index":0,"measurement_id":"m-000928"},
{"legacy_row_id":929,"split_index":0,"measurement_id":"m-000929"},
{"legacy_row_id":930,"split_index":0,"measurement_id":"m-000930"},
{"legacy_row_id":931,"split_index":0,"measurement_id":"m-000931"},
{"legacy_row_id":932,"split_index":0,"measurement_id":"m-000932"},
{"legacy_row_id":933,"split_index":0,"measurement_id":"m-000933"},
{"legacy_row_id":934,"split_index":0,"measurement_id":"m-000934"},
{"legacy_row_id":935,"split_index":0,"measurement_id":"m-000935"},
{"legacy_row_id":936,"split_index":0,"measurement_id":"m-000936"},
{"legacy_row_id":937,"split_index":0,"measurement_id":"m-000937"},
{"legacy_row_id":938,"split_index":0,"measurement_id":"m-000938"},
{"legacy_row_id":939,"split_index":0,"measurement_id":"m-000939"},
{"legacy_row_id":940,"split_index":0,"measurement_id":"m-000940"},
{"legacy_row_id":941,"split_index":0,"measurement_id":"m-000941"},
{"legacy_row_id":942,"split_index":0,"measurement_id":"m-000942"},
{"legacy_row_id":943,"split_index":0,"measurement_id":"m-000943"},
{"legacy_row_id":944,"split_index":0,"measurement_id":"m-000944"},
{"legacy_row_id":945,"split_index":0,"measurement_id":"m-000945"},
{"legacy_row_id":946,"split_index":0,"measurement_id":"m-000946"},
{"legacy_row_id":947,"split_index":0,"measurement_id":"m-000947"},
{"legacy_row_id":948,"split_index":0,"measurement_id":"m-000948"},
{"legacy_row_id":949,"split_index":0,"measurement_id":"m-000949"},
{"legacy_row_id":950,"split_index":0,"measurement_id":"m-000950"},
{"legacy_row_id":951,"split_index":0,"measurement_id":"m-000951"},
{"legacy_row_id":952,"split_index":0,"measurement_id":"m-000952"},
{"legacy_row_id":953,"split_index":0,"measurement_id":"m-000953"},
{"legacy_row_id":954,"split_index":0,"measurement_id":"m-000954"},
{"legacy_row_id":955,"split_index":0,"measurement_id":"m-000955"},
{"legacy_row_id":956,"split_index":0,"measurement_id":"m-000956"},
{"legacy_row_id":957,"split_index":0,"measurement_id":"m-000957"},
{"legacy_row_id":958,"split_index":0,"measurement_id":"m-000958"},
{"legacy_row_id":959,"split_index":0,"measurement_id":"m-000959"},
{"legacy_row_id":960,"split_index":0,"measurement_id":"m-000960"},
{"legacy_row_id":961,"split_index":0,"measurement_id":"m-000961"},
{"legacy_row_id":962,"split_index":0,"measurement_id":"m-000962"},
{"legacy_row_id":963,"split_index":0,"measurement_id":"m-000963"},
{"legacy_row_id":964,"split_index":0,"measurement_id":"m-000964"},
{"legacy_row_id":965,"split_index":0,"measurement_id":"m-000965"},
{"legacy_row_id":966,"split_index":0,"measurement_id":"m-000966"},
{"legacy_row_id":967,"split_index":0,"measurement_id":"m-000967"},
{"legacy_row_id":968,"split_index":0,"measurement_id":"m-000968"},
{"legacy_row_id":969,"split_index":0,"measurement_id":"m-000969"},
{"legacy_row_id":970,"split_index":0,"measurement_id":"m-000970"},
{"legacy_row_id":971,"split_index":0,"measurement_id":"m-000971"},
{"legacy_row_id":972,"split_index":0,"measurement_id":"m-000972"},
{"legacy_row_id":973,"split_index":0,"measurement_id":"m-000973"},
{"legacy_row_id":974,"split_index":0,"measurement_id":"m-000974"},
{"legacy_row_id":975,"split_index":0,"measurement_id":"m-000975"},
{"legacy_row_id":976,"split_index":0,"measurement_id":"m-000976"},
{"legacy_row_id":977,"split_index":0,"measurement_id":"m-000977"},
{"legacy_row_id":978,"split_index":0,"measurement_id":"m-000978"},
{"legacy_row_id":979,"split_index":0,"measurement_id":"m-000979"},
{"legacy_row_id":980,"split_index":0,"measurement_id":"m-000980"},
{"legacy_row_id":981,"split_index":0,"measurement_id":"m-000981"},
{"legacy_row_id":982,"split_index":0,"measurement_id":"m-000982"},
{"legacy_row_id":983,"split_index":0,"measurement_id":"m-000983"},
{"legacy_row_id":984,"split_index":0,"measurement_id":"m-000984"},
{"legacy_row_id":985,"split_index":0,"measurement_id":"m-000985"},
{"legacy_row_id":986,"split_index":0,"measurement_id":"m-000986"},
{"legacy_row_id":987,"split_index":0,"measurement_id":"m-000987"},
{"legacy_row_id":988,"split_index":0,"measurement_id":"m-000988"},
{"legacy_row_id":989,"split_index":0,"measurement_id":"m-000989"},
{"legacy_row_id":990,"split_index":0,"measurement_id":"m-000990"},
{"legacy_row_id":991,"split_index":0,"measurement_id":"m-000991"},
{"legacy_row_id":992,"split_index":0,"measurement_id":"m-000992"},
{"legacy_row_id":993,"split_index":0,"measurement_id":"m-000993"},
{"legacy_row_id":994,"split_index":0,"measurement_id":"m-000994"},
{"legacy_row_id":995,"split_index":0,"measurement_id":"m-000995"},
{"legacy_row_id":996,"split_index":0,"measurement_id":"m-000996"},
{"legacy_row_id":997,"split_index":0,"measurement_id":"m-000997"},
{"legacy_row_id":998,"split_index":0,"measurement_id":"m-000998"},
{"legacy_row_id":999,"split_index":0,"measurement_id":"m-000999"},
{"legacy_row_id":1000,"split_index":0,"measurement_id":"m-001000"},
{"legacy_row_id":1001,"split_index":0,"measurement_id":"m-001001"},
{"legacy_row_id":1002,"split_index":0,"measurement_id":"m-001002"},
{"legacy_row_id":1003,"split_index":0,"measurement_id":"m-001003"},
{"legacy_row_id":1004,"split_index":0,"measurement_id":"m-001004"},
{"legacy_row_id":1005,"split_index":0,"measurement_id":"m-001005"},
{"legacy_row_id":1006,"split_index":0,"measurement_id":"m-001006"},
{"legacy_row_id":1007,"split_index":0,"measurement_id":"m-001007"},
{"legacy_row_id":1008,"split_index":0,"measurement_id":"m-001008"},
{"legacy_row_id":1009,"split_index":0,"measurement_id":"m-001009"},
{"legacy_row_id":1010,"split_index":0,"measurement_id":"m-001010"},
{"legacy_row_id":1011,"split_index":0,"measurement_id":"m-001011"},
{"legacy_row_id":1012,"split_index":0,"measurement_id":"m-001012"},
{"legacy_row_id":1013,"split_index":0,"measurement_id":"m-001013"},
{"legacy_row_id":1014,"split_index":0,"measurement_id":"m-001014"},
{"legacy_row_id":1015,"split_index":0,"measurement_id":"m-001015"},
{"legacy_row_id":1016,"split_index":0,"measurement_id":"m-001016"},
{"legacy_row_id":1017,"split_index":0,"measurement_id":"m-001017"},
{"legacy_row_id":1018,"split_index":0,"measurement_id":"m-001018"},
{"legacy_row_id":1019,"split_index":0,"measurement_id":"m-001019"},
{"legacy_row_id":1020,"split_index":0,"measurement_id":"m-001020"},
{"legacy_row_id":1021,"split_index":0,"measurement_id":"m-001021"},
{"legacy_row_id":1022,"split_index":0,"measurement_id":"m-001022"},
{"legacy_row_id":1023,"split_index":0,"measurement_id":"m-001023"},
{"legacy_row_id":1024,"split_index":0,"measurement_id":"m-001024"},
{"legacy_row_id":1025,"split_index":0,"measurement_id":"m-001025"},
{"legacy_row_id":1026,"split_index":0,"measurement_id":"m-001026"},
{"legacy_row_id":1027,"split_index":0,"measurement_id":"m-001027"},
{"legacy_row_id":1028,"split_index":0,"measurement_id":"m-001028"},
{"legacy_row_id":1029,"split_index":0,"measurement_id":"m-001029"},
{"legacy_row_id":1030,"split_index":0,"measurement_id":"m-001030"},
{"legacy_row_id":1031,"split_index":0,"measurement_id":"m-001031"},
{"legacy_row_id":1032,"split_index":0,"measurement_id":"m-001032"},
{"legacy_row_id":1033,"split_index":0,"measurement_id":"m-001033"},
{"legacy_row_id":1034,"split_index":0,"measurement_id":"m-001034"},
{"legacy_row_id":1035,"split_index":0,"measurement_id":"m-001035"},
{"legacy_row_id":1036,"split_index":0,"measurement_id":"m-001036"},
{"legacy_row_id":1037,"split_index":0,"measurement_id":"m-001037"},
{"legacy_row_id":1038,"split_index":0,"measurement_id":"m-001038"},
{"legacy_row_id":1039,"split_index":0,"measurement_id":"m-001039"},
{"legacy_row_id":1040,"split_index":0,"measurement_id":"m-001040"},
{"legacy_row_id":1041,"split_index":0,"measurement_id":"m-001041"},
{"legacy_row_id":1042,"split_index":0,"measurement_id":"m-001042"},
{"legacy_row_id":1043,"split_index":0,"measurement_id":"m-001043"},
{"legacy_row_id":1044,"split_index":0,"measurement_id":"m-001044"},
{"legacy_row_id":1045,"split_index":0,"measurement_id":"m-001045"},
{"legacy_row_id":1046,"split_index":0,"measurement_id":"m-001046"},
{"legacy_row_id":1047,"split_index":0,"measurement_id":"m-001047"},
{"legacy_row_id":1048,"split_index":0,"measurement_id":"m-001048"},
{"legacy_row_id":1049,"split_index":0,"measurement_id":"m-001049"},
{"legacy_row_id":1050,"split_index":0,"measurement_id":"m-001050"},
{"legacy_row_id":1051,"split_index":0,"measurement_id":"m-001051"},
{"legacy_row_id":1052,"split_index":0,"measurement_id":"m-001052"},
{"legacy_row_id":1053,"split_index":0,"measurement_id":"m-001053"},
{"legacy_row_id":1054,"split_index":0,"measurement_id":"m-001054"},
{"legacy_row_id":1055,"split_index":0,"measurement_id":"m-001055"},
{"legacy_row_id":1056,"split_index":0,"measurement_id":"m-001056"},
{"legacy_row_id":1057,"split_index":0,"measurement_id":"m-001057"},
{"legacy_row_id":1058,"split_index":0,"measurement_id":"m-001058"},
{"legacy_row_id":1059,"split_index":0,"measurement_id":"m-001059"},
{"legacy_row_id":1060,"split_index":0,"measurement_id":"m-001060"},
{"legacy_row_id":1061,"split_index":0,"measurement_id":"m-001061"},
{"legacy_row_id":1062,"split_index":0,"measurement_id":"m-001062"},
{"legacy_row_id":1063,"split_index":0,"measurement_id":"m-001063"},
{"legacy_row_id":1064,"split_index":0,"measurement_id":"m-001064"},
{"legacy_row_id":1065,"split_index":0,"measurement_id":"m-001065"},
{"legacy_row_id":1066,"split_index":0,"measurement_id":"m-001066"},
{"legacy_row_id":1067,"split_index":0,"measurement_id":"m-001067"},
{"legacy_row_id":1068,"split_index":0,"measurement_id":"m-001068"},
{"legacy_row_id":1069,"split_index":0,"measurement_id":"m-001069"},
{"legacy_row_id":1070,"split_index":0,"measurement_id":"m-001070"},
{"legacy_row_id":1071,"split_index":0,"measurement_id":"m-001071"},
{"legacy_row_id":1072,"split_index":0,"measurement_id":"m-001072"},
{"legacy_row_id":1073,"split_index":0,"measurement_id":"m-001073"},
{"legacy_row_id":1074,"split_index":0,"measurement_id":"m-001074"},
{"legacy_row_id":1075,"split_index":0,"measurement_id":"m-001075"},
{"legacy_row_id":1076,"split_index":0,"measurement_id":"m-001076"},
{"legacy_row_id":1077,"split_index":0,"measurement_id":"m-001077"},
{"legacy_row_id":1078,"split_index":0,"measurement_id":"m-001078"},
{"legacy_row_id":1079,"split_index":0,"measurement_id":"m-001079"},
{"legacy_row_id":1080,"split_index":0,"measurement_id":"m-001080"},
{"legacy_row_id":1081,"split_index":0,"measurement_id":"m-001081"},
{"legacy_row_id":1082,"split_index":0,"measurement_id":"m-001082"},
{"legacy_row_id":1083,"split_index":0,"measurement_id":"m-001083"},
{"legacy_row_id":1084,"split_index":0,"measurement_id":"m-001084"},
{"legacy_row_id":1085,"split_index":0,"measurement_id":"m-001085"},
{"legacy_row_id":1086,"split_index":0,"measurement_id":"m-001086"},
{"legacy_row_id":1087,"split_index":0,"measurement_id":"m-001087"},
{"legacy_row_id":1088,"split_index":0,"measurement_id":"m-001088"},
{"legacy_row_id":1089,"split_index":0,"measurement_id":"m-001089"},
{"legacy_row_id":1090,"split_index":0,"measurement_id":"m-001090"},
{"legacy_row_id":1091,"split_index":0,"measurement_id":"m-001091"},
{"legacy_row_id":1092,"split_index":0,"measurement_id":"m-001092"},
{"legacy_row_id":1093,"split_index":0,"measurement_id":"m-001093"},
{"legacy_row_id":1094,"split_index":0,"measurement_id":"m-001094"},
{"legacy_row_id":1095,"split_index":0,"measurement_id":"m-001095"},
{"legacy_row_id":1096,"split_index":0,"measurement_id":"m-001096"},
{"legacy_row_id":1097,"split_index":0,"measurement_id":"m-001097"},
{"legacy_row_id":1098,"split_index":0,"measurement_id":"m-001098"},
{"legacy_row_id":1099,"split_index":0,"measurement_id":"m-001099"},
{"legacy_row_id":1100,"split_index":0,"measurement_id":"m-001100"},
{"legacy_row_id":1101,"split_index":0,"measurement_id":"m-001101"},
{"legacy_row_id":1102,"split_index":0,"measurement_id":"m-001102"},
{"legacy_row_id":1103,"split_index":0,"measurement_id":"m-001103"},
{"legacy_row_id":1104,"split_index":0,"measurement_id":"m-001104"},
{"legacy_row_id":1105,"split_index":0,"measurement_id":"m-001105"},
{"legacy_row_id":1106,"split_index":0,"measurement_id":"m-001106"},
{"legacy_row_id":1107,"split_index":0,"measurement_id":"m-001107"},
{"legacy_row_id":1108,"split_index":0,"measurement_id":"m-001108"},
{"legacy_row_id":1109,"split_index":0,"measurement_id":"m-001109"},
{"legacy_row_id":1110,"split_index":0,"measurement_id":"m-001110"},
{"legacy_row_id":1111,"split_index":0,"measurement_id":"m-001111"},
{"legacy_row_id":1112,"split_index":0,"measurement_id":"m-001112"},
{"legacy_row_id":1113,"split_index":0,"measurement_id":"m-001113"},
{"legacy_row_id":1114,"split_index":0,"measurement_id":"m-001114"},
{"legacy_row_id":1115,"split_index":0,"measurement_id":"m-001115"},
{"legacy_row_id":1116,"split_index":0,"measurement_id":"m-001116"},
{"legacy_row_id":1117,"split_index":0,"measurement_id":"m-001117"},
{"legacy_row_id":1118,"split_index":0,"measurement_id":"m-001118"},
{"legacy_row_id":1119,"split_index":0,"measurement_id":"m-001119"},
{"legacy_row_id":1120,"split_index":0,"measurement_id":"m-001120"},
{"legacy_row_id":1121,"split_index":0,"measurement_id":"m-001121"},
{"legacy_row_id":1122,"split_index":0,"measurement_id":"m-001122"},
{"legacy_row_id":1123,"split_index":0,"measurement_id":"m-001123"},
{"legacy_row_id":1124,"split_index":0,"measurement_id":"m-001124"},
{"legacy_row_id":1125,"split_index":0,"measurement_id":"m-001125"},
{"legacy_row_id":1126,"split_index":0,"measurement_id":"m-001126"},
{"legacy_row_id":1127,"split_index":0,"measurement_id":"m-001127"},
{"legacy_row_id":1128,"split_index":0,"measurement_id":"m-001128"},
{"legacy_row_id":1129,"split_index":0,"measurement_id":"m-001129"},
{"legacy_row_id":1130,"split_index":0,"measurement_id":"m-001130"},
{"legacy_row_id":1131,"split_index":0,"measurement_id":"m-001131"},
{"legacy_row_id":1132,"split_index":0,"measurement_id":"m-001132"},
{"legacy_row_id":1133,"split_index":0,"measurement_id":"m-001133"},
{"legacy_row_id":1134,"split_index":0,"measurement_id":"m-001134"},
{"legacy_row_id":1135,"split_index":0,"measurement_id":"m-001135"},
{"legacy_row_id":1136,"split_index":0,"measurement_id":"m-001136"},
{"legacy_row_id":1137,"split_index":0,"measurement_id":"m-001137"},
{"legacy_row_id":1138,"split_index":0,"measurement_id":"m-001138"},
{"legacy_row_id":1139,"split_index":0,"measurement_id":"m-001139"},
{"legacy_row_id":1140,"split_index":0,"measurement_id":"m-001140"},
{"legacy_row_id":1141,"split_index":0,"measurement_id":"m-001141"},
{"legacy_row_id":1142,"split_index":0,"measurement_id":"m-001142"},
{"legacy_row_id":1143,"split_index":0,"measurement_id":"m-001143"},
{"legacy_row_id":1144,"split_index":0,"measurement_id":"m-001144"},
{"legacy_row_id":1145,"split_index":0,"measurement_id":"m-001145"},
{"legacy_row_id":1146,"split_index":0,"measurement_id":"m-001146"},
{"legacy_row_id":1147,"split_index":0,"measurement_id":"m-001147"},
{"legacy_row_id":1148,"split_index":0,"measurement_id":"m-001148"},
{"legacy_row_id":1149,"split_index":0,"measurement_id":"m-001149"},
{"legacy_row_id":1150,"split_index":0,"measurement_id":"m-001150"},
{"legacy_row_id":1151,"split_index":0,"measurement_id":"m-001151"},
{"legacy_row_id":1152,"split_index":0,"measurement_id":"m-001152"},
{"legacy_row_id":1153,"split_index":0,"measurement_id":"m-001153"},
{"legacy_row_id":1154,"split_index":0,"measurement_id":"m-001154"},
{"legacy_row_id":1155,"split_index":0,"measurement_id":"m-001155"},
{"legacy_row_id":1156,"split_index":0,"measurement_id":"m-001156"},
{"legacy_row_id":1157,"split_index":0,"measurement_id":"m-001157"},
{"legacy_row_id":1158,"split_index":0,"measurement_id":"m-001158"},
{"legacy_row_id":1159,"split_index":0,"measurement_id":"m-001159"},
{"legacy_row_id":1160,"split_index":0,"measurement_id":"m-001160"},
{"legacy_row_id":1161,"split_index":0,"measurement_id":"m-001161"},
{"legacy_row_id":1162,"split_index":0,"measurement_id":"m-001162"},
{"legacy_row_id":1163,"split_index":0,"measurement_id":"m-001163"},
{"legacy_row_id":1164,"split_index":0,"measurement_id":"m-001164"},
{"legacy_row_id":1165,"split_index":0,"measurement_id":"m-001165"},
{"legacy_row_id":1166,"split_index":0,"measurement_id":"m-001166"},
{"legacy_row_id":1167,"split_index":0,"measurement_id":"m-001167"},
{"legacy_row_id":1168,"split_index":0,"measurement_id":"m-001168"},
{"legacy_row_id":1169,"split_index":0,"measurement_id":"m-001169"},
{"legacy_row_id":1170,"split_index":0,"measurement_id":"m-001170"},
{"legacy_row_id":1171,"split_index":0,"measurement_id":"m-001171"},
{"legacy_row_id":1172,"split_index":0,"measurement_id":"m-001172"},
{"legacy_row_id":1173,"split_index":0,"measurement_id":"m-001173"},
{"legacy_row_id":1174,"split_index":0,"measurement_id":"m-001174"},
{"legacy_row_id":1175,"split_index":0,"measurement_id":"m-001175"},
{"legacy_row_id":1176,"split_index":0,"measurement_id":"m-001176"},
{"legacy_row_id":1177,"split_index":0,"measurement_id":"m-001177"},
{"legacy_row_id":1178,"split_index":0,"measurement_id":"m-001178"},
{"legacy_row_id":1179,"split_index":0,"measurement_id":"m-001179"},
{"legacy_row_id":1180,"split_index":0,"measurement_id":"m-001180"},
{"legacy_row_id":1181,"split_index":0,"measurement_id":"m-001181"},
{"legacy_row_id":1182,"split_index":0,"measurement_id":"m-001182"},
{"legacy_row_id":1183,"split_index":0,"measurement_id":"m-001183"},
{"legacy_row_id":1184,"split_index":0,"measurement_id":"m-001184"},
{"legacy_row_id":1185,"split_index":0,"measurement_id":"m-001185"},
{"legacy_row_id":1186,"split_index":0,"measurement_id":"m-001186"},
{"legacy_row_id":1187,"split_index":0,"measurement_id":"m-001187"},
{"legacy_row_id":1188,"split_index":0,"measurement_id":"m-001188"},
{"legacy_row_id":1189,"split_index":0,"measurement_id":"m-001189"},
{"legacy_row_id":1190,"split_index":0,"measurement_id":"m-001190"},
{"legacy_row_id":1191,"split_index":0,"measurement_id":"m-001191"},
{"legacy_row_id":1192,"split_index":0,"measurement_id":"m-001192"},
{"legacy_row_id":1193,"split_index":0,"measurement_id":"m-001193"},
{"legacy_row_id":1194,"split_index":0,"measurement_id":"m-001194"},
{"legacy_row_id":1195,"split_index":0,"measurement_id":"m-001195"},
{"legacy_row_id":1196,"split_index":0,"measurement_id":"m-001196"},
{"legacy_row_id":1197,"split_index":0,"measurement_id":"m-001197"},
{"legacy_row_id":1198,"split_index":0,"measurement_id":"m-001198"},
{"legacy_row_id":1199,"split_index":0,"measurement_id":"m-001199"},
{"legacy_row_id":1200,"split_index":0,"measurement_id":"m-001200"},
{"legacy_row_id":1201,"split_index":0,"measurement_id":"m-001201"},
{"legacy_row_id":1202,"split_index":0,"measurement_id":"m-001202"},
{"legacy_row_id":1203,"split_index":0,"measurement_id":"m-001203"},
{"legacy_row_id":1204,"split_index":0,"measurement_id":"m-001204"},
{"legacy_row_id":1205,"split_index":0,"measurement_id":"m-001205"},
{"legacy_row_id":1206,"split_index":0,"measurement_id":"m-001206"},
{"legacy_row_id":1207,"split_index":0,"measurement_id":"m-001207"},
{"legacy_row_id":1208,"split_index":0,"measurement_id":"m-001208"},
{"legacy_row_id":1209,"split_index":0,"measurement_id":"m-001209"},
{"legacy_row_id":1210,"split_index":0,"measurement_id":"m-001210"},
{"legacy_row_id":1211,"split_index":0,"measurement_id":"m-001211"},
{"legacy_row_id":1212,"split_index":0,"measurement_id":"m-001212"},
{"legacy_row_id":1213,"split_index":0,"measurement_id":"m-001213"},
{"legacy_row_id":1214,"split_index":0,"measurement_id":"m-001214"},
{"legacy_row_id":1215,"split_index":0,"measurement_id":"m-001215"},
{"legacy_row_id":1216,"split_index":0,"measurement_id":"m-001216"},
{"legacy_row_id":1217,"split_index":0,"measurement_id":"m-001217"},
{"legacy_row_id":1218,"split_index":0,"measurement_id":"m-001218"},
{"legacy_row_id":1219,"split_index":0,"measurement_id":"m-001219"},
{"legacy_row_id":1220,"split_index":0,"measurement_id":"m-001220"},
{"legacy_row_id":1221,"split_index":0,"measurement_id":"m-001221"},
{"legacy_row_id":1222,"split_index":0,"measurement_id":"m-001222"},
{"legacy_row_id":1223,"split_index":0,"measurement_id":"m-001223"},
{"legacy_row_id":1224,"split_index":0,"measurement_id":"m-001224"},
{"legacy_row_id":1225,"split_index":0,"measurement_id":"m-001225"},
{"legacy_row_id":1226,"split_index":0,"measurement_id":"m-001226"},
{"legacy_row_id":1227,"split_index":0,"measurement_id":"m-001227"},
{"legacy_row_id":1228,"split_index":0,"measurement_id":"m-001228"},
{"legacy_row_id":1229,"split_index":0,"measurement_id":"m-001229"},
{"legacy_row_id":1230,"split_index":0,"measurement_id":"m-001230"},
{"legacy_row_id":1231,"split_index":0,"measurement_id":"m-001231"},
{"legacy_row_id":1232,"split_index":0,"measurement_id":"m-001232"},
{"legacy_row_id":1233,"split_index":0,"measurement_id":"m-001233"},
{"legacy_row_id":1234,"split_index":0,"measurement_id":"m-001234"},
{"legacy_row_id":1235,"split_index":0,"measurement_id":"m-001235"},
{"legacy_row_id":1236,"split_index":0,"measurement_id":"m-001236"},
{"legacy_row_id":1237,"split_index":0,"measurement_id":"m-001237"},
{"legacy_row_id":1238,"split_index":0,"measurement_id":"m-001238"},
{"legacy_row_id":1239,"split_index":0,"measurement_id":"m-001239"},
{"legacy_row_id":1240,"split_index":0,"measurement_id":"m-001240"},
{"legacy_row_id":1241,"split_index":0,"measurement_id":"m-001241"},
{"legacy_row_id":1242,"split_index":0,"measurement_id":"m-001242"},
{"legacy_row_id":1243,"split_index":0,"measurement_id":"m-001243"},
{"legacy_row_id":1244,"split_index":0,"measurement_id":"m-001244"},
{"legacy_row_id":1245,"split_index":0,"measurement_id":"m-001245"},
{"legacy_row_id":1246,"split_index":0,"measurement_id":"m-001246"},
{"legacy_row_id":1247,"split_index":0,"measurement_id":"m-001247"},
{"legacy_row_id":1248,"split_index":0,"measurement_id":"m-001248"},
{"legacy_row_id":1249,"split_index":0,"measurement_id":"m-001249"},
{"legacy_row_id":1250,"split_index":0,"measurement_id":"m-001250"},
{"legacy_row_id":1251,"split_index":0,"measurement_id":"m-001251"},
{"legacy_row_id":1252,"split_index":0,"measurement_id":"m-001252"},
{"legacy_row_id":1253,"split_index":0,"measurement_id":"m-001253"},
{"legacy_row_id":1254,"split_index":0,"measurement_id":"m-001254"},
{"legacy_row_id":1255,"split_index":0,"measurement_id":"m-001255"},
{"legacy_row_id":1256,"split_index":0,"measurement_id":"m-001256"},
{"legacy_row_id":1257,"split_index":0,"measurement_id":"m-001257"},
{"legacy_row_id":1258,"split_index":0,"measurement_id":"m-001258"},
{"legacy_row_id":1259,"split_index":0,"measurement_id":"m-001259"},
{"legacy_row_id":1260,"split_index":0,"measurement_id":"m-001260"},
{"legacy_row_id":1261,"split_index":0,"measurement_id":"m-001261"},
{"legacy_row_id":1262,"split_index":0,"measurement_id":"m-001262"},
{"legacy_row_id":1263,"split_index":0,"measurement_id":"m-001263"},
{"legacy_row_id":1264,"split_index":0,"measurement_id":"m-001264"},
{"legacy_row_id":1265,"split_index":0,"measurement_id":"m-001265"},
{"legacy_row_id":1266,"split_index":0,"measurement_id":"m-001266"},
{"legacy_row_id":1267,"split_index":0,"measurement_id":"m-001267"},
{"legacy_row_id":1268,"split_index":0,"measurement_id":"m-001268"},
{"legacy_row_id":1269,"split_index":0,"measurement_id":"m-001269"},
{"legacy_row_id":1270,"split_index":0,"measurement_id":"m-001270"},
{"legacy_row_id":1271,"split_index":0,"measurement_id":"m-001271"},
{"legacy_row_id":1272,"split_index":0,"measurement_id":"m-001272"},
{"legacy_row_id":1273,"split_index":0,"measurement_id":"m-001273"},
{"legacy_row_id":1274,"split_index":0,"measurement_id":"m-001274"},
{"legacy_row_id":1275,"split_index":0,"measurement_id":"m-001275"},
{"legacy_row_id":1276,"split_index":0,"measurement_id":"m-001276"},
{"legacy_row_id":1277,"split_index":0,"measurement_id":"m-001277"},
{"legacy_row_id":1278,"split_index":0,"measurement_id":"m-001278"},
{"legacy_row_id":1279,"split_index":0,"measurement_id":"m-001279"},
{"legacy_row_id":1280,"split_index":0,"measurement_id":"m-001280"},
{"legacy_row_id":1281,"split_index":0,"measurement_id":"m-001281"},
{"legacy_row_id":1282,"split_index":0,"measurement_id":"m-001282"},
{"legacy_row_id":1283,"split_index":0,"measurement_id":"m-001283"},
{"legacy_row_id":1284,"split_index":0,"measurement_id":"m-001284"},
{"legacy_row_id":1285,"split_index":0,"measurement_id":"m-001285"},
{"legacy_row_id":1286,"split_index":0,"measurement_id":"m-001286"},
{"legacy_row_id":1287,"split_index":0,"measurement_id":"m-001287"},
{"legacy_row_id":1288,"split_index":0,"measurement_id":"m-001288"},
{"legacy_row_id":1289,"split_index":0,"measurement_id":"m-001289"},
{"legacy_row_id":1290,"split_index":0,"measurement_id":"m-001290"},
{"legacy_row_id":1291,"split_index":0,"measurement_id":"m-001291"},
{"legacy_row_id":1292,"split_index":0,"measurement_id":"m-001292"},
{"legacy_row_id":1293,"split_index":0,"measurement_id":"m-001293"},
{"legacy_row_id":1294,"split_index":0,"measurement_id":"m-001294"},
{"legacy_row_id":1295,"split_index":0,"measurement_id":"m-001295"},
{"legacy_row_id":1296,"split_index":0,"measurement_id":"m-001296"},
{"legacy_row_id":1297,"split_index":0,"measurement_id":"m-001297"},
{"legacy_row_id":1298,"split_index":0,"measurement_id":"m-001298"},
{"legacy_row_id":1299,"split_index":0,"measurement_id":"m-001299"},
{"legacy_row_id":1300,"split_index":0,"measurement_id":"m-001300"},
{"legacy_row_id":1301,"split_index":0,"measurement_id":"m-001301"},
{"legacy_row_id":1302,"split_index":0,"measurement_id":"m-001302"},
{"legacy_row_id":1303,"split_index":0,"measurement_id":"m-001303"},
{"legacy_row_id":1304,"split_index":0,"measurement_id":"m-001304"},
{"legacy_row_id":1305,"split_index":0,"measurement_id":"m-001305"},
{"legacy_row_id":1306,"split_index":0,"measurement_id":"m-001306"},
{"legacy_row_id":1307,"split_index":0,"measurement_id":"m-001307"},
{"legacy_row_id":1308,"split_index":0,"measurement_id":"m-001308"},
{"legacy_row_id":1309,"split_index":0,"measurement_id":"m-001309"},
{"legacy_row_id":1310,"split_index":0,"measurement_id":"m-001310"},
{"legacy_row_id":1311,"split_index":0,"measurement_id":"m-001311"},
{"legacy_row_id":1312,"split_index":0,"measurement_id":"m-001312"},
{"legacy_row_id":1313,"split_index":0,"measurement_id":"m-001313"},
{"legacy_row_id":1314,"split_index":0,"measurement_id":"m-001314"},
{"legacy_row_id":1315,"split_index":0,"measurement_id":"m-001315"},
{"legacy_row_id":1316,"split_index":0,"measurement_id":"m-001316"},
{"legacy_row_id":1317,"split_index":0,"measurement_id":"m-001317"},
{"legacy_row_id":1318,"split_index":0,"measurement_id":"m-001318"},
{"legacy_row_id":1319,"split_index":0,"measurement_id":"m-001319"},
{"legacy_row_id":1320,"split_index":0,"measurement_id":"m-001320"},
{"legacy_row_id":1321,"split_index":0,"measurement_id":"m-001321"},
{"legacy_row_id":1322,"split_index":0,"measurement_id":"m-001322"},
{"legacy_row_id":1323,"split_index":0,"measurement_id":"m-001323"},
{"legacy_row_id":1324,"split_index":0,"measurement_id":"m-001324"},
{"legacy_row_id":1325,"split_index":0,"measurement_id":"m-001325"},
{"legacy_row_id":1326,"split_index":0,"measurement_id":"m-001326"},
{"legacy_row_id":1327,"split_index":0,"measurement_id":"m-001327"},
{"legacy_row_id":1328,"split_index":0,"measurement_id":"m-001328"},
{"legacy_row_id":1329,"split_index":0,"measurement_id":"m-001329"},
{"legacy_row_id":1330,"split_index":0,"measurement_id":"m-001330"},
{"legacy_row_id":1331,"split_index":0,"measurement_id":"m-001331"},
{"legacy_row_id":1332,"split_index":0,"measurement_id":"m-001332"},
{"legacy_row_id":1333,"split_index":0,"measurement_id":"m-001333"},
{"legacy_row_id":1334,"split_index":0,"measurement_id":"m-001334"},
{"legacy_row_id":1335,"split_index":0,"measurement_id":"m-001335"},
{"legacy_row_id":1336,"split_index":0,"measurement_id":"m-001336"},
{"legacy_row_id":1337,"split_index":0,"measurement_id":"m-001337"},
{"legacy_row_id":1338,"split_index":0,"measurement_id":"m-001338"},
{"legacy_row_id":1339,"split_index":0,"measurement_id":"m-001339"},
{"legacy_row_id":1340,"split_index":0,"measurement_id":"m-001340"},
{"legacy_row_id":1341,"split_index":0,"measurement_id":"m-001341"},
{"legacy_row_id":1342,"split_index":0,"measurement_id":"m-001342"},
{"legacy_row_id":1343,"split_index":0,"measurement_id":"m-001343"},
{"legacy_row_id":1344,"split_index":0,"measurement_id":"m-001344"},
{"legacy_row_id":1345,"split_index":0,"measurement_id":"m-001345"},
{"legacy_row_id":1346,"split_index":0,"measurement_id":"m-001346"},
{"legacy_row_id":1347,"split_index":0,"measurement_id":"m-001347"},
{"legacy_row_id":1348,"split_index":0,"measurement_id":"m-001348"},
{"legacy_row_id":1349,"split_index":0,"measurement_id":"m-001349"},
{"legacy_row_id":1350,"split_index":0,"measurement_id":"m-001350"},
{"legacy_row_id":1351,"split_index":0,"measurement_id":"m-001351"},
{"legacy_row_id":1352,"split_index":0,"measurement_id":"m-001352"},
{"legacy_row_id":1353,"split_index":0,"measurement_id":"m-001353"},
{"legacy_row_id":1354,"split_index":0,"measurement_id":"m-001354"},
{"legacy_row_id":1355,"split_index":0,"measurement_id":"m-001355"},
{"legacy_row_id":1356,"split_index":0,"measurement_id":"m-001356"},
{"legacy_row_id":1357,"split_index":0,"measurement_id":"m-001357"},
{"legacy_row_id":1358,"split_index":0,"measurement_id":"m-001358"},
{"legacy_row_id":1359,"split_index":0,"measurement_id":"m-001359"},
{"legacy_row_id":1360,"split_index":0,"measurement_id":"m-001360"},
{"legacy_row_id":1361,"split_index":0,"measurement_id":"m-001361"},
{"legacy_row_id":1362,"split_index":0,"measurement_id":"m-001362"},
{"legacy_row_id":1363,"split_index":0,"measurement_id":"m-001363"},
{"legacy_row_id":1364,"split_index":0,"measurement_id":"m-001364"},
{"legacy_row_id":1365,"split_index":0,"measurement_id":"m-001365"},
{"legacy_row_id":1366,"split_index":0,"measurement_id":"m-001366"},
{"legacy_row_id":1367,"split_index":0,"measurement_id":"m-001367"},
{"legacy_row_id":1368,"split_index":0,"measurement_id":"m-001368"},
{"legacy_row_id":1369,"split_index":0,"measurement_id":"m-001369"},
{"legacy_row_id":1370,"split_index":0,"measurement_id":"m-001370"},
{"legacy_row_id":1371,"split_index":0,"measurement_id":"m-001371"},
{"legacy_row_id":1372,"split_index":0,"measurement_id":"m-001372"},
{"legacy_row_id":1373,"split_index":0,"measurement_id":"m-001373"},
{"legacy_row_id":1374,"split_index":0,"measurement_id":"m-001374"},
{"legacy_row_id":1375,"split_index":0,"measurement_id":"m-001375"},
{"legacy_row_id":1376,"split_index":0,"measurement_id":"m-001376"},
{"legacy_row_id":1377,"split_index":0,"measurement_id":"m-001377"},
{"legacy_row_id":1378,"split_index":0,"measurement_id":"m-001378"},
{"legacy_row_id":1379,"split_index":0,"measurement_id":"m-001379"},
{"legacy_row_id":1380,"split_index":0,"measurement_id":"m-001380"},
{"legacy_row_id":1381,"split_index":0,"measurement_id":"m-001381"},
{"legacy_row_id":1382,"split_index":0,"measurement_id":"m-001382"},
{"legacy_row_id":1383,"split_index":0,"measurement_id":"m-001383"},
{"legacy_row_id":1384,"split_index":0,"measurement_id":"m-001384"},
{"legacy_row_id":1385,"split_index":0,"measurement_id":"m-001385"},
{"legacy_row_id":1386,"split_index":0,"measurement_id":"m-001386"},
{"legacy_row_id":1387,"split_index":0,"measurement_id":"m-001387"},
{"legacy_row_id":1388,"split_index":0,"measurement_id":"m-001388"},
{"legacy_row_id":1389,"split_index":0,"measurement_id":"m-001389"},
{"legacy_row_id":1390,"split_index":0,"measurement_id":"m-001390"},
{"legacy_row_id":1391,"split_index":0,"measurement_id":"m-001391"},
{"legacy_row_id":1392,"split_index":0,"measurement_id":"m-001392"},
{"legacy_row_id":1393,"split_index":0,"measurement_id":"m-001393"},
{"legacy_row_id":1394,"split_index":0,"measurement_id":"m-001394"},
{"legacy_row_id":1395,"split_index":0,"measurement_id":"m-001395"},
{"legacy_row_id":1396,"split_index":0,"measurement_id":"m-001396"},
{"legacy_row_id":1397,"split_index":0,"measurement_id":"m-001397"},
{"legacy_row_id":1398,"split_index":0,"measurement_id":"m-001398"},
{"legacy_row_id":1399,"split_index":0,"measurement_id":"m-001399"},
{"legacy_row_id":1400,"split_index":0,"measurement_id":"m-001400"},
{"legacy_row_id":1401,"split_index":0,"measurement_id":"m-001401"},
{"legacy_row_id":1402,"split_index":0,"measurement_id":"m-001402"},
{"legacy_row_id":1403,"split_index":0,"measurement_id":"m-001403"},
{"legacy_row_id":1404,"split_index":0,"measurement_id":"m-001404"},
{"legacy_row_id":1405,"split_index":0,"measurement_id":"m-001405"},
{"legacy_row_id":1406,"split_index":0,"measurement_id":"m-001406"},
{"legacy_row_id":1407,"split_index":0,"measurement_id":"m-001407"},
{"legacy_row_id":1408,"split_index":0,"measurement_id":"m-001408"},
{"legacy_row_id":1409,"split_index":0,"measurement_id":"m-001409"},
{"legacy_row_id":1410,"split_index":0,"measurement_id":"m-001410"},
{"legacy_row_id":1411,"split_index":0,"measurement_id":"m-001411"},
{"legacy_row_id":1412,"split_index":0,"measurement_id":"m-001412"},
{"legacy_row_id":1413,"split_index":0,"measurement_id":"m-001413"},
{"legacy_row_id":1414,"split_index":0,"measurement_id":"m-001414"},
{"legacy_row_id":1415,"split_index":0,"measurement_id":"m-001415"},
{"legacy_row_id":1416,"split_index":0,"measurement_id":"m-001416"},
{"legacy_row_id":1417,"split_index":0,"measurement_id":"m-001417"},
{"legacy_row_id":1418,"split_index":0,"measurement_id":"m-001418"},
{"legacy_row_id":1419,"split_index":0,"measurement_id":"m-001419"},
{"legacy_row_id":1420,"split_index":0,"measurement_id":"m-001420"},
{"legacy_row_id":1421,"split_index":0,"measurement_id":"m-001421"},
{"legacy_row_id":1422,"split_index":0,"measurement_id":"m-001422"},
{"legacy_row_id":1423,"split_index":0,"measurement_id":"m-001423"},
{"legacy_row_id":1424,"split_index":0,"measurement_id":"m-001424"},
{"legacy_row_id":1425,"split_index":0,"measurement_id":"m-001425"},
{"legacy_row_id":1426,"split_index":0,"measurement_id":"m-001426"},
{"legacy_row_id":1427,"split_index":0,"measurement_id":"m-001427"},
{"legacy_row_id":1428,"split_index":0,"measurement_id":"m-001428"},
{"legacy_row_id":1429,"split_index":0,"measurement_id":"m-001429"},
{"legacy_row_id":1430,"split_index":0,"measurement_id":"m-001430"},
{"legacy_row_id":1431,"split_index":0,"measurement_id":"m-001431"},
{"legacy_row_id":1432,"split_index":0,"measurement_id":"m-001432"},
{"legacy_row_id":1433,"split_index":0,"measurement_id":"m-001433"},
{"legacy_row_id":1434,"split_index":0,"measurement_id":"m-001434"},
{"legacy_row_id":1435,"split_index":0,"measurement_id":"m-001435"},
{"legacy_row_id":1436,"split_index":0,"measurement_id":"m-001436"},
{"legacy_row_id":1437,"split_index":0,"measurement_id":"m-001437"},
{"legacy_row_id":1438,"split_index":0,"measurement_id":"m-001438"},
{"legacy_row_id":1439,"split_index":0,"measurement_id":"m-001439"},
{"legacy_row_id":1440,"split_index":0,"measurement_id":"m-001440"},
{"legacy_row_id":1441,"split_index":0,"measurement_id":"m-001441"},
{"legacy_row_id":1442,"split_index":0,"measurement_id":"m-001442"},
{"legacy_row_id":1443,"split_index":0,"measurement_id":"m-001443"},
{"legacy_row_id":1444,"split_index":0,"measurement_id":"m-001444"},
{"legacy_row_id":1445,"split_index":0,"measurement_id":"m-001445"},
{"legacy_row_id":1446,"split_index":0,"measurement_id":"m-001446"},
{"legacy_row_id":1447,"split_index":0,"measurement_id":"m-001447"},
{"legacy_row_id":1448,"split_index":0,"measurement_id":"m-001448"},
{"legacy_row_id":1449,"split_index":0,"measurement_id":"m-001449"},
{"legacy_row_id":1450,"split_index":0,"measurement_id":"m-001450"},
{"legacy_row_id":1451,"split_index":0,"measurement_id":"m-001451"},
{"legacy_row_id":1452,"split_index":0,"measurement_id":"m-001452"},
{"legacy_row_id":1453,"split_index":0,"measurement_id":"m-001453"},
{"legacy_row_id":1454,"split_index":0,"measurement_id":"m-001454"},
{"legacy_row_id":1455,"split_index":0,"measurement_id":"m-001455"},
{"legacy_row_id":1456,"split_index":0,"measurement_id":"m-001456"},
{"legacy_row_id":1457,"split_index":0,"measurement_id":"m-001457"},
{"legacy_row_id":1458,"split_index":0,"measurement_id":"m-001458"},
{"legacy_row_id":1459,"split_index":0,"measurement_id":"m-001459"},
{"legacy_row_id":1460,"split_index":0,"measurement_id":"m-001460"},
{"legacy_row_id":1461,"split_index":0,"measurement_id":"m-001461"},
{"legacy_row_id":1462,"split_index":0,"measurement_id":"m-001462"},
{"legacy_row_id":1463,"split_index":0,"measurement_id":"m-001463"},
{"legacy_row_id":1464,"split_index":0,"measurement_id":"m-001464"},
{"legacy_row_id":1465,"split_index":0,"measurement_id":"m-001465"},
{"legacy_row_id":1466,"split_index":0,"measurement_id":"m-001466"},
{"legacy_row_id":1467,"split_index":0,"measurement_id":"m-001467"},
{"legacy_row_id":1468,"split_index":0,"measurement_id":"m-001468"},
{"legacy_row_id":1469,"split_index":0,"measurement_id":"m-001469"},
{"legacy_row_id":1470,"split_index":0,"measurement_id":"m-001470"},
{"legacy_row_id":1471,"split_index":0,"measurement_id":"m-001471"},
{"legacy_row_id":1472,"split_index":0,"measurement_id":"m-001472"},
{"legacy_row_id":1473,"split_index":0,"measurement_id":"m-001473"},
{"legacy_row_id":1474,"split_index":0,"measurement_id":"m-001474"},
{"legacy_row_id":1475,"split_index":0,"measurement_id":"m-001475"},
{"legacy_row_id":1476,"split_index":0,"measurement_id":"m-001476"},
{"legacy_row_id":1477,"split_index":0,"measurement_id":"m-001477"},
{"legacy_row_id":1478,"split_index":0,"measurement_id":"m-001478"},
{"legacy_row_id":1479,"split_index":0,"measurement_id":"m-001479"},
{"legacy_row_id":1480,"split_index":0,"measurement_id":"m-001480"},
{"legacy_row_id":1481,"split_index":0,"measurement_id":"m-001481"},
{"legacy_row_id":1482,"split_index":0,"measurement_id":"m-001482"},
{"legacy_row_id":1483,"split_index":0,"measurement_id":"m-001483"},
{"legacy_row_id":1484,"split_index":0,"measurement_id":"m-001484"},
{"legacy_row_id":1485,"split_index":0,"measurement_id":"m-001485"},
{"legacy_row_id":1486,"split_index":0,"measurement_id":"m-001486"},
{"legacy_row_id":1487,"split_index":0,"measurement_id":"m-001487"},
{"legacy_row_id":1488,"split_index":0,"measurement_id":"m-001488"},
{"legacy_row_id":1489,"split_index":0,"measurement_id":"m-001489"},
{"legacy_row_id":1490,"split_index":0,"measurement_id":"m-001490"},
{"legacy_row_id":1491,"split_index":0,"measurement_id":"m-001491"},
{"legacy_row_id":1492,"split_index":0,"measurement_id":"m-001492"},
{"legacy_row_id":1493,"split_index":0,"measurement_id":"m-001493"},
{"legacy_row_id":1494,"split_index":0,"measurement_id":"m-001494"},
{"legacy_row_id":1495,"split_index":0,"measurement_id":"m-001495"},
{"legacy_row_id":1496,"split_index":0,"measurement_id":"m-001496"},
{"legacy_row_id":1497,"split_index":0,"measurement_id":"m-001497"},
{"legacy_row_id":1498,"split_index":0,"measurement_id":"m-001498"},
{"legacy_row_id":1499,"split_index":0,"measurement_id":"m-001499"},
{"legacy_row_id":1500,"split_index":0,"measurement_id":"m-001500"},
{"legacy_row_id":1501,"split_index":0,"measurement_id":"m-001501"},
{"legacy_row_id":1502,"split_index":0,"measurement_id":"m-001502"},
{"legacy_row_id":1503,"split_index":0,"measurement_id":"m-001503"},
{"legacy_row_id":1504,"split_index":0,"measurement_id":"m-001504"},
{"legacy_row_id":1505,"split_index":0,"measurement_id":"m-001505"},
{"legacy_row_id":1506,"split_index":0,"measurement_id":"m-001506"},
{"legacy_row_id":1507,"split_index":0,"measurement_id":"m-001507"},
{"legacy_row_id":1508,"split_index":0,"measurement_id":"m-001508"},
{"legacy_row_id":1509,"split_index":0,"measurement_id":"m-001509"},
{"legacy_row_id":1510,"split_index":0,"measurement_id":"m-001510"},
{"legacy_row_id":1511,"split_index":0,"measurement_id":"m-001511"},
{"legacy_row_id":1512,"split_index":0,"measurement_id":"m-001512"},
{"legacy_row_id":1513,"split_index":0,"measurement_id":"m-001513"},
{"legacy_row_id":1514,"split_index":0,"measurement_id":"m-001514"},
{"legacy_row_id":1515,"split_index":0,"measurement_id":"m-001515"},
{"legacy_row_id":1516,"split_index":0,"measurement_id":"m-001516"},
{"legacy_row_id":1517,"split_index":0,"measurement_id":"m-001517"},
{"legacy_row_id":1518,"split_index":0,"measurement_id":"m-001518"},
{"legacy_row_id":1519,"split_index":0,"measurement_id":"m-001519"},
{"legacy_row_id":1520,"split_index":0,"measurement_id":"m-001520"},
{"legacy_row_id":1521,"split_index":0,"measurement_id":"m-001521"},
{"legacy_row_id":1522,"split_index":0,"measurement_id":"m-001522"},
{"legacy_row_id":1523,"split_index":0,"measurement_id":"m-001523"},
{"legacy_row_id":1524,"split_index":0,"measurement_id":"m-001524"},
{"legacy_row_id":1525,"split_index":0,"measurement_id":"m-001525"},
{"legacy_row_id":1526,"split_index":0,"measurement_id":"m-001526"},
{"legacy_row_id":1527,"split_index":0,"measurement_id":"m-001527"},
{"legacy_row_id":1528,"split_index":0,"measurement_id":"m-001528"},
{"legacy_row_id":1529,"split_index":0,"measurement_id":"m-001529"},
{"legacy_row_id":1530,"split_index":0,"measurement_id":"m-001530"},
{"legacy_row_id":1531,"split_index":0,"measurement_id":"m-001531"},
{"legacy_row_id":1532,"split_index":0,"measurement_id":"m-001532"},
{"legacy_row_id":1533,"split_index":0,"measurement_id":"m-001533"},
{"legacy_row_id":1534,"split_index":0,"measurement_id":"m-001534"},
{"legacy_row_id":1535,"split_index":0,"measurement_id":"m-001535"},
{"legacy_row_id":1536,"split_index":0,"measurement_id":"m-001536"},
{"legacy_row_id":1537,"split_index":0,"measurement_id":"m-001537"},
{"legacy_row_id":1538,"split_index":0,"measurement_id":"m-001538"},
{"legacy_row_id":1539,"split_index":0,"measurement_id":"m-001539"},
{"legacy_row_id":1540,"split_index":0,"measurement_id":"m-001540"},
{"legacy_row_id":1541,"split_index":0,"measurement_id":"m-001541"},
{"legacy_row_id":1542,"split_index":0,"measurement_id":"m-001542"},
{"legacy_row_id":1543,"split_index":0,"measurement_id":"m-001543"},
{"legacy_row_id":1544,"split_index":0,"measurement_id":"m-001544"},
{"legacy_row_id":1545,"split_index":0,"measurement_id":"m-001545"},
{"legacy_row_id":1546,"split_index":0,"measurement_id":"m-001546"},
{"legacy_row_id":1547,"split_index":0,"measurement_id":"m-001547"},
{"legacy_row_id":1548,"split_index":0,"measurement_id":"m-001548"},
{"legacy_row_id":1549,"split_index":0,"measurement_id":"m-001549"},
{"legacy_row_id":1550,"split_index":0,"measurement_id":"m-001550"},
{"legacy_row_id":1551,"split_index":0,"measurement_id":"m-001551"},
{"legacy_row_id":1552,"split_index":0,"measurement_id":"m-001552"},
{"legacy_row_id":1553,"split_index":0,"measurement_id":"m-001553"},
{"legacy_row_id":1554,"split_index":0,"measurement_id":"m-001554"},
{"legacy_row_id":1555,"split_index":0,"measurement_id":"m-001555"},
{"legacy_row_id":1556,"split_index":0,"measurement_id":"m-001556"},
{"legacy_row_id":1557,"split_index":0,"measurement_id":"m-001557"},
{"legacy_row_id":1558,"split_index":0,"measurement_id":"m-001558"},
{"legacy_row_id":1559,"split_index":0,"measurement_id":"m-001559"},
{"legacy_row_id":1560,"split_index":0,"measurement_id":"m-001560"},
{"legacy_row_id":1561,"split_index":0,"measurement_id":"m-001561"},
{"legacy_row_id":1562,"split_index":0,"measurement_id":"m-001562"},
{"legacy_row_id":1563,"split_index":0,"measurement_id":"m-001563"},
{"legacy_row_id":1564,"split_index":0,"measurement_id":"m-001564"},
{"legacy_row_id":1565,"split_index":0,"measurement_id":"m-001565"},
{"legacy_row_id":1566,"split_index":0,"measurement_id":"m-001566"},
{"legacy_row_id":1567,"split_index":0,"measurement_id":"m-001567"},
{"legacy_row_id":1568,"split_index":0,"measurement_id":"m-001568"},
{"legacy_row_id":1569,"split_index":0,"measurement_id":"m-001569"},
{"legacy_row_id":1570,"split_index":0,"measurement_id":"m-001570"},
{"legacy_row_id":1571,"split_index":0,"measurement_id":"m-001571"},
{"legacy_row_id":1572,"split_index":0,"measurement_id":"m-001572"},
{"legacy_row_id":1573,"split_index":0,"measurement_id":"m-001573"},
{"legacy_row_id":1574,"split_index":0,"measurement_id":"m-001574"},
{"legacy_row_id":1575,"split_index":0,"measurement_id":"m-001575"},
{"legacy_row_id":1576,"split_index":0,"measurement_id":"m-001576"},
{"legacy_row_id":1577,"split_index":0,"measurement_id":"m-001577"},
{"legacy_row_id":1578,"split_index":0,"measurement_id":"m-001578"},
{"legacy_row_id":1579,"split_index":0,"measurement_id":"m-001579"},
{"legacy_row_id":1580,"split_index":0,"measurement_id":"m-001580"},
{"legacy_row_id":1581,"split_index":0,"measurement_id":"m-001581"},
{"legacy_row_id":1582,"split_index":0,"measurement_id":"m-001582"},
{"legacy_row_id":1583,"split_index":0,"measurement_id":"m-001583"},
{"legacy_row_id":1584,"split_index":0,"measurement_id":"m-001584"},
{"legacy_row_id":1585,"split_index":0,"measurement_id":"m-001585"},
{"legacy_row_id":1586,"split_index":0,"measurement_id":"m-001586"},
{"legacy_row_id":1587,"split_index":0,"measurement_id":"m-001587"},
{"legacy_row_id":1588,"split_index":0,"measurement_id":"m-001588"},
{"legacy_row_id":1589,"split_index":0,"measurement_id":"m-001589"},
{"legacy_row_id":1590,"split_index":0,"measurement_id":"m-001590"},
{"legacy_row_id":1591,"split_index":0,"measurement_id":"m-001591"},
{"legacy_row_id":1592,"split_index":0,"measurement_id":"m-001592"},
{"legacy_row_id":1593,"split_index":0,"measurement_id":"m-001593"},
{"legacy_row_id":1594,"split_index":0,"measurement_id":"m-001594"},
{"legacy_row_id":1595,"split_index":0,"measurement_id":"m-001595"},
{"legacy_row_id":1596,"split_index":0,"measurement_id":"m-001596"},
{"legacy_row_id":1597,"split_index":0,"measurement_id":"m-001597"},
{"legacy_row_id":1598,"split_index":0,"measurement_id":"m-001598"},
{"legacy_row_id":1599,"split_index":0,"measurement_id":"m-001599"},
{"legacy_row_id":1600,"split_index":0,"measurement_id":"m-001600"},
{"legacy_row_id":1601,"split_index":0,"measurement_id":"m-001601"},
{"legacy_row_id":1602,"split_index":0,"measurement_id":"m-001602"},
{"legacy_row_id":1603,"split_index":0,"measurement_id":"m-001603"},
{"legacy_row_id":1604,"split_index":0,"measurement_id":"m-001604"},
{"legacy_row_id":1605,"split_index":0,"measurement_id":"m-001605"},
{"legacy_row_id":1606,"split_index":0,"measurement_id":"m-001606"},
{"legacy_row_id":1607,"split_index":0,"measurement_id":"m-001607"},
{"legacy_row_id":1608,"split_index":0,"measurement_id":"m-001608"},
{"legacy_row_id":1609,"split_index":0,"measurement_id":"m-001609"},
{"legacy_row_id":1610,"split_index":0,"measurement_id":"m-001610"},
{"legacy_row_id":1611,"split_index":0,"measurement_id":"m-001611"},
{"legacy_row_id":1612,"split_index":0,"measurement_id":"m-001612"},
{"legacy_row_id":1613,"split_index":0,"measurement_id":"m-001613"},
{"legacy_row_id":1614,"split_index":0,"measurement_id":"m-001614"},
{"legacy_row_id":1615,"split_index":0,"measurement_id":"m-001615"},
{"legacy_row_id":1616,"split_index":0,"measurement_id":"m-001616"},
{"legacy_row_id":1617,"split_index":0,"measurement_id":"m-001617"},
{"legacy_row_id":1618,"split_index":0,"measurement_id":"m-001618"},
{"legacy_row_id":1619,"split_index":0,"measurement_id":"m-001619"},
{"legacy_row_id":1620,"split_index":0,"measurement_id":"m-001620"},
{"legacy_row_id":1621,"split_index":0,"measurement_id":"m-001621"},
{"legacy_row_id":1622,"split_index":0,"measurement_id":"m-001622"},
{"legacy_row_id":1623,"split_index":0,"measurement_id":"m-001623"},
{"legacy_row_id":1624,"split_index":0,"measurement_id":"m-001624"},
{"legacy_row_id":1625,"split_index":0,"measurement_id":"m-001625"},
{"legacy_row_id":1626,"split_index":0,"measurement_id":"m-001626"},
{"legacy_row_id":1627,"split_index":0,"measurement_id":"m-001627"},
{"legacy_row_id":1628,"split_index":0,"measurement_id":"m-001628"},
{"legacy_row_id":1629,"split_index":0,"measurement_id":"m-001629"},
{"legacy_row_id":1630,"split_index":0,"measurement_id":"m-001630"},
{"legacy_row_id":1631,"split_index":0,"measurement_id":"m-001631"},
{"legacy_row_id":1632,"split_index":0,"measurement_id":"m-001632"},
{"legacy_row_id":1633,"split_index":0,"measurement_id":"m-001633"},
{"legacy_row_id":1634,"split_index":0,"measurement_id":"m-001634"},
{"legacy_row_id":1635,"split_index":0,"measurement_id":"m-001635"},
{"legacy_row_id":1636,"split_index":0,"measurement_id":"m-001636"},
{"legacy_row_id":1637,"split_index":0,"measurement_id":"m-001637"},
{"legacy_row_id":1638,"split_index":0,"measurement_id":"m-001638"},
{"legacy_row_id":1639,"split_index":0,"measurement_id":"m-001639"},
{"legacy_row_id":1640,"split_index":0,"measurement_id":"m-001640"},
{"legacy_row_id":1641,"split_index":0,"measurement_id":"m-001641"},
{"legacy_row_id":1642,"split_index":0,"measurement_id":"m-001642"},
{"legacy_row_id":1643,"split_index":0,"measurement_id":"m-001643"},
{"legacy_row_id":1644,"split_index":0,"measurement_id":"m-001644"}
],
"sources": [
{"source_id":"anthropic-claude-opus-4-sonnet-4-system-card","category":"lab_document","lab":"Anthropic","title":"Claude Opus 4 & Sonnet 4 System Card","doc_type":"system_card","models_covered":"Claude Opus 4; Claude Sonnet 4","published":"2025-05-22","url":"https://www-cdn.anthropic.com/6d8a8055020700718b0c49369f60816ba2a7c285/Claude%204%20System%20Card.pdf","alt_urls":"https://www.anthropic.com/claude-4-system-card (redirect)","revisions_known":"2025-07-16 footnote and formatting; 2025-09-02 corrected Claude Code Impossible Tasks numbers","changelog":"yes","extraction_notes":"Web reader stopped at §4.2.1; later sections partly from secondary write-ups","v0_rows":"45","v0_card_label":"Claude Opus 4 & Sonnet 4 system card","last_checked":"2026-09-26"},
{"source_id":"anthropic-claude-opus-4-1-system-card-addendum","category":"lab_document","lab":"Anthropic","title":"Claude Opus 4.1 System Card (addendum)","doc_type":"addendum","models_covered":"Claude Opus 4.1","published":"2025-08-05","url":"https://www-cdn.anthropic.com/9fa30625273bafdf5af82c93719d7ca606485a16/Claude%204.1%20System%20Card.pdf","alt_urls":"","revisions_known":"2025-09-15 CBRN partner acknowledgments","changelog":"yes","extraction_notes":"Read in full; carries corrected Opus 4 / Sonnet 4 reward-hacking numbers","v0_rows":"34","v0_card_label":"Claude Opus 4.1 system card addendum","last_checked":"2026-09-26"},
{"source_id":"anthropic-claude-sonnet-4-5-system-card","category":"lab_document","lab":"Anthropic","title":"Claude Sonnet 4.5 System Card","doc_type":"system_card","models_covered":"Claude Sonnet 4.5","published":"2025-09-29","url":"https://www-cdn.anthropic.com/963373e433e489a87a10c823c52a0a013e9172dd/Claude%20Sonnet%204.5%20System%20Card.pdf","alt_urls":"","revisions_known":"2025-10-10 footnote author fix; 2025-12-03 edit to §9.3.5","changelog":"yes","extraction_notes":"Web reader stopped at §7.2; alignment numbers partly from secondary write-ups","v0_rows":"56","v0_card_label":"Claude Sonnet 4.5 system card","last_checked":"2026-09-26"},
{"source_id":"anthropic-claude-haiku-4-5-system-card","category":"lab_document","lab":"Anthropic","title":"Claude Haiku 4.5 System Card","doc_type":"system_card","models_covered":"Claude Haiku 4.5","published":"2025-10-15","url":"https://www-cdn.anthropic.com/7aad69bf12627d42234e01ee7c36305dc2f6a970.pdf","alt_urls":"https://assets.anthropic.com/m/99128ddd009bdcb/original/Claude-Haiku-4-5-System-Card.pdf","revisions_known":"none seen","changelog":"no","extraction_notes":"Read in full (~39 pages)","v0_rows":"39","v0_card_label":"Claude Haiku 4.5 system card","last_checked":"2026-09-26"},
{"source_id":"anthropic-claude-opus-4-5-system-card","category":"lab_document","lab":"Anthropic","title":"Claude Opus 4.5 System Card","doc_type":"system_card","models_covered":"Claude Opus 4.5","published":"2025-11-24","url":"https://www-cdn.anthropic.com/bf10f64990cfda0ba858290be7b8cc6317685f47.pdf","alt_urls":"https://assets.anthropic.com/m/64823ba7485345a7/Claude-Opus-4-5-System-Card.pdf","revisions_known":"2025-11-24 ARC-AGI-1 and training-data fixes; 2025-11-25 caption typo; 2025-12-05 several corrections","changelog":"yes","extraction_notes":"Web reader stopped at §5.2.2.2; §6–7 from secondary write-ups","v0_rows":"58","v0_card_label":"Claude Opus 4.5 system card","last_checked":"2026-09-26"},
{"source_id":"anthropic-claude-opus-4-6-system-card","category":"lab_document","lab":"Anthropic","title":"Claude Opus 4.6 System Card","doc_type":"system_card","models_covered":"Claude Opus 4.6","published":"2026-02","url":"https://www-cdn.anthropic.com/6a5fa276ac68b9aeb0c8b6af5fa36326e0e166dd/Claude%20Opus%204.6%20System%20Card.pdf","alt_urls":"https://www-cdn.anthropic.com/0dd865075ad3132672ee0ab40b05a53f14cf5288.pdf (earlier version)","revisions_known":"2026-02-06; 2026-02-10; 2026-02-17; 2026-03-06 (benchmark corrections, wording)","changelog":"yes","extraction_notes":"Web reader stopped ~p.58; sabotage figures live in a separate Sabotage Risk Report (not extracted)","v0_rows":"24","v0_card_label":"Claude Opus 4.6","last_checked":"2026-09-26"},
{"source_id":"anthropic-claude-sonnet-4-6-system-card","category":"lab_document","lab":"Anthropic","title":"Claude Sonnet 4.6 System Card","doc_type":"system_card","models_covered":"Claude Sonnet 4.6","published":"2026-02-17","url":"https://www-cdn.anthropic.com/bbd8ef16d70b7a1665f14f306ee88b53f686aa75/Claude%20Sonnet%204.6%20System%20Card.pdf","alt_urls":"","revisions_known":"2026-03-06 BrowseComp; section moved","changelog":"yes","extraction_notes":"Web reader stopped ~p.68","v0_rows":"17","v0_card_label":"Claude Sonnet 4.6","last_checked":"2026-09-26"},
{"source_id":"anthropic-claude-mythos-preview-system-card","category":"lab_document","lab":"Anthropic","title":"Claude Mythos Preview System Card","doc_type":"system_card","models_covered":"Claude Mythos Preview","published":"2026-04-07","url":"https://www-cdn.anthropic.com/7624816413e9b4d2e3ba620c5a5e091b98b190a5/Claude%20Mythos%20Preview%20System%20Card.pdf","alt_urls":"","revisions_known":"2026-04-08; 2026-04-14","changelog":"yes","extraction_notes":"Web reader stopped ~p.49; limited-release model; first card under RSP v3.0","v0_rows":"43","v0_card_label":"Claude Mythos Preview","last_checked":"2026-09-26"},
{"source_id":"anthropic-claude-opus-4-7-system-card","category":"lab_document","lab":"Anthropic","title":"Claude Opus 4.7 System Card","doc_type":"system_card","models_covered":"Claude Opus 4.7","published":"2026-04-16","url":"https://www-cdn.anthropic.com/037f06850df7fbe871e206dad004c3db5fd50340/Claude%20Opus%204.7%20System%20Card.pdf","alt_urls":"","revisions_known":"none seen","changelog":"unknown","extraction_notes":"Web reader stopped ~p.52","v0_rows":"24","v0_card_label":"Claude Opus 4.7","last_checked":"2026-09-26"},
{"source_id":"anthropic-claude-opus-4-8-system-card","category":"lab_document","lab":"Anthropic","title":"Claude Opus 4.8 System Card","doc_type":"system_card","models_covered":"Claude Opus 4.8","published":"2026-05-28","url":"https://www-cdn.anthropic.com/0f0c97ad20d8005706296bd92aa1c27c6b2f4f61/Claude%20Opus%204.8%20System%20Card.pdf","alt_urls":"","revisions_known":"2026-06-03; 2026-06-17 (virology task 2 0.89→0.90; bug-bounty correction; scale fix)","changelog":"yes","extraction_notes":"Web reader stopped ~p.57","v0_rows":"35","v0_card_label":"Claude Opus 4.8","last_checked":"2026-09-26"},
{"source_id":"anthropic-claude-fable-5-claude-mythos-5-system-card","category":"lab_document","lab":"Anthropic","title":"Claude Fable 5 & Claude Mythos 5 System Card","doc_type":"system_card","models_covered":"Claude Fable 5; Claude Mythos 5","published":"2026-06-09","url":"https://www-cdn.anthropic.com/57a52ea7d8f0e54e8a542e908266086df425cdf5/Claude%20Fable%205%20&%20Claude%20Mythos%205%20System%20Card.pdf","alt_urls":"","revisions_known":"2026-06-11 several corrections; 2026-06-25 executive-summary alignment risk \"low\"→\"very low\" to match §2.4 (verified)","changelog":"yes","extraction_notes":"Web reader stopped ~p.50","v0_rows":"20","v0_card_label":"Claude Fable 5 & Claude Mythos 5","last_checked":"2026-09-26"},
{"source_id":"anthropic-claude-sonnet-5-system-card","category":"lab_document","lab":"Anthropic","title":"Claude Sonnet 5 System Card","doc_type":"system_card","models_covered":"Claude Sonnet 5","published":"2026-06-30","url":"https://www-cdn.anthropic.com/283ef97c476cf442c91d9a37d5b214242a55bb92/Claude%20Sonnet%205%20System%20Card.pdf","alt_urls":"","revisions_known":"2026-07-10 BrowseComp footnote","changelog":"yes","extraction_notes":"Web reader stopped ~p.56","v0_rows":"42","v0_card_label":"Claude Sonnet 5","last_checked":"2026-09-26"},
{"source_id":"anthropic-claude-opus-5-system-card","category":"lab_document","lab":"Anthropic","title":"Claude Opus 5 System Card","doc_type":"system_card","models_covered":"Claude Opus 5","published":"2026-07-24","url":"https://www-cdn.anthropic.com/ceaf5c7ff2783855203fde8208ec311252dced5b/Claude%20Opus%205%20System%20Card.pdf","alt_urls":"","revisions_known":"2026-08-19 prompt-injection bug-bounty results added; Cowork harness fixes; thinking-disabled results removed","changelog":"yes","extraction_notes":"Web reader stopped ~p.57","v0_rows":"30","v0_card_label":"Claude Opus 5","last_checked":"2026-09-26"},
{"source_id":"anthropic-claude-fable-5-1-claude-mythos-5-1-system-card","category":"lab_document","lab":"Anthropic","title":"Claude Fable 5.1 & Claude Mythos 5.1 System Card","doc_type":"system_card","models_covered":"Claude Fable 5.1; Claude Mythos 5.1","published":"2026-09-01","url":"https://www-cdn.anthropic.com/0339e6a7c5c7b87f5c07798616dc32c215d14235/Claude%20Fable%205.1%20&%20Claude%20Mythos%205.1%20System%20Card.pdf","alt_urls":"","revisions_known":"none seen","changelog":"unknown","extraction_notes":"Web reader stopped ~p.52; refers to an August 2026 Risk Report (not extracted)","v0_rows":"22","v0_card_label":"Claude Fable 5.1 & Claude Mythos 5.1","last_checked":"2026-09-26"},
{"source_id":"anthropic-claude-opus-5-5-system-card","category":"lab_document","lab":"Anthropic","title":"Claude Opus 5.5 System Card","doc_type":"system_card","models_covered":"Claude Opus 5.5","published":"2026-09-22","url":"https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf","alt_urls":"","revisions_known":"none yet","changelog":"unknown","extraction_notes":"Web reader stopped ~p.49","v0_rows":"23","v0_card_label":"Claude Opus 5.5","last_checked":"2026-09-26"},
{"source_id":"openai-o3-and-o4-mini-system-card","category":"lab_document","lab":"OpenAI","title":"OpenAI o3 and o4-mini System Card","doc_type":"system_card","models_covered":"o3; o4-mini","published":"2025-04-16","url":"https://cdn.openai.com/pdf/2221c875-02dc-4789-800b-e7758f3722c1/o3-and-o4-mini-system-card.pdf","alt_urls":"","revisions_known":"none seen","changelog":"unknown","extraction_notes":"Most numbers stated in text","v0_rows":"51","v0_card_label":"o3 & o4-mini","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-oss-120b-gpt-oss-20b-model-card","category":"lab_document","lab":"OpenAI","title":"gpt-oss-120b & gpt-oss-20b Model Card","doc_type":"model_card","models_covered":"gpt-oss-120b; gpt-oss-20b","published":"2025-08-05","url":"https://cdn.openai.com/pdf/419b6906-9da6-406c-a19d-1bb078ac7637/oai_gpt-oss_model_card.pdf","alt_urls":"https://deploymentsafety.openai.com/gpt-oss; arXiv 2508.10925","revisions_known":"none seen","changelog":"unknown","extraction_notes":"Open-weight; includes worst-case malicious fine-tuning assessment","v0_rows":"74","v0_card_label":"gpt-oss-120b & gpt-oss-20b","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-5-system-card","category":"lab_document","lab":"OpenAI","title":"GPT-5 System Card","doc_type":"system_card","models_covered":"gpt-5-thinking; gpt-5-main; comparators","published":"2025-08-07","url":"https://cdn.openai.com/gpt-5-system-card.pdf","alt_urls":"https://deploymentsafety.openai.com/gpt-5","revisions_known":"PDF of 2025-08-07 replaced by 2025-08-13 version without changelog; 2026-04-24 hub added chain-of-thought evaluations","changelog":"partial","extraction_notes":"Many Preparedness numbers are chart-only (excluded)","v0_rows":"118","v0_card_label":"GPT-5","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-5-codex-system-card-addendum","category":"lab_document","lab":"OpenAI","title":"GPT-5-Codex System Card Addendum","doc_type":"addendum","models_covered":"GPT-5-Codex","published":"2025-09-15","url":"https://cdn.openai.com/pdf/97cc5669-7a25-4e63-b15f-5fd5bdc4d149/gpt-5-codex-system-card.pdf","alt_urls":"","revisions_known":"hub marks it no longer in production","changelog":"unknown","extraction_notes":"","v0_rows":"21","v0_card_label":"GPT-5-Codex (addendum)","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-5-1-instant-and-thinking-system-card-addendum","category":"lab_document","lab":"OpenAI","title":"GPT-5.1 Instant and Thinking System Card Addendum","doc_type":"addendum","models_covered":"gpt-5.1-instant; gpt-5.1-thinking","published":"2025-11-12","url":"https://cdn.openai.com/pdf/4173ec8d-1229-47db-96de-06d87147e07e/5_1_system_card.pdf","alt_urls":"","revisions_known":"none seen","changelog":"unknown","extraction_notes":"Introduces Production Benchmarks v2","v0_rows":"73","v0_card_label":"GPT-5.1 Instant & Thinking (addendum)","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-5-1-codex-max-system-card","category":"lab_document","lab":"OpenAI","title":"GPT-5.1-Codex-Max System Card","doc_type":"system_card","models_covered":"GPT-5.1-Codex-Max","published":"2025-11-18","url":"https://cdn.openai.com/pdf/2a7d98b1-57e5-4147-8d0e-683894d782ae/5p1_codex_max_card_03.pdf","alt_urls":"https://deploymentsafety.openai.com/gpt-5-1-codex-max","revisions_known":"filename suffix _03 suggests earlier versions","changelog":"unknown","extraction_notes":"","v0_rows":"42","v0_card_label":"GPT-5.1-Codex-Max","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-5-2-system-card-update-to-gpt-5-card","category":"lab_document","lab":"OpenAI","title":"GPT-5.2 System Card (update to GPT-5 card)","doc_type":"system_card","models_covered":"gpt-5.2-thinking; gpt-5.2-instant","published":"2025-12-11","url":"https://cdn.openai.com/pdf/3a4153c8-c748-4b71-8e31-aecbde944f8d/oai_5_2_system-card.pdf","alt_urls":"https://deploymentsafety.openai.com/gpt-5-2","revisions_known":"2026-04-24 hub added CoT monitorability/controllability and sandbagging sections (not in PDF)","changelog":"partial","extraction_notes":"","v0_rows":"94","v0_card_label":"GPT-5.2 (update to GPT-5 card)","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-5-2-codex-system-card-addendum","category":"lab_document","lab":"OpenAI","title":"GPT-5.2-Codex System Card Addendum","doc_type":"addendum","models_covered":"GPT-5.2-Codex","published":"2025-12-18","url":"https://cdn.openai.com/pdf/ac7c37ae-7f4c-4442-b741-2eabdeaf77e0/oai_5_2_Codex.pdf","alt_urls":"","revisions_known":"none seen","changelog":"unknown","extraction_notes":"Partial extraction (15 rows)","v0_rows":"15","v0_card_label":"GPT-5.2-Codex (addendum)","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-5-3-codex-system-card","category":"lab_document","lab":"OpenAI","title":"GPT-5.3-Codex System Card","doc_type":"system_card","models_covered":"GPT-5.3-Codex","published":"2026-02-05","url":"https://cdn.openai.com/pdf/23eca107-a9b1-4d2c-b156-7deb4fbc697c/GPT-5-3-Codex-System-Card-02.pdf","alt_urls":"https://deploymentsafety.openai.com/gpt-5-3-codex","revisions_known":"filename suffix -02","changelog":"unknown","extraction_notes":"First launch treated as High in cyber","v0_rows":"33","v0_card_label":"GPT-5.3-Codex system card","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-5-3-instant-system-card","category":"lab_document","lab":"OpenAI","title":"GPT-5.3 Instant System Card","doc_type":"system_card","models_covered":"GPT-5.3 Instant","published":"2026-03-03","url":"https://deploymentsafety.openai.com/gpt-5-3-instant/gpt-5-3-instant.pdf","alt_urls":"","revisions_known":"none seen","changelog":"unknown","extraction_notes":"Short card","v0_rows":"9","v0_card_label":"GPT-5.3 Instant system card","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-5-4-thinking-system-card","category":"lab_document","lab":"OpenAI","title":"GPT-5.4 Thinking System Card","doc_type":"system_card","models_covered":"GPT-5.4 Thinking","published":"2026-03-05","url":"https://deploymentsafety.openai.com/gpt-5-4-thinking/gpt-5-4-thinking.pdf","alt_urls":"","revisions_known":"none seen","changelog":"unknown","extraction_notes":"Jailbreak results figure-only","v0_rows":"27","v0_card_label":"GPT-5.4 Thinking system card","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-5-5-system-card","category":"lab_document","lab":"OpenAI","title":"GPT-5.5 System Card","doc_type":"system_card","models_covered":"GPT-5.5","published":"2026-04-23","url":"https://deploymentsafety.openai.com/gpt-5-5/gpt-5-5.pdf","alt_urls":"","revisions_known":"none seen","changelog":"unknown","extraction_notes":"","v0_rows":"37","v0_card_label":"GPT-5.5 system card","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-5-5-instant-system-card","category":"lab_document","lab":"OpenAI","title":"GPT-5.5 Instant System Card","doc_type":"system_card","models_covered":"GPT-5.5 Instant","published":"2026-05-04","url":"https://deploymentsafety.openai.com/gpt-5-5-instant/gpt-5-5-instant.pdf","alt_urls":"","revisions_known":"none seen","changelog":"unknown","extraction_notes":"","v0_rows":"16","v0_card_label":"GPT-5.5 Instant system card","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-rosalind-5-5-system-card","category":"lab_document","lab":"OpenAI","title":"GPT-Rosalind-5.5 System Card","doc_type":"system_card","models_covered":"GPT-Rosalind-5.5","published":"2026-06-03","url":"https://deploymentsafety.openai.com/gpt-rosalind-5-5","alt_urls":"","revisions_known":"none seen","changelog":"unknown","extraction_notes":"Biology model, trusted access; bio scores not extracted","v0_rows":"2","v0_card_label":"GPT-Rosalind-5.5 system card","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-5-6-preview-system-card","category":"lab_document","lab":"OpenAI","title":"GPT-5.6 Preview System Card","doc_type":"system_card","models_covered":"GPT-5.6 Sol; GPT-5.6 Terra; GPT-5.6 Luna","published":"2026-06-25","url":"https://deploymentsafety.openai.com/gpt-5-6-preview/gpt-5-6-preview.pdf","alt_urls":"","revisions_known":"2026-08-19 GPT-5.5 protein-binding pass@4 corrected 0.4%→1.5% (changelog verified 2026-09-26; same entry as GPT-5.6 system card)","changelog":"yes","extraction_notes":"","v0_rows":"7","v0_card_label":"GPT-5.6 Preview system card","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-live-system-card","category":"lab_document","lab":"OpenAI","title":"GPT-Live System Card","doc_type":"system_card","models_covered":"GPT-Live-1; GPT-Live-1 mini","published":"2026-07-08","url":"https://deploymentsafety.openai.com/gpt-live/gpt-live.pdf","alt_urls":"","revisions_known":"2026-08-04 configuration mismatch; Appendix A lists original vs corrected values","changelog":"yes","extraction_notes":"Voice model","v0_rows":"12","v0_card_label":"GPT-Live system card","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-5-6-system-card","category":"lab_document","lab":"OpenAI","title":"GPT-5.6 System Card","doc_type":"system_card","models_covered":"GPT-5.6 Sol; GPT-5.6 Terra; GPT-5.6 Luna","published":"2026-07-09","url":"https://deploymentsafety.openai.com/gpt-5-6/gpt-5-6.pdf","alt_urls":"","revisions_known":"2026-06-27 metagaming plots re-aggregated; 2026-08-03 GPT-Red prompt-injection results added; 2026-08-19 GPT-5.5 protein-binding pass@4 corrected 0.4%→1.5% (changelog verified 2026-09-26)","changelog":"yes","extraction_notes":"","v0_rows":"51","v0_card_label":"GPT-5.6 system card","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-5-6-august-updates-system-card","category":"lab_document","lab":"OpenAI","title":"GPT-5.6 August Updates System Card","doc_type":"system_card","models_covered":"GPT-5.6 Sol (August); GPT-5.6 Luna (August)","published":"2026-08-06","url":"https://deploymentsafety.openai.com/gpt-5-6-august-update/gpt-5-6-august-update.pdf","alt_urls":"","revisions_known":"none seen","changelog":"unknown","extraction_notes":"","v0_rows":"15","v0_card_label":"GPT-5.6 August Updates system card","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-6-astra-system-card","category":"lab_document","lab":"OpenAI","title":"GPT-6 Astra System Card","doc_type":"system_card","models_covered":"GPT-6 Astra; comparators","published":"2026-09-03","url":"https://deploymentsafety.openai.com/gpt-6-astra/gpt-6-astra.pdf","alt_urls":"https://deploymentsafety.openai.com/gpt-6-astra (HTML sections of the same document)","revisions_known":"2026-09-09 alignment section rewritten (\"alignment faking\"→\"oversight gaming\"); 2026-09-22 HealthBench fix, appendix on GPT-6 Sol/Luna, updated alignment evals","changelog":"yes","extraction_notes":"Web reader stopped around §9. v0 rows whose source_url is the launch post belong to openai-gpt-6-astra-launch-post, not to this card","v0_rows":"82","v0_card_label":"GPT-6 Astra system card","last_checked":"2026-09-26"},
{"source_id":"openai-gpt-6-astra-launch-post","category":"lab_document","lab":"OpenAI","title":"GPT-6 Astra launch post","doc_type":"launch_post","models_covered":"GPT-6 Astra","published":"2026-09-03","url":"https://openai.com/index/gpt-6-astra/","alt_urls":"","revisions_known":"","changelog":"not_applicable","extraction_notes":"v0 labels these rows \"GPT-6 Astra system card\"; assign by source_url","v0_rows":"14","v0_card_label":"GPT-6 Astra system card [source_url=https://openai.com/index/gpt-6-astra/]","last_checked":"2026-09-26"},
{"source_id":"openai-chatgpt-images-2-5-system-card","category":"lab_document","lab":"OpenAI","title":"ChatGPT Images 2.5 System Card","doc_type":"system_card","models_covered":"ChatGPT Images 2.5","published":"2026-09-08","url":"https://deploymentsafety.openai.com/chatgpt-images-2-5","alt_urls":"","revisions_known":"none seen","changelog":"unknown","extraction_notes":"Image-generation safety only","v0_rows":"6","v0_card_label":"ChatGPT Images 2.5 system card","last_checked":"2026-09-26"},
{"source_id":"openai-our-framework-for-reporting-model-misalignment","category":"lab_document","lab":"OpenAI","title":"Our framework for reporting model misalignment","doc_type":"policy_post","models_covered":"—","published":"2026-09-16","url":"https://openai.com/index/model-misalignment-reporting-framework/","alt_urls":"","revisions_known":"","changelog":"not_applicable","extraction_notes":"Not a card; six incident reports","v0_rows":"1","v0_card_label":"Model Misalignment Reporting Framework (not a system card)","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-gemini-2-5-pro-model-card","category":"lab_document","lab":"Google DeepMind","title":"Gemini 2.5 Pro Model Card","doc_type":"model_card","models_covered":"Gemini 2.5 Pro","published":"2025-06-27","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-2-5-Pro-Model-Card.pdf","alt_urls":"https://storage.googleapis.com/model-cards/documents/gemini-2.5-pro.pdf","revisions_known":"card shows columns for several preview versions","changelog":"no","extraction_notes":"Cyber figures differ from tech report (low confidence rows)","v0_rows":"21","v0_card_label":"Gemini 2.5 Pro model card","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-gemini-2-5-technical-report","category":"lab_document","lab":"Google DeepMind","title":"Gemini 2.5 Technical Report","doc_type":"tech_report","models_covered":"Gemini 2.5 family","published":"2025-06-17","url":"https://storage.googleapis.com/deepmind-media/gemini/gemini_v2_5_report.pdf","alt_urls":"arXiv 2507.06261","revisions_known":"","changelog":"not_applicable","extraction_notes":"Tables 7 and 9 headers garbled in extraction; column mapping inferred (medium confidence)","v0_rows":"25","v0_card_label":"Gemini 2.5 technical report","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-gemini-2-5-deep-think-model-card","category":"lab_document","lab":"Google DeepMind","title":"Gemini 2.5 Deep Think Model Card","doc_type":"model_card","models_covered":"Gemini 2.5 Deep Think","published":"2025-08-01","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-2-5-Deep-Think-Model-Card.pdf","alt_urls":"","revisions_known":"","changelog":"no","extraction_notes":"First model to reach CBRN early-warning alert threshold","v0_rows":"15","v0_card_label":"Gemini 2.5 Deep Think model card","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-gemini-2-5-flash-model-card","category":"lab_document","lab":"Google DeepMind","title":"Gemini 2.5 Flash Model Card","doc_type":"model_card","models_covered":"Gemini 2.5 Flash","published":"2025-09-26","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-2-5-Flash-Model-Card.pdf","alt_urls":"","revisions_known":"header says updated Dec 2025; no changelog","changelog":"no","extraction_notes":"v0 card_date \"2025-12\" is the updated-header date; use 2025-09-26 as published date and record a Dec 2025 version","v0_rows":"6","v0_card_label":"Gemini 2.5 Flash model card","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-gemini-3-pro-model-card","category":"lab_document","lab":"Google DeepMind","title":"Gemini 3 Pro Model Card","doc_type":"model_card","models_covered":"Gemini 3 Pro","published":"2025-11-18","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-Pro-Model-Card.pdf","alt_urls":"https://deepmind.google/models/model-cards/gemini-3-pro/","revisions_known":"header says last updated May 2026; no changelog","changelog":"no","extraction_notes":"","v0_rows":"7","v0_card_label":"Gemini 3 Pro model card","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-gemini-3-pro-frontier-safety-framework-report","category":"lab_document","lab":"Google DeepMind","title":"Gemini 3 Pro Frontier Safety Framework Report","doc_type":"fsf_report","models_covered":"Gemini 3 Pro","published":"2025-11-18","url":"https://storage.googleapis.com/deepmind-media/gemini/gemini_3_pro_fsf_report.pdf","alt_urls":"","revisions_known":"","changelog":"not_applicable","extraction_notes":"Several results chart-only (excluded)","v0_rows":"17","v0_card_label":"Gemini 3 Pro FSF report","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-gemini-3-launch-post","category":"lab_document","lab":"Google DeepMind","title":"Gemini 3 launch post","doc_type":"launch_post","models_covered":"Gemini 3 Pro","published":"2025-11-18","url":"https://blog.google/products/gemini/gemini-3/","alt_urls":"","revisions_known":"","changelog":"not_applicable","extraction_notes":"Only source for one factuality figure","v0_rows":"1","v0_card_label":"Gemini 3 launch blog","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-gemini-3-flash-model-card","category":"lab_document","lab":"Google DeepMind","title":"Gemini 3 Flash Model Card","doc_type":"model_card","models_covered":"Gemini 3 Flash","published":"2025-12-17","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-Flash-Model-Card.pdf","alt_urls":"","revisions_known":"","changelog":"no","extraction_notes":"FSF results inherited from Gemini 3 Pro","v0_rows":"6","v0_card_label":"Gemini 3 Flash model card","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-gemini-3-1-pro-model-card","category":"lab_document","lab":"Google DeepMind","title":"Gemini 3.1 Pro Model Card","doc_type":"model_card","models_covered":"Gemini 3.1 Pro","published":"2026-02-19","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-1-Pro-Model-Card.pdf","alt_urls":"","revisions_known":"","changelog":"no","extraction_notes":"","v0_rows":"17","v0_card_label":"Gemini 3.1 Pro model card","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-gemini-3-1-flash-lite-model-card","category":"lab_document","lab":"Google DeepMind","title":"Gemini 3.1 Flash-Lite Model Card","doc_type":"model_card","models_covered":"Gemini 3.1 Flash-Lite","published":"2026-03-03","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-1-Flash-Lite-Model-Card.pdf","alt_urls":"","revisions_known":"header says updated May 2026; no changelog","changelog":"no","extraction_notes":"","v0_rows":"6","v0_card_label":"Gemini 3.1 Flash-Lite model card","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-gemini-3-5-flash-model-card","category":"lab_document","lab":"Google DeepMind","title":"Gemini 3.5 Flash Model Card","doc_type":"model_card","models_covered":"Gemini 3.5 Flash","published":"2026-05-19","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-5-Flash-Model-Card.pdf","alt_urls":"","revisions_known":"","changelog":"no","extraction_notes":"FSF inherited from 3.1 Pro plus extra cyber testing","v0_rows":"7","v0_card_label":"Gemini 3.5 Flash model card","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-gemini-3-5-flash-lite-model-card","category":"lab_document","lab":"Google DeepMind","title":"Gemini 3.5 Flash-Lite Model Card","doc_type":"model_card","models_covered":"Gemini 3.5 Flash-Lite","published":"2026-07-21","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-5-Flash-Lite-Model-Card.pdf","alt_urls":"","revisions_known":"","changelog":"no","extraction_notes":"","v0_rows":"6","v0_card_label":"Gemini 3.5 Flash-Lite model card","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-gemini-3-6-flash-model-card","category":"lab_document","lab":"Google DeepMind","title":"Gemini 3.6 Flash Model Card","doc_type":"model_card","models_covered":"Gemini 3.6 Flash","published":"2026-07-21","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-6-Flash-Model-Card.pdf","alt_urls":"","revisions_known":"","changelog":"no","extraction_notes":"Deltas printed as percentage points","v0_rows":"7","v0_card_label":"Gemini 3.6 Flash model card","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-gemini-3-7-flash-model-card","category":"lab_document","lab":"Google DeepMind","title":"Gemini 3.7 Flash Model Card","doc_type":"model_card","models_covered":"Gemini 3.7 Flash","published":"2026-08-13","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-7-Flash-Model-Card.pdf","alt_urls":"https://deepmind.google/models/model-cards/gemini-3-7-flash/","revisions_known":"revision reported by a watchdog; no record found of what changed","changelog":"no","extraction_notes":"","v0_rows":"5","v0_card_label":"Gemini 3.7 Flash model card","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-gemini-3-7-flash-frontier-safety-framework-report","category":"lab_document","lab":"Google DeepMind","title":"Gemini 3.7 Flash Frontier Safety Framework Report","doc_type":"fsf_report","models_covered":"Gemini 3.7 Flash","published":"2026-08-13","url":"https://storage.googleapis.com/deepmind-media/gemini/gemini_3-7_flash_fsf_report.pdf","alt_urls":"","revisions_known":"","changelog":"not_applicable","extraction_notes":"First report under FSF v3.1","v0_rows":"23","v0_card_label":"Gemini 3.7 Flash FSF report","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-gemini-3-8-flash-model-card","category":"lab_document","lab":"Google DeepMind","title":"Gemini 3.8 Flash Model Card","doc_type":"model_card","models_covered":"Gemini 3.8 Flash","published":"2026-09-02","url":"https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-8-Flash-Model-Card.pdf","alt_urls":"https://deepmind.google/models/model-cards/gemini-3-8-flash/","revisions_known":"","changelog":"no","extraction_notes":"FSF inherited from 3.7 Flash","v0_rows":"6","v0_card_label":"Gemini 3.8 Flash model card","last_checked":"2026-09-26"},
{"source_id":"xai-grok-4-model-card","category":"lab_document","lab":"xAI","title":"Grok 4 Model Card","doc_type":"model_card","models_covered":"Grok 4","published":"2025-08-20","url":"https://data.x.ai/2025-08-20-grok-4-model-card.pdf","alt_urls":"","revisions_known":"2025-08-22 mentions of UK AISI removed (per Midas Project); no numeric changes documented","changelog":"no","extraction_notes":"","v0_rows":"17","v0_card_label":"Grok 4 model card","last_checked":"2026-09-26"},
{"source_id":"xai-grok-code-fast-1-model-card","category":"lab_document","lab":"xAI","title":"Grok Code Fast 1 Model Card","doc_type":"model_card","models_covered":"grok-code-fast-1","published":"2025-08-26","url":"https://data.x.ai/2025-08-26-grok-code-fast-1-model-card.pdf","alt_urls":"","revisions_known":"","changelog":"no","extraction_notes":"","v0_rows":"6","v0_card_label":"Grok Code Fast 1 model card","last_checked":"2026-09-26"},
{"source_id":"xai-grok-4-fast-model-card","category":"lab_document","lab":"xAI","title":"Grok 4 Fast Model Card","doc_type":"model_card","models_covered":"Grok 4 Fast","published":"2025-09-19","url":"https://data.x.ai/2025-09-19-grok-4-fast-model-card.pdf","alt_urls":"","revisions_known":"","changelog":"no","extraction_notes":"","v0_rows":"10","v0_card_label":"Grok 4 Fast model card","last_checked":"2026-09-26"},
{"source_id":"xai-grok-4-1-model-card","category":"lab_document","lab":"xAI","title":"Grok 4.1 Model Card","doc_type":"model_card","models_covered":"Grok 4.1","published":"2025-11-17","url":"https://data.x.ai/2025-11-17-grok-4-1-model-card.pdf","alt_urls":"","revisions_known":"","changelog":"no","extraction_notes":"","v0_rows":"14","v0_card_label":"Grok 4.1 model card","last_checked":"2026-09-26"},
{"source_id":"xai-grok-4-20-system-card","category":"lab_document","lab":"xAI","title":"Grok 4.20 System Card","doc_type":"system_card","models_covered":"Grok 4.20","published":"2026-04-07","url":"https://data.x.ai/2026-04-07-grok-4-20-model-card.pdf","alt_urls":"","revisions_known":"","changelog":"no","extraction_notes":"First xAI card with an alignment audit (Petri 2.0)","v0_rows":"18","v0_card_label":"Grok 4.20 system card","last_checked":"2026-09-26"},
{"source_id":"xai-grok-4-5-model-card","category":"lab_document","lab":"xAI","title":"Grok 4.5 Model Card","doc_type":"model_card","models_covered":"Grok 4.5","published":"2026-07-14","url":"https://media.x.ai/v1/website/4p5-5184fdf9.pdf","alt_urls":"https://cursor.com/resources/grok-4-5-model-card.pdf (original version)","revisions_known":"2026-07-20 revision, no changelog; safety values appear unchanged","changelog":"no","extraction_notes":"Metric scales changed from 0–1 rates to percentages","v0_rows":"15","v0_card_label":"Grok 4.5 model card (rev 2026-07-20)|Grok 4.5 model card (original)","last_checked":"2026-09-26"},
{"source_id":"xai-grok-4-6-model-card","category":"lab_document","lab":"xAI","title":"Grok 4.6 Model Card","doc_type":"model_card","models_covered":"Grok 4.6","published":"2026-08-12","url":"https://media.x.ai/v1/website/card-4p6-4cd2dc57.pdf","alt_urls":"https://cursor.com/resources/grok-4-6-model-card.pdf (original version)","revisions_known":"2026-08-17 revision: HackerBench harmful/dual-use 16.7%→6.9%, self-harm 3.7%→0.84%, MASK 3.8%→1.90% (verified); changelog gives no reason","changelog":"partial","extraction_notes":"See also https://www.themidasproject.com/watchtower/xai-08172026","v0_rows":"22","v0_card_label":"Grok 4.6 model card (rev 2026-08-17)|Grok 4.6 model card (original)","last_checked":"2026-09-26"},
{"source_id":"xai-grok-4-7-model-card","category":"lab_document","lab":"xAI","title":"Grok 4.7 Model Card","doc_type":"model_card","models_covered":"Grok 4.7","published":"2026-09-21","url":"https://media.x.ai/v1/website/4p7card-5eccc980.pdf","alt_urls":"https://media.x.ai/v1/website/card4p7-3a96f40b.pdf","revisions_known":"","changelog":"no","extraction_notes":"","v0_rows":"11","v0_card_label":"Grok 4.7 model card","last_checked":"2026-09-26"},
{"source_id":"meta-llama-4-model-card","category":"lab_document","lab":"Meta","title":"Llama 4 Model Card","doc_type":"model_card","models_covered":"Llama 4 Scout; Llama 4 Maverick","published":"2025-04-05","url":"https://github.com/meta-llama/llama-models/blob/main/models/llama4/MODEL_CARD.md","alt_urls":"","revisions_known":"","changelog":"not_applicable","extraction_notes":"No numeric safety results in card","v0_rows":"1","v0_card_label":"Llama 4 model card","last_checked":"2026-09-26"},
{"source_id":"meta-llama-4-launch-post","category":"lab_document","lab":"Meta","title":"Llama 4 launch post","doc_type":"launch_post","models_covered":"Llama 4","published":"2025-04-05","url":"https://ai.meta.com/blog/llama-4-multimodal-intelligence/","alt_urls":"","revisions_known":"","changelog":"not_applicable","extraction_notes":"Refusal and bias percentages","v0_rows":"1","v0_card_label":"Llama 4 launch blog (not card)","last_checked":"2026-09-26"},
{"source_id":"meta-muse-spark-safety-preparedness-report","category":"lab_document","lab":"Meta","title":"Muse Spark Safety & Preparedness Report","doc_type":"safety_report","models_covered":"Muse Spark","published":"2026-04-08","url":"https://ai.meta.com/static-resource/muse-spark-safety-and-preparedness-report/","alt_urls":"","revisions_known":"2026-05-26 instruction-hierarchy comparator scores fixed after a bug","changelog":"partial","extraction_notes":"First report under Meta Advanced AI Scaling Framework v2","v0_rows":"22","v0_card_label":"Muse Spark Safety & Preparedness Report","last_checked":"2026-09-26"},
{"source_id":"meta-muse-spark-1-1-evaluation-report","category":"lab_document","lab":"Meta","title":"Muse Spark 1.1 Evaluation Report","doc_type":"safety_report","models_covered":"Muse Spark 1.1","published":"2026-07-09","url":"https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report/","alt_urls":"","revisions_known":"","changelog":"not_applicable","extraction_notes":"Restates several Muse Spark 1.0 values differently","v0_rows":"10","v0_card_label":"Muse Spark 1.1 Evaluation Report","last_checked":"2026-09-26"},
{"source_id":"meta-muse-glimmer-30b-model-card","category":"lab_document","lab":"Meta","title":"Muse Glimmer-30B model card","doc_type":"model_card","models_covered":"Muse Glimmer-30B","published":"2026-08-10","url":"https://huggingface.co/meta-models/Muse-Glimmer-30B/blob/main/README.md","alt_urls":"","revisions_known":"","changelog":"not_applicable","extraction_notes":"Open weights; limited numbers","v0_rows":"3","v0_card_label":"Muse Glimmer-30B HF model card","last_checked":"2026-09-26"},
{"source_id":"moonshot-ai-kimi-k2-technical-report","category":"lab_document","lab":"Moonshot AI","title":"Kimi K2 technical report","doc_type":"tech_report","models_covered":"Kimi K2","published":"2025-07-28","url":"https://arxiv.org/pdf/2507.20534v1","alt_urls":"","revisions_known":"","changelog":"not_applicable","extraction_notes":"Red-team pass rates","v0_rows":"4","v0_card_label":"Kimi K2 technical report","last_checked":"2026-09-26"},
{"source_id":"moonshot-ai-kimi-k3-technical-report","category":"lab_document","lab":"Moonshot AI","title":"Kimi K3 technical report","doc_type":"tech_report","models_covered":"Kimi K3","published":"2026-07-27","url":"","alt_urls":"","revisions_known":"","changelog":"not_applicable","extraction_notes":"Only secondary summary used (vulnerability discovery); primary not located","v0_rows":"1","v0_card_label":"Kimi K3 technical report","last_checked":"2026-09-26"},
{"source_id":"zhipu-ai-glm-4-5-technical-report","category":"lab_document","lab":"Zhipu AI","title":"GLM-4.5 technical report","doc_type":"tech_report","models_covered":"GLM-4.5","published":"2025-08-08","url":"https://arxiv.org/pdf/2508.06471","alt_urls":"","revisions_known":"","changelog":"not_applicable","extraction_notes":"SafetyBench scores","v0_rows":"2","v0_card_label":"GLM-4.5 technical report","last_checked":"2026-09-26"},
{"source_id":"deepseek-r1-paper-nature-arxiv-v2","category":"lab_document","lab":"DeepSeek","title":"DeepSeek-R1 paper (Nature; arXiv v2)","doc_type":"tech_report","models_covered":"DeepSeek-R1","published":"2025-09-17","url":"https://arxiv.org/html/2501.12948v2","alt_urls":"","revisions_known":"","changelog":"not_applicable","extraction_notes":"Supplementary D.3 safety tables not yet extracted","v0_rows":"1","v0_card_label":"DeepSeek-R1 paper (Nature; arXiv v2)","last_checked":"2026-09-26"},
{"source_id":"anthropic-transparency-hub","category":"lab_summary_page","lab":"Anthropic","title":"Anthropic Transparency Hub","doc_type":"lab_summary_page","models_covered":"","published":"","url":"https://www.anthropic.com/transparency","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Summarizes system-card results; used where card sections were out of reach","v0_rows":"14","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-caylent-com-blog-claude-sonnet-4-6-in-production-capability","category":"secondary_writeup","lab":"","title":"Caylent blog","doc_type":"secondary_writeup","models_covered":"Claude Sonnet 4.6","published":"","url":"https://caylent.com/blog/claude-sonnet-4-6-in-production-capability-safety-and-cost-explained","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"2","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-codersera-com-blog-gpt-6-astra-safety-cyber-capabilities-202","category":"secondary_writeup","lab":"","title":"Codersera blog","doc_type":"secondary_writeup","models_covered":"GPT-6 Astra system card","published":"","url":"https://codersera.com/blog/gpt-6-astra-safety-cyber-capabilities-2026/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"1","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-hugobowne-github-io-mythos-preview-model-card-sources-04a-al","category":"secondary_writeup","lab":"","title":"Mythos Preview system card wiki (hugobowne.github.io)","doc_type":"secondary_writeup","models_covered":"Claude Mythos Preview","published":"","url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04a-alignment-part1","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"18","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-hugobowne-github-io-mythos-preview-model-card-sources-04b-al","category":"secondary_writeup","lab":"","title":"Mythos Preview system card wiki (hugobowne.github.io)","doc_type":"secondary_writeup","models_covered":"Claude Mythos Preview","published":"","url":"https://hugobowne.github.io/mythos-preview-model-card/sources/04b-alignment-part2","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"3","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-neuraltrust-ai-blog-claude-opus-4-6-safety","category":"secondary_writeup","lab":"","title":"NeuralTrust blog","doc_type":"secondary_writeup","models_covered":"Claude Opus 4.6","published":"","url":"https://neuraltrust.ai/blog/claude-opus-4-6-safety","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"3","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-neuraltrust-ai-blog-claude-sonnet-5-security-safety-system-c","category":"secondary_writeup","lab":"","title":"NeuralTrust blog","doc_type":"secondary_writeup","models_covered":"Claude Sonnet 5","published":"","url":"https://neuraltrust.ai/blog/claude-sonnet-5-security-safety-system-card","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"5","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-simonwillison-net-2025-may-25-claude-4-system-card","category":"secondary_writeup","lab":"","title":"Simon Willison’s weblog","doc_type":"secondary_writeup","models_covered":"Claude Opus 4 & Sonnet 4 system card","published":"","url":"https://simonwillison.net/2025/May/25/claude-4-system-card/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"2","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-thezvi-substack-com-p-claude-fable-5-and-mythos-5-the-system","category":"secondary_writeup","lab":"","title":"Zvi Mowshowitz, Don’t Worry About the Vase","doc_type":"secondary_writeup","models_covered":"Claude Fable 5 & Claude Mythos 5","published":"","url":"https://thezvi.substack.com/p/claude-fable-5-and-mythos-5-the-system","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"3","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-thezvi-substack-com-p-claude-mythos-the-system-card","category":"secondary_writeup","lab":"","title":"Zvi Mowshowitz, Don’t Worry About the Vase","doc_type":"secondary_writeup","models_covered":"Claude Mythos Preview","published":"","url":"https://thezvi.substack.com/p/claude-mythos-the-system-card","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"5","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-thezvi-substack-com-p-opus-47-part-1-the-model-card","category":"secondary_writeup","lab":"","title":"Zvi Mowshowitz, Don’t Worry About the Vase","doc_type":"secondary_writeup","models_covered":"Claude Opus 4.7","published":"","url":"https://thezvi.substack.com/p/opus-47-part-1-the-model-card","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"3","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-thezvi-wordpress-com-2025-09-30-claude-sonnet-4-5-system-car","category":"secondary_writeup","lab":"","title":"Zvi Mowshowitz, Don’t Worry About the Vase","doc_type":"secondary_writeup","models_covered":"Claude Sonnet 4.5 system card","published":"","url":"https://thezvi.wordpress.com/2025/09/30/claude-sonnet-4-5-system-card-and-alignment/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"3","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-thezvi-wordpress-com-2025-11-28-claude-opus-4-5-model-card-a","category":"secondary_writeup","lab":"","title":"Zvi Mowshowitz, Don’t Worry About the Vase","doc_type":"secondary_writeup","models_covered":"Claude Opus 4.5 system card","published":"","url":"https://thezvi.wordpress.com/2025/11/28/claude-opus-4-5-model-card-alignment-and-safety/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"9","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-thezvi-wordpress-com-2026-02-09-claude-opus-4-6-system-card","category":"secondary_writeup","lab":"","title":"Zvi Mowshowitz, Don’t Worry About the Vase","doc_type":"secondary_writeup","models_covered":"Claude Opus 4.6","published":"","url":"https://thezvi.wordpress.com/2026/02/09/claude-opus-4-6-system-card-part-1-mundane-alignment-and-model-welfare/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"4","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-thezvi-wordpress-com-2026-02-10-claude-opus-4-6-system-card","category":"secondary_writeup","lab":"","title":"Zvi Mowshowitz, Don’t Worry About the Vase","doc_type":"secondary_writeup","models_covered":"Claude Opus 4.6","published":"","url":"https://thezvi.wordpress.com/2026/02/10/claude-opus-4-6-system-card-part-2-frontier-alignment/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"1","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-thezvi-wordpress-com-2026-05-29-claude-opus-4-8-the-system-c","category":"secondary_writeup","lab":"","title":"Zvi Mowshowitz, Don’t Worry About the Vase","doc_type":"secondary_writeup","models_covered":"Claude Opus 4.8","published":"","url":"https://thezvi.wordpress.com/2026/05/29/claude-opus-4-8-the-system-card/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"6","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-thezvi-wordpress-com-2026-07-25-claude-opus-5-the-system-car","category":"secondary_writeup","lab":"","title":"Zvi Mowshowitz, Don’t Worry About the Vase","doc_type":"secondary_writeup","models_covered":"Claude Opus 5","published":"","url":"https://thezvi.wordpress.com/2026/07/25/claude-opus-5-the-system-card/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"2","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-thezvi-wordpress-com-2026-09-04-claude-fable-5-1-and-mythos","category":"secondary_writeup","lab":"","title":"Zvi Mowshowitz, Don’t Worry About the Vase","doc_type":"secondary_writeup","models_covered":"Claude Fable 5.1 & Claude Mythos 5.1","published":"","url":"https://thezvi.wordpress.com/2026/09/04/claude-fable-5-1-and-mythos-5-1-the-system-card/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"4","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-thezvi-wordpress-com-2026-09-09-gpt-6-astra-the-system-card","category":"secondary_writeup","lab":"","title":"Zvi Mowshowitz, Don’t Worry About the Vase","doc_type":"secondary_writeup","models_covered":"GPT-6 Astra system card","published":"","url":"https://thezvi.wordpress.com/2026/09/09/gpt-6-astra-the-system-card-alignment-and-what-comes-next/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"2","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-thezvi-wordpress-com-2026-09-23-claude-opus-5-5-the-system-c","category":"secondary_writeup","lab":"","title":"Zvi Mowshowitz, Don’t Worry About the Vase","doc_type":"secondary_writeup","models_covered":"Claude Opus 5.5","published":"","url":"https://thezvi.wordpress.com/2026/09/23/claude-opus-5-5-the-system-card/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"5","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-www-greaterwrong-com-posts-4yn8b8p2yiouxlaby-claude-sonnet-4","category":"secondary_writeup","lab":"","title":"Zvi Mowshowitz (LessWrong mirror)","doc_type":"secondary_writeup","models_covered":"Claude Sonnet 4.5 system card","published":"","url":"https://www.greaterwrong.com/posts/4yn8B8p2YiouxLABy/claude-sonnet-4-5-system-card-and-alignment","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"5","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-www-quentir-ai-blog-2026-gpt-6-astra-critical-cyber-prepared","category":"secondary_writeup","lab":"","title":"Quentir blog","doc_type":"secondary_writeup","models_covered":"GPT-6 Astra system card","published":"","url":"https://www.quentir.ai/blog/2026/gpt-6-astra-critical-cyber-preparedness-framework-3-september-2026-eu-ai-act-article-55-sb-53","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"1","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-www-thestack-technology-claude-4-of-blackmail-bioweapons-and","category":"secondary_writeup","lab":"","title":"The Stack","doc_type":"secondary_writeup","models_covered":"Claude Opus 4 & Sonnet 4 system card","published":"","url":"https://www.thestack.technology/claude-4-of-blackmail-bioweapons-and-bad-code/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"1","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-www-transformernews-ai-p-claude-sonnet-4-5-evaluation-situat","category":"secondary_writeup","lab":"","title":"Transformer","doc_type":"secondary_writeup","models_covered":"Claude Sonnet 4.5 system card","published":"","url":"https://www.transformernews.ai/p/claude-sonnet-4-5-evaluation-situational-awareness","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"1","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"sec-zentor-ai-blog-kimi-k3-technical-report","category":"secondary_writeup","lab":"","title":"Zentor blog","doc_type":"secondary_writeup","models_covered":"Kimi K3 technical report","published":"","url":"https://zentor.ai/blog/kimi-k3-technical-report","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Used only where the card section was out of reach; rows marked source_type=secondary; replace with card values in v1","v0_rows":"1","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"anthropic-system-cards-index","category":"lab_index_to_monitor","lab":"Anthropic","title":"Anthropic system cards index","doc_type":"index","models_covered":"","published":"","url":"https://www.anthropic.com/system-cards","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Check for new or revised documents on every refresh","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"openai-deployment-safety-hub","category":"lab_index_to_monitor","lab":"OpenAI","title":"OpenAI Deployment Safety Hub","doc_type":"index","models_covered":"","published":"","url":"https://deploymentsafety.openai.com/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Check for new or revised documents on every refresh","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"google-deepmind-model-cards-index","category":"lab_index_to_monitor","lab":"Google DeepMind","title":"Google DeepMind model cards index","doc_type":"index","models_covered":"","published":"","url":"https://deepmind.google/models/model-cards/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Check for new or revised documents on every refresh","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"xai-model-card-files-data-x-ai-media-x-ai","category":"lab_index_to_monitor","lab":"xAI","title":"xAI model card files (data.x.ai / media.x.ai)","doc_type":"index","models_covered":"","published":"","url":"https://data.x.ai/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Check for new or revised documents on every refresh","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"meta-ai-research-resources","category":"lab_index_to_monitor","lab":"Meta","title":"Meta AI research resources","doc_type":"index","models_covered":"","published":"","url":"https://ai.meta.com/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Check for new or revised documents on every refresh","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-openai-o3-mini-system-card-2025-01-31","category":"backlog_to_review","lab":"OpenAI","title":"o3-mini system card (2025-01-31)","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"not collected in v0","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-openai-operator-system-card-2025-01-23","category":"backlog_to_review","lab":"OpenAI","title":"Operator system card (2025-01-23)","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"not collected in v0","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-openai-deep-research-system-card-2025-02-25","category":"backlog_to_review","lab":"OpenAI","title":"Deep research system card (2025-02-25)","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"not collected in v0","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-openai-gpt-4-5-system-card-2025-02-27","category":"backlog_to_review","lab":"OpenAI","title":"GPT-4.5 system card (2025-02-27)","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"not collected in v0","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-openai-codex-1-addendum-2025-05-16","category":"backlog_to_review","lab":"OpenAI","title":"codex-1 addendum (2025-05-16)","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"not collected in v0","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-openai-chatgpt-agent-system-card-2025-07-17","category":"backlog_to_review","lab":"OpenAI","title":"ChatGPT agent system card (2025-07-17)","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"not collected in v0","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-openai-gpt-5-sensitive-conversations-addendum-2025-10-27","category":"backlog_to_review","lab":"OpenAI","title":"GPT-5 sensitive-conversations addendum (2025-10-27)","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"not collected in v0","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-openai-sora-2-system-card-2025-09-30","category":"backlog_to_review","lab":"OpenAI","title":"Sora 2 system card (2025-09-30)","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"not collected in v0","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-openai-gpt-oss-safeguard-report-2025-10-29","category":"backlog_to_review","lab":"OpenAI","title":"gpt-oss-safeguard report (2025-10-29)","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"not collected in v0","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-anthropic-claude-opus-4-6-sabotage-risk-report","category":"backlog_to_review","lab":"Anthropic","title":"Claude Opus 4.6 Sabotage Risk Report","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"holds Opus 4.6 sabotage figures","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-anthropic-august-2026-risk-report","category":"backlog_to_review","lab":"Anthropic","title":"August 2026 Risk Report","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"referenced by Fable 5.1 card","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-google-deepmind-gemini-2-5-flash-lite-model-card","category":"backlog_to_review","lab":"Google DeepMind","title":"Gemini 2.5 Flash-Lite model card","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"has safety delta table; not extracted","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-google-deepmind-gemini-2-5-computer-use-model-card","category":"backlog_to_review","lab":"Google DeepMind","title":"Gemini 2.5 Computer Use model card","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"no numeric safety results found","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-google-deepmind-gemini-omni-flash-model-card-2026-08-27","category":"backlog_to_review","lab":"Google DeepMind","title":"Gemini Omni Flash model card (2026-08-27)","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"no safety table found","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-deepseek-deepseek-v4-technical-report-and-model-card","category":"backlog_to_review","lab":"DeepSeek","title":"DeepSeek-V4 technical report and model card","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"no safety numbers found","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-alibaba-qwen3-technical-report-qwen3-6-27b-model-card","category":"backlog_to_review","lab":"Alibaba","title":"Qwen3 technical report; Qwen3.6-27B model card","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"no safety numbers found","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-moonshot-ai-kimi-k2-5-model-card","category":"backlog_to_review","lab":"Moonshot AI","title":"Kimi K2.5 model card","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"no safety numbers found","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-zhipu-ai-glm-5-glm-5-3-reports","category":"backlog_to_review","lab":"Zhipu AI","title":"GLM-5 / GLM-5.3 reports","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"no safety numbers found; GLM-5.3 weights held pending safety evaluation","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-third-party-uk-aisi-and-us-caisi-evaluations-of-open-weight-models-kimi-","category":"backlog_to_review","lab":"Third party","title":"UK AISI and US CAISI evaluations of open-weight models (Kimi K3, DeepSeek V4 Pro)","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"third-party evaluations; candidate for a separate evaluator category","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-third-party-saferai-evaluation-of-glm-5-2","category":"backlog_to_review","lab":"Third party","title":"SaferAI evaluation of GLM-5.2","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"third-party; candidate","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"backlog-third-party-anthropic-agentic-misalignment-in-summer-2026-cross-lab-stud","category":"backlog_to_review","lab":"Third party","title":"Anthropic “Agentic Misalignment in Summer 2026” cross-lab study","doc_type":"","models_covered":"","published":"","url":"","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"https://alignment.anthropic.com/2026/agentic-misalignment-summer-2026/ ; cross-lab numbers, candidate","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"model-cards-by-free-systems-stanford","category":"related_project","lab":"","title":"Model Cards by Free Systems (Stanford)","doc_type":"","models_covered":"","published":"","url":"https://modelcards.freesystems.net/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Catalogs which tests labs report (541 tests, 28 models, 9 labs); no results, no download; launched Sep 2026. Potential collaborator.","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"systemcards-org-cardtrack","category":"related_project","lab":"","title":"systemcards.org / cardtrack","doc_type":"","models_covered":"","published":"","url":"https://github.com/DouwMarx/cardtrack","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Daily archive of 280+ cards with version history; no numbers. Candidate upstream for version detection.","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"every-eval-ever-evaleval-coalition","category":"related_project","lab":"","title":"Every Eval Ever (EvalEval Coalition)","doc_type":"","models_covered":"","published":"","url":"https://github.com/evaleval/every_eval_ever","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Open schema + HF datastore with provenance fields; mostly capability benchmarks. Candidate export format.","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"cais-ai-dashboard","category":"related_project","lab":"","title":"CAIS AI Dashboard","doc_type":"","models_covered":"","published":"","url":"https://dashboard.safe.ai/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Composite risk index across frontier models.","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"midas-project-watchtower","category":"related_project","lab":"","title":"Midas Project Watchtower","doc_type":"","models_covered":"","published":"","url":"https://www.themidasproject.com/watchtower","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Logs changes to lab policies and cards in prose; alert source for revisions.","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"metr-frontier-risk-report-feb-mar-2026","category":"related_project","lab":"","title":"METR Frontier Risk Report (Feb–Mar 2026)","doc_type":"","models_covered":"","published":"","url":"https://metr.org/blog/2026-05-19-frontier-risk-report/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Cross-lab risk report with incident database.","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"metr-investigating-ai-propensities-after-incidents","category":"related_project","lab":"","title":"METR: investigating AI propensities after incidents","doc_type":"","models_covered":"","published":"","url":"https://metr.org/blog/2026-07-28-investigating-ai-propensities-after-incidents/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Incident investigation method.","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"metr-frontier-ai-safety-regulations-reference","category":"related_project","lab":"","title":"METR: Frontier AI safety regulations reference","doc_type":"","models_covered":"","published":"","url":"https://metr.org/notes/2026-01-29-frontier-ai-safety-regulations/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"SB 53, RAISE Act, IL SB 315, EU AI Act obligations.","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"epoch-ai-data-hub","category":"related_project","lab":"","title":"Epoch AI data hub","doc_type":"","models_covered":"","published":"","url":"https://epoch.ai/data","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Design and data-publishing reference; no safety datasets.","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"ai-lab-watch","category":"related_project","lab":"","title":"AI Lab Watch","doc_type":"","models_covered":"","published":"","url":"https://ailabwatch.org/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Lab scorecard; unmaintained since late 2025 per our survey.","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"fli-ai-safety-index-summer-2026","category":"related_project","lab":"","title":"FLI AI Safety Index (Summer 2026)","doc_type":"","models_covered":"","published":"","url":"https://futureoflife.org/ai-safety-index-summer-2026/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Letter grades; no per-metric dataset.","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"},
{"source_id":"ai-futures-project-blog","category":"related_project","lab":"","title":"AI Futures Project blog","doc_type":"","models_covered":"","published":"","url":"https://blog.aifutures.org/","alt_urls":"","revisions_known":"","changelog":"","extraction_notes":"Context for why the hinge variables matter.","v0_rows":"","v0_card_label":"","last_checked":"2026-09-26"}
]
}
}
