{
  "title": "Alpha Frontier Lab Benchmark · Public Evidence Edition",
  "version": "0.1.0-public-evidence",
  "snapshotDate": "2026-08-16",
  "alphaRatingStatus": "not_an_alpha_rating",
  "missingDataPolicy": "not_rated",
  "method": {
    "chartXAxis": "Highest scored model for each lab in the downloaded Epoch Capabilities Index data",
    "chartYAxis": "Future of Life Institute Summer 2026 AI Safety Index overall score",
    "separateMeasures": [
      "METR Time Horizon 1.1 p80 hours",
      "Stanford December 2025 Foundation Model Transparency Index score"
    ],
    "aggregation": "none"
  },
  "records": [
    {
      "lab": "Anthropic",
      "country": "United States",
      "epochEci": 161.53,
      "epochModel": "Claude Fable 5 (high)",
      "epochModelReleaseDate": "2026-06-09",
      "epochConfidence": "Confident",
      "fliSafetyScore": 2.66,
      "fliGrade": "C+",
      "stanfordTransparencyScore": 46,
      "metrP80Hours": 185.911829,
      "metrP50Hours": 1044.780145,
      "metrModel": "claude-mythos-preview-early"
    },
    {
      "lab": "OpenAI",
      "country": "United States",
      "epochEci": 161.65,
      "epochModel": "GPT-5.6 Sol (medium)",
      "epochModelReleaseDate": "2026-07-09",
      "epochConfidence": "Confident",
      "fliSafetyScore": 2.28,
      "fliGrade": "C",
      "stanfordTransparencyScore": 35,
      "metrP80Hours": 66.002649,
      "metrP50Hours": 352.249302,
      "metrModel": "gpt-5.2-2025-12-11_high"
    },
    {
      "lab": "Google DeepMind",
      "country": "United States",
      "epochEci": 154.75,
      "epochModel": "Gemini 3.1 Pro Preview",
      "epochModelReleaseDate": "2026-02-19",
      "epochConfidence": "Likely",
      "fliSafetyScore": 2.01,
      "fliGrade": "C",
      "stanfordTransparencyScore": 41,
      "metrP80Hours": 89.801503,
      "metrP50Hours": 384.147435,
      "metrModel": "gemini-3.1-pro-preview"
    },
    {
      "lab": "Meta",
      "country": "United States",
      "epochEci": 154.75,
      "epochModel": "Muse Spark 1.1 (high)",
      "epochModelReleaseDate": "2026-07-09",
      "epochConfidence": "Confident",
      "fliSafetyScore": 1.32,
      "fliGrade": "D+",
      "stanfordTransparencyScore": 31,
      "metrP80Hours": null,
      "metrP50Hours": null,
      "metrModel": null
    },
    {
      "lab": "Z.ai",
      "country": "China",
      "epochEci": 152.21,
      "epochModel": "GLM-5.2",
      "epochModelReleaseDate": "2026-06-16",
      "epochConfidence": "Confident",
      "fliSafetyScore": 0.88,
      "fliGrade": "D-",
      "stanfordTransparencyScore": null,
      "metrP80Hours": null,
      "metrP50Hours": null,
      "metrModel": null
    },
    {
      "lab": "Alibaba Cloud",
      "country": "China",
      "epochEci": 156.05,
      "epochModel": "Qwen3.8 Max (xhigh)",
      "epochModelReleaseDate": "2026-08-02",
      "epochConfidence": "Confident",
      "fliSafetyScore": 0.87,
      "fliGrade": "D-",
      "stanfordTransparencyScore": 26,
      "metrP80Hours": null,
      "metrP50Hours": null,
      "metrModel": null
    },
    {
      "lab": "xAI",
      "country": "United States",
      "epochEci": 154.02,
      "epochModel": "Grok 4.5 (high)",
      "epochModelReleaseDate": "2026-07-08",
      "epochConfidence": "Likely",
      "fliSafetyScore": 0.65,
      "fliGrade": "F",
      "stanfordTransparencyScore": 14,
      "metrP80Hours": null,
      "metrP50Hours": null,
      "metrModel": null
    },
    {
      "lab": "DeepSeek",
      "country": "China",
      "epochEci": 152.53,
      "epochModel": "DeepSeek V4 Flash 0731 (max)",
      "epochModelReleaseDate": "2026-07-31",
      "epochConfidence": "Likely",
      "fliSafetyScore": 0.47,
      "fliGrade": "F",
      "stanfordTransparencyScore": 32,
      "metrP80Hours": null,
      "metrP50Hours": null,
      "metrModel": null
    },
    {
      "lab": "Mistral",
      "country": "France",
      "epochEci": 142.64,
      "epochModel": "Mistral Medium 3.5",
      "epochModelReleaseDate": "2026-04-28",
      "epochConfidence": "Confident",
      "fliSafetyScore": 0.33,
      "fliGrade": "F",
      "stanfordTransparencyScore": 18,
      "metrP80Hours": null,
      "metrP50Hours": null,
      "metrModel": null
    }
  ],
  "sources": [
    {
      "name": "Epoch AI · Epoch Capabilities Index",
      "url": "https://epoch.ai/data/eci-documentation",
      "status": "used",
      "coverage": "9 of 9 labs"
    },
    {
      "name": "Future of Life Institute · AI Safety Index",
      "url": "https://futureoflife.org/ai-safety-index-summer-2026/",
      "status": "used",
      "coverage": "9 of 9 labs"
    },
    {
      "name": "METR · Time Horizon 1.1",
      "url": "https://metr.org/time-horizons/",
      "status": "used",
      "coverage": "3 of 9 labs"
    },
    {
      "name": "Stanford CRFM · Foundation Model Transparency Index",
      "url": "https://crfm.stanford.edu/fmti/",
      "status": "used",
      "coverage": "8 of 9 labs"
    },
    {
      "name": "Artificial Analysis · Intelligence and Agentic Indices",
      "url": "https://artificialanalysis.ai/methodology/intelligence-benchmarking",
      "status": "reviewed_not_scored",
      "coverage": "Method reviewed; scores withheld pending authenticated data feed"
    }
  ]
}
