Skip to content

Run

6 emulators 601 tests

Results as of this run. The arrow shows each target's movement since the previous run it was tested in. The suite grew this run, so an upward arrow can be the new tests biting rather than a target getting worse.

When this run was published the board led with a single correctness percentage. The figures here are that run's own results restated as divergence and coverage, so they read differently from what this page showed at the time. The changelog has the change.

Suite grew from 572 to 601 tests this run.

That's 29 new tests measured against every target. Movement below compares to the previous run, so a rise here is as likely to be the stricter suite as a real regression.

What changed in the suite this run

Suite on

Grew to 601 tests, up 29, and every new test landed in Tier 3: a broader strict surface spanning validation ordering, exact error messages, service limits, and the legacy request shapes. Floci and Ministack were added to the run as targets the same day.

  1. live (AWS)

    Runs via: AWS service

    Grade baseline

    no divergence in all 33 regions · covers 100.0% of the suite

    ground truth
    Tier breakdown
    Tier 1 · Core 0.0% diverges
    100.0% covered
    Tier 2 · Complete 0.0% diverges
    100.0% covered
    Tier 3 · Strict 0.0% diverges
    100.0% covered
  2. -

    Runs via: npx, Docker, Homebrew, binary, npm, cargo, embedded, GitHub Action, source

    Disclosure: maintained by this board's author

    Grade A+

    no divergence · covers 100.0% of the suite

    diverged 1.0 percentage points less
    Tier breakdown
    Tier 1 · Core 0.0% diverges
    100.0% covered
    Tier 2 · Complete 0.0% diverges
    100.0% covered
    Tier 3 · Strict 0.0% diverges
    100.0% covered
  3. -

    Runs via: Docker, pip, Homebrew, binary

    Grade B

    moderate divergence (11.0%) · covers 100.0% of the suite

    diverged 3.3 percentage points more
    Tier breakdown
    Tier 1 · Core 1.0% diverges
    100.0% covered
    Tier 2 · Complete 3.9% diverges
    100.0% covered
    Tier 3 · Strict 30.3% diverges
    100.0% covered
  4. -

    Runs via: Docker, JAR, Maven

    Grade B

    moderate divergence (11.8%) · covers 100.0% of the suite

    diverged 3.2 percentage points more
    Tier breakdown
    Tier 1 · Core 1.0% diverges
    100.0% covered
    Tier 2 · Complete 8.7% diverges
    100.0% covered
    Tier 3 · Strict 30.3% diverges
    100.0% covered
  5. Grade C

    moderate divergence (14.8%) · covers 92.8% of the suite · coverage lowers this row to C

    diverged 2.2 percentage points more
    Tier breakdown
    Tier 1 · Core 1.7% diverges
    100.0% covered
    Tier 2 · Complete 48.5% diverges
    58.3% covered 43 unsupported
    Tier 3 · Strict 17.4% diverges
    100.0% covered
  6. Grade F

    severe divergence (36.4%) · covers 97.0% of the suite

    new
    Tier breakdown
    Tier 1 · Core 14.9% diverges
    100.0% covered
    Tier 2 · Complete 24.3% diverges
    82.5% covered 18 unsupported
    Tier 3 · Strict 76.4% diverges
    100.0% covered
  7. Runs via: Docker, Homebrew, install script, Scoop, binary, JAR

    Grade F

    severe divergence (37.1%) · covers 95.8% of the suite

    new
    Tier breakdown
    Tier 1 · Core 21.8% diverges
    100.0% covered
    Tier 2 · Complete 11.7% diverges
    75.7% covered 25 unsupported
    Tier 3 · Strict 74.4% diverges
    100.0% covered