{
  "format": "neural-download-model-family-v1",
  "id": "ornith-1-5",
  "primary_packet_id": "ornith-15-35b-a3b-q4km-b70",
  "name": "Ornith 1.5",
  "display_name": "Ornith 1.5 · dense 9B + MoE 35B-A3B",
  "publisher": "Ornith AI",
  "updated_at": "2026-08-23",
  "summary": "Ornith AI's Ornith 1.5 line: a dense 9B and a 35B mixture-of-experts (about 3B active per word), both Qwen-derived. The 35B is the fastest single-card model this lab has measured; the 9B is a smaller stock deployment.",
  "architecture": {
    "class": "Qwen3.5-derived sibling architectures",
    "model_type": "qwen35 (dense 9B) / qwen35moe (35B-A3B MoE)",
    "variants": [
      {
        "id": "ornith-1.5-9b",
        "class": "qwen35",
        "design": "dense",
        "layers": 32,
        "hidden_size": 4096,
        "native_context_tokens": 262144,
        "evidence": "repro/ornith-15-9b-q8-b70/README.md"
      },
      {
        "id": "ornith-1.5-35b-a3b",
        "class": "qwen35moe",
        "design": "mixture of experts",
        "layers": 41,
        "hidden_size": 2048,
        "attention_heads": 16,
        "kv_heads": 2,
        "experts": 256,
        "experts_used": 8,
        "native_context_tokens": 262144,
        "evidence": "repro/ornith-15-35b-a3b-q4km-b70/README.md"
      }
    ],
    "evidence": "packages/README.md"
  },
  "weight_revisions": [
    {
      "id": "ornith-1.5",
      "label": "Ornith 1.5",
      "role": "publisher release line containing architecture-distinct siblings",
      "model_manifest": "packages/README.md"
    }
  ],
  "model_variants": [
    {
      "id": "ornith-1.5-9b",
      "label": "Ornith 1.5 9B",
      "role": "dense sibling",
      "model_manifest": "repro/ornith-15-9b-q8-b70/model-manifest.json"
    },
    {
      "id": "ornith-1.5-35b-a3b",
      "label": "Ornith 1.5 35B-A3B",
      "role": "MoE sibling",
      "model_manifest": "repro/ornith-15-35b-a3b-q4km-b70/model-manifest.json"
    }
  ],
  "transfer_scope": {
    "status": "Publisher/version grouping only: the dense qwen35 9B and qwen35moe 35B-A3B variants are architecture-distinct, so no model-specific kernel, speed, output, or quality transfer is implied.",
    "transfers": [
      "the generic artifact-verification workflow",
      "the fixed cache-zero serving benchmark and objective-canary protocol"
    ],
    "does_not_transfer": [
      "the 35B-A3B MoE patch stack to the dense 9B graph",
      "benchmark speed between the Q8_0 dense and Q4_K_M MoE variants",
      "output or quality decisions between artifacts",
      "two-card behavior or context performance between architectures"
    ],
    "evidence": "packages/README.md"
  },
  "model_signals": {
    "b70_fit": {
      "band": "high",
      "scope": "local-llm-on-b70",
      "basis": "Both measured artifacts fit and serve target-only on one 32 GiB B70; the 9B packet is stock upstream and the 35B-A3B packet carries its own model-specific patch stack.",
      "reviewed_at": "2026-08-23"
    },
    "quality_evidence": {
      "band": "strong-scoped-deployment-evidence",
      "scope": "objective self-consistency and canary evidence for each exact model/quant/runtime packet; not cross-model oracle equality or a general intelligence score",
      "evidence": [
        "repro/ornith-15-9b-q8-b70/README.md",
        "repro/ornith-15-35b-a3b-q4km-b70/README.md",
        "experiments/ornith-15-b70/data/2026-08-23-ornith35b-copy-offload-summary.json"
      ]
    },
    "popularity": {
      "state": "repository-snapshots-only",
      "captured_at": "2026-08-22T02:47:17Z",
      "reason": "The two official-publisher quant repositories have separate snapshots; they are not summed into a family popularity score.",
      "snapshots": [
        {
          "repo_id": "ornith-ai/Ornith-1.5-35B-A3B-GGUF",
          "downloads": 123237,
          "likes": 208,
          "trending_score": 199
        },
        {
          "repo_id": "ornith-ai/Ornith-1.5-9B-GGUF",
          "downloads": 115365,
          "likes": 139,
          "trending_score": 130
        }
      ],
      "evidence": "model-intake/catalog.json"
    }
  },
  "dimensions": {
    "model_variant": [
      "Ornith 1.5 9B dense",
      "Ornith 1.5 35B-A3B MoE"
    ],
    "weight_quantization": [
      "Q8_0",
      "Q4_K_M"
    ],
    "runtime": [
      "llama.cpp SYCL"
    ],
    "cards": [
      1,
      2
    ],
    "split_mode": [
      "single device",
      "layer"
    ],
    "mtp": [
      0
    ],
    "active_context_tokens": [
      0,
      2048,
      4096,
      8192,
      16384,
      24576,
      32768
    ],
    "configured_max_context_tokens": [
      8192,
      65536
    ],
    "concurrent_sequences": [1, 2, 4, 8, 16, 32],
    "native_context_tokens": [
      262144
    ],
    "graph": [
      "off"
    ],
    "kv": [
      "f16"
    ]
  },
  "packets": [
    {
      "id": "ornith-15-9b-q8-b70",
      "label": "Ornith 1.5 9B dense · Q8_0 · one B70",
      "revision": "ornith-1.5-9b",
      "quantization": "Q8_0",
      "runtime": "llama.cpp SYCL",
      "cards": 1,
      "status": "candidate",
      "evidence_level": "B70-verified",
      "grades": {
        "evidence": {
          "grade": "C",
          "scope": "Ornith 1.5 9B Q8_0 stock llama.cpp/SYCL one-card deployment",
          "basis": "two complete fresh-server 12-prompt/six-class, 512-cap, cache-zero runs and both objective-canary batteries are retained, but complete token arrays matched only 8/12 across servers; the serving rates are scoped diagnostics and no strict headline is assigned",
          "reviewed_at": "2026-08-27",
          "evidence": [
            "repro/ornith-15-9b-q8-b70/README.md",
            "repro/ornith-15-9b-q8-b70/ornith-15-9b-q8.sweep.json",
            "data/2026-08-27-ornith15-9b-q8-tp1-strict-headline-comparison.json"
          ]
        }
      },
      "coverage": [
        "decode",
        "prefill",
        "context through 32K",
        "quality",
        "recipe"
      ],
      "projection": {
        "model": "ornith_1.5_9b",
        "quant": "Q8_0",
        "runtime": "llama_cpp",
        "spec": "none"
      , "prompt_tokens": 128, "output_tokens": 100},
      "manifest": "packages/ornith-15-9b-q8-b70/package.json"
    },
    {
      "id": "ornith-15-35b-a3b-q4km-b70",
      "label": "Ornith 1.5 35B-A3B MoE · Q4_K_M · one B70",
      "revision": "ornith-1.5-35b-a3b",
      "quantization": "Q4_K_M",
      "runtime": "llama.cpp SYCL",
      "cards": 1,
      "status": "candidate",
      "evidence_level": "B70-verified",
      "grades": {
        "evidence": {
          "grade": "B",
          "scope": "Ornith 1.5 35B-A3B Q4_K_M twelve-feature one-card optimization packet",
          "basis": "the complete patch and binaries are hashed, the final incremental door has mirrored engine and fresh-server A/B evidence, every candidate and control row was cache-zero, the canonical 128-token transcript was byte-identical across 5,080 candidate hits, objective canaries passed, and the current seven-point 0–32K profile was measured directly; clean-host replay and cross-process output determinism remain open",
          "reviewed_at": "2026-08-23",
          "evidence": [
            "experiments/ornith-15-b70/data/2026-08-23-ornith35b-shared-gate-residual-rms-summary.json",
            "experiments/ornith-15-b70/data/2026-08-23-ornith35b-shared-gate-residual-rms-exactness.json",
            "repro/ornith-15-35b-a3b-q4km-b70/ornith-15-35b-a3b-q4km-twelve-feature.sweep.json",
            "patches/ornith-15-35b-a3b-q4km-b70/llama-cpp-ornith15-twelve-feature-stack-shared-gate-residual-rms-20260823.patch"
          ]
        }
      },
      "coverage": [
        "decode",
        "prefill",
        "context through 32K",
        "quality",
        "patched recipe"
      ],
      "projection": {
        "model": "ornith_1.5_35b_a3b",
        "quant": "Q4_K_M",
        "runtime": "llama_cpp",
        "spec": "none"
      , "prompt_tokens": 128, "output_tokens": 100},
      "manifest": "packages/ornith-15-35b-a3b-q4km-b70/package.json"
    }
  ],
  "run_measurements": [
    {
      "id": "ornith-9b-standard-one-card",
      "state": "lab-measured",
      "revision": "ornith-1.5-9b",
      "variant": "Q8_0 dense",
      "runtime": "llama.cpp SYCL 9fee29e",
      "config": {
        "model_size_b": 9,
        "cards": 1,
        "profile_id": "ornith-9b-q8-stock-8k",
        "split_mode": "single device",
        "mtp": 0,
        "graph": "off",
        "kv": "f16",
        "configured_max_context_tokens": 8192
      },
      "workload": "two fresh-server runs of the complete 12-prompt/six-class suite; 512-token cap; class-balanced 100-event/99-interval decode; target-only; cache zero",
      "metrics": {
        "decode_tok_s": [
          49.593582386789734,
          49.51586866321264
        ]
      },
      "quality": "both workload/cache and objective-canary gates passed, but complete natural-response token arrays matched only 8/12 across fresh servers; strict headline withheld",
      "evidence": "data/2026-08-27-ornith15-9b-q8-tp1-strict-headline-comparison.json"
    },
    {
      "id": "ornith-35b-optimized-one-card",
      "state": "lab-measured",
      "revision": "ornith-1.5-35b-a3b",
      "variant": "Q4_K_M MoE eleven-feature stack plus copy-offload setting",
      "runtime": "llama.cpp SYCL 9fee29e plus lab patch",
      "config": {
        "model_size_b": 35,
        "cards": 1,
        "profile_id": "ornith-35b-q4-eleven-feature-copyoff-8k",
        "split_mode": "single device",
        "mtp": 0,
        "graph": "off",
        "kv": "f16",
        "configured_max_context_tokens": 8192
      },
      "workload": "two fresh-server runs of the 12-prompt suite, up-to-512-token responses, legacy 100-event numerator compatibility median over the 99-interval elapsed window, target-only, cache zero; retained under its original stable measurement ID",
      "metrics": {
        "decode_tok_s": [
          130.159639,
          128.977294
        ]
      },
      "conventional_metrics": {
        "decode_tok_s": [
          128.8580426010522,
          127.68752111614396
        ],
        "accounting": "preferred conventional 99-interval rate from the same physical run arms"
      },
      "quality": "same-frozen-binary patch exactness and objective canary gates passed; stock fresh processes were already output-nondeterministic",
      "evidence": "experiments/ornith-15-b70/data/2026-08-23-ornith35b-copy-offload-summary.json"
    },
    {
      "id": "ornith-35b-twelve-feature-copyoff-one-card",
      "state": "lab-measured",
      "revision": "ornith-1.5-35b-a3b",
      "variant": "Q4_K_M MoE twelve-feature stack plus copy-offload setting",
      "runtime": "llama.cpp SYCL 9fee29e plus lab patch",
      "config": {
        "model_size_b": 35,
        "cards": 1,
        "profile_id": "ornith-35b-q4-twelve-feature-8k",
        "split_mode": "single device",
        "mtp": 0,
        "graph": "off",
        "kv": "f16",
        "configured_max_context_tokens": 8192
      },
      "workload": "two fresh-server candidate runs from the matched A/B/B/A program, fixed 12-prompt suite, up-to-512-token responses, conventional 99-interval median, target-only, cache zero",
      "metrics": {
        "decode_tok_s": [
          130.45137082384383,
          132.46909033578714
        ]
      },
      "compatibility_metrics": {
        "decode_tok_s": [
          131.76906143822612,
          133.80716195534055
        ],
        "accounting": "legacy 100-event numerator over the same 99-interval elapsed window; retained but not used as the site headline"
      },
      "quality": "all candidate and control rows reported cached_tokens=0 and passed final gates; the same-frozen-binary 128-token transcript was byte-identical across 5,080 candidate hits; objective canaries passed, while stock cross-process output nondeterminism remains disclosed",
      "evidence": "experiments/ornith-15-b70/data/2026-08-23-ornith35b-shared-gate-residual-rms-summary.json"
    },
    {
      "id": "ornith-35b-stock-one-card",
      "state": "lab-measured",
      "revision": "ornith-1.5-35b-a3b",
      "variant": "Q4_K_M MoE stock",
      "runtime": "llama.cpp SYCL 9fee29e",
      "config": {
        "cards": 1,
        "profile_id": "ornith-35b-q4-stock-8k",
        "split_mode": "single device",
        "mtp": 0,
        "graph": "off",
        "kv": "f16",
        "configured_max_context_tokens": 8192
      },
      "workload": "stock one-card comparison under the same serving protocol as the stock layer-split screen",
      "metrics": {
        "decode_tok_s": [
          104.839983,
          104.810772
        ]
      },
      "quality": "stock comparison anchor",
      "evidence": "repro/ornith-15-35b-a3b-q4km-b70/README.md"
    },
    {
      "id": "ornith-35b-stock-layer-split-two-card",
      "state": "lab-measured",
      "revision": "ornith-1.5-35b-a3b",
      "variant": "Q4_K_M MoE stock",
      "runtime": "llama.cpp SYCL 9fee29e",
      "config": {
        "cards": 2,
        "profile_id": "ornith-35b-q4-stock-8k",
        "split_mode": "layer",
        "mtp": 0,
        "graph": "off",
        "kv": "f16",
        "configured_max_context_tokens": 8192
      },
      "workload": "stock two-card split-mode-layer comparison on GPUs 0 and 1",
      "metrics": {
        "decode_tok_s": [
          102.011447,
          102.200045
        ]
      },
      "quality": "5/5 canaries passed; topology characterization only",
      "evidence": "repro/ornith-15-35b-a3b-q4km-b70/README.md"
    }
  ],
  "series_measurements": [
    {
      "id": "ornith-9b-context-depth",
      "state": "lab-measured",
      "revision": "ornith-1.5-9b",
      "variant": "Q8_0 dense",
      "runtime": "llama.cpp SYCL 9fee29e",
      "config": {
        "cards": 1,
        "profile_id": "ornith-9b-q8-stock-context",
        "split_mode": "single device",
        "mtp": 0,
        "graph": "off",
        "kv": "f16"
      },
      "workload": "llama-bench pp2048 plus tg128 at each depth, flash attention on, five repetitions; raw-engine shape metric",
      "axis": "active_context_tokens",
      "points": [
        {
          "x": 0,
          "decode_tok_s": 50.291618,
          "prefill_tok_s": 3184.490007
        },
        {
          "x": 2048,
          "decode_tok_s": 49.338288,
          "prefill_tok_s": 1623.026366
        },
        {
          "x": 4096,
          "decode_tok_s": 48.554943,
          "prefill_tok_s": 1601.167744
        },
        {
          "x": 8192,
          "decode_tok_s": 47.044737,
          "prefill_tok_s": 1568.596728
        },
        {
          "x": 16384,
          "decode_tok_s": 44.349773,
          "prefill_tok_s": 1489.240859
        },
        {
          "x": 24576,
          "decode_tok_s": 41.957791,
          "prefill_tok_s": 1448.815985
        },
        {
          "x": 32768,
          "decode_tok_s": 39.83848,
          "prefill_tok_s": 1313.738568
        }
      ],
      "evidence": "repro/ornith-15-9b-q8-b70/ornith-15-9b-q8.sweep.json"
    },
    {
      "id": "ornith-35b-context-depth",
      "state": "lab-measured",
      "revision": "ornith-1.5-35b-a3b",
      "variant": "Q4_K_M MoE eleven-feature stack",
      "runtime": "llama.cpp SYCL 9fee29e plus lab patch",
      "config": {
        "cards": 1,
        "profile_id": "ornith-35b-q4-eleven-feature-context",
        "split_mode": "single device",
        "mtp": 0,
        "graph": "off",
        "kv": "f16"
      },
      "workload": "llama-bench pp2048 plus tg128 at each depth, flash attention on, five repetitions; exact eleven-feature raw-engine profile predating the accepted copy-offload setting",
      "axis": "active_context_tokens",
      "points": [
        {
          "x": 0,
          "decode_tok_s": 138.97752,
          "prefill_tok_s": 1397.348168
        },
        {
          "x": 2048,
          "decode_tok_s": 133.765934,
          "prefill_tok_s": 1326.651018
        },
        {
          "x": 4096,
          "decode_tok_s": 130.620489,
          "prefill_tok_s": 1312.167851
        },
        {
          "x": 8192,
          "decode_tok_s": 124.209778,
          "prefill_tok_s": 1284.796086
        },
        {
          "x": 16384,
          "decode_tok_s": 113.31086,
          "prefill_tok_s": 1220.200931
        },
        {
          "x": 24576,
          "decode_tok_s": 104.315441,
          "prefill_tok_s": 1196.724116
        },
        {
          "x": 32768,
          "decode_tok_s": 96.995532,
          "prefill_tok_s": 1101.625369
        }
      ],
      "evidence": "repro/ornith-15-35b-a3b-q4km-b70/ornith-15-35b-a3b-q4km-eleven-feature.sweep.json"
    },
    {
      "id": "ornith-35b-twelve-feature-copyoff-context-depth",
      "state": "lab-measured",
      "revision": "ornith-1.5-35b-a3b",
      "variant": "Q4_K_M MoE twelve-feature stack plus copy-offload setting",
      "runtime": "llama.cpp SYCL 9fee29e plus lab patch",
      "config": {
        "cards": 1,
        "profile_id": "ornith-35b-q4-twelve-feature-context",
        "split_mode": "single device",
        "mtp": 0,
        "graph": "off",
        "kv": "f16"
      },
      "workload": "llama-bench pp2048 plus tg128 at each depth, flash attention on, five repetitions; exact twelve-feature raw-engine profile with the accepted copy-offload setting",
      "axis": "active_context_tokens",
      "points": [
        {
          "x": 0,
          "decode_tok_s": 141.917514,
          "prefill_tok_s": 1422.407346
        },
        {
          "x": 2048,
          "decode_tok_s": 136.848608,
          "prefill_tok_s": 1343.876428
        },
        {
          "x": 4096,
          "decode_tok_s": 133.329784,
          "prefill_tok_s": 1338.212192
        },
        {
          "x": 8192,
          "decode_tok_s": 126.829116,
          "prefill_tok_s": 1301.167019
        },
        {
          "x": 16384,
          "decode_tok_s": 116.267169,
          "prefill_tok_s": 1238.569995
        },
        {
          "x": 24576,
          "decode_tok_s": 106.967195,
          "prefill_tok_s": 1212.927246
        },
        {
          "x": 32768,
          "decode_tok_s": 99.614237,
          "prefill_tok_s": 1115.599876
        }
      ],
      "evidence": "repro/ornith-15-35b-a3b-q4km-b70/ornith-15-35b-a3b-q4km-twelve-feature.sweep.json"
    },
    {
      "id": "ornith-35b-accepted-stack-concurrency",
      "state": "lab-measured",
      "revision": "ornith-1.5-35b-a3b",
      "variant": "Q4_K_M MoE accepted twelve-feature stack",
      "runtime": "llama.cpp SYCL 9fee29e plus accepted lab patch",
      "profile_id": "ornith-35b-q4-accepted-stack-batched",
      "measurement_class": "raw-engine-continuous-batching",
      "promotion_status": "measured-capacity-profile-not-http-serving",
      "quality_scope": "accepted stack; independent prompts; candidate patch correctness was separately byte-identical at four sequences",
      "config": {
        "cards": 1,
        "split_mode": "single device",
        "mtp": 0,
        "graph": "off",
        "kv": "f16",
        "configured_max_context_tokens": 65536,
        "prompt_tokens_per_sequence": 1024,
        "output_tokens_per_sequence": 256
      },
      "workload": "llama-batched-bench raw-engine continuous batching with independent prompts and interleaved decode; npp=1024, ntg=256; not HTTP users or a server-scheduler result",
      "axis": "concurrent_sequences",
      "points": [
        {"x": 1, "decode_tok_s": 98.024651, "aggregate_tok_s": 98.024651},
        {"x": 2, "decode_tok_s": 51.335869, "aggregate_tok_s": 102.671738},
        {"x": 4, "decode_tok_s": 29.720736, "aggregate_tok_s": 118.882942},
        {"x": 8, "decode_tok_s": 18.285381, "aggregate_tok_s": 146.283051},
        {"x": 16, "decode_tok_s": 10.156496, "aggregate_tok_s": 162.503937},
        {"x": 32, "decode_tok_s": 6.766034, "aggregate_tok_s": 216.513077}
      ],
      "quality": "Measured baseline for the accepted stack. The separately tested optional multirow candidate preserved a byte-identical four-sequence transcript; that candidate's speeds are not substituted into this baseline curve.",
      "caveat": "Decode is per sequence and aggregate is combined engine throughput. Sequence count is not equated with HTTP users.",
      "evidence": "experiments/ornith-15-b70/data/2026-08-23-ornith35b-multirow-aggregate-summary.json"
    }
  ],
  "views": [
    {
      "id": "ornith-context",
      "title": "Measured context profiles",
      "subtitle": "Separate dense Q8_0 and MoE Q4_K_M architectures on one B70; shared axes do not imply transferable speed",
      "x_label": "active context tokens",
      "metrics": [
        "decode_tok_s",
        "prefill_tok_s"
      ],
      "series": [
        {
          "label": "9B dense · Q8_0",
          "measurement_ids": [
            "ornith-9b-context-depth"
          ]
        },
        {
          "label": "35B-A3B MoE · Q4_K_M · current 12-feature",
          "measurement_ids": [
            "ornith-35b-twelve-feature-copyoff-context-depth"
          ]
        }
      ]
    },
    {
      "id": "ornith-35b-optimization-context",
      "title": "Accepted 35B optimization over context",
      "subtitle": "Historical eleven-feature profile and current twelve-feature plus copy-offload profile; every marker is measured independently",
      "x_label": "active context tokens",
      "metrics": [
        "decode_tok_s",
        "prefill_tok_s"
      ],
      "series": [
        {
          "label": "historical 11-feature",
          "measurement_ids": [
            "ornith-35b-context-depth"
          ]
        },
        {
          "label": "current 12-feature + copy-offload",
          "measurement_ids": [
            "ornith-35b-twelve-feature-copyoff-context-depth"
          ]
        }
      ]
    },
    {
      "id": "ornith-35b-stock-card-count",
      "title": "35B stock card count",
      "subtitle": "Q4_K_M stock serving comparison; the optimized one-card packet is a separate patched identity",
      "x_label": "B70 cards",
      "discrete": true,
      "metrics": [
        "decode_tok_s"
      ],
      "series": [
        {
          "label": "stock layer placement",
          "measurement_ids": [
            "ornith-35b-stock-one-card",
            "ornith-35b-stock-layer-split-two-card"
          ],
          "x_from": "config.cards"
        }
      ]
    },
    {
      "id": "ornith-35b-concurrency",
      "title": "35B accepted-stack batching capacity",
      "subtitle": "Raw llama-batched-bench engine throughput; combined and per-sequence rates are both measured, and sequence count is not relabeled as HTTP users",
      "x_label": "concurrent engine sequences",
      "metrics": ["aggregate_tok_s", "decode_tok_s"],
      "series": [
        {
          "label": "accepted 12-feature stack",
          "measurement_ids": ["ornith-35b-accepted-stack-concurrency"]
        }
      ]
    }
  ],
  "coverage_views": [
    {
      "id": "ornith-serving-profile-by-cards",
      "label": "serving profile × cards",
      "row_axis": {
        "key": "profile_id",
        "label": "deployment profile",
        "prefix": "",
        "value_labels": {
          "ornith-9b-q8-stock-8k": "9B Q8_0 · stock",
          "ornith-35b-q4-twelve-feature-8k": "35B-A3B Q4_K_M · current optimized",
          "ornith-35b-q4-stock-8k": "35B-A3B Q4_K_M · stock"
        }
      },
      "column_axis": {
        "key": "cards",
        "label": "B70 cards",
        "prefix": ""
      },
      "fixed_selectors": {
        "mtp": 0,
        "graph": "off",
        "kv": "f16",
        "configured_max_context_tokens": 8192
      },
      "fixed": "Target-only · graph off · F16 KV · standard 8K serving profile. Rows keep stock and patched identities separate; a blank topology is never inferred from another row.",
      "decision_note": "The optimized 35B-A3B packet is measured only on one card. Its stock two-card layer split is retained as a separate profile and is slower than stock one-card single-stream decode. No four-card serving point is claimed.",
      "evidence": "repro/ornith-15-35b-a3b-q4km-b70/README.md",
      "rows": [
        "ornith-9b-q8-stock-8k",
        "ornith-35b-q4-twelve-feature-8k",
        "ornith-35b-q4-stock-8k"
      ],
      "columns": [1, 2, 4],
      "cells": {
        "ornith-9b-q8-stock-8k:1": {"state": "lab-measured", "label": "D49.573–49.588 · stock", "evidence_id": "ornith-9b-standard-one-card", "packet_id": "ornith-15-9b-q8-b70"},
        "ornith-9b-q8-stock-8k:2": {"state": "missing", "label": "no measured route"},
        "ornith-9b-q8-stock-8k:4": {"state": "missing", "label": "no measured route"},
        "ornith-35b-q4-twelve-feature-8k:1": {"state": "lab-measured", "label": "D130.451–132.469 · EVID B", "evidence_id": "ornith-35b-twelve-feature-copyoff-one-card", "packet_id": "ornith-15-35b-a3b-q4km-b70"},
        "ornith-35b-q4-twelve-feature-8k:2": {"state": "missing", "label": "current overlay not measured"},
        "ornith-35b-q4-twelve-feature-8k:4": {"state": "missing", "label": "current overlay not measured"},
        "ornith-35b-q4-stock-8k:1": {"state": "lab-measured", "label": "D104.811–104.840 · stock", "evidence_id": "ornith-35b-stock-one-card"},
        "ornith-35b-q4-stock-8k:2": {"state": "lab-measured", "label": "D102.011–102.200 · layer split", "evidence_id": "ornith-35b-stock-layer-split-two-card"},
        "ornith-35b-q4-stock-8k:4": {"state": "missing", "label": "no measured route"}
      }
    },
    {
      "id": "ornith-9b-context-by-cards",
      "label": "9B Q8_0 context × cards",
      "row_axis": {
        "key": "active_context_tokens",
        "label": "active context",
        "prefix": ""
      },
      "column_axis": {
        "key": "cards",
        "label": "B70 cards",
        "prefix": ""
      },
      "fixed_selectors": {
        "revision": "ornith-1.5-9b",
        "variant": "Q8_0 dense",
        "runtime": "llama.cpp SYCL 9fee29e",
        "profile_id": "ornith-9b-q8-stock-context",
        "split_mode": "single device",
        "mtp": 0,
        "graph": "off",
        "kv": "f16"
      },
      "fixed": "Stock 9B Q8_0 · target-only · graph off · F16 KV · raw pp2048/tg128 · five repetitions per marker.",
      "decision_note": "The complete one-card 0–32K profile is measured. Two- and four-card context curves remain explicit gaps.",
      "evidence": "repro/ornith-15-9b-q8-b70/ornith-15-9b-q8.sweep.json",
      "rows": [0, 2048, 4096, 8192, 16384, 24576, 32768],
      "columns": [1, 2, 4],
      "cells": {
        "0:1": {"state": "lab-measured", "label": "D50.29 · P3,184", "evidence_id": "ornith-9b-context-depth", "point_x": 0},
        "0:2": {"state": "missing", "label": "not measured"},
        "0:4": {"state": "missing", "label": "not measured"},
        "2048:1": {"state": "lab-measured", "label": "D49.34 · P1,623", "evidence_id": "ornith-9b-context-depth", "point_x": 2048},
        "2048:2": {"state": "missing", "label": "not measured"},
        "2048:4": {"state": "missing", "label": "not measured"},
        "4096:1": {"state": "lab-measured", "label": "D48.55 · P1,601", "evidence_id": "ornith-9b-context-depth", "point_x": 4096},
        "4096:2": {"state": "missing", "label": "not measured"},
        "4096:4": {"state": "missing", "label": "not measured"},
        "8192:1": {"state": "lab-measured", "label": "D47.04 · P1,569", "evidence_id": "ornith-9b-context-depth", "point_x": 8192},
        "8192:2": {"state": "missing", "label": "not measured"},
        "8192:4": {"state": "missing", "label": "not measured"},
        "16384:1": {"state": "lab-measured", "label": "D44.35 · P1,489", "evidence_id": "ornith-9b-context-depth", "point_x": 16384},
        "16384:2": {"state": "missing", "label": "not measured"},
        "16384:4": {"state": "missing", "label": "not measured"},
        "24576:1": {"state": "lab-measured", "label": "D41.96 · P1,449", "evidence_id": "ornith-9b-context-depth", "point_x": 24576},
        "24576:2": {"state": "missing", "label": "not measured"},
        "24576:4": {"state": "missing", "label": "not measured"},
        "32768:1": {"state": "lab-measured", "label": "D39.84 · P1,314", "evidence_id": "ornith-9b-context-depth", "point_x": 32768},
        "32768:2": {"state": "missing", "label": "not measured"},
        "32768:4": {"state": "missing", "label": "not measured"}
      }
    },
    {
      "id": "ornith-35b-context-by-cards",
      "label": "35B-A3B current context × cards",
      "row_axis": {
        "key": "active_context_tokens",
        "label": "active context",
        "prefix": ""
      },
      "column_axis": {
        "key": "cards",
        "label": "B70 cards",
        "prefix": ""
      },
      "fixed_selectors": {
        "revision": "ornith-1.5-35b-a3b",
        "variant": "Q4_K_M MoE twelve-feature stack plus copy-offload setting",
        "runtime": "llama.cpp SYCL 9fee29e plus lab patch",
        "profile_id": "ornith-35b-q4-twelve-feature-context",
        "split_mode": "single device",
        "mtp": 0,
        "graph": "off",
        "kv": "f16"
      },
      "fixed": "Current twelve-feature Q4_K_M overlay plus accepted copy-offload setting · target-only · graph off · F16 KV · raw pp2048/tg128 · five repetitions per marker.",
      "decision_note": "Every one-card 0–32K marker is measured from the current accepted overlay. The old eleven-feature curve remains historical evidence; no current-overlay multi-card curve is inferred.",
      "evidence": "repro/ornith-15-35b-a3b-q4km-b70/ornith-15-35b-a3b-q4km-twelve-feature.sweep.json",
      "rows": [0, 2048, 4096, 8192, 16384, 24576, 32768],
      "columns": [1, 2, 4],
      "cells": {
        "0:1": {"state": "lab-measured", "label": "D141.92 · P1,422", "evidence_id": "ornith-35b-twelve-feature-copyoff-context-depth", "point_x": 0},
        "0:2": {"state": "missing", "label": "not measured"},
        "0:4": {"state": "missing", "label": "not measured"},
        "2048:1": {"state": "lab-measured", "label": "D136.85 · P1,344", "evidence_id": "ornith-35b-twelve-feature-copyoff-context-depth", "point_x": 2048},
        "2048:2": {"state": "missing", "label": "not measured"},
        "2048:4": {"state": "missing", "label": "not measured"},
        "4096:1": {"state": "lab-measured", "label": "D133.33 · P1,338", "evidence_id": "ornith-35b-twelve-feature-copyoff-context-depth", "point_x": 4096},
        "4096:2": {"state": "missing", "label": "not measured"},
        "4096:4": {"state": "missing", "label": "not measured"},
        "8192:1": {"state": "lab-measured", "label": "D126.83 · P1,301", "evidence_id": "ornith-35b-twelve-feature-copyoff-context-depth", "point_x": 8192},
        "8192:2": {"state": "missing", "label": "not measured"},
        "8192:4": {"state": "missing", "label": "not measured"},
        "16384:1": {"state": "lab-measured", "label": "D116.27 · P1,239", "evidence_id": "ornith-35b-twelve-feature-copyoff-context-depth", "point_x": 16384},
        "16384:2": {"state": "missing", "label": "not measured"},
        "16384:4": {"state": "missing", "label": "not measured"},
        "24576:1": {"state": "lab-measured", "label": "D106.97 · P1,213", "evidence_id": "ornith-35b-twelve-feature-copyoff-context-depth", "point_x": 24576},
        "24576:2": {"state": "missing", "label": "not measured"},
        "24576:4": {"state": "missing", "label": "not measured"},
        "32768:1": {"state": "lab-measured", "label": "D99.61 · P1,116", "evidence_id": "ornith-35b-twelve-feature-copyoff-context-depth", "point_x": 32768},
        "32768:2": {"state": "missing", "label": "not measured"},
        "32768:4": {"state": "missing", "label": "not measured"}
      }
    },
    {
      "id": "ornith-35b-concurrency-by-cards",
      "label": "35B concurrent sequences × cards",
      "row_axis": {"key": "concurrent_sequences", "label": "engine sequences", "prefix": "c"},
      "column_axis": {"key": "cards", "label": "B70 cards", "prefix": ""},
      "fixed_selectors": {
        "revision": "ornith-1.5-35b-a3b",
        "variant": "Q4_K_M MoE accepted twelve-feature stack",
        "runtime": "llama.cpp SYCL 9fee29e plus accepted lab patch",
        "profile_id": "ornith-35b-q4-accepted-stack-batched",
        "measurement_class": "raw-engine-continuous-batching",
        "split_mode": "single device",
        "mtp": 0,
        "graph": "off",
        "kv": "f16",
        "configured_max_context_tokens": 65536
      },
      "fixed": "Accepted Ornith 35B Q4_K_M stack · one-card raw-engine continuous batching · independent 1,024-token prompts · 256 generated tokens per sequence · graph off · F16 KV.",
      "decision_note": "Only the one-card accepted stack has a measured concurrency curve. Combined engine throughput rises through c32 while per-sequence decode falls; these are engine sequences, not HTTP-user or scheduler claims. Two- and four-card curves remain explicit gaps.",
      "evidence": "experiments/ornith-15-b70/data/2026-08-23-ornith35b-multirow-aggregate-summary.json",
      "rows": [1, 2, 4, 8, 16, 32],
      "columns": [1, 2, 4],
      "cells": {
        "1:1": {"state": "lab-measured", "label": "D98.02 · A98.02", "evidence_id": "ornith-35b-accepted-stack-concurrency", "point_x": 1},
        "1:2": {"state": "missing", "label": "not measured"},
        "1:4": {"state": "missing", "label": "not measured"},
        "2:1": {"state": "lab-measured", "label": "D51.34 · A102.67", "evidence_id": "ornith-35b-accepted-stack-concurrency", "point_x": 2},
        "2:2": {"state": "missing", "label": "not measured"},
        "2:4": {"state": "missing", "label": "not measured"},
        "4:1": {"state": "lab-measured", "label": "D29.72 · A118.88", "evidence_id": "ornith-35b-accepted-stack-concurrency", "point_x": 4},
        "4:2": {"state": "missing", "label": "not measured"},
        "4:4": {"state": "missing", "label": "not measured"},
        "8:1": {"state": "lab-measured", "label": "D18.29 · A146.28", "evidence_id": "ornith-35b-accepted-stack-concurrency", "point_x": 8},
        "8:2": {"state": "missing", "label": "not measured"},
        "8:4": {"state": "missing", "label": "not measured"},
        "16:1": {"state": "lab-measured", "label": "D10.16 · A162.5", "evidence_id": "ornith-35b-accepted-stack-concurrency", "point_x": 16},
        "16:2": {"state": "missing", "label": "not measured"},
        "16:4": {"state": "missing", "label": "not measured"},
        "32:1": {"state": "lab-measured", "label": "D6.77 · A216.51", "evidence_id": "ornith-35b-accepted-stack-concurrency", "point_x": 32},
        "32:2": {"state": "missing", "label": "not measured"},
        "32:4": {"state": "missing", "label": "not measured"}
      }
    }
  ],
  "family_closures": [
    {
      "selectors": {
        "model_variant": "Ornith 1.5 9B and 35B-A3B",
        "active_context_tokens": ">32768"
      },
      "state": "missing",
      "reason": "Both artifacts declare a 262,144-token native window, but these two packet profiles have measured active-context evidence only through 32,768 tokens.",
      "evidence": "packages/README.md"
    }
  ],
  "estimates": []
}
