Recipe benchmark dgr-001-controlled-whole-model-baseline-v1 (local-real)
model Qwen/Qwen2.5-0.5B-Instruct@7ae557604adf67be50417f59c2c2f167def9a775
transformers-safetensors-reference     [quality         ] c= 1 ttft p50/p95     32.9/   173.7 ms; prefill   699.8 tok/s; decode   50.8 tok/s; aggregate    44.5 tok/s; rss  1.93 GB; vram  0.00 GB; artifact  1.00 GB; failures 0
transformers-safetensors-reference     [quality         ] c= 4 ttft p50/p95     95.8/   425.5 ms; prefill   264.6 tok/s; decode   13.5 tok/s; aggregate    48.8 tok/s; rss  2.17 GB; vram  0.00 GB; artifact  1.00 GB; failures 0
llama-cpp-near-lossless-quality        [quality         ] c= 1 ttft p50/p95     15.1/    65.2 ms; prefill  1740.0 tok/s; decode  102.5 tok/s; aggregate    89.3 tok/s; rss  1.11 GB; vram  0.00 GB; artifact  0.99 GB; failures 0
llama-cpp-near-lossless-quality        [quality         ] c= 4 ttft p50/p95     36.6/   178.8 ms; prefill  1064.6 tok/s; decode   80.1 tok/s; aggregate   218.1 tok/s; rss  1.14 GB; vram  0.00 GB; artifact  0.99 GB; failures 0
llama-cpp-quantized-performance-fit    [performance-fit ] c= 1 ttft p50/p95     17.3/   130.5 ms; prefill  1181.1 tok/s; decode  213.1 tok/s; aggregate   149.9 tok/s; rss  0.54 GB; vram  0.00 GB; artifact  0.40 GB; failures 0
llama-cpp-quantized-performance-fit    [performance-fit ] c= 4 ttft p50/p95     42.1/   312.6 ms; prefill   567.7 tok/s; decode   94.8 tok/s; aggregate   235.7 tok/s; rss  0.57 GB; vram  0.00 GB; artifact  0.40 GB; failures 0
drift llama-cpp-near-lossless-quality  vs transformers-safetensors-reference exact 0.33; similarity 0.947 (gated)
drift llama-cpp-quantized-performance-fit vs transformers-safetensors-reference exact 0.00; similarity 0.456 (advisory)
