Measured performance

Provider & model performance

Measured time-to-first-token, time-to-first-byte, effective throughput, and uptime for every LLM provider and model TrustedRouter routes to — continuously sampled, not vendor-claimed.

Last updated 2026-08-04T22:27:52Z

Video leaderboard

Continuously sampled from TrustedRouter's monitor regions using a rolling benchmark set of up to 10,000 samples. Time-to-first-token (TTFT), time-to-first-byte (TTFB), effective throughput, and success rate come from real streaming requests, not vendor claims. Completion rate shows the end-user result. Provider availability excludes failures owned by TrustedRouter, customers, or route configuration, while still reporting those failures under their actual owner. Capacity acceptance measures requests not rejected for provider overload. Effective throughput is provider-reported output tokens divided by complete request time, so buffered delivery cannot inflate the result. Unsupported route and probe-configuration rows are reported separately and do not count as provider downtime. No prompt or output content is ever stored.

Providers

Ranked by provider-attributed availability, then p50 time-to-first-token across all of a provider's models (38 providers · 160 availability samples · 0 sustained throughput samples). Providers below the evidence floor remain visible as warming, but do not receive a rank.

#ProviderModels CompletionProvider availabilityWithin deadline Capacity acceptedp50 TTFTp95 TTFT Effective throughputFailure ownerConfig excludedSamples
mistral warming 3 100.00% 100.00% 100.00% 100.00% 811 ms 956 ms 5
deepseek warming 3 100.00% 100.00% 100.00% 100.00% 1053 ms 2377 ms 11
kimi warming 2 100.00% 100.00% 100.00% 100.00% 1085 ms 2468 ms 3
grok warming 2 100.00% 100.00% 100.00% 100.00% 1130 ms 1135 ms 4
baseten warming 1 100.00% 100.00% 100.00% 100.00% 1134 ms 1134 ms 1
cerebras warming 4 100.00% 100.00% 100.00% 100.00% 1259 ms 2390 ms 5
openai warming 3 100.00% 100.00% 100.00% 100.00% 1295 ms 5072 ms 4
friendli warming 3 100.00% 100.00% 100.00% 100.00% 1553 ms 1928 ms 3
venice warming 3 100.00% 100.00% 100.00% 100.00% 1553 ms 2241 ms 3
lightning warming 4 100.00% 100.00% 100.00% 100.00% 1559 ms 3022 ms 4
nebius warming 3 100.00% 100.00% 100.00% 100.00% 1609 ms 1682 ms 3
parasail warming 2 100.00% 100.00% 100.00% 100.00% 1633 ms 7015 ms 3
minimax warming 3 100.00% 100.00% 100.00% 100.00% 1919 ms 3067 ms 3
wafer warming 3 100.00% 100.00% 100.00% 100.00% 2155 ms 2648 ms 6
siliconflow warming 1 100.00% 100.00% 100.00% 100.00% 2173 ms 2173 ms 1
makora warming 1 100.00% 100.00% 100.00% 100.00% 2202 ms 2202 ms 1
xiaomi warming 2 100.00% 100.00% 100.00% 100.00% 2263 ms 2506 ms 6
together warming 2 100.00% 100.00% 100.00% 100.00% 2278 ms 2817 ms 2
thinkingmachines warming 1 100.00% 100.00% 100.00% 100.00% 2338 ms 2338 ms 1
anthropic warming 6 100.00% 100.00% 100.00% 100.00% 2547 ms 3409 ms 6
zai warming 3 100.00% 100.00% 100.00% 100.00% 2618 ms 5383 ms 4
gmi warming 2 100.00% 100.00% 100.00% 100.00% 3388 ms 4269 ms 3
fireworks warming 6 88.89% 88.89% 88.89% 100.00% 1378 ms 6376 ms provider 1 9
tinfoil warming 3 83.33% 83.33% 83.33% 100.00% 1467 ms 7785 ms provider 1 6
novita warming 3 66.67% 66.67% 66.67% 100.00% 1453 ms 1465 ms provider 1 3
alibaba warming 3 0.00% 0.00% 0.00% 100.00% provider 3 3
atlas-cloud warming 5 0.00% 0.00% 0.00% 100.00% provider 5 5
cloudflare-workers-ai warming 7 0.00% 0.00% 0.00% 100.00% provider 7 7
digitalocean warming 2 0.00% 0.00% 0.00% 100.00% provider 2 2
engy warming 2 0.00% 0.00% 0.00% 100.00% provider 3 3
google-ai-studio warming 5 0.00% 0.00% 0.00% 100.00% provider 5 5
google-vertex warming 2 0.00% 0.00% 0.00% 100.00% provider 2 2
inceptron warming 4 0.00% 0.00% 0.00% 100.00% provider 7 7
morph warming 5 0.00% 0.00% 0.00% 100.00% provider 7 7
neurometric warming 5 0.00% 0.00% 0.00% 100.00% provider 6 6
streamlake warming 1 0.00% 0.00% 0.00% 100.00% provider 1 1
telnyx warming 6 0.00% 0.00% 0.00% 100.00% provider 9 9
zero-g warming 2 0.00% 0.00% 0.00% 100.00% provider 3 3

Models

Qualified models are ranked by provider-attributed availability, then p50 TTFT. Thin availability and throughput measurements stay visible below the ranked set as warming.

#ModelProvider CompletionProvider availabilityWithin deadlineCapacity accepted p50 TTFTp95 TTFTp50 TTFBp95 TTFB Effective throughputConfig excludedSamples
mistralai/codestral-2508 warming mistral 100.00% 100.00% 100.00% 20s 100.00% 699 ms 881 ms 699 ms 880 ms 2
mistralai/ministral-14b-2512 warming mistral 100.00% 100.00% 100.00% 20s 100.00% 811 ms 814 ms 811 ms 814 ms 2
z-ai/glm-5.1 warming friendli 100.00% 100.00% 100.00% 45s 100.00% 854 ms 854 ms 854 ms 854 ms 1
mistralai/mistral-medium-3-5 warming mistral 100.00% 100.00% 100.00% 20s 100.00% 956 ms 956 ms 956 ms 956 ms 1
NousResearch/Hermes-4-70B warming nebius 100.00% 100.00% 100.00% 20s 100.00% 1040 ms 1040 ms 1039 ms 1039 ms 1
deepseek/deepseek-v4-flash-0731 warming deepseek 100.00% 100.00% 100.00% 20s 100.00% 1040 ms 1053 ms 1040 ms 1053 ms 2
deepseek/deepseek-v4-flash warming deepseek 100.00% 100.00% 100.00% 20s 100.00% 1053 ms 1146 ms 1053 ms 1146 ms 5
moonshotai/moonshot-v1-32k warming kimi 100.00% 100.00% 100.00% 20s 100.00% 1085 ms 1135 ms 1085 ms 1135 ms 2
x-ai/grok-4.20 warming grok 100.00% 100.00% 100.00% 20s 100.00% 1090 ms 1090 ms 1090 ms 1090 ms 1
google/gemma-4-31b-it warming lightning 100.00% 100.00% 100.00% 20s 100.00% 1100 ms 1100 ms 1100 ms 1100 ms 1
x-ai/grok-build-0.1 warming grok 100.00% 100.00% 100.00% 20s 100.00% 1130 ms 1135 ms 1130 ms 1135 ms 3
thinkingmachines/inkling-1m warming baseten 100.00% 100.00% 100.00% 45s 100.00% 1134 ms 1134 ms 1134 ms 1134 ms 1
openai/gpt-oss-120b warming fireworks 100.00% 100.00% 100.00% 20s 100.00% 1182 ms 1182 ms 1182 ms 1182 ms 1
cerebras/gemma-4-31b warming cerebras 100.00% 100.00% 100.00% 15s 100.00% 1217 ms 1217 ms 1217 ms 1217 ms 1
xiaomi/mimo-v2.5 warming xiaomi 100.00% 100.00% 100.00% 20s 100.00% 1227 ms 2280 ms 1227 ms 2280 ms 2
openai/gpt-5.6-sol warming openai 100.00% 100.00% 100.00% 45s 100.00% 1245 ms 1245 ms 1245 ms 1245 ms 1
openai/gpt-oss-120b warming cerebras 100.00% 100.00% 100.00% 20s 100.00% 1259 ms 1301 ms 1259 ms 1301 ms 2
openai/gpt-5.6-terra warming openai 100.00% 100.00% 100.00% 45s 100.00% 1295 ms 1295 ms 1295 ms 1295 ms 1
google/gemma-4-31b-it warming tinfoil 100.00% 100.00% 100.00% 20s 100.00% 1323 ms 2241 ms 1323 ms 2241 ms 2
z-ai/glm-5.2 warming fireworks 100.00% 100.00% 100.00% 45s 100.00% 1344 ms 2168 ms 1344 ms 2168 ms 3
moonshotai/kimi-k2.7-code warming fireworks 100.00% 100.00% 100.00% 20s 100.00% 1378 ms 1378 ms 1378 ms 1378 ms 1
deepseek/deepseek-v4-pro warming deepseek 100.00% 100.00% 100.00% 20s 100.00% 1411 ms 2377 ms 1411 ms 2377 ms 4
z-ai/glm-4.7-flash warming venice 100.00% 100.00% 100.00% 20s 100.00% 1431 ms 1431 ms 1431 ms 1431 ms 1
qwen/qwen3-omni-30b-a3b-instruct warming novita 100.00% 100.00% 100.00% 20s 100.00% 1453 ms 1453 ms 1452 ms 1452 ms 1
deepseek/deepseek-r1-distill-llama-70b warming novita 100.00% 100.00% 100.00% 45s 100.00% 1465 ms 1465 ms 1465 ms 1465 ms 1
meta-llama/llama-3.3-70b-instruct warming tinfoil 100.00% 100.00% 100.00% 20s 100.00% 1467 ms 1708 ms 1467 ms 1708 ms 2
anthropic/claude-sonnet-4.6 warming anthropic 100.00% 100.00% 100.00% 20s 100.00% 1538 ms 1538 ms 1537 ms 1537 ms 1
z-ai/glm-4.7 warming cerebras 100.00% 100.00% 100.00% 20s 100.00% 1549 ms 1549 ms 1548 ms 1548 ms 1
qwen/qwen3-235b-a22b-thinking-2507 warming venice 100.00% 100.00% 100.00% 45s 100.00% 1553 ms 1553 ms 1553 ms 1553 ms 1
z-ai/glm-5.2 warming friendli 100.00% 100.00% 100.00% 45s 100.00% 1553 ms 1553 ms 1553 ms 1553 ms 1
openai/gpt-4 warming lightning 100.00% 100.00% 100.00% 20s 100.00% 1559 ms 1559 ms 1559 ms 1559 ms 1
anthropic/claude-opus-4.8 warming anthropic 100.00% 100.00% 100.00% 45s 100.00% 1598 ms 1598 ms 1598 ms 1598 ms 1
nvidia/nemotron-3-ultra-550b-a55b warming nebius 100.00% 100.00% 100.00% 20s 100.00% 1609 ms 1609 ms 1609 ms 1609 ms 1
deepseek/deepseek-v4-pro warming parasail 100.00% 100.00% 100.00% 20s 100.00% 1633 ms 7015 ms 1633 ms 7014 ms 2
NousResearch/Hermes-4-405B warming nebius 100.00% 100.00% 100.00% 20s 100.00% 1682 ms 1682 ms 1682 ms 1682 ms 1
minimax/minimax-m2.7-highspeed warming minimax 100.00% 100.00% 100.00% 20s 100.00% 1734 ms 1734 ms 1734 ms 1734 ms 1
z-ai/glm-5.2 warming parasail 100.00% 100.00% 100.00% 45s 100.00% 1835 ms 1835 ms 1835 ms 1835 ms 1
minimax/minimax-m2.7 warming minimax 100.00% 100.00% 100.00% 20s 100.00% 1919 ms 1919 ms 1919 ms 1919 ms 1
deepseek/deepseek-v3.2 warming friendli 100.00% 100.00% 100.00% 20s 100.00% 1928 ms 1928 ms 1927 ms 1927 ms 1
z-ai/glm-5.2-fast warming fireworks 100.00% 100.00% 100.00% 45s 100.00% 2039 ms 2039 ms 2039 ms 2039 ms 1
minimax/minimax-m3 warming wafer 100.00% 100.00% 100.00% 20s 100.00% 2056 ms 2126 ms 2055 ms 2126 ms 2
z-ai/glm-5.2 warming wafer 100.00% 100.00% 100.00% 45s 100.00% 2155 ms 2155 ms 2155 ms 2155 ms 1
google/gemini-3.1-flash-lite-preview warming lightning 100.00% 100.00% 100.00% 15s 100.00% 2157 ms 2157 ms 2157 ms 2157 ms 1
tencent/hunyuan-a13b-instruct warming siliconflow 100.00% 100.00% 100.00% 20s 100.00% 2173 ms 2173 ms 2172 ms 2172 ms 1
z-ai/glm-5.2 warming makora 100.00% 100.00% 100.00% 45s 100.00% 2202 ms 2202 ms 2201 ms 2201 ms 1
z-ai/glm-5 warming venice 100.00% 100.00% 100.00% 45s 100.00% 2241 ms 2241 ms 2241 ms 2241 ms 1
xiaomi/mimo-v2.5-pro warming xiaomi 100.00% 100.00% 100.00% 20s 100.00% 2263 ms 2506 ms 2263 ms 2506 ms 4
google/gemma-3n-e4b-it warming together 100.00% 100.00% 100.00% 20s 100.00% 2278 ms 2278 ms 2277 ms 2277 ms 1
thinkingmachines/inkling warming thinkingmachines 100.00% 100.00% 100.00% 45s 100.00% 2338 ms 2338 ms 2338 ms 2338 ms 1
google/gemma-4-31b-it warming cerebras 100.00% 100.00% 100.00% 20s 100.00% 2390 ms 2390 ms 2390 ms 2390 ms 1
moonshotai/kimi-k2.6 warming wafer 100.00% 100.00% 100.00% 20s 100.00% 2445 ms 2648 ms 2444 ms 2648 ms 3
moonshotai/kimi-k3 warming kimi 100.00% 100.00% 100.00% 20s 100.00% 2468 ms 2468 ms 2468 ms 2468 ms 1
openai/gpt-5 warming openai 100.00% 100.00% 100.00% 20s 100.00% 2488 ms 5072 ms 2488 ms 5072 ms 2
anthropic/claude-sonnet-4.5 warming anthropic 100.00% 100.00% 100.00% 20s 100.00% 2547 ms 2547 ms 2547 ms 2547 ms 1
z-ai/glm-5 warming zai 100.00% 100.00% 100.00% 45s 100.00% 2618 ms 3643 ms 2618 ms 3643 ms 2
anthropic/claude-sonnet-5 warming anthropic 100.00% 100.00% 100.00% 20s 100.00% 2623 ms 2623 ms 2622 ms 2622 ms 1
z-ai/glm-5.2 warming gmi 100.00% 100.00% 100.00% 45s 100.00% 2780 ms 2780 ms 2780 ms 2780 ms 1
meta-llama/llama-3.3-70b-instruct warming together 100.00% 100.00% 100.00% 20s 100.00% 2817 ms 2817 ms 2817 ms 2817 ms 1
anthropic/claude-opus-5 warming anthropic 100.00% 100.00% 100.00% 45s 100.00% 2918 ms 2918 ms 2917 ms 2917 ms 1
google/gemini-3.1-pro-preview warming lightning 100.00% 100.00% 100.00% 20s 100.00% 3022 ms 3022 ms 3022 ms 3022 ms 1
minimax/minimax-m2.5-highspeed warming minimax 100.00% 100.00% 100.00% 20s 100.00% 3067 ms 3067 ms 3067 ms 3067 ms 1
z-ai/glm-4.5v warming zai 100.00% 100.00% 100.00% 20s 100.00% 3213 ms 3213 ms 3213 ms 3213 ms 1
deepseek/deepseek-v4-pro warming gmi 100.00% 100.00% 100.00% 20s 100.00% 3388 ms 4269 ms 3388 ms 4269 ms 2
anthropic/claude-opus-4.6 warming anthropic 100.00% 100.00% 100.00% 45s 100.00% 3409 ms 3409 ms 3409 ms 3409 ms 1
z-ai/glm-5.1 warming zai 100.00% 100.00% 100.00% 45s 100.00% 5383 ms 5383 ms 5383 ms 5383 ms 1
deepseek/deepseek-v4-flash-0731 warming fireworks 100.00% 100.00% 100.00% 20s 100.00% 6376 ms 6376 ms 6376 ms 6376 ms 1
moonshotai/kimi-k3 warming fireworks 50.00% 50.00% 50.00% 20s 100.00% 4016 ms 4016 ms 4016 ms 4016 ms 2
z-ai/glm-5.2 warming tinfoil 50.00% 50.00% 50.00% 45s 100.00% 7785 ms 7785 ms 7784 ms 7784 ms 2
aisingapore/gemma-sea-lion-v4-27b-it warming cloudflare-workers-ai 0.00% 0.00% 0.00% 20s 100.00% 1
deepseek/deepseek-v3.1 warming atlas-cloud 0.00% 0.00% 0.00% 20s 100.00% 1
deepseek/deepseek-v4-flash-0731 warming atlas-cloud 0.00% 0.00% 0.00% 20s 100.00% 1
google/diffusiongemma-26b-a4b-it warming neurometric 0.00% 0.00% 0.00% 20s 100.00% 2
google/gemini-2.5-flash warming google-ai-studio 0.00% 0.00% 0.00% 20s 100.00% 1
google/gemini-2.5-flash warming google-vertex 0.00% 0.00% 0.00% 20s 100.00% 1
google/gemini-3-flash-preview warming google-ai-studio 0.00% 0.00% 0.00% 20s 100.00% 1
google/gemini-3.1-flash-lite warming google-vertex 0.00% 0.00% 0.00% 15s 100.00% 1
google/gemini-3.5-flash warming google-ai-studio 0.00% 0.00% 0.00% 20s 100.00% 1
google/gemini-3.5-flash-lite warming google-ai-studio 0.00% 0.00% 0.00% 15s 100.00% 1
google/gemini-3.6-flash warming google-ai-studio 0.00% 0.00% 0.00% 20s 100.00% 1
google/gemma-4-12b-it warming neurometric 0.00% 0.00% 0.00% 20s 100.00% 1
ibm-granite/granite-4.0-h-micro warming cloudflare-workers-ai 0.00% 0.00% 0.00% 20s 100.00% 1
ibm-granite/granite-4.1-8b warming neurometric 0.00% 0.00% 0.00% 20s 100.00% 1
kwaipilot/kat-coder-pro-v2.5 warming streamlake 0.00% 0.00% 0.00% 20s 100.00% 1
meta-llama/llama-3.2-1b-instruct warming cloudflare-workers-ai 0.00% 0.00% 0.00% 20s 100.00% 1
meta-llama/llama-3.2-3b-instruct warming cloudflare-workers-ai 0.00% 0.00% 0.00% 20s 100.00% 1
meta-llama/llama-3.3-70b-instruct warming novita 0.00% 0.00% 0.00% 20s 100.00% 1
minimax/minimax-m2.5 warming inceptron 0.00% 0.00% 0.00% 20s 100.00% 1
minimax/minimax-m2.7 warming morph 0.00% 0.00% 0.00% 20s 100.00% 1
minimax/minimax-m2.7 warming telnyx 0.00% 0.00% 0.00% 20s 100.00% 1
minimax/minimax-m3 warming morph 0.00% 0.00% 0.00% 20s 100.00% 1
minimax/minimax-m3 warming telnyx 0.00% 0.00% 0.00% 20s 100.00% 2
moonshotai/kimi-k2.6 warming digitalocean 0.00% 0.00% 0.00% 20s 100.00% 1
moonshotai/kimi-k2.6 warming inceptron 0.00% 0.00% 0.00% 20s 100.00% 4
moonshotai/kimi-k2.7-code warming inceptron 0.00% 0.00% 0.00% 20s 100.00% 1
moonshotai/kimi-k3 warming telnyx 0.00% 0.00% 0.00% 20s 100.00% 2
morph/morph-v3-fast warming morph 0.00% 0.00% 0.00% 15s 100.00% 1
morph/morph-v3-large warming morph 0.00% 0.00% 0.00% 20s 100.00% 1
nvidia/nemotron-3-120b-a12b warming cloudflare-workers-ai 0.00% 0.00% 0.00% 20s 100.00% 1
nvidia/nemotron-3-nano-omni warming digitalocean 0.00% 0.00% 0.00% 20s 100.00% 1
qwen/qwen-flash warming alibaba 0.00% 0.00% 0.00% 20s 100.00% 1
qwen/qwen3-235b-a22b warming telnyx 0.00% 0.00% 0.00% 20s 100.00% 1
qwen/qwen3-30b-a3b-fp8 warming cloudflare-workers-ai 0.00% 0.00% 0.00% 20s 100.00% 1
qwen/qwen3-vl-30b-a3b-thinking warming alibaba 0.00% 0.00% 0.00% 45s 100.00% 1
qwen/qwen3-vl-8b-instruct warming neurometric 0.00% 0.00% 0.00% 20s 100.00% 1
qwen/qwen3-vl-8b-thinking warming neurometric 0.00% 0.00% 0.00% 45s 100.00% 1
qwen/qwen3.6-35b-a3b warming engy 0.00% 0.00% 0.00% 20s 100.00% 2
qwen/qwen3.7-max warming alibaba 0.00% 0.00% 0.00% 20s 100.00% 1
qwen/qwen3.8-max warming atlas-cloud 0.00% 0.00% 0.00% 20s 100.00% 1
xiaomi/mimo-v2.5 warming atlas-cloud 0.00% 0.00% 0.00% 20s 100.00% 1
z-ai/glm-5 warming atlas-cloud 0.00% 0.00% 0.00% 45s 100.00% 1
z-ai/glm-5.1 warming telnyx 0.00% 0.00% 0.00% 45s 100.00% 2
z-ai/glm-5.2 warming cloudflare-workers-ai 0.00% 0.00% 0.00% 45s 100.00% 1
z-ai/glm-5.2 warming engy 0.00% 0.00% 0.00% 45s 100.00% 1
z-ai/glm-5.2 warming inceptron 0.00% 0.00% 0.00% 45s 100.00% 1
z-ai/glm-5.2 warming morph 0.00% 0.00% 0.00% 45s 100.00% 3
z-ai/glm-5.2 warming telnyx 0.00% 0.00% 0.00% 45s 100.00% 1
z-ai/glm-5.2 warming zero-g 0.00% 0.00% 0.00% 45s 100.00% 1
zero-g/0gm-1.0-35b-a3b warming zero-g 0.00% 0.00% 0.00% 20s 100.00% 2
Workspace access

Sign in

Choose a sign in method to access your TrustedRouter workspace.

By signing in you agree to the terms of service and privacy policy.