⏱️ AI API Latency Budget Planner

gpt0x.com
🌍 region preset:
🧠 LLM budget (after overheads) 1790 ms
🔹 TTFT % 40%
Max TTFT: 716 ms Gen TPS:
Output tokens budget:
🚦 Feasibility: GREEN P95 ×1.5
📋 Compatible models (by TTFT) LLM budget 1790ms
ClassModelsTTFT rangeStatus
⚡ FastHaiku, GPT-4o-mini, Gemini Flash<200ms
🔶 MediumSonnet, GPT-4o200–500ms
🐢 SlowOpus, o1>500ms⚠️
* based on max TTFT from LLM budget & TTFT%