# InferRoute Environment Configuration # Execution Environment (development/production) ENV=development # ── Core API Keys ──────────────────────────────────────────────────────────── OPENAI_API_KEY=your-openai-api-key-here # Google Gemini GEMINI_API_KEY=your-gemini-api-key-here GEMINI_MODEL=gemini-1.5-flash MOCK_GEMINI=True # Local Inference (vLLM) Settings # When MOCK_VLLM=True, requests to vLLM are simulated locally without needing a GPU. MOCK_VLLM=True VLLM_API_URL=http://localhost:8000/v1 VLLM_API_KEY=mock-vllm-key # Local Ollama OLLAMA_API_URL=http://localhost:11434 OLLAMA_MODEL=llama3 MOCK_OLLAMA=True # ── Database Connections ────────────────────────────────────────────────────── DATABASE_URL=postgresql+asyncpg://postgres:postgres@localhost:5432/inferroute REDIS_URL=redis://localhost:6379/0 # ── Gateway Administration ──────────────────────────────────────────────────── ADMIN_API_KEY=admin-secret DEFAULT_RATE_LIMIT_RPM=60 # ── SLO Targets (milliseconds) ──────────────────────────────────────────────── SLO_P50_MS=500.0 SLO_P95_MS=2000.0 SLO_P99_MS=5000.0 # ── Circuit Breaker ─────────────────────────────────────────────────────────── CB_FAILURE_THRESHOLD=5 CB_RECOVERY_TIMEOUT_S=30 CB_SUCCESS_THRESHOLD=2 # ── Caching ─────────────────────────────────────────────────────────────────── CACHE_MAX_SIZE_MB=512 CACHE_PREFIX_MAX_CHARS=256 CACHE_DEDUP_ENABLED=True CACHE_DEDUP_TIMEOUT_S=30 # ── Observability Configuration ─────────────────────────────────────────────── OTEL_EXPORTER_OTLP_ENDPOINT=http://localhost:4317