InferRoute / .env.example
Ypeng12's picture
feat: Kubernetes-ready multi-provider LLM gateway v0.2.0
8a841b2
Raw
History Blame Contribute Delete
2.35 kB
# InferRoute Environment Configuration
# Execution Environment (development/production)
ENV=development
# ── Core API Keys ────────────────────────────────────────────────────────────
OPENAI_API_KEY=your-openai-api-key-here
# Google Gemini
GEMINI_API_KEY=your-gemini-api-key-here
GEMINI_MODEL=gemini-1.5-flash
MOCK_GEMINI=True
# Local Inference (vLLM) Settings
# When MOCK_VLLM=True, requests to vLLM are simulated locally without needing a GPU.
MOCK_VLLM=True
VLLM_API_URL=http://localhost:8000/v1
VLLM_API_KEY=mock-vllm-key
# Local Ollama
OLLAMA_API_URL=http://localhost:11434
OLLAMA_MODEL=llama3
MOCK_OLLAMA=True
# ── Database Connections ──────────────────────────────────────────────────────
DATABASE_URL=postgresql+asyncpg://postgres:postgres@localhost:5432/inferroute
REDIS_URL=redis://localhost:6379/0
# ── Gateway Administration ────────────────────────────────────────────────────
ADMIN_API_KEY=admin-secret
DEFAULT_RATE_LIMIT_RPM=60
# ── SLO Targets (milliseconds) ────────────────────────────────────────────────
SLO_P50_MS=500.0
SLO_P95_MS=2000.0
SLO_P99_MS=5000.0
# ── Circuit Breaker ───────────────────────────────────────────────────────────
CB_FAILURE_THRESHOLD=5
CB_RECOVERY_TIMEOUT_S=30
CB_SUCCESS_THRESHOLD=2
# ── Caching ───────────────────────────────────────────────────────────────────
CACHE_MAX_SIZE_MB=512
CACHE_PREFIX_MAX_CHARS=256
CACHE_DEDUP_ENABLED=True
CACHE_DEDUP_TIMEOUT_S=30
# ── Observability Configuration ───────────────────────────────────────────────
OTEL_EXPORTER_OTLP_ENDPOINT=http://localhost:4317