Cloudflare Worker for parallel LLM calls via OpenRouter.
| Before (local) | After (Worker) |
|---|---|
| 3 models x 10 sec = 30 sec | 3 models in parallel = ~3 sec |
| CPU load | No load |
| No caching | KV cache |
wrangler kv:namespace create ACP_CACHE
# Copy id to wrangler.tomlwrangler secret put OPENROUTER_API_KEY
# Paste sk-or-v1-xxxcd workers/cloudflare-worker
wrangler deploy{"status": "healthy", "service": "ACP Consensus Worker"}Parallel query to multiple models.
{
"query": "Is AI consciousness possible?",
"models": ["openai/gpt-4o-mini", "anthropic/claude-3-haiku"],
"temperature": 0.7,
"use_cache": true
}Response:
{
"total_latency_ms": 2845,
"models_count": 2,
"results": [
{"model": "openai/gpt-4o-mini", "success": true, "content": "...", "latency_ms": 2100},
{"model": "anthropic/claude-3-haiku", "success": true, "content": "...", "latency_ms": 2845}
],
"cached": false
}For benchmarks — parallel processing of multiple queries.
{
"queries": ["Question 1", "Question 2", "Question 3"],
"models": ["openai/gpt-4o-mini", "anthropic/claude-3-haiku"]
}import httpx
WORKER_URL = "https://acp-consensus.YOUR-SUBDOMAIN.workers.dev"
async def consensus_via_worker(query: str, models: list[str]) -> dict:
async with httpx.AsyncClient() as client:
response = await client.post(
f"{WORKER_URL}/consensus",
json={"query": query, "models": models},
timeout=30.0
)
return response.json()- Speed: Parallel requests = 3x-5x faster
- Caching: Repeated queries are free
- Global: Worker runs closer to APIs (lower latency)
- Scaling: No local machine limits
- Cost: ~$0 for typical volumes (free tier)