effidevFlutter · Cloudflare-Edge · Cloud-Kostenoptimierung
Deutsch

LLM-Kosten und Ausfälle mit Cloudflare AI Gateway steuern

Steuerung von LLM-API-Kosten und Ausfällen mit Cloudflare AI Gateway

Wenn Sie APIs von OpenAI, Anthropic oder Google Gemini in der Produktion einbinden, läuft zunächst alles reibungslos. Doch mit wachsender Nutzerzahl treten gleichzeitig drei unerwartete Probleme auf. Erstens: Für identische Anfragen wird jedes Mal eine neue Antwort über die API abgerufen, wodurch die Token-Kosten linear steigen. Zweitens: Fällt ein bestimmter Provider aus, steht die gesamte Anwendung still. Drittens: Wenn jemand wiederholte Aufrufe durchführt oder Prompt Injections versucht, gibt es keine Möglichkeit, den Traffic zu steuern.

Diese drei Probleme könnten Sie jeweils separat mit Redis-Caching, Fallback-Logik und Rate-Limiting-Middleware lösen. Cloudflare AI Gateway behebt sie jedoch alle mit einem einzigen Edge-Proxy. Ohne eine einzige Zeile Code zu ändern, müssen Sie lediglich die Endpoint-URL durch die AI Gateway-URL ersetzen — Caching, Rate Limiting, automatischer Fallback, Ausgabenlimits, Logging und DLP-Guardrails werden sofort angewendet.

Dieser Artikel behandelt die Architektur von AI Gateway, die Verbindungskonfiguration für verschiedene Provider, Berechnungen zur tatsächlichen Kostenreduzierung durch Caching, Fallback-Routing-Strategien, die 2026 neu hinzugefügte Spend Limits-Funktion sowie Log-Limits und Sicherheitseinstellungen für den Produktionsbetrieb — auf einem Niveau, das Sie direkt in die Praxis umsetzen können.

Wichtigste Erkenntnisse

  • AI Gateway ist in allen Cloudflare-Tarifen kostenlos verfügbar. Zusätzliche Kosten entstehen nur durch die 5%-Gebühr bei Unified Billing und Workers-basierte Infrastrukturkosten.
  • Durch Edge-Caching können Sie bei wiederholten Aufrufen desselben Prompts eine Verzögerung von bis zu 90% reduzieren + Token-Kosten von 0 erreichen. Dies ist besonders effektiv bei Kundensupport-Chatbots und FAQ-Szenarien.
  • Wenn Sie Fallback-Provider als Array konfigurieren, erfolgt bei Ausfall des primären Modells ein automatisches Routing auf das sekundäre Modell. Über den Response-Header cf-aig-step können Sie prüfen, welcher Provider die Anfrage verarbeitet hat.
  • Mit der neuen Funktion Spend Limits (2026) können Sie tägliche oder monatliche Budgetobergrenzen in US-Dollar festlegen, um unerwartete Kostenexplosionen zu verhindern.
  • Das Log-Aufbewahrungslimit beträgt 100.000 Einträge/Monat im Free-Tarif und 1.000.000 Einträge/Monat im Workers Paid-Tarif. Bei Überschreitung werden keine neuen Logs gespeichert, weshalb wichtige Logs separat exportiert werden sollten.

AI Gateway-Architektur: LLM-Traffic am Edge ohne Codeänderungen steuern

AI Gateway ist im Wesentlichen ein Reverse Proxy. Es befindet sich zwischen Ihrer Anwendung und den AI-Providern, fängt alle Anfragen ab (intercept), wendet Caching-, Routing-, Logging- und Sicherheitsrichtlinien an und leitet sie erst dann an den Provider weiter. Laut der offiziellen Cloudflare AI Gateway-Dokumentation werden mehr als 20 Provider unterstützt.

Unterstützte Provider (Auszug) Verbindungsmethode
OpenAI (GPT-4o, o3 usw.) Universal Endpoint oder dedizierte URL
Anthropic (Claude Sonnet 5 usw.) Universal Endpoint
Google (Gemini 2.5 usw.) Universal Endpoint
Workers AI (Llama, Whisper usw.) Native Bindung
Azure OpenAI Universal Endpoint
AWS Bedrock Universal Endpoint
Hugging Face Universal Endpoint
Groq, Together AI, Perplexity Universal Endpoint

Für die Verbindung müssen Sie lediglich die Base-URL bestehender API-Aufrufe ersetzen. Die Code-Logik muss überhaupt nicht angepasst werden.

// Vorher: Direkter Aufruf von OpenAI
const client = new OpenAI({
  apiKey: process.env.OPENAI_API_KEY,
  baseURL: "https://api.openai.com/v1",
});

// Nachher: Über AI Gateway — nur dies ändern, um Caching, Logging und Fallback sofort anzuwenden
const client = new OpenAI({
  apiKey: process.env.OPENAI_API_KEY,
  baseURL: "https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_id}/openai",
});

Hinweis: {account_id} und {gateway_id} werden automatisch vergeben, wenn Sie ein AI Gateway im Cloudflare Dashboard erstellen. Sie können mehrere Gateways pro Konto erstellen, weshalb eine Trennung nach Umgebung (dev/staging/prod) oder Anwendung empfohlen wird.

Edge-Caching: Kosten für wiederholte Aufrufe identischer Prompts auf 0 senken

Das Prinzip des AI Gateway-Cachings ist einfach. Bei der Kombination gleicher Prompt + gleiches Modell + gleiche Parameter wird keine Anfrage an den Provider gesendet, sondern sofort die am Edge gecachte Antwort zurückgegeben. Da kein Provider-API-Aufruf stattfindet, betragen die Token-Kosten 0, und da die Antwort vom Edge geliefert wird, verringert sich die Latenz um bis zu 90%.

Szenarien, in denen Caching effektiv ist

Szenario Erwartete Cache-Hit-Rate Kosteneinsparungseffekt
Kundensupport-Chatbot (wiederholte FAQ-Fragen) 60~80% 60~80% Ersparnis bei monatlichen Token-Kosten
Code-Assistent (Erzeugung von identischem Boilerplate) 30~50% 30~50% Ersparnis bei monatlichen Token-Kosten
Übersetzungs-API (wiederholte Übersetzung gleicher Sätze) 70~90% 70~90% Ersparnis bei monatlichen Token-Kosten
Freier Konversations-Chatbot (jedes Mal andere Fragen) 5~15% Begrenzte Wirkung

Caching-Konfiguration

Wählen Sie das Gateway im Dashboard aus, aktivieren Sie Settings > Cache > Enable und stellen Sie die TTL (Time-to-Live) ein. Die Steuerung ist auch im Code über Request-Header möglich.

// Cache-TTL pro Anfrage steuern (in Sekunden)
const response = await fetch(
  `https://gateway.ai.cloudflare.com/v1/${accountId}/${gatewayId}/openai/chat/completions`,
  {
    method: "POST",
    headers: {
      "Authorization": `Bearer ${apiKey}`,
      "Content-Type": "application/json",
      "cf-aig-cache-ttl": "3600",  // 1 Stunde Cache
    },
    body: JSON.stringify({
      model: "gpt-4o",
      messages: [{ role: "user", content: "Was ist das CPU-Zeitlimit für Cloudflare Workers?" }],
    }),
  }
);

// Cache-Hit-Status über Response-Header prüfen
const cacheStatus = response.headers.get("cf-aig-cache-status");
// "HIT" = Aus Cache zurückgegeben (Kosten 0, Latenz ~10ms)
// "MISS" = Neu vom Provider abgerufen

Hinweis: Caching funktioniert nur bei Nicht-Streaming-Antworten. Streaming-Anfragen mit stream: true werden nicht gecacht. Wenn Sie Streaming benötigen und dennoch von Caching profitieren möchten, empfiehlt sich eine Strategie, bei der häufig wiederholte Fragen ohne Streaming und benutzerspezifische Gespräche mit Streaming verarbeitet werden.

Automatischer Fallback: Kontinuität des Dienstes bei Provider-Ausfällen gewährleisten

Wer sich an den großen Ausfall von OpenAI im Jahr 2024 oder die zeitweisen Ausfallzeiten der Anthropic-API im Jahr 2025 erinnert, muss nicht erst über das Risiko der Abhängigkeit von einem einzelnen Provider aufgeklärt werden. Die Fallback-Funktion von AI Gateway ermöglicht es Ihnen, ein Provider-Array zu definieren, sodass bei einem Fehlschlag der ersten Priorität automatisch auf die zweite Priorität umgeschaltet wird.

// Fallback-Provider-Konfiguration (Universal Endpoint)
const response = await fetch(
  `https://gateway.ai.cloudflare.com/v1/${accountId}/${gatewayId}`,
  {
    method: "POST",
    headers: { "Content-Type": "application/json" },
    body: JSON.stringify([
      {
        // Prio 1: Anthropic Claude Sonnet 5
        provider: "anthropic",
        endpoint: "messages",
        headers: { "x-api-key": ANTHROPIC_KEY, "anthropic-version": "2023-06-01" },
        query: {
          model: "claude-sonnet-5-20260514",
          max_tokens: 1024,
          messages: [{ role: "user", content: userMessage }],
        },
      },
      {
        // Prio 2: OpenAI GPT-4o (Fallback)
        provider: "openai",
        endpoint: "chat/completions",
        headers: { "Authorization": `Bearer ${OPENAI_KEY}` },
        query: {
          model: "gpt-4o",
          messages: [{ role: "user", content: userMessage }],
        },
      },
      {
        // Prio 3: Workers AI (Eigene Infrastruktur, minimale Kosten)
        provider: "workers-ai",
        endpoint: "@cf/meta/llama-3.3-70b-instruct-fp8-fast",
        headers: { "Authorization": `Bearer ${CF_API_TOKEN}` },
        query: {
          messages: [{ role: "user", content: userMessage }],
        },
      },
    ]),
  }
);

// Welcher Provider die Anfrage verarbeitet hat prüfen
const step = response.headers.get("cf-aig-step");
// "0" = Anthropic erfolgreich, "1" = OpenAI-Fallback, "2" = Workers AI-Fallback

Der wesentliche Vorteil dieser Struktur ist, dass keine if-else-Verzweigungen im Anwendungscode erforderlich sind. Da Provider-Prioritäten und Fallback-Logik auf Gateway-Ebene verarbeitet werden, richtet die Anwendung ihre Anfragen immer an denselben Endpoint und erhält Antworten im selben Format.

Spend Limits: Unerwartete Kostenexplosionen mit Budgetobergrenzen in US-Dollar verhindern

Die 2026 hinzugefügte Funktion Spend Limits ist die praktischste Neuerung von AI Gateway. Während sich bisherige Rate Limits auf die Anzahl der Anfragen bezogen, setzt Spend Limits Obergrenzen auf Basis der tatsächlichen Kosten in US-Dollar.

Einstellungsoption Beispielwert Beschreibung
Total Spend Limit $500/Tag Gesamt-Tageskostenlimit des Gateways
Per-User Spend Limit $10/Tag Tageskostenlimit pro Benutzer
Action on Limit Block / Fallback Anfragen bei Erreichen des Limits blockieren oder auf ein günstigeres Modell ausweichen
Reset Period Täglich / Monatlich Zurücksetzungsintervall des Kostenzählers

Praxisszenario: Wenn Sie in einer SaaS-Anwendung ein Limit von $10/Tag pro Benutzer festlegen, bleiben die Gesamtkosten auch dann unter Kontrolle, wenn ein einzelner Benutzer exzessive API-Aufrufe durchführt. Wenn Sie das System so konfigurieren, dass bei Erreichen des Limits nicht einfach blockiert, sondern automatisch auf ein günstigeres Modell (z. B. Llama in Workers AI) umgeschaltet wird, bleibt die Benutzererfahrung erhalten, während lediglich die Kosten begrenzt werden.

Rate Limits und Spend Limits können gleichzeitig angewendet werden. Ein empfohlenes Muster für die Produktion ist das Einrichten eines doppelten Schutzmechanismus, wie z. B. „60 Anfragen pro Minute + $50 Tageskostenlimit“.

Kostenstruktur und Log-Limits: Checkliste für den Produktionsbetrieb

AI Gateway selbst ist kostenlos, jedoch gibt es Kosten und Limits, die Sie im Betrieb beachten müssen. Nachfolgend finden Sie die Zahlen mit Stand August 2026 von der Cloudflare Workers Preisübersicht und der AI Gateway-Dokumentation.

Position Free Workers Paid ($5/Monat)
AI Gateway-Nutzungsgebühr $0 $0
Log-Aufbewahrungslimit 100.000 Einträge/Monat 1.000.000 Einträge/Monat
Unified Billing-Gebühr 5% 5%
Workers-Anfragen 100.000 / Tag kostenlos $0.30 pro 1 Mio. Anfragen
Workers-CPU-Zeit 10 ms / Tag kostenlos $0.02 pro 1 Mio. CPU-ms

Drei Dinge, die Sie beim Betrieb beachten sollten:

  1. Prüfen Sie unbedingt die Log-Limits. Wenn Sie im Free-Tarif 100.000 Einträge pro Monat überschreiten, werden keine neuen Logs mehr gespeichert. Für Logs, die eine Analyse erfordern, sollten Sie eine Pipeline aufbauen, die Daten aus Workers in Echtzeit an einen externen Speicher (R2, BigQuery usw.) exportiert. In unserem Leitfaden für asynchrone Pipelines mit Cloudflare Queues wird dieses Muster ausführlich behandelt.

  2. Unified Billing vs. BYOK (Bring Your Own Key). Bei der Nutzung von Unified Billing verwaltet Cloudflare die API-Schlüssel der Provider und erhebt eine Gebühr von 5%. Wenn Sie Ihre Schlüssel selbst verwalten (BYOK), fällt keine Gebühr an, aber Sie müssen Schlüsselrotation und Sicherheitsverwaltung selbst übernehmen. Für kleine Teams ist BYOK üblich, für Unternehmen Unified Billing.

  3. Aktivieren Sie DLP-Guardrails. Die in AI Gateway integrierte DLP-Funktion (Data Loss Prevention) erkennt vertrauliche Informationen (personenbezogene Daten, Quellcode) in Prompts und Antworten automatisch. Wenn Sie auch Sicherheits-Guardrails auf Basis von Llama Guard 3 8B aktivieren, können Sie Prompt-Injection-Angriffe oder die Generierung schädlicher Inhalte auf Gateway-Ebene blockieren.

Vergleich mit bestehender Infrastruktur: AI Gateway vs. Eigenentwicklung vs. LiteLLM

AI Gateway ist nicht die einzige Option. Sie können auch einen eigenen Proxy implementieren oder einen Open-Source-LLM-Proxy (wie LiteLLM) verwenden.

Kriterium Cloudflare AI Gateway Eigenentwicklung (Node.js + Redis) LiteLLM (Open Source)
Installation & Setup 1 Zeile URL-Änderung Server + Redis + Middleware Docker-Container-Deployment
Caching Integrierter Edge-Cache Eigener Redis-Cache Redis/DB-Anbindung
Fallback-Routing Automatisch per Array-Deklaration if-else- oder Retry-Logik Per Konfigurationsdatei
Kostenkontrolle Spend Limits (in US-Dollar) Eigene Berechnungs-/Sperrlogik Basiert auf Token-Zählung
Logging & Analytik Integriertes Dashboard Eigener Aufbau (ELK/Grafana) Integriertes Dashboard (eingeschränkt)
Globale Latenz 300+ PoPs am Edge Abhängig vom Serverstandort Abhängig vom Serverstandort
Vendor Lock-in Hoch (nur Cloudflare) Keiner Keiner
Kosten Kostenlos (~Workers Kosten) Server- + Redis-Kosten Serverkosten

Wenn Sie bereits das Cloudflare-Ökosystem nutzen, ist AI Gateway die schnellste und günstigste Wahl. Falls eine Multi-Cloud-Strategie unerlässlich ist oder spezielle Anpassungen erforderlich sind, sollten Sie LiteLLM in Betracht ziehen; für vollständige Flexibilität eine Eigenentwicklung. In unserem Kostenvergleichs-Leitfaden Cloudflare Workers vs. AWS Lambda haben wir einen detaillierten Vergleich unter dem Gesichtspunkt der Infrastrukturkosten angestellt.

Häufig gestellte Fragen

Erzeugt die Nutzung von AI Gateway zusätzliche Latenz?

Sie ist minimal. Da AI Gateway am globalen Edge von Cloudflare läuft, liegt die zusätzliche Latenz meist im Bereich von 1~5 ms. Bei einem Cache-Hit wird die Latenz im Vergleich zu einem direkten Provider-Aufruf sogar deutlich reduziert (da die Roundtrip-Zeit zum Provider entfällt).

Werden auch Streaming-Antworten unterstützt?

Ja. AI Gateway leitet Streaming-Antworten direkt (Pass-Through) weiter. Allerdings werden Streaming-Antworten nicht gecacht. Logging und Rate Limiting funktionieren auch bei Streaming normal.

Können Workers AI und externe Provider in einem einzigen Gateway verwaltet werden?

Das ist möglich. Der Hauptwert von AI Gateway liegt genau darin, mehr als 20 Provider in einem einzigen Gateway zu konsolidieren. Sie können Workers AI (eigene Modelle) und OpenAI/Anthropic (externe APIs) im selben Gateway verwalten und die Fallback-Reihenfolge frei festlegen.

Kann AI Gateway im Cloudflare Free-Tarif für die Produktion genutzt werden?

Es ist möglich, aber es gibt Einschränkungen. Da das Log-Limit im Free-Tarif bei 100.000 Einträgen pro Monat liegt, gehen Logs verloren, wenn mehr als 3.300 AI-Anfragen pro Tag anfallen. Für die Produktion wird empfohlen, mit dem Workers Paid-Tarif ($5/Monat, 1.000.000 Log-Einträge) zu starten.

Kann das bestehende OpenAI SDK weiterhin verwendet werden?

Sie können es weiterhin unverändert nutzen. Ersetzen Sie einfach den baseURL-Parameter des OpenAI SDK durch die AI Gateway-URL. Alle anderen Funktionen des SDK (Streaming, Function Calling, Vision usw.) funktionieren gewohnt weiter. Die SDKs von Anthropic und Google Gemini lassen sich ebenso durch bloßes Ersetzen der Base-URL verbinden.