Budget

Token- und Kostenrechner

Reflection hat für die Beta keine API-Preise veröffentlicht. Gib daher deine eigenen Preise ein. Der Rechner zeigt, wofür die Tokens verwendet werden, insbesondere für Reasoning, das Beam immer erzeugt.

API-Nutzung
Die Länge des Reasonings von Beam hängt von der Aufgabe und dem Aufwand ab. Lies usage.completion_tokens_details.reasoning_tokens aus deinen Antworten aus und gib den Durchschnitt ein.

Lass das Feld leer, um nur die Tokens anzuzeigen. Bei APIs im OpenAI-Stil wird Reasoning als Output abgerechnet. Prüfe die Bedingungen von Reflection, sobald Preise verfügbar sind.

API-Nutzung
Tokens pro Anfrage
4,100
Tokens pro Tag
4.1M
Tokens pro Monat
123M
Durchschnittliche Tokens pro Minute
2,847
Reasoning-Anteil an der Ausgabe
71%
API-Kosten pro Monat
Preise eingeben
Input-Tokens pro AnfrageAntwort-Tokens pro AnfrageReasoning-Tokens pro Anfrage
Self-Hosting
Gesamtzahl der Output-Tokens pro Sekunde über alle Anfragen auf dem Server. Miss den Wert mit deiner Engine und Batch-Größe; er kann stark variieren.
Self-Hosting
Kosten pro Monat
$17,280
Output-Tokens pro Monat
3.9B
Kosten pro 1 Mio. Output-Tokens
$4.44
Ungefähre Token-Zählung

Etwa 0 Tokens · 0 Zeichen

Der Tokenizer von Beam ist noch nicht öffentlich. Für lateinischen Text werden hier etwa 4 Zeichen pro Token und für Chinesisch, Japanisch und Koreanisch etwa 1 Token pro Zeichen angenommen.

Ratenlimits kurz erklärt
  • Die Limits gelten für die gesamte Organisation und werden von allen Projekten und Schlüsseln gemeinsam genutzt.
  • Gezählt werden Anfragen und Tokens pro Minute und pro UTC-Tag; Reasoning-Tokens zählen ebenfalls.
  • Die Anzahl gleichzeitiger Anfragen ist pro Organisation und pro Schlüssel begrenzt.
  • 429 mit dem Code rate_limit_exceeded: Warte mindestens Retry-After Sekunden. x-should-retry: false bedeutet, dass das Tageslimit bis 00:00 UTC ausgeschöpft ist.
  • Behalte x-ratelimit-remaining-requests und x-ratelimit-remaining-tokens (sowie ihre -day-Varianten) im Blick, um frühzeitig langsamer zu werden.

Quelle: developers.reflection.ai/rate-limits