Fireworks AI
Fireworks AI
Inférence, entraînement et déploiements dédiés pour modèles ouverts, facturés aux tokens et aux heures de GPU.

Plateformes
Aperçu
Fireworks AI est une plateforme d'inférence pour modèles ouverts. Sa page tarifaire, intitulée une tarification pour passer sans friction de l'idée à l'entreprise, se divise en trois : inférence serverless facturée au token, entraînement facturé au token d'entraînement et déploiements dédiés à la demande facturés à l'heure de GPU. Pour l'entraînement, sur les modèles jusqu'à 16B, LoRA SFT coûte 0,50 dollar par million de tokens et le SFT complet 1,00. À la demande, H100/H200 coûte 8 dollars l'heure et B200 13. Un crédit offert de 1 dollar est proposé au démarrage.
Fonctionnalités principales
- Inférence serverless facturée au token
- Fine-tuning (LoRA et paramètres complets)
- GPU dédiés à la demande
- 1 dollar de crédits offerts au démarrage
- Conditions sur mesure pour les entreprises
Tarifs
Training (up to 16B, LoRA SFT)
0,50 $US / 1M training tokens
Prix publié (USD) · Source
- Up to 16B: LoRA SFT $0.50 / Full Param SFT $1.00
- 16.1B-80B: LoRA SFT $3.00 / Full Param SFT $6.00
- 80B-300B: $6.00-$24.00
- >300B: $10.00-$40.00
- All per 1M training tokens
Dernière vérification : septembre 2026
On-demand deployments
8 $US / GPU hour
Prix publié (USD) · Source
- H100/H200: $8.00/hour
- B200: $13.00/hour
- B300/GB300: $15.00-$20.00/hour
Dernière vérification : septembre 2026
Serverless inference (embeddings example)
0,10 $US / 1M input tokens
Prix publié (USD) · Source
- Qwen3 8B embeddings: $0.1 per 1M input tokens
- Embeddings up to 150M params: $0.008
- Embeddings 150M-350M params: $0.016
- Get started with $1 in free credits
Dernière vérification : septembre 2026
Enterprise
Contacter le service commercial
- Faster speeds and lower costs
- Higher rate limits
- Contact us for a quote
Fireworks AI publie un tarif unique dans le monde entier et facture en USD. Il n’existe pas de prix distinct dans votre monnaie locale.
Captures d'écran

Outils d'IA similaires
Together AI
Together AI est une plateforme de développement IA et une API, utile pour le développement d'IA et l'inférence.
Replicate
Replicate est une plateforme de développement IA et une API, utile pour le développement d'IA et le prototypage.
Groq
Cloud d'inférence bâti sur son propre processeur LPU, exploitant une capacité dédiée à grande échelle.
OpenRouter
OpenRouter est une plateforme de développement IA et une API, utile pour le développement d'IA et la comparaison de modèles.