Fireworks AI
Fireworks AI
Inferenza, addestramento e deployment dedicati per modelli aperti, con fatturazione a token e ore GPU.

Piattaforme
Panoramica
Fireworks AI è una piattaforma di inferenza per modelli aperti. La pagina dei prezzi, intitolata prezzi per scalare senza attriti dall'idea all'impresa, si divide in tre: inferenza serverless a token, addestramento a token di addestramento e deployment dedicati on demand a ore GPU. Nell'addestramento, per modelli fino a 16B, LoRA SFT costa 0,50 dollari per milione di token e l'SFT a parametri completi 1,00. On demand, H100/H200 costa 8 dollari l'ora e B200 13. All'avvio è previsto 1 dollaro di crediti gratuiti.
Funzionalità principali
- Inferenza serverless con fatturazione a token
- Fine tuning (LoRA e parametri completi)
- GPU dedicate on demand
- 1 dollaro di crediti gratuiti all'avvio
- Condizioni su misura per le aziende
Prezzi
Training (up to 16B, LoRA SFT)
0,50 USD / 1M training tokens
Prezzo pubblicato (USD) · Fonte
- Up to 16B: LoRA SFT $0.50 / Full Param SFT $1.00
- 16.1B-80B: LoRA SFT $3.00 / Full Param SFT $6.00
- 80B-300B: $6.00-$24.00
- >300B: $10.00-$40.00
- All per 1M training tokens
Ultima verifica: settembre 2026
On-demand deployments
8 USD / GPU hour
Prezzo pubblicato (USD) · Fonte
- H100/H200: $8.00/hour
- B200: $13.00/hour
- B300/GB300: $15.00-$20.00/hour
Ultima verifica: settembre 2026
Serverless inference (embeddings example)
0,10 USD / 1M input tokens
Prezzo pubblicato (USD) · Fonte
- Qwen3 8B embeddings: $0.1 per 1M input tokens
- Embeddings up to 150M params: $0.008
- Embeddings 150M-350M params: $0.016
- Get started with $1 in free credits
Ultima verifica: settembre 2026
Enterprise
Contatta il vendor
- Faster speeds and lower costs
- Higher rate limits
- Contact us for a quote
Fireworks AI pubblica un unico prezzo valido in tutto il mondo e addebita in USD. Non esiste un prezzo separato nella tua valuta locale.
Screenshot

Strumenti AI correlati
Together AI
Together AI è una piattaforma di sviluppo AI/API utile per lo sviluppo AI e l'inferenza.
Replicate
Replicate è una piattaforma di sviluppo AI/API utile per lo sviluppo AI e la prototipazione.
Groq
Cloud di inferenza costruito sul proprio processore LPU, con capacità dedicata su larga scala.
OpenRouter
OpenRouter è una piattaforma di sviluppo AI/API utile per lo sviluppo AI e il confronto tra modelli.