Fireworks AI
Fireworks AI
Inferensi, pelatihan, dan penempatan khusus untuk model terbuka, ditagih per token dan per jam GPU.

Platform
Ringkasan
Fireworks AI adalah platform inferensi untuk model terbuka. Halaman harganya, berjudul harga untuk berkembang mulus dari ide hingga skala perusahaan, terbagi tiga: inferensi serverless per token, pelatihan per token pelatihan, dan penempatan GPU khusus sesuai permintaan per jam. Untuk pelatihan model hingga 16B, LoRA SFT dikenakan 0,50 dolar per satu juta token pelatihan dan SFT parameter penuh 1,00 dolar. Untuk penempatan sesuai permintaan, H100/H200 seharga 8 dolar per jam dan B200 seharga 13 dolar. Saat memulai, pengguna mendapat kredit gratis 1 dolar.
Fitur utama
- Inferensi serverless ditagih per token
- Penyetelan halus (LoRA dan parameter penuh)
- GPU khusus sesuai permintaan
- Kredit gratis 1 dolar saat memulai
- Ketentuan khusus untuk perusahaan
Harga
Training (up to 16B, LoRA SFT)
US$0,50 / 1M training tokens
Harga resmi (USD) · Sumber
- Up to 16B: LoRA SFT $0.50 / Full Param SFT $1.00
- 16.1B-80B: LoRA SFT $3.00 / Full Param SFT $6.00
- 80B-300B: $6.00-$24.00
- >300B: $10.00-$40.00
- All per 1M training tokens
Terakhir diverifikasi: September 2026
On-demand deployments
US$8 / GPU hour
Harga resmi (USD) · Sumber
- H100/H200: $8.00/hour
- B200: $13.00/hour
- B300/GB300: $15.00-$20.00/hour
Terakhir diverifikasi: September 2026
Serverless inference (embeddings example)
US$0,10 / 1M input tokens
Harga resmi (USD) · Sumber
- Qwen3 8B embeddings: $0.1 per 1M input tokens
- Embeddings up to 150M params: $0.008
- Embeddings 150M-350M params: $0.016
- Get started with $1 in free credits
Terakhir diverifikasi: September 2026
Enterprise
Hubungi penjual
- Faster speeds and lower costs
- Higher rate limits
- Contact us for a quote
Fireworks AI menerbitkan satu harga yang berlaku di seluruh dunia dan menagih dalam USD. Tidak ada harga terpisah dalam mata uang lokal Anda.
Tangkapan layar

Alat AI terkait
Together AI
Together AI adalah layanan AI untuk platform pengembangan AI/API yang dapat dimanfaatkan untuk pengembangan AI dan inferensi.
Replicate
Replicate adalah layanan AI untuk platform pengembangan AI/API yang dapat dimanfaatkan untuk pengembangan AI dan prototipe.
Groq
Cloud inferensi yang dibangun di atas prosesor LPU buatan sendiri, mengoperasikan kapasitas khusus berskala besar.
OpenRouter
OpenRouter adalah layanan AI untuk platform pengembangan AI/API yang dapat dimanfaatkan untuk pengembangan AI dan perbandingan model.