Fireworks AI
Fireworks AI
Suy luận, huấn luyện và triển khai riêng cho các mô hình mở, tính phí theo token và giờ GPU.

Nền tảng
Tổng quan
Fireworks AI là nền tảng suy luận dành cho các mô hình mở. Trang giá với tiêu đề mức giá giúp mở rộng liền mạch từ ý tưởng đến quy mô doanh nghiệp được chia làm ba phần: suy luận serverless tính theo token, huấn luyện tính theo token huấn luyện và triển khai GPU riêng theo nhu cầu tính theo giờ. Về huấn luyện, với mô hình đến 16B, LoRA SFT có giá 0,50 đô la cho mỗi triệu token huấn luyện và SFT toàn bộ tham số là 1,00 đô la. Với triển khai theo nhu cầu, H100/H200 là 8 đô la mỗi giờ và B200 là 13 đô la. Khi bắt đầu, người dùng được tặng 1 đô la tín dụng.
Tính năng chính
- Suy luận serverless tính theo token
- Tinh chỉnh (LoRA và toàn bộ tham số)
- GPU riêng theo nhu cầu
- Tặng 1 đô la tín dụng khi bắt đầu
- Điều kiện riêng cho doanh nghiệp
Bảng giá
Training (up to 16B, LoRA SFT)
0,50 US$ / 1M training tokens
Giá công bố (USD) · Nguồn
- Up to 16B: LoRA SFT $0.50 / Full Param SFT $1.00
- 16.1B-80B: LoRA SFT $3.00 / Full Param SFT $6.00
- 80B-300B: $6.00-$24.00
- >300B: $10.00-$40.00
- All per 1M training tokens
Xác minh lần cuối: tháng 9 năm 2026
On-demand deployments
8 US$ / GPU hour
Giá công bố (USD) · Nguồn
- H100/H200: $8.00/hour
- B200: $13.00/hour
- B300/GB300: $15.00-$20.00/hour
Xác minh lần cuối: tháng 9 năm 2026
Serverless inference (embeddings example)
0,10 US$ / 1M input tokens
Giá công bố (USD) · Nguồn
- Qwen3 8B embeddings: $0.1 per 1M input tokens
- Embeddings up to 150M params: $0.008
- Embeddings 150M-350M params: $0.016
- Get started with $1 in free credits
Xác minh lần cuối: tháng 9 năm 2026
Enterprise
Liên hệ tư vấn
- Faster speeds and lower costs
- Higher rate limits
- Contact us for a quote
Fireworks AI công bố một mức giá chung toàn cầu và thu phí bằng USD. Không có mức giá riêng theo tiền tệ địa phương.
Ảnh chụp màn hình

Công cụ AI liên quan
Together AI
Together AI là dịch vụ thuộc lĩnh vực Nền tảng phát triển AI & API, có thể ứng dụng cho phát triển AI và suy luận (inference).
Replicate
Replicate là dịch vụ thuộc lĩnh vực Nền tảng phát triển AI & API, có thể ứng dụng cho phát triển AI và tạo bản mẫu (prototype).
Groq
Đám mây suy luận xây trên bộ xử lý LPU tự phát triển, vận hành hạ tầng chuyên dụng ở quy mô lớn.
OpenRouter
OpenRouter là dịch vụ thuộc lĩnh vực Nền tảng phát triển AI & API, có thể ứng dụng cho phát triển AI và so sánh mô hình.