Fireworks AI
Fireworks AI
오픈 모델의 추론·학습·전용 배포를 함께 제공하는 AI 기반. 토큰과 GPU 시간 단위 종량 과금.

지원 플랫폼
개요
Fireworks AI는 오픈 모델을 다루는 추론 플랫폼입니다. 공식 요금 페이지는 “아이디어에서 엔터프라이즈까지 매끄럽게 확장하는 가격”을 내세우며 토큰 단위의 서버리스 추론, 학습 토큰 단위의 파인튜닝, GPU 시간 단위의 전용 온디맨드 배포 세 가지로 요금을 제시합니다. 학습은 16B 이하 모델에서 LoRA SFT가 100만 학습 토큰당 0.50달러, 전체 파라미터 SFT가 1.00달러입니다. 온디맨드는 H100/H200이 시간당 8달러, B200이 13달러입니다. 시작할 때 1달러의 무료 크레딧이 안내됩니다.
주요 기능
- 토큰 과금의 서버리스 추론
- 파인튜닝(LoRA·전체 파라미터)
- 전용 GPU 온디맨드 이용
- 최초 1달러 무료 크레딧
- 기업용 개별 조건
요금제
Training (up to 16B, LoRA SFT)
US$0.50 / 1M training tokens
공식 표시 가격 (USD) · 출처
- Up to 16B: LoRA SFT $0.50 / Full Param SFT $1.00
- 16.1B-80B: LoRA SFT $3.00 / Full Param SFT $6.00
- 80B-300B: $6.00-$24.00
- >300B: $10.00-$40.00
- All per 1M training tokens
최종 확인: 2026년 9월
On-demand deployments
US$8 / GPU hour
공식 표시 가격 (USD) · 출처
- H100/H200: $8.00/hour
- B200: $13.00/hour
- B300/GB300: $15.00-$20.00/hour
최종 확인: 2026년 9월
Serverless inference (embeddings example)
US$0.10 / 1M input tokens
공식 표시 가격 (USD) · 출처
- Qwen3 8B embeddings: $0.1 per 1M input tokens
- Embeddings up to 150M params: $0.008
- Embeddings 150M-350M params: $0.016
- Get started with $1 in free credits
최종 확인: 2026년 9월
Enterprise
영업팀 문의
- Faster speeds and lower costs
- Higher rate limits
- Contact us for a quote
Fireworks AI은(는) 전 세계 동일 요금을 게시하고 USD로 청구합니다. 현지 통화로 된 별도 가격은 없습니다.
스크린샷

관련 AI 도구
Together AI
Together AI는 AI 개발 플랫폼·API 서비스로, AI 개발이나 추론에 활용할 수 있는 AI 서비스입니다.
Replicate
Replicate는 AI 개발 플랫폼·API 서비스로, AI 개발이나 프로토타입에 활용할 수 있는 AI 서비스입니다.
Groq
자체 프로세서 LPU로 고속 추론을 제공하는 클라우드. 추론 전용 인프라를 대규모로 운영한다.
OpenRouter
OpenRouter는 AI 개발 플랫폼·API 서비스로, AI 개발이나 모델 비교에 활용할 수 있는 AI 서비스입니다.