Cartesia
Cartesia
API tổng hợp giọng nói và nhận dạng giọng nói theo thời gian thực, hướng đến xây dựng tác nhân giọng nói.

Nền tảng
Tổng quan
Cartesia cung cấp tổng hợp giọng nói (Text to Speech) và nhận dạng giọng nói (Speech to Text) qua API. Chi phí tính theo mức dùng dựa trên tín dụng đã dùng và số phút tác nhân, còn số chỗ ngồi trong không gian làm việc là không giới hạn ở mọi gói. Có thể bắt đầu từ gói miễn phí; gói trả phí bổ sung giấy phép sử dụng thương mại và nhân bản giọng nói tức thì, còn gói cao hơn có nhân bản giọng nói chuyên nghiệp và giới hạn chạy song song lớn hơn.
Tính năng chính
- Tổng hợp giọng nói theo thời gian thực
- Nhận dạng giọng nói (Speech to Text)
- Nhân bản giọng nói
- Xây dựng tác nhân giọng nói
- Tính phí theo tín dụng và số phút
- Chỗ ngồi không gian làm việc không giới hạn
Bảng giá
Free
Miễn phí
Giá công bố (USD) · Nguồn
- 20K credits/month
- $1 prepaid agents/month
- Text to Speech, Speech to Text
Xác minh lần cuối: tháng 9 năm 2026
Pro
5 US$/tháng
Giá công bố (USD) · Nguồn
- 100K credits/month
- $5 prepaid agents/month
- Commercial use license
- Instant voice cloning
Xác minh lần cuối: tháng 9 năm 2026
Startup
49 US$/tháng
Giá công bố (USD) · Nguồn
- 1.25M credits/month
- $49 prepaid agents/month
- Pro voice cloning
- Organizations
Xác minh lần cuối: tháng 9 năm 2026
Scale
299 US$/tháng
Giá công bố (USD) · Nguồn
- 8M credits/month
- $299 prepaid agents/month
- Priority support
- High concurrency limits
Xác minh lần cuối: tháng 9 năm 2026
Cartesia công bố một mức giá chung toàn cầu và thu phí bằng USD. Không có mức giá riêng theo tiền tệ địa phương.
Ảnh chụp màn hình

Công cụ AI liên quan
ElevenLabs
ElevenLabs là dịch vụ AI có thể ứng dụng trong thuyết minh hoặc lồng tiếng dưới dạng AI tạo giọng nói.
Murf AI
Murf AI là dịch vụ thuộc lĩnh vực AI tạo giọng nói, có thể ứng dụng cho lồng tiếng (thuyết minh) và sản xuất video.
Hume AI
API giọng nói xoay quanh cảm xúc: tổng hợp giọng nói, giao diện giọng nói hội thoại và đo biểu cảm.
Speechify
Speechify là dịch vụ thuộc lĩnh vực AI tạo giọng nói, có thể ứng dụng cho đọc sách và khả năng tiếp cận (accessibility).