Ngày 21 tháng 9 năm 2026, xAI ra mắt "Grok 4.7", phiên bản mới của mô hình chủ lực. Công ty cho biết đây là mô hình mạnh nhất của họ dành cho lập trình và công việc tri thức (knowledge work).
Những cải tiến chính
Theo thông báo chính thức, Grok 4.7 dùng một mô hình nền mới, lớn hơn Grok 4.6. Ngoài ra, mô hình được huấn luyện tăng cường (reinforcement learning) lâu hơn trước, với dữ liệu chứa nhiều tác vụ khó cần tới hàng giờ mới hoàn thành.
Theo xAI, nhờ đó mô hình được cải thiện ở các điểm sau:
- Có thể dành nhiều thời gian hơn cho các tác vụ khó
- Tự kiểm tra kết quả công việc của mình kỹ lưỡng hơn
- Xử lý ngữ cảnh dài tốt hơn
- Soạn tài liệu và slide thuyết trình tốt hơn
Các con số chính
Dưới đây là các số liệu chính do xAI công bố:
- 46,3% trên "CursorBench 4.0", bài đánh giá lập trình (Grok 4.6: 40,4%)
- 71,0% trên "DeepSWE v1.1", bài đánh giá phát triển phần mềm (Grok 4.6: 65,2%)
- 19,6% trên "Harvey Legal Agent Benchmark", bài đánh giá nghiệp vụ pháp lý (Grok 4.6: 15,8%)
- 56,7% trên "HealthBench Professional", bài đánh giá suy luận lâm sàng (Grok 4.6: 48,5%)
Về an toàn, Grok 4.7 được trang bị các biện pháp bảo vệ được xây dựng lại từ đầu, và xAI cho biết đây là mô hình từ chối yêu cầu không phù hợp và chống jailbreak tốt nhất trong số những mô hình công ty từng thử nghiệm. Tất cả số liệu đều do xAI tự công bố.
Giá và nơi có thể sử dụng
Giá API cho mỗi triệu token khởi điểm từ 2 USD cho đầu vào và 6 USD cho đầu ra. Ngoài ra còn có phiên bản tốc độ cao cho tốc độ tạo đầu ra gấp đôi, với giá gấp đôi bản thường.
Grok 4.7 có thể dùng trên Cursor, công cụ dành cho nhà phát triển "Grok Build" của xAI và Grok API, cũng như qua các công cụ lập trình, bộ định tuyến mô hình (model router) và dịch vụ đám mây của bên thứ ba.
Góc nhìn của ban biên tập CoAI
Thông báo lần này nhắm rõ vào nhà phát triển và việc sử dụng trong công việc. Việc cho phép dùng trên Cursor ngay từ ngày ra mắt cũng cho thấy xAI muốn Grok được chọn cho các tác vụ lập trình. Khi so sánh với các mô hình lớn khác, ngoài giá, bạn nên xem thêm kết quả của những benchmark sát với nhu cầu sử dụng của mình.