Hosting cho website AI cần được tính theo toàn bộ chuỗi hạ tầng, không chỉ theo dung lượng ổ đĩa hay số lượt truy cập. Khi website gọi mô hình AI, phát video do AI tạo, xử lý ảnh hoặc phục vụ nhiều người dùng đồng thời, các khoản quan trọng thường gồm máy chủ, GPU hoặc CPU, lưu trữ, băng thông đầu ra, điện năng và hệ thống làm mát.
Cách an toàn nhất là tách kiến trúc thành hai phần: website và dịch vụ AI. Website có thể chạy trên máy chủ CPU thông thường, còn mô hình AI được gọi qua API hoặc chạy trên máy GPU riêng. Chỉ nên thuê GPU liên tục khi bạn có tải ổn định, yêu cầu độ trễ thấp hoặc cần kiểm soát dữ liệu và mô hình.
AI hosting là gì và vì sao cách tính khác hosting thường?
AI hosting là gì? Đây là mô hình lưu trữ và vận hành ứng dụng có thành phần trí tuệ nhân tạo, chẳng hạn chatbot, tìm kiếm ngữ nghĩa, nhận diện hình ảnh, tạo nội dung, chuyển giọng nói thành văn bản hoặc hệ thống RAG. Khác với website WordPress thông thường, ứng dụng AI có thể phát sinh tải tính toán lớn ở mỗi yêu cầu.
Một lượt truy cập trang giới thiệu chỉ cần xử lý HTML, cơ sở dữ liệu và tệp tĩnh. Ngược lại, một câu hỏi gửi đến chatbot có thể phải thực hiện xác thực, truy xuất tài liệu, tạo embedding, gọi mô hình, lưu lịch sử hội thoại rồi trả về nhiều token. Nếu có hình ảnh hoặc âm thanh, dung lượng truyền tải còn tăng mạnh.
Vì vậy, bạn nên theo dõi ít nhất sáu chỉ số:
- Số yêu cầu AI mỗi phút và thời điểm cao điểm.
- Thời gian xử lý trung bình và thời gian phản hồi ở phân vị cao, chẳng hạn P95.
- Mức sử dụng CPU, GPU, RAM và VRAM.
- Dung lượng dữ liệu vào, dữ liệu ra và lưu lượng giữa các dịch vụ.
- Dung lượng tài liệu, ảnh, video, log và bản sao lưu.
- Tỷ lệ cache, tỷ lệ lỗi và số yêu cầu phải chạy lại.
Không có một con số cố định cho “chi phí website AI”. Giá thay đổi theo mô hình, khu vực máy chủ, thời lượng GPU hoạt động, chính sách lưu lượng và mức dự phòng. Các nhà cung cấp cloud thường tính riêng máy ảo, GPU, ổ đĩa và dữ liệu truyền ra ngoài; Google Cloud cũng lưu ý giá GPU chưa bao gồm máy ảo, ổ đĩa và networking (theo cloud.google.com).
GPU hosting hay CPU hosting: Chọn theo tải thực tế
Câu hỏi GPU hosting hay CPU hosting không nên trả lời bằng cách chọn phần cứng đắt nhất. Hãy chọn theo loại công việc, kích thước mô hình và yêu cầu phản hồi.
| Tiêu chí | CPU hosting | GPU hosting | Khuyến nghị |
|---|---|---|---|
| Website, API, WordPress | Phù hợp | Thường dư thừa | Dùng CPU cho lớp web |
| Chatbot gọi API bên ngoài | Phù hợp | Không bắt buộc | Tách AI sang nhà cung cấp mô hình |
| Embedding, RAG quy mô nhỏ | Đủ cho tải thấp và chạy theo lô | Hữu ích khi xử lý nhanh hoặc nhiều tài liệu | Đo thời gian xử lý trước khi nâng cấp |
| Fine-tuning hoặc suy luận mô hình lớn | Không hiệu quả | Cần GPU và VRAM phù hợp | Thuê theo giờ hoặc theo phiên |
| Tạo ảnh, video, âm thanh | Không phù hợp khi có tải cao | Gần như bắt buộc | Ưu tiên GPU, lưu trữ đối tượng và CDN |
| Tải không ổn định | Dễ duy trì máy nền | Dễ lãng phí nếu bật 24/7 | Dùng job queue, autoscaling hoặc GPU theo yêu cầu |
GPU không chỉ làm tăng giá thuê máy. Một NVIDIA H100 SXM có mức công suất thiết kế tối đa lên đến 700 W, còn H100 NVL được cấu hình trong khoảng 350–400 W (theo nvidia.com). Đây mới là công suất của GPU, chưa tính CPU, RAM, ổ đĩa, mạng, bộ nguồn và làm mát.
Cách ước tính chi phí GPU
Công thức đơn giản là:
Chi phí GPU tháng = giá thuê mỗi giờ × số GPU × số giờ hoạt động thực tế
Ví dụ, nếu một GPU có giá 1 USD mỗi giờ và chạy 10 giờ mỗi ngày trong 30 ngày, chi phí riêng của GPU là khoảng 300 USD/tháng. Nếu chạy liên tục, con số tăng lên khoảng 720 USD/tháng. Đây là lý do hàng đợi xử lý và cơ chế tắt GPU khi không có việc thường quan trọng hơn việc chỉ tìm GPU có giá thấp.
Với tải không đều, hãy cân nhắc ba cách: chạy worker GPU theo job, dùng máy Spot hoặc preemptible nếu tác vụ có thể bị gián đoạn, và giữ một máy CPU để nhận yêu cầu rồi đưa phần nặng vào hàng đợi. AWS mô tả mô hình On-Demand là trả tiền theo thời gian sử dụng, trong khi các lựa chọn cam kết hoặc Spot có thể phù hợp với nhu cầu khác nhau (theo aws.amazon.com).
Chi phí điện data center, băng thông và hạ tầng cần tính thế nào?
Người thuê hosting thường không nhận hóa đơn điện riêng, nhưng chi phí điện data center vẫn nằm trong giá máy chủ. Trung tâm dữ liệu phải cấp điện cho thiết bị tính toán, lưu trữ, mạng, UPS và hệ thống làm mát. Theo IEA, máy chủ trung bình chiếm khoảng 60% điện năng trong các trung tâm dữ liệu hiện đại; làm mát có thể dao động từ khoảng 7% ở trung tâm siêu hiệu quả đến hơn 30% ở cơ sở kém hiệu quả (theo iea.org).
Để tự ước tính phần điện của máy chủ riêng, bạn có thể dùng:
Điện năng tháng kWh = công suất thiết bị kW × số giờ chạy × hệ số tải × PUE
Ví dụ minh họa: một máy có công suất trung bình 1 kW, chạy 24 giờ mỗi ngày trong 30 ngày, tải trung bình 70% và giả định PUE là 1,4 sẽ tiêu thụ khoảng 706 kWh mỗi tháng. Nếu giá điện quy đổi là 0,10 USD/kWh, phần điện ước tính khoảng 70,6 USD. Đây chỉ là phép tính kỹ thuật; giá thuê thực tế còn bao gồm phần cứng, mặt bằng, nhân sự, mạng, dự phòng, bảo mật và lợi nhuận nhà cung cấp.
Ở quy mô toàn ngành, IEA dự báo điện năng dành cho trung tâm dữ liệu toàn cầu có thể tăng từ khoảng 415 TWh năm 2024 lên gần 945 TWh năm 2030 trong kịch bản cơ sở. Con số này không phải hóa đơn của một website, nhưng cho thấy AI đang làm tăng mật độ công suất và yêu cầu làm mát của hạ tầng (theo iea.org).
Công thức tính băng thông
Tổng băng thông tháng = số lượt tải × dung lượng phản hồi trung bình
Ví dụ, 200.000 lượt xem với mỗi lượt tải trung bình 2 MB tạo ra khoảng 400 GB dữ liệu, chưa tính API, ảnh phụ, video, tải lại và bot. Nếu chatbot trả về tệp PDF, ảnh sinh tự động hoặc âm thanh, dung lượng mỗi phản hồi có thể lớn hơn nhiều lần văn bản.
Đừng chỉ nhìn lưu lượng từ người dùng đến máy chủ. Bạn còn phải tính:
- Lưu lượng từ máy chủ ứng dụng đến nhà cung cấp mô hình AI.
- Truy vấn giữa ứng dụng, cơ sở dữ liệu, kho vector và bộ nhớ đệm.
- Ảnh, video, file tải xuống và bản sao lưu.
- Log, giám sát và dữ liệu truyền giữa các vùng cloud.
Ví dụ, Google Cloud phân biệt dữ liệu đi vào, dữ liệu đi ra Internet và dữ liệu truyền giữa các vùng; dữ liệu đi ra thường là khoản cần đặc biệt kiểm soát (theo cloud.google.com). AWS hiện nêu mức 100 GB dữ liệu truyền ra Internet miễn phí mỗi tháng cho khách hàng EC2, gộp trên nhiều dịch vụ và khu vực, nhưng các điều kiện giá cần được kiểm tra theo tài khoản và khu vực cụ thể (theo aws.amazon.com).
Cách tối ưu băng thông website AI
- Đưa tệp tĩnh lên CDN: ảnh, CSS, JavaScript và video không nên luôn đi qua máy chủ gốc. CDN có thể lưu bản sao gần người dùng và giảm tải origin (theo developers.cloudflare.com).
- Nén và thay đổi kích thước ảnh: tạo ảnh theo kích thước thiết bị, dùng WebP hoặc AVIF khi phù hợp, không gửi ảnh gốc 4K cho một thẻ hiển thị nhỏ. Cloudflare cho biết tối ưu ảnh có thể tạo file nhỏ hơn và giảm băng thông (theo developers.cloudflare.com).
- Giới hạn đầu ra AI: đặt giới hạn token, kích thước ảnh, thời lượng video và số lần thử. Một câu trả lời dài hơn không mặc nhiên hữu ích hơn.
- Cache kết quả an toàn: cache câu hỏi phổ biến, embedding và tài liệu đã xử lý; không cache dữ liệu cá nhân hoặc nội dung phụ thuộc quyền truy cập.
- Dùng hàng đợi cho tác vụ nặng: tạo video, OCR hàng loạt và fine-tuning nên chạy nền thay vì giữ kết nối HTTP mở.
- Theo dõi egress theo tính năng: gắn nhãn lưu lượng cho ảnh, video, API, backup và AI để biết khoản nào thực sự làm hóa đơn tăng.
Điều kiện chuẩn bị tối thiểu gồm một bảng theo dõi số yêu cầu AI, dung lượng phản hồi, thời gian xử lý, CPU/GPU utilization, dung lượng lưu trữ và egress. Sau khi triển khai, kiểm tra kết quả bằng dashboard chi phí, log CDN, tỷ lệ cache hit, tốc độ tải trang và P95 của API. Nếu traffic tăng nhưng cache hit giảm, hãy kiểm tra query string, cookie và header Cache-Control trước khi nâng cấp máy.
Các lỗi thường gặp là thuê GPU 24/7 cho một chatbot có vài trăm lượt hỏi mỗi ngày, đặt cơ sở dữ liệu và GPU ở hai vùng làm phát sinh lưu lượng liên vùng, lưu toàn bộ file sinh ra không có chính sách xóa, và gửi ảnh/video trực tiếp từ origin. Cách khắc phục là chạy GPU theo lịch hoặc theo hàng đợi, đặt các thành phần thường xuyên trao đổi trong cùng vùng, đặt thời hạn lưu trữ và phân phối media qua CDN.
Kết luận: website AI nhỏ nên bắt đầu bằng CPU hosting cho web, API mô hình bên ngoài, kho đối tượng và CDN. Website có tải AI ổn định nên tách worker GPU khỏi máy chủ web để dễ mở rộng và kiểm soát chi phí. Chỉ đầu tư cụm GPU riêng khi bạn đã có dữ liệu sử dụng đủ dài, yêu cầu bảo mật hoặc độ trễ rõ ràng, và chứng minh rằng chi phí tự vận hành thấp hơn thuê theo nhu cầu.

