(Bối cảnh sau đây là một tình huống hư cấu mang tính minh họa. Nhân vật chính, "Ôn Tử Hiên", là hình tượng đại diện dùng để minh họa, không phải khách hàng thật.)

Sếp thả một câu trong nhóm chat

"Công ty bên cạnh đã tự mua GPU để chạy AI rồi. Sao mình vẫn còn trả tiền hóa đơn hàng tháng cho Claude?"

Ôn Tử Hiên là trưởng nhóm kỹ thuật của một startup hơn chục người, nhìn chằm chằm vào câu sếp vừa thả vào nhóm chat, anh không nghĩ ra câu phản bác nào ngay lúc đó. Hóa đơn API Claude của công ty họ quả thật cứ tăng đều mỗi tháng, và gần đây trên mạng tràn ngập những lời khẳng định rằng "chỉ cần một chiếc Mac Studio là đủ để vượt mặt Claude." Sếp anh thêm một câu nữa: "Họp ngân sách tuần sau, mang cho tôi một bản so sánh: tự mua phần cứng hay tiếp tục trả tiền API" — và thế là cả vấn đề này đổ hết lên vai anh.

Trước tiên, tìm một vật thay thế có thể thực sự tính toán được

Điều đầu tiên khiến Ôn Tử Hiên bế tắc khi bắt tay vào tìm hiểu là: không ai thực sự biết cần bao nhiêu GPU để chạy được Claude Fable 5, vì Anthropic chưa bao giờ công bố số lượng tham số, kiến trúc, hay trọng số của nó. Có cả một chuỗi thảo luận dài trên Reddit đoán già đoán non xem cần bao nhiêu H100 để chạy được một model cỡ Fable — có người đoán bốn, có người đoán tám B200, có người còn nói thẳng "bạn cần cả một rack." Câu trả lời loạn xạ, vì chẳng ai thực sự tính toán cả.

Sau đó anh tìm thấy một video tính toán bằng cách dùng Kimi K3 làm vật thay thế, và đó là lúc anh nhận ra: đây mới là cách duy nhất để thực sự tính ra được điều gì đó. Tài liệu chính thức của Kimi K3 công bố 2,8 nghìn tỷ tham số và cửa sổ ngữ cảnh 1 triệu token, và tài liệu ra mắt của nó cũng trực tiếp so sánh với Fable 5 trên các bài benchmark về code và agent — dù blog chính thức của Kimi cũng thừa nhận nhìn chung vẫn còn kém hơn các model đóng mạnh nhất, và điểm benchmark không đồng nghĩa với việc làm tốt công việc thực tế. Vấn đề không phải là khẳng định Kimi K3 có thể thay thế Fable 5; mà là vì Kimi K3 là vật thay thế duy nhất vừa có quy mô ngang tầm frontier vừa có kích thước được công bố minh bạch — điều khiến nó trở thành thứ duy nhất có thể dùng để tính toán thực sự.

Vừa mở phép tính ra, câu trả lời hiện ra ngay lập tức

Kimi K3 lưu trọng số ở định dạng 4-bit gọi là MXFP4. 2,8 nghìn tỷ tham số nhân với nửa byte cho ra khoảng 1,4 terabyte chỉ riêng cho trọng số thô — và đó là chưa tính đến phần mềm suy luận, ngữ cảnh hội thoại, hay bất kỳ khoảng dự phòng an toàn nào. Đó là mức sàn, không phải tổng chi phí.

Ôn Tử Hiên áp phép tính đó vào từng lựa chọn mà công ty có thể chi trả, và lần nào cũng đâm đầu vào tường. Anh kiểm tra trước chiếc Mac Studio cấu hình cao nhất của công ty — 512 GB bộ nhớ hợp nhất, còn chưa bằng một phần ba mức sàn, loại ngay lập tức. Anh nhớ có đồng nghiệp từng nói "bốn cái H100 chắc là đủ" — anh tính thử: mỗi cái 80 GB, bốn cái cộng lại là 320 GB, còn ít hơn cả Mac Studio, vẫn không đủ. Lên cao hơn, một DGX B200 với tám GPU B200 có 1,44 TB bộ nhớ GPU — trên giấy tờ, cuối cùng cũng vượt qua mức sàn — nhưng sau khi trừ trọng số chỉ còn chưa đến 40 GB khả dụng, cửa sổ ngữ cảnh, cache hội thoại, phần mềm suy luận đều phải nhét vừa trong 40 GB đó, không còn chỗ để thở. Anh tiếp tục leo lên và tìm ra DGX B300: tám card, 2,3 TB, sau khi trừ trọng số còn lại gần 900 GB — về mặt lý thuyết, cuối cùng cũng tạm ổn. Chỉ có điều khuyến nghị chính thức của Kimi cho "suy luận hiệu quả" lại là 64 bộ gia tốc trở lên — quy đổi ra là tám máy chủ, không phải một.

Một chiếc DGX B300 chạy hết công suất có mức tiêu thụ điện công bố là 14,5 kW; chạy tám chiếc thì gần chạm mốc 116 kW, chưa tính làm mát. Anh còn thấy có người trong chuỗi thảo luận nói công ty họ vận hành vài chục chiếc B200, và tiếng bật máy "nghe như đang ngồi sau một chiếc Airbus A380." Anh ước tính sơ bộ theo giá thuê công khai hiện nay — tám node như vậy sẽ tốn khoảng từ 313.000 đến 577.000 đô la mỗi tháng. Anh biết đây chỉ là con số tham khảo theo bậc độ lớn, không phải báo giá chính thức, nhưng như vậy đã đủ để cho thấy quy mô hoàn toàn khác so với những gì anh từng tưởng tượng.

Anh tưởng mình đang tính một khoản mua sắm một lần, hóa ra đang tính cả một trung tâm dữ liệu

Đọc đến đây, Ôn Tử Hiên mới nhận ra giả định ban đầu của mình hoàn toàn sai. Anh đã nghĩ sếp muốn "mua vài cái GPU, trả tiền một lần, sau đó không phải đụng đến hóa đơn API nữa" — một khoản chi vốn một lần. Nhưng khi phép tính được mở ra, hóa ra một hệ thống tự vận hành đủ sức chạy model cỡ Fable hoàn toàn không phải là khoản mua sắm phần cứng "mua một lần là xong" — mà là cả một trung tâm dữ liệu vận hành liên tục: điện, làm mát, hạ tầng mạng, và cần người túc trực theo dõi máy móc 24 giờ. Và chi phí hàng tháng đó cao hơn hóa đơn Claude họ đang trả hiện tại đến cả một bậc độ lớn.

Quan trọng hơn nữa, video chỉ ra rằng ngay từ đầu chuỗi thảo luận trên Reddit đã đặt sai câu hỏi: "100 người dùng" không giống với "100 yêu cầu đồng thời." Nếu 100 nhân viên mỗi người gửi một yêu cầu mỗi 10 phút, và mỗi phản hồi chiếm dụng hệ thống trong 30 giây, thì trung bình số yêu cầu thực sự đang chạy cùng lúc chỉ khoảng 5 — AI agent chắc chắn có thể đẩy con số này tăng nhanh, nhưng khi Ôn Tử Hiên quay lại kiểm tra mức sử dụng đồng thời thực tế của chính nhóm mình, con số đó thấp hơn rất nhiều so với những gì anh tưởng tượng.

Thứ anh mang vào phòng họp không phải là báo giá, mà là một câu hỏi

Tại cuộc họp ngân sách tuần sau, Ôn Tử Hiên không mang theo danh sách mua tám chiếc DGX B300 — làm vậy là quá vội. Có người trong video từng vận hành dịch vụ LLM cho hàng nghìn người dùng đã nói một câu mà anh ghi lại: "Một model đủ tốt và có thể mở rộng quy mô thật sự sẽ thắng một siêu model chỉ phục vụ được vài người." Điều đó khớp với một khuôn mẫu khác mà anh tìm thấy — những nhóm thực sự từng tự vận hành model cục bộ gần như không bao giờ "hoàn toàn tự chủ": công việc riêng tư hoặc lặp đi lặp lại thì giao cho model cục bộ nhỏ, còn nhiệm vụ khó nhất vẫn giao cho Claude hoặc GPT.

Thứ Ôn Tử Hiên mang vào phòng họp lại là một câu hỏi ngược: "Chúng ta có thực sự biết mỗi ngày mình dùng bao nhiêu token, bao nhiêu yêu cầu đồng thời không?" Đề xuất của anh là đừng vội quyết định có nên tự vận hành hay không, mà trước tiên hãy phơi bày mức sử dụng thực tế của nhóm — nhiệm vụ nào khối lượng lớn nhưng đơn giản, nhiệm vụ nào ít nhưng nặng — rồi mới quyết định liệu có đáng để đánh đổi hóa đơn API lấy trách nhiệm vận hành cả một trung tâm dữ liệu hay không.

Câu hỏi thường gặp (FAQ)

Câu 1: "Kimi K3" được nhắc đến trong bài là gì? Nó liên quan gì đến Claude Fable 5?

Kimi K3 là một model ngôn ngữ lớn có số lượng tham số được công bố công khai (2,8 nghìn tỷ tham số, kiến trúc mixture-of-experts, cửa sổ ngữ cảnh 1 triệu token), và tài liệu ra mắt của nó từng trực tiếp so sánh với Claude Fable 5 qua các bài benchmark. Vì Anthropic chưa bao giờ công bố số lượng tham số hay kiến trúc của Fable 5, bài viết này (và video nguồn được chuyển thể) chọn Kimi K3 làm vật thay thế "quy mô tương đương nhưng thông số công khai minh bạch" để ước tính phần cứng cần thiết cho việc triển khai cục bộ — không phải khẳng định hai model có năng lực ngang nhau.

Câu 2: Một công ty bình thường có thực sự cần tự mua GPU để chạy model AI cao cấp ở cục bộ không?

Đa số trường hợp là không cần. Kết luận của video nguồn là: những nhóm thực sự từng vận hành model cục bộ gần như không bao giờ "hoàn toàn tự chủ" — model cục bộ nhỏ phù hợp để xử lý công việc riêng tư hoặc lặp đi lặp lại (như tìm kiếm tài liệu, phân loại, viết code thường quy), còn nhiệm vụ khó nhất vẫn giao cho các dịch vụ đám mây như Claude hay GPT. Có đáng để tự vận hành hay không phụ thuộc vào mức sử dụng đồng thời thực tế và kiểu công việc, chứ không phải một phản xạ muốn tiết kiệm chi phí.

Câu 3: Các con số mua sắm và tiền điện trong bài (như 313.000–577.000 đô la mỗi tháng) có phải là báo giá chính xác không?

Không. Những con số này là ước tính sơ bộ theo bậc độ lớn mà người làm video nguồn tự tính dựa trên giá thuê phần cứng và thông số công khai — không phải báo giá chính thức, cũng không phải giá chính thức từ Anthropic, Nvidia hay bất kỳ nhà cung cấp đám mây nào. Chi phí thực tế sẽ khác biệt đáng kể tùy khu vực, nhà cung cấp, và điều khoản hợp đồng; độc giả đánh giá tình huống của riêng mình nên lấy báo giá thực tế làm chuẩn.

Câu 4: "100 người dùng" khác gì với "100 yêu cầu đồng thời"? Vì sao sự khác biệt này lại quan trọng đến vậy?

"Số người dùng" là tổng số người có khả năng sử dụng hệ thống; "số yêu cầu đồng thời" là số yêu cầu hệ thống thực sự phải xử lý tại một thời điểm nhất định — và hai con số này có thể chênh lệch rất lớn. Ví dụ trong bài: nếu 100 nhân viên gửi yêu cầu một cách đều đặn và rải rác, số yêu cầu chạy cùng lúc có thể thấp đến mức chỉ khoảng 5, thấp hơn nhiều so với con số trực giác "100." Sự khác biệt này quyết định trực tiếp cần mua bao nhiêu phần cứng, và đây là điểm dễ bị hiểu sai nhất trong bài — cũng là điểm dễ dẫn đến mua sắm quá mức nhất.

Câu 5: Thay vì đoán mò thông số phần cứng, công ty nên quyết định việc chuyển công việc AI sang hạ tầng cục bộ như thế nào?

Đề xuất của video nguồn là: đừng vội đặt đơn mua hàng — hãy thuê phần cứng trong vài tuần và xem người dùng thật phản ứng ra sao, điều đó có giá trị tham khảo hơn bất kỳ bảng thông số hay biểu đồ benchmark nào. Và trước cả bước thuê để thử nghiệm, bước đầu tiên căn bản hơn là nhìn rõ mô hình sử dụng token và yêu cầu đồng thời thực tế của nhóm bạn — bạn cần biết mình thực sự dùng bao nhiêu, dùng ở đâu, trước khi có đủ cơ sở để bàn xem có đáng đánh đổi khoản chi phí đó lấy trách nhiệm vận hành cả một trung tâm dữ liệu hay không.

Ghi chú nguồn: Bài viết này được chuyển thể từ video do kênh YouTube Kai đăng tải, có tiêu đề "What Would It Cost to Run Claude Fable 5 Locally?", được viết lại theo hình thức tường thuật, không phải dịch từng chữ. Nhân vật chính trong bài viết, "Ôn Tử Hiên", là hình tượng đại diện dùng để minh họa, không phải trường hợp khách hàng thật; bối cảnh và tình huống công ty của anh là một sự tái hiện mang tính minh họa. Mọi con số cụ thể trong bài (quy đổi bộ nhớ, thông số GPU, mức tiêu thụ điện, ước tính chi phí thuê) đều là ước tính theo bậc độ lớn mà người làm video nguồn tự tính dựa trên thông số công khai, không phải dữ liệu được trang này hay bên thứ ba kiểm chứng, kiểm toán độc lập, cũng không phải giá chính thức. Độc giả nên căn cứ vào thông số phần cứng thực tế và báo giá từ nhà cung cấp khi đánh giá tình huống của riêng mình.

Hành Động Ngay

Dù bạn tiếp tục dùng API hay bắt đầu cân nhắc tự vận hành, điều thực sự cần làm rõ trước tiên không phải là "nên mua bao nhiêu GPU," mà là "hiện tại chúng ta thực sự đang dùng bao nhiêu." Thay vì đoán mò cách chữa cho một cơn đau đầu chưa được chẩn đoán, hãy phơi bày trước mức sử dụng token thực tế của từng model, từng nhiệm vụ. Hãy thử dùng AI Token King miễn phí ngay hôm nay, để chúng tôi giúp nhóm của bạn phơi bày mức sử dụng thực tế, để bạn quyết định bằng dữ liệu — chứ không phải bằng một câu như "công ty bên cạnh đã làm rồi."