Câu chuyện chủ quyền AI của Việt Nam đang mắc kẹt ở một tầng quá cao 🇻🇳

· 19 min read · 3712 words · Read in English

Authors

Đây là bản tiếng Việt của bài Vietnam's Sovereign AI Conversation Is Stuck One Layer Too High, viết lại cho bạn đọc trong nước. Cập nhật tháng 8/2026: phần pháp lý đã được bổ sung sau khi Danh mục hệ thống AI rủi ro cao được ban hành.

Tuần trước tôi định đóng gói mô hình speech on-device tốt nhất cho tiếng Việt vào một sản phẩm, rồi phát hiện là không ship được. Mô hình Zipformer tiếng Việt công bố tại VLSP 2025, thứ mà gần như ai làm voice on-device tiếng Việt cũng phải dựa vào, được cấp phép CC-BY-NC-ND-4.0. Phi thương mại. Không được tạo bản phái sinh. Ai muốn bán sản phẩm giọng nói tiếng Việt thì có hai đường: chấp nhận không thu tiền được, hoặc tự huấn luyện mô hình thay thế trên một kho ngữ liệu tiếng nói sạch về pháp lý. Mà kho đó thì đến giờ vẫn chưa có bản mở nào.

Đây mới là chỗ mà cuộc chiến chủ quyền AI của Việt Nam đang thực sự diễn ra. Không phải ở mô hình nền tảng. Câu chuyện về AI chủ quyền cứ quay lại đúng một câu hỏi: Việt Nam có cần một mô hình tiếng Việt 30 đến 70 tỷ tham số, huấn luyện từ đầu, do liên minh nhà nước đứng sau hay không. Việt Nam có những vấn đề lớn hơn và sát sườn hơn ở tầng thấp hơn, và tất cả đều giải được mà không cần đến nguồn vốn cỡ nhà nước.

Ngành này thực ra chia tầng thế nào

Người ta hay chia ngành AI thành ba tầng: silicon và hạ tầng ở dưới, mô hình nền tảng ở giữa, ứng dụng ở trên. Cách chia đó không sai, nhưng gần như vô dụng khi cần định vị Việt Nam năm 2026, vì tầng giữa đang che mất một tầng khác.

Ứng dụng765+ startup AI Việt · phần lớn chỉ là lớp vỏ gọi API của mô hình nước ngoàiĐÃ CÓMô hình nền tảngGreenMind 14B · ViettelSolutions-8B · Nemotron-vi tùy biến · VinAI/Movian (đóng băng)ĐANG HÌNH THÀNHMô hình chuyên biệt · Đánh giá mởDữ liệu sạch giấy phép · Công cụ tuân thủMô hình dấu, văn phong, phương ngữ · ma trận đánh giá chung · corpus tiếng nói CC-BY ·mẫu hồ sơ kỹ thuật và gắn nhãn nội dung AI theo Luật 134/2025KHOẢNG TRỐNGTính toán · hạ tầngFPT AI Factory (hàng nghìn H100) · cụm 22 DGX B200 của Viettel (~1,5 ExaFLOPs FP8)ĐÃ CÓ

Bốn tầng. Câu chuyện chủ quyền AI bị tầng mô hình nền tảng chiếm hết diễn đàn. Đòn bẩy thật của năm 2026 nằm thấp hơn một tầng.

Đọc từ dưới lên. Tính toán là tầng chậm nhất và tốn kém nhất, cần hàng chục năm tích lũy sở hữu trí tuệ và hàng tỷ đô vốn đầu tư hạ tầng, vậy mà Việt Nam đã có năng lực vật lý ở mức ít ai ngờ tới. Mô hình nền tảng thì cứ 12 đến 24 tháng lại có bản mở mới ra, kéo giá trị của lứa trước về mức phổ thông. Làm một cái tốn vài triệu đô và vài năm, mà Việt Nam đã có ba nỗ lực đáng tin cậy đang chạy. Ứng dụng là tầng người dùng nhìn thấy: vốn thấp, cạnh tranh gắt, biên lợi nhuận mỏng dần khi API mô hình ngày càng rẻ.

Tầng gần như ai cũng bỏ qua nằm kẹt giữa mô hình nền tảng và ứng dụng. Mô hình nhỏ chuyên biệt, đánh giá mở, dữ liệu sạch về giấy phép và công cụ tuân thủ không phải "chuyện kỹ thuật vặt". Đó là nơi hiểu biết về tiếng Việt thực sự biến thành phần mềm, nơi lợi thế pháp lý tích lũy theo luật AI mới, và là nơi không cần vốn cỡ nhà nước vẫn cạnh tranh được. Phần còn lại của bài viết là để trả lời một câu: vì sao tầng đó vừa hở nhiều nhất, vừa dễ vào nhất trong năm 2026.

Trong nước đang có sẵn những gì

Người ta hay nói Việt Nam vắng mặt ở tầng mô hình nền tảng. Hai năm trước thì đúng. Giờ thì không còn chính xác nữa.

AI Factory của FPT chạy hàng nghìn GPU NVIDIA H100 từ tháng 1/2025, trong một dự án 200 triệu USD với NVIDIA, phục vụ hơn 18.000 người dùng ở y tế, CNTT và tài chính, nay bổ sung thêm HGX H200 và HGX B300. Viettel vận hành cụm 22 hệ thống NVIDIA DGX B200 đạt khoảng 1,5 ExaFLOPs (FP8) tại Trung tâm Kỹ thuật Hòa Lạc, tự huấn luyện mô hình chuyên biệt tiếng Việt trên nền Llama 3 (Llama3-ViettelSolutions-8B, làm sạch dữ liệu bằng NVIDIA NeMo Curator), đồng thời tùy biến kiến trúc Nemotron cho tiếng Việt. GreenNode, công ty con hạ tầng AI mà VNG lập ra từ việc sáp nhập mảng cloud và AI, ra mắt GreenMind-Medium-14B-R1 hồi tháng 9/2025: LLM suy luận tiếng Việt mã nguồn mở đầu tiên đóng gói sẵn trên NVIDIA NIM, chạy được trên một con H100, mô tả trong bài báo tháng 4/2025 của GreenNode.

Chuyện VinAI phức tạp hơn các dòng tít nhiều. Tháng 4/2025, Vingroup bán 65% MovianAI cho Qualcomm với giá 67 triệu USD. Đọc theo tít thì đó là "Việt Nam mất phòng lab AI hàng đầu". Nhìn vào thực tế vận hành thì khác: TS. Bùi Hùng, từng làm ở Google DeepMind, vẫn dẫn dắt đội ngũ từ Hà Nội. Người vẫn ở lại Việt Nam. Tổ chức vinai trên Hugging Face ghi rõ: "Effective April 1, 2025, Qualcomm acquired VinAI's Research and GenAI teams. Consequently, this Hugging Face organization is no longer being updated with new models or datasets." PhoBERT, BARTpho, ViT5, PhoWhisper, PhoGPT: cả họ mô hình xương sống mà cộng đồng vẫn mặc định dùng đều đóng băng từ ngày đó. Chúng vẫn được dùng rất nhiều, đơn giản vì chưa có gì thay thế.

Tóm lại: trong nước có năng lực tính toán do người Việt sở hữu ở quy mô lớn, ba nỗ lực làm mô hình nền tảng tiếng Việt đang chạy (một mã nguồn mở, hai chạy production), và một họ mô hình đã đóng băng nhưng vẫn là lựa chọn mặc định. Đó không phải một tầng 2 trống rỗng. Đó là một tầng 2 đã có người làm, đã có đà, nhưng các bên không nói chuyện với nhau.

Khoảng trống nằm ở đâu

Khoảng trống nằm ngay dưới tầng mô hình nền tảng. Ba thứ đang thiếu, và cả ba đều làm được mà không cần vốn cỡ nhà nước.

Đánh giá mở. Chưa có bộ benchmark mô hình ngôn ngữ tiếng Việt nào phân tầng theo văn phong và phương ngữ, được trích dẫn rộng rãi, mà các bên đang làm mô hình cùng công nhận. Bên ra benchmark tiếng Việt công khai nhiều nhất là UIT-VNUHCM: UIT-ViQuAD, ViLexNorm, ViGLUE, VLUE, và corpus tiếng Việt đa phương ngữ tại EMNLP 2024. Bộ nào cũng tốt. Nhưng chưa ai ghép chúng lại thành một ma trận đánh giá chung để các bên đang làm mô hình tiếng Việt (FPT, Viettel, GreenNode, AITeamVN, 5CD-AI) cùng đối chiếu số liệu. Ai dựng được ma trận ấy trong năm 2026 sẽ là người định nghĩa "tiếng Việt tốt" nghĩa là gì, trong mọi bài báo suốt một thập kỷ sau. Nước cờ đó có đòn bẩy lớn hơn việc làm thêm một mô hình nền tảng: mô hình nền tảng chỉ 12 đến 24 tháng là thành hàng phổ thông, còn benchmark thì định hình cả lĩnh vực suốt mười năm.

Dữ liệu tiếng Việt sạch về giấy phép. Chuyện sherpa-onnx ở đầu bài là hồi chuông báo động, và nó không phải trường hợp cá biệt. Corpus VIVOS của AILAB-VNUHCM được dùng rộng rãi, nhưng chỉ 15 giờ và bản thân nó là CC-BY-NC-SA-4.0, tức chỉ dùng được cho học thuật. Mozilla CommonVoice tiếng Việt là CC0 nhưng quy mô nhỏ, đọc theo kịch bản chứ không phải nói tự nhiên, chủ yếu là câu ngắn. Các mô hình ASR tiếng Việt đủ sức cạnh tranh đều huấn luyện trên corpus ghép từ ViVoice, PhoAudioBook và dữ liệu test VLSP gán nhãn giả, phần lớn mang giấy phép hạn chế hoặc chưa ai kiểm chứng theo từng nguồn. Đó là lý do mô hình đầu ra kéo theo điều khoản phi thương mại cho mọi sản phẩm dùng lại nó. Hiện chưa có corpus tiếng nói tiếng Việt CC-BY nào cỡ 1000 đến 2000 giờ, thứ mà một doanh nghiệp nhỏ và vừa cần để xây sản phẩm giọng nói một cách hợp pháp. Một đợt gán nhãn có tổ chức, tốn khoảng 200 đến 500 nghìn USD, đủ để gỡ nút thắt này vĩnh viễn cho cả ngành.

Mô hình chuyên biệt gắn với tuân thủ. Đây từng là khoảng trống mơ hồ cho tới tháng 12/2025. Giờ nó có hạn chót rõ ràng, và từ tháng 8/2026 thì có luôn danh sách cụ thể.

Luật đổi bài toán, và Danh mục vừa siết lại

Luật 134/2025/QH15, luật AI độc lập đầu tiên của Việt Nam, có hiệu lực từ 1/3/2026. Đây là luật AI độc lập và có tính ràng buộc pháp lý đầu tiên ở Đông Nam Á, đi trước Singapore, Indonesia và Malaysia, những nước đến giờ vẫn chỉ có khung quản trị AI tự nguyện chứ chưa thành luật.

Luật đòi hỏi gì ở nhà cung cấp AI rủi ro cao (Điều 14):

  • Biện pháp quản lý rủi ro, rà soát định kỳ.
  • Quản trị chất lượng dữ liệu huấn luyện và vận hành: nguồn gốc, cân bằng, truy vết được.
  • Hồ sơ kỹ thuật và nhật ký vận hành đủ để đánh giá sự phù hợp và thanh tra sau triển khai.
  • Thiết kế cơ chế để con người giám sát và can thiệp được.
  • Minh bạch và xử lý sự cố, gồm cả gắn nhãn máy đọc được cho nội dung do AI tạo ra (Điều 11.2).
  • Giải thích được: mô tả chức năng, loại dữ liệu đầu vào, cách quản lý rủi ro, cung cấp cho cơ quan quản lý, người dùng và người bị ảnh hưởng. Mã nguồn và trọng số không nằm trong nghĩa vụ công bố, nhưng hành vi vận hành thì có.

Nhà cung cấp nước ngoài phải chỉ định đại diện pháp lý tại Việt Nam. Bộ Khoa học và Công nghệ là cơ quan chủ trì.

Ở thời điểm bài này lên trang, Danh mục hệ thống AI rủi ro cao vẫn còn là dự thảo, và đó là ẩn số lớn nhất.

Cập nhật tháng 8/2026. Ẩn số đó đã có lời giải. Thủ tướng Chính phủ ban hành Quyết định 33/2026/QĐ-TTg ngày 30/6/2026, do Phó Thủ tướng Hồ Quốc Dũng ký, công bố 46 hệ thống AI rủi ro cao thuộc sáu lĩnh vực: giáo dục, dân tộc và tôn giáo, y tế, ngân hàng, tố tụng, và giao thông vận tải. Riêng giao thông vận tải chiếm 31 hệ thống, nhóm lớn nhất. Quyết định có hiệu lực từ 15/8/2026.

Lộ trình tuân thủ cho các hệ thống đã vận hành trước ngày 15/8/2026:

  • Trước 1/9/2027 với hệ thống thuộc lĩnh vực y tế, giáo dục và tài chính.
  • Trước 1/3/2027 với các lĩnh vực còn lại trong Danh mục.

Nếu bạn đang vận hành một sản phẩm AI thuộc sáu lĩnh vực đó thì đồng hồ đã bắt đầu chạy: nhiều nhất là mười tám tháng, ít nhất là sáu tháng.

Điều 25.1 có một khoản ít ai để ý mà lẽ ra phải để ý: doanh nghiệp nhỏ và vừa (DNNVV) cùng startup được luật cho quyền nhận miễn phí mẫu hồ sơ và công cụ tự đánh giá. Nhà nước có nghĩa vụ cung cấp. Đây rõ ràng là một lời mời gọi làm bộ công cụ tuân thủ mã nguồn mở. Ai ra trước thì bộ của người đó thành bản tham chiếu mặc định cho cả đợt chạy đua tuân thủ của khối DNNVV giai đoạn 2026 đến 2027.

Một mô hình nền tảng nước ngoài, tự thân nó, không đáp ứng nổi loạt yêu cầu này. Một sản phẩm triển khai tại Việt Nam xây trên mô hình nước ngoài thì đáp ứng được, nhưng chỉ khi bạn lắp thêm phần sinh hồ sơ, nhật ký vận hành, gắn nhãn nội dung AI, lớp giải thích được, và phân loại rủi ro. Chính mấy thứ lắp thêm đó mới là phần việc chủ quyền AI thật sự của hai năm tới. Chúng không phải một mô hình 70B. Chúng là một loạt công cụ tuân thủ và vận hành chẳng hào nhoáng gì, mà chưa ai chịu rót vốn vào.

Tôi đang làm gì, và không làm gì

Tôi đang bắt tay vào hai mảnh trong số đó, dưới nrl-ai, và tôi muốn nói thật cả về hiện trạng lẫn chỗ còn thiếu.

nom là một package NLP tiếng Việt: khôi phục dấu, sửa chính tả, phân loại văn phong, truy xuất, OCR với chỉ số đánh giá có tính đến dấu, và các tập đánh giá ghi rõ giấy phép. Trọng tâm là tầng mô hình nhỏ chuyên biệt và tầng đánh giá, không phải mô hình nền tảng. Giấy phép MIT và Apache, dependency ghim phiên bản, benchmark chạy được. Module nom.compliance đang trong giai đoạn thiết kế, bám sát từng điều khoản cụ thể của Luật 134/2025/QH15: mẫu hồ sơ kỹ thuật đánh phiên bản theo các nghị định sắp ban hành, công cụ gắn nhãn nội dung AI theo chuẩn C2PA kèm phương án sidecar cho môi trường chưa có profile Việt Nam được phê chuẩn, và công cụ để DNNVV tự phân loại mức rủi ro theo Điều 25.1.

edgevox là hạ tầng mã nguồn mở cho voice agent tiếng Việt chạy thẳng trên thiết bị. Sherpa-ONNX Zipformer ASR, cộng Piper Vietnamese TTS, cộng một lớp tool-calling bằng mô hình ngôn ngữ nhỏ với đầu ra ràng buộc theo grammar. Thiết bị đích là một chiếc laptop chạy CPU, một Raspberry Pi 5, hay một Jetson Orin Nano, chứ không phải GPU trên cloud.

Những điều tôi chưa dám tuyên bố:

  • Chưa có số TTFT đo được trên một lớp thiết bị cụ thể. Bộ bench thì tôi vẫn đang làm. Khi có số, chúng sẽ nằm trong repo kèm warmup, best-of-N, ghi rõ phần cứng và phiên bản dependency. Không nằm trong tài liệu marketing. Nếu bạn thấy một con số độ trễ voice on-device tiếng Việt trong thông cáo báo chí mà không kèm quy trình đo, cứ coi nó là hư cấu.
  • Giấy phép ASR thượng nguồn vẫn chưa gỡ được. Vấn đề CC-BY-NC-ND-4.0 mà tôi mở đầu bài áp cho mọi dự án voice on-device tiếng Việt dùng mô hình thắng VLSP 2025, kể cả dự án của tôi. Gỡ ở tầng dữ liệu thì có trong roadmap, nhưng cần một đợt gán nhãn có trả tiền, hoặc một corpus tiếng nói mở do cộng đồng tài trợ. Cả hai đều không phải việc một người làm nổi.

Còn đây là những gì tôi không làm, mà một liên minh thì thừa sức:

  • Một liên minh đánh giá tiếng Việt giữa UIT-VNUHCM, JAIST Nguyen Lab, VNU-UET và các nhóm mở độc lập đang hoạt động. Sạch về giấy phép. Phân tầng theo văn phong. Có tính đến phương ngữ. Để mọi bên làm mô hình tiếng Việt lấy đó làm chuẩn mà công bố số liệu. Việc này cần ba cuộc họp, không phải ba năm.
  • Một corpus tiếng nói tiếng Việt CC-BY cỡ 1000 đến 2000 giờ. Khoảng 200 đến 500 nghìn USD tiền gán nhãn. Một tổ chức, hoặc một liên minh phối hợp tốt, làm một lần, để mọi dự án voice on-device tiếng Việt trong mười năm tới xây hợp pháp lên trên đó.
  • Một bộ công cụ tuân thủ mã nguồn mở làm mẫu cho Điều 25.1: mẫu hồ sơ, quy trình tự đánh giá, gắn nhãn nội dung AI, bộ phân loại mức rủi ro. Bộ Khoa học và Công nghệ có nghĩa vụ pháp lý cung cấp thứ tương đương. Về đích trước họ đồng nghĩa với việc bạn là người đặt ra quy ước. Danh mục đã có hiệu lực và hạn tháng 3/2027 đang tới gần, nên cơ hội này đang hẹp lại rất nhanh.

Người làm nghề nên làm gì trong quý này

Nếu bạn là kỹ sư ML người Việt: khi câu chuyện xoay quanh những liên minh 10 triệu đô, cám dỗ lớn nhất là buông xuôi. Phản ứng có ích hơn nhiều là làm xong một thứ nhỏ nhưng cộng dồn được.

Chọn một. Làm xong trước cuối năm.

  • Công bố một tập đánh giá tiếng Việt sạch về giấy phép, ít nhất 1.000 mẫu cho mỗi ô phân tầng, có tài liệu nguồn, kèm bộ bench chạy được. Năm sao GitHub và mười lượt tải trong tháng đầu đã là thành công. Từ đó nó tự cộng dồn.
  • Huấn luyện một mô hình tiếng Việt chuyên biệt (khôi phục dấu, phân loại văn phong, ASR phương ngữ, reranker pháp lý) dưới 1 tỷ tham số, giấy phép MIT hoặc Apache, kèm model card có số liệu kiểm chứng được từ một script đo đã commit. Đẩy lên Hugging Face ở một URL ổn định.
  • Demo một luồng inference tiếng Việt chạy thẳng trên một lớp thiết bị cụ thể (Jetson Orin Nano, Raspberry Pi 5, laptop Apple Silicon, laptop CPU Intel tầm trung). Công bố TTFT, RTF và bộ nhớ đỉnh, kèm quy trình warmup và best-of-N. Chỉ một điểm dữ liệu đo đạc nghiêm túc thôi cũng đã nhiều hơn tất cả những gì bản tổng quan ASR/SER của VLSP 2025 công bố.

Chọn một. Làm dưới tên thật, với số liệu kiểm chứng được. Đó là phần đang nằm trong tay bạn hôm nay, và Việt Nam đã có sẵn các mảnh ở tầng trên lẫn tầng dưới để nó có giá trị.

Câu chuyện chủ quyền AI đang mắc kẹt ở một tầng quá cao. Việc quyết định thế nào là "tiếng Việt tốt" trong AI, cho cả một thập kỷ tới, nằm thấp hơn một tầng. Và nó không chờ ai cho phép.

What matters

  1. 1Việt Nam đã có năng lực tính toán quy mô lớn (FPT AI Factory, cụm DGX B200 của Viettel), ba nỗ lực làm mô hình nền tảng tiếng Việt đang chạy (GreenMind, ViettelSolutions-8B, Nemotron-vi), và luật AI ràng buộc đầu tiên ở Đông Nam Á. Cách nói "Việt Nam thiếu tầng 2" đã lạc hậu hai năm.
  2. 2Khoảng trống chủ quyền thật nằm thấp hơn một tầng: hạ tầng đánh giá mở, corpus tiếng nói và văn bản tiếng Việt sạch về giấy phép, và mô hình chuyên biệt hiện thực hóa Luật 134/2025.
  3. 3Quyết định 33/2026/QĐ-TTg có hiệu lực từ 15/8/2026, liệt kê 46 hệ thống AI rủi ro cao thuộc sáu lĩnh vực. Hạn tuân thủ là 1/3/2027 cho hầu hết lĩnh vực, 1/9/2027 cho y tế, giáo dục và tài chính. Đồng hồ đã chạy.
  4. 4Điều 25.1 cho phép doanh nghiệp nhỏ và vừa cùng startup nhận miễn phí mẫu hồ sơ và công cụ tự đánh giá. Ai làm xong bản tham chiếu mã nguồn mở trước sẽ là người đặt ra quy ước cho cả đợt chạy đua tuân thủ.
  5. 5Với người làm nghề: làm xong một tập đánh giá mở, một mô hình chuyên biệt, hoặc một demo chạy trên thiết bị cụ thể kèm số đo thật, trước cuối năm. Dưới tên thật, dưới một giấy phép ổn định.