🇰🇷  Hàn Quốc, giải mã  →

AI Compute Giải Mã, Phần 1: Chip AI Thực Sự Là Gì (2026)

Khởi đầu dễ hiểu cho ngành phần cứng AI: chip là gì, tại sao AI cần loại chip riêng, huấn luyện và suy luận có nghĩa gì, và tại sao bộ nhớ mới là nút cổ chai thực sự.

Cập nhật: tháng 8 năm 2026

Đã đối chiếu với 3 nguồn chính thức. Cập nhật tháng 8 năm 2026. Mọi con số đều dẫn nguồn.

Thông tin quan trọng

  • Chip là miếng silicon phủ đầy transistor (công tắc đóng mở siêu nhỏ). Một chip AI hiện đại chứa số lượng transistor khổng lồ, nhiều hơn bất kỳ thế hệ chip nào trước đó.
  • Tên node quy trình như 2nm là nhãn marketing, không phải phép đo thực tế. Không có chi tiết nào trên chip 2nm thực sự rộng 2 nanomet.
  • Huấn luyện là xây dựng mô hình AI, chi phí lớn chỉ xảy ra một lần. Suy luận là sử dụng mô hình đó, chi phí nhỏ lặp lại mỗi khi có người dùng sản phẩm.
  • Chip AI bị giới hạn không phải bởi tốc độ tính toán mà bởi băng thông bộ nhớ, tức tốc độ truyền dữ liệu tới bộ xử lý. Đây gọi là bức tường bộ nhớ.
  • Bộ nhớ Băng thông Cao (HBM) giải quyết vấn đề này bằng cách xếp chồng các chip nhớ theo chiều dọc và đặt chúng trên cùng gói với bộ xử lý, cách nhau vài milimet thay vì vài centimet.
  • Nvidia báo cáo doanh thu trung tâm dữ liệu kỷ lục 75,2 tỷ USD trong quý kết thúc tháng 4 năm 2026, tăng 92% so với cùng kỳ năm trước.
Chia sẻWhatsAppTelegramEmailGửi cho người có thể cần.
From Seoulstart

Tóm gọn

Đây là phần 1 trong loạt bài sáu phần về ngành phần cứng AI. Bài không yêu cầu bạn biết gì về chip bán dẫn, và bắt đầu từ điều cơ bản nhất. Đến cuối loạt bài, bạn sẽ có thể giải thích toàn bộ chuỗi cung ứng cho người khác: ai làm gì, tại sao chỉ một số công ty kiểm soát các điểm thắt cổ chai, điều gì giới hạn tốc độ tăng trưởng về mặt vật lý, và Hàn Quốc đứng ở đâu trong tất cả đó.

Không ai cần hiểu điều này để qua ngày ở Seoul. Nhưng nếu bạn sống ở Hàn Quốc, ngành này đang âm thầm định hình hóa đơn điện, ngân sách quốc gia, giá trị đồng won trong tài khoản của bạn, và thị trường việc làm. Hiểu được ngành này là điều đáng làm.

Chip thực sự là gì

Bắt đầu với cát. Cát thông thường chủ yếu là silicon dioxide. Tinh chế đủ sâu, bạn có được silicon với độ tinh khiết mà hầu như không có gì trong ngành sản xuất yêu cầu. Kéo thành tinh thể hình trụ đơn, cắt thành đĩa tròn đường kính khoảng 30 centimet, và bạn có một tấm wafer: tờ giấy trắng mà mọi chip được xây dựng trên đó.

Silicon là chất bán dẫn, nghĩa là nó dẫn điện trong một số điều kiện và không dẫn trong điều kiện khác. Tính chất đó cho phép bạn tạo ra một công tắc không có bộ phận chuyển động. Áp điện áp nhỏ vào một đầu và dòng điện chạy giữa hai đầu kia. Ngắt điện và dòng điện dừng lại. Công tắc đó là transistor, và đó là thứ duy nhất mà chip thực sự được làm từ.

Một transistor là một công tắc. Nối vài cái lại và bạn có thể tạo mạch thực hiện logic đơn giản: AND này, OR kia, NOT kia. Nối hàng triệu cái và bạn có thể cộng số. Nối một số lượng khổng lồ lại và bạn có thể chạy mô hình AI.

Quy mô ở đây khó mà hình dung ra được. Một bộ xử lý AI cao cấp nhồi số lượng transistor khổng lồ vào một mảnh silicon gần bằng con tem bưu chính, nhiều hơn nhiều so với chip từ vài năm trước. Chúng không được lắp từng cái một, điều đó bất khả thi, mà được in ra: chiếu mẫu ánh sáng lên tấm wafer phủ hóa chất, hiện hình như phim nhiếp ảnh, rồi khắc và lắng đọng vật liệu qua mẫu đó. Bước in đó gọi là lithography, và đó là thứ khó nhất trong ngành. Phần 3 giải thích tại sao một công ty Hà Lan lại độc quyền hoàn toàn các máy EUV dùng cho những lớp tiên tiến nhất.

Tại sao "2nm" không phải một phép đo

Bạn sẽ liên tục thấy chip được mô tả theo node quy trình: 7nm, 5nm, 3nm, 2nm. Hiểu theo nghĩa đen thì những con số này có vẻ là kích thước của cái gì đó. Và xưa kia đúng là vậy. Nhưng đã hơn một thập kỷ rồi chúng không còn nghĩa đó nữa.

Ngày nay đây là nhãn thế hệ, gần giống năm dòng xe hơi hơn là thông số kỹ thuật. Chip 2nm không có chi tiết nào thực sự rộng 2 nanomet. Điều nhãn hiệu này cho biết là nhà sản xuất có thể nhồi transistor dày đặc hơn so với thế hệ trước, thường đổi lại bằng hiệu suất tốt hơn và tiêu thụ điện thấp hơn cho cùng khối lượng công việc.

Có hai hệ quả thực tế. Thứ nhất, tên gọi không thể so sánh giữa các hãng. 2nm của hãng A chưa chắc dày đặc hơn 3nm của hãng B vì mỗi hãng tự đặt tên node của mình nhé. Thứ hai, tên marketing là thước đo kém cho chất lượng chip. Điều quan trọng là mật độ transistor, hiệu quả năng lượng, và yield, tức tỷ lệ phần trăm chip trên mỗi tấm wafer ra đúng tiêu chuẩn. Yield là con số các nhà sản xuất giữ kín nhất, vì một node có thông số xuất sắc nhưng yield kém thì lỗ tiền trên mỗi tấm wafer.

Tại sao AI cần loại chip khác

Hãy nghĩ đến sự khác biệt giữa một nhóm nhỏ chuyên gia cấp cao và một sân vận động đầy người cầm máy tính.

CPU là nhóm nhỏ đó. Nó có số lượng nhân mạnh vừa phải, mỗi nhân xử lý được những lệnh phức tạp, khó đoán và quyết định bước tiếp theo. Đó chính xác là thứ hệ điều hành cần: nhiều tác vụ khác nhau, mỗi tác vụ có logic riêng, đến không theo thứ tự cố định.

GPU là sân vận động đó. Nó có rất nhiều nhân đơn giản, mỗi nhân ít mạnh hơn nhiều so với từng cái, nhưng tất cả làm cùng một thao tác vào cùng một lúc trên các phần dữ liệu khác nhau. GPU được tạo ra cho đồ họa, khi công việc là tính màu sắc cho hai triệu pixel cùng một lúc, và mỗi pixel cần cùng một loại phép tính.

Hóa ra AI cũng có hình dạng đó. Phía sau giao diện, chạy một mô hình AI chủ yếu là một thao tác: nhân ma trận, một cách có cấu trúc để nhân các lưới số lớn với nhau và cộng kết quả. Đó là phép toán một đứa trẻ mười tuổi có thể làm. Chỉ là số lượng phép toán là không thể tưởng tượng được. Đây là bài toán sân vận động, không phải bài toán đội chuyên gia, đó là lý do ngành card đồ họa tình cờ tìm thấy mình ở trung tâm của trí tuệ nhân tạo.

Không phải mọi chip AI đều là GPU. Một số công ty công nghệ lớn tự thiết kế accelerator riêng, bỏ qua hẳn gốc gác đồ họa và nhắm thẳng vào toán học AI: TPU của Google, Trainium và Inferentia của Amazon, MTIA của Meta. Đây là các ASIC, tức mạch tích hợp chuyên dụng, và sự đánh đổi rất rõ ràng. Chúng hiệu quả hơn trong công việc hẹp mà chúng được tạo ra và vô dụng với bất kỳ thứ gì khác. Phần 2 nói về ai xây dựng những chip này và tại sao một công ty lại chịu chi phí đó.

Huấn luyện và suy luận là hai bài toán khác nhau

Gần như mọi khẳng định khó hiểu về kinh tế AI trở nên rõ ràng hơn khi bạn tách hai khái niệm này ra.

Huấn luyện là xây dựng mô hình. Bạn lấy một lượng văn bản, hình ảnh hoặc dữ liệu khác khổng lồ, chạy qua mạng chứa số lượng tham số khổng lồ, so sánh đầu ra với câu trả lời đúng, rồi điều chỉnh mỗi tham số một chút theo hướng giảm sai số. Rồi làm lại, và lại, trong thời gian dài trên số lượng chip rất lớn chạy liên tục. Huấn luyện là chi phí lớn, tập trung, chỉ xảy ra một lần. Đây là thứ người ta muốn nói khi nói một tòa nhà trung tâm dữ liệu tiêu thụ điện bằng một thành phố cỡ vừa.

Suy luận là sử dụng mô hình đã xong. Bạn gửi câu hỏi, mô hình đọc tham số, tính toán, và đưa ra câu trả lời. Mỗi lần suy luận đơn lẻ là rất nhỏ so với huấn luyện. Nhưng nó xảy ra mỗi lần bất kỳ ai ở bất kỳ đâu dùng sản phẩm, mà hiện nay nghĩa là hàng tỷ lần mỗi ngày.

Ngành này trải qua năm 2023 và 2024 bị chi phối bởi nhu cầu huấn luyện. Trọng tâm đang dịch chuyển sang suy luận, vì một khi mô hình đã tồn tại, chi phí phục vụ nó không bao giờ dừng. Sự dịch chuyển này quan trọng về mặt thương mại: suy luận đòi hỏi hiệu quả và chi phí thấp mỗi câu trả lời, là cuộc cạnh tranh khác với hiệu suất huấn luyện thuần túy, và là cơ hội mà các nhà thiết kế chip chuyên biệt, bao gồm hai startup Hàn Quốc được đề cập ở phần 6, đang cố khai thác.

Bức tường bộ nhớ, và đây mới là câu chuyện thực sự

Thật ra đây là điều mà hầu hết các bài giải thích bỏ qua, và là lý do Hàn Quốc quan trọng.

Bạn sẽ nghĩ yếu tố giới hạn của một chip AI là tốc độ tính toán. Thường thì không phải vậy. Bộ xử lý có thể làm phép toán nhanh hơn đáng kể so với phần còn lại của hệ thống có thể cung cấp số liệu cho nó. Cung cấp quá chậm và bộ xử lý đắt tiền ngồi không, chờ đợi. Kỹ sư gọi đây là bức tường bộ nhớ.

Lý do là vật lý. Tham số của một mô hình AI phải được lưu ở đâu đó, và có quá nhiều để giữ bên trong bộ xử lý. Vậy chúng sống trong các chip nhớ gần đó, và mỗi phép tính đều cần lấy chúng qua một kết nối. Kết nối đó có độ rộng cố định và tốc độ cố định. Lượng dữ liệu nó có thể chuyển mỗi giây gọi là băng thông, và băng thông là thứ cạn trước.

Có một ví von đơn giản: bộ xử lý là đầu bếp có thể nấu nhanh đến kinh ngạc, và băng thông bộ nhớ là chiều rộng cửa bếp. Thuê đầu bếp nhanh hơn không giúp gì nếu nguyên liệu chỉ vào được từng thứ một.

Đó là lý do chip nhớ không còn là hàng hóa nhàm chán nữa. Trong hàng thập kỷ, chip nhớ được bán chủ yếu theo giá mỗi gigabyte, trong chu kỳ tàn khốc của dư thừa và thiếu hụt. AI đã đổi câu hỏi từ "bạn lưu được bao nhiêu" thành "bạn có thể giao nhanh bao nhiêu", và những công ty có thể trả lời câu hỏi thứ hai thấy mình đang bán thứ khó thay thế hơn nhiều đấy.

HBM là gì, nói cụ thể

Câu trả lời của ngành cho bức tường bộ nhớ là Bộ nhớ Băng thông Cao (HBM). Ba ý tưởng, xếp chồng theo nghĩa đen và nghĩa bóng.

Đi theo chiều dọc. Thay vì xếp chip nhớ cạnh nhau, xếp chồng lên nhau, mười mấy lớp, thành một tháp.

Khoan thẳng xuyên qua. Kết nối các lớp bằng hàng nghìn kênh dọc đục xuyên qua chính silicon, gọi là through-silicon via. Điều này cho đường truyền dữ liệu rộng hơn rất nhiều so với dẫn tín hiệu vòng quanh cạnh.

Đặt sát bên cạnh. Đặt cả tháp đã hoàn chỉnh trên cùng gói với bộ xử lý, cách nhau vài milimet thay vì vài centimet, trên lớp đế chung truyền tín hiệu giữa chúng.

Kết quả là đường truyền dữ liệu rộng hơn bộ nhớ thông thường nhiều lần. Chi phí là việc sản xuất thực sự rất khó. Bạn đang gắn kết những tháp silicon mỏng như giấy với dung sai căn chỉnh siêu nhỏ, và một lớp xấu làm hỏng cả tháp. Yield thấp hơn và giá cao hơn nhiều so với bộ nhớ thông thường.

Chỉ có ba công ty sản xuất HBM ở quy mô lớn: SK Hynix, Samsung và Micron. Hai trong số đó là công ty Hàn Quốc. Trong quý đầu tiên năm 2026, Counterpoint Research xếp SK Hynix ở mức 58% thị phần HBM, với Samsung và Micron cùng ở mức 21%. Thống kê đơn lẻ đó là phần lớn lý do Hàn Quốc không phải là khán giả trong cơn bùng nổ AI.

Từ chip tới trung tâm dữ liệu

Thêm một chút từ vựng, vì những bước nhảy về quy mô là nơi hay gây bối rối. Từ nhỏ đến lớn:

Die là mảnh silicon chính nó, được cắt từ tấm wafer.

Package là die cộng với các tháp HBM của nó, được lắp cùng nhau trên đế kết nối chúng, rồi được niêm phong. Khi người ta nói "chip" thường ý là cái này. Lắp ráp nó gọi là đóng gói tiên tiến, và đây là điểm nghẽn theo cách riêng của nó, được đề cập ở phần 3.

Bo mạch và máy chủ giữ nhiều package lại với nhau cùng CPU, lưu trữ, hệ thống phân phối điện và làm mát, trong vỏ máy trượt vào giá đỡ.

Rack là tủ máy chủ được nối dây với nhau chặt chẽ đến mức chúng hoạt động như một bộ xử lý lớn. Đây là nơi phần cứng AI bắt đầu không còn giống máy tính thông thường. Một rack AI thế hệ hiện tại tiêu thụ hơn một trăm kilowatt, nhiều hơn một tòa nhà chung cư nhỏ, tập trung vào một tủ khoảng kích thước tủ quần áo. Không khí không thể tản nhiệt đó, nên các rack này được làm mát bằng chất lỏng dẫn thẳng tới chip.

Cluster là hàng nghìn rack được kết nối bằng mạng tốc độ cao chuyên biệt, vì huấn luyện một mô hình lớn nghĩa là mỗi chip liên tục trao đổi kết quả với mọi chip khác. Mạng không chỉ là ống nước ở đây; nó là một phần của máy tính, và phần 2 giải thích tại sao điều đó khiến chip mạng trở thành một mảng kinh doanh lớn.

Trung tâm dữ liệu là tòa nhà, nguồn điện, hệ thống làm mát và hệ thống cấp nước. Ngành ngày càng đo lường chúng bằng công suất điện gigawatt thay vì mét vuông hay số lượng máy chủ, điều đó cho bạn biết giới hạn thực sự đã trở thành gì. Phần 4 nói về giới hạn đó.

Tại sao số tiền lại lớn đến vậy

Để đưa ra một con số về nhu cầu: Nvidia báo cáo doanh thu trung tâm dữ liệu kỷ lục 75,2 tỷ USD cho quý đơn kết thúc vào tháng 4 năm 2026, tăng 92% so với cùng quý năm trước. Đó là một công ty, một dòng sản phẩm, ba tháng.

Con số đó tồn tại vì bốn công ty đám mây Mỹ lớn nhất đang chi tiêu ở quy mô hiếm có tiền lệ trong thời bình, và vì mỗi chip đó cần bộ nhớ, đóng gói, mạng, một tòa nhà và kết nối điện. Mỗi lớp của chuỗi đó có người dẫn đầu riêng, kinh tế học riêng và điểm nghẽn riêng.

Phần 2 lập bản đồ toàn bộ chuỗi, từng lớp một, và đặt tên người dẫn đầu từng lớp.

Chia sẻWhatsAppTelegramEmailGửi cho người có thể cần.

Advertisement

Hướng dẫn liên quan

Câu hỏi thường gặp

CPU và GPU khác nhau như thế nào?

CPU (bộ xử lý trung tâm) được thiết kế để làm ít việc phức tạp nhanh, lần lượt từng cái. Nó là người quản lý tổng thể của máy tính. GPU (bộ xử lý đồ họa) được thiết kế để làm một việc đơn giản trên khối lượng dữ liệu khổng lồ, tất cả cùng một lúc. Ban đầu GPU được tạo ra để tô màu hàng triệu pixel màn hình đồng thời. Thiết kế đó hóa ra lại rất phù hợp cho AI, vì huấn luyện và chạy mô hình AI nghĩa là làm đi làm lại cùng một phép toán đơn giản trên những lưới số khổng lồ. CPU máy tính để bàn có vài nhân mạnh, CPU máy chủ có nhiều hơn một chút. GPU AI hiện đại có hàng chục nghìn nhân đơn giản.

2nm thực sự có nghĩa gì?

Rất ít, về mặt vật lý. Tên node như 7nm, 3nm và 2nm xưa kia mô tả kích thước của một chi tiết thực trên chip, nhưng điều đó đã không còn đúng từ khoảng năm 2010. Ngày nay chúng là nhãn thế hệ, gần giống năm dòng xe hơi. Điều chúng cho biết là nhà sản xuất có thể nhồi nhiều transistor hơn vào cùng diện tích, thường nghĩa là hiệu suất tốt hơn và tiêu thụ điện ít hơn trên mỗi phép tính. Tên gọi cũng không thể so sánh giữa các công ty. 2nm của một công ty chưa chắc đã dày đặc hơn 3nm của công ty khác, vì mỗi công ty tự đặt tên node của mình.

Tại sao AI cần nhiều bộ nhớ như vậy?

Mô hình AI về cơ bản là một tập hợp số khổng lồ, gọi là tham số hay trọng số. Để tạo ra một từ trong câu trả lời, chip phải đọc phần lớn những con số đó từ bộ nhớ và nhân chúng lại với nhau. Mô hình lớn chứa nhiều tham số đến mức mỗi lần trả lời đều cần di chuyển một lượng dữ liệu khổng lồ. Bản thân phép tính rất nhanh. Lấy dữ liệu ra mới là phần chậm, đó là lý do băng thông bộ nhớ, không phải tốc độ tính toán thuần túy, mới là giới hạn thực tế.

Xem tất cả 6 câu hỏi

HBM là gì và tại sao ai cũng nhắc đến nó?

HBM là viết tắt của High Bandwidth Memory, tức bộ nhớ băng thông cao. Bộ nhớ máy tính thông thường nằm trên các thanh RAM cách bộ xử lý vài centimet, nối qua đường truyền tương đối hẹp. HBM thay vào đó xếp chồng các chip nhớ theo chiều dọc thành một tháp, khoan đường kết nối thẳng xuyên qua silicon, rồi đặt cả tháp đó trên cùng gói với bộ xử lý. Kết quả là đường truyền dữ liệu rộng hơn nhiều trên khoảng cách ngắn hơn nhiều. Sản xuất rất khó và đắt, chỉ có ba công ty làm được ở quy mô lớn, và hai trong số đó là công ty Hàn Quốc.

Chip AI có phải là GPU không?

Không nhất thiết. GPU là loại phổ biến nhất, và GPU của Nvidia được biết đến nhiều nhất. Nhưng nhiều công ty công nghệ lớn tự thiết kế chip AI riêng, hoàn toàn không phải GPU. Google làm TPU (Tensor Processing Unit), Amazon làm Trainium và Inferentia, Meta làm MTIA. Đây là các ASIC, tức mạch tích hợp chuyên dụng, được thiết kế để làm một việc hẹp một cách hiệu quả thay vì linh hoạt. Thuật ngữ chung bao gồm tất cả chúng là accelerator.

Tôi có cần hiểu những điều này để sống ở Hàn Quốc không?

Không, nhưng nó giải thích nhiều thứ bạn thấy xung quanh. Chất bán dẫn chiếm tỷ trọng rất lớn trong xuất khẩu của Hàn Quốc, ngành này thúc đẩy đáng kể nền kinh tế quốc gia, và chính phủ đã cam kết những khoản tiền khổng lồ để mở rộng nó. Tin tức chip ảnh hưởng đến tỷ giá won, định hình chính sách điện, và ngày càng quyết định nơi các thị trấn mới và đường dây truyền tải điện được xây dựng. Phần 6 của loạt bài này sẽ nói về ý nghĩa của tất cả điều đó đối với người sống ở đây.

Nguồn đã xác minh

Hướng dẫn này dựa trên nguồn chính thức

Mọi thông tin trong hướng dẫn này đều dẫn đến nguồn chính thức. Bạn có thể tự kiểm tra lại.

  1. 01

    Nvidia: first quarter fiscal 2027 results (data center revenue USD 75.2 billion)

    nvidianews.nvidia.comTruy cập tháng 8 năm 2026
  2. 02

    SK hynix newsroom: 2026 market outlook, HBM-led memory cycle

    news.skhynix.comTruy cập tháng 8 năm 2026
  3. 03

    CNBC: comparing Nvidia GPUs, Google TPUs and AWS Trainium

    cnbc.comTruy cập tháng 8 năm 2026

Trích dẫn hướng dẫn này

Seoulstart Editorial Team. (2026). AI Compute Giải Mã, Phần 1: Chip AI Thực Sự Là Gì (2026). Seoulstart. Retrieved from https://seoulstart.com/vi/guides/ai-compute-what-is-an-ai-chip
Định dạng khác (Chicago, BibTeX)

Chicago

Seoulstart Editorial Team. 2026."AI Compute Giải Mã, Phần 1: Chip AI Thực Sự Là Gì (2026)."Seoulstart. Last modified 14 tháng 8, 2026. https://seoulstart.com/vi/guides/ai-compute-what-is-an-ai-chip.

BibTeX

@misc{seoulstart-ai-compute-what-is-an-ai-chip,
  author = {{Seoulstart Editorial Team}},
  title = {{AI Compute Giải Mã, Phần 1: Chip AI Thực Sự Là Gì (2026)}},
  year = {2026},
  publisher = {Seoulstart},
  url = {https://seoulstart.com/vi/guides/ai-compute-what-is-an-ai-chip},
  note = {Last updated 14 tháng 8, 2026}
}
Muốn đọc bản tiếng Anh đầy đủ hơn? Xem bản tiếng Anh →