Trong bối cảnh các cụm GPU phục vụ AI ngày càng mở rộng quy mô, độ trễ và tính toàn vẹn tín hiệu trên kết nối PCIe trở thành những yếu tố ảnh hưởng trực tiếp đến hiệu quả khai thác tài nguyên tính toán. Tam Do, Kỹ sư Marketing Sản phẩm Kỹ thuật thuộc bộ phận Giải pháp Trung tâm Dữ liệu của Microchip Technology Inc., đã chia sẻ về vai trò của dòng thiết bị tái định thời XpressConnect PCIe 6.0 và CXL 3.1 trong các kiến trúc trung tâm dữ liệu thế hệ mới, từ bài toán giảm độ trễ, mở rộng khoảng cách truyền dẫn đến hỗ trợ chia sẻ bộ nhớ và lộ trình hướng tới PCIe 7.0.
Theo Tam Do, giá trị của XpressConnect không nằm ở việc tăng băng thông đỉnh, mà ở khả năng hạn chế độ trễ tích lũy vốn có thể khiến GPU phải chờ đợi và làm giảm hiệu quả của toàn hệ thống. Với độ trễ pin-to-pin dưới 12ns, dòng sản phẩm này được Microchip định vị như một thành phần quan trọng trong danh mục kết nối trung tâm dữ liệu toàn trình, đặc biệt với các hạ tầng AI có kiến trúc mô-đun và yêu cầu khả năng mở rộng cao.

Câu hỏi phỏng vấn
- Khi công nghệ PCIe 6.0 nâng tốc độ dữ liệu lên 64GT/s, khoảng cách truyền tín hiệu và độ trễ trở thành những thách thức lớn trong thiết kế. Những hạn chế về tính toàn vẹn tín hiệu có thể gây ra những vấn đề cụ thể nào về hiệu năng và mức độ lãng phí tài nguyên trong các cụm GPU quy mô lớn, đồng thời XpressConnect giữ vai trò gì trong chiến lược trung tâm dữ liệu tổng thể của Microchip?
Tam Do: Trong các cụm GPU lớn, giới hạn về tính toàn vẹn tín hiệu PCIe không dừng lại ở nguy cơ phát sinh lỗi đường truyền. Khi chất lượng tín hiệu suy giảm, đường truyền có thể phải hạ tốc độ, độ trễ tăng lên và GPU phải dành nhiều chu kỳ hơn cho trạng thái chờ thay vì xử lý tác vụ. Việc phải thiết kế bo mạch và sơ đồ mạch với mức dự phòng lớn để bù cho các giới hạn này cũng làm tăng chi phí và độ phức tạp của hệ thống.
Khi triển khai ở quy mô lớn, những yếu tố đó cộng dồn thành bài toán đáng kể cả về hiệu suất lẫn chi phí. XpressConnect được thiết kế để khôi phục toàn bộ biên độ tín hiệu PCIe Gen6 và CXL 3.1 với độ trễ rất thấp, qua đó cho phép tăng khoảng cách truyền dẫn, linh hoạt hơn trong cách xây dựng kiến trúc và hỗ trợ cấu trúc GPU dạng mô-đun mà không phải đánh đổi hiệu năng.
Ở góc độ chiến lược, Microchip xem XpressConnect là một thành phần then chốt cho các thiết kế trung tâm dữ liệu phân tách có khả năng mở rộng và tối ưu chi phí. Sản phẩm cũng giữ vai trò trung tâm trong danh mục giải pháp kết nối trung tâm dữ liệu toàn trình của công ty.
- XpressConnect đạt độ trễ pin-to-pin dưới 12ns, thấp hơn khoảng 80% so với tiêu chuẩn PCIe 6.0. Microchip đạt được mức độ trễ này bằng kiến trúc như thế nào và trong các hệ thống huấn luyện AI, việc giảm độ trễ có thể cải thiện hiệu quả sử dụng GPU cũng như hạn chế nút thắt truyền dữ liệu ở mức nào?
Tam Do: XpressConnect đạt độ trễ pin-to-pin dưới 12ns nhờ kiến trúc tối giản, tập trung vào lớp vật lý. Thiết kế sử dụng số giai đoạn định thời và khôi phục dữ liệu ở mức tối thiểu, pipeline cân bằng nhưng nông, đồng thời không đưa bộ đệm lớp giao thức vào đường truyền.
Cách tiếp cận này cho phép thiết bị tái tạo tín hiệu mà không tự biến mình thành một tầng xử lý bổ sung trong pipeline. Đối với các hệ thống huấn luyện AI, việc giảm độ trễ theo cách này giúp hạn chế những trạng thái đình trệ khi đồng bộ hóa giữa các thành phần và giảm thời gian GPU phải chờ do giao tiếp PCIe.
Ở quy mô lớn, khách hàng thường ghi nhận mức cải thiện hiệu quả sử dụng GPU ở mức trung bình một con số, trong khi mức cải thiện trong các môi trường đa GPU có thể rõ rệt hơn đáng kể. Điểm quan trọng không nằm ở băng thông tối đa của kết nối, mà ở việc loại bỏ phần độ trễ tích lũy có thể âm thầm làm thất thoát chu kỳ tính toán.
- XpressConnect hỗ trợ CXL 3.1, qua đó hướng đến việc mở rộng bộ nhớ và chia sẻ tài nguyên trong các mạng máy tính AI quy mô lớn. CXL 3.1 hiện đang ở giai đoạn nào trong lĩnh vực AI và XpressConnect hỗ trợ triển khai bộ nhớ dùng chung ra sao?
Tam Do: Trong lĩnh vực AI, CXL 3.1 hiện nằm ở giai đoạn thử nghiệm nâng cao và bắt đầu đi vào sản xuất ban đầu. Động lực chính đến từ nhu cầu của các tập đoàn đa quốc gia và các kiến trúc sư hệ thống đang chuẩn bị cho mô hình chia sẻ bộ nhớ ở quy mô tủ rack cũng như cho hạ tầng có cấu trúc mô-đun.
Việc triển khai CXL nói chung vẫn đang ở giai đoạn tương đối sớm. CXL 1.1 và CXL 2.0 đã được triển khai rộng hơn, trong khi CXL 3.1 hướng đến bài toán phân tách bộ nhớ ở quy mô lớn cho hệ thống AI. Trong quá trình này, thiết bị tái định thời XpressConnect đóng vai trò hỗ trợ quan trọng ở lớp vật lý.
XpressConnect không trực tiếp triển khai giao thức CXL, nhưng giúp việc tập trung hóa bộ nhớ trở nên khả thi hơn bằng cách mở rộng phạm vi truyền dẫn và khôi phục tính toàn vẹn tín hiệu với độ trễ dưới 12ns. Do CXL và PCIe sử dụng chung giao diện vật lý, các thiết bị bộ nhớ CXL có thể được bố trí ở cấp độ chassis hoặc tủ rack mà vẫn đáp ứng các yêu cầu độ trễ của CXL.mem.
Khả năng này mở đường cho mô hình tập trung hóa bộ nhớ có quy mô lớn hơn, phù hợp với các hệ thống AI thế hệ tiếp theo cần chia sẻ tài nguyên linh hoạt giữa nhiều thành phần.
- Khi các nhà vận hành trung tâm dữ liệu quy mô lớn ngày càng quan tâm đến nguy cơ lệ thuộc nhà cung cấp, một giải pháp tiêu chuẩn theo hướng cắm và chạy như XpressConnect có thể mang lại những lợi ích cụ thể nào trong việc giảm TCO? Microchip hỗ trợ khách hàng rút ngắn thời gian từ thiết kế đến sản xuất hàng loạt bằng cách nào?
Tam Do: XpressConnect có thể góp phần giảm tổng chi phí sở hữu bằng cách hạ chi phí kỹ thuật không lặp lại, đơn giản hóa quy trình xác thực và cho phép sử dụng bo mạch, cáp cũng như cấu trúc hệ thống có chi phí thấp hơn.
Khi áp dụng trên quy mô lớn, những lợi ích này có thể giúp giảm số lượng SKU cần duy trì, cải thiện lợi suất và hạ rủi ro vận hành. Với các nhà khai thác trung tâm dữ liệu, đây là những yếu tố có tác động trực tiếp đến chi phí triển khai cũng như chi phí duy trì hệ thống về lâu dài.
Microchip hỗ trợ rút ngắn thời gian đưa sản phẩm và giải pháp ra thị trường thông qua các thiết kế tham chiếu đã được kiểm chứng, khả năng tương tác sâu với hệ sinh thái và bộ công cụ ChipLink. Những công cụ này giúp giảm thời gian cần cho các giai đoạn phát triển, gỡ lỗi và tiền sản xuất.
Mục tiêu là giúp khách hàng triển khai nhanh hơn mà vẫn duy trì độ mở của hệ thống và không phải hy sinh tính linh hoạt trong kiến trúc.
- Trong bối cảnh thị trường thiết bị tái định thời PCIe 6.0 ngày càng cạnh tranh, điều gì tạo ra khác biệt cho XpressConnect và Microchip dự kiến duy trì lợi thế này trong trung và dài hạn bằng cách nào?
Tam Do: Khi số lượng giải pháp tái định thời PCIe 6.0 trên thị trường tăng lên, lợi thế của XpressConnect nằm ở mức độ trễ thấp được hình thành ngay từ kiến trúc thiết kế, thay vì chỉ dừng ở việc đáp ứng tiêu chuẩn.
Độ trễ pin-to-pin dưới 12ns, thiết kế được tối ưu cho CXL và khả năng hoạt động ổn định khiến XpressConnect phù hợp với các hệ thống AI cũng như những môi trường mạng tập trung vào bộ nhớ, nơi độ trễ tích lũy có thể tăng nhanh khi số lượng thành phần và kết nối mở rộng.
Microchip cho biết công ty duy trì lợi thế này thông qua việc tham gia sớm vào quá trình xây dựng tiêu chuẩn, xây dựng lộ trình kết nối PCIe đồng bộ qua nhiều thế hệ và cung cấp hỗ trợ ở cấp độ toàn hệ thống. Cách tiếp cận đó vừa giúp giảm rủi ro cho khách hàng, vừa góp phần cắt giảm TCO thông qua một giải pháp hệ thống tổng thể.
Vì vậy, mục tiêu của Microchip không chỉ là tạo ra một bộ tái định thời nhanh hơn, mà là xây dựng một nền tảng có thể tiếp tục mở rộng khi hạ tầng AI phát triển trong tương lai.
- PCIe 7.0 thế hệ tiếp theo được kỳ vọng tiếp tục rút ngắn thời gian truyền tín hiệu ở lớp vật lý, đồng thời tạo ra yêu cầu khắt khe hơn đối với thiết bị tái định thời về độ trễ và hiệu quả sử dụng năng lượng. Microchip đánh giá quá trình chuyển từ PCIe 6.0 lên PCIe 7.0 như thế nào và XpressConnect có lộ trình để giải quyết những thách thức này ra sao?
Tam Do: Việc chuyển từ PCIe 6.0 sang PCIe 7.0 làm giảm đáng kể thời gian truyền tín hiệu ở lớp vật lý, khiến vấn đề độ trễ và công suất cần được giải quyết ở cấp độ kiến trúc thay vì chỉ dựa vào tối ưu hóa từng phần.
Ở tốc độ 128GT/s, thiết bị tái định thời cần có khả năng chịu rung pha và khôi phục tín hiệu ở mức rất cao, đồng thời không được trở thành nút thắt mới về độ trễ hoặc nhiệt độ vận hành.
XpressConnect có lợi thế khi bước vào quá trình chuyển đổi này nhờ triết lý thiết kế hiện tại gồm pipeline có độ sâu tối thiểu, độ trễ thấp và ổn định, cùng khả năng tái tạo tín hiệu thuần túy ở lớp vật lý. Theo Microchip, các nguyên tắc này đã được áp dụng trên thiết kế PCIe 6.0 hiện nay và cũng phù hợp với những yêu cầu cốt lõi của PCIe 7.0.
Các sản phẩm Gen7 cụ thể sẽ tiếp tục phát triển theo mức độ hoàn thiện của tiêu chuẩn. Tuy nhiên, lộ trình của Microchip được xây dựng xoay quanh thiết kế hệ thống, với mục tiêu để các thế hệ XpressConnect trong tương lai tiếp tục hỗ trợ các cấu trúc PCIe và CXL có độ trễ thấp, khả năng mở rộng cao và phù hợp với hạ tầng AI thế hệ mới.
Về tác giả
Tam Do là chuyên gia marketing kỹ thuật và thiết kế ứng dụng với hơn 30 năm kinh nghiệm trong ngành bán dẫn và hệ thống. Chuyên môn của ông bao gồm quản lý vòng đời sản phẩm, tương tác với khách hàng toàn cầu và phát triển doanh thu trong các phân khúc ứng dụng video, thiết bị di động tiêu dùng, IoT và trung tâm dữ liệu.
