The Data Center Is Becoming a Product
By Roger (Zhaoyang) Wang, General Manager of Global Data Centers, Alibaba Cloud Intelligence
For decades, building a data center has largely meant managing a construction project: secure a site, design the facility, coordinate contractors, install infrastructure, test the systems and eventually bring computing equipment online.
AI is making that model harder to sustain. It’s not just about the amount of computing capacity we need – AI workloads demand much higher rack densities, more liquid cooling, infrastructure flexible enough to accommodate different generations and types of accelerators, all while demand moves faster than conventional construction cycles allow. The question is no longer how to build bigger data centers. It is how to deploy infrastructure fast enough to keep up with AI.
Beyond modular construction
This was the thinking behind CUBE 5.0, the next-generation data center architecture we first introduced at Alibaba Cloud’s flagship technology event Apsara Conference in 2024 –– combining wind-liquid hybrid cooling, advanced power architecture, intelligent management and prefabricated modular design to meet AI's growing, diverse compute demand.
Introducing a new architecture was only the first step. The harder part was turning it into a repeatable way of delivering infrastructure. Making a few components modular does not necessarily make a data center faster to build. If other parts of the project still depend on conventional construction and on-site integration, those parts become the bottleneck. That is why we have focused on extending modularization across the major infrastructure systems, including power, cooling, fire protection, security and intelligent management, from 30 percent to 90 percent in its latest iteration.
The goal is to move more work from the construction site into the factory, where modules can be manufactured, integrated and tested in parallel while site preparation is underway. These components are then shipped in container-like units and assembled on-site like building blocks. This changes the nature of the project. Instead of building everything sequentially on site, we can manufacture standardized infrastructure and assemble it where it is needed.
In our view, products are replacing projects, and factories are replacing construction sites.
What 100 days really means
With CUBE 5.0, we have cut delivery time for large scale AI data center infrastructure to just about 100 days –– compared to our prior-generation architecture — while reducing construction costs per kilowatt by 10 percent and pushing first-pass testing success close to 100 percent.
The clock runs in three stages: 30 days for factory production and site preparation, 50 days for on-site installation, 20 days for commissioning and testing.
The number itself matters less than what makes it possible: doing more work in parallel and moving processes into a factory environment. It's a change in process, not just speed — and that matters because a compute cluster that isn't online yet can't support an AI workload. For AI infrastructure, time to compute is becoming as important a measure as cost, efficiency and reliability.
Standardized, but not identical
A product-based approach does not mean building exactly the same data center everywhere. Wider deployments still have to deal with different power grids, regulations, climates, sites and construction standards. What can be standardized should be standardized; what needs to adapt locally should remain flexible.
The core infrastructure, manufacturing processes and testing methodologies can be repeatable, while grid connections, site engineering and local requirements can be addressed at each location. This is particularly important as AI infrastructure expands across geographies. The ability to reproduce a proven design without having to reinvent the entire project each time can make deployment both faster and more predictable.
The next bottleneck is energy
There is, however, a larger challenge ahead: power infrastructure for large AI clusters still takes years to plan and deliver, even as compute deployment accelerates. Closing that gap will mean treating computing and energy as one coordinated system rather than two separate problems — a shift we'll explore in more depth in a future piece.
Building at the speed of AI
CUBE 5.0 began as an architectural response to the changing demands of AI. The work since 2024 has been about turning that architecture into an industrialised way of delivering infrastructure. The 100-day cycle is one result — but the larger lesson is about how we build. The data center is becoming a product: manufactured rather than built, designed for the pace AI now sets.
مراكز البيانات تتحول إلى منتجات
بقلم روجر (تشاويانغ) وانغ، المدير العام لمراكز البيانات العالمية في علي بابا كلاود إنتليجنس
على مدى عقود، ارتبط إنشاء مراكز البيانات إلى حد كبير بإدارة مشروع إنشائي متكامل: بدءًا من تأمين الموقع وتصميم المنشأة، مرورًا بالتنسيق مع المقاولين وتركيب البنية التحتية واختبار الأنظمة، وصولًا إلى تشغيل معدات الحوسبة وبدء العمليات.
لكن الذكاء الاصطناعي يجعل الاستمرار بهذا النموذج أكثر صعوبة. فالمسألة لا تقتصر على حجم القدرات الحاسوبية التي نحتاج إليها - إذ تتطلب أعباء عمل الذكاء الاصطناعي كثافة أعلى بكثير للقدرات الحاسوبية داخل رفوف تكنولوجيا المعلومات، واعتمادًا أكبر على تقنيات التبريد بالسائل، فضلًا عن بنية تحتية تتمتع بالمرونة الكافية لاستيعاب مختلف أجيال وأنواع مسرّعات الحوسبة، كل ذلك في حين يتسارع الطلب بوتيرة تفوق دورات الإنشاء التقليدية. لذلك، لم يعد السؤال يتمحور حول كيفية بناء مراكز بيانات أكبر حجمًا، بل حول كيفية تطوير البنية التحتية بالسرعة اللازمة لمواكبة متطلبات عصر الذكاء الاصطناعي.
أبعد من مفهوم البناء النموذجي
انطلاقاً من هذه الرؤية، قمنا بتطوير CUBE 5.0، بنية الجيل الجديد من مراكز البيانات، والتي كشفنا عنها للمرة الأولى خلال مؤتمر أبسارا 2024، الحدث التكنولوجي السنوي الأبرز الذي تنظمه شركة علي بابا كلاود. وتجمع بنية CUBE 5.0 بين نظام التبريد الهجين بالهواء والسوائل، والبنية المتقدمة للطاقة، والإدارة الذكية، والتصميم النموذجي مسبق الصنع، بهدف تلبية الطلب المتنامي والمتنوع على القدرات الحاسوبية اللازمة لتطبيقات الذكاء الاصطناعي.
وشكّل إدخال بنية جديدة الخطوة الأولى فحسب. أمّا الجزء الأصعب فتمثّل في تحويلها إلى طريقة قابلة للتكرار لتوفير البنية التحتية. ولا يعني جعل بعض المكونات معيارية بالضرورة تسريع عملية بناء مركز البيانات. فإذا كانت أجزاء أخرى من المشروع لا تزال تعتمد على أساليب التأسيس التقليدية والتكامل في مكان الموقع، فإن تلك الأجزاء تتحوّل إلى عنق الزجاجة. ولهذا السبب ركّزنا على توسيع نطاق المعايير النموذجية لتشمل أنظمة البنية التحتية الرئيسية، بما في ذلك الطاقة والتبريد والحماية من الحرائق والأمن والإدارة الذكية، من 30 في المائة إلى 90 في المائة في النسخة الأحدث من هذا النموذج.
يقضي الهدف بنقل المزيد من الأعمال من موقع البناء إلى المصنع، حيث يمكن هناك تصنيع الوحدات وتجميعها واختبارها بشكل متوازٍ لتنفيذ عملية تجهيز الموقع. ثم يتم شحن هذه المكونات في وحدات تشبه الحاويات وتجميعها في الموقع كقطع البناء. وهذا يُغير طبيعة المشروع ككلّ. فبدلًا من بناء كل جزء بشكل متتالي في أرض الموقع، يمكننا تصنيع بنية تحتية موحدة ثم تجميعها في المكان المطلوب.
من وجهة نظرنا، تحلّ المنتجات مكان المشاريع، وتحلّ المصانع مكان مواقع البناء.
ما الذي تعنيه فترة 100 يوم بحق؟
بفضل CUBE 5.0، تمكنا من تقليص مدة تسليم البنية التحتية لمراكز بيانات الذكاء الاصطناعي واسعة النطاق لتبلغ نحو 100 يوم فقط - مقارنةً بالبنية من الجيل السابق - بالتزامن مع خفض تكاليف الإنشاء لكل كيلوواط بنسبة 10 في المائة ورفع نسبة نجاح الاختبارات الأولية إلى ما يقارب 100 في المائة.
وتتم العملية على ثلاث مراحل: 30 يومًا للإنتاج في المصنع وإعداد الموقع، و50 يومًا للتركيب في أرض الموقع، و20 يومًا للتشغيل وإجراء الاختبارات.
الرقم بحدّ ذاته أقل أهمية من العوامل التي تجعل تحقيقه ممكنًا. ويتمثل بإنجاز المزيد من الأعمال بشكل متوازٍ ونقل العمليات إلى بيئة مصنعية. إنه تغيير في المسار ككلّ، وليس على صعيد السرعة فحسب - وهذا أمر مهم لأن مجموعة الحوسبة التي لا تكون متصلة بالإنترنت بعد، لا يمكنها دعم أحمال عمل الذكاء الاصطناعي. وبالنسبة إلى البنية التحتية للذكاء الاصطناعي، صار وقت الحوسبة مقياسًا لا يقل أهمية عن التكلفة والكفاءة والموثوقية.
موحّدة المعايير، لكنها غير متطابقة
لا يعني النهج القائم على المنتج إنشاء مراكز بيانات متطابقة تمامًا في كل مكان. فلا يزال يتعين على عمليات النشر وتعميم الاستعمال على نطاق واسع، التعامل مع شبكات كهرباء، وأطر تنظيمية، ومناخات، ومواقع، ومعايير بناء مختلفة. وما هو قابل لتوحيد معاييره يجب القيام بذلك؛ وما يحتاج إلى التكيف محليًّا يجب أن يبقى مرنًا.
بإمكان البنية التحتية الأساسية وعمليات التصنيع ومنهجيات الاختبار أن تكون قابلة للتكرار، في حين يمكن معالجة مسائل الربط بشبكات الكهرباء، والقراءة الهندسية للمواقع، ودراسة المتطلبات المحلية في كل موقع على حدة. ويكتسب هذا الأمر أهمية خاصة مع توسع البنية التحتية للذكاء الاصطناعي على امتداد المناطق الجغرافية المختلفة. فالقدرة على إعادة إنتاج تصميم أثبت فعاليته دون الحاجة إلى إعادة ابتكار المشروع بأكمله في كل مرة، يمكن أن تجعل عملية النشر أسرع وأكثر قابلية لتوقّع الظروف والنتائج.
تمثّل الطاقة العقبة التالية
ومع ذلك، يوجد تحدٍ أكبر في انتظارنا: لا تزال البنية التحتية للطاقة الخاصة بمجموعات الذكاء الاصطناعي الضخمة والواسعة النطاق تستغرق سنوات من أجل التخطيط لها وتنفيذها، حتى في ضوء تسارع وتيرة نشر قدرات الحوسبة. وسيتطلب سد هذه الفجوة التعامل مع الحوسبة والطاقة بكونهما يشكّلان نظامًا واحدًا منسّقًا بدلًا من اعتبارهما مشكلتين منفصلتين - وهو تحول جذري سنستكشف تفاصيله بمزيد من العمق في مقال مقبل.
البناء بسرعة الذكاء الاصطناعي
بدأ مشروع CUBE 5.0 كاستجابة معمارية للمتطلبات المتغيرة للذكاء الاصطناعي. وقد ركز العمل منذ عام 2024 على تحويل تلك البنية المعمارية إلى نهج صناعي لتوفير البنية التحتية. وتُعد الدورة الزمنية التي تستغرق 100 يوم إحدى النتائج - لكنّ الدرس الأهم يرتبط بكيفية بناء هذه البنية. فقد أصبح مركز البيانات منتجًا: يُصنع بدلًا من أن يُبنى، ويُصَمّم ليتناسب مع الوتيرة التي يُحددها الذكاء الاصطناعي حالياً.