Menembus Batas Kapasitas guna Mendukung AI Skala Besar dengan Memori Berkapasitas Masif
Dengan dukungan jaringan interkoneksi UnifiedBus berkecepatan tinggi, KV cache dapat dihimpun dan digunakan bersama secara global melalui penyimpanan data berjenjang. Kapasitas KV cache SuperPoD diperluas dari memori on-chip dan DRAM hingga ke SSD sehingga satu klaster mampu menyediakan kapasitas 64 PB. Kapasitas KV cache yang tersedia pada setiap NPU juga meningkat dari gigabita menjadi terabita. Dengan kapasitas tersebut, lebih banyak konteks dapat disimpan, digunakan bersama, dan digunakan kembali sehingga rasio hit KV cache meningkat secara signifikan.
Meningkatkan Performa Inferensi untuk Mengoptimalkan Daya Komputasi
OceanStor M900 merupakan arsitektur pertama di industri yang mengintegrasikan CPU, network controller unit, dan NAND controller unit. Produk ini menyediakan semantik KV secara native agar NPU SuperPoD terhubung langsung ke SSD melalui satu hop. Pendekatan tersebut menghilangkan kebutuhan konversi protokol dan penerusan melalui CPU. Dengan demikian, latensi akses turun dari hitungan milidetik menjadi 60 mikrodetik, atau berkurang 90%. Satu klaster mampu menghasilkan bandwidth akses agregat hingga 40 TB/detik, atau 1,5 kali lebih tinggi dibandingkan solusi sejenis. Dalam skenario pemrograman AI pada umumnya, arsitektur ini melipatgandakan token throughput klaster inferensi dan memangkas separuh waktu untuk menghasilkan token pertama. Hasilnya, daya komputasi dapat dimanfaatkan secara lebih produktif.