BlockBeats haberine göre, 30 Ağustos'ta Citrini analisti Jukan, kaynaklarına dayanarak NVIDIA'nın Rubin Ultra'da kullanacağı HBM spesifikasyonunun 12 katmanlı HBM4E'den 8 katmana düşürülmüş olabileceğini belirtti. OpenAI ve Anthropic gibi müşterilerin 4 katmanlı ürün talep ettiğini ancak bellek üreticilerinin bunu reddettiğini, şu anda indirimin 8 katmanda durabileceğini ifade etti. Analist, indirimin esas olarak verim ve maliyet baskısından kaynaklandığını düşünüyor: 12 katmanlı HBM4E kullanılıp fiyat artışı dahil edilirse, bellek maliyeti Rubin Ultra'ın toplam malzeme maliyetinin yaklaşık %70'ini oluşturabilir.
Model niceleme, MLA ve hesaplama görevi bölme gibi yazılım optimizasyonları, düşük frekanslı erişilen KV önbelleğini ve model durumunu LPDDR, CXL ve NAND'a taşıyor; HBM esas olarak mevcut hesaplama için gereken çalışma setini koruyor. Bu nedenle, minimum kapasite karşılandıktan sonra müşteriler HBM bant genişliğine kapasiteden daha fazla önem vermeye başlıyor.
Analist, katman sayısını azaltmanın paketleme verimini artırabileceğini, HBM ve AI hızlandırıcı sevkiyatlarını çoğaltabileceğini ve bunun da HBM toplam talebini genişletebileceğini; daha yüksek bant genişliği gereksinimlerinin, gofretlerde hız sınıflandırmasından geçen çip oranını düşürerek DRAM gofret kapasitesini daha da tüketeceğini düşünüyor. Uzun vadede HBM'in yeni mimarilerle değiştirileceğini, nihai yönün bellek ve mantık çiplerinin birleşmesi olabileceğini ve önümüzdeki iki yılın bellek üreticilerinin mantık alanına genişleyip genişleyemeyeceğinin kritik aşaması olacağını belirtti.
