# hyperscaler capex — X 热门讨论 (2026-09-11 19:50 UTC)
## @rzayev7895 (Yunis Rzayev) · 09-11 17:16 · ♥41 ↻1 💬6 $SNDK $MU DeepSeek V4.1-Flash neden bellek hisselerini baskıladı ve neden bundan korkmuyorum?
Not: Bu analizi DeepSeek'in paylaştığı rakamların doğru olduğunu varsayarak yaptık. Ancak DeepSeek'in geçmişte yaptığı bazı açıklamalara ve sonradan ortaya çıkan verilere baktığımızda, şirketin teknolojik gelişmelerini zaman zaman oldukça iddialı şekilde sunduğunu da unutmamak gerekiyor. Dolayısıyla burada verilen %75 HBM ve %87,5 depolama tasarrufu gibi rakamları şimdilik şirketin kendi verileri olarak değerlendirmek, bunların gerçek dünya ölçeğindeki etkisini ise bağımsız veriler ve hyperscaler sonuçları üzerinden takip etmek daha doğru olacaktır.
Bugün bellek hisselerinde gördüğümüz zayıflığın önemli nedenlerinden biri DeepSeek'in V4.1-Flash modelini duyurması. İlk bakışta haber gerçekten negatif görünüyor. DeepSeek, yeni modelde KV cache için gereken HBM miktarını yaklaşık %75, kalıcı SSD depolama ihtiyacını ise %87,5 azaltmış durumda. Global KV cache gereksinimi token başına 890 byte'a kadar düşürülmüş. V4-Flash'ta bu rakam 3.514 byte, V3.2'de ise 48.068 byte seviyesindeydi.
Piyasanın ilk tepkisi de oldukça basit: Eğer AI modelleri aynı işi daha az bellekle yapabiliyorsa, gelecekte HBM talebi azalabilir. Dolayısıyla SK Hynix, Micron ve Samsung gibi bellek üreticilerinin büyüme beklentileri sorgulanmaya başlıyor.
Ancak burada bence çok önemli bir ayrım var. DeepSeek'in açıkladığı %75'lik düşüş, toplam GPU belleğinin %75 azalması anlamına gelmiyor. Bu rakam KV cache'in HBM gereksinimiyle ilgili. Model ağırlıkları, hesaplama için gereken bellek, GPU'lar, networking, güç altyapısı ve veri merkezinin diğer bileşenleri bundan bağımsız olarak varlığını sürdürüyor. Benzer şekilde %87,5'lik rakam da toplam veri merkezi depolamasının %87,5 azalacağı anlamına gelmiyor.
Daha da önemlisi, DeepSeek'in amacı AI kullanımını azaltmak değil. Tam tersine, modeli daha düşük maliyetle çalıştırabilmek. V4.1-Flash toplam 552 milyar parametreye sahip ve Causal Encoder–Decoder mimarisi sayesinde girişlerde yaklaşık 8 milyar, çıktılarda ise 16 milyar parametre aktive ediyor. Yani burada gördüğümüz şey AI altyapısının ortadan kalkması değil, aynı altyapıyla daha fazla iş yapılabilmesi.
Bence asıl bakılması gereken nokta da bu.
AI'da birim başına kullanılan bellek miktarı düşebilir ama AI kullanımı bundan çok daha hızlı büyüyebilir. Bir modelin inference maliyeti düştükçe şirketlerin daha fazla agent kullanması, daha uzun context'lerle çalışması ve daha fazla inference gerçekleştirmesi ekonomik hale geliyor. Özellikle agentic AI tarafında modeller sürekli olarak kod, doküman, geçmiş konuşmalar ve araç sonuçlarıyla çalışacağı için context yönetimi çok daha önemli hale gelecek.
Dolayısıyla denklem sadece "bir milyon token için ne kadar HBM gerekiyor?" şeklinde kurulamaz. Asıl soru, önümüzdeki yıllarda kaç milyar token işleneceği. Token başına bellek ihtiyacının düşmesi olumlu bir gelişme olabilir; çünkü AI kullanımını daha ucuz hale getirir. Kullanım arttığında ise toplam compute, networking, storage ve bellek talebi yine büyüyebilir.
SSD tarafındaki gelişmeyi de benzer şekilde değerlendiriyorum. DeepSeek, kısa ömürlü sliding-window attention verilerini kalıcı SSD üzerinde tutmak yerine sunucunun normal belleğindeki paylaşılan bir havuza taşıyor. Bu veriler dakikalar sonra zaten değerini kaybediyor. Global context ise daha uzun süre tutuluyor. Eksik kısa süreli cache gerektiğinde de sınırlı yeniden hesaplama yapılabiliyor. Burada yapılan şey AI'ın depolama ihtiyacını ortadan kaldırmak değil, hangi verinin nerede ve ne kadar süre tutulacağını daha verimli hale getirmek.
Bence piyasadaki en büyük hata, "daha verimli model = daha az toplam bellek talebi" şeklinde doğrudan bir bağlantı kurmak. Teknoloji tarihinde bunun tam tersini çok defa gördük. Bir teknolojinin birim maliyeti düştüğünde kullanım genellikle artıyor. AI için de benzer bir durum yaşanabilir. Inference ucuzladıkça daha fazla şirket AI agent kullanmaya başlayabilir, mevcut kullanıcılar daha fazla inference gerçekleştirebilir ve AI uygulamalarının kullanım alanı genişleyebilir.
Bu nedenle benim için asıl takip edilmesi gereken DeepSeek'in 890 byte'lık KV cache rakamı değil. Hyperscaler'ların 2027 ve sonrasındaki AI capex planları. NVIDIA ve AMD accelerator siparişleri, HBM kontratları, HBM fiyatları ve bellek üreticilerinin ileriye dönük kapasite planlarında bir bozulma görüyor muyuz? Eğer bunlarda ciddi bir değişiklik yoksa, tek başına bir modelin daha verimli hale gelmesi AI memory tezinin bozulduğu anlamına gelmez.
Hatta uzun vadede bunun olumlu bir tarafı bile var. AI'ın çalışma maliyeti düştükçe daha önce ekonomik olmayan kullanım alanları mümkün hale geliyor. Bugün bir şirketin 100 AI agent çalıştırması pahalı olabilir; ancak inference maliyetleri ciddi şekilde düştüğünde bu sayı çok daha yukarı çıkabilir. Dolayısıyla model başına daha az bellek kullanılırken toplam AI iş yükü çok daha hızlı büyüyebilir.
Bu yüzden bugün MU, SK Hynix veya SNDK gibi hisselerde yaşanan zayıflığı şu aşamada temel tez kırılması olarak görmüyorum. Elbette DeepSeek ve benzeri modellerin bellek verimliliğini sürekli artırması uzun vadede izlenmesi gereken bir konu. Fakat bunun gerçekleşmesi için önce AI capex'in, HBM kontratlarının ve gerçek bellek talebinin aşağı geldiğini görmemiz gerekiyor.
Şimdilik gördüğümüz şey bana daha çok piyasanın yeni bir teknoloji gelişmesini çok hızlı şekilde fiyatlaması gibi geliyor. DeepSeek, AI'ın bellek ihtiyacını ortadan kaldırmadı; AI'ın aynı işi daha az kaynakla yapabilmesini sağladı.
Aradaki fark oldukça önemli.
Kısacası, korkmamız gereken şey daha verimli AI modelleri değil. Korkmamız gereken şey AI kullanımının ve hyperscaler capex'inin gerçekten yavaşlaması. Şu anda ikincisini gösteren bir tablo olmadığı sürece, bugünkü hareketi bellek hisselerinde uzun vadeli tezin bozulması olarak okumak için erken olduğunu düşünüyorum.
Yatırım tavsiyesi değildir. Kendi araştırmanızı yapın. > 引用 @wallstengine: DeepSeek just launched V4.1-Flash, cutting KV-cache HBM requirements by roughly 75% and persistent SSD storage by 87.5% compared with V4-Flash.
Its global KV cache is down to 890 bytes per token, versus 3,514 for V4-Flash and 48,068 for V3.2. That is roughly 54x smaller than last December’s model.
V4.1-Flash has 552B total parameters, but its new Causal Encoder–Decoder architecture activates just 8B when processing inputs and 16B when generating outputs.
It also adds native image understanding, alongside new pretraining methods and larger-scale reinforcement learning.
The memory savings matter because AI agents repeatedly reuse context from conversations, documents, code and tool results.
The KV cache preserves earlier calculations so the model doesn’t have to redo all that work.
At 890 bytes per token, a million tokens would occupy about 890MB of global KV cache. That excludes model weights and other memory needed to run the system.
The SSD reduction comes from changing both what gets stored and where.
Previously, DeepSeek kept global attention data and short-lived sliding-window attention data in its persistent SSD cache. Both typically stayed there for more than 72 hours, even though the sliding-window data was mainly useful for minutes during an active session.
V4.1 moves that short-lived data into a shared pool using 10% of each server’s regular memory. Entries expire after minutes, while global context remains in persistent storage for at least 72 hours.
When short-lived data is missing, a new technique called “bounded replay” reconstructs it using a limited window of tokens instead of the much larger computation previously required. Removing that data from SSDs, combined with compressing the remaining global cache, produces the reported 8x storage reduction.
Reported benchmark scores include 63.9 on Humanity’s Last Exam with tools, 31.2 on Terminal-Bench 4.0 and 54.8 on Automation-Bench.
V4.1-Flash is live through the API as deepseek-flash, with off-peak pricing at half the peak rate. DeepSeek is also replacing V4-Pro with V4.1-Flash starting Sept. 14, ahead of a future V4.1-Pro release.
Note: These are reductions in cache requirements, not a 75% cut in total GPU memory or an 87.5% cut in all storage. They make retaining and reusing context substantially cheaper without eliminating the other costs of running an agent. https://x.com/rzayev7895/status/2098460796116480286