bugün
@mertcobanov ile gelecekte ai infrastructure nasıl olabilir diye konuşuyorduk, konu baya dallandı.
bugün chatgpt, claude veya başka bir frontier provider kullandığımızda model ve inference'ı ayırmıyoruz.
- model
- hardware
- modeli servis eden infrastructure
- request scheduling
- caching
- inference
ve bütün serving stack. hepsi provider'ın. biz sadece request'i internet üzerinden gönderiyoruz. onlar da kendi data center'larında modeli çalıştırıp token'ları geri bize gönderiyorlar. yani aslında yalnızca bir "model" kullanmıyoruz, model + compute + inference + serving'in paketlenmiş halini satın alıyoruz. bu bugün gayet mantıklı.
frontier modeller çok büyük. modelin ağırlıkları gizli. bunları düşük latency ve yüksek throughput ile serve etmek başlı başına devasa bir infrastructure problemi. üstelik modeli geliştirirken şirket hem performans hem güvenlik hem de ürün deneyimi üzerinde kontrol sahibi oluyor. tüketici deneyimini de böyle kurguluyor.
ama bunun uzun vadede tek model olması gerekmiyor, gerekmesi için bir sebep yok. elimizdeki verilere de sürdürülebilir durmuyor. dışarıdan vc parasıyla sübvanse ediliyor. ekonomisi çok garip.
sam altman 2025'in başında sanırım bu konu hakkında konuşmuştu, $200'lık chatgpt pro planında kullanıcılar beklediklerinden fazla kullandığı için para kaybediyoruz tarzı bir şey söylemişti. subscription'un gerçek maliyetini bilmiyoruz ama birey olarak baya aşabildiğimizi tahmin edebiliyoruz. yani düz subscription ücreti ile sürekli değişen inference maliyeti arasında doğal bir gerilim var. ai kullanımı agent'lara kaydıkça inference miktarı da değişiyor.
reasoning -> tool -> inference -> search -> inference -> code -> inference -> verify -> inference ...
gibi bir loop var. yani güncel olarak bir kullanıcı başına tüketilen inference birkaç yıl öncekinden çok daha farklı ve fazla. bu yüzden hardware tarafı da ilginçleşiyor.
"gpu'lar ai inference için kötü" gibi bir cümle kurmak istemiyorum. ama training ile inference aynı problem değil. training için optimize etmek istediğimiz şeyler ile milyonlarca kullanıcıya düşük latency model serve ederken optimize etmek istediğimiz şeyler aynı değil. inference tarafında memory bandwidth, memory kapasitesi, kv cache, latency, batching, watt başına üretilen token gibi kritik şeyler var. bunun yönünü hardware tarafında şimdiden görüyoruz.
google bu yıl sekizinci nesil tpu'larını ilk kez training ve inference için iki ayrı mimariye ayırdı. tpu 8t training'e, tpu 8i ise düşük latency inference'a göre optimize edildi. özellikle agent'ların sürekli loop içinde çalışmasının mevcut infrastructure'daki verimsizliklerinin günümüz ölçeğinde çok önemli olduğunu düşünüyorlarmış.
inference için ayrı bir hardware çıkacağı bu yüzden baya net. ilk vardığımız yer şuydu:
inference hardware'i zamanla daha ucuz, verimli ve erişilebilir olursa neden inference'ı uzaktaki hyperscale data center yapsın? mert bugün evimize modem/router koyduğumuz gibi bir kişisel inference box koyacağımızı falan söyledi, anlatınca baya mantıklı geldi.
open-weight bir modeli indiririm, agent'ım 7/24 kendi network'ümde çalışır, veri bende kalır. internet olmasa bile bazı işleri yapabilir. her bir token için şirkete ödeme yapmam.
nvidia bugün beta olarak "pair" diye bir şey sunuyormuş. aynı ev ağındaki mac, rtx, dgx spark... gibi bir sürü makineyi tek bir local inference endpoint'inin arkasında toplayıp gelen inference isteklerini uygun node'a route ediyormuş. makineler bağımsız inference node'ları olarak çalışıyor. yani gelecekte inference local olacak.
ben bunun tam tersini de düşündüm. evime pahalı bir kutu almak istemezsem? birkaç bin dolarlık accelerator alıp günde bir saat kullanırsam hardware günün geri kalanında yatacak. bunun yerine şehirde ya da bölgede, binlerce insanın kullandığı bir inference farm olsa. binlerce bağımsız workload aynı infrastructure'a geliyor, hardware çok daha yüksek utilization ile çalışıyor. request'ler batch edilebiliyor. böylece popüler modeller sürekli memory'de tutulabiliyor. aynı prefix'leri kullanan isteklerde caching yapılabiliyor. request'ler cache locality koruyacak şekilde route edilebiliyor. prefill gibi farklı karakteristik işleri farklı accelerator havuzlarına dağıtabiliyoruz.
burada bahsedilen optimizasyonların büyük bir kısmı teorik değil, benim fikrim de değil zaten. inference serving yapan şirketler zaten bu gibi şeylerle uğraşıyor (ör. cerebras).
bu gibi sebeplerden ötürü, local ve kişisel inference da mantıklıyken her workload için ekonomik olarak en iyi çözüm olmuyor. shared inference da tam tersine aşırı mantıklı. serverless inference yapan şirketler var, açık modelleri token başına kullanabiliyoruz; dedicated tarafta ise kendi model ağırlıklarını getirip managed infrastructure üzerinde de serve edebiliyorsun (ör. coreweave, scaleway).
data center'ların temel ürünü storage, compute, networking vs. bu kenarda dursa, bir de ai center'lar olsa? temel ürünleri de doğrudan inference capacity olsa? iyi yaptıkları, uzmanlaştıkları şey:
tüketiciden ağırlıkları alıp mümkün olan en ucuz, hızlı ve verimli bir şekilde tokene çevirmek.
biz hangi modele erişimimiz varsa onu seçiyoruz; qwen, mistral, deepseek, ya da kendi fine-tune'umuz. frontier provider'lar da belirli gizlilik anlaşmaları ile sunabilirler belki, böylece üstlerindeki yükü dağıtabilirler. lisanslasınlar yani. asıl ayrım şu:
modeli yapan şirket ile modeli infer eden şirket aynı şirket olmak zorunda değil.
günümüzde çoğu consumer ai için durum bu. cloud'da da alışık olduğumuz abstraction bu değil zaten. uygulamayı geliştiren şirket, cpu'yu tasarlayan şirket, server'ı üreten şirket, data center'ı işleten şirket ve cloud servisi satan şirket aynı şirket olmak zorunda değil. dolayısıyla "ai" da sonsuza kadar aynı yerde birleşik kalmak zorunda değil. üstelik bu ayrışmanın bazı primitive'leri şimdiden zaten oluşuyor. aws bedrock farklı provider'ların modellerini aynı inference yüzeyi üzerinden sunuyor. cross-region inference yapabiliyorsun, bir isteği tek bir region'a sabitlemiyorlar. uygun olan aws region'larındaki compute'a route edebiliyorsun.
hakim değilim ama alibaba'nın da model studio'su falan var. qwen dışında deepseek, moonshot gibi farklı provider'ların modelleri de var. model provider ve inference provider ayrı kavramlar.
bunların hiçbirisi düşündüğümüz "ai center network" değil ama düşündüğümüz şeyin parçalarının halihazırda farklı yerlerde oluşuyor. devamında şöyle garip bir topoloji oluşuyor:
- evimde personal inference node var
- şehirde veya isp'ye yakın bir inference point var
- bölge/ülke seviyesinde büyük, shared ai center'lar var
- çok büyük modeller ve aşırı compute gerektiren işler için hyperscale frontier cluster'lar olabilir
ve bunların hepsi aynı internetin üzerinde yaşayabilir.
agent'a bir iş verdiğimde de "hangi model?" sorusunun yanında bir soru daha çıkar: nerede infer edeceğim?
kişisel bir dosyayı summarize edeceksem local'de infer ederim. eğer compute isteyen paralel işlerim varsa yakındaki bir inference farm'da, latency önemli değil ve milyonlarca tokenlik batch workload varsa neresi ucuzsa orada... çok zor, devasa bir reasoning problemi var ve yalnızca bir frontier model lazım; model provider'ın kendi cluster'ında infer ederim.
bu route kararı yalnızca capability üzerinden değil; capability + cost + latency + privacy + ... gibi şeyler üzerinden verilebilir. yani tek bir çözümdense devasa heterojen bir inference ağı. bazı compute'lar bana ait, bazıları shared, bazıları reserved, bazıları dünyanın bir ucundaki bir cluster'da ve agent'ım gerektiğinde bunların arasında geziyor.
buradan sonra iş "network"e geliyor. agent'ların ilginç yanı sadece çok inference kullanmıyorlar, interneti de insan gibi kullanmıyorlar. ben tarayıcıda bir şey araştırırken linke tıklıyorum, okuyorum, düşünüyorum, sonrasında başka bir link açıyorum. agent'lar bunların hepsini "software speed"de yapabiliyorlar.
aynı task içerisinde onlarca search, web fetch, api call, database query, model call ve başka agent çağrıları üretiyorlar. sanki yakın gelecekte internet trafiği, dünya nüfusu artmadan, birkaç katına çıkacak gibi.
network üreticileri de aynı problemi modellemeye başladı. cisco'nun 2026 çalışması ai inference trafiğinin 2035'te toplam wan trafiğinin 25%'ine ulaşabileceğini öngörmüş ve agent'ları insan hızında değil "software speed"de çalışan network power user'ları olarak tarif etmiş.
sonra buradan çok saçma bir düşünce çıktı: global rag
ilk düşüncem şuydu: internetin tamamını bir kere crawl etsek ve dünyanın ikinci bir kopyasını vector database'e koysak... baya saçma. çünkü zaten inference dağıtık node'larda yaşayacaksa, modelin inference sırasında ihtiyaç duyduğu context'in bir kısmı neden aynı node'ların yakınında olmasın? bugün bir agent web'den bir şey öğrenmek istediğinde kabaca search yapıyor, url buluyor, sayfayı fetch ediyor, gelen html'i parse ediyor, ilgili parçaları çıkarıyor sonra model bunu okuyor. bunun her request'te baştan yapılması mantıklı değil.
bir ai center'ın yanında hot web cache, retrieval index, embedding'ler, reranking ya da başka bir context infrastructure'ı bulunabilir. context "fresh" ise yakından gelir, değilse yine agent internete çıkar. bilginin kaynağı yine internet olur.
web ile inference arasına agent'ların tüketimine göre optimize edilmiş bir context layer koyulabilir. bunun da primitive'leri bugün var.
"web access layer for agents" olarak konumlanmış birkaç şirket buldum, arama sonucunu yalnızca url listesi olarak değil modelin kullanabileceği reranked context olarak dönüyorlar ve search/crawl/extract/indexing/cache gibi işleri agent için tek katmanda topluyor. search endpoint'leri agent tüketimi için optimize edilmiş.
kabaca toparlamak gerekirse;
- internet altta duruyor
- bunun üzerinde dağıtık bir inference compute var
- compute'un yakınlarında context/retrieval var
- agent'lar bunların üzerinde çalışıyor
- tıpkı cdn'ler gibi "compute" kullanıcıya yaklaşıyor. context de compute'a.
ne kadarı gerçekleşir bilmiyorum, belki frontier lab'ler inference ekonomisini o kadar iyi çözer ki model ile inference düşündüğümüz kadar ayrışmaz.
belki kişisel hardware o kadar hızlı gelişir ki local inference çok baskın hale gelir.
belki birkaç hyperscaler bütün katmanları kendisi geliştirir.
belki "ai center" diye ayrı bir kategori hiç olmaz, bugün data center dediğimiz şey zaten doğal olarak buna dönüşür.
bugün farklı şirketlerin yaptığı şeyleri yan yana koyunca açıkça bir ayrım görüyoruz: model başka, inference başka bir şey. inference'ın nerede çalıştığı da başka bir şey. model ile model'in context'i nereden aldığı da başka bir şey. biz şu an bunların tamamını aynı ürünün içerisinde görüyoruz.
acaba gelecekte neler olacak.