✨👩🏻‍💻💃🏻✨ | Senior DevRel Engineer @deepset_ai 🥑 | AI, @Haystack_AI & life in between | TR/EN | she/her

Berlin
Bilge retweeted
Haystack 3.2 is here 🚀 This release keeps agents lean and in control as conversations grow. Three highlights: 🧵 SummarizationCompactor for smarter context compaction Pair SummarizationCompactor with CompactionHook (shipped in v3.1) to progressively summarize long-running Agent conversations. 💰 TokenBudgetHook caps what a run can spend A ready-made hook that ends the run at "token_budget_exceeded" once you hit your token ceiling through the stop_run hook point. 🛠️ Faster Pipeline building New add_components() and connect_many() let you add and wire up multiple components in one call. 💙 70 contributors made this release happen; huge thanks to everyone! 🔗 Full release notes: haystack.deepset.ai/release-…
4
1
10
245
we complete the full circle and bring unconference back to Berlin! we meet tomorrow at @deepset_ai HQ, with @Prior_Labs. here are tomorrow's discussion topics: → structured data & grounded predictions → agent harness and orchestration → open weights, open agents in practice we're almost full for this event, follow @Haystack_AI on luma so you catch the next one 👇
1
10
506
this!! offsite last week + friend’s birthday party this weekend, i missed the entire shebang. where so i even start now🫣😅
3
276
LLM/AI agent people and tabular ML people never talk, and we want to change that! So we're putting them in one room and hosting our next unconference with @prior_labs in Berlin: Open Weights, Open Agents 🐻 Open source is the thread connecting both worlds: open-weight models like TabPFN on one side, open source agent frameworks like @Haystack_AI on the other. As with our other unconferences, it's participant-driven, not a lineup of talks. Come with actual opinions and questions on: → Why (and when) your agent needs orchestration → Benchmarking tabular models, a different game than benchmarking LLMs → Open-weight vs. closed models → What "owning your stack end-to-end" actually means and more! If you're building or evaluating real-world AI systems in Berlin, join us! 📅 September 24, 6–9 PM 📍 @deepset_ai HQ, Berlin Seats are limited, link is in the replies
1
1
7
359
Bilge retweeted
bugün @mertcobanov ile gelecekte ai infrastructure nasıl olabilir diye konuşuyorduk, konu baya dallandı. bugün chatgpt, claude veya başka bir frontier provider kullandığımızda model ve inference'ı ayırmıyoruz. - model - hardware - modeli servis eden infrastructure - request scheduling - caching - inference ve bütün serving stack. hepsi provider'ın. biz sadece request'i internet üzerinden gönderiyoruz. onlar da kendi data center'larında modeli çalıştırıp token'ları geri bize gönderiyorlar. yani aslında yalnızca bir "model" kullanmıyoruz, model + compute + inference + serving'in paketlenmiş halini satın alıyoruz. bu bugün gayet mantıklı. frontier modeller çok büyük. modelin ağırlıkları gizli. bunları düşük latency ve yüksek throughput ile serve etmek başlı başına devasa bir infrastructure problemi. üstelik modeli geliştirirken şirket hem performans hem güvenlik hem de ürün deneyimi üzerinde kontrol sahibi oluyor. tüketici deneyimini de böyle kurguluyor. ama bunun uzun vadede tek model olması gerekmiyor, gerekmesi için bir sebep yok. elimizdeki verilere de sürdürülebilir durmuyor. dışarıdan vc parasıyla sübvanse ediliyor. ekonomisi çok garip. sam altman 2025'in başında sanırım bu konu hakkında konuşmuştu, $200'lık chatgpt pro planında kullanıcılar beklediklerinden fazla kullandığı için para kaybediyoruz tarzı bir şey söylemişti. subscription'un gerçek maliyetini bilmiyoruz ama birey olarak baya aşabildiğimizi tahmin edebiliyoruz. yani düz subscription ücreti ile sürekli değişen inference maliyeti arasında doğal bir gerilim var. ai kullanımı agent'lara kaydıkça inference miktarı da değişiyor. reasoning -> tool -> inference -> search -> inference -> code -> inference -> verify -> inference ... gibi bir loop var. yani güncel olarak bir kullanıcı başına tüketilen inference birkaç yıl öncekinden çok daha farklı ve fazla. bu yüzden hardware tarafı da ilginçleşiyor. "gpu'lar ai inference için kötü" gibi bir cümle kurmak istemiyorum. ama training ile inference aynı problem değil. training için optimize etmek istediğimiz şeyler ile milyonlarca kullanıcıya düşük latency model serve ederken optimize etmek istediğimiz şeyler aynı değil. inference tarafında memory bandwidth, memory kapasitesi, kv cache, latency, batching, watt başına üretilen token gibi kritik şeyler var. bunun yönünü hardware tarafında şimdiden görüyoruz. google bu yıl sekizinci nesil tpu'larını ilk kez training ve inference için iki ayrı mimariye ayırdı. tpu 8t training'e, tpu 8i ise düşük latency inference'a göre optimize edildi. özellikle agent'ların sürekli loop içinde çalışmasının mevcut infrastructure'daki verimsizliklerinin günümüz ölçeğinde çok önemli olduğunu düşünüyorlarmış. inference için ayrı bir hardware çıkacağı bu yüzden baya net. ilk vardığımız yer şuydu: inference hardware'i zamanla daha ucuz, verimli ve erişilebilir olursa neden inference'ı uzaktaki hyperscale data center yapsın? mert bugün evimize modem/router koyduğumuz gibi bir kişisel inference box koyacağımızı falan söyledi, anlatınca baya mantıklı geldi. open-weight bir modeli indiririm, agent'ım 7/24 kendi network'ümde çalışır, veri bende kalır. internet olmasa bile bazı işleri yapabilir. her bir token için şirkete ödeme yapmam. nvidia bugün beta olarak "pair" diye bir şey sunuyormuş. aynı ev ağındaki mac, rtx, dgx spark... gibi bir sürü makineyi tek bir local inference endpoint'inin arkasında toplayıp gelen inference isteklerini uygun node'a route ediyormuş. makineler bağımsız inference node'ları olarak çalışıyor. yani gelecekte inference local olacak. ben bunun tam tersini de düşündüm. evime pahalı bir kutu almak istemezsem? birkaç bin dolarlık accelerator alıp günde bir saat kullanırsam hardware günün geri kalanında yatacak. bunun yerine şehirde ya da bölgede, binlerce insanın kullandığı bir inference farm olsa. binlerce bağımsız workload aynı infrastructure'a geliyor, hardware çok daha yüksek utilization ile çalışıyor. request'ler batch edilebiliyor. böylece popüler modeller sürekli memory'de tutulabiliyor. aynı prefix'leri kullanan isteklerde caching yapılabiliyor. request'ler cache locality koruyacak şekilde route edilebiliyor. prefill gibi farklı karakteristik işleri farklı accelerator havuzlarına dağıtabiliyoruz. burada bahsedilen optimizasyonların büyük bir kısmı teorik değil, benim fikrim de değil zaten. inference serving yapan şirketler zaten bu gibi şeylerle uğraşıyor (ör. cerebras). bu gibi sebeplerden ötürü, local ve kişisel inference da mantıklıyken her workload için ekonomik olarak en iyi çözüm olmuyor. shared inference da tam tersine aşırı mantıklı. serverless inference yapan şirketler var, açık modelleri token başına kullanabiliyoruz; dedicated tarafta ise kendi model ağırlıklarını getirip managed infrastructure üzerinde de serve edebiliyorsun (ör. coreweave, scaleway). data center'ların temel ürünü storage, compute, networking vs. bu kenarda dursa, bir de ai center'lar olsa? temel ürünleri de doğrudan inference capacity olsa? iyi yaptıkları, uzmanlaştıkları şey: tüketiciden ağırlıkları alıp mümkün olan en ucuz, hızlı ve verimli bir şekilde tokene çevirmek. biz hangi modele erişimimiz varsa onu seçiyoruz; qwen, mistral, deepseek, ya da kendi fine-tune'umuz. frontier provider'lar da belirli gizlilik anlaşmaları ile sunabilirler belki, böylece üstlerindeki yükü dağıtabilirler. lisanslasınlar yani. asıl ayrım şu: modeli yapan şirket ile modeli infer eden şirket aynı şirket olmak zorunda değil. günümüzde çoğu consumer ai için durum bu. cloud'da da alışık olduğumuz abstraction bu değil zaten. uygulamayı geliştiren şirket, cpu'yu tasarlayan şirket, server'ı üreten şirket, data center'ı işleten şirket ve cloud servisi satan şirket aynı şirket olmak zorunda değil. dolayısıyla "ai" da sonsuza kadar aynı yerde birleşik kalmak zorunda değil. üstelik bu ayrışmanın bazı primitive'leri şimdiden zaten oluşuyor. aws bedrock farklı provider'ların modellerini aynı inference yüzeyi üzerinden sunuyor. cross-region inference yapabiliyorsun, bir isteği tek bir region'a sabitlemiyorlar. uygun olan aws region'larındaki compute'a route edebiliyorsun. hakim değilim ama alibaba'nın da model studio'su falan var. qwen dışında deepseek, moonshot gibi farklı provider'ların modelleri de var. model provider ve inference provider ayrı kavramlar. bunların hiçbirisi düşündüğümüz "ai center network" değil ama düşündüğümüz şeyin parçalarının halihazırda farklı yerlerde oluşuyor. devamında şöyle garip bir topoloji oluşuyor: - evimde personal inference node var - şehirde veya isp'ye yakın bir inference point var - bölge/ülke seviyesinde büyük, shared ai center'lar var - çok büyük modeller ve aşırı compute gerektiren işler için hyperscale frontier cluster'lar olabilir ve bunların hepsi aynı internetin üzerinde yaşayabilir. agent'a bir iş verdiğimde de "hangi model?" sorusunun yanında bir soru daha çıkar: nerede infer edeceğim? kişisel bir dosyayı summarize edeceksem local'de infer ederim. eğer compute isteyen paralel işlerim varsa yakındaki bir inference farm'da, latency önemli değil ve milyonlarca tokenlik batch workload varsa neresi ucuzsa orada... çok zor, devasa bir reasoning problemi var ve yalnızca bir frontier model lazım; model provider'ın kendi cluster'ında infer ederim. bu route kararı yalnızca capability üzerinden değil; capability + cost + latency + privacy + ... gibi şeyler üzerinden verilebilir. yani tek bir çözümdense devasa heterojen bir inference ağı. bazı compute'lar bana ait, bazıları shared, bazıları reserved, bazıları dünyanın bir ucundaki bir cluster'da ve agent'ım gerektiğinde bunların arasında geziyor. buradan sonra iş "network"e geliyor. agent'ların ilginç yanı sadece çok inference kullanmıyorlar, interneti de insan gibi kullanmıyorlar. ben tarayıcıda bir şey araştırırken linke tıklıyorum, okuyorum, düşünüyorum, sonrasında başka bir link açıyorum. agent'lar bunların hepsini "software speed"de yapabiliyorlar. aynı task içerisinde onlarca search, web fetch, api call, database query, model call ve başka agent çağrıları üretiyorlar. sanki yakın gelecekte internet trafiği, dünya nüfusu artmadan, birkaç katına çıkacak gibi. network üreticileri de aynı problemi modellemeye başladı. cisco'nun 2026 çalışması ai inference trafiğinin 2035'te toplam wan trafiğinin 25%'ine ulaşabileceğini öngörmüş ve agent'ları insan hızında değil "software speed"de çalışan network power user'ları olarak tarif etmiş. sonra buradan çok saçma bir düşünce çıktı: global rag ilk düşüncem şuydu: internetin tamamını bir kere crawl etsek ve dünyanın ikinci bir kopyasını vector database'e koysak... baya saçma. çünkü zaten inference dağıtık node'larda yaşayacaksa, modelin inference sırasında ihtiyaç duyduğu context'in bir kısmı neden aynı node'ların yakınında olmasın? bugün bir agent web'den bir şey öğrenmek istediğinde kabaca search yapıyor, url buluyor, sayfayı fetch ediyor, gelen html'i parse ediyor, ilgili parçaları çıkarıyor sonra model bunu okuyor. bunun her request'te baştan yapılması mantıklı değil. bir ai center'ın yanında hot web cache, retrieval index, embedding'ler, reranking ya da başka bir context infrastructure'ı bulunabilir. context "fresh" ise yakından gelir, değilse yine agent internete çıkar. bilginin kaynağı yine internet olur. web ile inference arasına agent'ların tüketimine göre optimize edilmiş bir context layer koyulabilir. bunun da primitive'leri bugün var. "web access layer for agents" olarak konumlanmış birkaç şirket buldum, arama sonucunu yalnızca url listesi olarak değil modelin kullanabileceği reranked context olarak dönüyorlar ve search/crawl/extract/indexing/cache gibi işleri agent için tek katmanda topluyor. search endpoint'leri agent tüketimi için optimize edilmiş. kabaca toparlamak gerekirse; - internet altta duruyor - bunun üzerinde dağıtık bir inference compute var - compute'un yakınlarında context/retrieval var - agent'lar bunların üzerinde çalışıyor - tıpkı cdn'ler gibi "compute" kullanıcıya yaklaşıyor. context de compute'a. ne kadarı gerçekleşir bilmiyorum, belki frontier lab'ler inference ekonomisini o kadar iyi çözer ki model ile inference düşündüğümüz kadar ayrışmaz. belki kişisel hardware o kadar hızlı gelişir ki local inference çok baskın hale gelir. belki birkaç hyperscaler bütün katmanları kendisi geliştirir. belki "ai center" diye ayrı bir kategori hiç olmaz, bugün data center dediğimiz şey zaten doğal olarak buna dönüşür. bugün farklı şirketlerin yaptığı şeyleri yan yana koyunca açıkça bir ayrım görüyoruz: model başka, inference başka bir şey. inference'ın nerede çalıştığı da başka bir şey. model ile model'in context'i nereden aldığı da başka bir şey. biz şu an bunların tamamını aynı ürünün içerisinde görüyoruz. acaba gelecekte neler olacak.
12
5
105
8,899
a good reminder for me to update my website
A personal website should feel like you’ve briefly left the rest of the internet
1
5
340
Can you explain to me exactly what you want 4 microducks for??
171
188
1,965
287,660
Kaçıracağım için çok üzüldüğüm bir konferans, bütün ekibin eline sağlık 💕
LatentShift Yapay Zeka Konferansı 2026 konuşmacı listesinden ilk üç isim sizlerle. ✨ Bilet alın diyemiyorum, biletlerimiz taze bitti ama bilet alabilenler için en iyi konuları, en iyi deneyim ortamıyla sunmak için çok çalıştığımızı söylemek isterim. 👀
2
8
759
🗽In NYC tonight? @DylanCouzon & @qdrant_engine are hosting a debate night, and @deepset_ai is teaming up Hear some hot AI takes, get a chance to win prizes, and learn about @Haystack_AI and @qdrant_engine along the way! luma.com/nyc-meetup-qdrant-0…
4
6
344
noticed I hadn’t tweeted in a while and there’s a good reason: I was on vacation for two weeks, enjoying the sun, the sea, and a few city trips 🌊☀️ now I’m back, so here are a few moments that had me contemplating life and almost forgetting my laptop password all credits for turning them into travel notes go to @Hamburgerai & @ChatGPT
Made with AI
1
9
317
Bilge retweeted
Haystack 3.0 Live Office Hours - New Features, Migration & Q&A nitter.net/i/broadcasts/1qKVmmjkb…
1
2
5
217
we are so back! pretty sure our last livestream was a different lifetime ago. bringing it back tomorrow, 3PM CET for @Haystack_AI 3.0 office hours. @LukawskiKacper and I'll be live on YouTube, LinkedIn, and X, sharing what's shipped and answering your questions! 👇

ALT Excited Jimmy Fallon GIF by The Tonight Show Starring Jimmy Fallon

1
3
14
495
Bilge retweeted
Haystack 3.0 shipped this month. We spent launch week showing you what it can do. Now here's what it took to build it 👇 Since @Haystack_AI 2.0: 2,400+ pull requests merged, 195 contributors, ~170 of them making their first-ever contribution along the way. 17,258 CI runs since the v3 branch was cut, roughly one every five minutes, around the clock, for eight weeks. Most-edited file of the whole cycle: agent.py. Of course it was. Migrating to 3.0? The full guide covers all breaking changes: docs.haystack.deepset.ai/doc… Or skip straight to haystack-v2-to-v3, an agent skill that migrates your v2 pipelines and agents for you. 💙 Huge thanks to our open-source team at @deepset_ai, and to our community contributors who shipped fixes and features for v3 alongside us! Haystack 3.0 is yours as much as it's ours. Got questions about migrating, or curious why we made a specific call? Join us at Haystack 3.0 Office Hours next week, August 4, with @LukawskiKacper and @bilgeycl 👉🏼 Register: luma.com/haystack-3
5
10
492
🎥 day 5 is out with a video I kinda liked filming videos for @Haystack_AI v3 launch week so hit me up if you want to see me talking more!
9
377
Bilge retweeted
Day 5 of Haystack 3.0 Launch Week: Human-in-the-Loop from Terminal to Production For today's drop, we implemented a production agent that pauses before anything risky and waits for a human to say go. The approval shows up right where the conversation is happening, making the process intuitive for the users. We built the whole thing as a real, deployable service (Hayhooks + @Redisinc + @OpenWebUI), so it's not just another notebook trick or a simple terminal demo Set up with one command and run all services with @Docker 🐳 🎥 Watch it in action ↓
1
4
9
255
Haystack x Caveman
for day 4 of @Haystack_AI v3 launch week, we implemented an agent that: ✅ runs locally with @ollama ✅ can use skills (e.g. caveman by @julius_brussee) ✅ can control your computer ✅ has human-in-the-loop for every sensitive action code + video by @LukawskiKacper is below ⬇️
1
7
643
for day 4 of @Haystack_AI v3 launch week, we implemented an agent that: ✅ runs locally with @ollama ✅ can use skills (e.g. caveman by @julius_brussee) ✅ can control your computer ✅ has human-in-the-loop for every sensitive action code + video by @LukawskiKacper is below ⬇️
📬 Day 4 of Haystack 3.0 Launch Week: a fully local agent, running on @ollama with no API key, that reads skills, saves tokens with the caveman skill, and uses a real bash tool to control your machine, with a human approving every step. Skills only expose a name and one-line description upfront; with progressive disclosure, the full instructions load only when needed. That keeps context and token cost small, even with a large skill library. The agent then acts on a real machine through a custom bash tool, with a human approving every call before it runs, using hooks. code link below ↓ piped.video/watch?v=vefpGVFw…
1
13
1,209