Mechanical Engineer +4 years / vibe coder ⚙️ AI applications | model comparisons | cost analyses | bug hunting 📊 TR/EN

DeepSeek V4 Flash 0731, DeepSeek V4 Pro ve LongCat 2.0’ı aynı fizik + kodlama testine soktum. Üç modele de aynı görev, aynı şartlar. Açıkçası sonuçta beni en çok şaşırtan LongCat 2.0 oldu. Free kullanımda ilk kez karşıma çıkınca denemiştim; bu testte beklediğimden çok daha başarılı çıktı. Videoları aşağıya bırakıyorum 👇
1
12
2,061
Opus 5.5 - Kız Kulesi denizdeki ufak titreşimler ekran kaydından dolayı öyle gözüküyor.
35
opus5.5 , gpt 6 sol ve gpt 6 luna bugün neler oluyor böyle, gece gece hangi birini deneyelim inceleyelim sözde yavaşlatacaklardı puştlar tam gaz devam etmişler
1
91
Aynı mevcut projede 3 farklı AI modeline bug/hata incelemesi yaptırdım: • DeepSeek V4.1 Flash Max • GLM 5.3 Flash Max • Muse Spark 1.3 xhigh Sonrasında raporlarını doğrudan mevcut kodla karşılaştırdım; doğru bulguları, yanlış alarmları, kanıt kalitesini ve çözüm önerilerini ayrı ayrı değerlendirdim. Bu bir genel model benchmarkı değil. Sadece bu proje üzerindeki bug bulma ve kod inceleme performanslarının karşılaştırması.
2
1
142
Muse spark testi çok hızlı bitirdi fakat özelikle DeepSeek paralel ajanlar çalıştırdı her ajan için ayrı zamanlarda erişim izni istediği için test gereksiz uzadı hemen izin veremedim, o nedenle süreyi tabloya eklemedim. DeepSeek bu karşılaştırmanın net lideri oldu. En kritik ve en özgün hataları o buldu, bulgularını daha sağlam kanıtladı ve çözüm önerilerinde daha isabetliydi. GLM ikinci sırada kaldı. Doğrulama tarafı güçlüydü ancak bazı konuları gerçek hata seviyesinin üzerine taşıdı ve rapor kalitesi DeepSeek’in gerisinde kaldı. Muse ise açık şekilde son sırada. Belgelenmiş ürün kararlarını hata olarak işaretledi, daha fazla yanlış alarm üretti ve çözüm önerileri diğer iki modele göre daha zayıf kaldı.
1
42
GPT 6 Astra ya bir iş yaptırırken bir dolu test yapıyor, kendi yapabileceğimiz testleri yapamamını söylemek lazım yoksa hem limit tüketiyor hemde gereksiz işi uzatıyor.
1
354
GPT 6 Astra gerçekten AGI olabilir. İlk defa bir modele küfretmeden iş yaptırıyorum, hata yaptığında ya da bir şeyi istemediğim gibi yaptığında neden öyle yaptığını soruyorum ve mantıklı kısa net cevaplar veriyor, hiç sinirlenmedim şuana kadar. Razıyız..
1
1
49
GPT-5.6 Sol’u kullanmaya pek gerek kalmıyor gibi. GPT-6 Astra, medium seviyede GPT-5.6 Sol’un max performansını yakalıyor; üstelik daha az token ve daha düşük maliyetle. Bu tabloya bakınca Astra çok daha verimli duruyor. Sol’u tercih etmek için geriye ne kalıyor?
1
71
Fable 5.1 tablosuna bakınca asıl fark ajan işlerinde. Bilim tarafı %24.7’den %52.6’ya çıkmış, AutomationBench neredeyse iki katı. Terminal-Bench 4.0’da Fable %55.8, Mythos 5.1 %60.9. Fiyat etiketi aynı $10/$50 ama cache okuma $0.25 olmuş. Yani kağıt üstünde pahalı, gerçek faturada özellikle uzun ajan işlerinde ciddi düşüyor diyorlar. Opus 5 hâlâ yarı fiyat. Mythos aynı model, filtre daha gevşek, herkese açık değil.
81
Açık kaynak modellerinnin sansürsüz qwen 3.6 35b a3 ve gemma4 26b a4b modellerini internete bağladım, aykırı internnette sansürlü olan bazı fikirler üzerinde tartıştım. sii*yonniz*m ve p*rno sektörü arasındaki bağlantıyı tartıştık. gemma4 sansürsüz modelini kullansamda konuya sansür uygulayarak yaklaştı tamamen. benim sunduğum fikirleri ret etti hatta bir sorumda gereksiz düşüncemi uzatarak sonuç dahi üretmedi, şaşırttı beni. qwen 3.6 35b a3 modeli ise kendinde olmayan bilgileri internete araştırdı örnekler, isimler, tarihi olaylar vererek farklı başlıklar ile konuyu çok güzel işledi bilmediğim alanlarda beni çok güzel bir şekilde aydınlattı. gemma 11-13 t/s , qwen 7-9 t/s ile çalıştılar. biraz yavaş olsalarda derin bir konu olunca göze batmıyor.
1
100
yerel modelleri neden kullanalım, bulut modeller daha hızlı ve akıllı diyen arkadaşlar toplumda tablu olarak kabul edilen konuları bulutdaki modeller ile tartışmanız çok güç. dünya politikası, popüler akımlar, woke kültürü vb yeni üretilmiş bir dolu akım hakkında derinlemesine, ham bilgiye ulaşabilirsiniz. akademik olarak, hobi olarak yerel modelleri kullanmak çok büyük özgürlük. günümüz dünyasında her şeyi sosyal medyadan zihinlerimize dayatıyorlar ve farkında olmuyoruz, özellikle genç beyinler akıllanıyoruz ayağına nasıl bir beyin yıkamasına maruz kaldıklarının farkına varamıyor. her şeyi ai ya yaptırıp tembelleşmeden derinlerine inelim, ilerde yasaklayabilirler de bilemeyiz.
53
Gemini 3.7 flash benchmarklara göre başarılı bir model ama kullanımda bir türlü tatmin etmedi beni. Sürekli arkasını toplamak gerekiyor, işi yapamıyor ama yaptım diyor. Çok hızlı bir model ama güvenilmez.
1
168
Şu fiyatlandırmaya göre luna ve sol kullanıyorum, terra hiç kullanmıyorum. Terra nın fiyatının 1$-5$ olması lazım ki kullanalım @OpenAI
1
67
Çoğu işimizde luna xhigh-max kullanılabilir, zorlu görevlerde sol medium-high yeterli. En iyi ikili luna maks / sol medium, terra nın yeri yok piç gibi kalmış ortada.
55
opencode de bazı modelleri kullanamıyorum çok yavaş kalıyorlar ya da cevap vermiyorlar, böyle devam ederse sonlandıracağız gibi. @opencode
1
269
Ox Alpha has massive hype, but the benchmark tells the truth: Ranked 5th across a full codebase audit. Decent baseline, yet miles behind DeepSeek V4 Flash and GPT-5.6 Terra on critical bugs. Currently: more marketing than pure performance. Daily driver or just an experiment for you?
Replying to @MuGundo_dev
The story behind the table is more interesting than the scores. 🏆 DeepSeek V4 Flash delivered the strongest audit, but it came with heavy token usage and a 19-minute runtime. ⚡ DeepSeek V4 Pro achieved nearly the same quality in just 7 minutes. GPT-5.6 Terra produced one of the most accurate and clearest reports. GLM-5.3 went deep, but missed the most critical bug — the one preventing all app settings from being saved. And Ox Alpha, the mysterious model everyone has been talking about lately? Neither a revolution nor a disappointment. In the middle of all the hype, it was a solid but incomplete 5th place. Muse Spark 1.2 was fast and cheap, but its critical finding coverage was weak. GPT-5.6 Luna (XHigh) found important bugs, but a false critical alert significantly hurt its accuracy score. Same prompt, same repo, seven different audit personalities.
2
260
7 AIs, the same Flutter repo, the same audit prompt. 🏆 DeepSeek V4 Flash took the lead with a 92.9 report quality score and an 88.8 overall score, using 289K tokens in 19 minutes. DeepSeek V4 Pro finished in just 7 minutes and scored 88.5 overall, only 0.3 points behind the leader. GPT-5.6 Terra produced the second-best report quality score at 89.6 and ranked third overall with 85.3. 💸 Ox Alpha, currently getting attention for being free, scored 82.8 overall at $0 cost, making it one of the most interesting results in terms of cost efficiency. ⚠️ GPT-5.6 Luna (XHigh) used the fewest tokens in the test at only 117K, but still finished last with a 69.7 overall score. The task: read all code and Markdown files in the project, make no changes, and produce a detailed report covering bugs, code-documentation inconsistencies, optimization issues, and other technical problems. ✅ flutter analyze: 0 issues ✅ flutter test: 126/126 passed The reports were evaluated by GPT-5.6 Sol. Detailed comparison tables are in the next post.
Made with AI
1
1
95
The story behind the table is more interesting than the scores. 🏆 DeepSeek V4 Flash delivered the strongest audit, but it came with heavy token usage and a 19-minute runtime. ⚡ DeepSeek V4 Pro achieved nearly the same quality in just 7 minutes. GPT-5.6 Terra produced one of the most accurate and clearest reports. GLM-5.3 went deep, but missed the most critical bug — the one preventing all app settings from being saved. And Ox Alpha, the mysterious model everyone has been talking about lately? Neither a revolution nor a disappointment. In the middle of all the hype, it was a solid but incomplete 5th place. Muse Spark 1.2 was fast and cheap, but its critical finding coverage was weak. GPT-5.6 Luna (XHigh) found important bugs, but a false critical alert significantly hurt its accuracy score. Same prompt, same repo, seven different audit personalities.
1
1
408
The overall table makes one thing clear: price and speed alone aren’t enough. 🏆 DeepSeek V4 Flash won on quality, while DeepSeek V4 Pro finished just 0.3 points behind in only 7 minutes. GPT-5.6 Terra was strong, but also the most expensive. GLM-5.3 delivered a balanced result. Ox Alpha finished 5th despite costing $0. Muse Spark 1.2 was fast and cheap, but quality dropped. GPT-5.6 Luna (XHigh) used the fewest tokens, yet still finished last.
35
opencode bilgisyar kullanımı codex kadar gelişmiş olmayabilir ama basit işler için çok hızlı. örneğin masaüstünde şu klasörü oluştur içerisinde terminalde jcode başlat dediğimde codex 2-3 dk da anca yaparken opencode ortalama 20-30 saniyede yapıyor.
1
58
Opencode nerdeyse sınırsız kullanımda deepsek v4 flash veriyordu, 5 flash ajanına paralel iş veriyordum şimdi o avantajı kalmadı. Codex yanında meta ya da grok kullanacağım gibi artık.
1
67