Hayalet Gemiye Turbo Motor Takmak: Continue.dev'in Ölümü ve Cline Göçü
Sistem mühendisliğinde bazen mükemmel bir donanım mimarisi kurarsınız ama yazılım katmanının haftalar önce öldüğünü çok geç fark edersiniz. Geçtiğimiz günlerde NixOS üzerinde Ollama bağlam sınırını 32K seviyesine çıkarıp yerel yapay zeka modellerimi sınırlarına kadar zorlarken yaşadığım kriz tam olarak buydu.
Hayalet Gemi: Continue.dev
Ollama’yı izole etmek ve katmanlı güvenlik sağlamak üzerine kurguladığım altyapı sorunsuz çalışıyordu. İkinci aşama IDE içindeki kodlama asistanımın hafızasını devasa bir boyuta taşımaktı. Bunun için NixOS yapılandırmamda Ollama servisine doğrudan müdahale edip varsayılan sınırları kırdım:
# /persist/nixos-config/modules/services/ai-toggle.nix
services.ollama = {
enable = true;
environmentVariables = {
OLLAMA_NUM_CTX = "32768"; # Standart 8K sınırını parçalıyoruz
OLLAMA_MAX_VRAM = "24576";
};
};
Her şey kusursuz çalışıyor gibi görünürken merkeze koyduğum Continue.dev eklentisinin Haziran 2026 itibarıyla Cursor tarafından satın alınıp fişinin çekildiğini fark ettim. Kod deposu salt okunur hale getirilmiş ve ürün çoktan ölüme terk edilmişti. Açık kaynak dünyasında güvendiğiniz araçlar bir gecede kapalı kapılar ardında satılabiliyor.
Alternatif olarak Roo Code eklentisine yöneldim. Ancak o ekibin de Mayıs ayında bulut tabanlı başka bir projeye geçmesiyle o depo da arşive kaldırılmıştı. Geriye şeffaf onay mekanizmasına sahip tek bir sağlam alternatif kaldı: Cline.
32K Context ve VRAM Duvarına Çarpmak
Continue enkazını sistemden kazıyıp Cline ajanını kurdum. Ancak Cline sıradan bir kod tamamlama asistanı değil. Siz tek bir kelime dahi yazmadan arka planda modele binlerce tokenlık devasa bir sistem kural listesi gönderiyor. Ajanın otonom yetenekleri ve IDE entegrasyon gücü tamamen bu ağır başlangıç talimatlarından geliyor.
İlk denememi gemma-4-abliterated:26b modeliyle yaptım. Yirmi altı milyar parametreli devasa bir yapıydı. Bunun üzerine bir de 32768 token boyutundaki KV Cache belleği eklendi. Sonuç kaçınılmazdı: Donanım sınırlarına şiddetle çarptım. Terminalden çalışan işlemleri kontrol ettiğimde acı tabloyla karşılaştım:
$ ollama ps
NAME ID SIZE PROCESSOR CONTEXT
huihui_ai/gemma-4-abliterated:26b 114865317d3c 18 GB 47%/53% CPU/GPU 32768
Yükün yarısı işlemciye taşmıştı. İşlemciye düşen yapay zeka saniyede ancak bir veya iki kelime üretebilir. O devasa kural setini okuması dakikalar alıyordu.
Çözüm: Neşteri Vurmak ve %100 GPU
VRAM optimizasyonu yapmak şarttı. Modelin ağırlığından kurtulmam gerekiyordu ama zekasından çok fazla taviz veremezdim. İdeal dengeyi bulmak için aynı ailenin 12b-qat versiyonuna geçiş yaptım. 12B boyutu kodlama mantığını korumak için yeterince zekiyken QAT kuantizasyon formatı model kalitesini bozmadan hafıza ayak izini inanılmaz derecede küçültüyor. Bu sayede modelin boyutunu 8.1 GB seviyesine çekerek donanımı rahatlattım.
Ollama servisini yeniden başlatıp hafızayı sıfırladığımda sistemdeki yük tamamen değişti:
$ systemctl restart ollama
$ ollama ps
NAME ID SIZE PROCESSOR CONTEXT
huihui_ai/gemma-4-abliterated:12b-qat 00d9951e4140 8.1 GB 100% GPU 32768
Artık 32K hafıza ile modelin tamamı ekran kartımda çalışıyor ve binlerce tokenlık başlangıç verisini saniyeler içinde işliyordu.
Ayrıca Cline içerisindeki “Parallel Tool Calling” özelliğini kapattım. Bulut şirketleri devasa GPU kümeleriyle aynı anda üç farklı aracı paralel işleyebilir. Ancak yerel ekran kartları işlemleri sırayla yapar. Paralel araç çağrıları ekran kartında kuyruğa girer donanım sürekli bağlam değiştirir ve sistem kilitlenir. Bu ayarı kapatıp modeli tek bir hedefe odaklamak tepki süresini muazzam ölçüde hızlandırdı.
Localmind MCP Entegrasyonu
Performansı zirveye taşıdıktan sonra sistemi kendi geliştirdiğim zihin sarayım Localmind ile entegre etmem gerekiyordu.
VSCodium içinden MCP sunucuları konfigürasyonunu açıp doğrudan hazırladığım kabuk betiğini sisteme tanıttım:
// ~/.config/VSCodium/User/globalStorage/saoudrizwan.claude-dev/settings/cline_mcp_settings.json
{
"mcpServers": {
"localmind": {
"command": "/home/xmrah/Projects/localmind/run_mcp.sh",
"args": []
}
}
}
Sonuç kusursuzdu. Cline otonom olarak veritabanıma bağlandı. Hafıza odalarımı taradı ve bana 90 gün önce yaşadığım kritik bir Hyprland donanım sorununu hatırlattı. Ardından zihin sarayımdaki NixOS disiplinimi analiz edip bana harika bir yapısal özet sundu.
Bulut şirketlerinin kaprislerinden ve ani satın almalardan korunmanın tek yolu sistemi donanımdan yazılıma kadar kendi elinizde tutmaktır.