Hayalet Gemiye Turbo Motor Takmak: Continue.dev'in Ölümü ve Cline Göçü

Sistem mühendisliğinde bazen mükemmel bir donanım mimarisi kurarsınız ama yazılım katmanının haftalar önce öldüğünü çok geç fark edersiniz. Geçtiğimiz günlerde NixOS üzerinde Ollama bağlam sınırını 32K seviyesine çıkarıp yerel yapay zeka modellerimi sınırlarına kadar zorlarken yaşadığım kriz tam olarak buydu.

Hayalet Gemi: Continue.dev

Ollama’yı izole etmek ve katmanlı güvenlik sağlamak üzerine kurguladığım altyapı sorunsuz çalışıyordu. İkinci aşama IDE içindeki kodlama asistanımın hafızasını devasa bir boyuta taşımaktı. Bunun için NixOS yapılandırmamda Ollama servisine doğrudan müdahale edip varsayılan sınırları kırdım:

# /persist/nixos-config/modules/services/ai-toggle.nix
services.ollama = {
  enable = true;
  environmentVariables = {
    OLLAMA_NUM_CTX = "32768"; # Standart 8K sınırını parçalıyoruz
    OLLAMA_MAX_VRAM = "24576";
  };
};

Her şey kusursuz çalışıyor gibi görünürken merkeze koyduğum Continue.dev eklentisinin Haziran 2026 itibarıyla Cursor tarafından satın alınıp fişinin çekildiğini fark ettim. Kod deposu salt okunur hale getirilmiş ve ürün çoktan ölüme terk edilmişti. Açık kaynak dünyasında güvendiğiniz araçlar bir gecede kapalı kapılar ardında satılabiliyor.

Alternatif olarak Roo Code eklentisine yöneldim. Ancak o ekibin de Mayıs ayında bulut tabanlı başka bir projeye geçmesiyle o depo da arşive kaldırılmıştı. Geriye şeffaf onay mekanizmasına sahip tek bir sağlam alternatif kaldı: Cline.

32K Context ve VRAM Duvarına Çarpmak

Continue enkazını sistemden kazıyıp Cline ajanını kurdum. Ancak Cline sıradan bir kod tamamlama asistanı değil. Siz tek bir kelime dahi yazmadan arka planda modele binlerce tokenlık devasa bir sistem kural listesi gönderiyor. Ajanın otonom yetenekleri ve IDE entegrasyon gücü tamamen bu ağır başlangıç talimatlarından geliyor.

İlk denememi gemma-4-abliterated:26b modeliyle yaptım. Yirmi altı milyar parametreli devasa bir yapıydı. Bunun üzerine bir de 32768 token boyutundaki KV Cache belleği eklendi. Sonuç kaçınılmazdı: Donanım sınırlarına şiddetle çarptım. Terminalden çalışan işlemleri kontrol ettiğimde acı tabloyla karşılaştım:

$ ollama ps
NAME                                 ID            SIZE    PROCESSOR        CONTEXT
huihui_ai/gemma-4-abliterated:26b    114865317d3c  18 GB   47%/53% CPU/GPU  32768

Yükün yarısı işlemciye taşmıştı. İşlemciye düşen yapay zeka saniyede ancak bir veya iki kelime üretebilir. O devasa kural setini okuması dakikalar alıyordu.

Çözüm: Neşteri Vurmak ve %100 GPU

VRAM optimizasyonu yapmak şarttı. Modelin ağırlığından kurtulmam gerekiyordu ama zekasından çok fazla taviz veremezdim. İdeal dengeyi bulmak için aynı ailenin 12b-qat versiyonuna geçiş yaptım. 12B boyutu kodlama mantığını korumak için yeterince zekiyken QAT kuantizasyon formatı model kalitesini bozmadan hafıza ayak izini inanılmaz derecede küçültüyor. Bu sayede modelin boyutunu 8.1 GB seviyesine çekerek donanımı rahatlattım.

Ollama servisini yeniden başlatıp hafızayı sıfırladığımda sistemdeki yük tamamen değişti:

$ systemctl restart ollama
$ ollama ps
NAME                                     ID            SIZE    PROCESSOR  CONTEXT
huihui_ai/gemma-4-abliterated:12b-qat    00d9951e4140  8.1 GB  100% GPU   32768

Artık 32K hafıza ile modelin tamamı ekran kartımda çalışıyor ve binlerce tokenlık başlangıç verisini saniyeler içinde işliyordu.

Ayrıca Cline içerisindeki “Parallel Tool Calling” özelliğini kapattım. Bulut şirketleri devasa GPU kümeleriyle aynı anda üç farklı aracı paralel işleyebilir. Ancak yerel ekran kartları işlemleri sırayla yapar. Paralel araç çağrıları ekran kartında kuyruğa girer donanım sürekli bağlam değiştirir ve sistem kilitlenir. Bu ayarı kapatıp modeli tek bir hedefe odaklamak tepki süresini muazzam ölçüde hızlandırdı.

Localmind MCP Entegrasyonu

Performansı zirveye taşıdıktan sonra sistemi kendi geliştirdiğim zihin sarayım Localmind ile entegre etmem gerekiyordu.

VSCodium içinden MCP sunucuları konfigürasyonunu açıp doğrudan hazırladığım kabuk betiğini sisteme tanıttım:

// ~/.config/VSCodium/User/globalStorage/saoudrizwan.claude-dev/settings/cline_mcp_settings.json
{
  "mcpServers": {
    "localmind": {
      "command": "/home/xmrah/Projects/localmind/run_mcp.sh",
      "args": []
    }
  }
}

Sonuç kusursuzdu. Cline otonom olarak veritabanıma bağlandı. Hafıza odalarımı taradı ve bana 90 gün önce yaşadığım kritik bir Hyprland donanım sorununu hatırlattı. Ardından zihin sarayımdaki NixOS disiplinimi analiz edip bana harika bir yapısal özet sundu.

Bulut şirketlerinin kaprislerinden ve ani satın almalardan korunmanın tek yolu sistemi donanımdan yazılıma kadar kendi elinizde tutmaktır.

EOF.