25 Eylül 2026 — En İyi AI Coding & Agent Harness Sıralaması
Modeli Değil, Harness'i Değerlendiriyoruz: 27 Ajan Yürütme Motorunun Kapsamlı Analizi
Yayın Tarihi: 25 Eylül 2026
Kapsam: 27 Otonom Kodlama ve Ajan Çerçevesi (Harness)
Odak: Planlama, Context Yönetimi, Araç Çağırma (Tool-Calling), Test Doğrulama ve Subagent Koordinasyonu
Hazırlayan: Virtual Goods (VG) — editoryal değerlendirme
📌 Giriş ve Temel Hipotez
Burada modeli değil, harness'i (ajan çalıştırma ve orkestrasyon çerçevesini) değerlendiriyoruz.
Temel Soru:
Aynı yapay zekâ modelini (örneğin Claude Opus 5.5, GPT-6, Kimi K3 veya DeepSeek V4.1 Flash); Claude Code, Codex, Pi, OpenCode, DeepSeek Harness, Hermes vb. içine taktığımızda hangisi daha iyi planlıyor, context yönetiyor, araçları (tool-calling) hatasız kullanıyor, test döngülerini işletiyor, alt-ajanları (subagents) koordine ediyor ve işi başarıyla bitiriyor?
🔬 Neden Harness Model Kadar (Hatta Bazen Daha) Önemli?
Harness mimarisi nihai başarıda radikal bir fark yaratır:
- FrontierHarness Kanıtı (Kimi K3 Sabit Tutulduğunda):
Aynı Kimi K3 modeli 9 farklı harness üzerinde çalıştırıldığında; Codex %66.7, Claude Code %63.3, Pi %60.0, OpenCode %50.0 ve Hermes %50.0 başarı oranı vermiştir (FrontierHarness GitHub). Codex ile OpenCode/Hermes arasındaki fark 16,7 yüzde puandır (yaklaşık %33,4 göreli fark). Kaynak 30 görev, 9 harness ve 12 konfigürasyon içeren 360 değerlendirme bildiriyor; Kimi K3, görevler ve çalışma ortamı sabit tutulmuş. Bu sonuç tüm modeller veya gerçek projeler için aynı kazanımı garanti etmez. - DeepSeek V4.1 Flash SWE Kanıtı:
DeepSeek’in 10 Eylül 2026 sürüm notu V4.1 Flash için DeepSWE v1.1 skorunu 74,2 olarak bildiriyor. %65,5–%74,2 aralığının yalnız harness değişikliğine bağlı olduğu iddiası bu resmî kaynakta doğrulanmadı.
1. 27 harness için editoryal tercih tablosu
Yöntem: Tier ve sıra, planlama, bağlam yönetimi, araç kullanımı ve işletim esnekliği için VG’nin nitel değerlendirmesidir. Sayısal ağırlıklandırılmış bir puanlama veya 27 aracı kapsayan VG benchmark’ı değildir. FrontierHarness sonuçları aşağıda ayrı örneklem olarak verilir. Özellik matrisi ikincil kaynak niteliğindedir; sağlayıcı dokümanı yerine geçmez. Matrisin 4 Ekim 2026’da açılan sürümü 2 Ekim güncellemesini gösteriyor; 24 Eylül ifadesi eski derlemenin tarihidir.
24 Eylül 2026 tarihli güncel özellik matrisi (MCP, yerel modeller, subagents, hooks/skills, cloud execution, scheduled runs, IDE integration) referans alınarak derecelendirilmiştir (tomrochette.com Feature Matrix).
| # | Harness | Seviye (Tier) | Lisans / Tip | Özellikle En İyi Olduğu Uzmanlık Alanı |
|---|---|---|---|---|
| 01 | Claude Code | S+ | Ticari / CLI | Kompleks mimari işler, derin planlama, orkestrasyon, subagents |
| 02 | Codex | S+ | Açık (Rust) / CLI | Uçtan uca coding, debugging, implementation, bağımsız doğrulama |
| 03 | DeepSeek Harness (DSH) | S | Açık / Plugin | Model/harness optimizasyonu, DeepSeek ekosistemi, deneysel agent'lar |
| 04 | OpenCode | S | Açık (MIT) | Multi-model, BYOK (kendi anahtarını getir), ultra düşük overhead |
| 05 | Pi | S | Açık (TS) | Minimal, <1K token scaffold, saf TypeScript eklenti runtime'ı |
| 06 | OpenHands | A+ | Açık Kaynak | Otonom SWE platformu, sandbox, tarayıcı, cloud / self-host |
| 07 | Kilo Code | A+ | IDE Eklentisi | IDE içinde çok özellikli multi-model agent ve worktree yönetimi |
| 08 | Hermes Agent | A+ | Açık / Hibrit | Genel amaçlı autonomous agent + memory + Kanban + operasyon |
| 09 | Kimi Code | A | Bulut / CLI | Kimi modelleri, ucuz ve yüksek hacimli kodlama işleri |
| 10 | Cline | A | VS Code / Açık | VS Code içinde kontrollü Plan / Act ajan iş akışı |
| 11 | Warp Agent CLI | A | Terminal / SaaS | Cloud agents + terminal orkestrasyonu |
| 12 | Amp | A | Bulut Tabanlı | Deep coding / research iş akışları ve bulut yürütmesi |
| 13 | Goose | A- | Açık Kaynak | Yerel / multi-provider, MCP ağırlıklı araç entegrasyonu |
| 14 | Grok Build | A- | xAI / CLI | Grok modelleri + subagents + AGENTS.md |
| 15 | jcode | A- | Açık Kaynak | Çok sayıda paralel agent + bellek / swarm mimarisi |
| 16 | Qwen Code | B+ | Alibaba / CLI | Qwen modelleri ve açık model sağlayıcı ekosistemi |
| 17 | Crush | B+ | TUI (Terminal) | Hafif TUI, LSP-aware (Language Server Protocol) kodlama |
| 18 | Ante | B+ | Yerel (Local) | Yerel çıkarım (local inference) + hafif açık harness |
| 19 | Exo Harness | B+ (Deneysel) | Araştırma | Self-modifying (kendini çalışma zamanında değiştiren) harness |
| 20 | OneCLI | B | Kurumsal | Enterprise credential ve güvenlik uyumluluk modeli |
| 21 | Zerostack | B | Rust / Kompakt | Ultra düşük RAM tüketimi, mikro Rust çalışma zamanı |
| 22 | Juggler | B | Görsel GUI | Görsel conversation-tree (konuşma ağacı) / agent workbench |
| 23 | Bullet | B | Hızlı CLI | Çok hızlı ikinci görüş (second-opinion) kodlaması |
| 24 | Junie | B | JetBrains IDE | JetBrains ekosistemi merkezli geliştirme |
| 25 | fx | B | Kütüphane | Başka sistemlerin içine gömülebilen (embeddable) agent runtime |
| 26 | Aider | B- | Python CLI | Hassas git tabanlı pair-programming; klasik ve sağlam, daha az ajanik |
| 27 | Gemini CLI | B- | Google CLI | Kullanılabilir fakat Antigravity tarafından geride bırakıldı |
🔍 2. Zirvedeki 8 Harness'in Ayrıntılı Değerlendirmesi
1. Claude Code — En Komple Toplam Paket (#1)
“Harness olarak en güçlü toplam paket hangisi?” sorusunun VG’nin karmaşık planlama ve orkestrasyon işleri için editoryal tercihi Claude Code’dur (tomrochette.com Claude Code).
- Neden #1?
Gücü yalnızca Claude modellerinin yeteneğinden gelmez. Harness katmanında tek bir sistem içinde en olgun ekosistemi sunar: - Subagents & Skills: Görev bazlı izole alt-ajanlar ve dinamik yetenekler.
- Hooks & MCP: Yaşam döngüsü kancaları ve zengin Model Context Protocol sunucuları.
- Güvenlik: Kritik komutlarda detaylı izin sistemi (permission control).
- Ekosistem: Agent SDK, scheduled routines (zamanlanmış rutinler), cloud execution.
- Yüzey: Terminal + IDE + Masaüstü + Web + Session Teleport + Paralel Ajan Yönetimi.
- Eksisi:
Oldukça ağırdır. Bağımsız testlerde, minimal prompt öncesinde dahi OpenCode veya Pi'ye kıyasla belirgin şekilde daha fazla context/token overhead oluşturduğu ölçülmüştür. - En İyi İkili: Claude Opus 5.5 + Claude Code.
- Zirve Yaptığı Döngü:
Architecture → Planlama → Subagents → Implementation → Review → Tests → Fix Loop.
2. Codex — Saf Kodlama ve Uygulama İçin #1 Aday
Claude Code genel platform olarak zirvede olsa da; “repo ver, işi yap, test et ve doğrula” disiplininde Codex aynı seviyededir (tomrochette.com Codex).
- Öne Çıkan Altyapısı:
- Hızlı Rust CLI: Apache-2.0 lisanslı, ultra düşük gecikmeli çekirdek motor.
- Standartlar:
AGENTS.md, yerleşikskills, eklenti mimarisi. - Doğrulama: İzolasyonlu sandbox, yerleşik
/reviewdöngüsü vecodex exec. - Gelişmiş Dağıtım: Cloud workers, GitHub entegrasyonu, IDE desteği, SDK ve MCP server.
📊 FrontierHarness Kıyaslaması (Aynı Kimi K3 Modeli İle):
| Sıra | Harness | Başarı Oranı |
|---|---|---|
| 🥇 | Codex | %66.7 |
| 🥈 | DSH Creator | %63.3 |
| 🥉 | Claude Code | %63.3 |
| 4 | Pi | %60.0 |
| 5 | DSH Standard | %60.0 |
| 6 | Kimi Code | %56.7 |
| 7 | OpenCode | %50.0 |
| 8 | Hermes | %50.0 |
Analiz: Bu örneklemde Codex 30 görevin 20’sini tamamladı (%66,7). Tek koşullandırılmış değerlendirme, mekanizmanın nedenini veya her projede üstünlüğü tek başına kanıtlamaz.
3. DeepSeek Harness (DSH) — 2026'nın En İnovatif Mimarisi
DSH alışılmışın dışında, her şeyin eklenti (plugin) olduğu bir yaklaşım sergiler (tomrochette.com DSH İncelemesi):
Model → Tools → Agent Loop → UI → Workflows → Subagents katmanlarının tümü değiştirilebilir.
- Dört Çalışma Modu:
- Minimal: Mümkün olan en az scaffolding ve sıfır token israfı.
- Standard: Standart kodlama ajanı kurgusu.
- Code / PTC (Program-Aided Tool Calling): Modelin araç orkestrasyonu için doğrudan kod yazmasına izin verir.
- Creator: Ajanın kendi eklenti ve araç yapısını çalışma anında kendisinin inşa ettiği mod.
DeepSeek V4.1 Flash: doğrulanmış üretici sonuçları
DeepSeek’in 10 Eylül 2026 sürüm notu, DeepSWE v1.1: 74,2 ve Terminal-Bench 2.1: 90,6 bildiriyor. Kaynak 4 Ekim 2026’da kontrol edildi. Bunlar üreticinin kendi değerlendirme sonuçlarıdır; VG tarafından yeniden çalıştırılmadı. Sürüm notu harness’ler arasında bir karşılaştırma içermiyor; bu sonuçlar yalnız harness değişiminin etkisini ölçmez.
Önemli Kısıt: DSH henüz geliştirici önizleme (developer preview) aşamasındadır. 24 Eylül itibarıyla kararlı (stable) sürümü çıkmamıştır. Bu nedenle: Araştırma/Deney = S+, Günlük Üretim = Henüz S Değil.
4. OpenCode — En İyi Sağlayıcı Bağımsız (Vendor-Neutral) Sürücü
OpenCode'un en büyük avantajı: “Claude, OpenAI, DeepSeek, GLM, Kimi, yerel Ollama... Hepsini tek çatı altında tam özgürlükle çalıştırırım” felsefesidir (tomrochette.com OpenCode).
- Özellikler: MIT lisanslı açık kaynak,
AGENTS.md,CLAUDE.md, subagent desteği, plan/build ajanları, MCP, skills/plugins, ACP protokolü. - Esneklik: Masaüstü, TUI, IDE, Web/Server desteği ve tam Undo/Redo özelliği.
- Token Verimliliği: Context overhead'i Claude Code'dan belirgin biçimde düşüktür. OpenRouter + Ollama kullananlar için birincil tercihtir.
5. Pi — Kendi Harness'ini Geliştirenlerin İncelemesi Gereken Mimari
Pi'nin felsefesi: “Harness küçük olsun. Geri kalan her şeyi extension olarak ekle.” (tomrochette.com Pi).
- Sistem promptu 1.000 token'ın altında tutulabilir ve serbestçe değiştirilebilir.
- Oturum dallanması (session branching), model sağlayıcı değişimi ve saf TypeScript ile doğrudan yazılan eklentiler.
- FrontierHarness'ta Kimi K3 ile %60.0 başarı vermiş, token maliyeti Claude Code'un çok altında kalmıştır.
- Builtin MCP, sandbox veya subagent içermez; ihtiyacınız olanı extension olarak siz yazarsınız. Kendi özel harness'inizi yaparken temel referanstır.
6. OpenHands — Harness'tan Ziyade Otonom SWE Platformu
OpenHands'i basit bir terminal aracı olarak görmek eksik olur (tomrochette.com OpenHands):
* Ajan aynı anda shell, kod editörü, gerçek headless browser, Docker sandbox'ı, cron ve olay kuyruğu yönetebilir.
* Canvas Mimarisi: Claude Code, Codex veya Gemini CLI'ı ACP üzerinden kendi içinde alt-işçi olarak çalıştırabilir.
Harness'ın üstüne bir meta-platform yerleştirme vizyonunun en somut örneğidir.*
7. Kilo Code — IDE İçinde Çok Özellikli Multi-Model Agent
Kilo Code'un özelliği her şeyi doğrudan geliştiricinin IDE'sine getirmesidir (tomrochette.com Kilo Code):
* Plan/Act, subagents, MCP, skills, kancalar (hooks), git worktree yönetimi, zamanlanmış görevler ve bulut ajanları.
* AGENTS.md desteği, Ollama ve LM Studio ile yerel model bağlantısı.
* VS Code ve JetBrains içinde çoklu modelle çalışacaklar için son derece güçlü bir ortam sunar.
8. Hermes Agent — Kodlamadan Ziyade Şirket ve Operasyon Orkestratörü
FrontierHarness testinde Hermes + Kimi K3 = %50.0 vermiştir (Codex %66.7 idi). Ancak Hermes'in asıl odak alanı yalnızca kod yazmak değildir:
* Entegre Yetenekler: Hedef yönetimi (goals), uzun vadeli bellek (memory), browser, araçlar, zamanlanmış görevler (cron), mesajlaşma entegrasyonu, bilgisayar kullanımı (computer-use) ve Kanban panosu.
* VG Mimari Ayrımı:
* Kodu yazacak uzman işçi (Worker): Codex / Claude Code / DSH / Pi
* Şirketi, takvimi ve diğer tüm ajanları yönetecek ana zihin (Master Orchestrator): Hermes
🎯 3. “Hangi Amaç İçin Hangi Harness?” Karar Matrisi
| Kullanım Amacı / İhtiyaç | Önerilen Seçim | Neden Bu Seçim? |
|---|---|---|
| En Komple Toplam Paket | 🥇 Claude Code | Olgun orkestrasyon, zengin araç yüzeyi ve subagent gücü |
| Saf Kodlama / Uygulama / Doğrulama | 🥇 Codex | Rust CLI, izole sandbox, /review ve en yüksek K3 skoru (%66.7) |
| Mimari + Uzun Süreli Ajanik Görevler | Claude Code | Geniş bağlam ve çok aşamalı planlama disiplini |
| Açık Kaynak & Genel Günlük Kullanım | OpenCode | Sıfır vendor kilidi, MIT lisans, düşük context yükü |
| En Özelleştirilebilir / Hackable Yeni Mimari | DeepSeek Harness (DSH) | Tamamen eklentiye dayalı yapı, PTC ve Creator modları |
| Minimal / Genişletilebilir Çekirdek | Pi | 1K altı prompt scaffold, saf TypeScript eklentileri |
| Otonom SWE & Bulut Sandbox Platformu | OpenHands | Shell + Editor + Browser + Cron tam sandbox platformu |
| IDE İçinde Kesintisiz Multi-Model | Kilo Code | VS Code / JetBrains içinde yerel + bulut model desteği |
| Ana Orkestratör / Kişisel Operasyon Ajanı | Hermes Agent | Bellek, Kanban, cron, mesajlaşma ve çoklu ajan koordinasyonu |
| DeepSeek V4.1 Flash İçin En İyi Sonuç | DSH Minimal | DeepSWE'de ~%74 ile rekor skor |
| Kimi Modelleri İle En Yüksek Başarı | Codex / Kimi Code | FrontierHarness testinde K3 ile %66.7 birincilik |
| Yerel Modeller (Ollama / VLLM / LM Studio) | OpenCode / OpenHands / Pi | Yerel uç noktaları en az scaffolding ile çalıştırma |
| 100+ Ajanlı Swarm Çalıştırma Altyapısı | Pi / jcode | Minimal bellek ve düşük token overhead |
| Kendi Özel Harness'imizi Geliştirmek | Pi + DSH + Codex + Claude Code | Mimarilerin incelenip hibritleştirilmesi önerilir |
| Minimum Token / Context Overhead | Pi / OpenCode | İskeletin harcadığı token minimum düzeydedir |
| Bulut Tabanlı Otonom Ajanlar | Claude Code / Codex / OpenHands | Güvenilir uzaktan icra ve doğrulama |
| En İyi Kıyaslama (Benchmark) Referansı | mini-SWE-agent / DSH Minimal | Saf model kabiliyetini ölçen temiz ortam |
📊 4. Özet Tier List Görünümü
╔═════════╦════════════════════════════════════════════════════════════════╗
║ TIER │ HARNESS VE MOTORLAR ║
╠═════════╬════════════════════════════════════════════════════════════════╣
║ S+ │ Claude Code • Codex ║
╠═════════╬════════════════════════════════════════════════════════════════╣
║ S │ DeepSeek Harness (DSH) • OpenCode • Pi ║
╠═════════╬════════════════════════════════════════════════════════════════╣
║ A+ │ OpenHands • Kilo Code • Hermes Agent ║
╠═════════╬════════════════════════════════════════════════════════════════╣
║ A │ Kimi Code • Cline • Warp Agent CLI • Amp ║
╠═════════╬════════════════════════════════════════════════════════════════╣
║ A- │ Goose • Grok Build • jcode ║
╠═════════╬════════════════════════════════════════════════════════════════╣
║ B+ │ Qwen Code • Crush • Ante • Exo Harness ║
╠═════════╬════════════════════════════════════════════════════════════════╣
║ B │ OneCLI • Zerostack • Juggler • Bullet • Junie • fx ║
╠═════════╬════════════════════════════════════════════════════════════════╣
║ B- │ Aider • Gemini CLI ║
╚═════════╩════════════════════════════════════════════════════════════════╝
🔮 5. Gelecek Adım: “2026 Harness Bible”
Bir sonraki adımda bu çalışma 25–30 harness için:
* Mimari & Planlama disiplini,
* Kodlama ve UI kalitesi,
* Subagent ve Memory yetenekleri,
* MCP ve Skills genişletilebilirliği,
* Windows işletim sistemi uyumu,
* Subscription reuse (mevcut abonelikleri kullanma),
* Yerel model verimliliği ve gerçek maliyet,
kriterlerinden oluşan tam karşılaştırmalı "2026 Harness Bible" tablosuna dönüştürülecektir. Bu rehber, şirketinizin Ultimate Harness mimarisinde hangi parçaları hangi projeden ödünç alması gerektiğini netleştirecektir.
Kaynak Belgesi: 25 Eylül 2026 AI Agent Harness Evaluation — Virtual Goods (VG) AI Engineering Edition.