← vg.com.tr / Kaynaklar
BENCHMARK & KIYASLAMA · 25 EYLÜL 2026 · 27 HARNESS ANALİZİ

Model Değil Harness Karşılaştırması: Planlama, Context Yönetimi, Araç Orkestrasyonu ve Görev Tamamlama Oranları.

25 Eylül 2026 — En İyi AI Coding & Agent Harness Sıralaması

Modeli Değil, Harness'i Değerlendiriyoruz: 27 Ajan Yürütme Motorunun Kapsamlı Analizi

Yayın Tarihi: 25 Eylül 2026
Kapsam: 27 Otonom Kodlama ve Ajan Çerçevesi (Harness)
Odak: Planlama, Context Yönetimi, Araç Çağırma (Tool-Calling), Test Doğrulama ve Subagent Koordinasyonu
Hazırlayan: Virtual Goods (VG) — editoryal değerlendirme


📌 Giriş ve Temel Hipotez

Burada modeli değil, harness'i (ajan çalıştırma ve orkestrasyon çerçevesini) değerlendiriyoruz.

Temel Soru:
Aynı yapay zekâ modelini (örneğin Claude Opus 5.5, GPT-6, Kimi K3 veya DeepSeek V4.1 Flash); Claude Code, Codex, Pi, OpenCode, DeepSeek Harness, Hermes vb. içine taktığımızda hangisi daha iyi planlıyor, context yönetiyor, araçları (tool-calling) hatasız kullanıyor, test döngülerini işletiyor, alt-ajanları (subagents) koordine ediyor ve işi başarıyla bitiriyor?

🔬 Neden Harness Model Kadar (Hatta Bazen Daha) Önemli?

Harness mimarisi nihai başarıda radikal bir fark yaratır:


1. 27 harness için editoryal tercih tablosu

Yöntem: Tier ve sıra, planlama, bağlam yönetimi, araç kullanımı ve işletim esnekliği için VG’nin nitel değerlendirmesidir. Sayısal ağırlıklandırılmış bir puanlama veya 27 aracı kapsayan VG benchmark’ı değildir. FrontierHarness sonuçları aşağıda ayrı örneklem olarak verilir. Özellik matrisi ikincil kaynak niteliğindedir; sağlayıcı dokümanı yerine geçmez. Matrisin 4 Ekim 2026’da açılan sürümü 2 Ekim güncellemesini gösteriyor; 24 Eylül ifadesi eski derlemenin tarihidir.

24 Eylül 2026 tarihli güncel özellik matrisi (MCP, yerel modeller, subagents, hooks/skills, cloud execution, scheduled runs, IDE integration) referans alınarak derecelendirilmiştir (tomrochette.com Feature Matrix).

# Harness Seviye (Tier) Lisans / Tip Özellikle En İyi Olduğu Uzmanlık Alanı
01 Claude Code S+ Ticari / CLI Kompleks mimari işler, derin planlama, orkestrasyon, subagents
02 Codex S+ Açık (Rust) / CLI Uçtan uca coding, debugging, implementation, bağımsız doğrulama
03 DeepSeek Harness (DSH) S Açık / Plugin Model/harness optimizasyonu, DeepSeek ekosistemi, deneysel agent'lar
04 OpenCode S Açık (MIT) Multi-model, BYOK (kendi anahtarını getir), ultra düşük overhead
05 Pi S Açık (TS) Minimal, <1K token scaffold, saf TypeScript eklenti runtime'ı
06 OpenHands A+ Açık Kaynak Otonom SWE platformu, sandbox, tarayıcı, cloud / self-host
07 Kilo Code A+ IDE Eklentisi IDE içinde çok özellikli multi-model agent ve worktree yönetimi
08 Hermes Agent A+ Açık / Hibrit Genel amaçlı autonomous agent + memory + Kanban + operasyon
09 Kimi Code A Bulut / CLI Kimi modelleri, ucuz ve yüksek hacimli kodlama işleri
10 Cline A VS Code / Açık VS Code içinde kontrollü Plan / Act ajan iş akışı
11 Warp Agent CLI A Terminal / SaaS Cloud agents + terminal orkestrasyonu
12 Amp A Bulut Tabanlı Deep coding / research iş akışları ve bulut yürütmesi
13 Goose A- Açık Kaynak Yerel / multi-provider, MCP ağırlıklı araç entegrasyonu
14 Grok Build A- xAI / CLI Grok modelleri + subagents + AGENTS.md
15 jcode A- Açık Kaynak Çok sayıda paralel agent + bellek / swarm mimarisi
16 Qwen Code B+ Alibaba / CLI Qwen modelleri ve açık model sağlayıcı ekosistemi
17 Crush B+ TUI (Terminal) Hafif TUI, LSP-aware (Language Server Protocol) kodlama
18 Ante B+ Yerel (Local) Yerel çıkarım (local inference) + hafif açık harness
19 Exo Harness B+ (Deneysel) Araştırma Self-modifying (kendini çalışma zamanında değiştiren) harness
20 OneCLI B Kurumsal Enterprise credential ve güvenlik uyumluluk modeli
21 Zerostack B Rust / Kompakt Ultra düşük RAM tüketimi, mikro Rust çalışma zamanı
22 Juggler B Görsel GUI Görsel conversation-tree (konuşma ağacı) / agent workbench
23 Bullet B Hızlı CLI Çok hızlı ikinci görüş (second-opinion) kodlaması
24 Junie B JetBrains IDE JetBrains ekosistemi merkezli geliştirme
25 fx B Kütüphane Başka sistemlerin içine gömülebilen (embeddable) agent runtime
26 Aider B- Python CLI Hassas git tabanlı pair-programming; klasik ve sağlam, daha az ajanik
27 Gemini CLI B- Google CLI Kullanılabilir fakat Antigravity tarafından geride bırakıldı

🔍 2. Zirvedeki 8 Harness'in Ayrıntılı Değerlendirmesi


1. Claude Code — En Komple Toplam Paket (#1)

“Harness olarak en güçlü toplam paket hangisi?” sorusunun VG’nin karmaşık planlama ve orkestrasyon işleri için editoryal tercihi Claude Code’dur (tomrochette.com Claude Code).


2. Codex — Saf Kodlama ve Uygulama İçin #1 Aday

Claude Code genel platform olarak zirvede olsa da; “repo ver, işi yap, test et ve doğrula” disiplininde Codex aynı seviyededir (tomrochette.com Codex).

📊 FrontierHarness Kıyaslaması (Aynı Kimi K3 Modeli İle):

Sıra Harness Başarı Oranı
🥇 Codex %66.7
🥈 DSH Creator %63.3
🥉 Claude Code %63.3
4 Pi %60.0
5 DSH Standard %60.0
6 Kimi Code %56.7
7 OpenCode %50.0
8 Hermes %50.0

Analiz: Bu örneklemde Codex 30 görevin 20’sini tamamladı (%66,7). Tek koşullandırılmış değerlendirme, mekanizmanın nedenini veya her projede üstünlüğü tek başına kanıtlamaz.


3. DeepSeek Harness (DSH) — 2026'nın En İnovatif Mimarisi

DSH alışılmışın dışında, her şeyin eklenti (plugin) olduğu bir yaklaşım sergiler (tomrochette.com DSH İncelemesi):
Model → Tools → Agent Loop → UI → Workflows → Subagents katmanlarının tümü değiştirilebilir.

DeepSeek V4.1 Flash: doğrulanmış üretici sonuçları

DeepSeek’in 10 Eylül 2026 sürüm notu, DeepSWE v1.1: 74,2 ve Terminal-Bench 2.1: 90,6 bildiriyor. Kaynak 4 Ekim 2026’da kontrol edildi. Bunlar üreticinin kendi değerlendirme sonuçlarıdır; VG tarafından yeniden çalıştırılmadı. Sürüm notu harness’ler arasında bir karşılaştırma içermiyor; bu sonuçlar yalnız harness değişiminin etkisini ölçmez.

Önemli Kısıt: DSH henüz geliştirici önizleme (developer preview) aşamasındadır. 24 Eylül itibarıyla kararlı (stable) sürümü çıkmamıştır. Bu nedenle: Araştırma/Deney = S+, Günlük Üretim = Henüz S Değil.


4. OpenCode — En İyi Sağlayıcı Bağımsız (Vendor-Neutral) Sürücü

OpenCode'un en büyük avantajı: “Claude, OpenAI, DeepSeek, GLM, Kimi, yerel Ollama... Hepsini tek çatı altında tam özgürlükle çalıştırırım” felsefesidir (tomrochette.com OpenCode).


5. Pi — Kendi Harness'ini Geliştirenlerin İncelemesi Gereken Mimari

Pi'nin felsefesi: “Harness küçük olsun. Geri kalan her şeyi extension olarak ekle.” (tomrochette.com Pi).


6. OpenHands — Harness'tan Ziyade Otonom SWE Platformu

OpenHands'i basit bir terminal aracı olarak görmek eksik olur (tomrochette.com OpenHands):
* Ajan aynı anda shell, kod editörü, gerçek headless browser, Docker sandbox'ı, cron ve olay kuyruğu yönetebilir.
* Canvas Mimarisi: Claude Code, Codex veya Gemini CLI'ı ACP üzerinden kendi içinde alt-işçi olarak çalıştırabilir.
Harness'ın üstüne bir meta-platform yerleştirme vizyonunun en somut örneğidir.*


7. Kilo Code — IDE İçinde Çok Özellikli Multi-Model Agent

Kilo Code'un özelliği her şeyi doğrudan geliştiricinin IDE'sine getirmesidir (tomrochette.com Kilo Code):
* Plan/Act, subagents, MCP, skills, kancalar (hooks), git worktree yönetimi, zamanlanmış görevler ve bulut ajanları.
* AGENTS.md desteği, Ollama ve LM Studio ile yerel model bağlantısı.
* VS Code ve JetBrains içinde çoklu modelle çalışacaklar için son derece güçlü bir ortam sunar.


8. Hermes Agent — Kodlamadan Ziyade Şirket ve Operasyon Orkestratörü

FrontierHarness testinde Hermes + Kimi K3 = %50.0 vermiştir (Codex %66.7 idi). Ancak Hermes'in asıl odak alanı yalnızca kod yazmak değildir:
* Entegre Yetenekler: Hedef yönetimi (goals), uzun vadeli bellek (memory), browser, araçlar, zamanlanmış görevler (cron), mesajlaşma entegrasyonu, bilgisayar kullanımı (computer-use) ve Kanban panosu.
* VG Mimari Ayrımı:
* Kodu yazacak uzman işçi (Worker): Codex / Claude Code / DSH / Pi
* Şirketi, takvimi ve diğer tüm ajanları yönetecek ana zihin (Master Orchestrator): Hermes


🎯 3. “Hangi Amaç İçin Hangi Harness?” Karar Matrisi

Kullanım Amacı / İhtiyaç Önerilen Seçim Neden Bu Seçim?
En Komple Toplam Paket 🥇 Claude Code Olgun orkestrasyon, zengin araç yüzeyi ve subagent gücü
Saf Kodlama / Uygulama / Doğrulama 🥇 Codex Rust CLI, izole sandbox, /review ve en yüksek K3 skoru (%66.7)
Mimari + Uzun Süreli Ajanik Görevler Claude Code Geniş bağlam ve çok aşamalı planlama disiplini
Açık Kaynak & Genel Günlük Kullanım OpenCode Sıfır vendor kilidi, MIT lisans, düşük context yükü
En Özelleştirilebilir / Hackable Yeni Mimari DeepSeek Harness (DSH) Tamamen eklentiye dayalı yapı, PTC ve Creator modları
Minimal / Genişletilebilir Çekirdek Pi 1K altı prompt scaffold, saf TypeScript eklentileri
Otonom SWE & Bulut Sandbox Platformu OpenHands Shell + Editor + Browser + Cron tam sandbox platformu
IDE İçinde Kesintisiz Multi-Model Kilo Code VS Code / JetBrains içinde yerel + bulut model desteği
Ana Orkestratör / Kişisel Operasyon Ajanı Hermes Agent Bellek, Kanban, cron, mesajlaşma ve çoklu ajan koordinasyonu
DeepSeek V4.1 Flash İçin En İyi Sonuç DSH Minimal DeepSWE'de ~%74 ile rekor skor
Kimi Modelleri İle En Yüksek Başarı Codex / Kimi Code FrontierHarness testinde K3 ile %66.7 birincilik
Yerel Modeller (Ollama / VLLM / LM Studio) OpenCode / OpenHands / Pi Yerel uç noktaları en az scaffolding ile çalıştırma
100+ Ajanlı Swarm Çalıştırma Altyapısı Pi / jcode Minimal bellek ve düşük token overhead
Kendi Özel Harness'imizi Geliştirmek Pi + DSH + Codex + Claude Code Mimarilerin incelenip hibritleştirilmesi önerilir
Minimum Token / Context Overhead Pi / OpenCode İskeletin harcadığı token minimum düzeydedir
Bulut Tabanlı Otonom Ajanlar Claude Code / Codex / OpenHands Güvenilir uzaktan icra ve doğrulama
En İyi Kıyaslama (Benchmark) Referansı mini-SWE-agent / DSH Minimal Saf model kabiliyetini ölçen temiz ortam

📊 4. Özet Tier List Görünümü

╔═════════╦════════════════════════════════════════════════════════════════╗
║  TIER   │  HARNESS VE MOTORLAR                                           ║
╠═════════╬════════════════════════════════════════════════════════════════╣
║   S+    │  Claude Code  •  Codex                                         ║
╠═════════╬════════════════════════════════════════════════════════════════╣
║   S     │  DeepSeek Harness (DSH)  •  OpenCode  •  Pi                    ║
╠═════════╬════════════════════════════════════════════════════════════════╣
║   A+    │  OpenHands  •  Kilo Code  •  Hermes Agent                      ║
╠═════════╬════════════════════════════════════════════════════════════════╣
║   A     │  Kimi Code  •  Cline  •  Warp Agent CLI  •  Amp                ║
╠═════════╬════════════════════════════════════════════════════════════════╣
║   A-    │  Goose  •  Grok Build  •  jcode                                ║
╠═════════╬════════════════════════════════════════════════════════════════╣
║   B+    │  Qwen Code  •  Crush  •  Ante  •  Exo Harness                  ║
╠═════════╬════════════════════════════════════════════════════════════════╣
║   B     │  OneCLI  •  Zerostack  •  Juggler  •  Bullet  •  Junie  •  fx  ║
╠═════════╬════════════════════════════════════════════════════════════════╣
║   B-    │  Aider  •  Gemini CLI                                          ║
╚═════════╩════════════════════════════════════════════════════════════════╝

🔮 5. Gelecek Adım: “2026 Harness Bible”

Bir sonraki adımda bu çalışma 25–30 harness için:
* Mimari & Planlama disiplini,
* Kodlama ve UI kalitesi,
* Subagent ve Memory yetenekleri,
* MCP ve Skills genişletilebilirliği,
* Windows işletim sistemi uyumu,
* Subscription reuse (mevcut abonelikleri kullanma),
* Yerel model verimliliği ve gerçek maliyet,

kriterlerinden oluşan tam karşılaştırmalı "2026 Harness Bible" tablosuna dönüştürülecektir. Bu rehber, şirketinizin Ultimate Harness mimarisinde hangi parçaları hangi projeden ödünç alması gerektiğini netleştirecektir.


Kaynak Belgesi: 25 Eylül 2026 AI Agent Harness Evaluation — Virtual Goods (VG) AI Engineering Edition.

Virtual Goods (VG) — AI Transformation & Implementation Partner