Production-grade evaluation framework & turnkey GitHub Action for benchmarking AI coding harnesses (Claude Code, Gemini CLI, Antigravity, OpenCode, DeepSeek), Model Context Protocol (MCP) servers, LSP diagnostics, and agent plugins across CoderEval & Terminal-Bench.
ablation-study
ai-agents
antigravity
benchmark
claude-code
coder-eval
coding-assistant
deepseek
developer-tools
gemini-cli
github-action
language-server-protocol
llm-evaluation
lsp
mcp
model-context-protocol
opencode
terminal-bench
Updated 2026-08-22 20:33:17 +00:00